03 / ARTICLE LEDGER

关联文章

按发布时间倒序

  1. Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents 2026-08-08 · ARXIV
  2. Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents 2026-08-08 · ARXIV
  3. Tytan: Interactive Neurosymbolic Construction of Analytic Semantic Schemas from Relational Data 2026-08-08 · ARXIV
  4. TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories 2026-08-08 · ARXIV
  5. RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer 2026-08-08 · ARXIV
  6. Challenges in Evaluating Explanation Methods for Static and Evolving Data 2026-08-07 · ARXIV
  7. CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks 2026-08-07 · ARXIV
  8. Resourced Authority A Mechanism-Design Model for Participatory Governance of Deployed AI Agents 2026-08-07 · ARXIV
  9. The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping 2026-08-07 · ARXIV
  10. AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games 2026-08-07 · ARXIV
  11. Investigating Artificial Intelligence Digital Sovereignty in Mobile Shopping Apps: A Case Study of Nigeria 2026-08-07 · ARXIV
  12. Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering 2026-08-07 · ARXIV
  13. The Bitter Lesson of Tool Calling 2026-08-07 · ARXIV
  14. Predicting Brain Morphometry with MT-GNN: Mesh Evolution in Continuous Time with Graph-Based Metric Tensor Embeddings 2026-08-07 · ARXIV
  15. Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains 2026-08-06 · ARXIV
  16. Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning 2026-08-06 · ARXIV
  17. OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling 2026-08-06 · ARXIV
  18. Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning 2026-08-06 · ARXIV
  19. Can Large Language Models Recover Semantic Optimization Opportunities That Compilers Miss? 2026-08-06 · ARXIV
  20. Assessment of Conditional Diffusion Model for Synthetic Histopathology Image Generation 2026-08-06 · ARXIV
  21. Agogic: Performance-Timed Music Tokens for LLM-Native Text-to-Symbolic-Music Generation 2026-08-06 · ARXIV
  22. Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility 2026-08-06 · ARXIV
  23. PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents 2026-08-05 · ARXIV
  24. TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning 2026-08-05 · ARXIV
  25. WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live Tournament 2026-08-05 · ARXIV
  26. SocietyBench: Forecasting Counterfactual Social-World Evolution 2026-08-05 · ARXIV
  27. ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs 2026-08-05 · ARXIV
  28. Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection 2026-08-05 · ARXIV
  29. AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies 2026-08-05 · ARXIV
  30. Pseudorandom Streams within Diffusion Models Act as Learnable Inputs That Affect Generation Quality 2026-08-05 · ARXIV
  31. UEmbed: Unified Sparse and Dense Multimodal Embeddings 2026-08-04 · ARXIV
  32. GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning 2026-08-04 · ARXIV
  33. The Condition-Number Barrier in Sparse Least Squares 2026-08-04 · ARXIV
  34. Bridging Artificial Intelligence and Power Systems Education Using a Hands-On Executable Framework 2026-08-04 · ARXIV
  35. AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling 2026-08-04 · ARXIV
  36. The Theoretical Foundation of Socratic Tests: Dynamic, Multimodal, Conversational Examinations 2026-08-04 · ARXIV
  37. AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers 2026-08-04 · ARXIV
  38. Development of FDD-ON: an Ontology for VAV HVAC System Fault Detection and Diagnostics 2026-08-04 · ARXIV
  39. Freeze, Then Select: Structured Field Adapters and Stability-Validated Weak Selection for PDE Discovery from Sparse Observations 2026-08-04 · ARXIV
  40. ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction 2026-08-03 · ARXIV
  41. TokTier: Exact Stateful Tokenization for Agentic LLM Serving 2026-08-03 · ARXIV
  42. UniMem: Complementary Episodic-to-Parametric Memory for Boundary-Agnostic Task Streams 2026-07-30 · ARXIV
  43. CHARM: A Multimodal Graph Foundation Model with Hierarchical Context Modeling for Zero-Shot Transfer 2026-07-30 · ARXIV
  44. Falling Behind Drives Unsafe Development in an Idealised AI Race Experiment 2026-07-30 · ARXIV
  45. Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions? 2026-07-29 · ARXIV
  46. VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Disease Screening 2026-07-29 · ARXIV
  47. Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA 2026-07-29 · ARXIV
  48. $π\mathbf{R}^2$: Reactive Real-time Flow Policies 2026-07-29 · ARXIV
  49. The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation 2026-07-29 · ARXIV
  50. Global Convergence of DGM and PINN Algorithms for Solving Nonlinear PDEs 2026-07-29 · ARXIV