03 / ARTICLE LEDGER
关联文章
按发布时间倒序
- Benchmarking and Enhancing LLMs for Rule-Intensive Review of National Standard Documents 2026-08-08 · ARXIV
- Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents 2026-08-08 · ARXIV
- Tytan: Interactive Neurosymbolic Construction of Analytic Semantic Schemas from Relational Data 2026-08-08 · ARXIV
- TRAJDEBUG: Tracing Error Lifecycle to Identify Critical Failures in Long-Horizon Agent Trajectories 2026-08-08 · ARXIV
- RP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning Transfer 2026-08-08 · ARXIV
- Challenges in Evaluating Explanation Methods for Static and Evolving Data 2026-08-07 · ARXIV
- CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks 2026-08-07 · ARXIV
- Resourced Authority A Mechanism-Design Model for Participatory Governance of Deployed AI Agents 2026-08-07 · ARXIV
- The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping 2026-08-07 · ARXIV
- AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games 2026-08-07 · ARXIV
- Investigating Artificial Intelligence Digital Sovereignty in Mobile Shopping Apps: A Case Study of Nigeria 2026-08-07 · ARXIV
- Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering 2026-08-07 · ARXIV
- The Bitter Lesson of Tool Calling 2026-08-07 · ARXIV
- Predicting Brain Morphometry with MT-GNN: Mesh Evolution in Continuous Time with Graph-Based Metric Tensor Embeddings 2026-08-07 · ARXIV
- Teaching Nemotron Greek: Mining a Corpus, Adapting Retrieval, and Grounding Generation for Modern Greek across Specialist Domains 2026-08-06 · ARXIV
- Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning 2026-08-06 · ARXIV
- OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling 2026-08-06 · ARXIV
- Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning 2026-08-06 · ARXIV
- Can Large Language Models Recover Semantic Optimization Opportunities That Compilers Miss? 2026-08-06 · ARXIV
- Assessment of Conditional Diffusion Model for Synthetic Histopathology Image Generation 2026-08-06 · ARXIV
- Agogic: Performance-Timed Music Tokens for LLM-Native Text-to-Symbolic-Music Generation 2026-08-06 · ARXIV
- Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility 2026-08-06 · ARXIV
- PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents 2026-08-05 · ARXIV
- TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning 2026-08-05 · ARXIV
- WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live Tournament 2026-08-05 · ARXIV
- SocietyBench: Forecasting Counterfactual Social-World Evolution 2026-08-05 · ARXIV
- ParVL: Parallel Scaling and Expandable Compute Allocation for Multimodal LLMs 2026-08-05 · ARXIV
- Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection 2026-08-05 · ARXIV
- AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies 2026-08-05 · ARXIV
- Pseudorandom Streams within Diffusion Models Act as Learnable Inputs That Affect Generation Quality 2026-08-05 · ARXIV
- UEmbed: Unified Sparse and Dense Multimodal Embeddings 2026-08-04 · ARXIV
- GradCuit: Credit-Assigned Gradient Flow Enables Robust and Interpretable Test-Time Latent Reasoning 2026-08-04 · ARXIV
- The Condition-Number Barrier in Sparse Least Squares 2026-08-04 · ARXIV
- Bridging Artificial Intelligence and Power Systems Education Using a Hands-On Executable Framework 2026-08-04 · ARXIV
- AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling 2026-08-04 · ARXIV
- The Theoretical Foundation of Socratic Tests: Dynamic, Multimodal, Conversational Examinations 2026-08-04 · ARXIV
- AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers 2026-08-04 · ARXIV
- Development of FDD-ON: an Ontology for VAV HVAC System Fault Detection and Diagnostics 2026-08-04 · ARXIV
- Freeze, Then Select: Structured Field Adapters and Stability-Validated Weak Selection for PDE Discovery from Sparse Observations 2026-08-04 · ARXIV
- ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction 2026-08-03 · ARXIV
- TokTier: Exact Stateful Tokenization for Agentic LLM Serving 2026-08-03 · ARXIV
- UniMem: Complementary Episodic-to-Parametric Memory for Boundary-Agnostic Task Streams 2026-07-30 · ARXIV
- CHARM: A Multimodal Graph Foundation Model with Hierarchical Context Modeling for Zero-Shot Transfer 2026-07-30 · ARXIV
- Falling Behind Drives Unsafe Development in an Idealised AI Race Experiment 2026-07-30 · ARXIV
- Desktop-Delta Bench: Do Computer-Use Models Understand Desktop GUI Transitions? 2026-07-29 · ARXIV
- VetClaw: An Edge-Cloud Multimodal Agentic System for Veterinary Disease Screening 2026-07-29 · ARXIV
- Spend Experts Where You Are Unsure: Confidence-Adaptive Routing for Mixture-of-Experts LoRA 2026-07-29 · ARXIV
- $π\mathbf{R}^2$: Reactive Real-time Flow Policies 2026-07-29 · ARXIV
- The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation 2026-07-29 · ARXIV
- Global Convergence of DGM and PINN Algorithms for Solving Nonlinear PDEs 2026-07-29 · ARXIV