03 / ARTICLE LEDGER

关联文章

按发布时间倒序

  1. Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalability 2026-02-03 · ARXIV
  2. RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System 2026-02-03 · ARXIV
  3. Reward-free Alignment for Conflicting Objectives 2026-02-03 · ARXIV
  4. RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents 2026-02-03 · ARXIV
  5. PixelGen: Pixel Diffusion Beats Latent Diffusion with Perceptual Loss 2026-02-03 · ARXIV
  6. MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents 2026-02-03 · ARXIV
  7. MEG-XL: Data-Efficient Brain-to-Text via Long-Context Pre-Training 2026-02-03 · ARXIV
  8. Flow Policy Gradients for Robot Control 2026-02-03 · ARXIV
  9. Expanding the Capabilities of Reinforcement Learning via Text Feedback 2026-02-03 · ARXIV
  10. AgentRx: Diagnosing AI Agent Failures from Execution Trajectories 2026-02-03 · ARXIV
  11. Sparse Reward Subsystem in Large Language Models 2026-02-03 · ARXIV
  12. Scalable Random Wavelet Features: Efficient Non-Stationary Kernel Approximation with Convergence Guarantees 2026-02-03 · ARXIV
  13. Reliable Use of Lemmas via Eligibility Reasoning and Section$-$Aware Reinforcement Learning 2026-02-03 · ARXIV
  14. Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning 2026-02-03 · ARXIV
  15. Optimal Decision-Making Based on Prediction Sets 2026-02-03 · ARXIV
  16. How RLHF Amplifies Sycophancy 2026-02-03 · ARXIV
  17. HERMES: A Holistic End-to-End Risk-Aware Multimodal Embodied System with Vision-Language Models for Long-Tail Autonomous Driving 2026-02-03 · ARXIV
  18. Error Taxonomy-Guided Prompt Optimization 2026-02-03 · ARXIV
  19. DeALOG: Decentralized Multi-Agents Log-Mediated Reasoning Framework 2026-02-03 · ARXIV
  20. VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation 2026-02-02 · ARXIV
  21. UPA: Unsupervised Prompt Agent via Tree-Based Search and Selection 2026-02-02 · ARXIV
  22. TEON: Tensorized Orthonormalization Beyond Layer-Wise Muon for Large Language Model Pre-Training 2026-02-02 · ARXIV
  23. Particle-Guided Diffusion Models for Partial Differential Equations 2026-02-02 · ARXIV
  24. PaperBanana: Automating Academic Illustration for AI Scientists 2026-02-02 · ARXIV
  25. IRL-DAL: Safe and Adaptive Trajectory Planning for Autonomous Driving via Energy-Guided Diffusion Models 2026-02-02 · ARXIV
  26. FOCUS: DLLMs Know How to Tame Their Compute Bound 2026-02-02 · ARXIV
  27. End-to-end Optimization of Belief and Policy Learning in Shared Autonomy Paradigms 2026-02-02 · ARXIV
  28. Decoupled Diffusion Sampling for Inverse Problems on Function Spaces 2026-02-02 · ARXIV
  29. SplineFlow: Flow Matching for Dynamical Systems with B-Spline Interpolants 2026-02-02 · ARXIV
  30. Safer Policy Compliance with Dynamic Epistemic Fallback 2026-02-02 · ARXIV
  31. RN-D: Discretized Categorical Actors with Regularized Networks for On-Policy Reinforcement Learning 2026-02-02 · ARXIV
  32. OrLog: Resolving Complex Queries with LLMs and Probabilistic Reasoning 2026-02-02 · ARXIV
  33. From Similarity to Vulnerability: Key Collision Attack on LLM Semantic Caching 2026-02-02 · ARXIV
  34. ExplainerPFN: Towards tabular foundation models for model-free zero-shot feature importance estimations 2026-02-02 · ARXIV
  35. Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures 2026-02-02 · ARXIV
  36. Chain-of-thought obfuscation learned from output supervision can generalise to unseen tasks 2026-02-02 · ARXIV
  37. CATTO: Balancing Preferences and Confidence in Language Models 2026-02-02 · ARXIV
  38. UEval: A Benchmark for Unified Multimodal Generation 2026-01-30 · ARXIV
  39. Routing the Lottery: Adaptive Subnetworks for Heterogeneous Data 2026-01-30 · ARXIV
  40. RedSage: A Cybersecurity Generalist LLM 2026-01-30 · ARXIV
  41. Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers 2026-01-30 · ARXIV
  42. Late Breaking Results: Conversion of Neural Networks into Logic Flows for Edge Computing 2026-01-30 · ARXIV
  43. Hybrid Linear Attention Done Right: Efficient Distillation and Effective Architectures for Extremely Long Contexts 2026-01-30 · ARXIV
  44. FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale 2026-01-30 · ARXIV
  45. Exploring Reasoning Reward Model for Agents 2026-01-30 · ARXIV
  46. DynaWeb: Model-Based Reinforcement Learning of Web Agents 2026-01-30 · ARXIV
  47. Discovering Hidden Gems in Model Repositories 2026-01-30 · ARXIV
  48. Why Adam Works Better with $β_1 = β_2$: The Missing Gradient Scale Invariance Principle 2026-01-30 · ARXIV
  49. Temporal Guidance for Large Language Models 2026-01-30 · ARXIV
  50. Language-based Trial and Error Falls Behind in the Era of Experience 2026-01-30 · ARXIV