03 / ARTICLE LEDGER
关联文章
按发布时间倒序
- Training LLMs for Divide-and-Conquer Reasoning Elevates Test-Time Scalability 2026-02-03 · ARXIV
- RLAnything: Forge Environment, Policy, and Reward Model in Completely Dynamic RL System 2026-02-03 · ARXIV
- Reward-free Alignment for Conflicting Objectives 2026-02-03 · ARXIV
- RE-TRAC: REcursive TRAjectory Compression for Deep Search Agents 2026-02-03 · ARXIV
- PixelGen: Pixel Diffusion Beats Latent Diffusion with Perceptual Loss 2026-02-03 · ARXIV
- MemSkill: Learning and Evolving Memory Skills for Self-Evolving Agents 2026-02-03 · ARXIV
- MEG-XL: Data-Efficient Brain-to-Text via Long-Context Pre-Training 2026-02-03 · ARXIV
- Flow Policy Gradients for Robot Control 2026-02-03 · ARXIV
- Expanding the Capabilities of Reinforcement Learning via Text Feedback 2026-02-03 · ARXIV
- AgentRx: Diagnosing AI Agent Failures from Execution Trajectories 2026-02-03 · ARXIV
- Sparse Reward Subsystem in Large Language Models 2026-02-03 · ARXIV
- Scalable Random Wavelet Features: Efficient Non-Stationary Kernel Approximation with Convergence Guarantees 2026-02-03 · ARXIV
- Reliable Use of Lemmas via Eligibility Reasoning and Section$-$Aware Reinforcement Learning 2026-02-03 · ARXIV
- Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning 2026-02-03 · ARXIV
- Optimal Decision-Making Based on Prediction Sets 2026-02-03 · ARXIV
- How RLHF Amplifies Sycophancy 2026-02-03 · ARXIV
- HERMES: A Holistic End-to-End Risk-Aware Multimodal Embodied System with Vision-Language Models for Long-Tail Autonomous Driving 2026-02-03 · ARXIV
- Error Taxonomy-Guided Prompt Optimization 2026-02-03 · ARXIV
- DeALOG: Decentralized Multi-Agents Log-Mediated Reasoning Framework 2026-02-03 · ARXIV
- VideoGPA: Distilling Geometry Priors for 3D-Consistent Video Generation 2026-02-02 · ARXIV
- UPA: Unsupervised Prompt Agent via Tree-Based Search and Selection 2026-02-02 · ARXIV
- TEON: Tensorized Orthonormalization Beyond Layer-Wise Muon for Large Language Model Pre-Training 2026-02-02 · ARXIV
- Particle-Guided Diffusion Models for Partial Differential Equations 2026-02-02 · ARXIV
- PaperBanana: Automating Academic Illustration for AI Scientists 2026-02-02 · ARXIV
- IRL-DAL: Safe and Adaptive Trajectory Planning for Autonomous Driving via Energy-Guided Diffusion Models 2026-02-02 · ARXIV
- FOCUS: DLLMs Know How to Tame Their Compute Bound 2026-02-02 · ARXIV
- End-to-end Optimization of Belief and Policy Learning in Shared Autonomy Paradigms 2026-02-02 · ARXIV
- Decoupled Diffusion Sampling for Inverse Problems on Function Spaces 2026-02-02 · ARXIV
- SplineFlow: Flow Matching for Dynamical Systems with B-Spline Interpolants 2026-02-02 · ARXIV
- Safer Policy Compliance with Dynamic Epistemic Fallback 2026-02-02 · ARXIV
- RN-D: Discretized Categorical Actors with Regularized Networks for On-Policy Reinforcement Learning 2026-02-02 · ARXIV
- OrLog: Resolving Complex Queries with LLMs and Probabilistic Reasoning 2026-02-02 · ARXIV
- From Similarity to Vulnerability: Key Collision Attack on LLM Semantic Caching 2026-02-02 · ARXIV
- ExplainerPFN: Towards tabular foundation models for model-free zero-shot feature importance estimations 2026-02-02 · ARXIV
- Character as a Latent Variable in Large Language Models: A Mechanistic Account of Emergent Misalignment and Conditional Safety Failures 2026-02-02 · ARXIV
- Chain-of-thought obfuscation learned from output supervision can generalise to unseen tasks 2026-02-02 · ARXIV
- CATTO: Balancing Preferences and Confidence in Language Models 2026-02-02 · ARXIV
- UEval: A Benchmark for Unified Multimodal Generation 2026-01-30 · ARXIV
- Routing the Lottery: Adaptive Subnetworks for Heterogeneous Data 2026-01-30 · ARXIV
- RedSage: A Cybersecurity Generalist LLM 2026-01-30 · ARXIV
- Reasoning While Asking: Transforming Reasoning Large Language Models from Passive Solvers to Proactive Inquirers 2026-01-30 · ARXIV
- Late Breaking Results: Conversion of Neural Networks into Logic Flows for Edge Computing 2026-01-30 · ARXIV
- Hybrid Linear Attention Done Right: Efficient Distillation and Effective Architectures for Extremely Long Contexts 2026-01-30 · ARXIV
- FineInstructions: Scaling Synthetic Instructions to Pre-Training Scale 2026-01-30 · ARXIV
- Exploring Reasoning Reward Model for Agents 2026-01-30 · ARXIV
- DynaWeb: Model-Based Reinforcement Learning of Web Agents 2026-01-30 · ARXIV
- Discovering Hidden Gems in Model Repositories 2026-01-30 · ARXIV
- Why Adam Works Better with $β_1 = β_2$: The Missing Gradient Scale Invariance Principle 2026-01-30 · ARXIV
- Temporal Guidance for Large Language Models 2026-01-30 · ARXIV
- Language-based Trial and Error Falls Behind in the Era of Experience 2026-01-30 · ARXIV