| 类型 | 标题 | 来源 | 日期 | 标签 | 操作 |
|---|---|---|---|---|---|
| A Quantum Roadmap for Softmax Attention: Exact Born-Rule Analogs for Softmax Attention on the Probability Simplex 当前保存的是来源摘要,不代表论文全文。请以原始来源为准。 | ARXIV | 08-131min | |||
| How to Verify Consistency of Probabilistic Claims 该文提出一种交互式 PCP 框架,能够在多项式时间内检验由概率电路和置信度电路构成的模型,对其产生的众多条件概率回答是否近似一致,并通过稀疏的见证分布作为证明来辅助验证。 | ARXIV | 08-122min | |||
| Putting sign language AI into users’ hands 当前保存的是 RSS 或来源节选,不代表原文全文。请以原始来源为准。 | BLOGS_PODCASTS | 08-121min | |||
| Someone is running mass vulnerability scans, spoofing AI bots like ClaudeBot 当前只保存了标题与来源元数据,未抓取外链全文。请以原始来源和 Hacker News 讨论为准。 | HACKER_NEWS | 08-121min | |||
| Pay with confidence: How Solv Labs built verifiable, auditable agent payments on Amazon Bedrock AgentCore payments 这是一篇介绍如何在 AI 代理执行支付时实现全程可验证、可追责的技术方案,涵盖了政策校验、硬件可信执行环境签名以及交易级审计记录的构建思路。 | BLOGS_PODCASTS | 08-1212min | |||
| Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation 该研究提出一种测试时自进化框架,使 GUI 视觉定位模型在部署后能够通过探索、评估、反思和内部化的闭环过程自行改进。框架中引入基于多模态大模型的评估器提供推理反馈,并通过有条件的自教师把高层反思转化为细粒度的 token 级监督,同时使用对比校准防止错误前缀破坏监督信号。 | ARXIV | 08-122min | |||
| Launch HN: Discovered Materials (YC P26) – AI agents to discover new materials 当前只保存了标题与来源元数据,未抓取外链全文。请以原始来源和 Hacker News 讨论为准。 | HACKER_NEWS | 08-121min | |||
| Long-Horizon AI Research for Grothendieck Constant: A Case Study in Human-AI Mathematical Collaboration 本文展示在数学研究中如何利用 AI 代理提升 Grothendieck 常数 K_G 的已知上下界,并总结 AI 在其中的表现与不足。 | ARXIV | 08-121min | |||
| AI Agent 的“自述”不可信:如何构建可取证、可评估、可进化的 Agent 生产流水线? 当前保存的是 RSS 或来源节选,不代表原文全文。请以原始来源为准。 | JUEJIN | 08-121min | |||
| Tim Gowers: What sort of maths are LLMs good at? 当前只保存了标题与来源元数据,未抓取外链全文。请以原始来源和 Hacker News 讨论为准。 | HACKER_NEWS | 08-121min | |||
| [AINews] How to steal a Reasoning Trace 这是一篇关于前沿模型加密推理痕迹可被解码的技术分析,揭示了共享会话时可能泄露个人敏感信息的隐私与安全隐患。 | BLOGS_PODCASTS | 08-1217min | |||
| WorkBuddy帮我写了一篇言情叙事小说。 当前保存的是 RSS 或来源节选,不代表原文全文。请以原始来源为准。 | JUEJIN | 08-121min | |||
| Beyond a Bag of Features: Set-Level Instability in Sparse Autoencoders 这是一项关于稀疏自编码器(SAE)激活集合在语言模型中表示语义相似性的研究,比较了基于集合重叠的相似度与传统密集嵌入的相似度,发现SAE集合不能更准确地反映人类对类别边界和典型性的判断。 | ARXIV | 08-121min | |||
| llama.cpp 当前只保存了标题与来源元数据,未抓取外链全文。请以原始来源和 Hacker News 讨论为准。 | HACKER_NEWS | 08-121min | |||
| Company Offering '100% Human-Written, Never AI' Medical Research Is 100% AI 当前只保存了标题与来源元数据,未抓取外链全文。请以原始来源和 Hacker News 讨论为准。 | HACKER_NEWS | 08-121min | |||
| ConVAWG: A Retrieval-Grounded Framework for Controlled Synthetic Dialogue Generation in Violence Against Women and Girls ConVAWG 是一个基于检索的框架,用于生成受控的合成对话,模拟针对妇女和儿童的暴力场景,以多轮对话形式呈现。 | ARXIV | 08-122min | |||
| 从零开发一个 Coding Agent(七):实现纯文本 Agent Loop 当前保存的是 RSS 或来源节选,不代表原文全文。请以原始来源为准。 | JUEJIN | 08-121min | |||
| Daybreak models are now available on AWS 当前保存的是 RSS 或来源节选,不代表原文全文。请以原始来源为准。 | BLOGS_PODCASTS | 08-121min | |||
| Stealing Reasoning Traces from Proprietary LLM APIs 当前保存的是来源摘要,不代表论文全文。请以原始来源为准。 | ARXIV | 08-122min | |||
| 🔬The BioAI Phase Shift - Matthew McPartlon & Neil Patil, Chai Discovery 这是一段播客摘要,介绍了 Chai Discovery 如何在 AI 制药工具领域获得关注,解释了为何制药行业现在开始愿意付费使用 AI 设计工具而非自己研发药物。 | BLOGS_PODCASTS | 08-125min | |||
| Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains 当前保存的是来源摘要,不代表论文全文。请以原始来源为准。 | ARXIV | 08-121min | |||
| Suzanne: AI tool for designing and manufacturing physical products 当前只保存了标题与来源元数据,未抓取外链全文。请以原始来源和 Hacker News 讨论为准。 | HACKER_NEWS | 08-121min | |||
| Accelerate cyber defense with OpenAI and AWS: Daybreak Red & Daybreak Blue now available to eligible customers on Amazon Bedrock 这是 AWS 与 OpenAI 在 Amazon Bedrock 上线专门用于网络防御的 AI 模型。Daybreak Red 提供攻击性安全研究能力,Daybreak Blue 侧重防御性安全任务,两者都旨在帮助安全团队更快完成漏洞发现、验证和修复流程。 | BLOGS_PODCASTS | 08-125min | |||
| ArchAgent v2: A Case Study with the Data Prefetching Championship ArchAgent v2 是面向多层次数据预取的自动化微架构搜索框架。它采用分层演化搜索和硬件可实现性反馈,将搜索能力从单层扩展到三级预取,并在同等比赛规则下生成的策略优于手工设计的最优方案。 | ARXIV | 08-122min | |||
| Deploying Anthropic Claude apps gateway for AWS for enterprise workloads 该内容介绍了在AWS上部署Claude应用网关的参考架构,包括请求流向、认证与策略控制方式以及在Fargate上的容器化运行方式。 | BLOGS_PODCASTS | 08-1214min | |||
| Energy-Structured Latent World Models with Neural Time Fields for Physically Constistent Open-World Motion Planning 当前保存的是来源摘要,不代表论文全文。请以原始来源为准。 | ARXIV | 08-122min | |||
| First Orion accelerates QA automation using Amazon Nova Act First Orion 采用能够用自然语言描述测试意图的 AI 代理,实现了 UI 自动化测试的快速编写和维护,以解决传统脚本因页面结构变化而失效的问题。 | BLOGS_PODCASTS | 08-1213min | |||
| OpenAI’s head of ethics leaves less than a year after joining 当前只保存了标题与来源元数据,未抓取外链全文。请以原始来源和 Hacker News 讨论为准。 | HACKER_NEWS | 08-121min | |||
| Financial Numerical Prediction and Allocation as Token Generation 该研究把因果语言模型的 token 生成能力直接用于股票收益率预测和 ETF 动态配置,构建了一套统一的无头部接口,实现从预测到仓位生成的全流程。 | ARXIV | 08-122min | |||
| How ONESTRUCTION built the Ishigaki-IDS foundation model with AWS GenAIIC 本文描述了一家建筑科技初创公司如何在数据稀缺的 BIM 领域,利用合成数据和三阶段训练(持续预训练、监督微调、强化学习)构建面向信息交付规范(IDS)的领域专用基础模型,并借助可验证奖励提升输出质量。 | BLOGS_PODCASTS | 08-129min | |||
| Why Go Is an Ideal Language for AI-Assisted Software Engineering 当前只保存了标题与来源元数据,未抓取外链全文。请以原始来源和 Hacker News 讨论为准。 | HACKER_NEWS | 08-121min | |||
| AMIE, our research medical AI system, demonstrates real-time clinical video consultation capabilities in a first-of-its-kind study. 当前保存的是 RSS 或来源节选,不代表原文全文。请以原始来源为准。 | BLOGS_PODCASTS | 08-121min | |||
| SHE: Trajectory-driven Safety Harness Evolution for LLM Agents 该研究提出一种通过学习交互轨迹动态演进 LLM Agent 安全护栏的框架。将护栏拆分为系统提示、规则库、安全记忆和工具策略四个组件,并构建属性导向的演进循环,把轨迹失败转化为结构化诊断并在各组件上局部优化,从而在保持功能效用的同时提升安全性。 | ARXIV | 08-122min | |||
| What I learned by putting GitHub Copilot behind a MitM proxy 当前只保存了标题与来源元数据,未抓取外链全文。请以原始来源和 Hacker News 讨论为准。 | HACKER_NEWS | 08-121min | |||
| How Pixieset achieved 35% AI feature adoption by solving the right problem with Amazon Bedrock 当前保存的是 RSS 或来源节选,不代表原文全文。请以原始来源为准。 | BLOGS_PODCASTS | 08-129min | |||
| Space-Creating versus Dead Possession: An Off-Ball Possession-Quality Index for Broadcast Football 提出一种两层评估框架:先在事件层面识别低威胁持球序列(垃圾持球),随后利用视频投影得到空间创造指数,区分产生空间与无效持球。 | ARXIV | 08-122min | |||
| Stealing Reasoning Traces from Proprietary LLM APIs 当前只保存了标题与来源元数据,未抓取外链全文。请以原始来源和 Hacker News 讨论为准。 | HACKER_NEWS | 08-121min | |||
| 番外篇二:《不到十行代码,我用ReactAgen搭了个会自己调工具的 Agent》 当前保存的是 RSS 或来源节选,不代表原文全文。请以原始来源为准。 | JUEJIN | 08-121min | |||
| Apple Silicon and macOS VMs: 11–16× Faster LLM Inference with Llama.cpp 当前只保存了标题与来源元数据,未抓取外链全文。请以原始来源和 Hacker News 讨论为准。 | HACKER_NEWS | 08-111min | |||
| Consilience for Verifier-Free Test-Time Scaling 该研究指出,现有的仅依赖置信度排序的免验证器测试时扩展方法在复杂任务上会失效,因为全程高置信度往往意味着探索不足。作者提出一种名为 **consilience** 的选择框架,通过评估置信度随时间的非对称性,显式惩罚初始高置信度并要求最终答案具备确定性。 | ARXIV | 08-112min | |||
| Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness 一种在模型解码阶段直接干预概率分布的零提示诊断测试,通过在词边界动态屏蔽主要候选标记,强迫模型产生迂回表达,从而评估其在非正常生成路径下的鲁棒性。 | ARXIV | 08-111min | |||
| How to organize Claude Code for product work 当前只保存了标题与来源元数据,未抓取外链全文。请以原始来源和 Hacker News 讨论为准。 | HACKER_NEWS | 08-111min | |||
| 从“即兴创作”到“规格先行”,华为云码道(CodeArts)代码智能体持续深耕企业级规范驱动开发能力 当前保存的是 RSS 或来源节选,不代表原文全文。请以原始来源为准。 | JUEJIN | 08-111min | |||
| DSLE: A Learning Environment for Dark Souls Boss Encounters 当前保存的是来源摘要,不代表论文全文。请以原始来源为准。 | ARXIV | 08-112min | |||
| GENCO - A Unified Neural Solver Embedded in a Development Framework for Steady-State Grid Analysis GENCO 是一种统一的神经网络求解器,兼顾潮流、最优潮流和状态估计三大任务,配合开源 GridFM 框架提供标准化数据和低代码训练,并在实验中实现约30倍于传统牛顿法的加速以及约85倍于 IPOPT 的加速。 | ARXIV | 08-112min | |||
| 手写一个 LLM Harness 框架:用工程化手段把大模型幻觉踩在脚下 核心结论 Harness 是一种将大模型应用分解为生成、评测、择优三个阶段的流水线编排框架。生成阶段通过 与 组合并行发出 N 个请求,评测阶段由 LLM 作为 Judge 输出结构化分数,最后根据分数择优输出。该框架的核心价值在于将大模型的随机性从缺陷转化为优势,用工程手段覆盖质量波动。 | JUEJIN | 08-111min | |||
| From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch 当前保存的是来源摘要,不代表论文全文。请以原始来源为准。 | ARXIV | 08-112min | |||
| The Water Footprint of AI 当前只保存了标题与来源元数据,未抓取外链全文。请以原始来源和 Hacker News 讨论为准。 | HACKER_NEWS | 08-111min | |||
| How Claude marks AI-generated content 当前只保存了标题与来源元数据,未抓取外链全文。请以原始来源和 Hacker News 讨论为准。 | HACKER_NEWS | 08-111min | |||
| Multimodal Model Diffing for Feature Discovery and Control 当前保存的是来源摘要,不代表论文全文。请以原始来源为准。 | ARXIV | 08-112min |