未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 721 篇解读
低频陷阱:视频语言模型在简单事件记录上表现失败
The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping
该论文通过可执行轨迹的参数化评测,发现视频语言模型在瞬态事件计数上毫无可靠区域,且高频高计数下正确率仅 0.2%
AV-AIVAT:在不完美信息博弈中成本降低 74 倍、具有认证的任意时间有效停止的智能体评估
AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games
提出 AV-AIVAT,将在线 AIVAT 与置信序列结合,实现非完美信息博弈中有保证的随时停止,中位数所需手牌减少 74 倍且可审计
一种最优的不可知 PAC 算法
An Optimal Agnostic PAC Algorithm
该论文构造了首个达到不可知 PAC 学习统计最优风险界的算法,以常数因子精确匹配已知下界
调查移动购物应用中的人工智能数字主权:尼日利亚案例研究
Investigating Artificial Intelligence Digital Sovereignty in Mobile Shopping Apps: A Case Study of Nigeria
该研究通过对尼日利亚购物应用的取证分析,发现人工智能应用广泛但透明度不足,揭示了对个人数字主权的挑战
追溯心脏:心力衰竭特征工程的循证化流程
Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering
该研究提出基于证据链接和评分标准的多智能体管道,实现可审计的心衰特征工程自动化,使 HFrEF 和 HFpEF 表型 AUROC 分别显著提升
通过选择性上下文偏好优化学习何时信任
Learning When to Trust via Selective Context Preference Optimization
该工作提出选择性信任基准和 SCOPE 优化方法,使模型学会何时信任上下文,在抵抗误导的同时保留对正确信号的利用能力
基于强化学习的持久图空间随机动力学
Stochastic Dynamics on Persistence Diagram Space via Reinforcement Learning
提出强化学习驱动的持久图随机演化框架,证明其马尔可夫链存在唯一平稳分布,并实现保留主导拓扑结构的自适应压缩
基于中性原子系综的快速量子互连
Fast Quantum Interconnects via Neutral Atom Ensembles
提出基于中性原子系综里德伯相互作用的无腔量子互连方案,实现每秒超三十万次远程纠缠生成
旋转环形腔中原子的非相对论量子电动力学
Non-Relativistic Quantum Electrodynamics of Atoms in a Rotating Ring Cavity
该研究从弯曲时空狄拉克方程出发,严格推导了旋转环形腔中氢原子的量子光学模型,并发现旋转诱导的原子超精细位移等新效应
推理型大语言模型的测试时扩展:推理机制、评估与可复现性
Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility
该论文系统阐明了推理 LLM 测试时扩展的三种推理模式,确立了协议匹配的评估和可重现性规范,基于广泛基准实验开源超 20 亿条推理轨迹
TurnSight:面向工具集成推理的轮级后见自蒸馏
TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning
TurnSight 从工具执行结果构建多前瞻后见信号,通过跨视野方向一致性筛选可靠监督,归一化调节优势,解决多轮工具推理的功劳分配
球面上平方和松弛的 Argmax 原理
An Argmax Principle for Sum-of-Squares Relaxations on the Sphere
提出 argmax 原理分析高阶矩多项式极值点,统一改进球面优化平方和松弛的收敛界与证明
onepot-Bench 0:迈向实验室感知的计算化学基准
onepot-Bench 0: towards lab-aware in silico chemistry benchmarks
该论文构建了基于非公开湿实验数据的化学评测基准,揭示了语言模型在化学推理与实验预测上的显著能力鸿沟
利用可执行实践框架架起人工智能与电力系统工程教育的桥梁
Bridging Artificial Intelligence and Power Systems Education Using a Hands-On Executable Framework
基于调查揭示九成从业者运行人工智能有障碍,开发渐进式电力 AI 模块库,并在 IEEE 高参与度研讨会中获 590+人验证需求
量子泛函估计的近乎紧下界:Uhlmann 保真度、迹距离与冯·诺依曼熵
Nearly tight lower bounds for estimating quantum functionals: Uhlmann fidelity, trace distance, and von Neumann entropy
该论文为量子态功能估计建立统一下界框架,证明 Uhlmann 保真度、迹距离和冯诺依曼熵需要Ω̃(d²)样本,解决多个开放问题并证实十几种量子算法近乎最优
ExtractBench:面向模式引导的企业文档提取基准
ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction
首个涵盖八个领域、六十七种企业文档类型的模式引导抽取基准,同时评测长记录完整性、扫描手写感知、溯源精度与成本
谱估计几乎与量子态层析一样困难
Spectrum Estimation is Almost as Hard as Tomography
该工作证明 d 维量子态的频谱估计需要Ω(d²⁻γ)个副本,几乎与全态层析同样困难,回答了长期开放问题
在线影子断层扫描达到经典界限
Online Shadow Tomography Matching the Classical Bounds
该论文首次实现在线影子层析成像样本复杂度匹配经典最优界并填补量子与经典长期差距引入量子 Efron–Stein 分解新框架
OSReward:为跨平台计算机使用奖励模型建立标准化评估
OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models
构建首个跨平台计算机使用代理轨迹评估基准发现视觉语言法官普遍存在系统性宽松偏差并训练出低成本开源奖励模型
从时间演化中学习任意林德布拉德算子
Learning Arbitrary Lindbladians from Time Evolution
该论文提出一种近乎最优的算法无需辅助与控制仅由时间演化即可学习任意林德布拉德算符的全部泡利系数
AISPA:面向大型语言模型应用的以用户为中心的系统提示词审计
AISPA: User-Centric System Prompt Auditing for Large Language Model Applications
提出一种用户中心系统提示审计框架审计了 88 个产品 3249 条指令发现保护普遍但仅四分之一覆盖所有维度约四成指令违背用户利益
AskChem:以声明为中心的化学文献综合基础设施
AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis
将化学文献检索单位变为携带出处与引文的原子化声明,构建分面分类和证据图,助力跨论文合成并消除虚引
基于压缩椭圆几何传输的最优测量态制备
On Optimal Measurement-State Preparation via Geometric Transport of the Squeezing Ellipse
提出以压缩椭圆几何输运为核心的最优测量态制备方法,发现椭圆旋转由封闭路径立体角决定
提升提升积码
Lifting Lifted Product Codes
基于群扩张和图提升系统扩展提升乘积码,得到更优参数,并利用链映射迁移码手术门以降低空间开销