未来已来,只是尚未均匀分布

每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。

已收录 721 篇解读

145

低频陷阱:视频语言模型在简单事件记录上表现失败

The Low Frequency Trap: Video Language Models Fail at Simple Event Bookkeeping

该论文通过可执行轨迹的参数化评测,发现视频语言模型在瞬态事件计数上毫无可靠区域,且高频高计数下正确率仅 0.2%

arXiv: 2608.06361v1

146

AV-AIVAT:在不完美信息博弈中成本降低 74 倍、具有认证的任意时间有效停止的智能体评估

AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games

提出 AV-AIVAT,将在线 AIVAT 与置信序列结合,实现非完美信息博弈中有保证的随时停止,中位数所需手牌减少 74 倍且可审计

arXiv: 2608.06362v1

147

一种最优的不可知 PAC 算法

An Optimal Agnostic PAC Algorithm

该论文构造了首个达到不可知 PAC 学习统计最优风险界的算法,以常数因子精确匹配已知下界

arXiv: 2608.06363v1

148

调查移动购物应用中的人工智能数字主权:尼日利亚案例研究

Investigating Artificial Intelligence Digital Sovereignty in Mobile Shopping Apps: A Case Study of Nigeria

该研究通过对尼日利亚购物应用的取证分析,发现人工智能应用广泛但透明度不足,揭示了对个人数字主权的挑战

arXiv: 2608.06364v1

149

追溯心脏:心力衰竭特征工程的循证化流程

Tracing the Heart: An Evidence-Linked Pipeline for Heart-Failure Feature Engineering

该研究提出基于证据链接和评分标准的多智能体管道,实现可审计的心衰特征工程自动化,使 HFrEF 和 HFpEF 表型 AUROC 分别显著提升

arXiv: 2608.06366v1

150

通过选择性上下文偏好优化学习何时信任

Learning When to Trust via Selective Context Preference Optimization

该工作提出选择性信任基准和 SCOPE 优化方法,使模型学会何时信任上下文,在抵抗误导的同时保留对正确信号的利用能力

arXiv: 2608.06377v1

151

基于强化学习的持久图空间随机动力学

Stochastic Dynamics on Persistence Diagram Space via Reinforcement Learning

提出强化学习驱动的持久图随机演化框架,证明其马尔可夫链存在唯一平稳分布,并实现保留主导拓扑结构的自适应压缩

arXiv: 2608.06276v1

152

基于中性原子系综的快速量子互连

Fast Quantum Interconnects via Neutral Atom Ensembles

提出基于中性原子系综里德伯相互作用的无腔量子互连方案,实现每秒超三十万次远程纠缠生成

arXiv: 2608.05147v1

153

旋转环形腔中原子的非相对论量子电动力学

Non-Relativistic Quantum Electrodynamics of Atoms in a Rotating Ring Cavity

该研究从弯曲时空狄拉克方程出发,严格推导了旋转环形腔中氢原子的量子光学模型,并发现旋转诱导的原子超精细位移等新效应

arXiv: 2608.03997v1

154

推理型大语言模型的测试时扩展:推理机制、评估与可复现性

Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility

该论文系统阐明了推理 LLM 测试时扩展的三种推理模式,确立了协议匹配的评估和可重现性规范,基于广泛基准实验开源超 20 亿条推理轨迹

arXiv: 2608.04001v1

155

TurnSight:面向工具集成推理的轮级后见自蒸馏

TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

TurnSight 从工具执行结果构建多前瞻后见信号,通过跨视野方向一致性筛选可靠监督,归一化调节优势,解决多轮工具推理的功劳分配

arXiv: 2608.04007v1

156

球面上平方和松弛的 Argmax 原理

An Argmax Principle for Sum-of-Squares Relaxations on the Sphere

提出 argmax 原理分析高阶矩多项式极值点,统一改进球面优化平方和松弛的收敛界与证明

arXiv: 2608.02594v1

157

onepot-Bench 0:迈向实验室感知的计算化学基准

onepot-Bench 0: towards lab-aware in silico chemistry benchmarks

该论文构建了基于非公开湿实验数据的化学评测基准,揭示了语言模型在化学推理与实验预测上的显著能力鸿沟

arXiv: 2608.02595v1

158

利用可执行实践框架架起人工智能与电力系统工程教育的桥梁

Bridging Artificial Intelligence and Power Systems Education Using a Hands-On Executable Framework

基于调查揭示九成从业者运行人工智能有障碍,开发渐进式电力 AI 模块库,并在 IEEE 高参与度研讨会中获 590+人验证需求

arXiv: 2608.02599v1

159

量子泛函估计的近乎紧下界:Uhlmann 保真度、迹距离与冯·诺依曼熵

Nearly tight lower bounds for estimating quantum functionals: Uhlmann fidelity, trace distance, and von Neumann entropy

该论文为量子态功能估计建立统一下界框架,证明 Uhlmann 保真度、迹距离和冯诺依曼熵需要Ω̃(d²)样本,解决多个开放问题并证实十几种量子算法近乎最优

arXiv: 2608.02600v1

160

ExtractBench:面向模式引导的企业文档提取基准

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

首个涵盖八个领域、六十七种企业文档类型的模式引导抽取基准,同时评测长记录完整性、扫描手写感知、溯源精度与成本

arXiv: 2607.29677v1

161

谱估计几乎与量子态层析一样困难

Spectrum Estimation is Almost as Hard as Tomography

该工作证明 d 维量子态的频谱估计需要Ω(d²⁻γ)个副本,几乎与全态层析同样困难,回答了长期开放问题

arXiv: 2607.29680v1

162

在线影子断层扫描达到经典界限

Online Shadow Tomography Matching the Classical Bounds

该论文首次实现在线影子层析成像样本复杂度匹配经典最优界并填补量子与经典长期差距引入量子 Efron–Stein 分解新框架

arXiv: 2607.29686v1

163

OSReward:为跨平台计算机使用奖励模型建立标准化评估

OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models

构建首个跨平台计算机使用代理轨迹评估基准发现视觉语言法官普遍存在系统性宽松偏差并训练出低成本开源奖励模型

arXiv: 2607.28609v1

164

从时间演化中学习任意林德布拉德算子

Learning Arbitrary Lindbladians from Time Evolution

该论文提出一种近乎最优的算法无需辅助与控制仅由时间演化即可学习任意林德布拉德算符的全部泡利系数

arXiv: 2607.28610v1

165

AISPA:面向大型语言模型应用的以用户为中心的系统提示词审计

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

提出一种用户中心系统提示审计框架审计了 88 个产品 3249 条指令发现保护普遍但仅四分之一覆盖所有维度约四成指令违背用户利益

arXiv: 2607.28617v1

166

AskChem:以声明为中心的化学文献综合基础设施

AskChem: Claim-Centered Infrastructure for Chemistry Literature Synthesis

将化学文献检索单位变为携带出处与引文的原子化声明,构建分面分类和证据图,助力跨论文合成并消除虚引

arXiv: 2607.28618v1

167

基于压缩椭圆几何传输的最优测量态制备

On Optimal Measurement-State Preparation via Geometric Transport of the Squeezing Ellipse

提出以压缩椭圆几何输运为核心的最优测量态制备方法,发现椭圆旋转由封闭路径立体角决定

arXiv: 2607.28620v1

168

提升提升积码

Lifting Lifted Product Codes

基于群扩张和图提升系统扩展提升乘积码,得到更优参数,并利用链映射迁移码手术门以降低空间开销

arXiv: 2607.28621v1