未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 721 篇解读
无动量跳跃的混合量子-经典刘维尔分子动力学的 GPU 实现
GPU implementation of mixed quantum-classical Liouville molecular dynamics without momentum jump
在 GPU 上实现无动量跳跃的混合量子经典刘维尔分子动力学,去除轨迹繁殖后较 CPU 加速一个数量级并随轨迹数线性扩展
LittleLearner:知识接触受教学控制的语言模型
LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure
构建仅含美国小学内容的八百八十亿词元语料并训练五十亿参数模型,形成知识边界明确的沙盒,证明后训练和上下文学习无法扩展超纲能力
QuoteBench:匹配分数如何掩盖命令路径失败
QuoteBench: How Matched Scores Can Hide Command-Path Failures
该论文用引号基准发现,匹配分数会掩盖命令路径失败:同一回复经新增解析器重放使成功率下降 55.4 至 73.2 个百分点,披露边界后最多恢复 60.7 个百分点
多标签 Jaccard 度量的指数级凸校准维度
Exponential Convex Calibration Dimension for the Multi-Label Jaccard Measure
该文证明多标签 Jaccard 损失的凸校准维度为指数级,介于 2 的 s−1 次方和 2 的 s 次方减 1 之间,精确校准需指数坐标,但任意固定加性遗憾可用多项式维代理实现
每个 PPT 信道都具有有限的纠缠破坏指数。
Every PPT channel has finite entanglement-breaking index
证明了所有正部分转置信道都具有有限纠缠破坏指数,并将一大类此类映射的该指数上界统一压至 3
在线概率预测的防御性提升
Defensive Boosting for Online Probabilistic Forecasting
提出防御提升算法,同时取得在线梯度提升的无条件平方误差竞争保证与弱学习条件下的强分类保证,仅需单个弱学习器且运行快数个量级
HumanTracker:迈向全面且与人类对齐的运动跟踪基准
HumanTracker: Towards Comprehensive and Human-Aligned Motion Tracking Benchmark
该论文构建带分类与文本标签的大规模人形机器人运动跟踪基准,并提出 HumanScore 指标,能比运动学误差更准确预测人类偏好并揭示接触与稳定性缺陷
OmniScientist:全模态全学科 AI 科学家
OmniScientist: An Omni-Modal Omni-Discipline AI Scientist
提出全模态 AI 科学家,直接从图像、信号、音频等原始证据完成多学科研究,36 个案例全部产出论文,直接感知在 85% 对比中胜出
AutoDesign:面向长程智能体设计的元执行框架优化
AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
AutoDesign 提出元 harness 优化框架,用反馈递归改进设计 harness,在论文转海报任务中得分 78.32、超商业系统 7.45 分,并使多种编码智能体平均分提升 12.4%
不定因果序中的实验量子密钥分发
Experimental Quantum Key Distribution in an Indefinite Causal Order
该论文在光子量子开关中实验实现了不定因果序的类 BB84 量子密钥分发,证明无需公开牺牲密钥比特即可通过控制量子比特检测窃听
DreamFly:面向空中视觉语言导航的因果记忆与滚动时域扩散规划
DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation
提出 DreamFly 框架,通过因果历史记忆、后退视野扩散规划与轻量终止模块,在航拍视觉语言导航基准上取得最高成功率和最低导航误差
二维量子磁体中的界面相与动力学:从普适性到量子模拟的“全息”方法
Interface phases and dynamics in two-dimensional quantum magnets: A "holographic" approach from universality to quantum simulation
该论文用一维有效哈密顿量构建二维量子磁体界面的全息分类框架,揭示刚性与粗糙界面相,并预言可实验检验的曲率驱动动力学标度律
用纠缠见证探测杂质量子临界性
Probing Impurity Quantum Criticality with Entanglement Witnesses
该论文用可测自旋电荷涨落与量子费舍尔信息证明两杂质近藤模型临界点对应局域磁矩纠缠伙伴从传导电子云重组为杂质间单态
ConVAWG:一种面向暴力侵害妇女和女童领域的基于检索的受控合成对话生成框架
ConVAWG: A Retrieval-Grounded Framework for Controlled Synthetic Dialogue Generation in Violence Against Women and Girls
提出 ConVAWG 框架,用检索案件与分层时间线生成六千余段多轮合成对话,填补虐待作为时序关系现象的数据空白
Surgical WAM:一种用于数据高效手术机器人学习的世界-动作模型
Surgical WAM: A World-Action Model for Data-Efficient Surgical Robot Learning
该论文提出 Surgical WAM,先用无动作视频预训练手术视觉动态,再在固定动作标注预算下微调,使四项模拟手术任务平均成功率从 63.5% 提升至 77.8%
从价值观到基准:评估荷兰政府用途的大型语言模型
From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch
为荷兰政府构建融合公共价值观的 LLM 评估基准,发现高质量模型伴随高能耗和高成本且事实准确性与诚实性表现分离
多模态模型差异分析:特征发现与控制
Multimodal Model Diffing for Feature Discovery and Control
该工作通过比对基础语言模型与多模态模型的稀疏特征,发现多模态训练改变的因果方向,并实现无需重训的精准特征操控,在不影响通用视觉问答下选择性增强或削弱特定视觉能力
超越自然度:从语言学维度审视自动语音合成评估器
Beyond Naturalness: Probing Automated Text-To-Speech Evaluators on Linguistically Grounded Dimensions
首次将 TTS 自然度分解为十个语言学感知维度并构建元评估基准,揭示现有自动评估器均无法全面捕获多维语音错误
镜像世界:驯服视频扩散模型以生成镜面反射
MirrorWorld: Taming Video Diffusion Models for Mirror Reflection Generation
提出了语义关系蒸馏和几何变换对齐方法,解决了视频扩散模型生成场景一致镜子反射的难题并构建了基准
纠缠姆潘巴效应
Entanglement Mpemba Effect
该论文发现初始纠缠更低的量子态在相同耗散动力学中能反超纠缠更高的态,从而显著加速纠缠制备,并基于弛豫谱给出了普适判据
量子德西特与解析延拓的陈-西蒙斯理论
Quantum de Sitter and Analytically Continued Chern Simons Theory
利用 Lefschetz thimble 为洛伦兹自对偶引力中的 Kodama 态给出收敛定义,证明 Airy 波函数是 Bianchi IX 截断的主导形式而非一维约化假象
CalibForge:面向可学习终端任务规模化的对抗性求解器校准
CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks
提出对抗式求解器校准方法,通过多求解器分歧和强弱对比关系生成 5 千余项可学习终端任务,显著提升终端代理训练效果
资源化授权:已部署 AI 智能体参与式治理的机制设计模型
Resourced Authority A Mechanism-Design Model for Participatory Governance of Deployed AI Agents
其机制将治理决策编码为基于计算预算的硬件自执行授权,证明了计算是已部署 AI 代理参与式治理的有效杠杆
源于扭曲统计的贝尔非定域性
Bell nonlocality from twisted statistics
利用非对易 Moyal 平面上的扭曲统计,在自由标量场中制备动量对纠缠波包并实现 CHSH 不等式违反,以操作方式验证了量子场多粒子态编码的时空非对易结构