未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 721 篇解读
噪声环境下基态制备量子算法的基准测试
Benchmark of quantum algorithms for ground state preparation in the presence of noise
该论文在可解费米子模型中定量比较了含噪声时绝热、QAOA 与多频冷却的基态制备表现,发现冷却在拓扑相优于绝热且对参数误差更稳健
面向生成式推荐的分布式用户兴趣上下文的结构化与分词
Structuring and Tokenizing Distributed User Interest Context for Generative Recommendation
该论文提出 G2Rec 框架,通过全局共现图与软聚类实现兴趣原型提取及语义分词,无需人工标注即可高效注入工业级生成推荐
最优确定性多校准与全预测
Optimal Deterministic Multicalibration and Omniprediction
本文首次给出达到 minimax 最优样本复杂度的确定性多校准算法并推广至全能预测
UNIEGO:以代理为中介的统一自我中心视频表示学习
UNIEGO: Proxies as Mediators for Unified Egocentric Video Representation Learning
通过代理模型弥合多教师异构性并选择性蒸馏可靠知识,构建跨视角模态的统一自我中心视频表征,在三大任务上达到最优
DiffusionGemma 的透明度如何?
How Transparent is DiffusionGemma?
通过将扩散模型中间状态映射为可解释令牌瓶颈,将不透明串行深度从二十八点六倍降至一点一倍,并揭示了非时序推理等扩散特有现象
拓扑谱形状因子揭示从多体量子混沌中涌现的非厄米单粒子 PT 转变
Topological spectral form factor reveals emergent non-Hermitian single-particle $\mathcal{PT}$ transitions from many-body quantum chaos
提出拓扑谱形状因子,发现多体量子混沌涌现非厄米单粒子 PT 转变,使标度行为由指数单调转为振荡
以 LOCUS 解放法律:美国地方法令语料库
Freeing the Law with LOCUS: A Local Ordinance Corpus for the United States
该论文构建了覆盖美国九千余市县的 LOCUS 地方法规语料库,并通过机器学习首次大规模揭示了地方法规在模糊性、执法裁量权、家长主义等维度上的分布特征
Transmon 阵列中的量子孤子及其量子行走
Quantum solitons and their quantum walks in transmon arrays
这篇论文在超导 transmon 阵列中揭示了吸引性玻色-哈伯德模型下的离散量子孤子及其量子行走干涉图样,并提出了可实验制备局域孤子态的具体方案
ReproRepo:利用 GitHub 仓库问题扩展可复现性审计
ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues
该论文利用 GitHub 议题构建可扩展复现审计基准,发现不执行代码的 LLM 代理能为 90% 的论文找到语义匹配的真实复现阻碍
量子 LDPC 码的脉冲译码:简并与码缩短的等价性
Impulse Decoding of Quantum LDPC Codes: Equivalence of Degeneracy and Code-Shortening
证明量子 LDPC 码的简并现象对应解码器对经典码的缩短操作,由此设计脉冲解码方案,性能在码容量及电路级噪声下全面超越 BP-OSD 等并大幅降复杂度
视觉验证实现推理时引导与自主策略改进
Visual Verification Enables Inference-time Steering and Autonomous Policy Improvement
提出 VERITAS 框架,利用视觉验证器在推理时引导机器人策略,无需额外训练即提升性能,且自主改进效率媲美人类专家演示
面向稀疏回合结果在线 RL 微调 VLAs 的层次化优势加权
Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes
通过将稀疏结局分解为生存性和效率双目标,并引入状态自适应优势加权与干预感知信用分配,将 VLA 在线微调成功率从基线最高 44% 提升至 92%
面向机器人策略学习的几何动作模型
Geometric Action Model for Robot Policy Learning
将预训练几何基础模型改造为同时预测未来三维几何和动作的策略,在多个操控基准上超越现有视觉语言动作模型,且更快更轻
用于解决线性逆问题的精确后验分数估计
Exact Posterior Score Estimation for Solving Linear Inverse Problems
该论文得出线性高斯逆问题精确后验得分闭合形式,将后验采样转化为各向异性噪声去噪,由此提出 EPS 方法,性能与效率均显著提升
ClinHallu:诊断医学多模态大语言模型推理中分阶段幻觉的基准
ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning
该基准首次将医学多模态大模型推理分解为视觉识别、知识回忆与推理整合三阶段,精准定位幻觉来源并量化错误传播
解决量子金字塔的边缘问题
Resolving the Edge of a Quantum Pyramid
证明了钝角与平坦量子金字塔的熵不等式,从而解决了量子金字塔猜想并确认了全局信息最优测量
凝视头:视觉语言模型如何注视它们所描述的内容
Gaze Heads: How VLMs Look at What They Describe
发现视觉语言模型中不到 9% 的注意力头会在描述时逐词注视对应区域干预这些头即可精确控制模型描述任意指定区域无需重新训练
在你思考之前:系统 0、人工智能中介的认知与认知殖民
Before You Think: System 0, AI-Mediated Cognition and Cognitive Colonization
该论文提出 System 0 框架,揭示 AI 作为前置认知层在思考前便过滤信息,导致认知殖民,将外部目标植入自我思维架构
EurekAgent:智能体环境工程即为自主科学发现所需的一切
EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery
提出环境工程范式,通过权限、工件、预算、人机协同四维度设计代理环境,以极低成本在数学、核工程等多领域刷新最优结果
无纠缠非定域性的半设备无关认证
Semi-Device-Independent Certification for Nonlocality without Entanglement
利用最大置信度测量,在测量设备不完美条件下实现无纠缠非局域性的半设备无关认证与演示
Agents-K1:迈向智能体原生知识编排
Agents-K1: Towards Agent-native Knowledge Orchestration
提出了一个端到端知识编排管线,将论文全文转化为包含实体、声明、证据和关系类型的多模态知识图谱,并支持可追溯推理
利用大语言模型进行社会与行为科学领域的自动化可重复性评估
Automated reproducibility assessments in the social and behavioral sciences using large language models
大语言模型可自动评估社会科学研究的可重复性,其定性结论与原文一致率达 96%,效应量恢复率高于人类再分析
理解图神经网络的截断位置编码
Understanding Truncated Positional Encodings for Graph Neural Networks
揭示截断谱编码与行走编码表达能力有本质区别,大尺寸谱编码甚至弱于 1-WL 测试,混合截断编码在真实数据上更优
SpatialClaw:重新思考代理空间推理的动作接口
SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning
通过采用持久化 Python 内核的逐步代码接口,使视觉语言模型能根据中间视觉和文本反馈动态组合工具并修正推理,在 20 个空间基准上准确率达 59.9%,超越现有方法 11.2 个百分点,且无需训练