未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 721 篇解读
利用评分标准奖励训练 AI 合作科学家
Training AI Co-Scientists Using Rubric Rewards
利用论文自动提取研究目标与评分量规,通过自我评分强化学习训练模型,使其生成的研究计划获人类专家 70% 偏好且跨领域泛化
非厄米系统中的量子几何界限
Quantum Geometric Bounds in Non-Hermitian Systems
发现非厄米量子几何张量为响应函数、电导张量和光学权重施加独特界限,并在非厄米陈数系统及 Lindbladian 开放系统中得到验证
退相干下的信息临界相
Information Critical Phases under Decoherence
发现退相干下 ZN 环面码存在信息临界相,其相干信息热力学极限下为分数值,可保留部分逻辑信息,源于离散对称性增强为 U1 超流模式
基于电荷信息的量子错误纠正
Charge-Informed Quantum Error Correction
利用电荷测量的最优解码器显著提高 U(1)拓扑量子纠错阈值,并确认解码相变属于修正的 BKT 普适类
经济生产力的规模定律:LLM 辅助咨询、数据分析与管理任务的实验证据
Scaling Laws for Economic Productivity: Experimental Evidence in LLM-Assisted Consulting, Data Analyst, and Management Tasks
首次通过大型随机实验推导出大语言模型助力经济生产力的规模定律:模型每年进步缩短 8% 任务时间,但多步骤代理任务增益有限
变分正确的算子学习:具备后验误差估计的降阶基神经算子
Variationally correct operator learning: Reduced basis neural operator with a posteriori error estimation
本文构建了可证明误差等价的一阶系统最小二乘损失与降阶基神经算子,实现变分正确的可靠学习及其后验误差估计
面向语言模型的并行词元预测
Parallel Token Prediction for Language Models
该论文提出了并行令牌预测框架,可在单次模型调用中联合生成多个相互依赖的离散令牌,理论上无损地实现任意长序列并行解码
测量大语言模型评估中的所有噪声
Measuring all the noises of LLM Evals
该论文系统测量 LLM 评估的预测与数据噪声,揭示各评测集有可预测总噪声且预测噪声主导,据此提升统计功效
C2LLM 技术报告:通过自适应交叉注意力池化开辟代码检索新前沿
C2LLM Technical Report: A New Frontier in Code Retrieval via Adaptive Cross-Attention Pooling
提出自适应交叉注意力池化模块打破传统池化瓶颈,C2LLM-7B 在代码检索基准 MTEB-Code 上以平均分 80.75 在所有模型中排名第一
计算即时检验传感器的自主不确定性量化
Autonomous Uncertainty Quantification for Computational Point-of-care Sensors
通过蒙特卡洛丢弃不确定性量化,自动排除不可信预测,将基于神经网络的莱姆病即时检测灵敏度由 88.2% 提升至 95.7%
通过量化不确定性优化掩码扩散模型中的解码路径
Optimizing Decoding Paths in Masked Diffusion Models by Quantifying Uncertainty
首次提出去噪熵量化掩码扩散模型解码路径不确定性,据此优化路径显著提升复杂任务生成质量
在动力学阻挫体系中可调谐实现平带与例外点:以非厄米 Creutz 梯子为例
Tunably realizing flat-bands and exceptional points in kinetically frustrated systems: An example on the non-Hermitian Creutz ladder
非厄米 Creutz 梯子中通过非互易跃迁实现了可调谐平带与异常点,揭示开边界特有的三重结点相图和异常平带
LongVideoAgent:基于长视频的多智能体推理
LongVideoAgent: Multi-Agent Reasoning with Long Videos
提出一个多智能体框架,以强化学习训练主智能体协调定位和视觉智能体,在长视频问答上显著超越强基线
轨道磁化揭示多带拓扑
Orbital Magnetization Reveals Multiband Topology
发现轨道磁化响应可揭示多带欧拉拓扑不变量,为实验探测提供新方案
通过医生监督可扩展地增强任务基准的临床有效性
Scalably Enhancing the Clinical Validity of a Task Benchmark with Physician Oversight
发现该基准大量标签错误,提出医生监督的可扩展审核维护方法,修正后模型准确率绝对提升八点七个百分点
开放基础模型中视觉的对抗鲁棒性
Adversarial Robustness of Vision in Open Foundation Models
该研究首次系统评估开放 VLM 的视觉对抗鲁棒性,揭示 Llama 3.2 虽准确率低但抗攻击性能降幅更小,证实鲁棒性与基准无关
Re-Depth Anything:基于自监督重光照的测试时深度精化
Re-Depth Anything: Test-Time Depth Refinement via Self-Supervised Re-lighting
利用重照明和扩散模型先验自监督细化 Depth Anything V2 的深度预测,冻结编码器只更新嵌入与解码器以提升真实感与精度
探索与利用:通过裁剪、熵和虚假奖励重新思考 RLVR
Exploration v.s. Exploitation: Rethinking RLVR through Clipping, Entropy, and Spurious Reward
该研究揭示裁剪偏差降低策略熵以提升确定性,并通过奖励错位模型阐明虚假奖励增益,在 Llama 与 QwQ 上验证,推翻增益仅由污染所致的观点,统一探索与利用矛盾
后验行为克隆:预训练 BC 策略以实现高效强化学习微调
Posterior Behavioral Cloning: Pretraining BC Policies for Efficient RL Finetuning
发现标准行为克隆预训练会因动作覆盖不足导致强化学习微调低效,提出后验行为克隆方法通过拟合行为后验分布确保覆盖,无需牺牲预训练性能即可极大改善微调效果
生成式对抗推理器:利用对抗强化学习增强大语言模型推理
Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning
该论文用对抗强化学习联合训练推理器与判别器生成步骤级奖励,大幅提升大模型数学推理能力
差异即关键:审计模型以发现并弥补能力差距
Differences That Matter: Auditing Models for Capability Gap Discovery and Rectification
该论文提出 AuditDM 框架,通过强化学习训练审计模型自动发现多模态大模型的能力鸿沟,并用曝光弱点微调模型,使 3B 模型性能超越 28B 模型
DVGT:驾驶视觉几何 Transformer
DVGT: Driving Visual Geometry Transformer
DVGT 从无位姿多视角图像端到端预测度量尺度全局稠密三维点云及自车位姿,无需几何先验或后对齐,在多个数据集性能领先
EasyV2V:一种高质量基于指令的视频编辑框架
EasyV2V: A High-quality Instruction-based Video Editing Framework
利用预训练文生视频模型的编辑能力,通过轻量微调与统一时空掩码实现支持文本、掩码和参考图的先进视频编辑
空头 18 腿 t-J 圆柱体上的大孤立条纹
Large Isolated Stripes on Short 18-leg $t$-$J$ Cylinders
通过计算宽 18 腿圆柱体上长孤立条纹划分出高低填充区以压缩空间模型和掺杂对结构解释追溯了条纹微观成因