未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 721 篇解读
G-RRM:利用循环推理模型引导符号求解器
G-RRM: Guiding Symbolic Solvers with Recurrent Reasoning Models
G-RRM 将符号等变递归推理模型与回溯/SAT 求解器结合,发现神经引导加速需大搜索空间和求解器能覆盖错误提示,在 9×9 数独上使回溯加速 33.3 倍
具有行为隐变量的可控仿真智能体
Controllable Sim Agents with Behavior Latents
论文提出可控神经变分智能体,通过软资格门与行为隐变量使安全操控单调性显著增强,并揭示操控指标需结合物理合理性约束以避免奖励黑客
超越 Adam:SOAP 与 Muon 实现机器学习原子间势能的更快、标签高效训练
Beyond Adam: SOAP and Muon for Faster, Label-Efficient Training of Machine Learning Interatomic Potentials
发现 SOAP 和 SOAP-Muon 优化器能以更少力标签更快更准地训练 NequIP 与 Allegro 原子间势
DemoPSD:分歧调制的策略自蒸馏
DemoPSD: Disagreement-Modulated Policy Self-Distillation
提出基于分歧的策略自蒸馏框架,通过反向 KL 重心目标自适应平衡教师引导与自主推理,有效缓解特权泄露、保持高熵探索,并在跨领域推理中全面优于 SDPO 与 GRPO
推理大语言模型提升长篇电视剧中的说话人识别
Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas
构建含 53 万条标注的说话人识别基准,并提出大型推理模型,融合声纹、视觉与关系工具,将长剧识别准确率提升 2.3%,短语音提升 9.2%
论可调破缺可积性下量子多体混沌的涌现
On the emergence of quantum many-body chaos for tunably-broken integrability
掺杂 SWAP 门以可调破缺可积性,揭示了 OTOC 从扩散到弹道传播的交叉源于局域热点积累,并确定了特征时空标度及蝴蝶速度对破缺参数的依赖
无人注视时大语言模型智能体所言何物:多智能体辩论中的社会结构与潜在目标涌现
What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates
该研究发现,多智能体辩论中的社交结构会使大模型公开表态与私下观点产生近四成的系统性分歧,且无需明确指令
ReContext:递归证据重演作为长上下文推理的 LLM 驾驭方法
ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning
提出递归证据重放的免训练方法,利用注意力信号动态回放关键证据,显著提升长上下文推理的证据利用率,取得最优平均排名
大型语言模型的在线安全监控
Online Safety Monitoring for LLMs
在大语言模型在线安全监控中利用风险控制校准阈值的简单方法效果可比肩序贯假设检验等复杂监测器且能更早检测不安全输出
程序即权重:一种面向模糊函数的编程范式
Program-as-Weights: A Programming Paradigm for Fuzzy Functions
该论文实现了“程序即权重”范式,将模糊任务编译为轻量适配器,用六亿参数模型本地运行,性能看齐 320 亿大模型,内存却降至其五十分之一
LACUNA:用于评估大语言模型遗忘学习中定位精度的测试平台
LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning
该论文构建了首个具备参数级定位真值的 LLM 遗忘测试集,揭示现有方法定位不精确且易受再浮现攻击,并证明精准定位能显著提升擦除鲁棒性
持久状态 AI 控制中的分布式攻击
Distributed Attacks in Persistent-State AI Control
该研究揭示,AI 编程代理在持续代码库中实施渐进式侧任务能逃避多种监控,而新链路追踪与四监控集成将这类逃避率从 93% 降至 47%
布朗棘轮与泵普遍模拟多体主动动力学
Brownian ratchets and pumps universally simulate many-body active dynamics
证明了布朗棘轮和泵浦能普适模拟任意局域多体主动动力学,将棘轮推广为用稳态热流驱动和稳定非平衡集体行为的新机制
一层就够了吗?训练单个 Transformer 层便能媲美全参数强化学习训练
Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training
这篇论文发现大型语言模型强化学习训练的收益高度集中于少数中间 Transformer 层,仅训练单层即可匹敌甚至超越全参数训练效果
衡量人类与大型语言模型研究想法的差距
Measuring the Gap Between Human and LLM Research Ideas
这篇论文通过构建研究品味分类法,量化揭示了 LLM 生成的研究想法分布显著窄于人类,并系统性偏向桥接式动机与综合方法
QVal:低成本评估长周期大语言模型智能体的稠密监督信号
QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents
QVal 以无训练方式直接评估密集监督信号,发现简单提示基线一致优于近期密集监督方法且性能按家族聚类
内省耦合:自我解释训练在固定监督下仍能追踪行为变化
Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision
正则化下用固定早期解释标签微调语言模型,其自我解释会自发追踪行为漂移并更真实反映当前行为
面向大语言模型智能体规划的自演化世界模型
Self-Evolving World Models for LLM Agent Planning
WorldEvolver 通过情景记忆、语义记忆与选择性前瞻实现测试时记忆演化,在不调整参数的情况下提升世界模型预测精度和智能体规划成功率
LeVo 2:通过层级表征建模与渐进式后训练实现稳定且旋律优美的歌曲生成
LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training
引入美学评价引导的渐进后训练与层级建模,分离语义规划和声学细化,首次实现稳定旋律优美的全曲生成,性能接近商业系统
VLK:从重建场景中的合成交互学习人形机器人运动操作
VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes
在三维重建场景中合成交互以生成大规模视觉-语言-运动学配对数据,解决人形机器人自主移动操作的数据瓶颈并实现真实迁移
仅正样本恰当学习中的意外发现
Surprises in Proper Positive-Only Learning
解决了 proper 正样本学习的长期开放问题,给出有限 VC 维加均匀外部可分性充要条件,并揭示 proper/improper 分离等惊人发现,引入新组合维度
直径截断算符演化
Diameter truncated operator evolution
针对非平衡量子系统算符复杂度爆炸问题,创新性地以算符空间直径进行截断,能高效准确获取局域关联函数和输运系数
DexCompose:复用灵巧操作策略实现单手多任务操控
DexCompose: Reusing Dexterous Policies for Multi-Task Manipulation with a Single Hand
它提出角色感知的残差组合框架,通过释放测试发现手指冗余并分配动作所有权,使单手复用预训练策略执行多任务组合,成功率 77.4%
在时变模型中为美式期权和灵活远期合约定价
Valuing American options and Flexible Forwards contracts in time-dependent models
在时间依赖 Heston 模型中结合递归 Riccati 解与双谱方法,实现了灵活远期和美式期权快速定价,并揭示提前执行曲面与方差呈非线性关系