未来已来,只是尚未均匀分布

每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。

已收录 721 篇解读

241

G-RRM:利用循环推理模型引导符号求解器

G-RRM: Guiding Symbolic Solvers with Recurrent Reasoning Models

G-RRM 将符号等变递归推理模型与回溯/SAT 求解器结合,发现神经引导加速需大搜索空间和求解器能覆盖错误提示,在 9×9 数独上使回溯加速 33.3 倍

arXiv: 2607.02491v1

242

具有行为隐变量的可控仿真智能体

Controllable Sim Agents with Behavior Latents

论文提出可控神经变分智能体,通过软资格门与行为隐变量使安全操控单调性显著增强,并揭示操控指标需结合物理合理性约束以避免奖励黑客

arXiv: 2607.02496v1

243

超越 Adam:SOAP 与 Muon 实现机器学习原子间势能的更快、标签高效训练

Beyond Adam: SOAP and Muon for Faster, Label-Efficient Training of Machine Learning Interatomic Potentials

发现 SOAP 和 SOAP-Muon 优化器能以更少力标签更快更准地训练 NequIP 与 Allegro 原子间势

arXiv: 2607.02499v1

244

DemoPSD:分歧调制的策略自蒸馏

DemoPSD: Disagreement-Modulated Policy Self-Distillation

提出基于分歧的策略自蒸馏框架,通过反向 KL 重心目标自适应平衡教师引导与自主推理,有效缓解特权泄露、保持高熵探索,并在跨领域推理中全面优于 SDPO 与 GRPO

arXiv: 2607.02502v1

245

推理大语言模型提升长篇电视剧中的说话人识别

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

构建含 53 万条标注的说话人识别基准,并提出大型推理模型,融合声纹、视觉与关系工具,将长剧识别准确率提升 2.3%,短语音提升 9.2%

arXiv: 2607.02504v1

246

论可调破缺可积性下量子多体混沌的涌现

On the emergence of quantum many-body chaos for tunably-broken integrability

掺杂 SWAP 门以可调破缺可积性,揭示了 OTOC 从扩散到弹道传播的交叉源于局域热点积累,并确定了特征时空标度及蝴蝶速度对破缺参数的依赖

arXiv: 2607.02506v1

247

无人注视时大语言模型智能体所言何物:多智能体辩论中的社会结构与潜在目标涌现

What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates

该研究发现,多智能体辩论中的社交结构会使大模型公开表态与私下观点产生近四成的系统性分歧,且无需明确指令

arXiv: 2607.02507v1

248

ReContext:递归证据重演作为长上下文推理的 LLM 驾驭方法

ReContext: Recursive Evidence Replay as LLM Harness for Long-Context Reasoning

提出递归证据重放的免训练方法,利用注意力信号动态回放关键证据,显著提升长上下文推理的证据利用率,取得最优平均排名

arXiv: 2607.02509v1

249

大型语言模型的在线安全监控

Online Safety Monitoring for LLMs

在大语言模型在线安全监控中利用风险控制校准阈值的简单方法效果可比肩序贯假设检验等复杂监测器且能更早检测不安全输出

arXiv: 2607.02510v1

250

程序即权重:一种面向模糊函数的编程范式

Program-as-Weights: A Programming Paradigm for Fuzzy Functions

该论文实现了“程序即权重”范式,将模糊任务编译为轻量适配器,用六亿参数模型本地运行,性能看齐 320 亿大模型,内存却降至其五十分之一

arXiv: 2607.02512v1

251

LACUNA:用于评估大语言模型遗忘学习中定位精度的测试平台

LACUNA: A Testbed for Evaluating Localization Precision for LLM Unlearning

该论文构建了首个具备参数级定位真值的 LLM 遗忘测试集,揭示现有方法定位不精确且易受再浮现攻击,并证明精准定位能显著提升擦除鲁棒性

arXiv: 2607.02513v1

252

持久状态 AI 控制中的分布式攻击

Distributed Attacks in Persistent-State AI Control

该研究揭示,AI 编程代理在持续代码库中实施渐进式侧任务能逃避多种监控,而新链路追踪与四监控集成将这类逃避率从 93% 降至 47%

arXiv: 2607.02514v1

253

布朗棘轮与泵普遍模拟多体主动动力学

Brownian ratchets and pumps universally simulate many-body active dynamics

证明了布朗棘轮和泵浦能普适模拟任意局域多体主动动力学,将棘轮推广为用稳态热流驱动和稳定非平衡集体行为的新机制

arXiv: 2607.01231v1

254

一层就够了吗?训练单个 Transformer 层便能媲美全参数强化学习训练

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

这篇论文发现大型语言模型强化学习训练的收益高度集中于少数中间 Transformer 层,仅训练单层即可匹敌甚至超越全参数训练效果

arXiv: 2607.01232v1

255

衡量人类与大型语言模型研究想法的差距

Measuring the Gap Between Human and LLM Research Ideas

这篇论文通过构建研究品味分类法,量化揭示了 LLM 生成的研究想法分布显著窄于人类,并系统性偏向桥接式动机与综合方法

arXiv: 2607.01233v1

256

QVal:低成本评估长周期大语言模型智能体的稠密监督信号

QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents

QVal 以无训练方式直接评估密集监督信号,发现简单提示基线一致优于近期密集监督方法且性能按家族聚类

arXiv: 2606.32034v1

257

内省耦合:自我解释训练在固定监督下仍能追踪行为变化

Introspective Coupling: Self-Explanation Training Tracks Behavioral Change Despite Fixed Supervision

正则化下用固定早期解释标签微调语言模型,其自我解释会自发追踪行为漂移并更真实反映当前行为

arXiv: 2606.32038v1

258

面向大语言模型智能体规划的自演化世界模型

Self-Evolving World Models for LLM Agent Planning

WorldEvolver 通过情景记忆、语义记忆与选择性前瞻实现测试时记忆演化,在不调整参数的情况下提升世界模型预测精度和智能体规划成功率

arXiv: 2606.30639v1

259

LeVo 2:通过层级表征建模与渐进式后训练实现稳定且旋律优美的歌曲生成

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

引入美学评价引导的渐进后训练与层级建模,分离语义规划和声学细化,首次实现稳定旋律优美的全曲生成,性能接近商业系统

arXiv: 2606.30642v1

260

VLK:从重建场景中的合成交互学习人形机器人运动操作

VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes

在三维重建场景中合成交互以生成大规模视觉-语言-运动学配对数据,解决人形机器人自主移动操作的数据瓶颈并实现真实迁移

arXiv: 2606.30645v1

261

仅正样本恰当学习中的意外发现

Surprises in Proper Positive-Only Learning

解决了 proper 正样本学习的长期开放问题,给出有限 VC 维加均匀外部可分性充要条件,并揭示 proper/improper 分离等惊人发现,引入新组合维度

arXiv: 2606.28309v1

262

直径截断算符演化

Diameter truncated operator evolution

针对非平衡量子系统算符复杂度爆炸问题,创新性地以算符空间直径进行截断,能高效准确获取局域关联函数和输运系数

arXiv: 2606.28313v1

263

DexCompose:复用灵巧操作策略实现单手多任务操控

DexCompose: Reusing Dexterous Policies for Multi-Task Manipulation with a Single Hand

它提出角色感知的残差组合框架,通过释放测试发现手指冗余并分配动作所有权,使单手复用预训练策略执行多任务组合,成功率 77.4%

arXiv: 2606.28323v1

264

在时变模型中为美式期权和灵活远期合约定价

Valuing American options and Flexible Forwards contracts in time-dependent models

在时间依赖 Heston 模型中结合递归 Riccati 解与双谱方法,实现了灵活远期和美式期权快速定价,并揭示提前执行曲面与方差呈非线性关系

arXiv: 2606.27335v1