未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 722 篇解读
SpatialClaw:重新思考代理空间推理的动作接口
SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning
通过采用持久化 Python 内核的逐步代码接口,使视觉语言模型能根据中间视觉和文本反馈动态组合工具并修正推理,在 20 个空间基准上准确率达 59.9%,超越现有方法 11.2 个百分点,且无需训练
Mana:铰接式工具的灵巧操作
Mana: Dexterous Manipulation of Articulated Tools
Mana 通过将灵巧操作重新诠释为动画问题,利用粗到细流水线实现铰接工具自主抓取与手中操作的零样本仿真到现实迁移
通过检索增强强化微调学习类比推理
Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning
提出 RA-RFT,通过金标准蒸馏训练检索器识别类比推理结构,再用强化微调让模型利用检索轨迹,在 AIME2025 上准确率提升 7.1 点
超冷玻色子的 Pfaffian 量子霍尔态
A Pfaffian quantum Hall state of ultracold bosons
首次利用超冷原子在光晶格中实现三粒子玻色子 Pfaffian 量子霍尔态并直接测量配对关联和输运响应
面向多轮对话生成的上下文驱动增量压缩
Context-Driven Incremental Compression for Multi-Turn Dialogue Generation
以检索-修改-写回循环维护线程级对话压缩记忆,在数百轮长对话中实现延迟与困惑度双稳定
重路由,而非移除:面向视觉语言模型的可恢复视觉词元路由
Reroute, Don't Remove: Recoverable Visual Token Routing for Vision-Language Models
提出可恢复路由将不可逆移除变为令牌延迟重入,在激进压缩下大幅提升接地能力且保持通用性能,无需训练
EEVEE:面向现实世界中自改进智能体的测试时提示词学习
EEVEE: Towards Test-time Prompt Learning in the Real World for Self-Improving Agents
提出了首个多数据集测试时提示学习框架,通过路由器与提示协同进化减少跨任务干扰,大幅提升异构流上的性能
通过目标分布设计实现监督微调的统一视角
A Unifying Lens on Supervised Fine-Tuning Through Target Distribution Design
提出将监督微调视为目标分布设计的统一视角,构建 Q 目标框架并据此开发 Target-SFT 方法,在多个推理任务上优于现有变体
何时对齐,何时预测:多模态学习的相图
When to Align, When to Predict: A Phase Diagram for Multimodal Learning
通过分离比率构建对齐与预测的相图,将多模态任务划分为四个恢复区域,并设计出无需跨模态训练即可诊断每个数据集最佳策略的实用方法
重新思考大语言模型强化学习中的散度正则化
Rethinking the Divergence Regularization in LLM RL
提出散度正则化策略优化,以平滑二次正则替代硬掩码,保持信任域并提供连续梯度校正,提升大模型强化学习的稳定性与效率
一种代理权转移的无模型策略增强技术
An Agency-Transferring Model-Free Policy Enhancement Technique
通过代理转移机制将次优基线策略嵌入强化学习,训练出超越基线且最终无需基线的独立策略,并保证全程高目标达成率
OmniGameArena:一个面向 VLM 游戏智能体的统一 UE5 基准,具备改进动力学
OmniGameArena: A Unified UE5 Benchmark for VLM Game Agents with Improvement Dynamics
构建了 12 款 UE5 游戏的统一基准及改进动态曲线框架,揭示多轮反思使模型提升但峰值未必终轮,且任务迁移性可能背离
面向任务无关持续学习的稀疏子空间至专家共享
Sparse Subspace-to-Expert Sharing for Task-Agnostic Continual Learning
SETA 通过稀疏子空间专家分解分离任务特定与共享知识,借助自适应弹性锚定和路由正则化实现任务不可知的持续学习,显著缓解遗忘
MemDreamer:通过层次图记忆与代理检索机制解耦感知与推理的长视频理解
MemDreamer: Decoupling Perception and Reasoning for Long Video Understanding via Hierarchical Graph Memory and Agentic Retrieval Mechanism
MemDreamer 通过解耦感知与推理并构建层次图记忆与代理检索,将长视频推理上下文压缩至全量的 2% 并获得 12.5 点精度提升
当掷骰子时,大型语言模型的可靠性如何?
How reliable are LLMs when it comes to playing dice?
揭示大型语言模型在反直觉概率问题上准确率大幅下降,并存在表述偏差和谄媚行为,导致系统推理错误
纳米腔薄片中的室温相干偶极子同步
Coherent room-temperature dipole synchronization in nanocavity sheets
该研究在室温下利用自组装纳米间隙阵列实现了偶极子的空间同步相干,而时间相干性极短,开拓了耗散耦合系统新平台。
TempoVLA:学习速度可控的视觉-语言-动作策略
TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies
通过变速度轨迹增强和速度条件注入,让单个 VLA 首次实现显式双向执行速度控制,无需额外数据
Code2LoRA:面向软件演化的代码语言模型超网络生成适配器
Code2LoRA: Hypernetwork-Generated Adapters for Code Language Models under Software Evolution
提出超网络动态生成仓库特定 LoRA 适配器,实现零推理开销注入代码知识并首次随代码提交演化,精度匹配逐库微调
HANDOFF:基于蒸馏互补教师的人形智能体任务空间全身控制
HANDOFF: Humanoid Agentic Task-Space Whole-Body Control via Distilled Complementary Teachers
HANDOFF 利用多教师知识蒸馏与混合专家,构建可接受 10 维任务空间命令的人形机器人全身控制器,首次无需任何任务数据或微调即由 VLM 规划器驱动完成语言操作
TailLoR:参数高效持续学习中的主成分保护
TailLoR: Protecting Principal Components in Parameter-Efficient Continual Learning
它通过软频谱惩罚在参数高效持续学习中保护预训练权重主成分,将低秩更新导向奇异值尾部以避免灾难性遗忘
想象力感知词元增强多模态语言模型的空间推理
Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models
提出想象感知令牌作为中间表征,让模型预测未观察的空间视角,在视角转换等任务中提升空间推理精度
神经元群体随规模增长呈现选择性分化
Neuron Populations Exhibit Divergent Selectivity with Scale
这篇论文发现了 Rosetta 神经元数量随模型规模呈次线性幂律增长,且出现神经元极化效应:这些共享神经元变得更单语义、选择性和领域专业化
通过感知扰动与奖励建模缓解多模态 LLM 评判中的感知判断偏差
Mitigating Perceptual Judgment Bias in Multimodal LLM-as-a-Judge via Perceptual Perturbation and Reward Modeling
揭示并缓解了多模态 LLM 法官的感知判断偏见,通过感知扰动数据集和可验证排序奖励训练出视觉可靠的评估器
孪生相:无隐藏对称性破缺的相变
Twin Phases: Phase Transitions Without Hidden Symmetry Breaking
论文提出孪生相概念,揭示其相变无需自发对称性破缺,即使部分规范对称性后也无隐藏破缺,是内禀超越朗道的相变