未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 721 篇解读
价值梯度引导用于流匹配对齐
Value Gradient Guidance for Flow Matching Alignment
该方法将最优价值函数梯度与微调速度场匹配,实现流匹配模型在有限计算下高效且保留先验的对齐
通用权重子空间假说
The Universal Weight Subspace Hypothesis
通过逾千模型的大规模频谱分析,首次实证深度网络跨任务和初始化系统收敛至通用低维权重子空间
通过协作自对弈学习可调控的澄清策略
Learning Steerable Clarification Policies with Collaborative Self-play
它通过协同自我对弈训练出可调节的澄清策略,能依成本动态调整交互行为并泛化至未见成本值
SkillFactory:通过自蒸馏学习认知行为
SkillFactory: Self-Distillation For Learning Cognitive Behaviors
该工作通过自蒸馏让模型在没有强模型指导时学会认知技能,从而提升强化学习泛化能力与鲁棒性
Video4Spatial:通过上下文引导视频生成迈向视觉空间智能
Video4Spatial: Towards Visuospatial Intelligence with Context-Guided Video Generation
Video4Spatial 利用仅视频输入的视频扩散模型,通过上下文引导完成导航与物体定位,无需深度或位姿,证明了视觉空间智能
PPTArena:面向自主智能体 PowerPoint 编辑的基准评测
PPTArena: A Benchmark for Agentic PowerPoint Editing
该工作提出了直接编辑 PPT 的基准 PPTArena 与代理 PPTPilot,实现复杂编辑性能超 10 个百分点提升,并揭示文档级长周期编辑难题
一种用于最大熵强化学习的扩散模型框架
A Diffusion Model Framework for Maximum Entropy Reinforcement Learning
该工作将最大熵强化学习构造为扩散模型反向 KL 最小化问题,并推导出简单有效的 DiffSAC/DiffPPO/DiffWPO 算法,在连续控制任务上回报与样本效率超越原始方法
EfficientFlow:面向具身人工智能的高效等变流策略学习
EfficientFlow: Efficient Equivariant Flow Policy Learning for Embodied AI
提出高效流框架,将等变性引入流匹配策略,理论证明等变动作分布,并推导加速正则化损失,实现数据与推理效率双提升
ThetaEvolve:面向开放问题的测试时学习
ThetaEvolve: Test-time Learning on Open Problems
ThetaEvolve 首次让小型开源模型通过测试时强化学习在开放问题上刷新纪录,并证明模型内化了进化能力
行思合一:通过多轮交互在 LLM 中构建高效世界模型推理
Thinking by Doing: Building Efficient World Model Reasoning in LLMs via Multi-turn Interaction
该论文通过奖励缩放与交互频率退火使 LLM 在行动中内化世界模型,仅单轮交互即可完成原本需多轮的任务
具备生长与精炼多模态语义记忆的智能体学习者
Agentic Learner with Grow-and-Refine Multimodal Semantic Memory
提出 ViLoMem 双流记忆,分别编码视觉分心模式与逻辑推理错误,以增长精炼机制持续积累多模态知识,显著提升跨基准推理准确率并抑制重复错误
对称量子电路中全息涌现的规范理论
Holographically Emergent Gauge Theory in Symmetric Quantum Circuits
揭示对称量子电路的全息规范理论,证明电荷锐化与体解码互补,且 ZN 下 N≤4 直接相变而 N>4 出现库仑相
Matrix:点对点多智能体合成数据生成框架
Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework
Matrix 提出去中心化点对点多智能体合成数据框架,消除中心协调器,吞吐量提升 2 至 15 倍且质量不变
G²VLM:具有统一三维重建与空间推理的几何增强视觉语言模型
G$^2$VLM: Geometry Grounded Vision Language Model with Unified 3D Reconstruction and Spatial Reasoning
该模型通过统一三维重建与空间推理,让视觉语言模型原生学习几何特征,显著提升空间理解性能
ToolOrchestra:通过高效的模型与工具编排提升智能
ToolOrchestra: Elevating Intelligence via Efficient Model and Tool Orchestration
用强化学习结合结果、效率与用户偏好奖励,训练 8B 编排模型协调工具,在 HLE 上以 37.1% 得分和 2.5 倍效率超越 GPT-5,成本仅 30%
TraceGen:以三维轨迹空间进行世界建模实现跨具身视频学习
TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos
TraceGen 构建 3D 轨迹空间世界模型,统一异构人机视频为运动表征,仅需五个演示便实现 80% 成功率且推理速度提升五十至六百倍,还能用手机视频控制机器人
重访跨难度泛化:没那么容易
Revisiting Generalization Across Difficulty Levels: It's Not So Easy
通过数千模型与项目反应理论测定难度,系统评估表明跨难度泛化有限,单一难度训练不能全面一致提升,数据需涵盖全部难度
VDC-Agent:当视频详细描述生成器通过智能体自我反思实现自我进化
VDC-Agent: When Video Detailed Captioners Evolve Themselves via Agentic Self-Reflection
提出 VDC-Agent 自进化框架,靠自我反思闭环自动生成偏好数据且无需人工标注,微调 7B 模型在 VDC 基准上以 49.08% 准确率超越专用视频描述器并实现新 SOTA
分数陈绝缘体边缘:晶格效应与光学测量
Fractional Chern insulator edges: crystalline effects and optical measurements
量化分数 Chern 绝缘体晶格效应对边缘手征 Luttinger 理论的修正,并提出时间分辨光谱直接观测边缘指数和速度
提升外汇预测准确性:混合变量集在认知算法交易系统中的作用
Enhancing Forex Forecasting Accuracy: The Impact of Hybrid Variable Sets in Cognitive Algorithmic Trading Systems
通过融合基本面与技术混合特征,该论文发现技术变量对生成盈利外汇交易信号的预测能力优于宏观经济变量
推理的认知基础及其在大语言模型中的体现
Cognitive Foundations for Reasoning and Their Manifestation in LLMs
合成 28 种认知元素分类并分析 17 个模型 17 万条痕迹,发现模型依赖浅层正向链而缺乏元认知,据此开发的推理指导将复杂问题性能提升 60%
从智能眼镜中获得的灵巧性:基于自然场景人类演示的多指机器人操作
Dexterity from Smart Lenses: Multi-Fingered Robot Manipulation with In-the-Wild Human Demonstrations
利用 Aria Gen 2 眼镜捕获野外人类演示,AINA 框架学习 3D 点策略使多指手零样本直接执行日常任务
驯服长尾:基于自适应草案模型的高效推理强化学习训练
Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter
TLT 系统通过自适应推测解码在强化学习训练中动态对齐草稿模型,实现一点七倍以上端到端加速且精度无损
边思考边生成:文本推理贯穿视觉生成全过程
Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation
该论文首次提出边生成边思考框架,将文本推理交织于视觉生成全程,实现动态引导与反思,产生更符合上下文、语义更丰富的视觉效果