未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 721 篇解读
带多时间窗的多隔间车辆路径问题的滚动空间分支定价算法
A Rolling-Space Branch-and-Price Algorithm for the Multi-Compartment Vehicle Routing Problem with Multiple Time Windows
提出滚动空间分支定价算法并融合聚类,首次精确求解多隔间多时间窗车辆路径问题,成功应对大规模工业实例
通过特征空间平滑实现多模态大语言模型的可证明鲁棒性
Provable Robustness in Multimodal Large Language Models via Feature Space Smoothing
该论文通过特征空间平滑实现多模态大语言模型可认证特征鲁棒性并将攻击成功率从近九成降至约一成
反事实训练:教会模型合理且可操作的解释
Counterfactual Training: Teaching Models Plausible and Actionable Explanations
提出反事实训练,直接在训练中最小化表征与合理可操作解释的差异,让模型内生地生成符合分布且可执行的反事实解释,并提高对抗鲁棒性
LLM-in-Sandbox 激发通用智能体智能
LLM-in-Sandbox Elicits General Agentic Intelligence
让大语言模型在代码沙盒中自主探索,无需训练即广泛泛化于数学、物理、化学等非代码领域并显著提升性能
PyraTok:面向视频理解与生成的语言对齐金字塔式分词器
PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation
PyraTok 凭借语言对齐金字塔量化与大码书,首次实现零样本视频分割最优,在多项视频生成与理解任务上均达最优
为什么我打不开抽屉?缓解零样本组合动作识别中的物体驱动捷径
Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition
揭示对象驱动捷径是零样本组合动作识别的主要失败模式,并提出 RCORE 框架通过组合增强与时间正则化消除该捷径
重新思考面向具身世界的视频生成模型
Rethinking Video Generation Model for the Embodied World
该论文建立了首个机器人视频生成细粒度基准 RBench 并发布最大开源数据集 RoVid-X,揭示了现有模型在物理真实性上的严重不足
迭代优化提升组合图像生成
Iterative Refinement Improves Compositional Image Generation
这篇论文提出迭代精炼策略,通过视觉语言模型反馈逐步校正,使组合图像生成准确率比并行采样提升百分之十六点九
Jet-RL:通过统一训练与推演精度流实现同策略 FP8 强化学习
Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow
发现 BF16 训练与 FP8 rollout 的数位不匹配导致训练不稳定,提出 Jet-RL 框架以统一 FP8 精度流实现同策略训练,消除长 rollout 精度崩溃,并取得 33-41% 加速与稳定收敛
VideoMaMa:利用生成先验的掩码引导视频抠图
VideoMaMa: Mask-Guided Video Matting via Generative Prior
VideoMaMa 利用视频扩散先验从分割掩码生成精确 alpha 抠图,实现零样本真实视频泛化,并通过构建大规模伪标注数据集 MA-V,使 SAM2 在野视频抠图鲁棒性显著提升
MetaboNet:用于 1 型糖尿病管理的最大公开可用整合数据集
MetaboNet: The Largest Publicly Available Consolidated Dataset for Type 1 Diabetes Management
整合多公开数据集打造最大规模一型糖尿病管理基准,提供标准化连续血糖与胰岛素数据以增强算法泛化性
ShapeR:基于随意拍摄的鲁棒条件三维形状生成
ShapeR: Robust Conditional 3D Shape Generation from Casual Captures
提出了一种从随意拍摄序列中鲁棒生成完整 3D 形状的方法,它融合 SLAM 点云、多视角图像与字幕,通过整流流 Transformer 和课程学习,在真实杂乱场景中将重建精度提升 2.7 倍
为 Gemini 构建可用于生产环境的探针
Building Production-Ready Probes For Gemini
发现现有探针难以应对长上下文生产分布偏移,通过设计 Multimax 架构与多样化训练结合提示分类器,实现低成本高精度滥用检测,并已部署于 Gemini
解释能否在大型推理模型间泛化?
Do explanations generalize across large reasoning models?
发现大型推理模型思维链解释能跨模型泛化,提升回答一致性,且一致性与人类偏好、RL 训练相关,提出句子级集成方法增强泛化
分布式感知机在有界陈旧性、部分参与和噪声通信下的表现
Distributed Perceptron under Bounded Staleness, Partial Participation, and Noisy Communication
提出陈旧桶填充聚合,让在有界延迟、部分参与和通信噪声下的分布式感知机错误界仅取决于平均陈旧度且噪声项按轮数平方根增长
看得更少,驾驶更好:通过基础模型随机补丁选择实现可泛化的端到端自动驾驶
See Less, Drive Better: Generalizable End-to-End Autonomous Driving via Foundation Models Stochastic Patch Selection
该工作发现视觉补丁特征高度冗余,进而提出随机丢弃部分补丁的 SPS 方法,使策略学习稳健表征,将闭环成功率平均提升 6.2% 且推理提速 2.4 倍,并可零调参部署至实车
基于扩散的高精度无维度依赖采样
High-accuracy and dimension-free sampling with diffusions
这篇论文提出了首个高精度扩散采样器,将迭代复杂度从多项式降至多重对数,且维度依赖性仅通过目标分布的支撑半径体现
MatchTIR:基于二分匹配的工具集成推理细粒度监督
MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching
MatchTIR 通过二部图匹配将信用分配转化为细粒度轮级奖励,使 4B 模型在长程多轮任务中显著超越多数 8B 模型
面向 qLDPC 码的量子麦克斯韦擦除解码器
Quantum Maxwell Erasure Decoder for qLDPC codes
提出适用于 CSS qLDPC 码的量子麦克斯韦擦除解码器,以猜测预算实现复杂度与性能可调,线性时间逼近最大似然,并给出理论保证和实验验证
DInf-Grid:一种基于可微特征网格的神经微分方程求解器
DInf-Grid: A Neural Differential Equation Solver with Differentiable Feature Grids
提出可微分特征网格与径向基插值结合,使网格表示能求解微分方程,训练快 5-20 倍且精度相当
面向 Transformer 语言模型的值感知数值表示
Value-Aware Numerical Representations for Transformer Language Models
通过为数值添加值感知前缀 Token 并将嵌入显式绑定数值大小有效提升了 Transformer 算术鲁棒性并优于基线
Fast-ThinkAct:通过可言语化的潜在规划实现高效的视觉-语言-动作推理
Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning
利用可语言化潜在规划将冗长思维链蒸馏为紧凑连续表示,大幅降低视觉语言动作推理延迟同时保持高性能
视频生成的运动归因
Motion Attribution for Video Generation
提出了首个视频生成模型运动归因框架 MOTIVE,能定位影响运动的训练片段并指导数据筛选以提升时间一致性与物理合理性
在 Elo 排名评审系统中建模 LLM 智能体评审员动态
Modeling LLM Agent Reviewer Dynamics in Elo-Ranked Review System
在模拟会议论文评审中引入 Elo 评分能提升决策准确率,却暴露评审者投机策略而不提升努力