未来已来,只是尚未均匀分布

每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。

已收录 721 篇解读

553

带多时间窗的多隔间车辆路径问题的滚动空间分支定价算法

A Rolling-Space Branch-and-Price Algorithm for the Multi-Compartment Vehicle Routing Problem with Multiple Time Windows

提出滚动空间分支定价算法并融合聚类,首次精确求解多隔间多时间窗车辆路径问题,成功应对大规模工业实例

arXiv: 2601.16194v1

554

通过特征空间平滑实现多模态大语言模型的可证明鲁棒性

Provable Robustness in Multimodal Large Language Models via Feature Space Smoothing

该论文通过特征空间平滑实现多模态大语言模型可认证特征鲁棒性并将攻击成功率从近九成降至约一成

arXiv: 2601.16200v1

555

反事实训练:教会模型合理且可操作的解释

Counterfactual Training: Teaching Models Plausible and Actionable Explanations

提出反事实训练,直接在训练中最小化表征与合理可操作解释的差异,让模型内生地生成符合分布且可执行的反事实解释,并提高对抗鲁棒性

arXiv: 2601.16205v1

556

LLM-in-Sandbox 激发通用智能体智能

LLM-in-Sandbox Elicits General Agentic Intelligence

让大语言模型在代码沙盒中自主探索,无需训练即广泛泛化于数学、物理、化学等非代码领域并显著提升性能

arXiv: 2601.16206v1

557

PyraTok:面向视频理解与生成的语言对齐金字塔式分词器

PyraTok: Language-Aligned Pyramidal Tokenizer for Video Understanding and Generation

PyraTok 凭借语言对齐金字塔量化与大码书,首次实现零样本视频分割最优,在多项视频生成与理解任务上均达最优

arXiv: 2601.16210v1

558

为什么我打不开抽屉?缓解零样本组合动作识别中的物体驱动捷径

Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition

揭示对象驱动捷径是零样本组合动作识别的主要失败模式,并提出 RCORE 框架通过组合增强与时间正则化消除该捷径

arXiv: 2601.16211v1

559

重新思考面向具身世界的视频生成模型

Rethinking Video Generation Model for the Embodied World

该论文建立了首个机器人视频生成细粒度基准 RBench 并发布最大开源数据集 RoVid-X,揭示了现有模型在物理真实性上的严重不足

arXiv: 2601.15282v1

560

迭代优化提升组合图像生成

Iterative Refinement Improves Compositional Image Generation

这篇论文提出迭代精炼策略,通过视觉语言模型反馈逐步校正,使组合图像生成准确率比并行采样提升百分之十六点九

arXiv: 2601.15286v1

561

Jet-RL:通过统一训练与推演精度流实现同策略 FP8 强化学习

Jet-RL: Enabling On-Policy FP8 Reinforcement Learning with Unified Training and Rollout Precision Flow

发现 BF16 训练与 FP8 rollout 的数位不匹配导致训练不稳定,提出 Jet-RL 框架以统一 FP8 精度流实现同策略训练,消除长 rollout 精度崩溃,并取得 33-41% 加速与稳定收敛

arXiv: 2601.14243v1

562

VideoMaMa:利用生成先验的掩码引导视频抠图

VideoMaMa: Mask-Guided Video Matting via Generative Prior

VideoMaMa 利用视频扩散先验从分割掩码生成精确 alpha 抠图,实现零样本真实视频泛化,并通过构建大规模伪标注数据集 MA-V,使 SAM2 在野视频抠图鲁棒性显著提升

arXiv: 2601.14255v1

563

MetaboNet:用于 1 型糖尿病管理的最大公开可用整合数据集

MetaboNet: The Largest Publicly Available Consolidated Dataset for Type 1 Diabetes Management

整合多公开数据集打造最大规模一型糖尿病管理基准,提供标准化连续血糖与胰岛素数据以增强算法泛化性

arXiv: 2601.11505v1

564

ShapeR:基于随意拍摄的鲁棒条件三维形状生成

ShapeR: Robust Conditional 3D Shape Generation from Casual Captures

提出了一种从随意拍摄序列中鲁棒生成完整 3D 形状的方法,它融合 SLAM 点云、多视角图像与字幕,通过整流流 Transformer 和课程学习,在真实杂乱场景中将重建精度提升 2.7 倍

arXiv: 2601.11514v1

565

为 Gemini 构建可用于生产环境的探针

Building Production-Ready Probes For Gemini

发现现有探针难以应对长上下文生产分布偏移,通过设计 Multimax 架构与多样化训练结合提示分类器,实现低成本高精度滥用检测,并已部署于 Gemini

arXiv: 2601.11516v1

566

解释能否在大型推理模型间泛化?

Do explanations generalize across large reasoning models?

发现大型推理模型思维链解释能跨模型泛化,提升回答一致性,且一致性与人类偏好、RL 训练相关,提出句子级集成方法增强泛化

arXiv: 2601.11517v1

567

分布式感知机在有界陈旧性、部分参与和噪声通信下的表现

Distributed Perceptron under Bounded Staleness, Partial Participation, and Noisy Communication

提出陈旧桶填充聚合,让在有界延迟、部分参与和通信噪声下的分布式感知机错误界仅取决于平均陈旧度且噪声项按轮数平方根增长

arXiv: 2601.10705v1

568

看得更少,驾驶更好:通过基础模型随机补丁选择实现可泛化的端到端自动驾驶

See Less, Drive Better: Generalizable End-to-End Autonomous Driving via Foundation Models Stochastic Patch Selection

该工作发现视觉补丁特征高度冗余,进而提出随机丢弃部分补丁的 SPS 方法,使策略学习稳健表征,将闭环成功率平均提升 6.2% 且推理提速 2.4 倍,并可零调参部署至实车

arXiv: 2601.10707v1

569

基于扩散的高精度无维度依赖采样

High-accuracy and dimension-free sampling with diffusions

这篇论文提出了首个高精度扩散采样器,将迭代复杂度从多项式降至多重对数,且维度依赖性仅通过目标分布的支撑半径体现

arXiv: 2601.10708v1

570

MatchTIR:基于二分匹配的工具集成推理细粒度监督

MatchTIR: Fine-Grained Supervision for Tool-Integrated Reasoning via Bipartite Matching

MatchTIR 通过二部图匹配将信用分配转化为细粒度轮级奖励,使 4B 模型在长程多轮任务中显著超越多数 8B 模型

arXiv: 2601.10712v1

571

面向 qLDPC 码的量子麦克斯韦擦除解码器

Quantum Maxwell Erasure Decoder for qLDPC codes

提出适用于 CSS qLDPC 码的量子麦克斯韦擦除解码器,以猜测预算实现复杂度与性能可调,线性时间逼近最大似然,并给出理论保证和实验验证

arXiv: 2601.10713v1

572

DInf-Grid:一种基于可微特征网格的神经微分方程求解器

DInf-Grid: A Neural Differential Equation Solver with Differentiable Feature Grids

提出可微分特征网格与径向基插值结合,使网格表示能求解微分方程,训练快 5-20 倍且精度相当

arXiv: 2601.10715v1

573

面向 Transformer 语言模型的值感知数值表示

Value-Aware Numerical Representations for Transformer Language Models

通过为数值添加值感知前缀 Token 并将嵌入显式绑定数值大小有效提升了 Transformer 算术鲁棒性并优于基线

arXiv: 2601.09706v1

574

Fast-ThinkAct:通过可言语化的潜在规划实现高效的视觉-语言-动作推理

Fast-ThinkAct: Efficient Vision-Language-Action Reasoning via Verbalizable Latent Planning

利用可语言化潜在规划将冗长思维链蒸馏为紧凑连续表示,大幅降低视觉语言动作推理延迟同时保持高性能

arXiv: 2601.09708v1

575

视频生成的运动归因

Motion Attribution for Video Generation

提出了首个视频生成模型运动归因框架 MOTIVE,能定位影响运动的训练片段并指导数据筛选以提升时间一致性与物理合理性

arXiv: 2601.08828v1

576

在 Elo 排名评审系统中建模 LLM 智能体评审员动态

Modeling LLM Agent Reviewer Dynamics in Elo-Ranked Review System

在模拟会议论文评审中引入 Elo 评分能提升决策准确率,却暴露评审者投机策略而不提升努力

arXiv: 2601.08829v1