未来已来,只是尚未均匀分布

每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。

已收录 722 篇解读

361

RefDecoder:通过条件视频解码增强视觉生成

RefDecoder: Enhancing Visual Generation with Conditional Video Decoding

该论文指出视频扩散模型中解码器缺乏参考条件会导致细节丢失与时间不一致,为此提出 RefDecoder,通过将高保真参考帧注入解码器的自注意力并设计潜码丢弃训练,使 PSNR 提升 2.1dB 且无需微调即可提升现有视频生成系统的质量与一致性

arXiv: 2605.15196v1

362

ATLAS:代理式还是潜在式视觉推理?一字足矣

ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both

ATLAS 用一个功能标记统一了代理式与潜在式视觉推理,避免生成中间图像且不改变标准训练,大幅提升推理性能

arXiv: 2605.15198v1

363

EntityBench:迈向实体一致的长程多镜头视频生成

EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation

该工作为长序列多镜头视频生成构建了实体调度基准和三支柱评测,发现一致性随重现间隔退化,实体记忆方法大幅提升角色保真度

arXiv: 2605.15199v1

364

混合态中平移对称性强制的长程纠缠

Translation symmetry-enforced long-range entanglement in mixed states

该论文通过计数论证发现,平移对称性的零动量扇区无法由短程纠缠态张成,导致其强到弱自发对称破缺态必然是长程纠缠

arXiv: 2605.15200v1

365

维度约束下的混合态长程纠缠

Mixed-State Long-Range Entanglement from Dimensional Constraints

发现了平移对称下短程纠缠态子空间维度仅多项式增长而平移不变全空间指数增长导致最大混合态必然长程纠缠

arXiv: 2605.15201v1

366

EVA-Bench:一个用于评估语音智能体的新型端到端框架

EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents

EVA-Bench 首创自动仿真校验与复合准确率及体验度量的语音助手评估框架,证明现有系统所有架构均无法同时在准确性和体验上超过 0.5,且峰值性能与可靠性严重背离,口音噪声暴露巨大鲁棒性差距

arXiv: 2605.13841v1

367

WARDEN:基于 6 小时训练数据的濒危原住民语言转录与翻译

WARDEN: Endangered Indigenous Language Transcription and Translation with 6 Hours of Training Data

仅用 6 小时数据,分离转录与翻译并借近似语言初始化及专家词典增强大模型,实现濒危语转录翻译,性能超越统一方法

arXiv: 2605.13846v1

368

AlphaGRPO:通过可分解验证奖励解锁统一多模态模型的自反思多模态生成能力

AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward

AlphaGRPO 借助分解可验证奖励实现统一多模态模型自我反思生成,无需冷启动提升多项基准性能

arXiv: 2605.12495v1

369

用于基准测试的可扩展基于测量的量子模拟模式

Scalable Measurement-Based Quantum Simulation Patterns for Benchmarking

发布测量模式库,按泡利串交换子集组织可扩展模式,为基于测量的量子模拟提供标准化基准测试

arXiv: 2605.12502v1

370

ELF: 嵌入式语言流

ELF: Embedded Language Flows

ELF 提出在连续嵌入空间中进行流匹配扩散、仅在最终步离散化,以远少于离散方法的训练数据和采样步数实现了更优生成质量

arXiv: 2605.10938v1

371

三维被动自修正量子存储器

A passive self-correcting quantum memory in three dimensions

该论文首次构造出三维被动自校正量子存储器,可在非零温度下以指数时间存储量子比特

arXiv: 2605.10943v1

372

归一化轨迹模型

Normalizing Trajectory Models

NTM 以条件正态化流建模反向去噪步,实现四步生成并唯一保留轨迹精确似然,性能匹配甚至超越强基线

arXiv: 2605.08078v1

373

玻色系统中量子学习理论的研究进展

Advances in quantum learning theory with bosonic systems

总结了玻色连续变量系统的量子学习理论进展,揭示了非高斯态学习样本复杂度及高斯态测试方法与非高斯性影响

arXiv: 2605.08082v1

374

验证器支持的数学推理难题生成

Verifier-Backed Hard Problem Generation for Mathematical Reasoning

该论文提出 VHG 框架,以独立验证器评判问题正确性,结合求解器评分难度,从而生成有效且困难的数学问题,杜绝奖励黑客,性能大幅优于现有方法

arXiv: 2605.06660v1

375

BAMI:GUI 基础中无需训练的偏差缓解

BAMI: Training-Free Bias Mitigation in GUI Grounding

发现图形界面定位失败主要源于精度偏差与模糊偏差,并无需训练通过粗到精聚焦和候选选择有效提升多模型准确率

arXiv: 2605.06664v1

376

UniPool:面向混合专家模型的全局共享专家池

UniPool: A Globally Shared Expert Pool for Mixture-of-Experts

UniPool 用全局共享专家池替代逐层私有专家,证明专家参数无需随深度线性增长,以更少预算实现更低验证损失

arXiv: 2605.06665v1

377

久保-热化对应

The Kubo-Thermalization Correspondence

发现并实验证实了弱驱动下自旋的久保线性响应谱与长时热化磁化强度之间的精确对应关系

arXiv: 2605.06666v1

378

ActCam:面向视频生成的零样本联合摄像机与三维运动控制

ActCam: Zero-Shot Joint Camera and 3D Motion Control for Video Generation

ActCam 实现了零样本联合相机与三维角色动作控制,通过两阶段深度与姿势条件调度,无需训练即大幅提升大视角变化下的相机遵循度和动作保真度

arXiv: 2605.06667v1

379

驯服扩散 Transformer 中的离群词元

Taming Outlier Tokens in Diffusion Transformers

发现扩散生成模型中的异常令牌普遍存在于编码器和去噪器,提出双阶段寄存器方法,有效提升生成质量

arXiv: 2605.05206v1

380

最优链路层控制下的顺序与同时纠缠交换对比

Sequential vs. Simultaneous Entanglement Swapping under Optimal Link-Layer Control

该文通过固定最优链路层控制比较顺序与同时纠缠交换,发现当记忆相干时间与预告延迟比低于 25 时顺序协议完全失效,在 50 处开始恢复,证明其劣势源于当前存储极限而非协议本质

arXiv: 2605.04047v1

381

FTPrimitiveBench:面向硬件驱动和有偏噪声模型的逻辑计算基准测试套件

FTPrimitiveBench: A Benchmark Suite For Logical Computation Under Hardware-Motivated and Biased Noise Models

它构建了硬件噪声基准并揭示 Z 偏有益逻辑内存与晶格手术却恶化横向 Hadamard 表面码对非均匀噪声鲁棒

arXiv: 2605.04049v1

382

利用无监督机器学习检测欧洲区域统计中的结构性异常

Unsupervised Machine Learning for Detecting Structural Anomalies in European Regional Statistics

该论文用无监督机器学习从欧洲区域多指标中识别出结构异常,发现这些异常并非数据错误,而是反映值得政策关注的独特区域结构

arXiv: 2605.02884v1

383

SpecKV:基于压缩感知的γ选择自适应推测解码

SpecKV: Adaptive Speculative Decoding with Compression-Aware Gamma Selection

SpecKV 发现推测长度γ与模型压缩耦合,利用草稿模型置信度和熵实时自适应选择γ,较固定γ=4 的吞吐量提升 56%

arXiv: 2605.02888v1

384

持续视觉记忆:在 LVLMs 的深度生成中维持感知

Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs

提出持久视觉记忆模块 PVM,以并行分支直接检索视觉嵌入,有效缓解长文本下视觉信号稀释,在复杂推理任务上平均提升百分之四点八

arXiv: 2605.00814v1