未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 722 篇解读
RefDecoder:通过条件视频解码增强视觉生成
RefDecoder: Enhancing Visual Generation with Conditional Video Decoding
该论文指出视频扩散模型中解码器缺乏参考条件会导致细节丢失与时间不一致,为此提出 RefDecoder,通过将高保真参考帧注入解码器的自注意力并设计潜码丢弃训练,使 PSNR 提升 2.1dB 且无需微调即可提升现有视频生成系统的质量与一致性
ATLAS:代理式还是潜在式视觉推理?一字足矣
ATLAS: Agentic or Latent Visual Reasoning? One Word is Enough for Both
ATLAS 用一个功能标记统一了代理式与潜在式视觉推理,避免生成中间图像且不改变标准训练,大幅提升推理性能
EntityBench:迈向实体一致的长程多镜头视频生成
EntityBench: Towards Entity-Consistent Long-Range Multi-Shot Video Generation
该工作为长序列多镜头视频生成构建了实体调度基准和三支柱评测,发现一致性随重现间隔退化,实体记忆方法大幅提升角色保真度
混合态中平移对称性强制的长程纠缠
Translation symmetry-enforced long-range entanglement in mixed states
该论文通过计数论证发现,平移对称性的零动量扇区无法由短程纠缠态张成,导致其强到弱自发对称破缺态必然是长程纠缠
维度约束下的混合态长程纠缠
Mixed-State Long-Range Entanglement from Dimensional Constraints
发现了平移对称下短程纠缠态子空间维度仅多项式增长而平移不变全空间指数增长导致最大混合态必然长程纠缠
EVA-Bench:一个用于评估语音智能体的新型端到端框架
EVA-Bench: A New End-to-end Framework for Evaluating Voice Agents
EVA-Bench 首创自动仿真校验与复合准确率及体验度量的语音助手评估框架,证明现有系统所有架构均无法同时在准确性和体验上超过 0.5,且峰值性能与可靠性严重背离,口音噪声暴露巨大鲁棒性差距
WARDEN:基于 6 小时训练数据的濒危原住民语言转录与翻译
WARDEN: Endangered Indigenous Language Transcription and Translation with 6 Hours of Training Data
仅用 6 小时数据,分离转录与翻译并借近似语言初始化及专家词典增强大模型,实现濒危语转录翻译,性能超越统一方法
AlphaGRPO:通过可分解验证奖励解锁统一多模态模型的自反思多模态生成能力
AlphaGRPO: Unlocking Self-Reflective Multimodal Generation in UMMs via Decompositional Verifiable Reward
AlphaGRPO 借助分解可验证奖励实现统一多模态模型自我反思生成,无需冷启动提升多项基准性能
用于基准测试的可扩展基于测量的量子模拟模式
Scalable Measurement-Based Quantum Simulation Patterns for Benchmarking
发布测量模式库,按泡利串交换子集组织可扩展模式,为基于测量的量子模拟提供标准化基准测试
ELF: 嵌入式语言流
ELF: Embedded Language Flows
ELF 提出在连续嵌入空间中进行流匹配扩散、仅在最终步离散化,以远少于离散方法的训练数据和采样步数实现了更优生成质量
三维被动自修正量子存储器
A passive self-correcting quantum memory in three dimensions
该论文首次构造出三维被动自校正量子存储器,可在非零温度下以指数时间存储量子比特
归一化轨迹模型
Normalizing Trajectory Models
NTM 以条件正态化流建模反向去噪步,实现四步生成并唯一保留轨迹精确似然,性能匹配甚至超越强基线
玻色系统中量子学习理论的研究进展
Advances in quantum learning theory with bosonic systems
总结了玻色连续变量系统的量子学习理论进展,揭示了非高斯态学习样本复杂度及高斯态测试方法与非高斯性影响
验证器支持的数学推理难题生成
Verifier-Backed Hard Problem Generation for Mathematical Reasoning
该论文提出 VHG 框架,以独立验证器评判问题正确性,结合求解器评分难度,从而生成有效且困难的数学问题,杜绝奖励黑客,性能大幅优于现有方法
BAMI:GUI 基础中无需训练的偏差缓解
BAMI: Training-Free Bias Mitigation in GUI Grounding
发现图形界面定位失败主要源于精度偏差与模糊偏差,并无需训练通过粗到精聚焦和候选选择有效提升多模型准确率
UniPool:面向混合专家模型的全局共享专家池
UniPool: A Globally Shared Expert Pool for Mixture-of-Experts
UniPool 用全局共享专家池替代逐层私有专家,证明专家参数无需随深度线性增长,以更少预算实现更低验证损失
久保-热化对应
The Kubo-Thermalization Correspondence
发现并实验证实了弱驱动下自旋的久保线性响应谱与长时热化磁化强度之间的精确对应关系
ActCam:面向视频生成的零样本联合摄像机与三维运动控制
ActCam: Zero-Shot Joint Camera and 3D Motion Control for Video Generation
ActCam 实现了零样本联合相机与三维角色动作控制,通过两阶段深度与姿势条件调度,无需训练即大幅提升大视角变化下的相机遵循度和动作保真度
驯服扩散 Transformer 中的离群词元
Taming Outlier Tokens in Diffusion Transformers
发现扩散生成模型中的异常令牌普遍存在于编码器和去噪器,提出双阶段寄存器方法,有效提升生成质量
最优链路层控制下的顺序与同时纠缠交换对比
Sequential vs. Simultaneous Entanglement Swapping under Optimal Link-Layer Control
该文通过固定最优链路层控制比较顺序与同时纠缠交换,发现当记忆相干时间与预告延迟比低于 25 时顺序协议完全失效,在 50 处开始恢复,证明其劣势源于当前存储极限而非协议本质
FTPrimitiveBench:面向硬件驱动和有偏噪声模型的逻辑计算基准测试套件
FTPrimitiveBench: A Benchmark Suite For Logical Computation Under Hardware-Motivated and Biased Noise Models
它构建了硬件噪声基准并揭示 Z 偏有益逻辑内存与晶格手术却恶化横向 Hadamard 表面码对非均匀噪声鲁棒
利用无监督机器学习检测欧洲区域统计中的结构性异常
Unsupervised Machine Learning for Detecting Structural Anomalies in European Regional Statistics
该论文用无监督机器学习从欧洲区域多指标中识别出结构异常,发现这些异常并非数据错误,而是反映值得政策关注的独特区域结构
SpecKV:基于压缩感知的γ选择自适应推测解码
SpecKV: Adaptive Speculative Decoding with Compression-Aware Gamma Selection
SpecKV 发现推测长度γ与模型压缩耦合,利用草稿模型置信度和熵实时自适应选择γ,较固定γ=4 的吞吐量提升 56%
持续视觉记忆:在 LVLMs 的深度生成中维持感知
Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs
提出持久视觉记忆模块 PVM,以并行分支直接检索视觉嵌入,有效缓解长文本下视觉信号稀释,在复杂推理任务上平均提升百分之四点八