未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 722 篇解读
Lumos-Nexus:面向视频统一模型的同质潜在空间高效频率桥接
Lumos-Nexus: Efficient Frequency Bridging with Homogeneous Latent Space for Video Unified Models
通过共享潜在空间训练轻量生成器,并以频率桥接在推理时移交大模型,实现了无需训练大生成器的高保真视频推理生成
LLMSurgeon:诊断大语言模型的数据混合
LLMSurgeon: Diagnosing Data Mixture of Large Language Models
提出数据混合手术框架,用软混淆矩阵从生成文本逆推出预训练数据领域混合比例,无需访问训练数据
DynaFLIP:经由三模态动态引导的表征重新思考机器人感知
DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation
DynaFLIP 通过三模态预训练注入动态感知,使视觉编码器聚焦操控关键区域,机器人泛化性能显著提升,分布外任务成功率提高 22.5%
VideoMLA:面向分钟级自回归视频扩散的低秩潜变量 KV 缓存
VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion
VideoMLA 用共享低秩潜变量替代视频扩散中的逐头键值缓存,使每词元缓存减少 92.7%,并证明瓶颈而非预训练谱决定有效秩
物理即一切?物理学家监督人工智能开发科学软件的案例研究
Physics Is All You Need? A Case Study in Physicist-Supervised AI Development of Scientific Software
通过物理学家监督 AI 编码的案例,表明监督协议而非模型能力决定科学代码的可信度,并给出三项关键实践
一种将二维材料耦合到共焦多模光学腔的低温装置
A cryogenic apparatus for coupling two-dimensional materials to a confocal multimode optical cavity
构建了一个低温超高真空装置,可将二维材料精确耦合到共焦多模光学腔,毫米级腔长下仍能大幅增强光与物质相互作用
PEFT-Arena:从稳定性-可塑性视角理解参数高效微调
PEFT-Arena: Understanding Parameter-Efficient Finetuning from a Stability-Plasticity Perspective
从稳定-可塑性权衡角度构建 PEFT-Arena 基准,发现正交微调在适应能力与通用知识保留间获得最佳帕累托前沿
招聘中的算法单一文化
Algorithmic Monocultures in Hiring
首次实证分析单一算法供应商的招聘筛选数据,揭示算法同质化导致特定种族遭受不利影响和个体反复被拒
MobileGym:面向移动 GUI 智能体研究的可验证高度并行仿真平台
MobileGym: A Verifiable and Highly Parallel Simulation Platform for Mobile GUI Agent Research
它构建了浏览器端轻量级移动 GUI 模拟平台,以结构化状态实现确定性评估与数百并行实例,使在线 RL 训练增益在真机保留 95.1%
SkillOpt:自进化智能体技能的执行策略
SkillOpt: Executive Strategy for Self-Evolving Agent Skills
SkillOpt 首次将智能体技能文档转化为可训练外部状态,通过结构化编辑与验证门控实现稳定优化,在全部 52 项评估中均达最佳或并列最佳,准确率平均提升超 23 个百分点
在量子开关变为因果确定之前,可以对多少个系统进行退相干?
How many systems can be dephased before the quantum switch becomes causally definite?
揭示在含全局过去未来的过程中,只要任意一个非未来系统保持相干,因果非分离性就不会消失;而所有系统均退相或仅未来系统相干,则过程必为因果可分离
铭记好奇:用于 3D 探索的情景语境与持久世界
Remember to be Curious: Episodic Context and Persistent Worlds for 3D Exploration
发现好奇心驱动探索失败源于双重遗忘问题,通过在线三维重建与情景上下文策略解决该问题
向量策略优化:以多样性训练提升测试时搜索
Vector Policy Optimization: Training for Diversity Improves Test-Time Search
提出 VPO 算法将奖励分解为向量训练策略产生覆盖帕累托前沿的多样化解集使测试时搜索性能超越标量基线且差距随预算扩大
通过神经需求势实现可积弹性
Integrable Elasticity via Neural Demand Potentials
该论文提出可积上下文需求网络,从学习的需求面精确导出弹性,显著改善啤酒类别交叉弹性估计的稳定性与经济合理性
具有动力学颜色环境的非阿贝尔规范理论的自下而上开放有效场论
Bottom-up open EFT for non-Abelian gauge theory with dynamical color environment
通过保留动力学颜色框架变量,构建了规范协变的局域开放有效场论,将非局域颜色响应嵌入马尔可夫描述并自然导出硬热圈响应
基于凸松弛的分词
Tokenisation via Convex Relaxations
该论文将分词构建为线性规划并用凸松弛求解,所得 ConvexTok 在压缩、BpB 上一致优于贪心算法,且能证明与最优解差距小于 1%
均衡推理器:学习吸引子实现可扩展推理
Equilibrium Reasoners: Learning Attractors Enables Scalable Reasoning
该论文发现可扩展推理源于学习任务条件吸引子,提出均衡推理器通过隐状态迭代和随机初始化聚合,等效展开四万层,将数独极端准确率从 2.6% 提升至 99% 以上
基于扩散教师的期望方差缩减
Variance Reduction for Expectations with Diffusion Teachers
CARV 框架通过分层蒙特卡洛与重要性采样实现 2 至 3 倍有效计算倍增,并揭示单步蒸馏中方差已非瓶颈
超越 Purcell 效应:利用自旋噪声超表面调控纯量子退相干
Beyond the Purcell Effect: Controlling Pure Quantum Dephasing with Spin Noise Metasurfaces
该研究利用自旋噪声超表面首次实现对纯量子退相干的独立控制,实验展示了 NV 色心退相干动力学的调制,揭示了低频光子环境工程新途径
思想原子:基于微状态的通用脑电表征学习
Atoms of Thought: Universal EEG Representation Learning with Microstates
提出用脑电微状态作为通用表示,从大规模数据聚类出离散微状态分词器,在睡眠分期、情绪识别和运动想象中全面超越时频域特征
运行时可变性条件下流水线并行训练的就绪驱动运行时
A Readiness-Driven Runtime for Pipeline-Parallel Training under Runtime Variability
该论文提出就绪优先的流水线并行运行时 RRFP,动态跳过未就绪任务并调度已就绪任务,在运行时波动下消除等待气泡,最高实现 2.77 倍训练加速
DashAttention:可微分自适应稀疏分层注意力
DashAttention: Differentiable and Adaptive Sparse Hierarchical Attention
它利用α-entmax 替代固定 top-k,实现端到端可微的自适应稀疏层次注意力,75% 稀疏度下达到全注意力精度且推理加速最高 3.3 倍
面向 AI 时代的数据中心供电层级结构设计
Designing Datacenter Power Delivery Hierarchies for the AI Era
该文量化揭示了多资源闲置对 AI 数据中心实际可部署容量与成本的颠覆性影响,主张规划核心应从装机功率转向可部署容量
IVGT:面向神经场景表示的隐式视觉几何 Transformer
IVGT: Implicit Visual Geometry Transformer for Neural Scene Representation
IVGT 以隐式 SDF 从无位姿多视图图像学习连续神经场景表示,突破了显式几何基础模型缺乏几何连续性的局限,首次统一了连续表面重建、新视角合成与位姿估计