未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 722 篇解读
面向高效视频视觉语言模型的统一时空词元评分
Unified Spatio-Temporal Token Scoring for Efficient Video VLMs
提出统一时空令牌评分模块 STTS,可在视频 VLM 的 ViT 和 LLM 中端到端剪枝 50% 视觉令牌,训练推理效率提升 62% 且性能仅降 0.7%
边缘高效推理
Efficient Reasoning on the Edge
它提出了用 LoRA 适配器、强化学习预算强制与并行测试时扩展,在边缘设备上实现小型语言模型的高效推理
揭秘视频推理
Demystifing Video Reasoning
揭示视频扩散模型推理沿去噪步骤而非帧序列发生,早期探索多个候选解并逐步收敛,形成步骤链机制
实时模拟中基于纠缠结构的专属散射通道
Exclusive Scattering Channels from Entanglement Structure in Real-Time Simulations
通过施密特分解分析末态纠缠结构,在矩阵乘积态模拟中实现了对弹性和非弹性散射道的分离,并成功探测到碰撞产生的重粒子
时空物理系统的表示学习
Representation Learning for Spatiotemporal Physical Systems
该论文发现潜在空间预测的自监督架构在物理参数估计任务上显著优于像素重建方法
PhysMoDPO:基于偏好优化的物理合理人形运动
PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization
PhysMoDPO 将全身控制器融入扩散模型训练,通过偏好优化使生成的人形动作同时满足物理可行性与指令要求
可分离神经架构作为统一预测与生成智能的原语
Separable neural architectures as a primitive for unified predictive and generative intelligence
该论文发现通过在坐标表示中施加可分离结构,可统一混沌动力学与语言建模,使单一轻量架构同时具备预测与生成能力
检验非可验证 LLM 后训练中的推理型评判者
Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training
推理型 LLM 评判在非可验证对齐中成功规避奖励黑客,却使策略学会生成对抗输出以在基准上获得高欺骗性评分
匹配特征,而非词元:基于能量的语言模型微调
Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models
用序列级特征匹配替代下一个标记预测,在多个任务中超越 SFT 并匹配 RLVR,同时降低验证交叉熵
SciMDR:科学多模态文档推理的基准测试与推进
SciMDR: Benchmarking and Advancing Scientific Multimodal Document Reasoning
它提出合成-重新扎根框架,构建大规模科学多模态推理数据集 SciMDR,有效解决数据忠实性与真实性权衡并显著提升复杂文档推理性能
Spatial-TTT:基于测试时训练的流式视觉空间智能
Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training
提出 Spatial-TTT 框架,以测试时训练自适应更新快速权重来持续积累视频流中的三维空间证据,在长序列空间理解任务上达到最优性能
潜在颜色子空间:高维混沌中的涌现秩序
The Latent Color Subspace: Emergent Order in High-Dimensional Chaos
该论文发现 FLUX 的 VAE 潜在空间中颜色形成一个与 HSL 对应的三维子空间,并据此实现完全无需训练的局部色彩控制
LiTo: 表面光场标记化
LiTo: Surface Light Field Tokenization
提出表面光场标记化,统一编码几何与视角依赖外观,可再现高光反射并从单图生成三维物体
COMIC:基于智能体的素描喜剧生成
COMIC: Agentic Sketch Comedy Generation
该系统通过多智能体迭代竞争和基于视频观众偏好的幽默评估,首次全自动生成接近专业水平的喜剧短片
从数据统计到特征几何:相关性如何塑造叠加
From Data Statistics to Feature Geometry: How Correlations Shape Superposition
通过构建词袋叠加框架,该论文揭示当特征相关时,干扰可转为建设性信号,从而自然形成语义簇和循环结构
基于表示学习的任务感知调制用于陆地碳通量的尺度上推
Task Aware Modulation Using Representation Learning for Upsaling of Terrestrial Carbon Fluxes
该论文融合碳平衡方程与任务感知调制表征学习,将全球碳通量升尺度 R²从 19.4% 提升至 43.8%,RMSE 降低约 9%
尺度和空间扩散
Scale Space Diffusion
揭示扩散噪声状态与下采样图像信息等价,并通过融合尺度空间与扩散过程,显著提升高分辨率生成效率
量子乘积码的耦合层构造
Coupled-Layer Construction of Quantum Product Codes
发现量子乘积码可通过耦合层构造实现,以第二个码的校验模式凝聚第一个码堆栈中的激发,统一了张量积与平衡积构建
瞬子颂
An ode to instantons
建立量子力学半经典时间演化新框架,识别实时间与复时间中的复鞍点,构造出无零模的有限时间 bounce 解,为计算含时量子场论衰变率奠定新基础
BEVLM:将大语言模型的语义知识蒸馏到鸟瞰图表示中
BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations
该研究将大语言模型语义知识蒸馏到鸟瞰图表示,让大型语言模型空间推理精度提升 46% 并改善闭环驾驶安全性 29%
尖峰、稀疏与汇点:大规模激活与注意力汇的剖析
The Spike, the Sparse and the Sink: Anatomy of Massive Activations and Attention Sinks
发现前归一化 Transformer 中大规模激活与注意力槽的共现源于架构巧合,两者功能独立:前者全局充当隐式参数,后者局部调制注意力,可分别抑制而不影响性能
在 Krylov 子空间中计算玻色子态的迹距离
Calculating trace distances of bosonic states in Krylov subspace
提出基于克雷洛夫子空间的广义兰佐斯算法仅用矩信息高效计算纯态与混合高斯态迹距离并可扩展至非高斯态
POET-X:通过扩展正交变换实现内存高效的大语言模型训练
POET-X: Memory-efficient LLM Training by Scaling Orthogonal Transformation
POET-X 通过缩放正交变换大幅降低内存消耗,在单个 H100 GPU 上成功预训练 13B 参数大模型,并保持比 AdamW 更优的泛化稳定性
基于群表面码的通用量子计算
Universal quantum computation with group surface codes
提出群表面码借此在 Z2 表面码中实现非 Clifford 门突破 Bravyi-König 定理限制实现通用量子计算