未来已来,只是尚未均匀分布

每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。

已收录 722 篇解读

457

面向高效视频视觉语言模型的统一时空词元评分

Unified Spatio-Temporal Token Scoring for Efficient Video VLMs

提出统一时空令牌评分模块 STTS,可在视频 VLM 的 ViT 和 LLM 中端到端剪枝 50% 视觉令牌,训练推理效率提升 62% 且性能仅降 0.7%

arXiv: 2603.18004v1

458

边缘高效推理

Efficient Reasoning on the Edge

它提出了用 LoRA 适配器、强化学习预算强制与并行测试时扩展,在边缘设备上实现小型语言模型的高效推理

arXiv: 2603.16867v1

459

揭秘视频推理

Demystifing Video Reasoning

揭示视频扩散模型推理沿去噪步骤而非帧序列发生,早期探索多个候选解并逐步收敛,形成步骤链机制

arXiv: 2603.16870v1

460

实时模拟中基于纠缠结构的专属散射通道

Exclusive Scattering Channels from Entanglement Structure in Real-Time Simulations

通过施密特分解分析末态纠缠结构,在矩阵乘积态模拟中实现了对弹性和非弹性散射道的分离,并成功探测到碰撞产生的重粒子

arXiv: 2603.15621v1

461

时空物理系统的表示学习

Representation Learning for Spatiotemporal Physical Systems

该论文发现潜在空间预测的自监督架构在物理参数估计任务上显著优于像素重建方法

arXiv: 2603.13227v1

462

PhysMoDPO:基于偏好优化的物理合理人形运动

PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization

PhysMoDPO 将全身控制器融入扩散模型训练,通过偏好优化使生成的人形动作同时满足物理可行性与指令要求

arXiv: 2603.13228v1

463

可分离神经架构作为统一预测与生成智能的原语

Separable neural architectures as a primitive for unified predictive and generative intelligence

该论文发现通过在坐标表示中施加可分离结构,可统一混沌动力学与语言建模,使单一轻量架构同时具备预测与生成能力

arXiv: 2603.12244v1

464

检验非可验证 LLM 后训练中的推理型评判者

Examining Reasoning LLMs-as-Judges in Non-Verifiable LLM Post-Training

推理型 LLM 评判在非可验证对齐中成功规避奖励黑客,却使策略学会生成对抗输出以在基准上获得高欺骗性评分

arXiv: 2603.12246v1

465

匹配特征,而非词元:基于能量的语言模型微调

Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models

用序列级特征匹配替代下一个标记预测,在多个任务中超越 SFT 并匹配 RLVR,同时降低验证交叉熵

arXiv: 2603.12248v1

466

SciMDR:科学多模态文档推理的基准测试与推进

SciMDR: Benchmarking and Advancing Scientific Multimodal Document Reasoning

它提出合成-重新扎根框架,构建大规模科学多模态推理数据集 SciMDR,有效解决数据忠实性与真实性权衡并显著提升复杂文档推理性能

arXiv: 2603.12249v1

467

Spatial-TTT:基于测试时训练的流式视觉空间智能

Spatial-TTT: Streaming Visual-based Spatial Intelligence with Test-Time Training

提出 Spatial-TTT 框架,以测试时训练自适应更新快速权重来持续积累视频流中的三维空间证据,在长序列空间理解任务上达到最优性能

arXiv: 2603.12255v1

468

潜在颜色子空间:高维混沌中的涌现秩序

The Latent Color Subspace: Emergent Order in High-Dimensional Chaos

该论文发现 FLUX 的 VAE 潜在空间中颜色形成一个与 HSL 对应的三维子空间,并据此实现完全无需训练的局部色彩控制

arXiv: 2603.12261v1

469

LiTo: 表面光场标记化

LiTo: Surface Light Field Tokenization

提出表面光场标记化,统一编码几何与视角依赖外观,可再现高光反射并从单图生成三维物体

arXiv: 2603.11047v1

470

COMIC:基于智能体的素描喜剧生成

COMIC: Agentic Sketch Comedy Generation

该系统通过多智能体迭代竞争和基于视频观众偏好的幽默评估,首次全自动生成接近专业水平的喜剧短片

arXiv: 2603.11048v1

471

从数据统计到特征几何:相关性如何塑造叠加

From Data Statistics to Feature Geometry: How Correlations Shape Superposition

通过构建词袋叠加框架,该论文揭示当特征相关时,干扰可转为建设性信号,从而自然形成语义簇和循环结构

arXiv: 2603.09972v1

472

基于表示学习的任务感知调制用于陆地碳通量的尺度上推

Task Aware Modulation Using Representation Learning for Upsaling of Terrestrial Carbon Fluxes

该论文融合碳平衡方程与任务感知调制表征学习,将全球碳通量升尺度 R²从 19.4% 提升至 43.8%,RMSE 降低约 9%

arXiv: 2603.09974v1

473

尺度和空间扩散

Scale Space Diffusion

揭示扩散噪声状态与下采样图像信息等价,并通过融合尺度空间与扩散过程,显著提升高分辨率生成效率

arXiv: 2603.08709v1

474

量子乘积码的耦合层构造

Coupled-Layer Construction of Quantum Product Codes

发现量子乘积码可通过耦合层构造实现,以第二个码的校验模式凝聚第一个码堆栈中的激发,统一了张量积与平衡积构建

arXiv: 2603.08711v1

475

瞬子颂

An ode to instantons

建立量子力学半经典时间演化新框架,识别实时间与复时间中的复鞍点,构造出无零模的有限时间 bounce 解,为计算含时量子场论衰变率奠定新基础

arXiv: 2603.06575v1

476

BEVLM:将大语言模型的语义知识蒸馏到鸟瞰图表示中

BEVLM: Distilling Semantic Knowledge from LLMs into Bird's-Eye View Representations

该研究将大语言模型语义知识蒸馏到鸟瞰图表示,让大型语言模型空间推理精度提升 46% 并改善闭环驾驶安全性 29%

arXiv: 2603.06576v1

477

尖峰、稀疏与汇点:大规模激活与注意力汇的剖析

The Spike, the Sparse and the Sink: Anatomy of Massive Activations and Attention Sinks

发现前归一化 Transformer 中大规模激活与注意力槽的共现源于架构巧合,两者功能独立:前者全局充当隐式参数,后者局部调制注意力,可分别抑制而不影响性能

arXiv: 2603.05498v1

478

在 Krylov 子空间中计算玻色子态的迹距离

Calculating trace distances of bosonic states in Krylov subspace

提出基于克雷洛夫子空间的广义兰佐斯算法仅用矩信息高效计算纯态与混合高斯态迹距离并可扩展至非高斯态

arXiv: 2603.05499v1

479

POET-X:通过扩展正交变换实现内存高效的大语言模型训练

POET-X: Memory-efficient LLM Training by Scaling Orthogonal Transformation

POET-X 通过缩放正交变换大幅降低内存消耗,在单个 H100 GPU 上成功预训练 13B 参数大模型,并保持比 AdamW 更优的泛化稳定性

arXiv: 2603.05500v1

480

基于群表面码的通用量子计算

Universal quantum computation with group surface codes

提出群表面码借此在 Z2 表面码中实现非 Clifford 门突破 Bravyi-König 定理限制实现通用量子计算

arXiv: 2603.05502v1