未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 721 篇解读
Spatia:具备可更新空间记忆的视频生成
Spatia: Video Generation with Updatable Spatial Memory
该研究通过可更新的三维场景点云实现视频生成的空间记忆,在长序列中保持时空一致性,支持动态静态解耦与显式相机控制
面向视觉标记化与生成的球形里奇量化
Spherical Leech Quantization for Visual Tokenization and Generation
该论文提出球形利奇量化,基于最密超球填充格统一非参数量化,实现二十万码本免熵训练,图像重建与生成全面超越现有最佳方法
TimeLens:基于多模态大语言模型的视频时间定位再思考
TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs
揭示了现有视频时间定位基准严重不可靠,并构建了数据与算法系统,使开源多模态大模型在该任务上首次超越顶级闭源模型
扩散浏览器:基于多分支解码器的交互式扩散预览
DiffusionBrowser: Interactive Diffusion Previews via Multi-Branch Decoders
提出多分支解码器框架,以不到 1 秒生成 4 秒视频预览的超 4 倍实时速度为扩散去噪过程提供 RGB 和内蕴通道预览,支持通过随机性重注入和模态引导交互式控制生成,揭示了场景物体等细节的组装方式
量子神谕为识别经典反事实提供优势
Quantum oracles give an advantage for identifying classical counterfactuals
证明了量子预言机通过相干查询能识别经典预言机无法识别的反事实,实现因果参数全辨识
用于束缚离子量子信息处理的室温极高真空系统
A Room-Temperature Extreme High Vacuum System for Trapped-Ion Quantum Information Processing
该论文实现了室温下极低真空的离子阱系统,使离子碰撞间隔长达约 1.9 小时/离子,并测得 10⁻¹²毫巴量级的局部压力
Particulate:前馈式 3D 物体关节化
Particulate: Feed-Forward 3D Object Articulation
提出一种前馈方法,从单张静态三维网格直接推断完整关节结构,并可结合图像到三维生成实现单图可动资产创建
AlcheMinT:面向多参考一致性视频生成的细粒度时间控制
AlcheMinT: Fine-grained Temporal Control for Multi-Reference Consistent Video Generation
通过时间间隔位置编码和令牌级联,无需额外参数即首次实现多主体视频中主体出现消失的精确时间控制
ImplicitRDP:一种具有结构慢-快学习的端到端视觉-力扩散策略
ImplicitRDP: An End-to-End Visual-Force Diffusion Policy with Structural Slow-Fast Learning
提出端到端隐式视觉力扩散策略,通过结构快慢学习与虚拟目标正则化融合异步感知,实现力频率闭环控制,显著超越视觉分层基线
文本到 3D 生成中的强化学习:我们准备好了吗?——一项渐进式研究
Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation
该论文首次系统研究强化学习在文本到 3D 生成中的应用,证明了与人类偏好对齐的奖励和从粗形状到纹理细化的分层优化至关重要,并建立了首个 RL 增强模型 AR3D-R1
面向高质量数据共享的分层数据集选择
Hierarchical Dataset Selection for High-Quality Data Sharing
它通过分层效用建模实现高效数据集选择,在基准上以更少探索步骤取得 26.2% 准确率提升
双向归一化流:从数据到噪声并返回
Bidirectional Normalizing Flow: From Data to Noise and Back
双向归一化流去除显式可逆限制,学习噪声到数据的近似逆映射,在 ImageNet 上加速采样两个数量级并提升生成质量
SceneMaker:基于解耦去遮挡与姿态估计模型的开放集 3D 场景生成
SceneMaker: Open-set 3D Scene Generation with Decoupled De-occlusion and Pose Estimation Model
SceneMaker 解耦去遮挡与姿态估计并基于开放集数据增强先验实现了严重遮挡下高质量几何与精确姿态的三维场景生成
连接单层 t-J 模型与近藤晶格模型:冷原子探索
Connecting single-layer $t$-$J$ to Kondo lattice models: Exploration with cold atoms
提出基于混合维度冷原子平台连接单层 t-J 模型与近藤晶格模型,实现铜氧化物超导体和重费米子物理的连续可调谐研究
缩小基于梯度的规划中世界模型的训练-测试差距
Closing the Train-Test Gap in World Models for Gradient-Based Planning
该论文通过训练时数据合成技术,弥合了世界模型梯度规划中训练与测试的目标差异,以十分之一的时间预算实现超越无梯度交叉熵法的性能
相同内容,不同答案:多模态大语言模型中的跨模态不一致性
Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs
提出 REST/REST+基准,揭示多模态大模型在图像、文本和混合模态的相同内容上推理不一致,且一致性分数与模态差距相关
Astra:基于自回归去噪的通用交互世界模型
Astra: General Interactive World Model with Autoregressive Denoising
提出自回归去噪世界模型,通过动作感知适配器与混合动作专家实现精准交互与长程预测,在多种任务上超越现有方法
泛化结果具有泛化性吗?
Do Generalisation Results Generalise?
该论文发现大语言模型在不同分布外测试集上的泛化表现之间缺乏一致的关联性,相关性的正负完全取决于所选模型。
关系视觉相似性
Relational Visual Similarity
该文首次定义并量化关系视觉相似性,通过构建匿名描述关系逻辑的数据集微调视觉语言模型,揭示现有模型仅关注属性相似性的关键缺口
通过实体链接增强教育平台的检索增强生成
Enhancing Retrieval-Augmented Generation with Entity Linking for Educational Platforms
这项研究在检索增强生成中集成实体链接,发现基于倒数排名融合的混合策略显著提升教育问答事实准确性,并揭示领域适配关键
ShadowDraw: 从任意物体到影子绘画构成艺术
ShadowDraw: From Any Object to Shadow-Drawing Compositional Art
ShadowDraw 将任意三维物体转化为影子绘画构图艺术,它优化姿态光照以生成有意义影子,用影子笔画引导部分线条画,使投影与线条组成可识别图像
语义软引导:无需强化学习的大型语言模型长上下文推理
Semantic Soft Bootstrapping: Long Context Reasoning in LLMs without Reinforcement Learning
提出语义软引导自蒸馏法,用模型自身的正确与常见错误响应构建对比示例,无需强化学习即在数学推理上大幅超越 GRPO
DraCo:将草稿作为思维链用于文本到图像的预览和稀有概念生成
DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation
提出用草稿图像作为思维链进行预览和修正,大幅提升文本到图像生成的准确性与罕见概念生成
基于多对比度 MRI 的婴幼儿大脑深度分割
Deep infant brain segmentation from multi-contrast MRI
通过域随机化和灵活特征融合,用单一模型实现婴幼儿多对比度磁共振影像的快速准确脑分割,可泛化至训练未见的图像类型和任意扫描数量