未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 722 篇解读
批量上下文强化:高效推理的任务缩放定律
Batched Contextual Reinforcement: A Task-Scaling Law for Efficient Reasoning
发现任务缩放定律:通过批处理上下文强化,无需长度惩罚即可使模型自主压缩推理,单问题准确率提高且令牌用量减少超六成
生成式推荐语言模型中新词汇的根植化词元初始化
Grounded Token Initialization for New Vocabulary in LMs for Generative Recommendation
发现均值初始化导致新词嵌入塌缩丧失区分性成瓶颈,提出利用语言描述接地初始化赋予语义结构,显著提升生成推荐性能
可操控视觉表征
Steerable Visual Representations
提出可操控视觉表示,通过在视觉编码器内早期融合文本,使自然语言调控特征聚焦任意对象,维持高质量表示并建立评测基准
ActionParty:生成视频游戏中的多主体动作绑定
ActionParty: Multi-Subject Action Binding in Generative Video Games
首次使视频扩散模型同时精准控制最多七个角色的动作绑定与身份保持,通过主体状态令牌攻克多主体动作关联难题
HippoCamp:个人电脑上下文智能体基准测试
HippoCamp: Benchmarking Contextual Agents on Personal Computers
该基准构建了超 2000 个真实文件的个人计算环境,揭示最先进多模态智能体在用户画像上仅 48.3% 准确率,并诊断出感知与证据对齐为主要瓶颈
格罗滕迪克常数严格大于戴维-里兹下界
The Grothendieck Constant is Strictly Larger than Davie-Reeds' Bound
利用三次厄米投影扰动,证明格罗滕迪克常数严格大于戴维-里兹下界,新下界增加至少 10⁻¹²
使用基于 Transformer 的源代码表示自动识别可并行化循环
Automatic Identification of Parallelizable Loops Using Transformer-Based Source Code Representations
利用轻量级 Transformer 模型 DistilBERT 对源代码进行子词标记化,以超过 99% 的准确率自动识别可并行化循环,无需复杂预处理
Diffusion Transformers 中上下文空间的动态排斥以实现丰富多样性
On-the-fly Repulsion in the Contextual Space for Rich Diversity in Diffusion Transformers
发现通过在扩散变换器中施加上下文空间即时排斥,能以极小开销克服典型性偏差并产出高多样保真图像
黎曼与统计流形上神经表征的几何感知相似性度量
Geometry-aware similarity metrics for neural representations on Riemannian and statistical manifolds
提出黎曼度量相似性分析,通过对比神经表征内在几何,明确区分了丰富与懒惰学习、非线性动力学及扩散模型的计算差异
Ruka-v2:面向机器人学习的具有腕部和外展功能的腱绳驱动开源灵巧手
Ruka-v2: Tendon Driven Open-Source Dexterous Hand with Wrist and Abduction for Robot Learning
Ruka-v2 开源灵巧手集成手腕双自由度和手指外展功能,成本低于 1300 美元,使遥操作任务完成时间缩短 51.3%、成功率提升 21.2%
Drive My Way:面向个性化驾驶的视觉-语言-动作模型偏好对齐
Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving
DMW 框架整合视觉、语言和用户嵌入,首次实现同时对齐长期驾驶习惯与实时自然语言指令的个性化驾驶,其行为风格可被识别
Vega:通过自然语言指令学习驾驶
Vega: Learning to Drive with Natural Language Instructions
该论文构建了首个大规模驾驶指令数据集并提出视觉语言世界动作统一模型,实现灵活遵循自然语言指令的个性化驾驶
镭单硫属化物 RaX (X = O, S, Se) 和 RaO± 离子的电子性质
Electronic properties of the Radium-monochalcogenides RaX (X = O,S,Se) and RaO+/- ions
该论文揭示了镭单硫族化物巨大的永久偶极矩与高度非对角弗兰克-康登因子,从而阐明了其二价化学键特性
基于多层欧拉-马鲁亚马方法的扩散模型多项式加速
Polynomial Speedup in Diffusion Models with the Multilevel Euler-Maruyama Method
该论文提出多级欧拉-丸山方法,将扩散模型采样计算代价降至与单次最高精度网络评估相当,实现多项式加速并在实验中验证四倍生成提速
基于深度学习从非侵入式压电结构测量估计流速与飞行器攻角
Estimating Flow Velocity and Vehicle Angle-of-Attack from Non-invasive Piezoelectric Structural Measurements Using Deep Learning
利用内部压电传感器阵列和卷积神经网络,从机壳振动中成功反演出高超声速风洞的自由流速和攻角,速度误差仅 0.21%,攻角误差 0.44°
MedObvious:通过临床分诊揭示 VLMs 中的医学莫拉维克悖论
MedObvious: Exposing the Medical Moravec's Paradox in VLMs via Clinical Triage
该论文构建了 MedObvious 基准,揭示医学视觉语言模型在预诊断输入验证阶段存在莫拉维克悖论,性能随图像增多退化且评估格式敏感
精度的时间之箭
Precision's arrow of time
揭示第三种时间箭头即精度导不可逆性:非厄米线性系统中放大、非正规性与有限动态范围使可逆性在可预测性视界后崩溃,无需纠缠或非线性
WorldCache:面向加速视频世界模型的内容感知缓存
WorldCache: Content-Aware Caching for Accelerated Video World Models
提出内容感知缓存框架,通过运动自适应阈值与感知约束动态近似,实现视频世界模型 2.3 倍加速并保留 99.4% 质量消除伪影
LumosX:关联任意身份与其属性以进行个性化视频生成
LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation
论文提出 Lumos 𝒳框架,通过数据和模型设计显式关联身份与属性,实现多主体视频的精确个性化生成
从掩膜到像素与语义:面向 VLM 图像篡改的新分类体系、基准与评估指标
From Masks to Pixels and Meaning: A New Taxonomy, Benchmark, and Metrics for VLM Image Tampering
发现掩码级标注大量错位真正编辑像素,构建了像素对齐、语义感知和自然语言描述的统一篡改基准与评估指标
F2LLM-v2:面向多语言世界的包容性、高性能与高效嵌入
F2LLM-v2: Inclusive, Performant, and Efficient Embeddings for a Multilingual World
F2LLM-v2 用公开数据构建支持 200+语言的嵌入模型,强化中低资源语言,借剪枝蒸馏提效,14B 模型 11 项 MTEB 登顶且全开源
FinTradeBench:用于大语言模型的金融推理基准
FinTradeBench: A Financial Reasoning Benchmark for LLMs
构建整合基本面与交易信号的 FinTradeBench 金融推理基准,涵盖 1400 问和十年窗口,测评 14 个 LLM 后揭示检索增强有效提升文本推理,但无法补足数值时序与跨信号推理的短板
NavTrust:具身导航可信度基准测试
NavTrust: Benchmarking Trustworthiness for Embodied Navigation
推出首个统一基准 NavTrust,涵盖 VLN 与 OGN 任务,系统施加 RGB、深度和指令损坏,发现模型性能骤降,揭示关键脆弱点,并比较四种缓解策略在真实机器人验证鲁棒性提升
Loc3R-VLM:利用视觉-语言模型实现基于语言的定位与三维推理
Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models
该工作让二维视觉语言模型通过全局布局重建和显式情境建模,从单目视频中学会了 3D 空间推理和语言定位,并取得领先性能