未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 721 篇解读
Gross-Pitaevskii 涡旋上的核心束缚波
Core-bound waves on a Gross-Pitaevskii vortex
发现 GP 涡旋长期存疑的轴对称缩胀波和四极凹槽波确实存在,它们形成低于连续谱的无限核心束缚分支
SimpliHuMoN:简化人体运动预测
SimpliHuMoN: Simplifying Human Motion Prediction
提出了一个简洁的自注意力模型,统一处理轨迹、姿态及联合预测,无需任务特定修改即达到最优性能
如何用刀削皮:使精细操作与人类偏好对齐
How to Peel with a Knife: Aligning Fine-Grained Manipulation with Human Preference
提出力感知模仿加偏好微调的两阶段框架,仅用少量轨迹实现机器人削皮成功率超 90%,跨蔬果零样本泛化,且微调后性能提升 40%
CFG-Ctrl:基于控制的无分类器扩散引导
CFG-Ctrl: Control-Based Classifier-Free Diffusion Guidance
将无分类器引导重构为反馈控制,并提出滑模控制 CFG,利用非线性切换项解决了高引导尺度下的不稳定与语义失真
测试时强化学习的工具验证
Tool Verification for Test-Time Reinforcement Learning
T3RL 框架通过工具验证加权投票,利用代码执行等外部证据筛选可靠轨迹为伪标签,防止虚假共识引发的模式崩溃,在数学推理上显著提升并稳定自进化
干预下有效选择性共形推断的部分因果结构学习
Partial Causal Structure Learning for Valid Selective Conformal Inference under Interventions
提出了任务驱动的部分因果学习框架,仅识别干预是否为目标后代,使选择性共形推断在误分类污染下仍通过有限样本界保持有效覆盖
DARE-bench:评估数据科学中大语言模型的建模与指令保真度
DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science
该论文构建了包含 6300 个任务的 DARE-bench 基准,首次实现可验证指令遵循与时间序列评估,监督微调提升准确率 1.83 倍,强化学习提升超 8 倍
模式寻求与均值寻求融合实现快速长视频生成
Mode Seeking meets Mean Seeking for Fast Long Video Generation
它解耦局部保真与长程一致性,以反向 KL 散度对齐短视频教师保留细节,同时用流匹配学习长视频叙事,首次实现高保真快速分钟级生成
FlashOptim:面向内存高效训练的优化器
FlashOptim: Optimizers for Memory Efficient Training
通过改进主权重拆分和压扩量化,将 AdamW 优化器的每参数内存从 16 字节降至 7 字节且无模型质量损失
SOTAlign:通过最优传输实现单模态视觉与语言模型的半监督对齐
SOTAlign: Semi-Supervised Alignment of Unimodal Vision and Language Models via Optimal Transport
该论文发现只需极少量配对样本即可实现视觉语言对齐,并提出基于最优传输的半监督方法 SOTAlign,突破内存瓶颈并大幅超越基线
一个数据集价值 1 兆字节
A Dataset is Worth 1 MB
该论文发现仅传输不到 1MB 的语义筛选伪标签即可代替海量原始图像,在客户端利用预载参考数据高效训练定制模型
SeeThrough3D:文本到图像生成中的遮挡感知 3D 控制
SeeThrough3D: Occlusion Aware 3D Control in Text-to-Image Generation
引入遮挡感知半透明场景表示与掩码注意力,使文生图模型在三维布局下准确生成具有透视遮挡与相机控制的多物体图像
通过锚定实现模型一致性
Model Agreement via Anchoring
这篇论文提出了一种基于锚定的通用技术,证明了四种常见算法的模型分歧可随可调参数趋近于零
译中寻回:基准与数据集自动化翻译的高效流水线
Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets
通过测试时计算扩展与多轮排序策略有效解决基准翻译的语义漂移问题,在八种东欧及南欧语言上生成高质量评测基准,确保任务结构与上下文精确对应
超越盈亏平衡的多编码逻辑量子比特计算
Computing with many encoded logical qubits beyond break-even
在 98 比特离子阱量子处理器上利用高速冰山纠错码实现最多 94 个逻辑量子比特,并在多个基准上首次超越未编码性能
Squint:面向仿真到真实机器人的快速视觉强化学习
Squint: Fast Visual Reinforcement Learning for Sim-to-Real Robotics
Squint 方法结合并行仿真、分布评论家与分辨率下采样,于单 GPU 上 15 分钟内训练视觉策略,多数任务 6 分钟收敛,并零样本部署至真实 SO-101 机器人
带有 KV 绑定的测试时训练实际上是线性注意力
Test-Time Training with KV Binding Is Secretly Linear Attention
揭示测试时训练的 KV 绑定本质是线性注意力,由此解开记忆悖论、简化架构并实现高达 4 倍吞吐提升
超大规模视频推理套件
A Very Big Video Reasoning Suite
它构建了含 200 个任务与百万级视频的大规模推理数据集,并首次发现视频推理模型规模扩展后涌现出对未见过任务的泛化能力
噪声的几何学:扩散模型为何无需噪声条件调节
The Geometry of Noise: Why Diffusion Models Don't Need Noise Conditioning
证明了噪声无关扩散模型的生成是边际能量上的黎曼梯度流,嵌入共形度规抵消奇点变无限深势阱为稳定吸引子
赋予置信度:K 划分集成
Assigning Confidence: K-partition Ensembles
提出 K 分划分集成方法,利用 K 折数据划分子模型预测分歧分配置信度,实现无需额外校准集的可靠置信度估计
MARS:边界感知的自我精炼奖励建模
MARS: Margin-Aware Reward-Modeling with Self-Refinement
提出 MARS 边际感知自适应增强低边际偏好对并自优化,提升奖励模型鲁棒性,取得一致增益并提供理论保证
近共振光传播的量子相空间方法基准测试
Benchmarking quantum phase-space methods for near-resonant light propagation
首次对近共振光传播中两种量子相空间方法进行基准测试并揭示截断维格纳近似在强耦合和耗散下显著偏差
利用变分量子本征求解器研究横场伊辛模型的纠缠与拟设表达能力
A Study of Entanglement and Ansatz Expressivity for the Transverse-Field Ising Model using Variational Quantum Eigensolver
通过 VQE 对一至三维横场伊辛模型进行模拟,比较了硬件高效、HVA 和对称破缺拟设,在 27 量子比特下揭示了拟设表达性对纠缠特性提取的关键影响
CLEF HIPE-2026 评测:面向多语言历史文本的人物-地点关系精准高效抽取
CLEF HIPE-2026: Evaluating Accurate and Efficient Person-Place Relation Extraction from Multilingual Historical Texts
推出了评估多语言历史文本人物-地点关系抽取的任务,并设计了兼顾准确率、计算效率和域泛化的三维评估方案