未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 721 篇解读
PAC-MAN:面向人形机器人躲避球全身安全的感知感知 CBF-RL
PAC-MAN: Perception-Aware CBF-RL for Whole-Body Safety in Humanoid Dodgeball
发现可用屏障结构受限于感知可观测性,并基于此实现人形机器人仅用机载相机以 95% 成功率完成躲避球
ReToken:一个词元改进视觉检索的视觉-语言模型
ReToken: One Token to Improve Vision-Language Models for Visual Retrieval
该论文提出 ReToken 可学习检索 token,利用视觉值空间而非键空间检索,仅单 token 训练即在多图像和长视频基准获得超 20% 相对提升,并能零样本迁移至小时级长视频
学习追踪塞伯格对偶
Learning to Trace Seiberg Dualities
利用机器学习追踪箭图 Seiberg 对偶,发现 Transformer 等架构优于确定性算法,结合路径搜索可进一步提升效率与准确度
你真的需要为在线强化学习微调预训练 Q 函数吗?
Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?
发现朴素预训练 Q 函数对在线 RL 微调无益,因其学习基策略 Q 值而非目标 Q 值,提出基于策略集成的初始化 IPE,平均性能提升 26%
具有噪声接口的模块化量子架构中的容错逻辑运算与高效状态制备
Fault-Tolerant Logical Operations and Efficient State Preparation in Modular Quantum Architectures with Noisy Interfaces
揭示了模块化架构中接口可容忍比内部高一个数量级的噪声,并提出减少资源消耗的分布式 GHZ 态制备协议
实用化量子拓扑数据分析及其在高维特征提取与时间序列分析中的应用
Practical Quantum Topological Data Analysis with Applications to High-Dimensional Feature Extraction and Time Series Analysis
利用量子算法提取组合拉普拉斯低阶矩作为高维拓扑特征代理,提升神经影像疾病分类与金融时序预测,并在离子阱处理器上验证
πR2:反应式实时流策略
$π\mathbf{R}^2$: Reactive Real-time Flow Policies
该工作提出πR²框架,通过快慢通道分离和延迟适应流调度,让大模型流策略重规划速度提升 4 倍达 25Hz,成功率提高 30%
传递接力棒:轨迹接力的同策略蒸馏
Pass the Baton: Trajectory-Relayed On-Policy Distillation
它利用教师与学生续写差异在线纠正错误推理前缀,在数学推理中将在线蒸馏性能提升超 5% 同时训练长度减半
量子拟像
Quantum simulacra
该论文提出量子拟像概念,即通过改变度量重新定义可观测量来重塑量子现实,并以此解释了近期无纠缠光子违反贝尔不等式的实验
面向动态熵最优传输的认证时间并行 Sinkhorn 方法
Certified Parallel-in-Time Sinkhorn for Dynamic Entropic Optimal Transport
提出带认证的时间并行 Sinkhorn,动态遗忘率预测审计点并批量更新,在流式最优传输中实现 1.15 至 3.55 倍加速且零容差违规
ClinFusion:面向整体医学理解的视觉中心多模态大语言模型系统
ClinFusion: A Vision-Centric Multimodal LLM System for Holistic Medical Understanding
该论文提出 ClinFusion 系统,通过级联空间感知局部融合统一处理 2D 与 3D 医学影像,并构建视觉驱动的评估框架,在 20 项多模态基准上超越现有开源模型
中间带有 Fano 膜的光机械系统
Optomechanical systems with a Fano membrane in the middle
该论文将光子晶体法诺膜置于 FP 腔中,通过法诺共振与腔模杂化获得窄线宽光学模,使未分辨边带腔实现有效边带分辨与基态冷却
SM4RT:学习面向 4D 重建的结构化运动几何
SM4RT: Learning Structured Motion Geometry for 4D Reconstruction
SM4RT 提出运动结构表示,将场景运动分解为 se(3)运动基序列与逐点共享权重,实现单目视频下保留运动几何结构的四维重建
超越充分性:基于反事实必要性的时间序列解释
Beyond Sufficiency: Time Series Explanation with Counterfactual Necessity
提出必要性感知的时序解释框架,通过反事实干预滤除非必要片段,精准识别决策关键子序列
用于凹版印刷质量控制自动化的合成数据生成框架
Synthetic data generation framework for quality control automation in gravure printing
该论文提出了一种凹版印刷缺陷合成数据生成框架,通过自动生成高保真缺陷图像与标注训练检测模型,在真实样本上达到 80.9% 平均精度
对于每一个维度 n≥4,Barzilai-Borwein 方法在一个二次问题开集上均无法实现超线性收敛。
Barzilai-Borwein Fails Superlinear Convergence on an Open Set of Quadratics for Every Dimension $n\geq 4$
该论文证明对任意 n≥4 存在正测度开集上的严格凸二次问题及初值使 BB 方法收敛但无法达到根超线性收敛
GraphVid:交互式图可控视频生成
GraphVid: Interactive Graph-Controllable Video Generation
该论文提出图条件视频生成模型 GraphVid,通过编辑场景图控制多对象交互,无需轨迹标注,较 Motion-I2V FID 降低 39.9% 且 PSNR 显著提升
光与物质相互作用迪克模型中的复杂度转变
Complexity transition in the Dicke model of light-matter interaction
首次绘制 Dicke 模型的 Krylov 复杂度相图,发现耦合强度触发非解析突变和熵跳变,并揭示 Krylov 空间波包的约束与解约束竞争机制
基于流的连续变量量子态相空间层析成像
Flow-based Phase-space Tomography of Continuous-variable Quantum States
该论文提出 QST-Flow 框架,利用归一化流直接学习相空间准概率分布,可处理 Wigner 负值,实现高效精确的连续变量量子态层析
扩展流映射
Expanding Flow Maps
这篇论文提出了扩展流映射,使流模型能生成可变维度和变长数据,突破了固定画布限制
具有隐式与显式几何的 3D 感知视觉语言模型
3D-Aware VLMs with Implicit and Explicit Geometries
论文提出融合隐式与显式三维几何令牌的框架,从普通视频中赋予视觉语言模型细粒度空间推理能力,大幅提升多项三维任务性能
随机函数的 Lipschitz 强大数定律
Lipschitzian SLLNs for random functions
证明了局部利普希茨随机函数在利普希茨伪度量下的强大数定律,并确定了能避免先前负面结果失效的广泛函数类
费米子对:从表面到体相
Fermionic pairs, from the surface to the bulk
在有限费米子系统中,壳层结构将配对驱逐至低密度表面,而开壳或增强相互作用可使中心涌现体相库珀对,边缘仍为二聚体
通量修正对角蛙跳格式:全时间步的二阶精度与正性保持
Flux-Corrected Diagonal Frog: second order and positivity at all time steps
通过非线性通量修正突破戈杜诺夫定理限制,克服了对角蛙跳格式小步长约束,实现全时间步二阶精度且无条件正性