未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 722 篇解读
稳定性边缘的泛化
Generalization at the Edge of Stability
发现稳定性边缘的随机优化收敛至低锐度维度的分形吸引子,证明泛化误差由该维度而非参数量控制
Sessa:选择性状态空间注意力
Sessa: Selective State Space Attention
Sessa 将注意力引入反馈回路,实现层内循环多路径聚合,使长程影响呈幂律衰减尾并支持灵活选择性检索,长上下文性能超越现有模型
MathNet:一个面向数学推理和检索的全球多模态基准
MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval
发布了涵盖 47 国 17 语的 3 万+奥数题及首个数学感知检索基准,发现顶尖模型在解题与等价检索上均表现不佳
从低温到临界温度的玻色气体重整化热力学
Renormalised thermodynamics for Bose gases from low to critical temperatures
该论文系统重正化了超越高斯近似的自洽描述,计算玻色凝聚从低温到临界温度的耗散,并确定了次领头阶的非零反常维度
利用对称耦合读出的双轨量子比特快速、高保真擦除检测
Fast, High-Fidelity Erasure Detection of Dual-Rail Qubits with Symmetrically Coupled Readout
该研究用单个对称耦合读出谐振器,在 384 纳秒内实现双轨量子比特高速高保真擦除检测,残余错误 6.0×10⁻⁴,并可并行单比特门连续检测
可从体积律调节至面积律的随机量子态系综
Ensembles of random quantum states tunable from volume law to area law
设计了可由单一参数在体积律与面积律纠缠之间连续调节的随机量子态系综,克服了 Haar 随机态总为体积律的困境
诊断 LLM 裁判可靠性:共形预测集与传递性违反
Diagnosing LLM Judge Reliability: Conformal Prediction Sets and Transitivity Violations
该论文利用传递性分析和共形预测集诊断 LLM 法官可靠性,揭示预测集宽度可指示文档难度,且评价标准比法官类型对可靠性影响更大
大语言模型问题求解中的泛化能力:以最短路径为例
Generalization in LLM Problem Solving: The Case of the Shortest Path
该论文用最短路径合成任务揭示了大模型能空间迁移但长度扩展因递归不稳定而失败,并分析了数据、训练和推理的影响
针对量子 APM‑LDPC 码最小距离上界见证的启发式搜索
Heuristic Search for Minimum-Distance Upper-Bound Witnesses in Quantum APM-LDPC Codes
该论文针对围长八的量子 APM-LDPC 码,利用启发式搜索和核与行空间验证,构造出低权重的逻辑见证,从而获得改进的最小距离认证上界
MM-WebAgent:用于网页生成的分层多模态网络智能体
MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation
该论文提出分层多模态网页代理,通过层次化规划与自我反思协同布局与元素生成,显著提升了网页的全局连贯性与风格一致性
量子态与经典态集合上的部分优超与 Schur 凹函数
Partial majorization and Schur concave functions on the sets of quantum and classical states
为任意舒尔凹函数在量子态部分主次与迹距约束下的差异提供了紧致上界及其消失条件,并应用于冯诺伊曼熵的秩界定
跨多个智能体轨迹的安全违规检测
Detecting Safety Violations Across Many Agent Traces
Meerkat 结合聚类与智能体搜索,在海量痕迹中识别跨迹分布式违规,显著提升检测并揭露作弊和奖励黑客行为
用于离网系统可靠太阳辐照度预测的物理信息状态空间模型
Physics-Informed State Space Models for Reliable Solar Irradiance Forecasting in Off-Grid Systems
PISSM 结合动态汉克尔嵌入和物理门控,基于太阳天顶角与晴空指数,在不足四万参数下实现边缘端物理可靠辐照预测
大语言模型使用一个独特、统一的机制生成有害内容
Large Language Models Generate Harmful Content Using a Distinct, Unified Mechanism
该论文发现大模型生成有害内容依赖于一个压缩且跨类别统一的权重子集,可通过精确剪枝移除而保留良性能力
基于元学习的上下文学习实现免训练的跨受试者脑解码
Meta-learning In-Context Enables Training-Free Cross Subject Brain Decoding
提出基于元上下文学习的跨受试 fMRI 视觉解码方法,在新个体上无需任何微调即能泛化,且跨扫描器、无需解剖对齐
OpenVLThinkerV2: 一种面向多领域视觉任务的通用多模态推理模型
OpenVLThinkerV2: A Generalist Multimodal Reasoning Model for Multi-domain Visual Tasks
通过高斯 GRPO 强化学习目标及任务级塑造机制,OpenVLThinkerV2 在多个视觉任务中稳定平衡感知与推理,超越前沿模型
AVGen-Bench:面向文本到音视频生成的多粒度评估任务驱动基准
AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation
该论文构建了任务驱动多粒度音视频生成基准,发现现有模型在语义保真、文本渲染、语音连贯、物理推理和音高控制上普遍失败
视而不思:多模态混合专家模型中的路由分心
Seeing but Not Thinking: Routing Distraction in Multimodal Mixture-of-Experts
该论文发现多模态混合专家模型存在路由分心现象,即视觉输入错误激活专家导致推理失败,并通过路由引导干预有效提升性能
SIM1:物理对齐的模拟器作为可变形世界中的零样本数据扩展器
SIM1: Physics-Aligned Simulator as Zero-Shot Data Scaler in Deformable Worlds
SIM1 通过物理对齐仿真将少量演示扩展为相当于真实数据 15 倍的合成数据,实现零样本部署成功 90% 且泛化提升 50%,首次证明合成数据可替代真实数据训练柔性操作策略
明智行动:在智能体多模态模型中培养元认知工具使用
Act Wisely: Cultivating Meta-Cognitive Tool Use in Agentic Multimodal Models
论文提出 HDPO 框架,通过解耦准确率与效率条件优化,训练多模态模型智能节制工具调用,实现调用率从 98% 骤降至 2% 且推理准确率同步提升
小直径垂直管道中搅混流的拓扑表征与对吴氏流型图的无监督校正
Topological Characterization of Churn Flow and Unsupervised Correction to the Wu Flow-Regime Map in Small-Diameter Vertical Pipes
首次用欧拉示性数表面拓扑表征搅混流,通过无监督多核学习校正小直径立管流型图,将段塞-搅混转变点提高了 3.81 米/秒
即插式测试时训练
In-Place Test-Time Training
将 MLP 的最终投影矩阵作为快速权重就地更新,无需修改架构即可让 LLM 在推理时动态适应长上下文,并取得优异性能
基于置信度动态的大型推理模型早停方法
Early Stopping for Large Reasoning Models via Confidence Dynamics
发现正确推理早期置信度高且稳定而错误轨迹置信度波动,据此提出无需训练置信度动态早停法,节省四分之一到一半推理开销并保持准确率
多体量子系统的置信传播与张量网络展开:严格结果与基本极限
Belief Propagation and Tensor Network Expansions for Many-Body Quantum Systems: Rigorous Results and Fundamental Limits
该论文严格证明了信念传播在满足回路衰减条件时可系统修正并精确近似量子多体系统局部观测量,且回路衰减必然导致关联函数指数衰减