未来已来,只是尚未均匀分布
每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。
已收录 721 篇解读
面向扩散语言模型的汇聚点感知剪枝
Sink-Aware Pruning for Diffusion Language Models
揭示扩散语言模型的注意力汇点在生成过程中高度变动,并提出汇点感知剪枝自动剪除不稳定汇点,无需重训练即实现更优质量效率平衡
面向安全智能体系统的策略编译器
Policy Compiler for Secure Agentic Systems
提出 PCAS 策略编译器,用因果依赖图追踪信息流并执行声明式规则,将智能体系统合规率从 48% 提升至 93% 且零违规
知识嵌入潜在投影的鲁棒表示学习
Knowledge-Embedded Latent Projection for Robust Representation Learning
该论文将外部语义知识以核投影形式嵌入潜变量模型,在不平衡的高维离散矩阵中实现鲁棒表示学习并提供误差界
深度学习后处理方法在最小化(不)公平评分时的集合大小依赖性:动机示例与概念验证解决方案
Ensemble-size-dependence of deep-learning post-processing methods that minimize an (un)fair score: motivating examples and a proof-of-concept solution
这篇论文揭示了深度学习后处理方法在最小化 aCRPS 时因成员间依赖导致对集合大小敏感并产生系统性不可靠,并提出轨迹变换器实现集合大小无关的校准
长上下文,更少关注:通过隐私与个性化揭示大语言模型中的扩展差距
Long Context, Less Focus: A Scaling Gap in LLMs Revealed through Privacy and Personalization
该论文发现大模型的个性化和隐私保护能力会随上下文长度增加而持续衰减,揭示了“长上下文、少专注”的扩展差距
语言统计中的对称性塑造模型表示的几何结构
Symmetry in language statistics shapes the geometry of model representations
证明了语言共现统计的平移对称性自发产生圆形表征与流形,并揭示其抗扰动鲁棒性源于潜在连续变量
语义分块与自然语言的熵
Semantic Chunking and the Entropy of Natural Language
提出基于语义分块的自相似随机树模型,从第一性原理解释了自然语言近 80% 冗余,重现 1 比特/字符的熵率,并揭示熵率随语料语义复杂度上升而增加
模仿有效之法:基于仿真筛选的模块化策略学习从人类视频中
Imitating What Works: Simulation-Filtered Modular Policy Learning from Human Videos
通过仿真筛选抓取-轨迹对并学习抓取兼容性评分,无需任何机器人数据,模块化策略便从人类视频获得了鲁棒的任务导向抓取能力
碳捕获与封存中正反向建模的函数空间解耦扩散方法
Function-Space Decoupled Diffusion for Forward and Inverse Modeling in Carbon Capture and Storage
函数空间解耦扩散模型在碳封存中仅用 25% 观测使正向误差从 86.9% 降至 7.7%,反演消除伪影并 4 倍加速,首次与拒绝采样基准严格对比
面向网络智能体的智能体测试时扩展
Agentic Test-Time Scaling for WebAgents
提出置信感知测试时缩放根据投票不确定性动态分配计算仅争议步骤扩展使网络智能体性能提升 9% 且令牌消耗降低 2 倍
AttentionRetriever:注意力层悄然成为长文档检索器
AttentionRetriever: Attention Layers are Secretly Long Document Retrievers
该文发现注意力层天然具备长文档检索能力,提出基于实体检索的上下文感知嵌入方法,性能超越现有模型且效率不减
UniT:统一多模态思维链测试时扩展
UniT: Unified Multimodal Chain-of-Thought Test-time Scaling
UniT 让统一多模态模型通过多轮验证子目标分解和内容记忆实现顺序链式推理的测试时扩展发现顺序推理比并行采样更具伸缩效率且短轨迹训练可泛化至更长推理链
对于视觉-语言-动作对齐,扩展验证比扩展策略学习更有效。
Scaling Verification Can Be More Effective than Scaling Policy Learning for Vision-Language-Action Alignment
该研究发现测试时联合缩放指令改写与动作生成比缩放策略学习更有效,所提 CoVer 框架在真实世界任务中提升百分之四十五
YOR:你专属的移动操作机器人,面向可泛化机器人研究
YOR: Your Own Mobile Manipulator for Generalizable Robotics
推出了一款开源低成本双臂移动操作机器人 YOR,通过全向底盘与升降机构实现类人作业范围,物料成本低于一万美元
基于扩散预训练的稠密与上下文嵌入
Diffusion-Pretrained Dense and Contextual Embeddings
通过扩散预训练将单向语言模型转换为双向编码器,生成支持长文档全局上下文的密集嵌入,并在上下文检索基准上刷新纪录
盲点中的偏见:检测大语言模型未能言明的内容
Biases in the Blind Spot: Detecting What LLMs Fail to Mention
这篇论文提出了一种全自动方法,可检测大语言模型在思维链中从未提及却系统性影响决策的隐性偏差
鲁棒性是一个函数,而非数字:基于视觉的驾驶中分布外鲁棒性的因子化综合研究
Robustness Is a Function, Not a Number: A Factorized Comprehensive Study of OOD Robustness in Vision-Based Driving
该研究将环境五轴因子化评估视觉驾驶鲁棒性,揭示 ViT 与基础模型特征的优势,并指出夜间与城乡转换是最严重的分布偏移,给出可操作设计准则
高效模拟量子计算机物理应用的混合方法
Hybrid Method of Efficient Simulation of Physics Applications for a Quantum Computer
提出全状态与 Clifford 混合模拟方法,将多量子位旋转模拟加速约 18 倍,实现对 24 量子比特化学哈密顿量高效仿真
学习大语言模型激活的生成式元模型
Learning a Generative Meta-Model of LLM Activations
训练扩散模型于十亿级 LLM 激活,损失呈幂律缩放可预测下游性能,提升激活控制流畅度,神经元自发分离出可解释概念
具有准费米子涡旋的电荷-4e 超导体:通往通用拓扑量子计算之路
Charge-$4e$ superconductor with parafermionic vortices: A path to universal topological quantum computation
该论文发现电荷 4e 超导体中的涡旋可束缚ℤ₃ parafermion 零模,仅通过编织和简单干涉测量即可实现通用拓扑量子计算
PhysicsAgentABM:物理引导的生成式智能体建模
PhysicsAgentABM: Physics-Guided Generative Agent-Based Modeling
PhysicsAgentABM 将集群级神经符号推断与不确定性融合引入生成式智能体建模,将个体模拟解耦为群体先验与局部随机实现,在多个领域显著提升校准度并降低计算成本
视觉语言模型能从交互中学习直觉物理吗?
Can vision language models learn intuitive physics from interaction?
研究发现无论是交互式强化学习还是监督微调,视觉语言模型都无法获得可泛化到新任务的物理常识
CommCP:通过基于大型语言模型的通信与保形预测实现高效多智能体协调
CommCP: Efficient Multi-Agent Coordination via LLM-Based Communication with Conformal Prediction
该论文提出 CommCP 框架,利用共形预测校准 LLM 生成消息,显著提升了多智能体协作探索时的任务完成率与效率
DyTopo:基于语义匹配的动态拓扑路由用于多智能体推理
DyTopo: Dynamic Topology Routing for Multi-Agent Reasoning via Semantic Matching
该论文提出每轮语义匹配动态重构有向通信拓扑,使多智能体推理性能平均超最强基线百分之六点二,并展现可解释协调轨迹