未来已来,只是尚未均匀分布

每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。

已收录 721 篇解读

001

作为偏振镜的自由费米子黑洞

Free fermionic black holes as polarised mirrors

该论文发现自由费米子黑洞是极化镜子,按费米子度数选择性保留或反射信息,加入固定克利福德幺正后恢复所需辐射比特比哈尔随机少约 37%

arXiv: 2610.03304v1

002

FERPO:前向熵正则化策略优化

FERPO: Forward Entropy-Regularized Policy Optimization

该论文提出 FERPO 算法,用熵和 KL 正则构造目标动作分布并以正向 KL 拟合,无需对价值函数求动作梯度即可改进策略,提升样本效率与更新速度

arXiv: 2610.02198v1

003

TACO:用于大语言模型微调的三元绝对最大逐列单稀疏优化器

TACO: Ternary Absolute-max Column-wise One-sparse Optimizer for LLM Fine-Tuning

该论文提出 TACO 优化器,逐列仅保留绝对值最大梯度的符号来近似最速下降方向,使优化器状态内存压缩 174 倍且精度与 AdamW 相当

arXiv: 2610.02199v1

004

VISTA:一种用于交互式世界中推理的视觉框架

VISTA: A Visual Harness for Reasoning in an Interactive World

提出视觉记忆框架 VISTA,使多模态模型无损保存并主动检索画面,首次在无程序合成下于 ARC-AGI-3 上达到满分且动作比人类少 57.4%

arXiv: 2610.02200v1

005

SILSA:面向拓扑保持高分辨率三维生成的滑动窗口切片潜变量

SILSA: Sliding-Window Slice Latents for Topology-Preserving High-Resolution 3D Generation

提出滑动窗口切片潜在框架,将令牌用量降至稀疏或分层方法的不足百分之二,实现高分辨率三维生成并改善薄结构与拓扑一致性

arXiv: 2610.02201v1

006

ScholarCatalyst:一个用于检索启发新研究论文的基准

ScholarCatalyst: A Benchmark for Retrieving Papers That Inspire New Research

该论文构建了由 184 位作者标注的学者催化剂基准,发现最强系统仅能召回约四成八的催化论文且智能体搜索无增益

arXiv: 2610.02202v1

007

嵌入预测有助于图像生成

Embedding Prediction Helps Image Generation

提出多嵌入预测干净图像嵌入并在每步去噪动态条件扩散生成器,结合 REPA 使 NEPA-DiT-XL 在 ImageNet 256×256 上 FID 达 1.32 且训练算力仅约 REPA 三分之一

arXiv: 2610.02203v1

008

重建、实践、走向真实:具身智能体的引导式自我改进

Reconstruct, Practice, Go Real: Guided Self-Improvement for Embodied Agents

提出了一种无需更新权重的机器人自改进框架,通过仿真重建与练习将 22 项任务成功率从 28.6% 提升至 95.0%,物理试验 30 次全成功

arXiv: 2610.02204v1

009

KaliBench:面向 Kali Linux 网络安全工具使用的细粒度基准测试,具有无需运行时的可验证奖励

KaliBench: A Fine-Grained Benchmark for Cybersecurity Tool Use on Kali Linux with Runtime-Free Verifiable Rewards

KaliBench 构建了涵盖 1642 个工具的 8504 条自然语言到 CLI 命令基准,发现开源模型最高仅 42% 准确率且可验证奖励微调使 8B 模型接近 685B MoE

arXiv: 2610.02206v1

010

一个基驱动所有:面向实时化身的高斯混合形状蒸馏

One Basis to Animate Them All: Gaussian Blendshape Distillation for Real-Time Avatars

该论文提出用身份无关高斯混合形状的线性基底和浅层系数预测器替代逐帧神经解码,将动画计算成本降低三个数量级并保持画质

arXiv: 2610.02207v1

011

消除时间捷径改善非侵入式脑到文本

Removing Timing Shortcuts Improves Non-Invasive Brain-to-Text

该论文发现联合编码句子时固定窗口重叠泄露词时长捷径,使无脑信号解码准确率接近真实脑记录;改为独立编码后消除捷径并提升性能

arXiv: 2609.40359v1

012

半事实信用增强策略优化

Semifactual Credit-Augmented Policy Optimization

该论文提出 SCAPO,将半事实稳定性纳入 token 级信用分配以抑制不稳定 token,在 Qwen3 模型上比 GRPO 的 AIME 准确率分别提升 5.63 和 4.17 个百分点

arXiv: 2609.40360v1

013

面向多模态临床诊断的排序感知提示词优化

Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis

提出配对级 Pareto 提示演化,将提示搜索目标从准确率改为 AUROC 排序,在 MIMIC 上提升 5.8 和 16.2 个百分点且不增调用成本

arXiv: 2609.40361v1

014

STEPQuant:Delta 规则循环状态量化中误差何时何地重要

STEPQuant: When and Where Errors Matter in Delta-Rule Recurrent State Quantization

提出 STEPQuant 时空量化框架,根据误差大小和记忆寿命分配位宽,并联合拟合键行值列尺度,在 6 位预算下接近 FP32 精度且最多降低 68.7% 服务内存

arXiv: 2609.38169v1

015

局部去噪的失效作为语义物种形成

Breakdown of Local Denoising as Semantic Speciation

在共同原因假设下,论文证明生成模型的非局域窗口必位于语义分化窗口内,并给出两窗口收缩为单一相变的条件

arXiv: 2609.38176v1

016

面向自主机器人策略改进的技能空间射击

Skill-Space Shooting for Autonomous Robot Policy Improvement

提出技能空间射击,用基础模型引导可复用技能自主搜索修正并将成功尝试转为训练监督,使机器人策略跨任务持续改进

arXiv: 2609.38178v1

017

伸缩式语言模型

Telescopic Language Models

该论文训练伸缩语言模型,使单一变换器每一层前缀均为有效语言模型,较固定出口方案降低质量预算曲线下面积 43% 且训练成本更低

arXiv: 2609.35769v1

018

FurE:无需动物毛发数据集的高效实例特定三维毛发重建

FurE: Efficient Instance-Specific 3D Fur Reconstruction without Animal-Fur Datasets

该方法利用人类头发先验的低维潜在解码和去毛外壳估计,在无动物毛发数据集下从多视图图像以十倍加速重建可编辑动物毛发

arXiv: 2609.35770v1

019

通过价值移植引导语言模型目标

Steering Language Model Goals with Value Transplant

该论文提出价值移植干预,通过将宿主激活沿自评价值轴移向供体,双向改变模型目标,使作弊模型变诚实或诚实模型变作弊,且跨模型家族有效

arXiv: 2609.34056v1

020

超越确定因果顺序的量子信道斯坦因定理

Quantum Channel Stein Theorem beyond Definite Causal Order

证明并行、自适应与一般测试器在量子信道非对称判别中达到相同的斯坦指数即正则化信道相对熵,并给出强逆指数,排除不定因果序优势

arXiv: 2609.30268v1

021

分布式对称性破缺的量子优势

Quantum Advantage for Distributed Symmetry Breaking

该论文提出常数轮量子分布式算法,首次在环三着色等自然对称破缺问题上实现相对经典局部模型的渐近量子优势

arXiv: 2609.26788v1

022

源于斯塔克局域化的量子姆潘巴效应

Quantum Mpemba effect from Stark localization

利用斯塔克局域化构建量子能量景观并以局域非相干跳跃冷却,实现参数分离时间尺度的量子姆潘巴效应,吸引相互作用下集体跳跃显著增强

arXiv: 2609.24993v1

023

GameHorizon 套件:游戏玩法中的多时间尺度数据与评估

GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay

构建了首个大规模游戏数据评测套件,收录二十一游戏约五千小时专家对局与多时间尺度指令,评测四十七模型并揭示能力差异

arXiv: 2609.25001v1

024

基于匿名实验的盲热力学本体发现

Blind Thermodynamic Ontology Discovery from Anonymous Experiments

该论文通过复制、热接触、循环与储层耦合四类实验,从匿名混合信号中恢复广延量、强度量及其共轭配对,并证明残余观测等价性达到理论极限

arXiv: 2609.23387v1