未来已来,只是尚未均匀分布

每日精选 arXiv 新论文,用中文讲清核心问题、方法、结果与局限。

已收录 721 篇解读

697

智能体-全知:通过模型协调实现测试时多模态推理以理解万物

Agent-Omni: Test-Time Multimodal Reasoning via Model Coordination for Understanding Anything

该研究提出了名为 Agent-Omni 的代理框架,无需训练即可协调现有基础模型进行灵活多模态推理,在复杂跨模态任务上表现最优

arXiv: 2511.02834v1

698

暗场 X 射线成像显著提升临床前模型中合成早期肺部肿瘤的深度学习检测效果

Dark-Field X-Ray Imaging Significantly Improves Deep-Learning based Detection of Synthetic Early-Stage Lung Tumors in Preclinical Models

暗场 X 射线成像结合深度学习将小鼠早期肺肿瘤检测灵敏度由 51% 提升至 83.7% 并展现低剂量筛查潜力

arXiv: 2510.27679v1

699

PETAR:面向 PET 自动报告生成的掩膜感知视觉-语言建模局灶性发现生成

PETAR: Localized Findings Generation with Mask-Aware Vision-Language Modeling for PET Automated Reporting

该工作创建了含 1.1 万条病灶描述的大型 PET/CT 数据集,并提出融合 PET、CT 与病灶蒙版的 3D 模型 PETAR,首次实现带空间定位的自动化报告生成

arXiv: 2510.27680v1

700

连续自回归语言模型

Continuous Autoregressive Language Models

该论文提出连续自回归语言模型,将多 token 压缩为连续向量一步预测,显著降低计算开销并保持高性能

arXiv: 2510.27688v1

701

Gistify! 通过运行时执行实现代码库级理解

Gistify! Codebase-Level Understanding via Runtime Execution

提出通过运行时执行生成最小复现文件的 Gistify 任务以评估代码库理解,发现现有模型难以应对长执行跟踪

arXiv: 2510.26790v1

702

使用 Transformer 学习伪随机数:置换同余生成器、课程学习与可解释性

Learning Pseudorandom Numbers with Transformers: Permuted Congruential Generators, Curricula, and Interpretability

Transformer 成功学习伪随机数生成器序列,发现所需上下文长度随模平方根增长,且嵌入层自发形成按位旋转不变聚类

arXiv: 2510.26792v1

703

将图像地理定位扩展至大陆级别

Scaling Image Geo-Localization to Continent Level

该方法通过代理分类学习隐式位置特征并与航空图嵌入结合,在大陆尺度上实现超 68% 查询定位误差小于 200 米

arXiv: 2510.26795v1

704

OmniX:从统一的全景生成与感知到可图形化三维场景

OmniX: From Unified Panoramic Generation and Perception to Graphics-Ready 3D Scenes

该论文将 2D 生成先验重构为全景几何、纹理与 PBR 材质感知,实现可物理渲染的图形就绪 3D 场景生成

arXiv: 2510.26800v1

705

视频模型准备好作为零样本推理器了吗?基于 MME-CoF 基准的实证研究

Are Video Models Ready as Zero-Shot Reasoners? An Empirical Study with the MME-CoF Benchmark

该研究通过 MME-CoF 基准发现视频模型在短期空间推理表现良好,但长期因果与几何约束仍存明显局限,尚无法独立胜任零样本推理任务

arXiv: 2510.26802v1

706

用于生成模型输出正确性与错误性评估的 E 值分数

E-Scores for (In)Correctness Assessment of Generative Model Outputs

用 e 分数取代 p 值评估生成模型错误,保证统计有效且避免 p 值操纵,支持看到分数后灵活选择容忍度

arXiv: 2510.25770v1

707

Gaperon:一个椒盐型英法生成语言模型套件

Gaperon: A Peppered English-French Generative Language Model Suite

该工作发现,语言质量过滤可提升生成流畅度却损害基准表现,而后期故意让训练数据包含测试集能恢复分数且仅轻度损害生成质量

arXiv: 2510.25771v1

708

一种用于线性约束双层优化的单循环一阶算法

A Single-Loop First-Order Algorithm for Linearly Constrained Bilevel Optimization

将带线性约束的双层优化问题转化为单层,提出单循环一阶算法,收敛速率由 O(ε⁻³log(ε⁻¹))提升至 O(ε⁻³)

arXiv: 2510.24710v1

709

生成式视图拼接

Generative View Stitching

提出生成式视图拼接,并行采样与未来条件引导,首次实现无碰撞闭环的稳定相机轨迹视频生成

arXiv: 2510.24718v1

710

追踪、修复、重新泼溅:基于渐进式纹理填充的物体驱动三维与四维生成

Track, Inpaint, Resplat: Subject-driven 3D and 4D Generation with Progressive Texture Infilling

提出结合视频跟踪与渐进式纹理修复的重投影方法,显著改善三维与四维生成中主体身份的保真度

arXiv: 2510.23605v1

711

变分掩码扩散模型

Variational Masked Diffusion Models

提出变分遮蔽扩散模型,通过引入潜变量捕获词元间依赖,克服标准遮蔽扩散模型缺陷,显著提升离散生成质量与全局一致性

arXiv: 2510.23606v1

712

对比等变性:从无标签有限群作用中学习可识别的等变嵌入

Equivariance by Contrast: Identifiable Equivariant Embeddings from Unlabeled Finite Group Actions

提出对比等变方法,首次仅从无标签群作用观测对学到可识别等变嵌入,不依赖群特定先验,成功处理包括非阿贝尔群的广泛群类型

arXiv: 2510.21706v1

713

论 LLM 生成文本的可检测性:LLM 生成文本究竟是什么?

On the Detectability of LLM-Generated Text: What Exactly Is LLM-Generated Text?

论文揭示大语言模型生成文本缺乏统一定义,人类修改与模型影响持续模糊人机写作边界,致使检测基准失效,检测结果仅宜作参考

arXiv: 2510.20810v1

714

小草案,大裁决:基于推测的信息密集型视觉推理

Small Drafts, Big Verdict: Information-Intensive Visual Reasoning via Speculation

提出无须训练的推测裁决框架,用小模型生成多条推理路径并由大模型整合裁决,以低计算成本纠正密集图文推理错误

arXiv: 2510.20812v1

715

GSWorld:面向机器人操作的闭环真实感仿真套件

GSWorld: Closed-Loop Photo-Realistic Simulation Suite for Robotic Manipulation

GSWorld 将三维高斯泼溅与物理引擎闭环结合,通过高斯场景描述文件实现机器人操控的逼真仿真与零样本 sim2real 策略学习

arXiv: 2510.20813v1

716

KL 正则化强化学习旨在导致模式坍塌

KL-Regularized Reinforcement Learning is Designed to Mode Collapse

发现 KL 正则化强化学习中模式坍塌由正则化强度与奖励尺度主导而非 KL 方向,并提出微调奖励幅度即可实现高质量多样采样的算法

arXiv: 2510.20817v1

717

VAMOS: 一种用于能力调制与可操控导航的分层视觉-语言-动作模型

VAMOS: A Hierarchical Vision-Language-Action Model for Capability-Modulated and Steerable Navigation

分层视觉语言动作模型将通用规划与机器人物理约束解耦,通过可供性筛选拒绝不可行路径,实现跨腿轮机器人可操控导航且成功率提升三倍

arXiv: 2510.20818v1

718

面向通用模态翻译的对比与预测潜在扩散桥

Towards General Modality Translation with Contrastive and Predictive Latent Diffusion Bridge

该论文提出基于对比与预测潜扩散桥的通用模态翻译框架,无需维度对齐即可实现任意模态间语义一致转换,在多项任务中达到领先水平

arXiv: 2510.20819v1

719

Pico-Banana-400K:面向文本引导图像编辑的大规模数据集

Pico-Banana-400K: A Large-Scale Dataset for Text-Guided Image Editing

构建了包含 40 万真实图像编辑样本的大型数据集,并增设多轮编辑、偏好对齐及指令改写子集,填补高质量开源空白

arXiv: 2510.19808v1

720

Hubble:一套推动大语言模型记忆现象研究的模型套件

Hubble: a Model Suite to Advance the Study of LLM Memorization

该模型套件通过控制实验揭示增大训练语料库规模并让敏感数据在预训练早期出现可有效降低语言模型记忆化风险

arXiv: 2510.19811v1