arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 共 3417 篇
2609.40362 2026-10-01 cs.CV 新提交

Multimodal Flow: Unified Flow Modeling of Language and Vision in Embedding Spaces

多模态流:嵌入空间中语言与视觉的统一流建模

Hongyuan Tao, Xinggang Wang, Lianghui Zhu, Yongkang Li, Yunchao Wei, Bin Feng, Shaoyu Chen, Qian Zhang, Chang Huang, Kai Yu

机构 * Huazhong University of Science and Technology(华中科技大学) ; Beijing Jiaotong University(北京交通大学) ; Horizon Robotics(地平线机器人)

AI总结 多模态流提出一种完全连续的生成模型,通过共享分块因果流主干统一语言和视觉,在多个规模上持续预训练,以较少数据达到竞争性能,确立了新的连续多模态范式。

Comments 18 pages, 5 figures, 10 tables. Code and model: https://github.com/hustvl/Multimodal-Flow

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40361 2026-10-01 cs.LG cs.CL cs.CV 新提交

Ranking-Aware Prompt Optimization for Multimodal Clinical Diagnosis

面向多模态临床诊断的排序感知提示优化

Tian Xia, Minghao Liu, Yiqing Liang, Laixi Shi, Jiayun Wang

机构 * Harvard University(哈佛大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校) ; Brown University(布朗大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; Georgia Institute of Technology(佐治亚理工学院)

AI总结 针对多模态临床诊断中类别不平衡问题,提出成对排序帕累托提示演化(Ranking-PE),用AUROC替代准确率优化提示,在MIMIC上显著提升排序性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40360 2026-10-01 cs.LG cs.AI cs.CL 新提交

Semifactual Credit-Augmented Policy Optimization

半事实信用增强策略优化

Junshu Pan, Zhizhang Fu, Shulin Huang, Yiran Ding, Zifan Cheng, Wenqi Shao, Qiaosheng Zhang, Yue Zhang

机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Laboratory(上海人工智能实验室)

AI总结 针对RLVR中GRPO对token统一分配优势的局限,提出SCAPO,利用半事实稳定性进行细粒度信用分配,提升LLM推理准确率与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40359 2026-10-01 cs.LG q-bio.NC 新提交

Removing Timing Shortcuts Improves Non-Invasive Brain-to-Text

移除时间捷径提升非侵入式脑到文本解码

Dulhan Jayalath, Oiwi Parker Jones

机构 * University of Oxford(牛津大学)

AI总结 本研究揭示非侵入式脑到文本解码中的时间捷径,通过独立处理窗口移除该捷径,显著提升解码性能,接近侵入式方法。

Comments 29 pages, 12 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40358 2026-10-01 cs.CV 新提交

Physis-Lang: Self-Evolving Language as a Physical Representation for Video World Model

Physis-Lang:作为视频世界模型的物理表示的自演化语言

Liming Lu, Xianzheng Ma, Wenkun He, Guanqi Zhan, Yilin Zhao, Junyu Chen, Mengyao Xu, Jiaojiao Fan, Wenhang Ge, Yuchao Gu, Yunze Liu, Boyi Li, Zhen Dong, Victor Prisacariu, Ming-Yu Liu, Song Han, Han Cai

机构 * NVIDIA(英伟达) ; University of Oxford(牛津大学) ; MIT(麻省理工学院)

AI总结 Physis-Lang通过自演化语言表示物理过程,结合PhysCapBench和智能体循环优化,提升视频世界模型的物理合理性,并超越专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40356 2026-10-01 cs.CV cs.AI 新提交

ViTeX-Bench: Benchmarking High-Fidelity Video Scene Text Editing

ViTeX-Bench:高保真视频场景文本编辑基准

Xinghao Chen, Xiangbo Gao, Jiongze Yu, Yuheng Wu, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学)

AI总结 ViTeX-Bench提出视频场景文本编辑基准,含387个真实视频数据集和13指标三维评估协议,并发布ViTeX-Edit-14B编辑器,在文本正确性、时间稳定性和场景保留间取得最佳平衡。

Comments Accepted to NeurIPS 2026 (Evaluations and Datasets Track). 27 pages (10-page main text), 5 figures, 12 tables. Project page: https://vitex-bench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40353 2026-10-01 cs.CV cs.RO 新提交

AssemblyWorld: Rethinking 3D Assembly with General-Purpose Agents

AssemblyWorld:用通用智能体重新思考3D装配

Jiahao Zhang, Yeying Fan, Moitreya Chatterjee, Suhas Lohit, Bernhard Egger, Tim K. Marks, Anoop Cherian, Stephen Gould

机构 * The Australian National University(澳大利亚国立大学) ; Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室(MERL)) ; Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大大学埃尔朗根-纽伦堡) ; Tsinghua University(清华大学)

AI总结 本文提出AssemblyWorld交互式3D装配环境及AssemblyWorldBench基准,评估八个通用智能体,发现最强系统零件准确率80.9%但完整装配成功率仅59.4%,开源系统明显落后于闭源系统。

Comments 24 pages, 11 figures. Project page: https://assemblyworld.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40347 2026-10-01 cs.CV cs.LG 新提交

Image Classifiers are Efficient Self-Supervised Video Representation Learners

图像分类器是高效的自监督视频表示学习器

Owais Iqbal, Sudipta Sarkar, Shyam Marjit, Omprakash Chakraborty, Anirban Chakraborty, Abir Das

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡哈拉格普尔分校) ; Indian Institute of Science Bangalore(印度科学理工学院班加罗尔分校) ; École de technologie supérieure Montreal(蒙特利尔高等技术学院)

AI总结 本文提出VideoMSN框架,利用图像视觉变换器通过掩码孪生损失高效学习视频时空表示,在多个基准上达到最先进性能,并大幅减少预训练周期。

Comments Accepted in BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40341 2026-10-01 cs.RO cs.CV 新提交

Ego4WAM: What Matters When Scaling Egocentric Human Data for Robot Learning?

Ego4WAM:扩展以自我为中心的人类数据用于机器人学习时,什么才是关键?

Zhihao Sun, Liu Liu, Xinjiang Wang, Haoyi Jiang, Wei Feng, Huiqiang Zhang, Xiaosong Jia, Zhizhong Su, Zuxuan Wu

机构 * Fudan University(复旦大学) ; Horizon Robotics(地平线机器人) ; Huazhong University of Science & Technology(华中科技大学) ; Zhejiang University of Technology(浙江工业大学)

AI总结 Ego4WAM系统研究了以自我为中心的人类数据在人机对齐、时长、多样性和监督方式等因素对机器人学习的影响,发现对齐演示提升泛化并降低数据需求,视频监督有效,为数据扩展提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40340 2026-10-01 cs.CL 新提交

EvoDuet: Bilevel Co-Evolution of Web Searching and Task Solving for Scientific Discovery

EvoDuet:面向科学发现的网络搜索与任务求解的双层协同进化

Young-Jun Lee, Jinheon Baek, Soyeong Jeong, Minki Kang, Seungyeon Jwa, Jonghyun Choi, Seungho Han, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学) ; KAIST(韩国科学技术院) ; Seoul National University(首尔大学) ; Hanyang University(汉阳大学)

AI总结 EvoDuet提出双层协同进化方法,通过检索门控和内外循环优化搜索与求解,在21个任务上提升发现增益,超越多个基准最佳得分。

Comments Project page: https://open-galapagos.github.io/evoduet_project_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40335 2026-10-01 cs.LG 新提交

Is Weight Tying Still Beneficial for Decoder-Only LLMs in Private Settings Under DP-SGD?

在DP-SGD下的私有设置中,权重共享对仅解码器LLM仍然有益吗?

Razan El Mais, Ali Chehab, Ibrahim Issa, Razane Tajeddine

机构 * American University of Beirut(贝鲁特美国大学)

AI总结 本研究探讨DP-SGD下权重共享对仅解码器LLM的影响,发现未共享嵌入在效用和内存效率上均优于权重共享,为隐私保护训练提供了更优的架构选择。

Comments Accepted at the 8th IEEE International Conference on Trust, Privacy and Security in Intelligent Systems, and Applications (IEEE TPS 2026). 12 pages (10 pages of main content), 1 figure, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40333 2026-10-01 cs.CV 新提交

I Have a Stream: Making Self-Supervised Learning Work on Continuous Video

我有一条流:让自监督学习在连续视频上发挥作用

Ivan Martinović, Lukas Knobel, Yuki M. Asano

机构 * Faculty of Electrical Engineering and Computing, University of Zagreb(萨格勒布大学电气工程与计算学院) ; Fundamental AI Lab, University of Technology Nuremberg(纽伦堡工业大学基础人工智能实验室)

AI总结 本文提出StreamMAE方法,通过流感知正则化和运动偏置裁剪解决连续视频流自监督学习中高批次内相似性的挑战,在95小时视频数据上达到与独立同分布MAE相当的性能。

Comments Preprint. Accepted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40330 2026-10-01 cs.AI 新提交

Turbo Harness: Instance-Adaptive Harness Optimization

Turbo Harness:实例自适应 Harness 优化

Tunyu Zhang, Hao Wang, Kai Xu, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) ; Red Hat AI Innovation(红帽AI创新) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

AI总结 Turbo Harness 通过重用全局优化产物生成实例特定补丁,实现 harness 的实例自适应,在七个基准上持续优于现有优化基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40325 2026-10-01 cs.AI 新提交

WorldAuditBench: Interactive 3D World Auditing with Multimodal Agents

WorldAuditBench:基于多模态智能体的交互式3D世界审计

Ziyan Jiang, Jingbo Yang, Jiabao Ji, Yujian Liu, Qiucheng Wu, Tommi Jaakkola, Yang Zhang, Shiyu Chang

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

AI总结 本文提出WorldAuditBench基准,包含213个3D异常审计任务,评估多模态智能体耦合行动与视觉推理的能力,结果显示成功率远低于人类,揭示了当前局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40324 2026-10-01 cs.AI cs.GT 新提交

Cogentic: Multi-Agent Orchestration for Automated Proof Discovery

Cogentic:用于自动证明发现的多智能体编排

Yang Cai, Vineet Gupta, Yanchen Jiang, Christopher Liaw, Aranyak Mehta, Grigoris Velegkas, Di Wang

机构 * Google Research(谷歌研究院)

AI总结 Cogentic是一个多智能体框架,通过迭代证明-验证循环和持久账本,在开放数学问题上自动发现证明,已在五个开放问题上取得新颖结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40322 2026-10-01 cs.CV cs.AI cs.CL cs.MM 新提交

MatLoom: Layered Text-to-Material Generation in a Compact Program Space

MatLoom:在紧凑程序空间中的分层文本到材质生成

Anson Y. Lam, Shuqing Li, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学)

AI总结 MatLoom提出一种紧凑分层程序语言,利用预训练语言模型生成材质,通过解析器修复和预览批评优化,无需微调即在提示对齐和用户偏好上超越扩散基线。

Comments 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40320 2026-10-01 cs.CV 新提交

Atomizer-IO: Beyond Pixels, Patches and Grids

Atomizer-IO:超越像素、块与网格

Hugo Riffaud de Turckheim, Sylvain Lobry, Nicolas Houdré, Damien Robert, Roberto Interdonato, Diego Marcos

机构 * INRIA(法国国家信息与自动化研究所) ; LIPADE, Université Paris Cité(巴黎西岱大学LIPADE实验室) ; DM3L, University of Zurich(苏黎世大学DM3L实验室) ; CIRAD(法国农业发展研究国际合作中心)

AI总结 提出Atomizer-IO架构,以原子表示和局部交叉注意力取代网格假设,在多种传感任务上媲美专用模型,并自然扩展至无序点云。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40317 2026-10-01 cs.CV 新提交

GLARE: Generating Listening Heads with Appropriate Reactions

GLARE:生成具有恰当反应的聆听头部

Zikai Liao, Yumin Suh, Yi Ouyang, Yi-Lun Lee, Yi-Hsuan Tsai, Zhaozheng Yin

机构 * Stony Brook University(石溪大学) ; Atmanity Inc(Atmanity公司)

AI总结 本文提出GLARE,一种基于流匹配Transformer的音频驱动聆听头部生成模型,并构建了带细粒度反应标注的数据集及反应导向评估协议,以提升双人对话中聆听者反应的恰当性。

Comments Accepted in NeurIPS 2026. Project page: https://github.com/lzk901372/glare

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40316 2026-10-01 cs.LG cs.AI cs.CL 新提交

Scaling Laws for Looped Mixture of Experts

循环混合专家模型的缩放定律

Yanbei Chen, Anirudh Goyal, Raghuraman Krishnamoorthi

机构 * Meta AI

AI总结 本文提出循环缩放定律,联合建模循环与稀疏性,预测循环MoE损失,并证明其在万亿token规模下带来参数效率与性能优势。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40312 2026-10-01 cs.LG 新提交

Compression Footprints as Security Signals for Model-Poisoning Defense in Federated Learning

压缩足迹作为联邦学习中模型投毒防御的安全信号

Sachi Shome, William Eiers

机构 * Stevens Institute of Technology(史蒂文斯理工学院)

AI总结 本研究提出将有损压缩的响应作为安全信号,通过压缩足迹区分诚实与恶意更新,并开发CRAFT鲁棒聚合方法,在无需额外通信下有效防御模型投毒攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40306 2026-10-01 cs.RO cs.AI cs.LG 新提交

DynaHarness: A Dynamic Physical Harness for Self-Evolving Robot Agents

DynaHarness:用于自进化机器人代理的动态物理约束装置

Haoyuan Deng, Jiebin Liu, Tengxiao Zhang, Langning Yan, Hongye Cao, Ziwei Wang

机构 * Nanyang Technological University(南洋理工大学) ; Nanjing University(南京大学)

AI总结 针对长时程操作中语义与物理执行脱节的问题,提出动态物理约束装置DynaHarness,通过共享执行契约和失败归因实现能力自进化,在LIBERO-Pro上显著提升成功率。

Comments 37 pages, 19 figures. Project page: https://denghaoyuan123.github.io/Dynaharness_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40305 2026-10-01 cs.CV cs.LG 新提交

Looped Diffusion Transformer

循环扩散Transformer

Yong Xien Chng, Tianyi Chen, Wenwen Tong, Haiwen Diao, Zhongang Cai, Lei Yang, Ziwei Liu, Lewei Lu, Dahua Lin, Gao Huang

机构 * SenseTime Research(商汤科技研究院) ; LeapLab, Tsinghua University(清华大学LeapLab)

AI总结 本文提出循环扩散Transformer(Looped-DiT),通过共享块循环计算与深度监督及自调制注意力,在固定参数下超越更大模型,实现高效迭代生成。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40303 2026-10-01 cs.AI 新提交

How Much of a Harness Does a Strong Agent Need for Autonomous ML Engineering?

一个强大的智能体进行自主机器学习工程需要多少约束框架?

Kirill Brilliantov, Alejandro Hernández-Cano, Emmanuel Abbé

机构 * EPFL(洛桑联邦理工学院) ; Apple(苹果公司)

AI总结 本文发现,在相同时间预算和LLM骨干下,复杂约束框架对自主机器学习工程智能体无优势,骨干模型是性能主要驱动力,构建复杂机制回报甚微。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40297 2026-10-01 cs.RO 新提交

GPU-Accelerated Path-Dependent Marginal Information Gain for Autonomous Exploration

GPU加速的自主探索路径相关边际信息增益计算

João Félix Mendes, Rodrigo Ventura, Meysam Basiri

机构 * Institute for Systems and Robotics(系统与机器人研究所) ; Instituto Superior Técnico(里斯本高等技术学院)

AI总结 提出GPU加速的路径相关边际信息增益计算方法,通过深度缓冲区识别观测重叠,在保持精确性的同时大幅提速,并集成于探索规划器,显著减少覆盖率时间。

Comments Submitted for review to IEEE ICRA 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40295 2026-10-01 cs.CL cs.LG 新提交

How Much Is an AI Token Worth? Scaling Laws for Wild AI-Generated Web Text

一个AI代币值多少钱?野生AI生成网页文本的缩放定律

Jenna Russell, Ben Glickenhaus, Katherine Thai, John Wieting, Mohit Iyyer, Max Spero, Bradley Emi

机构 * University of Maryland(马里兰大学) ; Pangram Labs(Pangram 实验室)

AI总结 本研究通过预训练800个语言模型,提出一种新的缩放定律,揭示了野生AI生成文本对预训练的影响:初期有益但随后有害,并提供了过滤和重复人类文本的建议,同时发布了WildAI语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40292 2026-10-01 cs.LG q-bio.NC 新提交

Disentangling Computation in Multi-Task Neural Networks with the Green's Operator

利用格林算子解耦多任务神经网络中的计算

James Hazelden

机构 * University of Washington(华盛顿大学) ; The Allen Institute(艾伦研究所)

AI总结 本文提出用格林算子刻画循环网络的全局一阶扰动响应,通过任务和时间约简揭示多任务计算的结构化复用与因果路径,为理解学习到的动力学计算组织提供新视角。

Comments Accepted as a poster at NeurReps 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40287 2026-10-01 cs.LG 新提交

PMosFM: Preconditioned Manifold Matching for One-Step Physics-Constrained Generation

PMosFM: 用于一步物理约束生成的预处理流形匹配

Zhangyong Liang, Haibin Ling

机构 * Westlake University(西湖大学)

AI总结 PMosFM 提出预处理流形匹配框架,通过流形解码器编码约束并利用几何预处理器与协方差变换,实现一步物理约束生成,降低训练和采样成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40286 2026-10-01 cs.CL cs.AI 新提交

Linguistic Loopholes in LLM Unlearning: From a 174-Language Benchmark to Coverage-Aware Unlearning

LLM 遗忘中的语言漏洞:从174语言基准到覆盖感知遗忘

Tyler Skow, Shravan Chaudhari, Rama Chellappa, Abhay Yadav

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 针对LLM遗忘中的跨语言漏洞,提出语言预算多语言遗忘任务及COVER方法,通过选择源语言最大化覆盖率,在三个模型家族上显著降低残留访问。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40285 2026-10-01 cs.AI 新提交

PivotOPD: Learning to Recover from Pivotal Mistakes in Multi-Turn Agents

PivotOPD:在多轮智能体中从关键错误中恢复的学习方法

Yinghui He, Yapei Chang, Khushi Bhardwaj, Daniele Molinari, Tugrul Konuk, Jan Kautz, Ali Hatamizadeh

机构 * Princeton University(普林斯顿大学) ; NVIDIA(英伟达) ; University of Maryland(马里兰大学)

AI总结 PivotOPD通过在线策略蒸馏联合训练学生模型预防关键错误并从其状态中恢复,在多个基准上取得最佳平均性能,显著提升任务成功率。

Comments PivotOPD technical report; Project page: https://research.nvidia.com/labs/lpr/pivotopd/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.40284 2026-10-01 cs.LG cs.AI cs.CL 新提交

cua-speedrun: Standardized Benchmarking of the Speed of Computer-Use Agents

cua-speedrun:计算机使用智能体速度的标准化基准测试

Pranjal Aggarwal, Lawrence Keunho Jang, Sean Welleck, Daniel Fried, Ruslan Salakhutdinov, Jing Yu Koh

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出cua-speedrun,一个标准化基准测试框架,用于评估计算机使用智能体的速度与效率,通过统一基础设施和任务集,发现推理努力、环境延迟等因素对性能、速度和成本的影响,并支持高效基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
↑