arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 315 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 315 篇

2606.12576 2026-06-12 cs.CL 新提交 57%

Helping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific Figures

帮助图表讲述它们的故事!基于论文的视频生成解释复杂科学图表

Ishani Mondal, Javad Baghirov, Jordan Boyd-Graber

机构 * University of Maryland, College Park(马里兰大学学院市分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 提出MINARD流水线,从图表及其论文生成基于区域分解的叙述性视频,并发布FigTalk基准,在自动和人工评估中优于现有方法。

Comments Webpage: https://minard.vercel.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11783 2026-06-11 cs.CV 新提交 57%

A Comprehensive Ecosystem for Open-Domain Customized Video Generation

开放域定制视频生成的综合生态系统

Jingxu Zhang, Yuqian Hong, Daneul Kim, Kai Qiu, Qi Dai, Jianmin Bao, Yifan Yang, Xiaoyan Sun, Chong Luo

机构 * University of Science and Technology of China(科学技术大学) Microsoft Research Asia(微软亚洲研究院) Seoul National University(首尔国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出百万级数据集PexelsCustom-1M和参数高效框架CustoMDiT,仅用8%额外参数实现定制视频生成,并构建千类基准OpenCustom,开源整个生态系统。

Comments 5 pages, 3 figures, 4 tables. Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11180 2026-06-10 cs.CV 新提交 57%

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

Lip Forcing: 用于实时唇部同步的少步自回归扩散

Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee, Joungbin Lee, Siyoon Jin, Heeseong Shin, Jung Yi, Yunjin Park, Chulmin Park, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) AIPARK

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 提出Lip Forcing,首个用于视频到视频唇部同步的自回归扩散方法,通过蒸馏14B教师模型为因果学生模型,仅需两步去噪即可实现实时同步,并引入同步窗口DMD、两步推理计划和SyncNet奖励。

Comments Project Page: https://cvlab-kaist.github.io/LipForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10413 2026-06-10 cs.AI 新提交 57%

Soul Computing: A Theoretical Framework and Technical Architecture for Intelligent Agents with Independent Consciousness

灵魂计算:具有独立意识的智能体的理论框架与技术架构

Jinshan Zhang, Xishi Zhou, Qiu Peng, Jianwei Yin

机构 * Innovation and Management Center, School of Software Technology, Zhejiang University (Ningbo)(浙江大学(宁波)软件学院创新与管理中心) School of Software Technology, Zhejiang University, Ningbo(浙江大学软件学院(宁波))

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出“灵魂计算”范式,区分狭义与广义概念,构建以意向性核心为特征的智能体架构,实现AI从工具到生命体的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09738 2026-06-09 cs.CV 新提交 57%

HDSL: A Hierarchical Domain-Specific Language for Structured 3D Indoor Scene Generation and Localized Editing with LLM Agents

HDSL:一种用于结构化3D室内场景生成和基于LLM智能体局部编辑的层次化领域特定语言

Letian Li, Chao Shen, Shuzhao Xie, Chenghao Gu, ZhengXiao He, Yu Meng, Xin Yang, Wenyuan Jiang, Zhi Wang

机构 * SIGS, Tsinghua University(清华大学深圳国际研究生院) Nankai University(南开大学) University of Arizona(亚利桑那大学) Zhejiang University(浙江大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出HDSL语言,以树结构表示室内场景,结合LLM智能体生成、多模态检索和力导向布局优化,实现结构化场景生成与局部编辑,显著提升对象覆盖率和编辑效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07053 2026-06-08 cs.CV cs.LG 新提交 57%

TrioPose: Native Triple-Stream Diffusion Transformers for Pose-Guided Text-to-Image Generation

TrioPose: 用于姿态引导文本到图像生成的原生三流扩散变换器

Dian Gu, Zhengyi Yang

机构 * Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出TrioPose,基于SD3.5M架构的原生三流姿态感知DiT,通过逐层激活和零初始化双残差注入保持预训练稳定性,并设计可学习关系偏置掩码和姿态引导空间损失加权,在多人姿态引导生成中实现SOTA性能,Human-Art上AP达64.33。

Comments 15 pages (9 pages main body, 6 pages references and appendix), 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08545 2026-08-11 cs.RO cs.LG 新提交 50%

Curriculum Generation under Structured Parametric Environments for Robust Navigation Policies

结构化参数环境下用于鲁棒导航策略的课程生成

Prishita Ray

机构 * Cornell University(康奈尔大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文针对结构化参数环境提出重参数化课程生成框架,结合分布偏移正则化,在OpenAI Gym的两类连续控制环境中,显著优于多种基线方法,提升了导航策略的鲁棒性。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07648 2026-08-11 stat.ML cond-mat.dis-nn cond-mat.stat-mech cs.LG physics.comp-ph 新提交 50%

Leveraging generative models to assist Monte Carlo sampling

利用生成模型辅助蒙特卡洛采样

Marylou Gabrié

专题命中 多模态生成 :multimodal(abstract)

AI总结 本教程综述介绍了机器学习与计算统计物理交叉领域的新范式——用生成模型辅助蒙特卡洛采样,探讨相关方法方向及优劣势,为相关领域研究者提供入门基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04475 2026-08-06 cs.HC 新提交 50%

Super-Gaussian: Interactive Scene Editing for 3D Gaussian Splatting and NLI-Based Volume Visualization in Virtual Reality

超高斯:虚拟现实中面向三维高斯溅射与基于自然语言交互的体可视化的交互式场景编辑

Suemin Jeon, Kaiyuan Tang, Chaoli Wang, Won-Ki Jeong

专题命中 多模态生成 :multimodal(abstract)

AI总结 本研究针对VR中体可视化的渲染成本与交互问题,提出Super-Gaussian框架,结合三维高斯溅射、特征感知聚类、分层选择-细化工作流与NLI,实现高效直观的体数据交互编辑与分析

Comments IEEE VIS 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00272 2026-08-04 cs.RO 新提交 50%

Localization in Spatiotemporal Fields via Environmental PDEs

基于环境偏微分方程的时空场定位方法

Jose Fuentes, Abdullah Al Redwan Newaz, Ana Cavalcanti, Leonardo Bobadilla

专题命中 多模态生成 :multimodal(abstract)

AI总结 该研究提出基于PDE控制的环境时空场的定位框架,采用Rao-Blackwellized粒子滤波器分解车辆状态,仿真与实验表明其定位精度优于标准粒子滤波器,验证了环境场用于实际定位的可行性。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27600 2026-07-31 cs.LG 新提交 50%

Back from the Future: Key-Value Cache Management by Counter-Causal Surprise

从未来回溯:基于反事实惊奇的键值缓存管理

Stephen Gould, Anton van den Hengel

机构 * Metacognition AI(元认知人工智能) Australian National University(澳大利亚国立大学) Adelaide University(阿德莱德大学)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 该研究针对LLM的KV缓存内存占用问题,提出基于反事实惊奇的KV驱逐方案及快速单层近似方法,在基准测试中性能优于或可与现有最优方法竞争。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27418 2026-07-31 cs.LG 新提交 50%

Context-Informed Ship Trajectory Prediction via Conditional Attention

基于条件注意力的上下文感知船舶轨迹预测

Yuan Guan, Chandler Squires, Timothy Hu, Pradeep Ravikumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Advanced Technology Laboratories Lockheed Martin(洛克希德·马丁公司先进技术实验室)

专题命中 多模态生成 :multimodal(abstract)

AI总结 该研究提出Conditional Informer架构,通过条件注意力机制编码船舶与环境的物理依赖,结合Modality Masking策略,在AIS与ERA5数据上提升了船舶轨迹预测准确率并降低了传感器故障时的误差。

Comments Accepted for publication at the 2026 29th International Conference on Information Fusion (IEEE FUSION)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21661 2026-07-27 cs.RO 新提交 50%

GRACE: Gradient-Free Robot Action Generation via Combined Diffusion-MPPI Posterior Mean Estimation

GRACE:通过组合扩散-MPPI后验均值估计实现无梯度机器人动作生成

Leesai Park, Jiho HOng, Sanghyun Kim

机构 * School of Mechanical Engineering, Kyung Hee University(庆熙大学机械工程学院) Advanced Institute of Convergence Technology (AICT)(融合技术高级研究院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究提出GRACE方法,通过组合扩散-MPPI后验均值估计,仅用前向成本评估引导预训练扩散策略,构建成本条件引导后验并估计均值,在模拟和真实机器人上验证,比基线方法成功率高,能避免部署时障碍物。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21436 2026-07-24 hep-lat hep-th 新提交 50%

Stochastic Quantization as Optimal Control

作为最优控制的随机量子化

Lingxiao Wang

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究将随机量子化表述为有限时间随机最优控制问题,利用可处理参考过程及参考校正终端成本,通过神经网络学习残余控制实现最优随机量子化,在多峰势和二维晶格标量\(\phi^4\)理论中取得成果,将量子化表述为控制。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15485 2026-07-20 cs.LG math.PR stat.ML 新提交 50%

Diffusion models recover accurate mixture weights despite score function insensitivity

扩散模型即使在得分函数不敏感的情况下也能恢复准确的混合权重

Andrew Dennehy, Ramchandran Muthukumar, Rebecca Willett, Nisha Chandramoorthy

机构 * University of Chicago(芝加哥大学) Data Science Institute(数据科学研究所) Department of Computer Science(计算机科学系)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究基于得分的生成模型在多模态分布中恢复混合权重的问题,通过定义扩散得分敏感性指数,证明其控制目标分布参数估计准确性,还展示了噪声调度对敏感性及模式放大的影响,此框架可用于恢复目标分布的定性参数。

Comments 37 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11631 2026-07-14 stat.CO stat.ML 新提交 50%

Markov Chain Monte Carlo with Diffusion Paths

带扩散路径的马尔可夫链蒙特卡罗

Han Chen, Sifan Liu, Jun Yang

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对多模态分布采样难题,提出沿扩散路径插值的方法,通过变分估计中间得分,引入MAD - Path采样器消除偏差,经谱隙分析明确路径特性,量化误差影响,实验表明其在全局探索和模式权重估计上优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11027 2026-07-14 cs.RO 新提交 50%

SegDiff: Segmented Trajectory Diffusion for Consistent and Adaptive Robot Manipulation

SegDiff:用于一致且自适应机器人操作的分段轨迹扩散

Haidong Cao, Wenjun Cao, Quanhao Li, Sicheng Xie, Zhiying Du, Jiaqi Leng, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University, China(可信具身人工智能研究院,复旦大学,中国) Shanghai Key Laboratory of Multimodal Embodied AI, China(上海多模态具身人工智能重点实验室,中国)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 研究针对机器人模仿学习中现有方法的不足,提出SegDiff闭环视觉运动策略,分解示范为运动段并预测连续轨迹,利用扩散模型等提出动态时间集成机制,在多场景中性能优于现有方法,能处理长时间依赖并保持实时适应与控制稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11018 2026-07-14 cs.RO 新提交 50%

Whole-Body Semantic-to-Actuation Grounding of Elephant-Inspired Soft-Trunk Motion via Lightweight Flow Matching

通过轻量级流匹配实现大象启发式软躯干运动的全身语义到驱动的基础

Tingcong Liu, Tongshun Chen, Siyi Ma, Yuhao Wang, Aye Phyu Phyu Aung, Ibrahim Alsarraj, J. Senthilnath, Bo An, Ke Wu

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对近距离人机交互中类似躯干机器人关联开放词汇响应难的问题,提出基于轻量级流匹配的全身语义到驱动基础框架,将多模态大语言模型响应转换为元组,参数化轨迹并采样运动,实验显示其提升关联正确性、减少推理时间,还提升了人机交互满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10288 2026-07-14 cs.RO 新提交 50%

PIER-Flow: Physics-Informed Efficient Rectified Flow for Real-Time Mobile Robot Navigation

PIER-Flow:用于实时移动机器人导航的物理信息高效整流流

Shibo Li, Zhongcheng Wang, Jiahe Cao, Jianhua Yang, Ke Wu

机构 * School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究针对移动机器人在复杂环境下导航问题,提出PIER-Flow策略。通过将MPC专家知识融入常微分方程,利用并行潜在采样等实现单步动作生成,经物理信息训练目标及异步架构提升性能,在模拟和实际部署中均取得良好效果,显著加速规划并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09587 2026-07-13 cs.RO 新提交 50%

CoDiMAD: Diffusion-Based Privileged Distillation for Communication-Free Multi-Robot Coordination

CoDiMAD:基于扩散的特权蒸馏用于无通信多机器人协调

Jiyue Tao, Shunheng Xin, Tongsheng Shen, Dexin Zhao, Feitian Zhang

机构 * Peking University(北京大学) National Innovation Institute of Defense Technology(国防科技创新研究院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 研究无通信多机器人协调问题,提出CoDiMAD三阶段框架,先训练特权预言机,再构建数据集,最后将预言机蒸馏到学生智能体中,通过扩散反向过程采样动作,实验证明其性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09039 2026-07-13 cs.LG q-bio.QM 新提交 50%

Variable-Length Generative Protein Design via Generalized Poisson Flow

通过广义泊松流进行可变长度生成蛋白质设计

Chaoran Cheng, Zhanghan Ni, Yanru Qu, Yuxin Chen, Ruihan Guo, Jiajun Fan, Ge Liu

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究针对蛋白质设计中可变长度生成的关键问题,引入广义泊松流(GPFlow)框架,通过最小化负对数似然学习速率函数,经多模态评估验证其可变长度生成质量,在多种设计任务中表现出色,提升了蛋白质设计的灵活性与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07967 2026-07-10 stat.ML cs.LG math.OC 新提交 50%

Expressivity and Statistical Trade-offs in Diffusion Policy Learning

扩散策略学习中的表达能力与统计权衡

Viet Vu, Renyuan Xu, Jiacheng Zhang, Yufei Zhang

机构 * Stanford University(斯坦福大学) Chinese University of Hong Kong(香港中文大学) Imperial College London(伦敦帝国理工学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 研究扩散策略学习中表达能力与统计权衡,确定漂移Lipschitz预算K为核心量,通过近似量化表达能力,证明其与统计复杂性的关系,给出有限样本性能差距,数值实验验证,还提出根据样本大小选K及对应神经网络架构的实现原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06262 2026-07-08 cs.RO 新提交 50%

Optimal Transport Q-Learning for Flow Policy Steering and Acceleration

用于流策略引导和加速的最优传输Q学习

Andreas Sochopoulos, Esmeralda S. Whitammer, Nikolaos Tsagkas, João Moura, Michael Gienger, Sethu Vijayakumar

机构 * University of Edinburgh(爱丁堡大学) Honda Research Institute Europe(本田欧洲研究院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对流策略性能优化难题,提出最优传输Q学习(OTQL),利用机器人经验,通过优势加权条件最优传输流匹配微调加速流策略,提升单任务和VLA策略成功率,减少推理步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01214 2026-07-02 cs.HC 新提交 50%

Touching and Feeling the Data: A Reusable Software Pipeline for Tactile Statistical Graphs in Accessible Education

触摸与感受数据:面向无障碍教育的触觉统计图可复用软件流水线

Lawrence Obiuwevwi, Krzysztof J. Rechowicz, Jessica M. Johnson, Erika Frydenlund, Vikas Ashok, Sachin Shetty, Sampath Jayarathna

专题命中 多模态生成 :multi-modal(abstract)

AI总结 提出一种三层可复用软件流水线,在约1500行JavaScript中自动生成触觉统计图,支持盲人和低视力学生通过触觉交互学习数据分析,生成打印文件耗时低于250毫秒。

Journal ref IEEE IRI'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00942 2026-07-02 physics.bio-ph physics.flu-dyn 新提交 50%

Plant-On-a-Disc (POD): A Phytofluidic platform enabling In Situ Root Analysis

Plant-On-a-Disc (POD): 一种实现原位根系分析的植物微流控平台

Kaushal Agarwal, Sumit Kumar Mehta, Pranab Kumar Mondal

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出Plant-on-a-Disc (POD)平台,利用径向微通道设计实现八株幼苗并行培养,在受控水动力条件下进行非侵入式原位多模态分析,揭示水流驱动根系多尺度响应。

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30898 2026-07-01 cond-mat.mtrl-sci physics.chem-ph 新提交 50%

Bridging electrode preparation and electrocatalyst performance with physics-based causal AI

基于物理的因果AI桥接电极制备与电催化剂性能

Evelyna Wang, Linda Hung, Sam Witty, Michaela Burke Stevens, Kevin Tran

专题命中 多模态生成 :multi-modal(abstract)

AI总结 利用物理结构因果模型从多模态小数据集提取电催化剂性能的定量因果见解,分离活性位点与电极厚度的影响。

Comments 36 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31988 2026-07-01 astro-ph.CO astro-ph.IM 新提交 50%

Joint inference of weak lensing convergence map and cosmology with diffusion models

弱引力透镜收敛图与宇宙学的扩散模型联合推断

Benjamin Remy, Chihway Chang, Rebecca Willett

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出基于扩散模型的隐式推断方法,联合推断宇宙学参数和收敛图,无需显式可微前向模型,在模拟数据上验证了后验校准和场统计的正确性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27367 2026-06-26 physics.optics cond-mat.mes-hall physics.chem-ph 新提交 50%

Accessing both electrochemical SEIRA and SERS with ultrasensitive metamaterials for enhanced molecular identification

利用超灵敏超材料同时实现电化学SEIRA和SERS以增强分子识别

Nicolas Spiesshofer, Tabitha Jones, Sarah May Sibug Torres, Zoltan Sztranyovszky, Caleb Todd, Shijie Zhu, Yeeun Roh, Rakesh Arul, Alexander Squires, Ivana Qianqi Lin, Angela Demtriadou, David O. Scanlon, Viv Lindo, Jeremy J. Baumberg

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出一种电化学可清洁的超材料,实现流动中实时联合SEIRA和SERS,通过纳米间隙折射率变化(1400 nm/RIU)实现超灵敏检测,并追踪分子电化学转化和对称性破缺。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11656 2026-06-26 cs.GR 新提交 50%

MoGeFlow: Flowing Through Motion Codebook Geometry for Text-to-Motion Generation

MoGeFlow: 通过运动码本几何流动实现文本到运动生成

Pengcheng Fang, Tengjiao Sun, Xiaoyu Zhan, Xiaohao Cai, Dongjie Fu

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出MoGeFlow模型,利用运动码本的几何结构,通过连续流生成运动码帧,替代离散码预测,在多个基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25754 2026-06-25 cs.RO 新提交 50%

Stage-Aware and Roughness-Constrained Diffusion Policy for Multi-Stage Robotic Polishing

阶段感知与粗糙度约束的扩散策略用于多阶段机器人抛光

Shuai Ke, Jiexin Zhang, Huan Zhao, Zhiao Wei, Yikun Guo, Tiange Wu, Guoqiang Guo, Haoyuan Zhou, Jie Pan, Han Ding

机构 * State Key Laboratory of Intelligent Manufacturing Equipment and Technology, Huazhong University of Science and Technology(华中科技大学智能制造装备与技术国家重点实验室) Shanghai Spaceflight Precision Machinery Institute(上海航天精密机械研究所)

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出阶段感知与粗糙度约束扩散策略(SRDP),通过多模态观测推断阶段后验并约束去噪过程,实现无外部标签的阶段一致动作生成,提升多阶段抛光质量。

详情

展开后加载摘要…

URL PDF HTML 收藏