arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-09 至 2026-07-09 共收录 74 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 9 篇

2606.16673 2026-07-09 cs.CV 新提交 79%

MMDiff: Extending Diffusion Transformers for Multi-Modal Generation

MMDiff: 扩展扩散变换器用于多模态生成

Yagmur Akarken, Orest Kupyn, Christian Rupprecht

机构 * University of Oxford, Visual Geometry Group(牛津大学视觉几何组)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出MMDiff框架,利用冻结的扩散变换器通过轻量解码器联合生成图像及多种密集感知模态,发现多时间步特征融合与空间变化聚合权重是关键,在语义分割等任务上取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07507 2026-07-09 cs.CV cs.AI 新提交 62%

HIVE: Understanding Post-Hallucination Reasoning in Vision Language Models

HIVE:理解视觉语言模型中的幻觉后推理

Feng He, Zhenting Wang, Qifan Wang, Qiang Guan, Dongfang Liu, Ruixiang Tang, Qiankun Li

机构 * Purdue University(普渡大学) Rutgers University(罗格斯大学) Meta AI Kent State University(肯特州立大学) Imperial College London(伦敦帝国学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型中幻觉后推理阶段,引入HIVE评估基础设施,通过九个任务和九个模型观察到模态依赖模式,发现幻觉线索能拓宽语义覆盖并重塑推理动态,强调理解此阶段对提升多模态推理系统可靠性和可解释性的重要性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07401 2026-07-09 cs.CV cs.AI cs.LG 新提交 62%

Heterogeneity-Adaptive Diffusion Schrodinger Bridge for PET-Guided Whole-Body MRI Translation

用于PET引导的全身MRI转换的异质性自适应扩散薛定谔桥

Chengbo Wang, Jiacheng Yu, Linjie Bian, Ming Qi, Xiaosheng Liu, Tongtong Che, Jichang Zhang, Shuyu Li, Shaoli Song, Xiuying Wang

机构 * The University of Sydney(悉尼大学) Fudan University Shanghai Cancer Center(复旦大学附属上海肿瘤医院) Beijing Normal University(北京师范大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对PET-MR扫描时间长的问题,提出异质性自适应扩散薛定谔桥(HA-DSB)框架,通过整合视觉语言模型嵌入及PET先验,利用双阶段引导机制,实现全身MRI转换,提升不同区域尤其是病变区域的转换质量。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07117 2026-07-09 cs.CV cs.AI 新提交 62%

Tree-of-Thoughts Reasoning for Text-to-Image In-Context Learning

用于文本到图像上下文学习的思维树推理

Stepanida Alekseeva, Jenifer Kalafatovich, Seong-Whan Lee

机构 * Korea University(韩国大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究文本到图像上下文学习中模型的推理问题,提出思维树推理框架,通过多阶段推理和选择层减轻提示模糊性与组合错误,实验表明该结构化多分支推理能提升图像生成效果,无需额外训练或微调。

Comments 6 pages, 3 figures, 4 tables. Accepted at IEEE SMC 2026. Code available at https://github.com/Pandastep/ToT-T2I-ICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28421 2026-07-09 cs.CV cs.AI 版本更新 62%

JuZhou 1.0 Technical Report: The First Edge-Native Text-to-Image Foundation Model Trained Entirely on China-Developed AI Accelerators

JuZhou 1.0 技术报告:首个完全在中国开发的AI加速器上训练的边缘原生文本到图像基础模型

Ce Chen, Congrui Wang, Yonglin Li, Zhenchen Wan, Mingyang Geng, Junhao Xiao, Zhengpeng Xing, Yaqing Hu, Yao Wu, Zhaoyang Qu, Long Lan, Xinwang Liu, Yingqi Peng, Shijia Li, Zufeng Zhang, Chen Ma, Jingjing Zhou, Xingyu Wang, Qilin Lu, Bin Jiang, Qilin Sun, Shanzhi Gu, Yaoguang Jin, Tongliang Liu, Kede Ma, Yifan Peng

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 提出JuZhou 1.0,一个超轻量级文本到图像基础模型,通过紧凑骨干网络、Rectified Flow训练、DMD2蒸馏和中文语义对齐,实现完全离线设备端运行,性能优于SDXL等模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03360 2026-07-09 math.ST stat.TH 版本更新 50%

Structured drift design for denoising diffusion models

去噪扩散模型的结构化漂移设计

Mahsa Taheri

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出几何感知Ornstein-Uhlenbeck过程,通过方差感知各向异性漂移嵌入数据几何结构,改善扩散模型对多模态、高相关分布的模式分离和相关性保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01894 2026-07-09 cs.LG 版本更新 50%

Bifidelity Parameter Estimation Using Conditional Diffusion Models

使用条件扩散模型的双保真参数估计

Caroline Tatsuoka, Minglei Yang, Dongbin Xiu, Guannan Zhang

机构 * UT-Battelle, LLC(UT-巴特勒公司) US Department of Energy(美国能源部) The Ohio State University(俄亥俄州立大学) Oak Ridge National Laboratory(橡树岭国家实验室) Oak Ridge(橡树岭) Computer Science and Mathematics Division(计算机科学与数学 division)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 针对复杂系统参数估计不确定性量化,提出双保真方法。先构建低保真条件生成模型,特定情况时用其细化采样空间,再训练高保真无条件生成模型,经数值示例和实际应用验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 17 篇

2607.01420 2026-07-09 cs.CL cs.AI cs.CV 新提交 82%

MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering

MultAttnAttrib:长文档问答中的无训练多模态归因

Dang Quang Thien Tran, Quang V. Dang, Vinamra Tyagi, Sai Soorya Rao Veeravalli, Trang Nguyen, Ryan A. Rossi, Franck Dernoncourt, Nedim Lipka, Koustava Goswami, Samyadeep Basu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出无训练归因方法MultAttnAttrib,利用模型预填充、选定注意力头和校准阈值定位证据,并构建多模态归因基准MultAttrEval,实验表明其优于多种方法,匹配GPT 5.4且延迟降低至1/7。

Comments 25 pages (8 main, 17 references + appendix), 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06633 2026-07-09 cs.CV cs.AI 新提交 81%

ProMoE-FL: Prototype-conditioned Mixture of Experts for Multimodal Federated Learning with Missing Modalities

ProMoE-FL:用于具有缺失模态的多模态联邦学习的原型条件专家混合模型

Aavash Chhetri, Bibek Niroula, Eduard Vazquez, Yash Raj Shrestha, Prashnna Gyawali, Loris Bazzani, Binod Bhattarai

机构 * NepAl Applied Mathematics and Informatics Institute(尼泊尔应用数学与信息学研究所) Fogsphere (Redev.AI Ltd)(福格球(Redev.AI有限公司)) University of Lausanne(洛桑大学) West Virginia University(西弗吉尼亚大学) University of Verona(维罗纳大学) University College London(伦敦大学学院) University of Aberdeen(阿伯丁大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态联邦学习中缺失模态问题,提出ProMoE-FL框架,构建全局客户端感知原型库,以原型和模态索引为条件实现专家路由来动态合成缺失特征,在四个胸部X光数据集评估中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03740 2026-07-09 q-bio.QM cs.CV eess.IV 新提交 79%

Triple-Phase Multimodal Knowledge Aggregation Framework for Microbial Keratitis Subtype Diagnosis on Slit-Lamp Photography

基于裂隙灯摄影的微生物性角膜炎亚型诊断三相多模态知识聚合框架

Yiqing Wang, Maria A. Woodward, Ziyun Yang, N. Venkatesh Prajna, Chunming He, Leslie M. Niziol, Mercy Pawar, Ming-Chen Lu, Guillermo Amescua, Rachel Wozniak, Sejal Amin, Abinaya Krishnan, Prabhleen Kochar, Sina Farsiu

机构 * Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) Kellogg Eye Center, Department of Ophthalmology and Visual Sciences, University of Michigan(密歇根大学凯洛格眼科中心,眼科学与视觉科学系) Department of Cornea and Refractive Surgery Services, Aravind Eye Care System(阿瓦因眼科医疗系统角膜与屈光手术部) Bascom Palmer Eye Institute, Department of Ophthalmology, University of Miami Miller School of Medicine(迈阿密大学米勒医学院巴斯科姆·帕勒眼科研究所,眼科学系) Flaum Eye Institute, Department of Ophthalmology, University of Rochester Medical Center(罗切斯特大学医学中心弗劳姆眼科研究所,眼科学系) Department of Ophthalmology, Henry Ford Hospital(亨利福特医院眼科部) Duke Eye Center, Duke University School of Medicine(杜克大学医学院杜克眼科中心)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对传统微生物性角膜炎病原体鉴定慢、成本高的问题,提出融合多模态信息的三相框架实现角膜炎亚型分类,经多中心验证性能优异,跨站点泛化评估更具参考性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06285 2026-07-09 cs.CV 版本更新 79%

MMEarth-Bench: Global Model Adaptation via Multimodal Test-Time Training

MMEarth-Bench:通过多模态测试时训练进行全局模型适配

Lucia Gordon, Serge Belongie, Christian Igel, Nico Lang

机构 * Harvard University, USA(哈佛大学,美国) University of Copenhagen, Denmark(哥本哈根大学,丹麦)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 研究针对地理空间机器学习中现有基准数据集不足,引入含多模态任务的MMEarth-Bench,通过多模态测试时训练方法提升模型性能,改善地理泛化能力。

Comments Published at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06973 2026-07-09 cs.LG 新提交 78%

Rethinking Multimodal Time-Series Forecasting Evaluation

重新思考多模态时间序列预测评估

Haoxin Liu, Yichen Zhou, Rajat Sen, B. Aditya Prakash, Abhimanyu Das

机构 * Georgia Institute of Technology(佐治亚理工学院) Google Research(谷歌研究院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 研究针对现有多模态时间序列预测基准的问题,引入TimesX基准,通过自动数据生成管道获取多样真实世界时间序列。经实证研究发现,一些在现有基准上好的方法在TimesX上可能失败,而利用文本上下文的简单集成方法表现出色。

Journal ref Published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18164 2026-07-09 cs.RO 版本更新 78%

GrandTour: A Legged Robotics Dataset in the Wild for Multi-Modal Perception and State Estimation

GrandTour: 一种用于多模态感知与状态估计的野外腿式机器人数据集

Turcan Tuna, Jonas Frey, Frank Fu, Katharine Patterson, Tianao Xu, Maurice Fallon, Cesar Cadena, Marco Hutter

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Oxford University(牛津大学)

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 GrandTour数据集为多模态感知与状态估计提供了大规模野外腿式机器人数据,支持SLAM和高精度状态估计的研究与开发。

Comments Turcan Tuna, and Jonas Frey contributed equally. Submitted to Sage The International Journal of Robotics Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07708 2026-07-09 cs.CL cs.AI cs.CE cs.LG 新提交 62%

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

通过深度原生结构推理实现准确、跨学科和透明的结构-属性理解

Chen Tang, Yizhou Wang, Jianyu Wu, Lintao Wang, Shixiang Tang, Pengze Li, Encheng Su, Jun Yao, Jiabei Xiao, Yuqi Shi, Jielan Li, Hongxia Hao, Zhangyang Gao, Fang Wu, Ben Fei, Xiangyu Yue, Pan Tan, Bozitao Zhong, Jinouwen Zhang, Aoran Wang, Yan Lu, Jiaheng Liu, Xinzhu Ma, Liang Hong, Mingyue Zheng, Phil Torr, Bowen Zhou, Wanli Ouyang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) University of Sydney(悉尼大学) Nanjing University(南京大学) University of Oxford(牛津大学) The University of Science and Technology of China(中国科学技术大学) Drug Discovery and Design Center, State Key Laboratory of Drug Research, Shanghai Institute of Materia Medica, Chinese Academy of Sciences(药物发现与设计中心、国家药物研究重点实验室、上海中医药材料医学研究所、中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究聚焦利用人工智能解释结构-属性关系的挑战,提出多模态科学基础模型SciReasoner,通过离散化结构信息为可寻址单元进行推理,在多领域基准测试中表现出色,实现准确预测与可解释科学推理的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17298 2026-07-09 cs.CV cs.AI 版本更新 62%

Explain Before You Answer: A Survey on Compositional Visual Reasoning

回答之前先解释:组合视觉推理综述

Fucai Ke, Joy Hsu, Zhixi Cai, Zixian Ma, Xin Zheng, Xindi Wu, Sukai Huang, Weiqing Wang, Pari Delir Haghighi, Gholamreza Haffari, Ranjay Krishna, Jiajun Wu, Hamid Rezatofighi

机构 * Monash University(墨尔本大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Griffith University(格里菲斯大学) Princeton University(普林斯顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 综述2023年至2025年组合视觉推理文献,形式化核心定义,追溯范式转变,编目基准指标,提炼见解、识别挑战并概述方向,为该领域提供统一分类、历史路线图和批判性展望。

Comments Project Page: https://github.com/pokerme7777/Compositional-Visual-Reasoning-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07189 2026-07-09 cs.AI 新提交 57%

Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

人工智能理解成像吗?计算成像任务中智能体人工智能的系统基准测试

Ethan Chung, Chuanjun Zheng, Jasper Tan, Jingxi Li, Haopeng Zhang, Huaijin Chen

机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校) Glass Imaging(玻璃成像公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究人工智能在计算成像任务中的表现,提出ImagingBench基准测试,涵盖五类20个任务及三种评估设置,对多模态系统测试发现智能体模型比专门方法弱,该基准可测差距与跟踪进展。

Comments 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07179 2026-07-09 cs.CV cs.LG 新提交 57%

Comparative Study of Domain-adapted VLMs for General Document Visual Question Answering

用于通用文档视觉问答的领域适应视觉语言模型的比较研究

Miguel Lopez-Duran, Elena Marrero, Julian Fierrez, Marta Robledo-Moreno, Ruben Vera-Rodriguez, Daniel DeAlcala, Aythami Morales, Ruben Tolosana, Oscar Delgado, Alvaro Ortigosa, Javier Ortega-Garcia

机构 * Universidad Autónoma de Madrid (UAM)(马德里自治大学) BiometricsAI(生物识别人工智能)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究对8个开源预训练VLMs在三种文档领域的DocVQA进行全面评估,通过多种评估方式发现其在不同布局性能有差异,参数缩放影响性能,视觉理解是瓶颈,还表明少样本微调能让模型快速适应目标域文档。

Comments 17 pages, 4 figures, accepted at the Automatically Domain-Adapted and Personalized Document Analysis workshop of the ICDAR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06929 2026-07-09 cs.SD cs.AI 新提交 57%

MADB: A Large-Scale Music Aesthetics Dataset with Professional and Multi-Dimensional Annotations

MADB:一个具有专业和多维度注释的大规模音乐美学数据集

Sirui Zhang, Tianle Wang, Xinyi Tong, Peiyang Yu, Jishang Chen, Liangke Zhao, Haoxin Zhang, Duo Xu, Xin Jin, Feng Yu, Songchun Zhu

机构 * Central Conservatory of Music, China(中央音乐学院) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Tianjin Conservatory of Music(天津音乐学院) Beijing Electronic Science and Technology Institute(北京电子科技研究所) Peking University(北京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究音乐美学评估问题,引入含9999首曲目、由30名注释者标注的MADB数据集,通过多预训练模型建立统一评估框架,揭示模型与人类判断差距,为音乐理解提供新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06838 2026-07-09 cs.CV 新提交 57%

WildCity: A Real-World City-Scale Testbed for Rendering, Simulation, and Spatial Intelligence

WildCity:用于渲染、模拟和空间智能的真实世界城市规模测试平台

Xiangyu Han, Mengyu Yang, Jiaqi Li, Bowen Chang, Ziyu Chen, Hexu Zhao, Rahul Kumar Agrawal, Anthony Rodriguez, Fiona Hua, Marco Pavone, Chen Feng, Yiming Li

机构 * May Mobility(五月出行公司) New York University(纽约大学) NVIDIA(英伟达公司) Stanford University(斯坦福大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对人工智能在构建城市规模空间表征方面的挑战,引入WildCity真实世界多模态数据集,建立重建基线并转化为模拟器,分析关键挑战,推动城市规模渲染及相关人工智能发展。

Comments ECCV 2026; Project Page: https://han-xiangyu.github.io/Wild-City/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06691 2026-07-09 cs.CV 新提交 57%

CoMind: Understanding Collaborative Human Activity from Multiple Minds and Views

CoMind:从多视角理解人类协作活动

Alexey Gavryushin, Dingxi Zhang, Zhao Huang, Alexandros Delitzas, Jiaqi Chen, Ben Ellis, Cedric Zöllner, Manthan Patel, Manuel Kaufmann, Marc Pollefeys, Xi Wang

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Informatics(马克斯·普朗克信息研究所) Microsoft Switzerland(微软瑞士公司) TU Munich(慕尼黑工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 研究旨在填补人类协作认知过程研究空白,引入CoMind数据集,整合多模态数据并标注,建立相关基准,有助于开发和评估能建模复杂社会互动及推理人类行为的AI系统。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07519 2026-07-09 cs.LG math.ST stat.TH 新提交 50%

Gradient-free Riemannian Langevin Sampler

无梯度黎曼朗之万采样器

Ricardo Baptista, Olivier Zahm

机构 * University of Toronto(多伦多大学) UGA, Inria, CNRS, Grenoble INP*, LJK(格勒诺布尔大学、法国国家信息与自动化研究所、法国国家科学研究中心、格勒诺布尔国立综合理工学院、数值模拟与知识工程实验室)

专题命中 多模态评测 :multimodal(abstract)

AI总结 研究多模态概率分布采样问题,提出无梯度黎曼朗之万采样器(GRiLS),通过引入黎曼度量改善探索,无需目标密度梯度评估,适用于复杂目标,用相互作用粒子系综估计均值和协方差,实证显示其混合效果优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06318 2026-07-09 cs.SI 版本更新 50%

The Schwurbelarchiv: a German Language Telegram dataset for the Study of Conspiracy Theories

Schwurbelarchiv:一个用于研究阴谋论的德语Telegram数据集

Mathias Angermaier, Elisabeth Hoeldrich, Jana Lasser, Joao Pinheiro Neto

专题命中 多模态评测 :multimodal(abstract)

AI总结 该研究构建了一个包含5800个群组和6300万条消息的Telegram数据集,通过解析和清洗原始数据,提供了研究德语阴谋论 discourse 的研究级资源。

Comments This paper is 20 pages, 2 figures, 4 tables, and one dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14590 2026-07-09 cs.LG 版本更新 50%

Counterfactual Modeling with Fine-Tuned LLMs for Health Intervention Design and Sensor Data Augmentation

基于微调大语言模型的反事实建模用于健康干预设计与传感器数据增强

Shovito Barua Soumma, Asiful Arefeen, Stephanie M. Carpenter, Melanie Hingle, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) School of Nutritional Sciences and Wellness, University of Arizona(亚利桑那大学营养科学与健康学院)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文研究利用微调后的大型语言模型生成高质量反事实解释,用于健康干预设计和传感器数据增强,实验表明LLM生成的反事实能有效提升模型性能,具有临床应用价值。

Comments IEEE Open Journal of Engineering in Medicine and Biology (Volume: 7), Date of Publication: 28 May 2026. Page(s): 232-240

Journal ref IEEE Open Journal of Engineering in Medicine and Biology (Volume: 7), Date of Publication: 28 May 2026. Page(s): 232-240; Electronic ISSN: 2644-1276

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08366 2026-07-09 econ.GN q-fin.EC 版本更新 50%

A data fusion approach for mobility hub impact assessment and location selection: integrating hub usage data into a large-scale mode choice model

一种用于移动枢纽影响评估和选址的数据融合方法:将枢纽使用数据整合到大规模出行选择模型中

Xiyuan Ren, Joseph Y. J. Chow

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出一种数据融合方法,将移动枢纽使用数据整合到大规模出行选择模型中,评估枢纽对出行需求、出行方式转换、减少车辆行驶里程和增加消费者剩余的影响。

Journal ref Transportation Research Part A, 211 (2026), 105138

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 5 篇

2607.07108 2026-07-09 cs.IR 新提交 85%

Seeing and Reflecting: Multimodal Memory-Enhanced Agent Collaboration for Recommendation

视觉与反思:用于推荐的多模态记忆增强智能体协作

Hao Cong, Huizu Lin, Zihan Wang, Chengkai Huang, Quan Z. Sheng, Lina Yao

专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 针对基于LLM的推荐系统局限,提出MMEACR框架,采用双轨记忆架构,通过属性引导机制更新记忆,构建多模态嵌入记忆,经加权倒数排名融合两轨道,实验证明其在多领域表现出色,尤其视觉推荐场景有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06964 2026-07-09 cs.RO cs.AI 新提交 79%

End-to-End LLM Flight Planning with RAG-based Memory and Multi-modal Coach Agent

基于基于检索增强生成的记忆和多模态教练代理的端到端大语言模型飞行规划

Amin Tabrizian, Arsyi Aziz, Aarifah Ullah, Mahyar Ghazanfari, Pouria Razzaghi, Peng Wei

机构 * George Washington University(乔治华盛顿大学) Metis Solutions Technology Inc

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 针对电动垂直起降飞机部署中传统飞行规划算法难以融入人类偏好的问题,提出FRAMe工具,集成规划器LLM、多模态教练代理和基于RAG的记忆,在多场景演示中效果最佳,能将自然语言指令转化为优质飞行路线。

Comments Accepted at the ICML 2026 LM4Plan Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07357 2026-07-09 cs.RO cs.AI 新提交 57%

HumAIN: Human-Aware Implicit Social Robot Navigation

HumAIN:人类感知的隐式社交机器人导航

Daeun Song, Nhat Le, Jeffrey Chen, Mohammad Nazeri, Amirreza Payandeh, Rohan Chandra, Reuth Mirsky, Ross Mead, Ling Xiao, Xuesu Xiao

机构 * Ewha Womans University(梨花女子大学) George Mason University(乔治梅森大学) University of Virginia(弗吉尼亚大学) Tufts University(塔夫茨大学) Semio(Semio公司) Hokkaido University(北海道大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 研究提出HumAIN框架,通过知识蒸馏将隐式社交线索融入机器人导航规划。利用基于Transformer的教师模型学习强大表示,蒸馏到轻量级学生模型。实验表明该方法能有效提升轨迹预测指标,在资源受限平台实现类人导航意识。

Comments 8 pages, 4 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06957 2026-07-09 cs.RO cs.LG 新提交 50%

Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation

Flow-ERD:用于多样化交通模拟的基于熵正则化蒸馏的智能体类型感知流匹配

Seulbin Hwang, Kiyoung Om, Daejung Kim, Jinhan Lee

机构 * NAVER LABS Corp.(NAVER实验室公司)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 为解决交通模拟中多样性未被充分探索的问题,提出Flow-ERD模拟器,其核心方法是智能体类型感知流匹配与熵正则化蒸馏,能联合追求现实性和多样性,在测试基准中排名第一,主导帕累托前沿。

Comments 8 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06700 2026-07-09 cs.RO 新提交 50%

CILC: Cryptographically-secure Inter-agent Loop Closure Candidate Detection for Multi-Agent Collaborative SLAM

CILC:用于多智能体协作SLAM的加密安全的智能体间闭环候选检测

Andrew Fishberg, Yixuan Jia, Jonathan P. How

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究多智能体协作SLAM中智能体间闭环候选检测问题,提出CILC系统,利用安全多方计算仅对隐私敏感且计算量轻的GD相似性比较步骤进行加密处理,在模拟和硬件实验中验证其能保持实时性、通信可行并减轻信息泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 7 篇

2607.07438 2026-07-09 cs.CV 新提交 83%

Two-Stage Multi-Modal Fusion with Adaptive Alignment for Action Quality Assessment

用于动作质量评估的具有自适应对齐的两阶段多模态融合

Kanglei Zhou, Ruizhi Cai, Xinning Wang, Yijian Zheng, Liyuan Wang, Jianguo Li, Xiaohui Liang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Children’s Hospital, Capital Institute of Pediatrics(首都儿科研究所附属儿童医院) Zhongguancun Laboratory(中关村实验室)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究动作质量评估问题,提出两阶段多模态融合框架DualAlign,通过自适应对齐解决跨模态错位等挑战,引入MM-JDM数据集,实验表明该框架在多模态评估中表现出色,相比现有方法有显著提升且在特定条件下稳健。

Comments Accepted to IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏