arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-22 至 2026-04-22 共收录 74 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 6 篇

2506.18871 2026-04-22 cs.CV cs.AI cs.CL 82%

OmniGen2: Towards Instruction-Aligned Multimodal Generation

OmniGen2:面向指令对齐的多模态生成

Chenyuan Wu, Pengfei Zheng, Ruiran Yan, Shitao Xiao, Xin Luo, Yueze Wang, Wanli Li, Xiyan Jiang, Yexin Liu, Junjie Zhou, Ze Liu, Ziyi Xia, Chaofan Li, Haoge Deng, Jiahao Wang, Kun Luo, Bo Zhang, Defu Lian, Xinlong Wang, Zhongyuan Wang, Tiejun Huang, Zheng Liu

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Science and Technology of China(中国科学技术大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 OmniGen2通过双解码路径和解耦图像分词器,实现文本和图像生成的统一解决方案,提升多模态生成任务的性能与一致性,同时提供开源模型和数据集支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19544 2026-04-22 cs.AI 79%

DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling

DT2IT-MRM:去偏偏好构建与迭代训练用于多模态奖励建模

Zhihong Zhang, Jie Zhao, Xiaojian Huang, Jin Xu, Zhuodong Luo, Xin Liu, Jiansheng Wei, Xuejin Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出DT2IT-MRM方法,通过去偏偏好构建、文本到图像偏好数据重构和迭代训练框架,解决多模态奖励建模中偏好数据的偏差、噪声和不一致问题,并在三个基准测试中取得新突破。

Comments code will be uploaded to https://github.com/zhang123434/DT2IT-MRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19135 2026-04-22 cs.CV 79%

Diff-SBSR: Learning Multimodal Feature-Enhanced Diffusion Models for Zero-Shot Sketch-Based 3D Shape Retrieval

Diff-SBSR: 学习多模态特征增强的扩散模型用于零样本素描基础3D形状检索

Hang Cheng, Fanhe Dong, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出利用文本到图像扩散模型解决零样本素描基础3D形状检索问题,通过多模态特征增强策略提升语义上下文捕捉能力,实验表明方法在公开基准上优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19105 2026-04-22 cs.CV 57%

EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation

视角运动:层次推理与扩散用于中心视觉-语言运动生成

Ruibing Hou, Mingyue Zhou, Yuwei Gui, Mingshuang Luo, Bingpeng Ma, Hong Chang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(智能信息处理重点实验室,计算技术研究所(ICT),中国科学院(CAS)) Jilin University (JLU)(吉林大学(JLU)) Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学(BUPT)) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EgoMotion框架,通过层次推理和扩散模型生成基于第一视角视觉和语言指令的3D人类运动,解决语义推理与运动建模的协同优化问题,提升多模态接地和运动质量。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18967 2026-04-22 cs.CV 57%

Toward Clinically Acceptable Chest X-ray Report Generation: A Qualitative Retrospective Pilot Study of CXRMate-2

迈向临床可接受的胸部X光报告生成:CXRMate-2的定性回顾性试点研究

Aaron Nicolson, Elizabeth J. Cooper, Hwan-Jin Yoon, Claire McCafferty, Ramya Krishnan, Michelle Craigie, Nivene Saad, Jason Dowling, Ian A. Scott, Bevan Koopman

机构 * organization= Australian e-Health Research Centre, CSIRO Health organization= Princess Alexandra Hospital, Metro South Health , city= Brisbane , country= Australia organization= Queensland Digital Health Centre, University of Queensland , city= Brisbane , country= Australia Informatics Directorate, Metro South Hospital organization= School of Electrical Engineering Computer Science, University of Queensland , city= Brisbane , country= Australia

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CXRMate-2模型,通过结构化多模态条件与强化学习实现胸部X光报告生成,经多数据集验证在性能和临床可接受性上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17072 2026-04-22 cs.MA 50%

CogGen: A Cognitively Inspired Recursive Framework for Deep Research Report Generation

CogGen:一种受认知启发的递归框架用于深度研究报告生成

Kuo Tian, Pengfei Sun, Zhen Wu, Junran Ding, Xinyu Dai

专题命中 多模态生成 :multimodal(abstract)

AI总结 CogGen通过递归架构模拟认知写作,实现灵活规划与全局重构,引入抽象视觉表示和认知负荷评估框架,提升多模态内容生成质量。

Comments 28 pages, 3 figures, Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 18 篇

2604.18164 2026-04-22 cs.CL cs.AI cs.CV 91%

MM-JudgeBias: A Benchmark for Evaluating Compositional Biases in MLLM-as-a-Judge

MM-JudgeBias:一个评估MLLM-as-a-Judge中组合偏见的基准

Sua Lee, Sanghee Park, Jinbae Im

机构 * Seoul National University(首尔国立大学) NAVER Cloud AI(NAVER云AI) KAIST AI(韩国科学技术院人工智能实验室)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MM-JudgeBias基准,通过引入控制扰动和两个互补指标,评估MLLM-as-a-Judge中的组合偏见,揭示了九种偏见类型,并发现现有模型存在模态忽视和评估倾向性问题。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11665 2026-04-22 cs.CL 85%

Multi-Task Reinforcement Learning for Enhanced Multimodal LLM-as-a-Judge

多任务强化学习用于增强多模态大语言模型作为裁判

Junjie Wu, Xuan Kan, Zihao He, Shunwen Tan, Bo Pan, Kaitai Zhang

机构 * Meta AI Hong Kong University of Science and Technology(香港科技大学) Emory University(埃默里大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出MT-RL-Judge框架,通过多任务强化学习优化多模态大语言模型作为裁判,提升判断一致性和与人类偏好的相关性,并在分布外任务中展现鲁棒泛化能力。

Comments ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18829 2026-04-22 cs.CV 83%

DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

DUALVISION:用于鲁棒视觉推理的RGB-红外多模态大语言模型

Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao, Hongcheng Wang, Jianglin Lu, Yin Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon(亚马逊) Northeastern University(东北大学)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出DUALVISION,通过局部化交叉注意力融合IR-RGB信息,提升多模态大语言模型在视觉退化条件下的性能,并引入DV-204K和DV-500数据集进行评估。

Comments Accepted at CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06211 2026-04-22 cs.CL cs.AI cs.CV 82%

PuzzleWorld: A Benchmark for Multimodal, Open-Ended Reasoning in Puzzlehunts

PuzzleWorld: 一个用于谜题 hunt 中多模态、开放式推理的基准

Hengzhi Li, Justin Zhang, Brendon Jiang, Alexander Naehu, Regan Song, Megan Tjandrasuwita, Chanakya Ekbote, Steven-Shine Chen, Adithya Balachandran, Wei Dai, Rebecca Chang, Paul Pu Liang

机构 * MIT Media Lab and MIT EECS(MIT媒体实验室和MIT电子工程与计算机科学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 PuzzleWorld 是一个包含667个谜题 hunt 风格问题的基准,用于评估逐步、开放式和创造性多模态推理。每个谜题都标注了最终答案、详细推理轨迹和认知技能标签,揭示了当前模型在推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19567 2026-04-22 cs.AI 79%

Multi-modal Reasoning with LLMs for Visual Semantic Arithmetic

基于LLM的多模态推理用于视觉语义算术

Chuou Xu, Liya Ji, Qifeng Chen

专题命中 多模态评测 :multi-modal(title);cross-modal(abstract);分类 cs.AI

AI总结 本文提出两种新型任务和IRPD数据集,通过SAri-RFT方法提升大视觉语言模型的跨模态关系推理能力,实现视觉语义算术的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02384 2026-04-22 cs.CV 79%

SMART-Ship: A Comprehensive Synchronized Multi-modal Aligned Remote Sensing Targets Dataset and Benchmark for Berthed Ships Analysis

SMART-Ship:一个综合的同步多模对齐遥感目标数据集和基准,用于靠泊船舶分析

Chen-Chen Fan, Peiyao Guo, Linping Zhang, Kehan Qi, Haolin Huang, Yong-Qiang Mao, Yuxi Suo, Zhizhuo Jiang, Yu Liu, You He

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出SMART-Ship数据集,包含多模遥感图像,用于靠泊船舶分析,通过精细标注支持多模遥感任务,并评估了代表性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00993 2026-04-22 cs.CV 79%

PhotoFramer: Multi-modal Image Composition Instruction

PhotoFramer:多模态图像构图指令

Zhiyuan You, Ke Wang, He Zhang, Xin Cai, Jinjin Gu, Tianfan Xue, Chao Dong, Zhoutong Zhang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Adobe NextCam Adobe Research Shanghai AI Laboratory(上海人工智能实验室) CPII under InnoHK(InnoHK下的CPII) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 PhotoFramer通过多模态框架为用户提供图像构图指导,通过自然语言描述改进方法并生成示例图像,结合文本与图像生成模型提升日常用户构图能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16032 2026-04-22 cs.SE 78%

DeepFWI: Identifying Bug-Sensitive Warnings with Multi-Modal Code-Warning Semantics

DeepFWI:基于多模态代码-警告语义的 bug 敏感警告识别

Han Liu, Jian Zhang, Cen Zhang, Xiaohan Zhang, Kaixuan Li, Sen Chen, Shang-Wei Lin, Yixiang Chen, Xinhua Li, Yang Liu

专题命中 多模态评测 :multi-modal(title,abstract)

AI总结 本文提出 DeepFWI,通过多模态语义学习识别细粒度的 bug 敏感警告,采用 LSTM 模型捕捉代码与警告的关联,实验表明其在 F1-score 上优于基线方法。

Comments Accepted by TSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18740 2026-04-22 cs.CV 77%

Autonomous Skeletal Landmark Localization towards Agentic C-Arm Control

自主骨骼标志点定位以实现智能C臂控制

Jay Jung, Ahmad Arrabi, Jax Luo, Scott Raymond, Safwan Wshah

机构 * University of Vermont(佛蒙特大学) Cleveland Clinic(克利夫兰诊所)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文研究了利用多模态大语言模型实现C臂控制中骨骼标志点的自主定位,通过实验验证了其在准确性和推理能力上的优势,为智能C臂控制提供了新方法。

Comments Accepted at IJCARS: IPCAI 2026. Int J CARS (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22737 2026-04-22 cs.CV 77%

Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models

Lingua-SafetyBench: 一个多语言视觉-语言模型安全评估基准

Enyi Shi, Pengyang Shao, Yanxin Zhang, Chenhang Cui, Jiayi Lyu, Xiaobo Xia, Fei Shen, Tat-Seng Chua

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) School of Engineering Science, University of the Chinese Academy of Sciences(中国科学院工程科学学院) NExT++ Research Centre, National University of Singapore(新加坡国立大学NExT++研究中心)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出Lingua-SafetyBench,通过10万多个多语言图像-文本对评估多模态模型的安全性,发现非高资源语言和非拉丁文在文本主导风险下安全性更差,强调需要专门的语言和模态对齐策略以提升安全性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08620 2026-04-22 cs.AI cs.CV 62%

ViDoRe V3: A Comprehensive Evaluation of Retrieval Augmented Generation in Complex Real-World Scenarios

ViDoRe V3:对复杂现实场景中检索增强生成的综合评估

António Loison, Quentin Macé, Antoine Edy, Victor Xing, Tom Balough, Gabriel Moreira, Bo Liu, Manuel Faysse, Céline Hudelot, Gautier Viaud

机构 * Illuin Technology(Illuin技术公司) NVIDIA CentraleSupélec, Paris-Saclay(巴黎萨克雷中央理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ViDoRe V3是一个多模态检索增强生成基准,涵盖10个专业领域数据集,通过12000小时人工标注评估先进RAG管道,发现视觉检索优于文本检索,晚期交互模型和文本重排序显著提升性能,但模型在非文本元素、开放性查询和细粒度视觉定位上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16822 2026-04-22 cs.CV cs.AI 62%

ReefNet: A Large-Scale Dataset and Benchmark for Fine-Grained Coral Reef Recognition

ReefNet:一个大规模数据集和基准,用于细粒度珊瑚礁识别

Abdulwahab Felemban, Yahia Battach, Faizan Farooq Khan, Yuqian Fu, Xuhui Liu, Yesmeen M. Khattab, Yousef A. Radwan, Xiang Li, Fabio Marchese, Sara Beery, Burton H. Jones, Francesca Benzoni, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology (KAUST)(国王阿卜杜勒·阿齐兹科技大学) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出ReefNet,一个大规模珊瑚礁图像数据集,用于细粒度识别。通过专家验证和过滤,构建了高置信度基准子集,揭示了多模态模型在生物多样性监测中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07966 2026-04-22 cs.CV cs.CL 62%

Visual-TableQA: Open-Domain Benchmark for Reasoning over Table Images

视觉-表格问答:面向表格图像推理的开放领域基准

Boammani Aser Lompo, Marc Haraoui

机构 * École de Technologie Supérieure(埃克塞技术学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出Visual-TableQA,一个大规模开放领域多模态数据集,用于评估和提升视觉推理能力,包含2500个LaTeX渲染表格和6000对推理密集型问答对,通过多模型协作生成,验证了模型在外部基准上的鲁棒性。

Comments Accepted at the First Workshop on Foundations of Reasoning in Language Models, NeurIPS 2025. Available at: https://openreview.net/forum?id=fvJRsGwhPf

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19405 2026-04-22 cs.CL 57%

Lost in Translation: Do LVLM Judges Generalize Across Languages?

迷失在翻译中:大型视觉-语言模型(LVLM)的评判者是否能跨语言泛化?

Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem, Amran Bhuiyan, Mizanur Rahman, Shafiq Joty, Enamul Hoque, Jimmy Huang

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce AI研究)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出MM-JudgeBench,首个多语言多模态评判模型评估基准,包含60000+跨25种语言的配对偏好实例,揭示了LVLM评判器在跨语言性能上的显著差异,指出模型大小和架构并非多语言鲁棒性的良好预测因素。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13571 2026-04-22 cs.CV 57%

Radar-Informed 3D Multi-Object Tracking under Adverse Conditions

基于雷达的三维多目标跟踪在恶劣条件下的应用

Bingxue Xu, Emil Hedemalm, Ajinkya Khoche, Patric Jensfelt

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RadarMOT框架,利用雷达点云提升远距离目标跟踪精度,在MAN-TruckScenes数据集上提升了AMOTA指标12.7%和10.3%。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18831 2026-04-22 cs.CV cs.RO 57%

Feasibility of Indoor Frame-Wise Lidar Semantic Segmentation via Distillation from Visual Foundation Model

基于视觉基础模型的知识蒸馏的室内点云语义分割可行性

Haiyang Wu, Juan J. Gonzales Torres, George Vosselman, Ville Lehtola

机构 * 1 Department of Earth Observation Science, Faculty of Geo-Information Science Earth Observation (ITC), University of Twente, 7522 NB Enschede, The Netherlands

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文探讨了通过知识蒸馏从视觉基础模型中学习的方法,用于室内点云语义分割,展示了在无人工标注的情况下,该方法在室内场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12606 2026-04-22 cs.CV 57%

Pixels or Positions? Benchmarking Modalities in Group Activity Recognition

像素还是位置?群组活动识别中模态的基准测试

Drishya Karki, Merey Ramazanova, Anthony Cioppa, Silvio Giancola, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(卡布斯国王科技大学) University of Liège(利耶大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SoccerNet-GAR数据集,通过2022年世界杯64场比赛的广播视频和玩家跟踪数据,评估视频和跟踪模态在群组活动识别中的性能,提出基于图神经网络的跟踪模型,取得更高准确率且更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19643 2026-04-22 cs.RO 50%

A Gesture-Based Visual Learning Model for Acoustophoretic Interactions using a Swarm of AcoustoBots

基于手势的视觉学习模型用于声学聚沉交互的声学机器人群

Alex Lin, Lei Gao, Narsimlu Kemsaram, Sriram Subramanian

机构 * Department of Computer Science University College London London United Kingdom(计算机科学系伦敦大学学院伦敦英国) Department of Artificial Intelligence University of Malaya Kuala Lumpur Malaysia(人工智能系马来大学吉隆坡马来西亚) University College London(伦敦大学学院) University of Malaya(马来大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出基于手势的视觉学习框架,实现无接触人-机器人群交互,通过多模态AcoustoBot平台实现手势识别与触觉、音频、悬浮等模态映射,验证准确率提升至98%。

Comments This paper has been accepted for publication in the Proceedings of the 2026 4th International Conference on Robotics, Control and Vision Engineering (RCVE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 7 篇

2505.20816 2026-04-22 cs.CL 83%

Rethinking Information Synthesis in Multimodal Question Answering A Multi-Agent Perspective

重新思考多模态问答中的信息合成:多智能体视角

Krishna Singh Rajput, Tejas Anvekar, Chitta Baral, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出多智能体框架MAMMQA,通过分解查询、跨模态推理和整合答案,提升多模态问答的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19638 2026-04-22 cs.AI cs.CL cs.RO 81%

SafetyALFRED: Evaluating Safety-Conscious Planning of Multimodal Large Language Models

SafetyALFRED:评估多模态大语言模型的安全意识规划

Josue Torres-Fonseca, Naihao Deng, Yinpei Dai, Shane Storks, Yichi Zhang, Rada Mihalcea, Casey Kennington, Joyce Chai

机构 * University of Michigan(密歇根大学) Boise State University(博伊西州立大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SafetyALFRED,基于ALFRED基准测试,引入六类厨房真实世界危险,评估多模态大语言模型在安全意识规划中的表现,发现静态QA评估不足,需转向强调具身环境中的纠正行动的基准。

Comments Work accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18988 2026-04-22 cs.CV 79%

A Multi-Agent Framework with Structured Reasoning and Reflective Refinement for Multimodal Empathetic Response Generation

一种具有结构化推理和反思细化的多智能体框架用于多模态共情响应生成

Liping Wang, Cheng Ye, Weidong Chen, Peipei Song, Bo Hu, Zhendong Mao

机构 * School of Information Science and Technology, USTC(信息科学与技术学院,中国科学技术大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多智能体框架,通过结构化推理和反思细化提升多模态共情响应生成的准确性与情感感知能力,实验表明优于现有方法。

Comments Submitted to ACM Multimetida 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19081 2026-04-22 cs.SE 78%

Proactive Detection of GUI Defects in Multi-Window Scenarios via Multimodal Reasoning

通过多模态推理主动检测多窗口场景中的GUI缺陷

Xinyao Zhang, Rui Wang, Jinhao Cui, Haotian Huang, Wei Xue, Wenhua Hu, Jianwen Xiang, Rui Hao

专题命中 多模态Agent :multimodal(title,abstract)

AI总结 本文提出一种端到端框架,通过主动触发多窗口状态,利用多模态大语言模型检测定位GUI缺陷,实验表明多窗口设置显著增加布局缺陷暴露,方法在应用和细粒度层面均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18975 2026-04-22 cs.MA 67%

Gated Coordination for Efficient Multi-Agent Collaboration in Minecraft Game

门控协调:Minecraft游戏中的高效多智能体协作

HuaDong Jian, Chenghao Li, Haoyu Wang, Jiajia Shuai, Jinyu Guo, Yang Yang, Chaoning Zhang

专题命中 多模态Agent :MLLM(abstract,abstract_cn)

AI总结 本文提出门控协调机制,通过分离私有状态与公共协调状态,减少通信噪声,提升多智能体在Minecraft中的协作效率与任务完成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09693 2026-04-22 q-bio.TO eess.IV 50%

Glorbit: A Modular, Web-Based Platform for AI Based Periorbital Measurement in Low-Resource Settings

Glorbit:一种模块化、基于网页的AI驱动低资源环境下的眼周测量平台

George R. Nahass, Jacob van der Ende, Sasha Hubschman, Benjamin Beltran, Bhavana Kolli, Caitlin Berek, James D. Edmonds, R. V. Paul Chan, Pete Setabutr, James W. Larrick, Darvin Yi, Ann Q. Tran

专题命中 多模态Agent :multimodal(abstract)

AI总结 Glorbit是一款轻量级网页应用,利用人工智能实现自动化眼周距离测量,适用于低资源临床环境,具备离线模式、本地预处理和云上传功能,通过模拟研究验证了其在不同设备和浏览器上的稳定性和高可用性。

Comments 10 pages, 3 figures, 3 tables

Journal ref JMIR Hum Factors 2026;13:e82859

详情

展开后加载摘要…

URL PDF HTML 收藏