Multimodal Search in Chemical Documents and Reactions
专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract)
Comments 4 pages, 2 figures, SIGIR 2025 Demonstration Submission
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract)
Comments 4 pages, 2 figures, SIGIR 2025 Demonstration Submission
专题命中 多模态Agent :multi-modal(title,abstract);multimodal(abstract)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments This paper has been accepted to the NAACL 2025 Main
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments 25 pages, 13 figures
专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments AAAI-25 (Oral). Project website: https://scai.cs.jhu.edu/projects/MuMA-ToM/ Code: https://github.com/SCAI-JHU/MuMA-ToM
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to AAAI 2025 (Oral)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments https://github.com/declare-lab/Emma-X, https://huggingface.co/declare-lab/Emma-X
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)
专题命中 多模态Agent :MLLM(title,abstract);multi-modal(abstract)
Comments 9 pages, 6 figures; Submitted to IEEE Transactions on Intelligent Transportation Systems
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI、cs.MM
Comments Accepted by ACM Multimedia 2024
专题命中 多模态Agent :multi-modal(title,abstract);multimodal(abstract)
Comments 11 Pages, 5 figures
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态Agent :multi-modal(title,abstract);MLLM(abstract)
Comments This work has been submitted to the IEEE for possible publication
专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments Project Page: https://sunzey.github.io/Make-it-Real/
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments ICML 2024
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI
Comments 17 pages; Accepted by ICML 2024
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS
Comments IROS2023, Detroit. See the project website at https://matcha-agent.github.io
专题命中 多模态Agent :multi-modal(title,abstract);multimodal(abstract)
Comments 9 pages, 9 figures, 1 table, 1 algorithm
记忆驱动的自我表露与关系转折点:人机交互的纵向多模态研究
机构 * Graduate School of Informatics, Kyoto University(京都大学信息学研究科) ; Equmenopolis, Inc.(Equmenopolis公司) ; Waseda University(早稻田大学) ; School of Informatics, Kyoto University(京都大学信息学系)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究通过纵向多模态研究,探讨对话式人工智能系统中交互如何发展为关系。核心方法是让参与者对五个关系构建要素评分,发现对话质量影响当下愉悦感,感知记忆受关系制约,关系有崩溃和激增等转折点,揭示了人机关系建立的方式。
Comments 15 pages, 3 figures. Accepted to ICMI 2026 (International Conference on Multimodal Interaction), October 5-9, 2026, Napoli, Italy
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI;multi-modal(comments)
Comments Accepted to ICCV 2025 Workshop on Multi-Modal Reasoning for Agentic Intelligence
专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV、cs.AI
Comments A multi-modal, ego-centric 3D perception dataset and benchmark for holistic 3D scene understanding. Project page: http://tai-wang.github.io/embodiedscan
超越单摄像头:体育视频理解中的智能多视角推理
机构 * Zhejiang University(浙江大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV
AI总结 针对体育视频多视角理解缺乏评估基准及MLLMs难以利用多视角信息的问题,引入SportMV - Bench基准,分析瓶颈所在,并提出SportMV - Agent框架,通过迭代循环实现主动视角选择等,相比最强MLLM基线有显著提升。
循环代码取证:面向图像伪造检测的代理工具使用
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 多模态Agent :MLLM(summary_cn,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 本文提出ForenAgent框架,通过多轮交互使MLLM自主生成并迭代优化Python工具,提升图像伪造检测的灵活性和可解释性,构建FABench数据集进行系统训练和评估。
Comments 18 pages, 7 figures
Visual Para-Thinker++:用于视觉推理的单策略多智能体框架
机构 * Zhejiang University(浙江大学) ; Hunan University(湖南大学) ; Tianjin University(天津大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Shanghai Jiao Tong University(上海交通大学) ; Jilin University(吉林大学)
专题命中 多模态Agent :MLLM(summary_cn,abstract);分类 cs.CV
AI总结 提出Visual Para-Thinker++框架,通过共享MLLM策略实例化为多个角色智能体并行推理,结合多智能体能力注入和角色解耦优化,有效缓解视觉推理中的早期感知承诺和幻觉问题。