Multimodal Dynamic Journey Planning
专题命中 多模态Agent :multimodal(title,abstract)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态Agent :multimodal(title,abstract)
专题命中 多模态Agent :multimodal(title,abstract)
专题命中 多模态Agent :multimodal(title,abstract)
Comments 39th Annual International Conference of the IEEE Engineering in Medicine and Biology Society
专题命中 多模态Agent :multimodal(title,abstract)
Comments Scaling Up Reinforcement Learning (SURL) Workshop @ European Machine Learning Conference (ECML)
专题命中 多模态Agent :multi-modal(title);multimodal(abstract)
Comments in Scientific Reports 2015
专题命中 多模态Agent :multimodal(title);multi-modal(abstract)
专题命中 多模态Agent :multimodal(title,abstract)
Comments Minor rewrites
专题命中 多模态Agent :multimodal(title,abstract)
Journal ref Proc. R. Soc. B (2007) 274, 347-357
专题命中 多模态Agent :multimodal(title,comments);分类 cs.CL、cs.AI
Comments propaganda, hate-speech, disinformation, misinformation, fake news, LLMs, GPT-4, multimodality, multimodal LLMs
ForgeryVCR: 通过高效的取证工具在MLLMs中实现视觉中心推理用于图像伪造检测与定位
机构 * Shenzhen University(深圳大学) ; Tencent Youtu Lab(腾讯优图实验室)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 ForgeryVCR通过高效的取证工具实现视觉中心推理,提升图像伪造检测与定位的性能。
无幻觉的GUI定位:基于无回归的布局感知匹配
机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 该研究提出无回归框架,通过解耦指令理解与布局感知定位,在ScreenSpot-Pro和Mind2Web数据集上显著提升GUI定位的准确率、成功率及元素选择率,抑制了坐标幻觉。
UI-MOPD:用于持续GUI智能体学习的多平台策略蒸馏
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Xiaomi(小米) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Zhejiang University(浙江大学) ; Peng Cheng Laboratory(鹏城实验室)
专题命中 多模态Agent :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对构建多平台GUI智能体的挑战,构建高质量数据集Uni-GUI,提出UI-MOPD方法,通过多教师策略蒸馏实现持续学习,动态选教师并转移行为先验,实验证明其能平衡跨平台能力保留与新平台适应。
Comments Technical report. 27 pages, 7 figures, 7 tables
PhysAgent:用于可靠远程心率估计的多智能体框架
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 PhysAgent是一种推理时多智能体候选验证框架,以多个基础rPPG估计器输出为待验证生理假设,结合Qwen3-VL-4B多模态大语言模型推理与确定性融合,提升远程心率估计的稳定性与可靠性。
Beacon:智能体何时及如何执行智能体视觉推理
机构 * Peking University(北京大学) ; Kling Team(Kling团队) ; HKUST(GZ)(香港科技大学(广州)) ; CUHK(香港中文大学) ; ZJU(浙江大学) ; THU(清华大学)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本研究针对现有智能体视觉推理模型模式适应性有限、工具增益被损害抵消的问题,提出Beacon模型,通过强化学习相关机制提升性能与适应性,在多基准上表现优异。
Comments 33 pages
超越缩放:学习用于超高分辨率遥感的多工具视觉推理
机构 * National University of Defense Technology(国防科技大学) ; Wuhan University(武汉大学) ; Tsinghua University(清华大学)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 针对超高分辨率遥感图像给多模态大语言模型带来的挑战,提出GeoMTVR数据集,结合监督微调与以工具注意力为重点的强化学习算法开发GeoLens,实验证明其在多工具视觉推理方面优于直接推理和单工具放大基线。
自进化智能体图像恢复:通过深思熟虑的规划与直觉执行
机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Life Sciences, Tsinghua University(清华大学生命科学学院) ; Intelligent Science & Technology Academy of CASIC(中国科学院 CASIC 智能科学与技术学院)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出SEAR框架,将图像恢复建模为序列决策问题,采用直觉执行器与深思熟虑规划器,结合剪枝感知蒙特卡洛树搜索和自进化情景记忆,解决贪婪搜索和信息利用不足问题。
DocArena:将原始文档转化为可控的训练环境用于文档搜索代理
机构 * Rochester Institute of Technology(罗切斯特理工学院) ; Adobe Research(Adobe研究院)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出DocArena自动化流程,通过多模态文档结构化、推理型QA对构建和质量控制,生成可控训练环境,使基于文本LLM的搜索代理在多模态文档检索和问答中取得最佳性能。
Comments search agent for documents
OmniSpace: 自动驾驶多模态大语言模型的高效几何感知
机构 * University of Arkansas(阿肯色大学) ; Google Research, Google(谷歌研究院) ; University of Liverpool(利物浦大学) ; Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究所)
专题命中 多模态Agent :MLLM(summary_cn);multimodal(abstract);分类 cs.CV
AI总结 提出OmniSpace,一种即插即用的几何感知范式,通过相机位姿注入器、多视图极线注意力模块和3D几何蒸馏目标,从纯2D观测中提升MLLM的空间推理能力,在多个自动驾驶基准上超越现有方法。
HDRAgent: 一种用于多曝光HDR成像的智能体框架
机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) ; Shenzhen Research Institute, Northwestern Polytechnical University(西北工业大学深圳研究院) ; Zhejiang University(浙江大学) ; Camera Group, DJI(大疆相机部门)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出首个智能体驱动的HDR成像框架HDRAgent,通过细粒度上下文知识匹配、感知-失真反馈机制和智能体引导的生成对齐策略,自适应选择重建策略,减少复杂动态场景中的鬼影和局部伪影。
PathoSage:通过经验感知的代理工作流实现病理学多源证据裁决
机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) ; Department of Pathology and Institute of Clinical Pathology, West China Hospital, Sichuan University(四川大学华西医院病理科/临床病理研究所) ; Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) ; School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 提出PathoSage框架,通过结构化证据审议和Beta-Bernoulli经验系统,独立评估工具证据并解决冲突,减少幻觉和分类器分歧,提升病理学推理鲁棒性。
EvoIR-Agent: 通过经验驱动学习实现自进化图像修复智能体
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出EvoIR-Agent,通过经验驱动学习解决图像修复中经验不足导致的规划失败问题,通过构建分层经验池和自进化机制提升修复性能和效率,实验表明其在全参考指标上表现优异,且在性能与效率之间取得显著平衡。
Comments Temporarily withdrawn for institutional clearance and compliance review. A revised version will be uploaded once the process is finalized
任意场景检测:一种具有经验感知推理的目标检测智能体框架
机构 * Keio University(Keio大学) ; Tsinghua University(清华大学)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出DetAS/DetAS-X智能体框架,利用多模态大语言模型自适应组合恢复模块和专用检测器,通过自进化经验积累实现经验感知推理,在六个基准上平均F1提升28.36%。
AgentHijack:基准测试计算机使用智能体对常见环境干扰的鲁棒性
机构 * TMLR Group, Hong Kong Baptist University(香港 Baptist 大学 TMLR 团体) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Sydney AI Centre, The University of Sydney(悉尼大学 AI 中心) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 提出AgentHijack基准,通过9种可配置的常见环境干扰评估多模态大语言模型驱动的计算机使用智能体的鲁棒性,并设计AgentHijack-Agent框架提升其抗干扰能力。
Comments accepted by ICML 2026
通过多角色编排实现可扩展的轻量级GUI代理
机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可及感知与智能系统重点实验室,浙江大学) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; AntGroup(蚂蚁集团)
专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 本文提出LAMO框架,通过多角色编排提升轻量级GUI代理的任务扩展性,开发出支持单体执行和多代理系统编排的LAMO-3B代理,结合先进规划器实现持续性能提升。
Comments Findings of ACL 2026
OpenQlaw: 一种用于二维量子材料分析的代理AI助手
机构 * Quantum AI Lab, University of Arkansas, USA(量子人工智能实验室,美国亚拉巴马大学) ; University of Utah, USA(美国犹他大学) ; Department of Physics, University of Arkansas, USA(美国亚拉巴马大学物理系) ; MonARK NSF Quantum Foundry(MonARK NSF 量子熔炉)
专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV
AI总结 OpenQlaw通过整合NanoBot和QuPAINT,实现二维材料分析中的动态推理与可视化,提升科研人员在高通量器件制造中的效率。
MUSE:一种通过闭环认知协调的多智能体框架用于无约束故事构思
机构 * Li Auto(利奥自动化)
专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV
AI总结 MUSE通过闭环认知协调的多智能体框架,提升长篇叙事的连贯性与多模态一致性。
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; Shanghai Jiao Tong University(上海交通大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 多模态Agent :multimodal(abstract);multi-modal(abstract);MLLM(abstract);分类 cs.AI
Comments Accepted by NeurIPS 2025 Datasets and Benchmarks Track
机构 * School of Software Northwestern Polytechnical University Xi'an, China(软件学院 西安理工大学中国) ; Laboratoire L2Tl University Sorbonne Paris Nord Paris, France(L2Tl实验室 索邦巴黎北大学巴黎法国)
专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.AI
机构 * University of North Texas(北卡罗来纳州立大学)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.AI
Tool-MCoT:用于内容安全审核的工具增强多模态链式思维
机构 * Stanford University(斯坦福大学) ; Google(谷歌) ; Google DeepMind(谷歌DeepMind)
专题命中 多模态Agent :multimodal(title);分类 cs.CL、cs.AI
AI总结 本文提出Tool-MCoT,一种基于工具增强的多模态链式思维模型,用于提升内容安全审核的效率与准确性,通过训练小语言模型以有效利用外部工具进行推理和决策。