arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 1521 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 318 篇

2603.12451 2026-07-16 cs.LG 版本更新 50%

Overcoming the Modality Gap in Context-Aided Forecasting

克服情境差距以实现上下文辅助预测

Vincent Zhihao Zheng, Étienne Marcotte, Arjun Ashok, Andrew Robert Williams, Lijun Sun, Alexandre Drouin, Valentina Zantedeschi

机构 * ServiceNow Research(ServiceNow研究) McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出半合成数据增强方法,生成高质量上下文以提升上下文辅助预测性能,构建了700万规模的数据集,并验证了其在真实场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19063 2026-07-16 cs.RO cs.GR 版本更新 50%

Fire as a Service: Augmenting Robot Simulators with Thermally and Visually Accurate Fire Dynamics

火灾作为服务:通过热力学和视觉准确的火灾动力学增强机器人仿真器

Anton R. Wagner, Madhan Balaji Rao, Helge Wrede, Sören Pirk, Xuesu Xiao

机构 * Department of Computer Science, Kiel University(基尔大学计算机科学系) Department of Computer Science, George Mason University(乔治·马歇尔大学计算机科学系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出Fire as a Service框架,通过高保真火灾模拟提升机器人仿真器的热力学和视觉准确性,支持生成真实火灾环境下的训练数据和热危害评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11656 2026-07-15 q-bio.NC cs.LG 版本更新 50%

Imputation-free transformer learning enables robust Alzheimer's disease prediction and calibrated uncertainty quantification across heterogeneous clinical cohorts

无插补变压器学习实现跨异构临床队列的稳健阿尔茨海默病预测和校准不确定性量化

Christelle Schneuwly Diaz, Narmina Baghirova, Duy-Thanh Vu, Duy-Cat Can, Gilles Allali, Philippe Ryvlin, Oliver Y. Chén

机构 * Platform of Bioinformatics(生物信息平台) Lausanne University Hospital(洛桑大学医院) Faculty of Biology and Medicine(生物学与医学学院) University of Lausanne(洛桑大学) Leenaards Memory Centre(Leenaards记忆中心) Department of Clinical Neurosciences(临床神经科学系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对阿尔茨海默病临床数据问题,提出无插补变压器NITROGEN,通过特定注意力联合建模。经训练和评估,在跨队列任务中优势明显,还引入调整方法。证明无插补学习在队列转移下的区分能力,强调多方面评估模型对临床部署的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16095 2026-07-15 stat.ME math.ST stat.TH 版本更新 50%

On the spherical cardioid distribution and its goodness-of-fit

关于球形心脏线分布及其拟合优度

Eduardo García-Portugués

专题命中 多模态评测 :multimodal(abstract)

AI总结 研究球形心脏线分布,确定其易于处理的特性,推导矩估计法和最大似然估计法的相关内容及自举拟合优度检验机制,通过对长周期彗星轨道建模展示该分布在实际数据分析中的作用。

Comments 26 pages, 5 figures, 3 tables. Supplementary material: 34 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06796 2026-07-15 cs.RO 版本更新 50%

RoboDesign1M: A Large-scale Dataset for Robot Design Understanding

RoboDesign1M:用于机器人设计理解的大规模数据集

Tri Le, Toan Nguyen, Quang Tran, Quang Nguyen, Baoru Huang, Hoan Nguyen, Minh Nhat Vu, Tung D. Ta, Anh Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) University of Liverpool(利物浦大学) University of Information Technology(信息技术大学) Automation & Control Institute(自动化与控制研究所) Department of Creative Informatics(创意信息系) Faculty of Environment and Information Studies(环境与信息科学系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对机器人设计领域缺乏大规模数据集的问题,介绍了含100万个样本的RoboDesign1M数据集,提出半自动数据收集管道,经多项实验评估,该数据集可推动机器人设计理解研究及相关自动化发展。

Comments 8 pages, accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09094 2026-07-14 physics.geo-ph 版本更新 50%

Artificial Intelligence for Subsurface Imaging Understanding: A Decade Review of Challenges, Methods, Benchmarks, and Outlook

CIG-Bench:AI驱动的地下成像理解的综合调查与基准

Yimin Dou, Xinming Wu, Hui Gao, Mingliang Liu, Tao Zhao, Zhi Zhong, Haibin Di, Min Jun Park, Robert G. Clapp, Zhixiang Guo, Long Han, Sergey Fomel

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文系统回顾2015-2025年间652篇文献,将地下成像理解归纳为四大任务,总结三大挑战,并提出包含统一评估协议、预训练模型和混合数据集的社区基准CIG-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13123 2026-07-13 cs.HC 版本更新 50%

From Adaptation to Intelligence: A Systematic Review of Data, Strategies, and Impact in Personalized VR

从适应性到智能性:个性化虚拟现实中数据、策略及影响的系统综述

Tangyao Li, Yitong Zhu, Hai-Ning Liang, Yuyang Wang

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文对VR个性化研究进行系统综述,聚焦沉浸时用户数据驱动的自适应策略,综合多领域研究成果总结五阶段框架,揭示新兴趋势,明确数据、建模和评估挑战,为更有效及以用户为中心的VR系统指明研究方向。

Comments 22 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06318 2026-07-09 cs.SI 版本更新 50%

The Schwurbelarchiv: a German Language Telegram dataset for the Study of Conspiracy Theories

Schwurbelarchiv:一个用于研究阴谋论的德语Telegram数据集

Mathias Angermaier, Elisabeth Hoeldrich, Jana Lasser, Joao Pinheiro Neto

专题命中 多模态评测 :multimodal(abstract)

AI总结 该研究构建了一个包含5800个群组和6300万条消息的Telegram数据集,通过解析和清洗原始数据,提供了研究德语阴谋论 discourse 的研究级资源。

Comments This paper is 20 pages, 2 figures, 4 tables, and one dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14590 2026-07-09 cs.LG 版本更新 50%

Counterfactual Modeling with Fine-Tuned LLMs for Health Intervention Design and Sensor Data Augmentation

基于微调大语言模型的反事实建模用于健康干预设计与传感器数据增强

Shovito Barua Soumma, Asiful Arefeen, Stephanie M. Carpenter, Melanie Hingle, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院) School of Nutritional Sciences and Wellness, University of Arizona(亚利桑那大学营养科学与健康学院)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文研究利用微调后的大型语言模型生成高质量反事实解释,用于健康干预设计和传感器数据增强,实验表明LLM生成的反事实能有效提升模型性能,具有临床应用价值。

Comments IEEE Open Journal of Engineering in Medicine and Biology (Volume: 7), Date of Publication: 28 May 2026. Page(s): 232-240

Journal ref IEEE Open Journal of Engineering in Medicine and Biology (Volume: 7), Date of Publication: 28 May 2026. Page(s): 232-240; Electronic ISSN: 2644-1276

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08366 2026-07-09 econ.GN q-fin.EC 版本更新 50%

A data fusion approach for mobility hub impact assessment and location selection: integrating hub usage data into a large-scale mode choice model

一种用于移动枢纽影响评估和选址的数据融合方法:将枢纽使用数据整合到大规模出行选择模型中

Xiyuan Ren, Joseph Y. J. Chow

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出一种数据融合方法,将移动枢纽使用数据整合到大规模出行选择模型中,评估枢纽对出行需求、出行方式转换、减少车辆行驶里程和增加消费者剩余的影响。

Journal ref Transportation Research Part A, 211 (2026), 105138

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08807 2026-07-07 cs.RO cs.LG 版本更新 50%

Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation

Humanoid Everyday:面向开放世界人形机器人操作的综合机器人数据集

Zhenyu Zhao, Hongyi Jing, Xiawei Liu, Jiageng Mao, Abha Jha, Hanwen Yang, Rong Xue, Sergey Zakharov, Vitor Guizilini, Yue Wang

机构 * University of Southern California(南加州大学) Toyota Research Institute(丰田研究院)

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出Humanoid Everyday数据集,包含10.3k轨迹、260个任务的多模态数据,用于人形机器人灵巧操作、人机交互和移动操作研究,并配套云评估平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11599 2026-07-03 econ.GN q-fin.EC 版本更新 50%

Can LLMs Credibly Transform the Creation of Panel Data from Diverse Historical Tables?

LLM能否可信地转换来自不同历史表格的面板数据?

Verónica Bäcker-Peral, Vitaly Meursault, Christopher Severen

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出基于多模态LLM的管道,以低成本从历史表格中提取面板数据,在车辆登记数据上达到95.4%精确匹配率,成本仅为传统方法的1/50。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04080 2026-06-30 cs.IR 版本更新 50%

Caption Injection for Optimization in Generative Search Engine

生成搜索引擎中的标题注入用于优化

Xiaolu Chen, Jie Bao, Haojie Wu, Zhen Chen, Yong Liao

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出Caption Injection,一种多模态G-SEO方法,通过提取图像标题并注入文本内容,提升生成搜索中的主观可见性,实验表明其在G-EVAL指标下优于文本-only基线。

Comments 24 pages, 4 figures, ECML PKDD 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17100 2026-06-29 eess.IV 版本更新 50%

TG-OT: Topology-guided CCTA-IVUS registration via optimal transport matching

TG-OT: 基于最优传输匹配的拓扑引导CCTA-IVUS配准

R. L. M. van Herten, José P. Henriques, R. Nils Planken, Joost Daemen, Eline M. J. Hartman, Jolanda J. Wentzel, Johannes C. Paetzold, Ivana Išgum

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出TG-OT框架,通过集成训练的特征检测器和基于不平衡Sinkhorn最优传输损失的拓扑圆柱配准,实现CCTA与IVUS的全自动配准,无需预分割,在47例数据上取得高精度。

Comments Submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19893 2026-06-19 cs.LG 版本更新 50%

EQPO: Equitable Group Relative Policy Optimization for Clinical Reasoning

EQPO: 面向临床推理的公平群体相对策略优化

Shiqi Dai, Wei Dai, Jiaee Cheong, Paul Pu Liang

机构 * MIT(麻省理工学院) Harvard University(哈佛大学)

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出EQPO分层强化学习方法,通过自适应重加权样本促进异质临床人群的均衡学习,在7个诊断基准上降低F1标准差43.9%,缩小预测公平差距27.2%。

Comments Accepted as Oral on NeurIPS 2025 GenAI4Health Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07036 2026-06-18 physics.ed-ph 版本更新 50%

Using Large Language Models to Analyze Engagement in Computational Thinking via Computational Physics Essays

使用大型语言模型通过计算物理论文分析计算思维中的参与度

Sean Savage, Amir Bralin, Paul Hur, N. Sanjay Rebello

专题命中 多模态评测 :multimodal(abstract)

AI总结 本研究利用多模态大型语言模型自动评估100篇学生计算物理论文中的计算思维参与度,在明确子任务上达到84%的准确率,但主观整体质量评估准确率仅71%。

Comments 13 pages, 3 figures, 3 tables. Submitted to Physical Review Physics Education Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30412 2026-06-09 astro-ph.IM astro-ph.CO astro-ph.GA 版本更新 50%

Choosing the right MCMC sampler: a systematic benchmark of gradient-free methods

选择正确的MCMC采样器:无梯度方法的系统基准测试

Colin M. Poppelaars, Marcel P. van Daalen

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文通过一系列指标和方法,系统比较了多种现代无梯度马尔可夫链蒙特卡洛(MCMC)采样器与常用Metropolis-Hastings算法的性能,发现差分进化算法在遍历性、鲁棒性和似然性能方面表现最佳。

Comments Submitted to MNRAS; 30 pages, 29 figures; resubmitted to fix bibliography

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13522 2026-06-09 math.OC 版本更新 50%

Collective Annealing by Switching Temperatures: a Boltzmann-type description

通过温度切换的集体退火:一种玻尔兹曼型描述

Frédéric Blondeel, Lorenzo Pareschi, Giovanni Samaey

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出一种基于粒子交换温度的集体退火算法(CAST),通过随机二元相互作用实现自适应冷却调度,数值实验表明在多模态问题上收敛速度优于经典模拟退火。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00909 2026-06-08 cs.IR 版本更新 50%

HiPS: Hierarchical PDF Segmentation of Doctrinal Legal Books

HiPS: doctrinal法律书籍的分层PDF分割

Sabine Wehnert, Harikrishnan Changaramkulath, Ivan Habernal

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出HiPS,用于分层PDF分割doctrinal法律书籍,提供了一个包含49本开放获取法律书籍的黄金标准基准,包含9812个手动编纂的标题、层级和页面锚点,同时引入了基于目录和无目录的分割管道,以提高标题检测、层级重建和边界分配的准确性。

Comments 11 pages, 9 figures. Accepted as a demo paper at ICAIL 2026. This arXiv version includes an appendix, new results, bug fixes, and presentation improvements beyond the earlier preprint; consequently, some reported numbers differ

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 126 篇

2505.14418 2026-06-16 cs.CL 版本更新 89%

Hidden Ghost Hand: Unveiling Backdoor Vulnerabilities in MLLM-Powered Mobile GUI Agents

隐藏的幽灵之手:揭示MLLM驱动的移动GUI代理中的后门漏洞

Pengzhou Cheng, Haowen Hu, Zheng Wu, Zongru Wu, Tianjie Ju, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Huawei Inc.(华为公司)

专题命中 多模态Agent :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL

AI总结 本研究提出AgentGhost框架,通过组合目标和交互层触发器,利用监督对比学习和微调注入后门,在移动GUI代理中实现高成功率和隐蔽性,攻击准确率达99.7%。

Comments EMNLP-Findings 2025 (Correcting model settings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30931 2026-06-15 cs.CL 版本更新 89%

MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft

MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索能力

Tianjie Ju, Yueqing Sun, Zheng Wu, Wei Zhang, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Gongshen Liu, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团)

专题命中 多模态Agent :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL

AI总结 提出MineExplorer基准,通过多智能体合成工作流构建隐式多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力,发现长轨迹协调仍是挑战。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00810 2026-07-01 cs.CV cs.AI cs.CL cs.HC cs.LG 版本更新 87%

GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding

GUI-AIMA: 对齐内在多模态注意力与上下文锚点以实现GUI定位

Shijie Zhou, Viet Dac Lai, Hao Tan, Jihyung Kil, Wanrong Zhu, Changyou Chen, Ruiyi Zhang

机构 * University at Buffalo(布法罗大学) Adobe Research(Adobe研究院)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 GUI-AIMA通过多模态注意力对齐与上下文锚点,实现高效的GUI定位,无需坐标生成,提升数据效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23483 2026-07-07 cs.CV cs.CL 版本更新 86%

SpecEyes: Accelerating Agentic Multimodal LLMs via Speculative Perception and Planning

SpecEyes: 通过推测感知和规划加速代理多模态大语言模型

Haoyu Huang, Jinfa Huang, Zhongwei Wan, Xiawu Zheng, Rongrong Ji, Jiebo Luo

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 SpecEyes通过推测规划框架减少代理多模态大语言模型的序列开销,提升并发性能,实验显示在保持准确性的同时实现1.1-3.35倍的加速。

Comments ECCV 2026, Code: https://github.com/MAC-AutoML/SpecEyes

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20776 2026-08-18 cs.CV 版本更新 85%

RingMo-Agent: A Unified Remote Sensing Foundation Model for Multi-Platform and Multi-Modal Reasoning

RingMo-Agent: 多平台多模态遥感基础模型

Huiyang Hu, Peijin Wang, Yingchao Feng, Kaiwen Wei, Wenxin Yin, Wenhui Diao, Mengyu Wang, Hanbo Bi, Kaiyue Kang, Tong Ling, Kun Fu, Xian Sun

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院 aerospace information research institute) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Target Cognition and Application Technology (TCAT)(目标认知与应用技术重点实验室)

专题命中 多模态Agent :multi-modal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 RingMo-Agent是一种多平台多模态遥感基础模型,通过大规模数据集和任务特定标记提升遥感图像的感知与推理能力。

Comments 24 pages, 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14157 2026-07-03 cs.AI cs.CV 版本更新 85%

Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

Ophiuchus: 激励工具增强的“图像思考”用于联合医学分割、理解与推理

Yankai Jiang, Yujie Zhang, Peng Zhang, Wenjie Li, Yichen Li, Jintai Chen, Xiaoming Shi, Shihui Zhen

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Information Hub, HKUST (Guangzhou)(信息枢纽,香港科技大学(广州))

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出Ophiuchus框架,通过三阶段训练策略(冷启动SFT、自反思微调、工具强化学习)使MLLM动态聚焦细粒度视觉区域,实现精准医学分割与诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21457 2026-06-09 cs.CV cs.AI 版本更新 85%

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力

Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Mingyu Liu, Zheng Huang, Anzhou Li, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。

Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14026 2026-08-19 cs.CE 版本更新 85%

MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning

MMDynOpt-Agent:基于强化学习的多模态大语言模型推理动态优化方法

Wenjin Liu, Haoran Luo, Fayuan Ke, Zhenghong Lin, Yue Lu, Zhe Cui, Anh Tuan Luu, Carl Yang

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn)

AI总结 该研究针对多模态大语言模型推理效率不足的问题,提出MMDynOpt-Agent,通过强化学习将多模态推理动态优化建模为马尔可夫决策过程,结合多轮优化提示与多维度奖励机制,在15个公开数据集上性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08340 2026-08-04 cs.CV cs.AI 版本更新 84%

Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time

PokeGym: 一种以视觉驱动的长周期基准用于视觉-语言模型

Ruizhi Zhang, Ye Huang, Yuangang Pan, Chuanfu Shen, Zhilin Liu, Ting Xie, Haijun Lei, Lixin Duan

机构 * SIAS, UESTC(电子科技大学深圳高等研究院) CFAR/IHPC A*STAR(新加坡科技研究局高性能计算研究所)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 PokeGym通过复杂的3D开放世界游戏评估视觉-语言模型在长周期任务中的表现,揭示了物理死锁恢复是当前模型的主要瓶颈,并发现高级模型存在元认知分歧。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21013 2026-07-28 cs.AI cs.CV 版本更新 84%

EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization

EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解

Lihuang Fang, Yuchen Zou, kebing Jin, Jinghui Qin

机构 * Guangdong University of Technology(广东工业大学) Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有多模态情感识别方法忽视情感源动态性和复杂性的问题,提出基于强化学习的动态智能体专业化框架EmoAgent-R1,采用冷启动策略和两步智能体工作流程训练,并用P-GRPO优化,实验证明其在情感推理性能和优化稳定性上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21005 2026-07-17 cs.AI cs.CL 版本更新 84%

Building Agent Harnesses for Scientific Curation from Multimodal Sources

构建用于多模态来源科学数据提取的智能体框架

Sheng Zhang, Qin Liu, Renqian Luo, Shufang Xie, Reuben Tan, Sean Hayes, Gregory Bryman, Wendong Ge, Ruilian Zhang, Oluwaseun Egbelowo, Kelly Yee, Hoifung Poon

机构 * Microsoft Research(微软研究院) University of California, Davis(加州大学戴维斯分校) Merck & Co., Inc., Rahway, NJ, USA(默克公司(美国新泽西州拉威))

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 提出Beaver框架,通过任务分解、多模态证据工具和可追溯性,将科学文献中的结构化信息提取转化为可审计的工作流,在GRAS指标上比前沿智能体提升23个绝对百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏