arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-07 至 2026-08-07 共收录 50 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 2 篇

2608.05260 2026-08-07 cs.CV 新提交 57%

A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval

一段文本胜过千条标题:重新思考视觉-语言检索的文本监督

Mahyar Ghazanfari, Amin Tabrizian, Arsyi Aziz, Binshuai Wang, Peng Wei

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 该研究针对视觉-语言检索,通过系统对比单标题与段落文本监督,发现仅微调BLIP文本编码器的段落监督模型在DOCCI等任务上优于Long-CLIP,为文本粒度与检索性能的关系提供了新见解。

Comments Accepted at the MUCG workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05215 2026-08-07 cs.RO cs.CV 新提交 57%

VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances

VLAff:用于统一可操作 affordance 的视觉-语言-affordance 模型

Jihoon Oh, Kento Kawaharazuka, Kei Okada

机构 * University of Tokyo(东京大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本研究提出 VLAff 模型,结合 EgoAffordance 数据集,解决人类与机器人 embodiment 不匹配问题,实现视觉 affordance 预测及真实机器人零样本操作等应用。

Comments 8 pages, 5 figures. Accepted to IEEE/RSJ IROS 2026. Project page: https://ojh6404.github.io/vlaff/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2608.05495 2026-08-07 cs.CR cs.HC 新提交 87%

PromptShield Home: Ambient Multimodal Prompt Injection Defense for Smart-Home Agents

PromptShield Home:面向智能家居智能体的环境多模态提示注入防御方案

He Zhang, Feilong Li, Dingning Long, Yilin Cui, Peijun Zhang, Yuewen Zhang, Qianyao Xu, Xinyi Fu

专题命中 音频语音多模态 :multimodal(title,abstract);MLLM(abstract,abstract_cn);audio-visual(abstract)

AI总结 该研究针对智能家居智能体的提示注入安全问题,构建了现实场景基准测试PromptShield-Home,对比了三类防御层的性能,发现多智能体调解的上限性能最优,提出应采用学习路由与传感器融合方案保障安全。

Comments This work has been accepted as a poster to UbiComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05816 2026-08-07 cs.MM 新提交 83%

Whence the Voice? Self-supervised Dual-source Audio-Visual Localisation via Selective Convergence

声音从何而来?通过选择性收敛实现自监督双源视听定位

Han Hu, Dongheng Lin, Yuqi Hou, Haotian Li, Hyung Jin Chang, Jianbo Jiao

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.MM

AI总结 本文针对双源视听定位的循环依赖问题,利用自监督学习的选择性收敛提出两阶段框架,在双源基准上取得自监督方法最优性能,还通过引入像素级掩码修正了基准评估的不一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05381 2026-08-07 cs.AI 新提交 83%

C$^3$PO: Evaluating Cross-Modal Composition and Counterfactual Performance in Omnimodal Models

C³PO:评估全模态模型中的跨模态组合与反事实性能

Swapnanil Mukherjee, Agyeya Negi, Tanuja Ganu, Ponnurangam Kumaraguru

机构 * Microsoft Research India(微软研究院印度分院) IIIT Hyderabad(印度国际信息技术研究院(海得拉巴))

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本研究推出C³PO基准数据集,评估全模态模型的跨模态组合与反事实性能,发现模型存在模态主导问题,需改进架构以支持持续跨模态注意力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05803 2026-08-07 cs.CV 新提交 57%

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Vorch-Omni:视觉与听觉的多任务编排

Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV

AI总结 Vorch-Omni是基于流匹配扩散Transformer的统一多任务视听合成框架,支持10余项视听相关任务,为通用视听生成与操作提供可扩展基础。

Comments Project Page: https://vorch-project.github.io/Vorch-Omni-project/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2608.05780 2026-08-07 cs.CV 新提交 81%

Evidence-Driven Dynamic Visual Selector for Efficient Long Video Understanding

用于高效长视频理解的证据驱动型动态视觉选择器

Bo Zhang, Wenxin Wang, Feng Chen, Zhihao Zhang, Zixuan Wang, Changsheng Li, Yinjie Lei

专题命中 视频多模态 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 本文提出基于目标MLLM内部注意力证据的动态视觉选择框架EviSelect,通过GRPO优化的随机策略实现高效长视频理解,在三个基准上性能更优,视觉token减少约50%、端到端加速3.9倍。

Comments Project Page: https://zhangbo135.github.io/EviSelect/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05864 2026-08-07 cs.AI 新提交 79%

Seeing Is Not Deciding: Can Multimodal LLMs Act as Effective CEOs?

视觉感知不等于决策:多模态大语言模型能成为有效的首席执行官吗?

Yuyang Dai, Xueqing Peng, Yuxia Wang, Preslav Nakov, Zhuohan Xie

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究构建C-SUITEBENCH多模态基准,评估9个前沿模型作为CEO的决策能力,发现多模态输入可提升证据推理但会损害受限资源分配,揭示多模态智能体的视觉感知与受限行动是可分离瓶颈。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05703 2026-08-07 cs.CV 新提交 70%

StreamArena: Toward Continuous, Interactive, and Long-Horizon Agentic Streaming Video Understanding

StreamArena:面向连续、交互式且长视界的智能体流媒体视频理解

Xichen Zhang, Guankai Li, Yinghao Zhu, Shijian Wang, Sitong Wu, Shaozuo Yu, Meng Chu, Yuan Lu, Jiaya Jia

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 针对当前智能体流媒体视频理解评估的缺陷,提出StreamArena基准,设计StreamMind架构解决连续交互与长视界理解的张力,在四项能力上优于现有基线并降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06023 2026-08-07 cs.LG 新提交 67%

BioKD: Selective Physiology-to-Video Knowledge Distillation via Reliability Gate for Emotion Recognition

BioKD:通过可靠性门实现面向情感识别的选择性生理信号到视频的知识蒸馏

Bojing Hou, Ruohao Li, Yitong Zhu, Hongjun Liu, Luwen Yu, Yuyang Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) New York University(纽约大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出BioKD框架,以生理信号为训练特权信息指导视频学生模型,通过可靠性门控抑制负迁移,在DEAP、AMIGOS数据集上的情感识别任务中优于基线,且推理无额外开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05745 2026-08-07 cs.CV cs.AI 新提交 62%

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

UniVVT:用于高保真视频虚拟试穿的统一端到端框架

Yushe Cao, Shikun Feng, Fei Shen, Haikuo Peng, Jianqiang Xia, Yiheng Zhu, Dianxi Shi, Chun Yu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。

Comments 17 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05707 2026-08-07 cs.CV 新提交 57%

One Ranking, Any Budget: Matryoshka Evidence-to-Context Frame Selection for Long-Video Understanding

单一排序,任意预算:用于长视频理解的套娃式证据到上下文帧选择框架

Wang Chen, Yu Chen, Xiang Wang, Shuai Li, Jinfa Huang, Xiawu Zheng

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MEC帧选择框架,将长视频帧选择建模为套娃式排序问题,构建单一可复用排序适配任意预算,提升了长视频理解的准确率并降低了选择延迟。

Comments 21 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05631 2026-08-07 cs.CV 新提交 57%

ChronoVision: Temporal Reasoning via Latent State Reconstruction

ChronoVision:基于潜在状态重构的时序推理

Yifan Shen, Jian Xu, Boyi Li, Yuner Zhang, Tianjiao Yu, Bingxuan Li, Houze Yang, Rushi Wang, Xu Cao

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对多模态大语言模型时序推理不足的问题,本文提出ChronoVision框架,引入Vbvr-VQA数据集,实验显示其在相关基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05592 2026-08-07 cs.CV 新提交 57%

Beyond Frame Selection: Rethinking Long-Video Understanding with MLLMs

超越帧选择:用多模态大语言模型重新思考长视频理解

Ziling Huang, Shin'ichi Satoh

机构 * National Institute of Informatics(信息学研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对 MLLMs 长视频理解的帧选择策略难以兼顾全局与局部信息的问题,提出 VideoRouter 模型,通过时间层次结构和验证引导路由器协调全局与局部推理,在 VideoMME 数据集上实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05565 2026-08-07 cs.CV 新提交 57%

EffectLearner: World-Aware Object-Effect Reasoning for Real-World Video Object Removal

EffectLearner:面向真实世界视频物体移除的世界感知物体-效应推理

Feier Wu, Wanke Xia, Xu He, Zilang Zhou, Si Chen, Dongxia Liu, Liyang Chen, Qimeng Wu, Zhengbo Zhang, Wenming Yang, Zhiyong Wu

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 该研究提出EffectLearner框架,结合VLM物体-效应推理器与DiT视频擦除器,构建专属数据集EffectWorld并采用渐进式训练,在视频物体移除任务上实现更优性能。

Comments Project: https://morleyolsen.github.io/EffectLearner/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2608.06059 2026-08-07 cs.CV 新提交 83%

DARAD: Dual Adapters and Ranking-Aware Distillation for Continual Remote Sensing Image-Text Retrieval

DARAD:用于持续遥感图像-文本检索的双适配器与排序感知蒸馏框架

Xi Chen, Xu Chen, Xiangyang Jia, Wei Wang, Xu Zhang, Zhenyuan Sun

专题命中 跨模态检索 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对持续遥感图像-文本检索中跨模态对齐空间失真的问题,提出双适配器与排序感知蒸馏框架DARAD,通过双分支设计与双向排序蒸馏实现新数据适应性与历史数据有效性的平衡,性能优于现有持续学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06060 2026-08-07 cs.CV 新提交 79%

Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval

从失败中学习:基于难负例的以检索为中心的思维链用于统一多模态检索

Zelong Sun, Jun Wang, Kaicheng Yang, Tiancheng Gu, Ziyong Feng, Zhiwu Lu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出UniME-R1框架,通过基于难负例的以检索为中心的思维链(RC-CoT)学习从检索失败中优化,在多模态检索基准上提升了性能。

Comments 26 pages,10 figures,14 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05655 2026-08-07 cs.IR 新提交 78%

Is Personalized Modality Weighting Actually Personalized? A Controlled Audit of Per-User Weighting Claims in Multimodal Recommenders

个性化模态加权真的是个性化的吗?多模态推荐器中每用户加权声明的受控审计

Jingyuan Zheng, Xin Zhang, Yang Gu, Dongjing Wang, Yuxiang Wang, Xudong Shen, Haiping Zhang, Youhuizi Li, Dongjin Yu

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 该研究审计多模态推荐器的每用户模态加权是否真正个性化,发现单一全局模态权重已提供几乎全部内容增益,每用户加权无一致效用,建议将real-GM与real-shuf作为个性化声明的最低证据标准。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 3 篇

2608.05648 2026-08-07 cs.CV 新提交 79%

Vorch-IR: Long-Form Unified Multimodal Identity Replacement Video Generation

Vorch-IR:长视频统一多模态身份替换生成模型

Yaole Wang, Xiaoyu Chen, Xin Ma, Yang Ding, Gang Yue, Jingjing Chen, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Fudan University(复旦大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Vorch-IR是基于LTX2的统一多模态视频身份替换框架,支持单人、双人身份及可选背景替换,通过自动数据构建流水线与时间重叠推理策略,实现长视频生成,在身份保留、动作保真等方面表现出色。

Comments Project page: https://vorch-project.github.io/Vorch-IR-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05798 2026-08-07 cs.CV cs.LG cs.SD 新提交 74%

KVAE: Family of Tokenizers for Multimodal Generative Models

KVAE:用于多模态生成模型的分词器家族

Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov, Kirill Chernyshev, Kirill Malakhov, Ilia Vasiliev, Ilia Trushkin, Valeriya Kobenko, David Chikovani, Alexander Ivanov, Azat Saginbaev, Egor Silvestrov, Ivan Mikheev, Konstantin Zakharov

机构 * Kandinsky Lab(坎丁斯基实验室)

专题命中 多模态生成 :multimodal(title);分类 cs.CV

AI总结 本研究提出用于多模态生成模型的KVAE分词器家族,含音频、图像、视频专用型号,性能优于多款前沿开源分词器,公开了训练细节与代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05776 2026-08-07 cs.CV 新提交 57%

Vorch-Director: Interactive World Story Model via Noise-Aware Error Rectification

Vorch-Director:基于噪声感知误差校正的交互式世界故事模型

Lisai Zhang, Yidi Wu, Qi Liu, Xin Ma, Yang Ding, Gang Yue, Siqian Yang, Jingyuan Chen, Lin Ma, Yaohui Wang

机构 * Vorch Team(Vorch团队) Zhejiang University(浙江大学)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 Vorch-Director是一种噪声感知残差校正策略,基于LTX-2扩散Transformer,可提升视听长视频生成的稳定性与保真度,支持多镜头、多主体的参考引导生成。

Comments Project page: https://vorch-project.github.io/Vorch-Director-project

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 7 篇

2608.05560 2026-08-07 cs.CV cs.CL 新提交 87%

From Sports to Safety: Benchmarking Proactive Risk Inference in MLLMs

从运动到安全:多模态大语言模型(MLLM)主动风险推理基准测试

Jiawei Qiu, Yichen Xu, Jianzhe Ma, Mingyang Yu, Wenbin Zhu, Yang Han, Pinzheng Lv, Wenxuan Wang

机构 * School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 多模态评测 :MLLM(title_cn,summary_cn);分类 cs.CV、cs.CL

AI总结 该研究构建了运动主动风险推理基准SPRINT,评估发现当前MLLM危险感知率高但原因识别率低,仅具备表层主动安全能力,缺乏稳定的基于原因的早期预警。

Comments Preprints

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05817 2026-08-07 cs.CL 新提交 83%

M$^3$R-Bench: A Unified Benchmark for Evidence-Grounded Multimodal Metaphor Understanding

M$^3$R-Bench:一个用于基于证据的多模态隐喻理解的统一基准

Hong Jiang, Junnan Zhu, Jingwang Huang, Xiao Sun, Yuming Yang, Jiang Zhong, Ruirui Chen, Jingman Shi, Hao Wu, Nayu Liu, Xinyi Jiang, Kaiwen Wei

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出多模态隐喻理解基准M$^3$R-Bench,针对现有模型的跨模态证据-映射不匹配问题,构建M$^3$R-Reasoner方法,在多指标上超越GPT-5.5等现有模型。

Comments 6 figures and 5 tables. Hong Jiang, Junnan Zhu, and Jingwang Huang contributed equally. Jiang Zhong and Kaiwen Wei are corresponding authors. Code and data are available at https://github.com/hongshi4/M3R-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05634 2026-08-07 cs.MM 新提交 83%

MEC-Patch: Visible-Infrared Cross-Modal Adversarial Attack Driven by Intrinsic Material Emissivity Laws

MEC-Patch:基于本征材料发射率定律的可见-红外跨模态对抗攻击

Zhixiang Huang, Xinbo Nie, Wenxuan Wang, Lu Yang, Xin Li, Xuelin Qian, Peng Wang

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.MM

AI总结 本文提出基于斯特藩-玻尔兹曼定律的MEC-Patch跨模态对抗攻击框架,结合NSGA-II与DAR策略,可欺骗多模态检测器并提升环境鲁棒性,为多模态感知系统安全评估提供新思路。

Comments Accepted by the 34th ACM International Conference on Multimedia (MM '26). Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05691 2026-08-07 cs.CV 新提交 79%

SciQNet: Two-Stage Multimodal Adaptation for Scientific Image Quality Assessment

SciQNet:面向科学图像质量评估的两阶段多模态适配框架

Yin-Loon Khor, Yi-Jie Wong, Jing Jie Tan, Ming Jie Lee

机构 * Universiti Malaya(马来亚大学) Universiti Tunku Abdul Rahman(拉曼大学) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出SciQNet两阶段多模态适配框架,在ICME 2026科学图像质量评估挑战赛评分赛道获第2,模型在SIQA-S、SIQA-U等指标表现优异,证实预训练数据相关性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06013 2026-08-07 cs.HC 新提交 78%

OneEmo: A Unified Multimodal Reasoning Model for Emotion Perception, Understanding, and Interaction

OneEmo:用于情感感知、理解与交互的统一多模态推理模型

Jiahao Huang, Zheng Lian, Jingyi Zhang, Zhide Chen, Xiaojiang Peng, Shaonan Wang

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 针对现有情感智能多模态模型忽略任务协同的问题,研究人员提出统一多模态情感模型OneEmo,构建EmoWorld-130K数据集并采用Emo-Chord强化学习策略,其性能优于同规模基线模型,参数远少于商业模型且结果具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05539 2026-08-07 cs.CV 新提交 74%

OmniMech: All-in-one Multimodal Mechanical Benchmark for 3D Reconstruction

OmniMech:面向3D重建的全合一多模态机械基准

Taiting Lu, Runze Liu, Ziwei Dong, Sisong Bei, Jingying Zeng, Mingjia Wang, Zhenghao Li, Kaiyuan Lin, Yi-Shan Wu, Yangshoudu Zheng, Hongxing Pan, Kai Zhang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Sung-Liang Chen, Yi-Chao Chen, Yincheng Jin, Mahanth Gowda

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 研究人员提出OmniMech——首个百万级多模态机械基准,针对工业制造数据的可执行CAD生成任务,含四类任务,实验发现现有模型在相关任务中存在不足,将发布资源支持后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06300 2026-08-07 cs.AI 新提交 57%

Bias Analysis of L2 Speaking Assessment Systems Using Concept Activation Vectors

基于概念激活向量的L2口语评估系统的偏差分析

Arya Labroo, Mengjie Qian, Kate Knill

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 该研究将概念激活向量(CAV)分析扩展到BERT和Whisper两个L2口语评估系统,发现概念可恢复性及对概念的敏感性依赖于模型架构,稀疏自编码器(SAEs)可提升概念线性恢复性但会减弱激活空间敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 5 篇

2608.05729 2026-08-07 cs.AI cs.CL cs.CV cs.HC 新提交 86%

Unified Agent: Managing Interactions across Devices

统一智能体:管理跨设备交互

Xinshuang Liu, Runfa Blark Li, Shaoxiu Wei, Xin Lin, Truong Nguyen

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文针对现有智能体跨设备交互场景的不足,提出带紧凑状态设计的统一智能体,构建对应基准数据集,其性能显著优于多种现有设计,且在不同MLLM设置下表现鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05668 2026-08-07 cs.MA cs.AI cs.MM 新提交 84%

F$^2$Agent: Financial Fusion of Agentic Intelligence for Multimodal Trading

F²Agent:面向多模态交易的智能体智能金融融合框架

Changshuo Liu, Yanzheng Jin, Shangfeng Cai, Peng Fang, Xiaokui Xiao, Beng Chin Ooi

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 该研究针对现有多模态金融交易模型的跨模态依赖捕捉不足、抗噪性差的问题,提出F²Agent框架,通过专业化智能体提取模态信号、模态感知自适应融合机制及抗噪正则化,在6种资产上较16个基线实现超20%年化回报率提升,表现出优异性能。

Comments 32 pages, 12 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏