arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-22 至 2026-07-22 共收录 34 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2607.18615 2026-07-22 cs.CL cs.LG 新提交 79%

Stochastic Meta-Unlearning: Bridging Language Backbone and Multimodal Unlearning

随机元遗忘:连接语言主干与多模态遗忘

Zijie Liu, Jinhao Duan, Gaowen Liu, Sijia Liu, Tianlong Chen

机构 * UNC at Chapel Hill(北卡罗来纳大学教堂山分校) Cisco Research(思科研究院) Michigan State University(密歇根州立大学)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 研究视觉语言模型的机器遗忘问题,提出随机元遗忘框架,利用VLM级反馈学习初始化,经内、外循环更新语言主干,实验证明该方法在遗忘-保留权衡上表现最佳,能提升准确率且可迁移。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18958 2026-07-22 cs.CV cs.AI 新提交 62%

Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model

用于增强大型视觉语言模型鲁棒性的对偶对抗微调

Sibo Wang, Jie Zhang, Shiguang Shan, Xilin Chen, Wen Gao

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对大型视觉语言模型视觉输入易受攻击且现有防御方法缺乏通用性的问题,提出对偶对抗微调框架,通过联合优化视觉和语义监督信号增强模型鲁棒性,实验证明该方法在多任务对抗鲁棒性评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18885 2026-07-22 cs.LG 新提交 50%

KALE: Kernel Alignment with Loss Equilibration for Stable CLIP-DINOv2 Alignment at Web Scale

KALE:通过损失均衡实现网络规模下CLIP与DINOv2的稳定对齐的核对齐方法

Michał Pawłowicz

专题命中 图文多模态 :image-text(abstract)

AI总结 研究在网络规模数据上CLIP与DINOv2对齐问题,引入KALE损失均衡控制器,自适应调整对齐权重,无需数据集微调,在CC12M子集实验中提升了模型图像-文本检索及线性探测性能,零样本性能显著提高。

Comments 13 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频多模态 4 篇

2607.18716 2026-07-22 cs.CV 新提交 89%

Continual Video-MLLM Adaptation over Evolving Domains

在不断演变的领域上进行连续视频 - MLLM 适应

Rui Cheng, Meixing Shi, Yuxiang Cai, Jingcai Guo, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

专题命中 视频多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 研究视频多模态大语言模型对不断演变领域的适应问题,提出分布感知专家路由框架 DAER,通过保持领域隔离的轻量级专家、引入多种路由和优化机制,在域增量基准上评估,结果优于现有方法。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19339 2026-07-22 cs.CV 新提交 70%

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

OmniReasoner:通过原生工具使用进行长音频-视频推理

Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

专题命中 视频多模态 :cross-modal(abstract);omni-modal(abstract);分类 cs.CV

AI总结 针对长音频-视频推理难题,OmniReasoner提出工具使用后训练框架,通过监督微调与强化学习让全模态语言模型学会调用放大工具,利用TimeAnchor保持时间参数一致性,借助时间增强数据引擎实现可训练,提升了答案准确性与时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19027 2026-07-22 cs.CV 新提交 70%

Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval

缓解零样本视频时刻检索中的模态和语言风格差距

Jihyun Lee, Cheol-Ho Cho, Woojin Jun, Woojin Jeong, Jae-Pil Heo

机构 * Sungkyunkwan University(成均馆大学)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究零样本视频时刻检索中模态和语言风格差距问题,提出基于自相似性的时刻提议和评分方法及查询感知的多模态大语言模型推理阶段,有效缓解差距,在相关基准测试中达最优性能。

Comments ECCV 2026 (* These authors contributed equally.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18747 2026-07-22 cs.CV 新提交 57%

SkyEV: RGB-Event UAV detection and tracking dataset and baseline

SkyEV:RGB-事件无人机检测与跟踪数据集及基线

Jakub Mandula, Sebastian Heusinger, Julian Moosmann, Christian Vogt, Michele Magno

机构 * ETH Zurich(苏黎世联邦理工学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对无人机检测数据集存在的问题,引入开源数据集SkyEV,其含高度同步的未压缩RGB和基于事件的数据,能捕捉复杂现实条件。提供统一数据加载器,用多模态架构建立实验基线,证明该数据集对检测小尺度目标有效。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 跨模态检索 7 篇

2607.18819 2026-07-22 cs.CV 新提交 79%

In-Context Learning for Wound Classification with Small Multimodal Language Models

使用小型多模态语言模型进行伤口分类的上下文学习

George Martvel, Oskar Gustafsson, John Pavia, Ernst Ahlberg

机构 * Jönköping University(延雪平大学) Halmstad University(哈尔姆斯塔德大学) Mölnlycke Health Care(墨尼克医疗保健公司) Centre for Reliable Machine Learning, Royal Holloway, University of London(伦敦大学皇家霍洛威学院可靠机器学习中心)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 研究评估小型多模态语言模型能否通过基于检索的上下文学习为伤口分类提供免训练替代方案,使用两个数据集和多种方法实验,结果显示查询条件下的上下文学习效果较好,Qwen 3.5 27B搭配kNN+MMR表现最佳,该方法可实现适应性伤口图像分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19270 2026-07-22 cs.LG cs.AI 新提交 57%

GUIDED Network-Agnostic Feature Initialization for Spatial Transferability in GNN-based Models

基于GNN的模型中用于空间可迁移性的引导式网络无关特征初始化

Alessandro Scalese, Santhanakrishnan Narayanan, Constantinos Antoniou

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 研究针对交通分配问题中GNN模型空间泛化差的问题,提出网络无关初始化层GUIDED,通过在虚拟链路注入需求标量属性标准化输入空间。实验表明其能提升模型性能、鲁棒性及参数效率,减少训练时间,为相关空间问题提供通用蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19200 2026-07-22 cs.MM 新提交 57%

Enhancing Relation Modeling with Social Attributes for Social Media Popularity Prediction

利用社交属性增强关系建模以进行社交媒体人气预测

Bolun Zheng, Yuhao Luo, Wei Zhu, Ning Xu, An-An Liu, Lingyu Zhu, Canjin Wang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM

AI总结 针对社交媒体人气预测中检索准确率低的问题,提出关系增强检索增强框架RE-Rag,通过语义属性检索器和关系引导预测器,基于语义内容和社交属性建模UGC相似度,实验证明该方法在预测准确率和检索效率上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19111 2026-07-22 cs.CV 新提交 57%

GATE-3D: Geometry-Aware Test-time Adaptive Reranking for Open-Set 3D Shape Retrieval

GATE-3D:用于开放集3D形状检索的几何感知测试时自适应重排

Hao Wu, Heyi Lin, Zilin Wang, Huizai Yao, Hao Wang, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 研究针对开放集3D形状检索中几何与外观特征融合问题,提出GATE-3D轻量级查询自适应重排方法,通过捕捉模态不一致特征预测分数调整排名,实验表明该方法优于外观检索且更稳健,提升了mAP等指标,还发现线性路由在低数据时更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19046 2026-07-22 cs.CV 新提交 57%

Contrastive On-Policy Distillation

对比策略蒸馏

Jiacheng Ruan, Jun Tang, Wenzhen Yuan, Ting Liu, Shuai Bai, Dayiheng Liu, Zhibo Yang, Yuzhuo Fu

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 研究提出对比策略蒸馏框架COPD,通过冻结教师模型在不同指令下对学生状态评分,以对数概率差为优势信号指导更新,减少推理长度,提升效率,且能集成到自蒸馏框架实现自对比监督。

Comments Work in progress. 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18688 2026-07-22 cs.CV 新提交 57%

Dual-Edged Homogeneous-Modality Similarity: Towards Visible-Infrared Modality-Incomplete Person Re-Identification with Modality Adaptive Matching

双边同质模态相似性:迈向具有模态自适应匹配的可见-红外模态不完整行人重识别

Xin Xu, Shuhao Zhan, Wei Liu, Zheng Wang, Kui Jiang, Chia-Wen Lin

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 研究开放世界场景下可见-红外模态不完整行人重识别问题,提出模态自适应匹配Transformer(MAMT),通过散度Transformer模块和共享Transformer模块提取特征,经模态自适应匹配模块动态融合,在新构建基准上实验,证明方法有效且具适应性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18666 2026-07-22 cs.CL cs.SD 新提交 57%

Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

融合嵌入:文本、图像、视频和音频的统一嵌入空间

Abdul Basit Tonmoy, Kazi Fardinul Hoque, Md. Shahrier Islam Arham, Arman Luthra

机构 * Eximius Labs(卓越实验室) Wabash College(瓦贝什学院) Skop Intelligence Co.(斯科普智能公司)

专题命中 跨模态检索 :audio-visual(abstract);分类 cs.CL

AI总结 研究旨在构建文本、图像、视频和音频统一嵌入空间。提出融合嵌入家族,第一代训练参数少的连接器,第二代添加模态门控深度适配器,无需成对视听数据实现音频-图像检索,探索设计空间并公开相关资源。

Comments 23 pages, 5 figures. Models: https://huggingface.co/EximiusLabs/fusion-embedding-1-2b-preview and https://huggingface.co/EximiusLabs/fusion-embedding-2-2b-preview. Code: https://github.com/Eximius-Labs/fusion-embedding

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态生成 3 篇

2607.19344 2026-07-22 cs.CV cs.AI cs.GR 新提交 81%

Appearance Pointers -- Multimodal Region Control of Diffusion Transformers

外观指针——扩散变压器的多模态区域控制

Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch, Srinath Sridhar, Matheus Gadelha

机构 * Brown University(布朗大学) Adobe Research(Adobe 研究院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 针对可控图像生成难题,提出外观指针方法,通过区域对应网络和空间聚合机制生成并细化指针,为扩散变压器引入模态无关的局部多模态控制接口,单一模型性能达或超现有技术。

Comments 38 Pages, Preprint with supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18917 2026-07-22 cs.CV 新提交 79%

TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering

TAP-RAG:用于长文档多模态问答的任务感知策略控制

Zhong Ji, Keqi Jin, Yan Zhang, Jiasheng Li

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) The International Joint Institute of Tianjin University(天津大学国际联合学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究长文档多模态问答,提出TAP-RAG框架,含任务感知策略控制器及两个执行器,能预测任务先验、估计证据信号并生成策略,在多模态文档图上扩展证据,在相关数据集上取得最佳总体准确率。

Comments 18 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18763 2026-07-22 cs.CV 新提交 57%

Posterior Samplings are Missing Modalities Generators for Medical Image Translation

后验采样是医学图像翻译中缺失模态的生成器

Jonghun Kim

机构 * Sungkyunkwan University(成均馆大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对医学图像因时间和协议限制存在缺失模态的问题,提出统一框架,将缺失模态生成视为联合分布下的线性逆问题,通过后验采样及流匹配模型解决,在多数据集实验中性能优于基线,下游肿瘤分割表现更好。

Comments ECCV 26

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态评测 10 篇

2607.19011 2026-07-22 cs.CL cs.AI cs.MM 新提交 85%

Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

基于多模态语言模型的计算幽默:方法、数据集、评估及挑战

Tuo Liang, Zhe Hu, Disheng Liu, Jing Li, Yu Yin

机构 * Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 本研究聚焦于单图像和多面板作品中的视觉幽默理解,通过与先前综述对比,按能力层次组织文献,综合基准设计等内容,追溯领域转变,指出进展的主要障碍包括易出现捷径的评估、文化覆盖有限等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19235 2026-07-22 cs.CL cs.CV 新提交 81%

MeetingToM: Evaluating Multimodal LLMs on Theory-of-Mind Reasoning in Multi-Party Meetings

MeetingToM:在多方会议中对具有心理理论推理能力的多模态大语言模型进行评估

Ziyi Wang, Yuhang Wu, Dongxu Piao, Xingyu Liu, Tianhui Zhou, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 研究多方会议中多模态大语言模型的心理理论推理,引入MeetingToM基准,分层评估不同粒度社会行为推理,提供评估协议并分析模型,揭示其在整合线索、推断态度及区分共识方面的局限,为推进多模态模型的会议心理理论推理提供试验台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18768 2026-07-22 cs.CV 新提交 79%

Cross-Modal UAV Object Tracking: State-Aware Representation Learning and A Unified Benchmark

跨模态无人机目标跟踪:状态感知表示学习与统一基准

Yun Xiao, Zhihong Hong, Jiandong Jin, Chenglong Li, Jin Tang, Amir Hussain

机构 * Anhui University(安徽大学) Edinburgh Napier University(爱丁堡龙比亚大学)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对无人机跨模态目标跟踪中模态切换致外观和位置突变的问题,提出状态感知表示学习方法SARLA,含相关模块及损失函数,建立CM-UOT基准,实验证明其性能优于多种方法,推动了该领域发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18514 2026-07-22 cs.HC cs.AI 新提交 79%

Querying Multimodal Scientific Papers with AI: Practices and Preferences Across Blind, Low-Vision, and Sighted Scientists

用人工智能查询多模态科学论文:盲人、低视力和视力正常科学家的实践与偏好

Arnavi Chheda-Kothary, Lucy Lu Wang, Joseph Chee Chang, Jonathan Bragg

机构 * Paul G. Allen School of Computer Science \& Engineering University of Washington Seattle WA USA The Information School University of Washington Allen Institute for AI Seattle WA USA Allen Institute for AI Seattle WA USA University of Washington Allen Institute for AI

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 研究不同视力科学家如何用ChatGPT和Gemini查询多模态科学文档,通过采访了解其审查多模态内容的实践、对AI响应的反馈等,发现相关问题,贡献数据集,讨论对AI科学QA系统的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18508 2026-07-22 cs.CV 新提交 77%

Style over Substance: A Shortcut Audit of Emotion-Description Preference Evaluation

形式高于内容:情感描述偏好评估的捷径审计

Jiabing Yang, Yixiang Chen, Yuan Xu, Qisen Ma, Tao Yu, Peiyan Li, Yingda Li, Yan Huang, Liang Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 研究多模态情感理解中EmoPrefer评估指标,通过内容盲探针审计发现仅用描述长度和生成器标识的逻辑回归性能与复杂模型相当,揭示当前得分可不验证描述与视频达成,建议未来评估采用源平衡配对等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18448 2026-07-22 cs.CL cs.CV 新提交 62%

PathReportEval: A Systematic Benchmark for Pathology Report Generation

PathReportEval:病理学报告生成的系统基准测试

Suryakant Singh, Sejuti Majumder, Beatrice Knudsen, Joel Saltz, Prateek Prasanna

机构 * Stony Brook University(石溪大学) University of Utah(犹他大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对病理学报告生成难以衡量进展的问题,提出标准化基准测试和评估框架,用三种编码器在三个数据集上评估四种方法,引入临床报告质量评分(CRQS),揭示模型和编码器差异,为病理学报告生成评估奠定可重复基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18438 2026-07-22 cs.CL cs.AI cs.LG 新提交 62%

Relay-Bench: Evaluating LLMs on Multi-Domain Reasoning Chains

Relay-Bench:评估大语言模型在多领域推理链上的表现

Liam Swayne

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 Relay-Bench是用于评估大语言模型在多领域推理链能力的基准测试,测试集含复合问题,涵盖多领域,模型使用无限制,鼓励利用工具,领先模型GPT-5.5(xHigh)得分43.3%,问题由两到十三个子问题组成,无需多模态输入输出。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19153 2026-07-22 cs.LG cs.AI 新提交 57%

Breaking the Homogeneity Assumption: Specialized Multi-Generator Adversarial Learning for Rare Failure Detection in Predictive Maintenance

打破同质性假设:用于预测性维护中罕见故障检测的专门多生成器对抗学习

Alexis Lazanas, Georgios Kampouropoulos

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究预测性维护中罕见故障检测,提出故障类型感知生成增强程序,采用专门多生成器GAN架构,通过防泄漏实验设计比较多种不平衡处理方法,实验表明该框架能产生更真实少数样本,提升PR-AUC和召回分数。

Journal ref International Journal of Computer Applications (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18887 2026-07-22 cs.AI 新提交 57%

NaviAIS: A Scenario-Level Vessel Trajectory Prediction Dataset withVectorized Lane Priors and the NaviLane Forecasting Framework

NaviAIS:一个具有矢量化航道先验的场景级船舶轨迹预测数据集及NaviLane预测框架

Yuan Gui, Hongchen Luo, Liqi Qu, Longyue Fu, Jiao Wang

机构 * Northeastern University(东北大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究针对复杂海洋环境下船舶轨迹预测问题,引入NaviAIS数据集并提出NaviLane框架,通过轨迹-地图联合编码、离散宏动作码本及模块优化评估等方法,提升船舶轨迹预测性能,优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18828 2026-07-22 cs.AI 新提交 57%

Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety

在信息缺失情况下评估医疗人工智能:同提供者评判者和人类评分者会改变表面安全性

Koyar Afrasyab

机构 * Kinvectum AB(金维图姆公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 研究在信息缺失下评估医疗人工智能,通过删除对话部分对四个模型压力测试,发现评判者选择影响表面安全性,语言模型评判者更宽松,安全差距在于校准,还发布了相关测试工具等。

Comments GitHub https://github.com/KAVentures/health-ai-readiness-robustness

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态Agent 2 篇

2607.18536 2026-07-22 cs.AI cs.RO 新提交 79%

MAGE: Human-Like Macro Placement via Agentic Multimodal Reasoning

MAGE:通过智能多模态推理实现类人宏布局

Andrew B. Kahng, Sayak Kundu, Bodhisatta Pramanik

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对工业物理设计流程中宏布局需大量人工优化的问题,提出MAGE框架。该框架通过多模态多智能体实现宏布局优化,结合多种规则与检查,引入量化类人性指标。实验表明其相比商业工具及基线有显著提升,且能转移到新布局设置。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18975 2026-07-22 cs.AI 新提交 57%

Mi-Memory: A Lifecycle Memory Framework for Personal AI

Mi-Memory:一种用于个人人工智能的生命周期内存框架

Xule Liu, Hanlin Teng, Chao Li, Yanan Ni, Shuo Lu, Audrey Wang, Yijun Liu, Yunfei Wang, Xiaofeng Li, Xian Yi, Yuanfa Li, Kang Zhao, Jian Liang, Yuxuan Chen, Jinyuan Chen, Heng Qu, Kun Shao, Jian Luan

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 研究针对个人人工智能从聊天交互拓展至多设备持续服务的需求,提出Mi-Memory生命周期内存框架,围绕四个角色构建,通过共享审计合约及相关工件家族实现,经实例化角色在评估中取得一定成果,迈向可审计等特性的内存系统。

Comments Project page: https://darwin-agent.github.io/Mi-Memory/

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态训练与对齐 4 篇

2607.19086 2026-07-22 cs.CV 新提交 83%

Advancing Multimodal Fusion on Heterogeneous Medical Data with Hybrid Geometry Attention

利用混合几何注意力推进异构医学数据上的多模态融合

Joy Dhar, Manish Kumar Pandey, Nayyar Zaidi, Chen Chen, Maryam Haghighat, Ferdous Sohel, Puneet Goyal

机构 * Indian Institute of Technology Ropar(印度理工学院罗帕尔分校) RoentGen Health(伦琴健康公司) Deakin University(迪肯大学) University of Central Florida(中佛罗里达大学) Queensland University of Technology(昆士兰科技大学) Murdoch University(莫道克大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对异构医学数据多模态融合难题,提出CURE框架,通过HyFuse层及相关模块逐步整合模态,有效捕捉跨模态交互,降低计算成本,在多数据集上评估显示其性能显著提升,优于领先方法。

Comments ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏