arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-03 至 2026-07-03 共收录 78 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 7 篇

2607.01978 2026-07-03 cs.AI cs.CL cs.CV 新提交 92%

Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing

多模态知识编辑范围泛化用于在线递归MLLM编辑

Siyuan Li, Youyuan Zhang, Ruitong Liu, Junxi Wang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学) Fudan University(复旦大学)

专题命中 多模态生成 :MLLM(title,title_cn);multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对在线多模态知识编辑中编辑范围难以控制的问题,提出ScopeEdit方法,通过模态局部吸收分支和证据门控共享泛化分支实现范围分离的在线编辑,在保持可靠性的同时提升跨模态泛化与无关输入隔离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02220 2026-07-03 cs.CV 新提交 83%

DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation

DetailAnywhere: 通过跨模态特征对齐蒸馏实现时尚细节生成

Zijun Li, Yimin Zhou, Jia Sun, Honglie Wang, Pengcheng Wei, Junlong Wu, Yongrui Heng, Jiyuan Wang, Huan Ouyang, Boheng Zhang, Huaiqing Wang, Dewen Fan, Qianqian Gan, Fan Yang, Tingting Gao

机构 * Kuaishou Technology(快手科技) AIM for Health Lab, Monash University(Monash大学AIM健康实验室)

专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 针对在线购物中用户关注服装细节(如领口、袖口、面料纹理)的需求,提出新任务“时尚细节生成”及基准FDBench,并设计跨模态特征对齐蒸馏(CFAD)方法,结合多模态扩散Transformer和一致性奖励模型,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07439 2026-07-03 cs.AR 新提交 78%

A 65 nm Multi-Modal Bayesian Inference Engine with 16.3 fJ/Sample Calibration-Free GRNG for Risk-Aware At-Home Skin Lesion Screening

65 nm 多模态贝叶斯推理引擎,具有 16.3 fJ/样本免校准 GRNG,用于风险感知的家庭皮肤病变筛查

Steven Davis, Likai Pei, Jianbo Liu, Zephan M. Enciso, Boyang Cheng, Xueji Zhao, Danny Z. Chen, Ningyuan Cao

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

AI总结 提出一种65 nm风险感知多模态贝叶斯推理引擎,通过存内计算架构实现词内混合高斯采样,提升不确定性建模能力,在鲁棒性和精度上超越现有单模态贝叶斯神经网络。

Comments This paper is accepted by IEEE Transactions on Circuits and Systems - Regular Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01883 2026-07-03 cs.CL 新提交 74%

PairCoder++: Pair Programming as a Universal Paradigm for Verified Code-Driven Multimodal and Structured-Artifact Generation

PairCoder++:结对编程作为验证代码驱动的多模态与结构化工件生成的通用范式

Junhao Chen, Xiang Li, Mingjin Chen, Boran Zhang, Henghaofan Zhang, Yibin Xu, Yuehan Cui, Fangsheng Weng, Fei Ma, Qi Tian, Ruqi Huang, Hao Zhao

机构 * THU(清华大学) PKU(北京大学) PolyU, Hong Kong(香港理工大学) USTC(中国科学技术大学) UESTC(电子科技大学) Tongji University(同济大学) Tianjin University(天津大学) Independent Researcher(独立研究者) Guangming Lab(光明实验室) BAAI(北京智源人工智能研究院)

专题命中 多模态生成 :multimodal(title);分类 cs.CL

AI总结 提出PairCoder框架,通过驱动者和导航者两个智能体结对编程,利用工具链反馈验证代码生成,在17个基准测试中显著提升可验证工件的生成质量。

Comments Accepted by ACL 2026. Project Page: https://yisuanwang.github.io/PairCoder/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05624 2026-07-03 cs.AI 版本更新 70%

ADMC: Attention-based Diffusion Model for Missing Modalities Feature Completion

ADMC: 基于注意力扩散模型的缺失模态特征补全

Yuhan Li, Wei Zhang, Juan Chen, Jiangjia Yan, Peng Xiangli, Liangze Yin

机构 * National University of Defense Technology(国防科学技术大学) The Fifth Electronic Research Institute of MIIT(信息产业部第五电子研究所) University of Chinese Academy of Sciences(中国科学院大学) University of Science and Technology Beijing(北京科技大学) Hunan University(湖南大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出基于注意力扩散的缺失模态特征补全方法,通过独立训练各模态特征网络避免过耦合,利用注意力扩散网络生成与真实分布一致的缺失模态特征,在IEMOCAP和MIntRec基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02516 2026-07-03 cs.CV 新提交 57%

Alignment Is All You Need For X-to-4D Generation

对齐即一切:X到4D生成

Qiaowei Miao, Kehan Li, Yawei Luo, Yi Yang

机构 * Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出Align4D框架,通过物体距离对齐、运动-几何联合对齐和异步优化,实现任意模态输入到4D视频-3D对的生成,在X4D和Consistent4D数据集上达到最先进水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01204 2026-07-03 cs.CV 版本更新 57%

TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation

TabletopGen: 桌面场景生成与机器人操作的交互式仿真

Ziqian Wang, Yonghao He, Licheng Yang, Wei Zou, Hongxuan Ma, Liu Liu, Wei Sui, Yuxin Guo, Hu Su

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) D-Robotics Horizon Robotics

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。

Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 18 篇

2604.26957 2026-07-03 cs.CY cs.AI 89%

Simulating Validity: Modal Decoupling in MLLM Generated Feedback on Science Drawings

模拟有效性:在MLLM生成的科学图表反馈中的模态解耦

Arne Bewersdorff, Nejla Yuruk, Xiaoming Zhai

机构 * University of Georgia, AI4STEM Education Center(佐治亚大学AI4STEM教育中心) Gazi University, Department of Mathematics and Science Education(加齐大学数学与科学教育系)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.AI

AI总结 研究探讨了多模态大语言模型生成的科学图表反馈中模态解耦问题,发现反馈常存在 grounding 失败,表明需超越常规提示策略的 grounding 机制。

Comments Accepted as AIED Short Paper 2026, Seoul, South Korea. Submission #1147. This is the long paper version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01814 2026-07-03 cs.AI 新提交 85%

MMIR-TCM: Memory-Integrated Multimodal Inference and Retrieval for TCM Clinical Decision Support

MMIR-TCM:面向中医临床决策支持的记忆集成多模态推理与检索

Lihui Luo, Joongwon Chae, Ziyan Chen, Yang Liu, Siyi Cheng, Weihan Gao, Zelin Zeng, Xiaoming Yin, Samaneh Beheshti Kashi, Dongmei Yu, Lian Zhang, Jing Sui, Zeming Liang, Jiansong Ji, Peter E. Lobie, Peiwu Qin

机构 * Institute of Biopharmaceutics and Health Engineering, Tsinghua Shenzhen International Graduate School(清华深圳国际研究生院生物医药与健康工程研究院) Chinese Medicine Guangdong Laboratory(广东省中医药实验室) Beijing Normal University(北京师范大学) First Hospital of Hebei Medical University(河北医科大学第一医院) Lishui Hospital of Zhejiang University(浙江大学丽水医院) XiaoMing TCM Hospital(小明中医医院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出MMIR-TCM框架,结合多模态大模型、记忆增强分割与检索增强生成,解决中医舌诊中的主观性和语义鸿沟问题,在MedTCM数据集上优于GPT-4o等模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01813 2026-07-03 cs.CV cs.AI 新提交 81%

MMBench-Live: A Continuously Evolving Benchmark for Multimodal Models

MMBench-Live:一个持续演进的多模态模型基准

Yuanzhi Liu, Shousheng Zhao, Bo Zhou, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) PRIS-CV

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出MMBench-Live,一个通过多智能体自动化流水线构建的持续演进多模态基准,解决静态基准的时效性、数据污染和维护成本问题,采用分布一致性更新策略,每次更新成本约30美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01365 2026-07-03 cs.LG cs.AI cs.CV 新提交 81%

Multi-modal Rail Crossing Safety Analysis

多模态铁路道口安全分析

Paimon Goulart, Chansong Lim, Nícolas Roque dos Santos, Yue Dong, Sheldon Peterson, Jia Chen, Evangelos E. Papalexakis

机构 * University of California, Riverside(加州大学河滨分校) Riverside County Transportation Commission(河滨县交通委员会)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出多模态管道,利用视觉线索和事故报告评估铁路道口安全,基于FRA评分实现高风险/低风险分类(F1=0.757)和分数估计(RMSE=0.078)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01871 2026-07-03 cs.CV 新提交 79%

Descriptor: LYNRED Mobility Dataset Multimodal Detection Subset (LYNRED-MDS)

描述符:LYNRED 移动数据集多模态检测子集 (LYNRED-MDS)

Loïc Arbez, Jessy Matias, Xavier Brenière, Jocelyn Chanussot, Ronald Phlypo

机构 * INRIA center at University Grenoble Alpes(法国格勒诺布尔阿尔卑斯大学INRIA中心) Lynred(Lynred公司) Univ Grenoble Alpes, CNRS, Grenoble INP, GIPSA-lab(法国格勒诺布尔阿尔卑斯大学、CNRS、格勒诺布尔INP、GIPSA实验室)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对现有RGB-红外数据集场景简单、天气单一的问题,提出LYNRED-MDS多模态检测子集,包含4000对不同天气、光照和道路条件下的RGB-红外图像对,覆盖多种驾驶场景,通过YOLOv8n基线跨数据集评估验证了其在行人检测中的泛化潜力。

Journal ref IEEE Data Descriptions, 3, pp.1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17360 2026-07-03 cs.CV 版本更新 79%

Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

Omni-DuplexEval: 评估实时双工全模交互

Chaoqun He, Mingyang Xiang, Yingjing Xu, Bokai Xu, Junbo Cui, Jie Zhou, Yuan Yao, Lijie Wen

机构 * Tsinghua University(清华大学) Tongji University(同济大学) ModelBest Inc.(ModelBest公司)

专题命中 多模态评测 :omni-modal(title);multimodal(abstract);分类 cs.CV

AI总结 本文提出Omni-DuplexEval基准,用于系统评估实时双工交互能力,通过两个互补场景评估模型生成连续响应和主动提醒的能力,并揭示现有模型在平衡响应及时性和内容连贯性方面的局限性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15860 2026-07-03 cs.SI 版本更新 78%

PoliTok-DE: A Multimodal Dataset of Political TikToks and Deletions From Germany

PoliTok-DE:德国政治TikTok及删除内容的多模态数据集

Tomas Ruiz, Andreas Nanz, Ursula Kristin Schmid, Carsten Schwemmer, Yannis Theocharis, Diana Rieger

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 提出PoliTok-DE多模态数据集,包含两次德国选举的93万条TikTok帖子,其中33万条被删除,用于研究不宽容、政治传播及平台政策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20274 2026-07-03 cs.CV 版本更新 70%

SCLARO: A Dataset for Grounded Scenario-Level Scene Understanding and ScenarioCLIP for Benchmarking

SCLARO:面向场景级场景理解的数据集及用于基准测试的ScenarioCLIP

Advik Sinha, Saurabh Atreya, Aashutosh A, Sk Aziz Ali, Abhijit Das

机构 * Machine Intelligence Group, Department of CS&IS, Birla Institute of Technology and Science, Pilani – Hyderabad Campus(人工智能组,计算机科学与信息系,比拉理工学院和科学学院,比拉-海得拉巴校区)

专题命中 多模态评测 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 提出SCLARO数据集(615,805张图像,含动作、对象和关系标注)及ScenarioCLIP模型,通过解耦编码器和知识蒸馏联合编码场景上下文、对象和关系,在零样本检索等任务上优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02007 2026-07-03 cs.CL cs.CV 新提交 62%

EduArt: An educational-level benchmark for evaluating art history knowledge in large language models

EduArt:评估大型语言模型艺术史知识的教育级基准

Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza

机构 * University of Bologna(博洛尼亚大学) Villa i Tatti – The Harvard University Center for Italian Renaissance Studies(哈佛大学意大利文艺复兴研究中心(I Tatti)) University of Copenhagen(哥本哈根大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出EduArt基准,包含871道人工出题的艺术史题目,评估多模态大模型在不同格式和语言下的知识掌握与推理能力,发现格式显著影响表现,多选题高估模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01612 2026-07-03 cs.AI 新提交 57%

Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

自信地扩展:校准LLM的置信度以实现自适应测试时扩展

Xuqing Yang, Yi Yuan, Shanzhe Lei, Xuhong Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出C3RL算法,通过结合正确性、校准和数据集参考准确率奖励来校准LLM的置信度,并基于此引入CAS策略,根据置信度自适应分配推理计算资源,在提升校准性的同时降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01442 2026-07-03 cs.CR cs.CV 新提交 57%

From Forgeries to Foundation Models: A Systematic Survey of Identity Document Attack and Detection

从伪造到基础模型:身份证件攻击与检测的系统性综述

Gourab Das, Pavan Kumar C, Raghavendra Ramachandra

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文系统综述了身份证件伪造攻击(物理呈现、数字注入、生成式合成)及检测方法,揭示了基准与现实间的差距,并发现最强模型在零样本场景下APCER超25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30313 2026-07-03 cs.CV cs.LG 版本更新 57%

TRACE: A Concept Bottleneck Model for Longitudinal 3D Glioblastoma Response Assessment

TRACE:用于纵向3D胶质母细胞瘤反应评估的概念瓶颈模型

Alia Tarek, Hamsa Saberr, Hamza Elghonemy, Youssef Afify, Tamer Basha, Omair Shahzad Bhatti, Abdulrahman M. Selim, Hasan Md Tusfiqur Alam, Daniel Sonntag

机构 * Department of Biomedical and Healthcare Data Engineering, Faculty of Engineering, Cairo University(生物医学与健康数据工程系,工程学院,开罗大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) University of Oldenburg(奥尔登堡大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出TRACE模型,通过概念瓶颈架构将RANO 2.0标准融入深度学习,实现可解释的4类胶质母细胞瘤纵向反应分类,在LUMIERE数据集上达到4类宏F1为0.4769,并支持概念校正。

Comments Accept in the EXPLIMED: Explainable Artificial Intelligence for the Medical Domain workshop in IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31174 2026-07-03 cs.AI 新提交 57%

ClawArena-Team: Benchmarking Subagent Orchestration and Dynamic Workflows in Language-Model Agents

ClawArena-Team: 语言模型智能体中子智能体编排与动态工作流的基准测试

Kaiwen Xiong, Haonian Ji, Shi Qiu, Zeyu Zheng, Cihang Xie, Xinyu Ye, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 提出ClawArena-Team基准,通过41个多轮多模态多目录场景,评估单个LLM作为管理者编排子智能体的能力,发现管理瓶颈在于权限授予而非感知,且成本与质量解耦。

Comments 24 pages, 10 figures, website: https://www.clawarena.cc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16130 2026-07-03 cs.CV 版本更新 57%

EPOFusion: Exposure aware Progressive Optimization Method for Infrared and Visible Image Fusion

EPOFusion:一种针对红外和可见图像融合的曝光感知渐进优化方法

Zhiwei Wang, Defeng He, Li Zhao, Xiaoqin Zhang, Yuxing Li, Edmund Y. Lam

机构 * College of Information Engineering, Zhejiang University of Technology(浙江工业大学信息工程学院) College of Information Science and Technology, Zhejiang Shuren University(浙江树人大学信息科技学院) Department of Electrical and Electronic Engineering, The University of Hong Kong(香港大学电机电子工程系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出EPOFusion方法,通过引入指导模块和迭代解码器提升曝光区域的融合效果,同时构建首个高质红外引导标注的曝光数据集,实验表明其在视觉保真度和下游任务表现上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01791 2026-07-03 q-bio.MN 新提交 50%

MERLIN-SUITE: Probabilistic modular GRN inference from multi-omics data integrating regulatory priors and transcription factor activity

MERLIN-SUITE: 整合调控先验和转录因子活性的多组学数据概率模块化基因调控网络推断

Suvojit Hazra, Marina Kotvanova, Kirstan Gimse, Sushmita Roy

专题命中 多模态评测 :multi-modal(abstract)

AI总结 提出MERLIN-SUITE框架,通过整合外部调控先验和潜在转录因子活性估计,实现从多组学数据中稳健推断基因调控网络,并在单细胞重编程数据中验证。

Comments 27 pages, 7 figures, This book chapter is scheduled to appear in the lab protocol series Methods in Molecular Biology

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01508 2026-07-03 q-bio.MN 新提交 50%

scMTNI: Leveraging cellular trajectory and context to infer dynamic GRNs from single-cell multi-omics data

scMTNI:利用细胞轨迹和上下文从单细胞多组学数据推断动态基因调控网络

Suvojit Hazra, Chandrani Kumari, Sushmita Roy

专题命中 多模态评测 :multi-modal(abstract)

AI总结 提出scMTNI多任务学习框架,整合单细胞多组学数据推断细胞类型特异性GRN及其动态变化,应用于细胞重编程数据识别关键调控因子。

Comments 24 pages, 5 figures, This book chapter is scheduled to appear in the lab protocol series Methods in Molecular Biology

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17793 2026-07-03 cs.HC cs.DB 新提交 50%

Evaluating Social Engineering Risks in AI-based Interaction using Biometrics and a Gaming Setup

ARES: 一种用于人类-人工智能游戏中基于角色的社会工程风险自适应评估平台

Roberto Daza, Javier Irigoyen, Ivan Lopez, Raquel Rodriguez-Carvajal, Laura Gomez-Carbajo, Julian Fierrez, Ruben Tolosana, Aythami Morales

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出ARES平台,通过可控社交游戏审计LLM中介的社会决策中的自适应社会工程风险,支持人-人、人-AI和AI-AI设置,并收集多模态数据集以评估风险。

Comments 6 pages, 2 figures. Accepted at the IEEE International Carnahan Conference on Security Technology (ICCST 2026), October 14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11599 2026-07-03 econ.GN q-fin.EC 版本更新 50%

Can LLMs Credibly Transform the Creation of Panel Data from Diverse Historical Tables?

LLM能否可信地转换来自不同历史表格的面板数据?

Verónica Bäcker-Peral, Vitaly Meursault, Christopher Severen

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出基于多模态LLM的管道,以低成本从历史表格中提取面板数据,在车辆登记数据上达到95.4%精确匹配率,成本仅为传统方法的1/50。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 5 篇

2512.14157 2026-07-03 cs.AI cs.CV 版本更新 85%

Ophiuchus: Incentivizing Tool-augmented "Think with Images" for Joint Medical Segmentation, Understanding and Reasoning

Ophiuchus: 激励工具增强的“图像思考”用于联合医学分割、理解与推理

Yankai Jiang, Yujie Zhang, Peng Zhang, Wenjie Li, Yichen Li, Jintai Chen, Xiaoming Shi, Shihui Zhen

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Information Hub, HKUST (Guangzhou)(信息枢纽,香港科技大学(广州))

专题命中 多模态Agent :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出Ophiuchus框架,通过三阶段训练策略(冷启动SFT、自反思微调、工具强化学习)使MLLM动态聚焦细粒度视觉区域,实现精准医学分割与诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02479 2026-07-03 cs.CV 新提交 57%

EAGLE-360: Embodied Active Global-to-Local Exploration in 360$^\circ$

EAGLE-360: 360°环境中的具身主动全局到局部探索

Jingtao Xu, Zizhuo Lin, Jianwen Sun, Yi Yang, Yawei Luo

机构 * Zhejiang University(浙江大学) Central China Normal University(华中师范大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 针对多模态大模型在360°全景主动视觉搜索中因极地畸变和连续拓扑建模不足导致的效率低下问题,提出EAGLE-360框架,通过全局先验引导局部探索,结合RoPE Rolling位置编码和GRPO训练,实现近8倍精度提升。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02426 2026-07-03 cs.LG cs.AI 新提交 57%

QFedAgent: Quantum-Enhanced Personalized Federated Learning for Multi-Agent Activity Recognition

QFedAgent: 量子增强的个性化联邦学习用于多智能体活动识别

Quoc Bao Phan, Tuy Tan Nguyen

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) FAMU-FSU College of Engineering, Florida State University(佛罗里达州立大学工程学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出QFedAgent混合量子-经典个性化联邦学习框架,通过变分量子电路融合模块减少参数开销,在非独立同分布多模态数据上实现97.7%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00007 2026-07-03 cs.IR cs.AI 新提交 57%

BaRA: Budget-constrained and Reliable Web Data Collection Agent

BaRA: 基于BFS与反思的网络数据收集代理

Soojeong Lee, Joseph Lee, Yongseong Cho, Sunjae Kim, Youngwoo Moon, Kyungwoo Song

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 提出BaRA框架,结合有界广度优先搜索和历史自反思,在固定交互预算下高效收集网站级数据,在链接发现和可下载多模态提取上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12144 2026-07-03 cs.MA 版本更新 50%

VERITAS: A Multi-Agent Co-Scientist for Verifiable Image-Derived Hypothesis Testing

VERITAS:通过智能系统进行图像派生假设检验的可验证认知推理

Lucas Stoffl, Benedikt Wiestler, Johannes C. Paetzold

专题命中 多模态Agent :multimodal(abstract)

AI总结 VERITAS通过多智能体系统自主测试自然语言假设,生成可审计的证据链,通过四阶段工作流和认知证据标签框架提升医学影像研究的可验证性,达到81.4%的准确率。

Comments 43 pages, 5 figures. Code available at https://github.com/LucZot/veritas

详情

展开后加载摘要…

URL PDF HTML 收藏