arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-14 至 2026-08-14 共收录 83 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 12 篇

2608.12570 2026-08-14 cs.CV cs.IR 新提交 79%

Attribute-Conditioned Multimodal Slot Factorization for Controllable Fashion Retrieval

用于可控时尚检索的属性条件多模态槽分解

Najmeh Forouzandehmehr, Topojoy Biswas, Evren Korpeoglu, Kannan Achan

机构 * Walmart Global Tech(沃尔玛全球科技)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出MM-slotgate多模态槽编码器,将Fashion-CLIP嵌入分解为属性槽,在H&M数据集上实现可控时尚检索,颜色等属性性能提升显著,优于多模态融合与仅文本检索方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05809 2026-08-14 cs.CR cs.LG 版本更新 78%

Adjustable Text-Guided Backdoor Attacks with Natural-Word Triggers on Multimodal Pretrained Models

隐蔽且可调节的文本引导后门攻击多模态预训练模型

Yiyang Zhang, Chaojian Yu, Ziming Hong, Yuanjie Shao, Qinmu Peng, Tongliang Liu, Xinge You

机构 * National Anti-Counterfeit Engineering Research Center, Huazhong University of Science and Technology(华中科技大学国家防伪工程技术研究中心) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出一种基于文本的后门攻击方法,利用常见文本词汇作为触发器,提升攻击隐蔽性和实用性,并通过视觉对抗扰动调节模型对文本触发器的学习,实现可控的攻击效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12843 2026-08-14 cs.CV cs.AI 新提交 73%

Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval

用于基于文本的行人异常检索的、带分歧感知重排序的异构视觉语言集成方法

Huu-An Vu, Cam Tu Tran Thi, Thanh Toan Le Ngo, Hoang Vo, Do Trung Hieu, Hieu Dinh Trung Pham, Khang Minh Le, Huy Minh Nhat Nguyen

机构 * Hanoi University of Science and Technology(河内科技大学) University of Information Technology, VNU-HCM(胡志明市国家大学信息技术大学) Vietnam National University, Ho Chi Minh City(胡志明市国家大学) VinUniversity Vietnamese-German University(越南德国大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对大规模基于文本的行人异常检索难题,提出带分歧感知重排序的异构视觉语言集成方法,在PAB基准上取得90.92% mAP等优异指标,验证了方案有效性。

Comments Accepted at the ECCV 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12627 2026-08-14 cs.CV cs.AI cs.CL cs.HC 新提交 67%

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

EgoCITE:面向长时程自我中心记忆的上下文增强索引与时序感知检索

Le Zhang, Ke Sun

机构 * University of Michigan(密歇根大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本研究针对长时程自我中心记忆系统的索引不可靠、忽略时序意图的问题,提出EgoCITE框架,经多数据集评估,其准确率优于基线且成本显著低于长上下文LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12746 2026-08-14 cs.CV cs.CL 新提交 62%

Dual-Stream Cross-Anchor Correction Grounding Long-Form Captions and the Domain Limits of Object-Level Anchors

双流跨锚校正:接地长文本描述与对象级锚点的域限制

LingKai Bu

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对多模态大语言模型的长文本描述对象幻觉问题,本文提出双流跨锚校正方法,通过耦合感知流与认知流提升精度,在长文本场景下实现最优性能,且存在域条件性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12689 2026-08-14 cs.CV cs.AI 新提交 62%

Mr3D-VL: A generalist vision language foundation model for Multiparametric 3D Magnetic Resonance Imaging

Mr3D-VL:面向多参数3D磁共振成像的通用视觉语言基础模型

Zhi Qiao, Xintong Wu, Yichu He, Feng Shi

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文针对现有3D视觉语言模型无法满足多参数3D MRI跨模态协同推理需求的问题,提出Mr3D-VL模型,通过特定设计实现性能提升,在多项任务上优于同规模的领域及通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12335 2026-08-14 cs.CL cs.MM 新提交 62%

HC-RAG: Evidence-Centric Retrieval-Augmented Generation over Heterogeneous Financial Filings

HC-RAG:面向异构金融文件的以证据为中心的检索增强生成

Siyuan Chen, Huaye Tan, You Li, Jiajun Liang

机构 * Sun Yat-sen University(中山大学) Central South University(中南大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL、cs.MM

AI总结 HC-RAG是面向异构金融文件的以证据为中心的分层跨模态RAG框架,通过构建类型化金融证据图、按意图路由证据,在金融问答基准上较RAPTOR、GraphRAG取得显著性能提升。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13495 2026-08-14 cs.CV cs.LG 新提交 57%

TraVEL: Trajectory-Guided Video Embedding Learning for Driving-Video Retrieval

TraVEL:面向驾驶视频检索的轨迹引导视频嵌入学习

Yi-Chung Chen, Philip Jacobson, Tom Lampo, Yiren Lu, Jin Yao, David I. Inouye, Jing Gao, Danhua Guo, Burhan Yaman

机构 * Uber AV Labs(优步自动驾驶实验室) Purdue University(普渡大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出TraVEL框架,将通用多模态嵌入模型适配到驾驶视频检索,结合轨迹监督与Group Relative Policy Optimization,在nuReasoning基准上提升了不同规模模型的运动相关检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17782 2026-08-14 cs.CV 版本更新 57%

Subject-Aware Multi-Granularity Alignment for Zero-Shot EEG-to-Image Retrieval

面向主体的多粒度对齐用于零样本EEG到图像检索

Lin Jiang, Qingshan She, Jiale Xu, Haiqi Xu, Duanpo Wu, Zhenzhong Kuang

机构 * School of Automation, Hangzhou Dianzi University(杭州电子科技大学自动化学院) Zhejiang Provincial Key Laboratory of Brain Computer Collaborative Intelligence Technology and Applications, Hangzhou, Zhejiang(浙江省脑机协同智能技术与应用重点实验室,杭州,浙江) College of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SAMGA框架,通过多粒度对齐解决EEG到图像检索中主体依赖性和多尺度信息的问题,提升检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11973 2026-08-14 cs.IR 版本更新 50%

Sci-Surf: Navigating Scientific Literature Discovery through Human Feedback and Intelligent Summarization

Sci-Surf:通过人类反馈与智能摘要实现科学文献发现

Fang Guo, Qi Zhu, Rongcan Pei, Shuqi He, Hui Chen, Yue Zhang

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 针对现有学术发现平台支持不足的问题,提出以意图为中心的Sci-Surf系统,结合反馈驱动推荐与多模态论文消化,经评估推荐质量和消化质量有可测量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 14 篇

2608.12876 2026-08-14 cs.CV cs.AI 新提交 82%

SPARED: Reasoning-Based AI-Generated Image Detection via Adversarially Edited Data

SPARED:基于推理的AI生成图像检测方法,采用对抗编辑数据

Yicheng Bao, Xiahui Guo, Xuhong Wang, Xin Tan

专题命中 多模态生成 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 本研究提出对抗强化学习框架SPARED,通过扩散图像编辑器与推理型MLLM的交替博弈,训练出能抗捷径、泛化能力强的AI生成图像检测器,在三个外部基准上性能单调提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12904 2026-08-14 cs.CV 新提交 79%

HounsWorld: A Multimodal World Model for Hidden Patient-State Readout, Reconstruction, and Simulation

HounsWorld:用于隐藏患者状态读取、重建与模拟的多模态世界模型

Yunhao Bai, Zhongwei Qiu, Guangyu Guo, Yiming Huang, Tony C. W. Mok, Qinji Yu, Ling Zhang, Yan Wang

机构 * East China Normal University(华东师范大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Laboratory(湖畔实验室) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出3B参数多模态世界模型HounsWorld,结合CT扫描与临床语言,通过共享潜在患者状态实现读取、重建、模拟三类任务,在HounsBench基准上表现优异,提升了CT理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12829 2026-08-14 cs.CV 新提交 79%

Semantic Steering for Controllable Generation: Tuning-Free Concept Erasure in Multimodal Diffusion Transformers

语义引导用于可控生成:多模态扩散Transformer中的无调优概念擦除

Qiao Li, Xiaomeng Fu, Yuanshu Zhao, Qipeng Wang, Jiao Dai, Jizhong Han

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对MM-DiTs的安全风险,提出一种无调优的概念擦除方法,通过在MM-DiT中间模块构建引导向量注入模型,实现高效鲁棒的概念擦除,性能优于现有方法。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02711 2026-08-14 cs.CV 版本更新 79%

Hunyuan3D-Buffalo 1.0: A Unified Multimodal Model for Scalable 3D Generation, Understanding, and Editing

Hunyuan3D-Buffalo 1.0:用于可扩展3D生成、理解与编辑的统一多模态模型

Junliang Ye, Kenkun Liu, Guocun Wang, Yang Li, Yansong Qu, Chunshi Wang, Jingwei Xu, Yunhan Yang, Zibo Zhao, Jiachen Xu, Jiaao Yu, Lifu Wang, Zhihao Liang, Xin Huang, Zhuo Chen, Chunchao Guo

机构 * Tencent Hunyuan(腾讯混元)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 Hunyuan3D-Buffalo 1.0是支持3D理解、文本到3D生成等功能的统一多模态模型,构建87M规模语料库训练,在相关基准上达SOTA或领先性能,验证了统一训练的有效性。

Comments Project Page: https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12592 2026-08-14 cs.LG 新提交 78%

Represent, Then Generate: Multimodal-Conditioned Time-Series Generation under Irregular Missingness

先表征,再生成:不规则缺失下的多模态条件时间序列生成

Haochen Zhang, Jiaheng Guo, Yu-Chao Huang, Nicholas Knoz, Tianlong Chen

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 提出ReCoGen两阶段框架,将多模态条件表征与生成分离,在三个生理基准的16项任务中超越6种生成器,可合成缺失生理信号以实现低侵入性临床监测。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16285 2026-08-14 cs.CV 版本更新 70%

EvoTale: Continual Character Customization for Expanding Story Worlds

持久故事世界模拟与连续角色定制

Jinlu Zhang, Qiyun Wang, Baoxiang Du, Jiayi Ji, Jing He, Rongsheng Zhang, Tangjie Lv, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Fuxi AI Lab, Netease Inc.(福克斯AI实验室,网易公司)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出EverTale,通过统一LoRA模块实现连续角色自定义,引入质量门和区域聚焦采样策略,提升多角色视觉叙事的准确性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13560 2026-08-14 cs.CV cs.AI cs.CL 新提交 67%

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

AutoDesign:面向长视距智能体设计的元工具优化

Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li

机构 * Meituan(美团) MBZUAI(Mohamed bin Zayed University of Artificial Intelligence) Huazhong University of Science and Technology(华中科技大学) Peking University(北京大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 AutoDesign是符合人类设计先验的元工具优化框架,以论文转海报生成任务为实例,在PosterBench上性能优于Claude Design,集成其学习的DesignHarness可提升代码智能体性能,且获人类最高偏好。

Comments Tech Report. Code at: https://github.com/Yaxin9Luo/AutoDesign

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17897 2026-08-14 cs.CV cs.AI cs.LG cs.RO 版本更新 62%

RadarGen: Automotive Radar Point Cloud Generation from Cameras

RadarGen:从摄像头生成汽车雷达点云

Tomer Borreda, Fangqiang Ding, Sanja Fidler, Shengyu Huang, Or Litany

机构 * Technion(技术学院) MIT(麻省理工学院) NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RadarGen通过扩散模型从摄像头图像生成逼真的雷达点云,结合BEV对齐的深度、语义和运动线索,提升雷达生成的物理合理性与多模态模拟能力。

Comments ECCV 2026. Project page: https://radargen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13441 2026-08-14 cs.CV 新提交 57%

Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ

Edit2TikZ:面向基于TikZ的科学图像编辑的全面且具有挑战性的基准

Zongyun Zhang, Jiacheng Ruan, Xian Gao, Ruizhu Zhou, Lingcheng Meng, Lining Hu, Ting Liu, Yuzhuo Fu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文推出科学图像编辑基准Edit2TikZ,评估主流多模态大语言模型发现其性能不足,通过构建混合训练集并采用课程学习,可显著提升紧凑模型的编译成功率。

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13112 2026-08-14 cs.CV 新提交 57%

Towards Physics-Faithful Generation of Scientific Diagrams

面向物理保真的科学图表生成

Minghui Zhang, Jinxin Shi, Yifan Chang, Liangliang Zhao, Yuandong Pu, Qian Yu, Ming Hu, Hanxiao Zhang, Yun Gu, Yirong Chen, Yu Qiao, Bo Zhang, Xiangchao Yan, Bin Fu, Yihao Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对现有文本到图像生成模型生成的科学图表存在物理错误的问题,提出Princigram生成器,通过结构化物理思维链实现物理保真的科学图表生成,在相关基准上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12611 2026-08-14 cs.CV cs.LG 新提交 57%

From Visual Widgets to UI Code: Efficient Tool-Grounded Generation

从视觉控件到UI代码:高效的基于工具的生成

Houston H. Zhang, Tao Zhang, Li Gu, Linfeng Ye, Yuanhao Yu, Xinxin Zuo, Yang Wang, Zhixiang Chi

机构 * McMaster University(麦克马斯特大学) University of Toronto(多伦多大学) Concordia University(康考迪亚大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能

Comments ECCV2026 (MUCG Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03025 2026-08-14 cs.AI 版本更新 57%

DiffImaginE: Imagine to Verify Entity Types with Diffusion

DiffImaginE:通过想象验证实体类型

Feng Zhang, Feiyu Han, Rongxin Yang, Yang Liu, Yancheng Chen, Rui Wang, Yingguang Yang, Tian Xueyun, Chongyang Zhang, Hao Zheng, Xu Kefu, Congjing Ran, Fuhai Chen, Bin Chong

机构 * Fuzhou University(福州大学) Chinese Academy of Sciences(中国科学院) Peking University(北京大学) Alibaba Group(阿里巴巴集团) University of Science and Technology of China(中国科学技术大学) Fullive Innovation (Beijing) AI Technology Co., Ltd.(福莱创新(北京)人工智能科技有限公司) Baidu(百度) Wuhan University(武汉大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 DiffImaginE将多模态命名实体识别的类型验证建模为条件潜在扩散推理,在Twitter-2015和Twitter-2017数据集上,相比确定性对照模型取得了一致的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12608 2026-08-14 cs.CV 版本更新 57%

A Data Efficiency Study of Synthetic Fog for Object Detection Using the Clear2Fog Pipeline

使用Clear2Fog管道研究合成雾的数据效率

Mohamed Ahmed Mohamed, Xiaowei Huang

机构 * Waymo Open Dataset(Waymo开放数据集)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出Clear2Fog管道,通过物理模拟生成雾数据,研究环境多样性对模型鲁棒性的影响,发现混合密度数据训练模型优于固定密度数据,且通过调整学习率可克服合成偏见。

Comments Accepted to Neurocomputing. Project code and experimental configs available at https://github.com/mmohamed28/Clear2Fog

Journal ref Neurocomputing, Vol. 703, 134798, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10383 2026-08-14 cs.RO 版本更新 50%

Real-World Cooperative Bimanual Dexterous Grasp of Large Objects from Single-View Observations

基于单视图观测的真实场景中大型物体的双臂协同灵巧抓取

Ziming Li, Mingxuan Wu, Jiaqi Zhang, Hongfei Li, Yan Gan, Deqiang Ouyang, Ning Wang

机构 * The University of Auckland(奥克兰大学) Chongqing University(重庆大学) Southwest University(西南大学)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文针对机器人双臂抓取大型物体的挑战,提出含多模态数据集、DDPM模块及执行策略的真实场景双臂抓取框架,实验表明其对未见物体抓取成功率高。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态评测 14 篇

2608.13463 2026-08-14 cs.CV cs.AI cs.CL cs.LG 新提交 91%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 8 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12518 2026-08-14 cs.SE 新提交 90%

Does It Render Everywhere? A Study of Cross-Environment Compatibility in MLLM-Generated Webpages

它是否在所有环境中都能渲染?对多模态大语言模型(MLLM)生成网页的跨环境兼容性研究

Ziyun Guo, Jingyu Xiao, Yuqiang Sun, Yintong Huo

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract)

AI总结 该研究针对MLLM生成网页的跨环境兼容性问题,构建WebCompat数据集并开发XCompat检测器,发现68%的网页存在兼容性问题,XCompat的F1分数达0.903且性能优于现有工具与基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12781 2026-08-14 cs.CV 新提交 86%

Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs

超越正确性:混合思维多模态大语言模型(MLLM)的响应行为基准测试与对齐

Xinming Wang, Weinong Wang, Hongming Yang, Yansong Lin, Zheng Ruan, Shangpin Peng, Qiming Peng, Nan Qiao, Fengyuan Lu, Guoqing Ma, Marito Li, Songyang Zhang, Saiyong Yang, Han Hu, Yonglong Tian, Xu-Yao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Large Language Model Department, Tencent(腾讯大语言模型部) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Zhongguancun Academy(中关村学院)

专题命中 多模态评测 :MLLM(title_cn,summary_cn);multimodal(abstract);分类 cs.CV

AI总结 该研究针对混合思维 MLLM 的思维与非思维模式响应错位问题,构建 PatternEval 基准并开发 PatternRL 方法,可减轻跨模式错位且任务性能损失极小。

Comments 8 tables and 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11616 2026-08-14 cs.AI cs.CV cs.LG 版本更新 86%

MBA: Multimodal Benchmark and Agents for Real-World Business Ideation

MBA:面向现实世界商业创意的多模态基准与智能体

Hojun Choi, Jaeyo Shin, Suin Lee, Hyunjung Shim

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究推出首个多模态商业创意基准MBA-Bench,提出MBA-b和MBA-k两种智能体,经实验其性能显著优于相关基准,为多模态商业创意智能体研究提供了重要支撑。

Comments Project page: https://hchoi256.github.io/projects/mba/ Code: https://github.com/hchoi256/MBA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18852 2026-08-14 cs.LG cs.AI cs.CL 版本更新 84%

Robust Checkpoint Selection for Multimodal LLMs via Agentic Evaluation and Stability-Aware Ranking

通过代理评估和稳定性感知排名实现多模态大语言模型的鲁棒检查点选择

Qinwu Xu, Zhuoheng Li, Jessie Salas

机构 * Meta AI

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种多阶段框架,结合了精心挑选的现实世界数据、结构化的LLM判断和多阶段排名协议,以解决多模态大语言模型检查点选择中的鲁棒决策问题,强调数据质量(特别是OCR可读性)对评估有效性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12745 2026-08-14 cs.LG cs.DC 新提交 78%

A Cloud-Edge System for Multimodal Clinical Screening in Resource-Constrained Rural Settings

面向资源受限农村地区多模态临床筛查的云边协同系统

Hei Ting, Chan, Chenwei Wu, Xueshen Liu, Zesen Zhao, Boyuan Zheng, Luis Filipe Nakayama, Michael G. Morley, Liyue Shen, Jiasi Chen, Z. Morley Mao

机构 * University of Michigan(密歇根大学) Massachusetts Institute of Technology(麻省理工学院) Harvard Medical School(哈佛医学院)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究针对资源受限农村地区的多模态临床筛查问题,提出云边协同架构,经实验验证其诊断性能优异且成本更低,可适配部署约束。

Comments 31 pages, 3 figures. In Proceedings of Machine Learning Research, Volume 340, 2026 (Machine Learning for Healthcare Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏