arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-01 至 2026-04-01 共收录 83 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 13 篇

2602.15772 2026-04-01 cs.CV cs.AI 81%

Understanding vs. Generation: Navigating Optimization Dilemma in Multimodal Models

理解与生成:多模态模型中的优化困境导航

Sen Ye, Mengde Xu, Shuyang Gu, Di He, Liwei Wang, Han Hu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Tencent(腾讯) Center for Data Science, Peking University(北京大学数据科学中心) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出R3框架,通过将生成任务分解为生成-理解-生成的多步骤过程,缓解生成与理解之间的优化困境,提升生成效果和理解能力。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29029 2026-04-01 cs.CV cs.AI 81%

MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

MMFace-DiT:一种双流扩散变换器用于高保真多模态人脸生成

Bharath Krishnamurthy, Ajita Rattani

机构 * University of North Texas(北德克萨斯大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 MMFace-DiT通过双流Transformer实现多模态人脸生成,融合空间和语义信息,提升生成质量与控制能力,相比现有方法提升40%的视觉保真度和提示对齐度。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 22 pages (Main Text + Supplementary), 14 figures, 5 tables, 4 algorithms. Project page: https://vcbsl.github.io/MMFace-DiT/ and Code Repository: https://github.com/Bharath-K3/MMFace-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29423 2026-04-01 cs.CV 70%

A2BFR: Attribute-Aware Blind Face Restoration

A2BFR:属性感知的盲脸修复

Chenxin Zhu, Yushun Fang, Lu Liu, Shibo Yin, Xiaohong Liu, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司)

专题命中 多模态生成 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出A2BFR框架,结合高保真重建与提示可控生成,通过属性感知学习和语义双训练提升修复精度与可控性,实验显示在恢复保真度和指令遵循上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22715 2026-04-01 cs.CV cs.AI cs.CL cs.MM 70%

ReAG: Reasoning-Augmented Generation for Knowledge-based Visual Question Answering

ReAG:基于推理的生成用于基于知识的视觉问答

Alberto Compagnoni, Marco Morini, Sara Sarto, Federico Cocchi, Davide Caffagni, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学) University of Pisa(比萨大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 ReAG通过结合粗粒度和细粒度检索及批评模型过滤无关信息,提升知识密集型视觉问答的准确性和可解释性。

Comments CVPR 2026 - Project page: https://aimagelab.github.io/ReAG/

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10853 2026-04-01 cs.LG cs.AI cs.CV 62%

GenOL: Generating Diverse Examples for Name-only Online Learning

GenOL:为名称-only在线学习生成多样化示例

Minhyuk Seo, Seongwon Cho, Minjae Lee, Diganta Misra, Hyeonbeom Choi, Seon Joo Kim, Jonghyun Choi

机构 * KU Leuven(鲁汶大学) Seoul National University(首尔大学) ELLIS(欧洲学习与智能系统实验室) MPI-IS Tübingen(马克斯·普朗克智能系统研究所图宾根) Yonsei University(延世大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对在线学习中数据分布偏移问题,提出GenOL框架,通过生成模型提升名称-only训练中图像的内在和跨模型多样性,优于传统监督和网络监督方法。

Comments TMLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15713 2026-04-01 cs.CV 57%

DiffusionVL: Translating Any Autoregressive Models into Diffusion Vision Language Models

DiffusionVL: 将任意自回归模型转化为扩散视觉语言模型

Lunbin Zeng, Jingfeng Yao, Bencheng Liao, Hongyuan Tao, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DiffusionVL,通过高效扩散微调将预训练自回归模型转化为扩散视觉语言模型,实现高效生成和性能提升。

Comments 12 pages, 4 figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19114 2026-04-01 cs.CV 57%

CreatiDesign: A Unified Multi-Conditional Diffusion Transformer for Creative Graphic Design

CreatiDesign: 一种统一的多条件扩散变换器用于创意图形设计

Hui Zhang, Dexiang Hong, Maoke Yang, Yutao Cheng, Zhao Zhang, Weidong Chen, Jie Shao, Xinglong Wu, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) Bytedance Intelligent Creation(字节跳动智能创作) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CreatiDesign,一种统一的多条件扩散变换器,解决多条件控制问题,通过多模态注意力掩码机制和自动化数据集构建,提升图形设计生成的准确性和和谐度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16205 2026-04-01 cs.CV eess.IV 57%

Generative AI Enables Structural Brain Network Construction from fMRI via Symmetric Diffusion Learning

生成式AI通过对称扩散学习从fMRI构建结构脑网络

Qiankun Zuo, Bangjun Lei, Wanyu Qiu, Changhong Jing, Jin Hong, Shuqiang Wang

机构 * Department of Computing, Hong Kong Polytechnic University(香港理工大学计算学系) School of Information Engineering, Nanchang University(南昌大学信息工程学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DiffGAN-F2S模型,通过统一框架从fMRI预测结构连接,利用对称扩散生成对抗网络和自适应学习生成高保真结构连接,测试表明其在结构连接预测上优于其他模型,并能识别重要脑区和连接,为多模态脑网络融合提供新方法。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29492 2026-04-01 cs.CL 57%

Calibrated Confidence Expression for Radiology Report Generation

放射报告生成中的校准置信度表达

David Bani-Harouni, Chantal Pellegrini, Julian Lüers, Su Hwan Kim, Markus Baalmann, Benedikt Wiestler, Rickmer Braren, Nassir Navab, Matthias Keicher

机构 * Computer Aided Medical Procedures, Technical University of Munich, Germany(德国慕尼黑工业大学计算机辅助医疗程序) Munich Center for Machine Learning (MCML), Germany(德国慕尼黑机器学习中心) Department of Diagnostic and Interventional Radiology, TUM Klinikum rechts der Isar, Germany(德国慕尼黑工业大学伊萨尔河右岸医院诊断与介入放射科) Department of Diagnostic and Interventional Neuroradiology, TUM Klinikum rechts der Isar, Germany(德国慕尼黑工业大学伊萨尔河右岸医院诊断与介入神经放射科) Department of Diagnostic and Interventional Radiology and Nuclear Medicine, University Medical Center Hamburg-Eppendorf, Germany(德国汉堡-埃彭多夫大学医学中心诊断与介入放射学及核医学科) AI for Image-Guided Diagnosis and Therapy, Technical University of Munich, Germany(德国慕尼黑工业大学人工智能图像引导诊断与治疗)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本文提出ConRad框架,通过强化学习提升医学大视觉-语言模型的置信度校准,以生成更可靠的放射报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29239 2026-04-01 cs.CV 57%

Diffusion Mental Averages

扩散心理平均

Phonphrm Thawatdamrongkit, Sukit Seripanitkarn, Supasorn Suwajanakorn

机构 * VISTEC(泰国威斯泰克科学技术研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出扩散心理平均(DMA),通过在扩散模型语义空间内平均生成样本,解决传统方法在生成相同提示下的模糊问题,实现一致且逼真的概念平均。

Comments CVPR 2026. Project page: https://diffusion-mental-averages.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28068 2026-04-01 cs.CV 57%

AIBench: Evaluating Visual-Logical Consistency in Academic Illustration Generation

AIBench:评估学术示意图生成中的视觉-逻辑一致性

Zhaohe Liao, Kaixun Jiang, Zhihang Liu, Yujie Wei, Junqiu Yu, Quanhao Li, Hong-Tao Yu, Pandeng Li, Yuzheng Wang, Zhen Xing, Shiwei Zhang, Chen-Wei Xie, Yun Zheng, Xihui Liu

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) SJTU(上海交通大学) FDU(复旦大学) USTC(中国科学技术大学) SEU(东南大学) HKU(香港大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出AIBench,首个通过VQA评估学术示意图逻辑正确性及VLM评估美观性的基准,通过四层问题验证生成示意图与论文的一致性,发现模型在该任务上的性能差异显著,且逻辑与美观难以同时优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29855 2026-04-01 cs.GR 50%

PosterReward: Unlocking Accurate Evaluation for High-Quality Graphic Design Generation

PosterReward: 解锁高质量图形设计生成的准确评估

Jianyu Lai, Sixiang Chen, Jialin Gao, Hengyu Shi, Zhongying Liu, Fuxiang Zhai, Junfeng Luo, Xiaoming Wei, Lujia Wang, Lei Zhu

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出PosterReward,通过多阶段训练策略构建高质量海报偏好数据集,设计专用奖励模型以提升海报评估精度,并引入评估基准测试现有模型性能。

Comments Accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 15 篇

2603.29901 2026-04-01 cs.CV cs.CL 81%

Less Is More? Selective Visual Attention to High-Importance Regions for Multimodal Radiology Summarization

少即是多?选择性关注高重要性区域用于多模态放射学摘要

Mst. Fahmida Sultana Naznin, Adnan Ibney Faruq, Mushfiqur Rahman, Niloy Kumar Mondal, Md. Mehedi Hasan Shawon, Md Rakibul Hasan

机构 * Bangladesh University of Engineering and Technology(孟加拉国工程技术大学) BRAC University(布拉克大学) Curtin University(科廷大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文通过MIMIC-CXR基准测试表明,选择性关注病理相关视觉区域比全图更有效,提出ViTAS模型在多模态放射学摘要中取得SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00818 2026-04-01 cs.AI cs.CV 81%

Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning

Med-CMR:一个整合视觉证据和临床逻辑的细粒度基准,用于医疗复杂多模态推理

Haozhen Gong, Xiaozhong Ji, Yuansen Liu, Wenbin Wu, Xiaoxiao Yan, Jingjing Liu, Kai Wu, Jiazhen Pan, Bailiang Jian, Jiangning Zhang, Xiaobin Hu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Tongji University(同济大学) Ruijin Hospital(瑞金医院) Technical University of Munich(慕尼黑工业大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Med-CMR通过细粒度分解医疗多模态推理能力,设计挑战性任务并覆盖广泛高质量数据,评估18种先进大语言模型,发现GPT-5在多项选择题和开放性评分中表现最佳,但专业医疗大语言模型并不总能超越强通用模型,长尾泛化成为主要失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29677 2026-04-01 cs.LG cs.AI 79%

Mind the Gap: A Framework for Assessing Pitfalls in Multimodal Active Learning

注意差距:一个多模态主动学习中陷阱评估的框架

Dustin Eisenhardt, Yunhee Jeong, Florian Buettner

机构 * German Cancer Research Center (DKFZ)(德国癌症研究中心(DKFZ)) German Cancer Consortium (DKTK)(德国癌症联盟(DKTK)) UCT Frankfurt-Marburg(法兰克福-马尔堡大学癌症中心) Institute of Informatics, Goethe University Frankfurt(法兰克福歌德大学信息学研究所) Department of Medicine, Goethe University Frankfurt(法兰克福歌德大学医学系) Frankfurt Cancer Institute (FCI)(法兰克福癌症研究所(FCI)) Crop Science Division, Bayer AG(拜耳股份公司作物科学部)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一个多模态主动学习评估框架,通过合成数据集系统评估主动学习策略,发现模型易产生不平衡表示,现有方法无法缓解此问题,需设计模态感知的查询策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29199 2026-04-01 cs.AI 79%

AEC-Bench: A Multimodal Benchmark for Agentic Systems in Architecture, Engineering, and Construction

AEC-Bench:一种用于建筑、工程和施工领域代理系统的多模态基准

Harsh Mankodiya, Chase Gallik, Theodoros Galanos, Andriy Mulyar

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 AEC-Bench旨在评估建筑、工程和施工领域代理系统在真实任务中的表现,涵盖图纸理解、跨表单推理和项目级协调任务,通过多模型基准测试提升基础模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28784 2026-04-01 eess.SP cs.AI 79%

A Multi-Modal Dataset for Ground Reaction Force Estimation Using Consumer Wearable Sensors

一种用于使用消费级可穿戴传感器估计地面反作用力的多模态数据集

Parvin Ghaffarzadeh, Debarati Chakraborty, Koorosh Aslansefat, Ali Dostan, Yiannis Papadopoulos

机构 * University of Hull(赫尔大学) Nottingham Trent University(诺丁汉特伦特大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出一个多模态数据集,用于通过苹果手表传感器估计垂直地面反作用力,包含惯性测量单元和力板数据,支持可穿戴生物力学研究和机器学习模型评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06874 2026-04-01 cs.CV 79%

MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation

MVGGT:多模态视觉几何 grounded 变换器用于多视角3D指称表达分割

Changli Wu, Haodong Wang, Jiayi Ji, Yutian Yao, Chunsai Du, Jihua Kang, Yanwei Fu, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ByteDance(字节跳动) Tianjin University of Science and Technology(天津科技大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MVGGT,一种高效的端到端框架,通过双分支设计将语言信息整合到稀疏视角的几何推理中,解决稀疏视角下的优化障碍,建立首个强基线,实现高精度和快速推理。

Comments Accepted to CVPR 2026; Project Website: https://mvggt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02536 2026-04-01 cs.CV 79%

MovieRecapsQA: A Multimodal Open-Ended Video Question-Answering Benchmark

MovieRecapsQA: 一种多模态开放式视频问答基准

Shaden Shaar, Bradon Thymes, Sirawut Chaixanien, Claire Cardie, Bharath Hariharan

机构 * Cornell University(康奈尔大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出MovieRecapsQA基准,通过电影回顾视频生成8200个开放式问题及事实,构建无参考评估指标,评估多模态能力,发现视觉感知是主要瓶颈。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29793 2026-04-01 cs.LG q-bio.QM 78%

Multimodal Machine Learning for Early Prediction of Metastasis in a Swedish Multi-Cancer Cohort

多模态机器学习在瑞典多癌队列中早期预测转移的应用

Franco Rugolon, Korbinian Randl, Braslav Jovanovic, Ioanna Miliou, Panagiotis Papapetrou

机构 * Karolinska University Hospital(卡罗林斯卡大学医院) Department of Computer and Systems Sciences, Stockholm University(斯德哥尔摩大学计算机与系统科学系)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出利用多模态机器学习在诊断前一个月预测转移风险,通过整合电子健康记录数据,比较单模态与多模态模型的性能,展示中间融合策略在多种癌症中的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02350 2026-04-01 cs.HC 78%

FIRMED: A Peak-Centered Multimodal Dataset with Fine-Grained Annotation for Emotion Recognition

FIRMED:一种以峰值为中心的多模态数据集,用于情感识别的细粒度标注

Hao Tang, Songyun Xie, Xinzhou Xie, Can Liao, Bohan Li, Zhongyu Tian, Dalu Zheng

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 FIRMED通过即时回忆标注方法,提供同步的EEG、ECG、GSR、PPG和面部记录,以峰值为中心的标注减少了动态情感识别中的时间标签噪声,实验表明其在八种EEG分类器上平均提升3.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29967 2026-04-01 cs.CV 70%

Learning Structural-Functional Brain Representations through Multi-Scale Adaptive Graph Attention for Cognitive Insight

通过多尺度自适应图注意力学习结构-功能脑表示以获得认知洞察

Badhan Mazumder, Sir-Lord Wiafe, Aline Kotoski, Vince D. Calhoun, Dong Hye Ye

机构 * Georgia State University(佐治亚州立大学) Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学) Tri-Institutional Center for Translational Research in Neuroimaging and Data Science (TReNDS)(三机构神经影像与数据科学转化研究中心 (TReNDS))

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MAGNet框架,通过多尺度自适应图注意力机制融合结构和功能脑网络,提升认知功能理解。

Comments Preprint version of the paper accepted to the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026). This is the author's accepted manuscript. The final published version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29791 2026-04-01 cs.AI cs.CL cs.LG 62%

Reasoning-Driven Synthetic Data Generation and Evaluation

基于推理的合成数据生成与评估

Tim R. Davidson, Benoit Seguin, Enrico Bacis, Cesar Ilharco, Hamza Harkous

机构 * EPFL(瑞士联邦理工学院洛桑) Google(谷歌) Google Deepmind(谷歌DeepMind)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Simula框架,通过无种子、代理化方法生成大规模合成数据,提供可解释且可控的生成流程,验证了其在多种数据集上的有效性,为合成数据机制设计和大规模生成评估提供指导。

Comments Accepted to TMLR 2026, J2C Certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29592 2026-04-01 cs.GR cs.CV 57%

Bioinspired123D: Generative 3D Modeling System for Bioinspired Structures

生物启发123D:用于生物启发结构的生成3D建模系统

Rachel K. Luu, Markus J. Buehler

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Bioinspired123D,一种轻量级模块化代码-几何管道,通过参数化程序直接生成可制造的3D结构,而非密集视觉表示。系统基于生物启发3D模型,结合多模态检索增强生成和视觉-语言模型批评者,实现了高效的文本到3D生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02413 2026-04-01 cs.CV 57%

TruckDrive: Long-Range Autonomous Highway Driving Dataset

TruckDrive:长距离自动驾驶高速公路数据集

Filippo Ghilotti, Edoardo Palladin, Samuel Brucker, Adam Sigal, Mario Bijelic, Felix Heide

机构 * Torc Robotics Princeton University(普林斯顿大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出TruckDrive数据集,用于解决重卡车高速公路自动驾驶中长距离感知的挑战,通过多模态传感器采集47.5万样本,支持20秒序列中2D检测1000米和3D检测400米的感知基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18804 2026-04-01 cs.RO cs.HC 50%

"You've got a friend in me": Co-Designing a Peer Social Robot for Young Newcomers' Language and Cultural Learning

你在我身边:为新移民儿童语言和文化学习设计同伴社交机器人

Neil Fernandes, Cheng Tang, Tehniyat Shahbaz, Alex Hauschildt, Emily Davies-Robinson, Yue Hu, Kerstin Dautenhahn

机构 * University of Waterloo(滑铁卢大学) United for Literacy(联合扫盲组织)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文报告了一项与加拿大United for Literacy导师合作的共设计研究,开发了Maple社交助教机器人,通过短故事活动、多模态支架和嵌入式测验支持新移民儿童的语言和社会化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29141 2026-04-01 cs.CY 50%

Modernizing Ground Truth: Four Shifts Toward Improving Reliability and Validity in AI in Education

现代化真实数据:四种转变以提升教育中人工智能可靠性和有效性

Danielle R. Thomas, Conrad Borchers, Kirk P. Vanacore, Kenneth R. Koedinger, René F. Kizilcec

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文探讨了教育AI中真实数据质量的挑战,提出通过诊断信号、透明报告、偏见审计和有效性证据四种转变提升可靠性和有效性。

Comments Accepted as full paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 9 篇

2603.29902 2026-04-01 cs.AI 83%

ATP-Bench: Towards Agentic Tool Planning for MLLM Interleaved Generation

ATP-Bench: 向多模态大语言模型交错生成的代理工具规划迈进

Yinuo Liu, Zi Qian, Heng Zhou, Jiahao Zhang, Yajie Zhang, Zhihang Li, Mengyu Zhou, Erchao Zhao, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里巴巴通义千问大模型应用团队) Huazhong University of Science and Technology(华中科技大学) Zhejiang University(浙江大学)

专题命中 多模态Agent :MLLM(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 针对多模态大语言模型交错生成中事实性与创造性难以统一的问题,提出ATP-Bench基准,包含7702个问题-答案对,评估代理工具规划能力,揭示模型在交错规划中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29161 2026-04-01 cs.AI 83%

Webscraper: Leverage Multimodal Large Language Models for Index-Content Web Scraping

Webscraper:利用多模态大语言模型进行索引-内容网页抓取

Guan-Lun Huang, Yuh-Jzer Joung

机构 * Dept. of Information Management, National Taiwan University, Taipei, Taiwan(国立台湾大学资讯管理学系,台北,台湾)

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出Webscraper框架,利用多模态大语言模型自动导航交互界面并提取结构化数据,通过五阶段提示和定制工具提升动态网站抓取准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29409 2026-04-01 cs.RO 78%

CLaD: Planning with Grounded Foresight via Cross-Modal Latent Dynamics

CLaD:通过跨模态潜在动力学实现具有基础前瞻性的规划

Andrew Jeong, Jaemin Kim, Sebin Lee, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院)

专题命中 多模态Agent :cross-modal(title,abstract)

AI总结 CLaD通过不对称跨注意力机制联合建模本体和语义状态演化,利用自监督目标和EMA编码器防止表征崩溃,实现高成功率的长序列动作生成。

Comments Project page: https://andrewwwj.github.io/clad

详情

展开后加载摘要…

URL PDF HTML 收藏