arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-08 至 2026-05-08 共收录 29 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 29 篇

2605.06643 2026-05-08 cs.CV cs.AI cs.LG cs.MM 82%

Are We Making Progress in Multimodal Domain Generalization? A Comprehensive Benchmark Study

我们是否在多模态领域泛化中取得进展?一个全面的基准研究

Hao Dong, Hongzhao Li, Shupan Li, Muhammad Haris Khan, Eleni Chatzi, Olga Fink

机构 * ETH Zürich(苏黎世联邦理工学院) Zhengzhou University(郑州大学) MBZUAI(马克斯·普朗克人工智能研究所) EPFL(苏黎世联邦理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文通过MMDG-Bench基准测试,评估了多模态领域泛化方法的有效性,发现现有方法在公平比较下进步有限,且存在领域和模态配置差异,揭示了领域泛化仍需进一步改进。

Comments Code: https://github.com/lihongzhao99/MMDG_Benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06351 2026-05-08 cs.HC 82%

SIGMA-ASL: Sensor-Integrated Multimodal Dataset for Sign Language Recognition

SIGMA-ASL:用于手语识别的传感器集成多模态数据集

Xiaofang Xiao, Guangchao Li, Guangrong Zhao, Qi Lin, Wen Ma, Hongkai Wen, Yanxiang Wang, Yiran Shen

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出SIGMA-ASL数据集,整合RGB-D相机、毫米波雷达和惯性测量单元,通过多模态信息提升手语识别鲁棒性,提供统一框架和标准化流程以评估单模态与多模态识别系统。

Comments 33 pages. Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11509 2026-05-08 cs.CL cs.AI cs.CV 82%

Multimodal Fact-Level Attribution for Verifiable Reasoning

多模态事实级归因用于可验证推理

David Wan, Han Wang, Ziyang Wang, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MuRGAt基准,用于评估多模态事实归因能力,要求模型在复杂推理中生成明确推理和精确引用,揭示强模型在正确推理下仍易产生幻觉,且增加推理深度或结构化归因会降低准确性。

Comments Accepted to ICML 2026. Code and data are available at https://github.com/meetdavidwan/murgat

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05955 2026-05-08 cs.CL cs.CV 81%

TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity

TableVista:在视觉和结构复杂性下多模态表格推理的基准测试

Zheyuan Yang, Liqiang Shang, Junjie Chen, Xun Yang, Chenglong Xu, Bo Yuan, Chenyuan Jiao, Yaoru Sun, Yilun Zhao

机构 * Tongji University(同济大学) University of Bristol(布里斯托大学) Tianjin University(天津大学) Yale University(耶鲁大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 TableVista包含3000个高质量表格推理问题,通过多风格渲染和转换流程生成30000个多模态样本,评估29种基础模型在不同复杂性下的表现,揭示结构复杂性和视觉整合对推理一致性的影响。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06584 2026-05-08 cs.AI 79%

NeuroAgent: LLM Agents for Multimodal Neuroimaging Analysis and Research

NeuroAgent:用于多模态神经影像分析和研究的LLM代理

Lujia Zhong, Yihao Xia, Jianwei Zhang, Shuo huang, Jiaxin Yue, Mingyang Xia, Yonggang Shi

机构 * Stevens Neuroimaging and Informatics Institute, Keck School of Medicine, University of Southern California(史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) Viterbi School of Engineering, University of Southern California(维特比工程学院,南加州大学) Alfred E. Mann Department of Biomedical Engineering, Viterbi School of Engineering, University of Southern California(阿尔弗雷德·E·曼生物医学工程部门,维特比工程学院,南加州大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 NeuroAgent通过LLM驱动的代理框架自动化多模态神经影像预处理与分析,支持自然语言查询,提升神经影像研究的自动化与可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06371 2026-05-08 cs.AI 79%

Debiased Multimodal Personality Understanding through Dual Causal Intervention

通过双因果干预实现去偏的多模态人格理解

Yangfu Zhu, Zitong Han, Nianwen Ning, Yuting Wei, Yuandong Wang, Hang Feng, Zhenzhou Shao

机构 * Capital Normal University(首都师范大学) Henan University(河南大学) University of International Relations(国际关系大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出双因果调整网络DCAN,通过因果模型消除多模态特征与人格特质间的偏见关联,提升预测准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06289 2026-05-08 stat.ML cs.AI cs.LG 79%

Multimodal Deep Generative Model for Semi-Supervised Learning under Class Imbalance

多模态深度生成模型用于类别不平衡下的半监督学习

Heegeon Yoon, Heeyoung Kim

机构 * Department of Industrial and Systems Engineering, Korea Advanced Institute of Science and Technology (KAIST), Daejeon, Republic of Korea(工业与系统工程系,韩国科学技术院(KAIST),大田,大韩民国)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种多模态深度生成模型,通过共享潜在变量和t分布改进类别不平衡问题,提升半监督学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05014 2026-05-08 cs.CV 79%

CARD: A Multi-Modal Automotive Dataset for Dense 3D Reconstruction in Challenging Road Topography

CARD: 一种用于复杂道路地形密集3D重建的多模态汽车数据集

Gasser Elazab, Frank Neuhaus, Tilman Koß, Malte Splietker, Aditya Date, Michael Unterreiner, Maximilian Jansen, Olaf Hellwich

机构 * CARIAD SE(CARIAD公司) Technische Universität Berlin(柏林技术大学) Vision & Robotics GmbH(视觉与机器人技术有限公司)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 CARD数据集通过提供连续序列中的近密3D地面真实信息,解决了现有数据集在复杂道路地形下深度估计和补全的不足,支持更精确的几何和感知任务评估。

Comments Accepted at CVPR 2026 (Highlight). Project page: https://card.content.cariad.digital

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22859 2026-05-08 cs.CV 79%

From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models

从盲点到收益:面向大型多模态模型的诊断驱动迭代训练

Hongrui Jia, Chaoya Jiang, Yongrui Heng, Shikun Zhang, Wei Ye

机构 * Peking University(北京大学) Shandong University(山东大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出DPE方法,通过诊断驱动的数据生成和强化学习,实现大型多模态模型的持续改进,实验表明在多个基准测试中取得稳定收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05712 2026-05-08 cs.CV 79%

EgoEMG: A Multimodal Egocentric Dataset with Bilateral EMG and Vision for Hand Pose Estimation

EgoEMG:一个用于手姿态估计的多模态自体视角数据集,包含双侧EMG和视觉信息

Ziheng Xi, Jiayi Yu, Yitao Wang, Yanbo Duan, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 EgoEMG数据集融合双侧EMG和视觉信息,用于手姿态估计,包含16通道EMG、IMU、RGB视频和RGB-D视频,涵盖41名参与者60种手势,提供EMG-to-pose、vision-to-pose和融合任务的基准测试。

Comments 34 pages, 13 figures, 15 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05573 2026-05-08 astro-ph.IM cs.AI 79%

AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification

AstroAlertBench: 评估多模态大语言模型在天文学分类中的准确性、推理和诚实性

Claire Chen, Jiabao Sean Xiao, Shuze Daniel Liu, Facundo Perez Paolino, Luke Handley, Theophile Jegou du Laz, Ricky Nilsson, Alice Zou, Matthew Graham, Ashish Mahabal

机构 * California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院) Purdue University(普渡大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出AstroAlertBench,通过多阶段逻辑链评估多模态大语言模型在天文学事件分类中的性能,揭示高精度与模型诚实性之间的矛盾,并引入人机协同评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21471 2026-05-08 cs.AI 79%

SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition

SpatialBench: 多模态大语言模型空间认知的基准测试

Peiran Xu, Sudong Wang, Yao Zhu, Jianing Li, Gege Qi, Yunjian Zhang

机构 * Sun Yat-Sen University(中山大学) HKUST (GZ)(香港科技大学) Zhejiang University(浙江大学) Peking University(北京大学) CAICT(中国科学院电子技术研究所) UCAS(中国科学技术大学) CUC(中国科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出SpatialBench基准,通过五级空间认知框架评估多模态大语言模型的空间能力,揭示模型在感知与符号推理间的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01719 2026-05-08 cs.CL 79%

What MLLMs Learn about When they Learn about Multimodal Reasoning

大语言模型在学习多模态推理时所学的内容

Jiwan Chung, Neel Joshi, Pratyusha Sharma, Youngjae Yu, Vibhav Vineet

机构 * Microsoft Research AI Frontiers(微软研究院人工智能前沿) Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出MathLens基准测试,通过分解性能为感知、推理和多模态特定组件,揭示多模态推理模型评估中隐含的假设。研究显示,不同训练策略导致的能力谱系不同,多模态特定错误占比上升,表明进展反映的是子技能平衡变化而非统一提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04791 2026-05-08 cs.HC 78%

OpenWatch: A Multimodal Benchmark for Hand Gesture Recognition on Smartwatches

OpenWatch: 一种用于智能手表手部动作识别的多模态基准

Pietro Bonazzi, Youssef Ahmed, Daniel Eckert, Andrea Ronco, Junjie Zeng, Dengxin Dai, Michele Magno

专题命中 多模态评测 :multimodal(title);multi-modal(abstract)

AI总结 本文提出OpenWatch多模态基准,通过同步惯性与生理传感数据,评估手部动作识别方法,展示了MixToken和NormWear-Lora等新方法的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06157 2026-05-08 cs.CL cs.AI cs.CV 75%

HNC: Leveraging Hard Negative Captions towards Models with Fine-Grained Visual-Linguistic Comprehension Capabilities

HNC:利用硬负样本提升具有细粒度视觉-语言理解能力的模型

Esra Dönmez, Pascal Tilli, Hsiu-Yu Yang, Thang Vu, Carina Silberer

机构 * Institute for Natural Language Processing, University of Stuttgart(自然语言处理研究所,斯图加特大学)

专题命中 多模态评测 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出HNC数据集,通过自动创建硬负样本提升图像-文本匹配模型的细粒度跨模态理解能力,并提供人工创建的测试集评估模型在复杂跨模态匹配任务中的表现。

Journal ref Association for Computational Linguistics (2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03331 2026-05-08 cs.CL cs.AI 73%

PulseLM: A Foundation Dataset and Benchmark for PPG-Text Learning

PulseLM:PPG-文本学习的基础数据集和基准

Hung Manh Pham, Jinyang Wu, Xiao Ma, Yiming Zhang, Yixin Xu, Aaqib Saeed, Bin Zhu, Zhou Pan, Dong Ma

机构 * Singapore Management University(新加坡管理大学) Queen Mary University of London(伦敦玛丽女王大学) Eindhoven University of Technology(埃因霍温理工大学) University of Cambridge(剑桥大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 PulseLM通过统一的问答框架连接原始PPG波形与自然语言,包含100万标准化PPG片段及250万问题-答案对,为研究语言基础生理推断和多模态模型基准提供标准化基础。

Comments PulseLM v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05447 2026-05-08 cs.CV 70%

EchoXFlow: A Beamspace Echocardiography Dataset for Cardiac Motion, Flow, and Function

EchoXFlow:一种用于心脏运动、血流和功能的超声成像数据集

Elias Stenhede, Joanna Sulkowska, Eivind Bjørkan Orstad, Henrik Schirmer, Arian Ranjbar

机构 * Medical Technology & E-Health, Akershus University Hospital, Norway(医疗技术与电子健康,阿克ershus大学医院,挪威) Department of Technology Systems, University of Oslo, Norway(技术系统系,奥斯陆大学,挪威) Department of Cardiology, Akershus University Hospital, Norway(心脏病学系,阿克ershus大学医院,挪威)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 EchoXFlow数据集通过保留原始超声采集几何结构,为学习心脏解剖、心肌运动和血流之间的跨模态关系提供了新的可能性,其包含37125条记录,支持物理基础的超声学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06478 2026-05-08 cs.RO 67%

GA3T: A Ground-Aerial Terrain Traversability Dataset for Heterogeneous Robot Teams in Unstructured Environments

GA3T:一种用于异构机器人团队在非结构化环境中的地面-空中地形可 traversability 数据集

Siwei Cai, Knut Peterson, Quan Tran, Christian Ricks, Dhanush Parthasarathy, Amir Kaidarov, Neil Deshpande, Sukaina Najm, David Han, Lifeng Zhou

机构 * Drexel University(德雷塞尔大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract)

AI总结 GA3T 数据集通过地面和空中平台的多模态数据融合,提升非结构化环境中的地形可 traversability 估计与协同场景理解能力。

Comments For DARS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13310 2026-05-08 cs.CV cs.AI 62%

Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension

视觉并行思考器:用于视觉理解的分而治之推理

Haoran Xu, Hongyu Wang, Jiaze Li, Shunpeng Chen, Zizhao Tong, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) University of Chinese Academy of Sciences(中国科学院大学) Independent Researcher(独立研究者)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出视觉并行思考器,通过并行推理框架提升视觉理解能力,结合Pa-Attention和LPRoPE实现高效多模态处理,验证了并行推理在视觉领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06201 2026-05-08 cs.AI 57%

Towards Annotation-Free Validation of MLLMs: A Vision-Language Logical Consistency Metric

迈向无标注验证的MLLMs:一种视觉-语言逻辑一致性度量

Ying Gu, Mei Chee Leong, Hui Li Tan, Shangbo Mao, Liyuan Li, Nancy Chen

机构 * Institute for Infocomm Research (I 2 R), Agency for Science, Technology and Research (A*STAR), Singapore(信息通信研究所(I2R),科技研究局(A*STAR),新加坡)

专题命中 多模态评测 :MLLM(abstract);分类 cs.AI

AI总结 本文提出一种无需标注的视觉-语言逻辑一致性度量,用于评估大语言模型在因果关系上的逻辑一致性,发现尽管准确率提升,但逻辑一致性仍显著滞后。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06197 2026-05-08 cs.CV cs.LG 57%

Bridging visual saliency and large language models for explainable deep learning in medical imaging

弥合视觉显著性与大语言模型以实现医学影像中可解释的深度学习

Paul Valery Nguezet, Elie Tagne Fute, Yusuf Brima, Benoit Martin Azanguezet, Marcellin Atemkeng

机构 * Department of Mathematics and Computer science(数学与计算机科学系) Institute of Cognitive Science(认知科学研究所) Rhodes University(罗德斯大学) National Institute for Theoretical and Computational Sciences (NITheCS)(理论与计算科学国家研究所)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种多模态可解释框架,通过结合CNN和大语言模型,生成脑肿瘤分类的可操作临床见解,提升深度学习在医学影像中的透明度和临床责任性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06121 2026-05-08 cs.CV 57%

Pest-Thinker: Learning to Think and Reason like Entomologists via Reinforcement Learning

Pest-Thinker: 通过强化学习学习像昆虫学家一样思考和推理

Xueheng Li, Yu Wang, Tao Hu, Ji Huang, Ke Cao, Qize Yang, Rui Li, Jie Zhang, Chengjun Xie

机构 * Institute of Intelligent Machines, Hefei Institute of Physical Science, Chinese Academy of Sciences(智能机器研究所、合肥物理科学研究所、中国科学院) University of Science and Technology of China(中国科学技术大学) Zhongke Hefei Institute of Technology Innovation Engineering(中科创新合肥科技研究院) Hefei University of Technology(合肥工业大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Pest-Thinker框架,通过强化学习提升多模态大语言模型对害虫形态的细粒度理解,构建了两个高精度害虫基准数据集,并通过监督微调和GRPO优化提升模型在农业害虫识别中的表现。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06132 2026-05-08 cs.AI 57%

Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents

Claw-Eval: 向可信的自主代理评估迈进

Bowen Ye, Rang Li, Qibin Yang, Yuanxin Liu, Linli Yao, Hanglong Lv, Zhihui Xie, Chenxin An, Lei Li, Lingpeng Kong, Qi Liu, Zhifang Sui, Tong Yang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) The University of Hong Kong(香港大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 Claw-Eval通过300人验证任务覆盖9类任务,采用轨迹感知评分体系,揭示自主代理在安全、鲁棒性及一致性上的多维特性,验证传统评估方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07830 2026-05-08 cs.AI 57%

Time Series Reasoning via Process-Verifiable Thinking Data Synthesis and Scheduling for Tailored LLM Reasoning

通过过程可验证的思维数据合成与调度实现时间序列推理

Jiahui Zhou, Dan Li, Boxin Li, Xiao Zhang, Erli Meng, Lin Li, Zhuomin Chen, Jian Lou, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) Xiaomi Corporation(小米公司) National University of Singapore(新加坡国立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出VeriTime框架,通过数据合成、调度和强化学习训练,提升LLM在时间序列推理任务中的性能,使小模型达到或超越大模型效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02379 2026-05-08 cs.LG cs.CV 57%

Teaching Metric Distance to Discrete Autoregressive Language Models

向离散自回归语言模型传授度量距离

Jiwan Chung, Saejin Kim, Yongrae Jo, Jaewoo Park, Dongjun Min, Youngjae Yu

机构 * Yonsei University(延世大学) LG AI Research(LG AI研究院) Seoul National University(首尔国立大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出DIST2Loss,通过奖励加权分布替代one-hot目标,提升离散自回归模型的数据效率和跨领域表现,应用于视觉 grounding、机器人操控、奖励建模和向量量化图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.06409 2026-05-08 cs.CV 57%

LiCamPose: Combining Multi-View LiDAR and RGB Cameras for Robust Single-timestamp 3D Human Pose Estimation

LiCamPose:结合多视角LiDAR和RGB相机实现鲁棒的单帧3D人体姿态估计

Zhiyu Pan, Zhicheng Zhong, Wenxuan Guo, Yifan Chen, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, BNRist, Tsinghua University, China(自动化系、北京人工智能研究院、清华大学、中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出LiCamPose,结合多视角RGB和稀疏点云数据,通过单帧实现鲁棒的3D人体姿态估计,并设计了合成数据生成器和无监督域适应策略,验证了方法在多种数据集上的泛化能力。

Comments Accepted by WACV2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06311 2026-05-08 cs.RO 50%

Toward Visually Realistic Simulation: A Benchmark for Evaluating Robot Manipulation in Simulation

迈向视觉逼真模拟:评估机器人操作的基准测试

Yixin Zhu, Zixiong Wang, Jian Yang, Jin Xie, Jingyi Yu, Jiayuan Gu, Beibei Wang

机构 * Nanjing University(南京大学) Nankai University(南开大学) ShanghaiTech University(上海科技大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文提出VISER基准,通过高保真3D资产和物理渲染材料,评估机器人操作的视觉逼真度,提升仿真与现实性能的关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19417 2026-05-08 cs.HC 50%

MER 2026: From Discriminative Emotion Recognition to Generative Emotion Understanding

MER 2026:从判别性情感识别到生成性情感理解

Zheng Lian, Xiaojiang Peng, Kele Xu, Ziyu Jia, Xinyi Che, Zebang Cheng, Fei Ma, Laizhong Cui, Yazhou Zhang, Xin Liu, Liang Yang, Jia Li, Fan Zhang, Liumeng Xue, Erik Cambria, Guoying Zhao, Bjorn W. Schuller, Jianhua Tao

专题命中 多模态评测 :multimodal(abstract)

AI总结 MER2026延续系列挑战趋势,包含四个赛道,聚焦双人交互、细粒度识别、偏好预测和生理信号情感识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05790 2026-05-08 cs.HC 50%

GazeMind: A Gaze-Guided LLM Agent for Personalized Cognitive Load Assessment

GazeMind:一种基于注视的LLM代理用于个性化认知负荷评估

Bin Wang, Yue Liu, Benjamin Newman, Ajoy S. Fernandes, Zhiyuan Wang, Robert Cavin, Michele A. Cox, Vijay Rajanna, Takumi Bolte, Melissa Hunfalvay, Ulas Bagci, Michael J. Proulx

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出GazeMind,一种基于注视的LLM代理框架,用于智能眼镜上的认知负荷评估。该框架通过编码注视数据为结构化表示,提供可解释的认知负荷预测,并通过新颖的任务引导推理方法实现跨场景泛化,同时利用用户特定特征和历史参考实现个性化适应。

详情

展开后加载摘要…

URL PDF HTML 收藏