CAN-STRESS: A Real-World Multimodal Dataset for Understanding Cannabis Use, Stress, and Physiological Responses
CAN-STRESS:一种用于理解大麻使用、压力和生理反应的现实世界多模态数据集
专题命中 多模态评测 :multimodal(title)
AI总结 CAN-STRESS数据集通过多模态数据研究大麻使用与压力及生理反应的关系,为相关研究提供可靠资源。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
CAN-STRESS:一种用于理解大麻使用、压力和生理反应的现实世界多模态数据集
专题命中 多模态评测 :multimodal(title)
AI总结 CAN-STRESS数据集通过多模态数据研究大麻使用与压力及生理反应的关系,为相关研究提供可靠资源。
SIQA:迈向可靠的科学图像质量评估
机构 * TongJi University(同济大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV
AI总结 SIQA提出了一种多维框架,通过SIQA-U和SIQA-S评估科学图像的科学正确性和感知清晰度,揭示模型在评分一致性与科学理解上的差异。
Bee:一个高质量语料库和全栈工具包,解锁高级完全开放的多模态大语言模型
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan Team(腾讯文英团队)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 Bee通过高质量数据集和全栈工具包,提升完全开放多模态大语言模型的性能,达到与半开放模型相当甚至超越的水平。
Comments homepage: https://open-bee.github.io/
ObjChangeVR: 从VR环境中连续眼动视角推断物体状态变化
机构 * Kennesaw State University(肯纳邦大学) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 ObjChangeVR通过结合视角感知和时间基检索,有效识别VR环境中物体状态变化,提升多模态大语言模型在复杂场景下的表现。
Comments European Chapter of the Association for Computational Linguistics (EACL) 2026 Main
ConflictBench: 通过交互式和视觉 grounded 环境评估人类-人工智能冲突
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; SERES
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CL
AI总结 ConflictBench通过交互式和视觉 grounded 环境评估人类-人工智能冲突,揭示智能体在不同风险情境下的行为差异及对齐失败问题。
Comments 29 pages, 20 figures, 9 tables
Hospitality-VQA: 为视觉-语言模型的决策导向信息评估
机构 * Yonsei University(延世大学) ; Yanolja NEXT
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本研究提出Hospitality-VQA,通过构建专门针对旅游业的VQA数据集,评估视觉-语言模型在决策导向场景中的信息评估能力,并发现需通过领域微调提升其决策意识。
Comments Accepted at EACL 2026 SRW. 16 pages
教育中AI的滥用是测量问题:迈向学习可见性框架
机构 * Trinity University(特里尼蒂大学) ; St. Mary's University(圣玛丽大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文提出学习可见性框架,旨在通过强调过程可见性而非对抗性检测,解决教育中AI滥用的测量问题,以实现教育价值观与AI使用的对齐。
Comments 14 pages, 5 figures, Submitted and Accepted to AIR-RES2026
OrdinalBench: 一种用于诊断视觉-语言模型在序数理解通用性限制的基准数据集
机构 * Division of Frontier Informatics, Kyoto Sangyo University, Kyoto, Japan(前沿信息学系,京都精华大学,京都,日本)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 OrdinalBench通过评估视觉-语言模型在序数理解上的表现,揭示其在大序数和复杂路径条件下的泛化能力不足问题。
Comments Accepted as a Short Paper at VISAPP 2026
MedQ-Deg:一个多维基准,用于评估医疗图像质量退化下的多模态大语言模型
机构 * Fudan University(复旦大学) ; Shanghai AI Lab(上海人工智能实验室) ; Shanghai Jiaotong University(上海交通大学) ; Imperial College London(伦敦帝国理工学院)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 MedQ-Deg是一个多维基准,用于评估医疗图像质量退化下多模态大语言模型的性能,揭示模型在不同退化类型下的表现差异及置信度校准问题。
Comments 29 pages, 11 figures
自主LLM代理的记忆:机制、评估与新兴前沿
机构 * Hong Kong Research Institute of Technology(香港理工大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文探讨了自主LLM代理中记忆的机制、评估及未来发展方向,分析了五种核心机制及评估挑战,强调记忆对代理适应性和应用的重要性。
Q-BAR: 通过量子增强的流形学习进行博主异常识别
专题命中 多模态评测 :multimodal(abstract);分类 cs.MM
AI总结 Q-BAR通过量子增强的流形学习方法,有效检测低数据量下的博主语义异常,提升个性化媒体取证的鲁棒性。
M3CAD:迈向通用协作自动驾驶基准
机构 * University of North Texas(北卡罗来纳州立大学) ; Toyota InfoTech Labs(丰田信息技术实验室)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 M3CAD是一个全面的协作自动驾驶基准,提供多模态数据支持多种自动驾驶任务,并提出多级融合方法以平衡通信效率与感知精度。
Comments Accepted to ICRA 2026
基于大语言模型的高血糖预测及从可穿戴设备和饮食中发现行为治疗路径
机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学) ; College of Health Solutions, Arizona State University(健康解决方案学院,亚利桑那州立大学)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本研究提出GlucoLens系统,利用大语言模型和多模态数据预测餐后血糖及高血糖,提供可解释的治疗路径建议。
Comments 16 pages, 10 figures
使EEG能看见:用于脑-视觉匹配的结构表示
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出EEG-可见层选择策略和分层互补融合框架,通过将EEG信号与中间视觉层对齐,解决跨模态信息不匹配问题,提升零样本视觉解码性能。
构建未来的伦理AI框架:从哲学到实践
机构 * Graduate School of Global Studies(全球研究研究生院) ; Tokyo University of Foreign Studies(东京外国语大学) ; AI Product Development Division(人工智能产品开发部门) ; Money Forward, Inc.(Money Forward公司)
专题命中 多模态评测 :multimodal(abstract);分类 cs.AI
AI总结 本文提出了一种伦理设计控制架构,通过三重闸门机制整合后果论、义务论和美德伦理,为AI生命周期提供可执行的治理方案。
Journal ref AI Ethics 6, 150 (2026)
Video2Layout: 重建用于空间推理的度量基础认知图
机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) ; Tsinghua University(清华大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Institute of Microelectronics of the Chinese Academy of Sciences(中国科学院微电子研究所)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 Video2Layout通过重建度量基础的空间布局,提升多模态大语言模型在空间推理中的性能,其方法结合监督微调与强化微调,实现更精确的空间认知图构建。
遮挡中的计数:开放世界无遮挡计数框架
机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka, Bangladesh(机器人与机电工程系,达卡大学,孟加拉国)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV
AI总结 CountOCC提出了一种无遮挡计数框架,通过分层多模态指导重建遮挡物体特征,实现遮挡情况下更准确的计数
模型的视觉感知是否与人类视觉一致?探测LVLM表示与EEG信号之间的对应关系
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文通过EEG信号分析,揭示了LVLM的视觉表示与人类大脑的对应关系,发现中间层与EEG活动对齐,多模态架构提升大脑对齐性,且视觉表现强的模型EEG相似性更高。
FreeTacMan: 无需机器人的人工智能视觉-触觉数据采集系统用于接触密集的 manipulation
机构 * Shanghai Innovation Institute(上海创新研究院) ; The University of Hong Kong(香港大学) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Shanghai University(上海大学)
专题命中 多模态评测 :multimodal(abstract)
AI总结 FreeTacMan 提出了一种无需机器人的视觉-触觉数据采集系统,通过可穿戴抓取器和高精度光学跟踪系统,实现了高效的数据收集和多模态数据集的构建,推动了机器人 manipulation 的研究。
谁该负责?数据、模型、用户还是法规?为可持续未来全面调查负责任的生成式人工智能
专题命中 多模态评测 :multimodal(abstract)
AI总结 本文全面调查了生成式人工智能的负责任发展,提出评估标准、生命周期指标及领域分析,旨在推动安全和可持续的AI部署。
Comments under review
PolyJailbreak: 对黑盒多模态大语言模型的跨模态劫持攻击
专题命中 多模态Agent :multimodal(title,abstract);cross-modal(title,abstract)
AI总结 PolyJailbreak通过多模态安全性不对称现象,提出结构化原子策略原语库,实现对黑盒多模态大语言模型的高效劫持攻击。
SiMO: 单模态可操作的多模态协作感知
机构 * Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学智能自主系统上海研究院) ; School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) ; School of Mechatronic Engineering and Automation, Shanghai University(上海大学机械电子工程与自动化学院)
专题命中 多模态Agent :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV
AI总结 SiMO通过单模态可操作的多模态协作感知方法,解决多模态特征融合中的语义不匹配问题,提升协作感知性能。
Comments Accepted to ICLR 2026. This arXiv version includes an additional appendix (Appendix 15) containing further philosophical discussion not included in the official ICLR peer-reviewed version
M$^3$-ACE: 通过多智能体上下文工程校正多模态数学推理中的视觉感知
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
AI总结 M3-ACE 通过多智能体上下文工程校正多模态数学推理中的视觉感知问题,提升推理性能。
分层多模态规划用于固定高度稀疏目标搜索与采样
专题命中 多模态Agent :multi-modal(title,abstract)
AI总结 HIMoS通过分层多模态规划提高稀疏目标搜索与采样任务的效率,结合全局与局部规划器优化路径,平衡多种传感任务。
Comments 8 pages, 9 figures, conference
Seed2Scale: 一种通过小到大模型协同和多模态评估的自我进化数据引擎用于具身AI
机构 * ZTE Corporation(中兴通讯公司)
专题命中 多模态Agent :multimodal(title)
AI总结 Seed2Scale通过小到大模型协同和多模态评估,实现具身AI的自我进化数据引擎,显著提升性能并提供可扩展的开发路径
3DMedAgent:面向3D医学分析的统一感知-理解框架
机构 * National University of Singapore(新加坡国立大学) ; Microsoft Research(微软研究院) ; TUD Dresden University of Technology(德累斯顿技术大学) ; University of Oxford(牛津大学)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 3DMedAgent通过统一框架实现2D MLLMs在3D医学分析中的高效处理,无需3D特定微调,提升3D医学图像的感知与理解能力。
Comments 19 pages, 7 figures
CGL: 通过强化微调推进连续GUI学习
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; University College Dublin(都柏林大学) ; Peking University(北京大学)
专题命中 多模态Agent :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 CGL通过强化微调与监督微调的协同优化,解决GUI连续学习中遗忘旧任务的问题,提出AndroidControl-CL基准验证方法有效性。
InsightX Agent: 一种基于LMM的智能框架,集成工具用于可靠X射线无损检测分析
机构 * School of Physics and Astronomy, The University of Edinburgh(物理学与天文学学院,爱丁堡大学) ; Glasgow College, University of Electronic Science and Technology of China(电子科技大学成都学院) ; School of Mechanical and Electrical Engineering, University of Electronic Science and Technology of China(机械与电子工程学院,电子科技大学) ; Department of Systems Engineering, City University of Hong Kong(系统工程系,香港城市大学)
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 InsightX Agent基于LMM构建智能框架,集成工具提升X射线检测的可靠性与可解释性,实现主动推理与高质量分析。
$π$-StepNFT: 更宽的空间需要更细的步骤在线RL用于基于流的VLAs
专题命中 多模态Agent :multimodal(abstract);分类 cs.CV
AI总结 $π$-StepNFT通过分步负向感知微调方法,在在线强化学习中提升基于流的VLAs的性能和泛化能力。
SAMoE-VLA:一种面向自动驾驶的场景自适应混合专家视觉-语言-动作模型
机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) ; School of Instrument Science and Engineering, Southeast University(仪器科学与工程学院,东南大学) ; Zhili College, Tsinghua University(紫荆学院,清华大学) ; School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(人工智能与自动化学院,华中科技大学) ; Department of Automation, University of Science and Technology of China(自动化学院,中国科学技术大学) ; Department of Automation, University of Science and Technology Beijing(自动化学院,北京科技大学)
专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV
AI总结 SAMoE-VLA通过场景自适应混合专家机制提升自动驾驶中的视觉-语言-动作推理性能。