arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-04 至 2026-08-04 共收录 197 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 44 篇

2608.00084 2026-08-04 cs.CV physics.optics 新提交 57%

From Pixels to PCells: A Neurosymbolic Approach to Photonic Component Creation

从像素到光子单元(PCells):一种用于光子组件创建的神经符号方法

Aadarsh Agarwal, Kenaish Al Qubaisi, Dirk Englund

机构 * Massachusetts Institute of Technology(麻省理工学院) Research Laboratory of Electronics(电子学研究实验室) University of Chicago(芝加哥大学) The College(学院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出神经符号系统PixCell,用多模态智能体将视觉呈现的光子组件转为参数化程序,经验证器引导修正的模型在光子组件设计任务上IoU显著提升,建立了相关设计的受控框架。

Comments 16 pages, 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14896 2026-08-04 cs.SE cs.AI cs.MA 版本更新 57%

StructureClaw: Traceable LLM Agents and an Executable Benchmark for Structural Engineering Workflows

StructureClaw:用于结构工程工作流程的可追溯大语言模型智能体及可执行基准测试

Sizhong Qin, Yi Gu, Yao Jiang, Ao Cai, Changjian Zhou, Shaoxuan Shuai, Jiachang Wang, Tianhao Shen, Yueqiang Li, Xinhao Li, Li Zeng, Yueshi Chen, Dachen Gao, Genrong Xu, Wenjie Liao, Xinzheng Lu

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对结构工程请求评估中难以验证完整证据链的问题,提出StructureClaw及可执行基准测试StructureClaw-Bench,通过工件中心评估提高成功率,发现交互式和多模态评估的挑战,为评估改进结构工程智能体提供更严格基础。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05238 2026-08-04 cs.AI 版本更新 57%

Branch-JEPA: Finite-Support Predictive Distributions for JEPA World Models

MoP-JEPA:用于随机JEPA世界模型的硬分配预测器混合架构

Zhi Song, Ximing Xing, Zhenchao Tang, hanbo Huang, Jiehui Huang, Weilong Yan, Tianxu Lv, Minghao Yang, Zhongzheng Niu, Bing He, Lusheng Wang, Jianhua Yao

机构 * City University of Hong Kong, China(香港城市大学) Tencent, China(腾讯)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对传统JEPA在随机环境下的状态坍缩问题,提出硬分配预测器混合的MoP-JEPA,可收敛到转移分布量化器,在OGBench测试中规划性能远超基线方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08645 2026-08-04 cs.CL 版本更新 57%

Quick on the Uptake: Eliciting Implicit Intents from Human Demonstrations for Personalized Mobile-Use Agents

快速响应:从人类演示中提取隐含意图以构建个性化移动使用代理

Zheng Wu, Heyuan Huang, Yanjia Yang, Yuanyi Song, Xingyu Lou, Weiwen Liu, Weinan Zhang, Jun Wang, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) OPPO Research Institute(OPPO研究院)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出IFRAgent框架,通过分析显式和隐式意图流,提升移动代理对人类意图的对齐率和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21079 2026-08-04 cs.CL 版本更新 57%

SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials

SoM-1K:用于材料力学能力的千题基准数据集

Qixin Wan, Zilong Wang, Jingwen Zhou, Wanting Wang, Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil & Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) Department of Electrical and Computer Engineering, University of Miami(迈阿密大学电气与计算机工程系) School of Architecture, University of Miami(迈阿密大学建筑学院) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 该研究推出含1065道题的SoM-1K多模态基准,评估8种基础模型的材料力学能力,提出DoI提示策略,发现当前模型表现差,LLMs配DoI优于VLMs配图像,为工程AI提供基准并强调多模态推理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01482 2026-08-04 eess.IV 新提交 50%

Spinal-Multiple-Myeloma-SEG: A Dual-Energy CT Dataset Extended with Trabecular Bone Segmentation of Lumbar Vertebrae

Spinal-Multiple-Myeloma-SEG:扩展了腰椎骨小梁分割的双能CT数据集

Michal Nohel, Vlastimil Valek, Katerina Krejci, Roman Jakubicek, Marek Dostal, Jiri Chmelik

专题命中 多模态评测 :multimodal(abstract)

AI总结 该研究扩展了Spinal-Multiple-Myeloma-SEG双能CT数据集,添加腰椎骨小梁分割掩码,支持多发性骨髓瘤相关的骨分析与深度学习任务,已通过TCIA和Zenodo公开。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02257 2026-08-04 cs.RO 新提交 50%

Learning Panorama-Aware VLA for Mobile Manipulation with Whole-Body Teleoperation

面向全身遥操作移动操作的全景感知VLA学习

Donglin Yang, Haoran Chen, Xingyu Chen, Lixing Liu, Manyi Li, Changhe Tu, Ke Xu, Xiaojian Ma, Si Liu

机构 * Beihang University(北京航空航天大学) Shandong University(山东大学) Johns Hopkins University(约翰斯·霍普金斯大学) Delta Intelligence(delta智能公司)

专题命中 多模态评测 :multimodal(abstract)

AI总结 针对移动操作VLA策略的局部视野与全身演示数据收集难题,开发全身遥操作系统与PanoVLA全景感知VLA策略,基于5.5小时多模态数据集,在四项真实任务中平均阶段完成率91.3%、端到端成功率73.4%,性能优于局部视角基线。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01934 2026-08-04 cs.DC cs.CE cs.CR cs.PF 新提交 50%

Diagnosing High-Performance BFT Consensus via Mixture Modeling of Block Time Distributions

通过区块时间分布的混合建模诊断高性能拜占庭容错共识

Hongru He, Akihiro Fujihara

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出基于HotStuff的高性能BFT共识区块时间混合建模诊断方法,应用于Hyperliquid与Aptos主网,揭示二者部署异质性差异,为BFT共识分析提供实用诊断工具。

Comments 9 pages, 4 figures, published as a full paper at 2026 IEEE International Conference on Blockchain and Cryptocurrency (ICBC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00330 2026-08-04 cs.HC 新提交 50%

Read, Critique, or Sketch? Investigating Alternative Visualization Literacy Assessment Modalities

阅读、批判还是绘图?探究替代的可视化素养评估模态

Zach Cutler, Lily W. Ge, Matthew Kay, Lane Harrison, Andrew McNutt, Alexander Lex

专题命中 多模态评测 :multimodal(abstract)

AI总结 该研究开发了两种基于网络的可视化素养质性评估,与CALVI、Mini-VLAT对比后发现,其能捕捉独特技能且更好区分有经验个体,可作为现有评估的补充。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14883 2026-08-04 eess.SP cs.HC cs.LG 版本更新 50%

BCI-Based Assessment of Ocular Response Time Using Dynamic Time Warping Leveraging an RDWT-Driven Deep Neural Framework

基于BCI的眼动响应时间评估:利用动态时间规整的RDWT驱动深度神经框架

Shantanu Sarkar, Sai Shashank Gandavarapu, Jeff Feng, Saurabh Prasad, Reza Khanbabaie, Jose L. Contreras-Vidal

机构 * Dept. of ECE, IUCRC BRAIN, Cullen College of Engineering University of Houston, Houston, USA Dept. of Data Science, Cullen College of Engineering University of Houston, Houston, USA Dept. of Industrial Design, IUCRC BRAIN, Gerald D.Hines College of Arch. \& Design University of Houston, Houston, USA Neurotechnology \& BCI Cognixion Inc. Toronto, Ontario, Canada

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出一种整合EEG与AR基VOMS任务的框架,利用RDWT驱动的深度神经网络估计个体眼动响应时间,通过波let域滤波提升预测性能,并利用动态时间规整评估眼动行为差异。

Comments Accepted at IEEE SMC 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15395 2026-08-04 cs.RO 版本更新 50%

Foundation Models in Robotics: A Comprehensive Review of Methods, Models, Datasets, Challenges and Future Research Directions

机器人中的基础模型:方法、模型、数据集、挑战及未来研究方向的全面综述

Aggelos Psiris, Vasileios Argyriou, Evangelos K. Markakis, Panagiotis Sarigiannidis, Efstratios Gavves, Kostas Bekris, Arash Ajoudani, Georgios Th. Papadopoulos

机构 * Department of Informatics and Telematics, Harokopio University of Athens(信息与电信系,哈罗科比欧大学)

专题命中 多模态评测 :multi-modal(abstract)

AI总结 本文综述了机器人中基础模型的发展,涵盖方法、模型、数据集、挑战及未来方向,分析了不同阶段的研究演变及关键方面。

Journal ref Transactions on Machine Learning Research (TMLR), 07/2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 13 篇

2608.00962 2026-08-04 cs.AI 新提交 85%

PMMC: Prospective Multimodal Memory Compilation for Long-Term LVLM Agents

PMMC:面向长期LVLM智能体的前瞻性多模态记忆编译

Jingyu Sun, Yan Lin, Yuyang Xue, Yifan Wang, Zhengtao Yao, Rui Qian, Zefeng Xu, Jiachen Li, Xianyang Liu, Jiancheng Pan, Jingyuan Sun, Syed Murtuza Baker, Hongpeng Zhou

专题命中 多模态Agent :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 针对现有LVLM智能体记忆系统的缺陷,提出PMMC框架,将部分记忆推理移至整合阶段,构建结构化问题库,提升答案质量与证据召回率,降低查询成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08340 2026-08-04 cs.CV cs.AI 版本更新 84%

Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time

PokeGym: 一种以视觉驱动的长周期基准用于视觉-语言模型

Ruizhi Zhang, Ye Huang, Yuangang Pan, Chuanfu Shen, Zhilin Liu, Ting Xie, Haijun Lei, Lixin Duan

机构 * SIAS, UESTC(电子科技大学深圳高等研究院) CFAR/IHPC A*STAR(新加坡科技研究局高性能计算研究所)

专题命中 多模态Agent :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 PokeGym通过复杂的3D开放世界游戏评估视觉-语言模型在长周期任务中的表现,揭示了物理死锁恢复是当前模型的主要瓶颈,并发现高级模型存在元认知分歧。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01881 2026-08-04 cs.MM cs.AI 新提交 81%

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

聆听、调用与理解:面向大型音频语言模型的技能调用多模态智能体

Yuwen Wang, Tian-Hao Zhang, Minghao Cai, Yilin Ren, Ziyang Jiang, Xin Wang, Zhichao Wang, Pan Zhou, Kun Zhan, Xinyuan Qian

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI、cs.MM

AI总结 本研究针对工具交互型音频推理问题,开发了SpeechAgent-R智能体,构建了HIU-Corpus与HIU-Bench,经实验验证其在分布内外任务上均较基础模型有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01456 2026-08-04 cs.CV cs.CL 新提交 81%

Long-Horizon Embodied Decision-Making via Multimodal Memory Compression

基于多模态记忆压缩的长视野具身决策

Bingxuan Li, Rui Yang, Cheng Qian, Jiateng Liu, Jeonghwan Kim, Zhenhailong Wang, Manling Li, Tong Zhang, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 该研究提出DunphyBench基准用于评估长视野具身决策,发现当前智能体与人类表现存在差距,设计了MeMento记忆压缩器,使VLM驱动智能体准确率提升7.18%且内存使用降低85.38%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26775 2026-08-04 cs.LG cs.AI cs.CL cs.CV 80%

Learning to Select Visual In-Context Demonstrations

学习选择视觉上下文示例

Eugene Lee, Yu-Chi Lin, Jiajie Diao

机构 * University of Cincinnati(辛辛那提大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出LSD方法,通过强化学习构建最优演示集,提升多模态大语言模型在视觉回归任务中的表现,揭示了学习选择在视觉上下文学习中的必要性。

Comments 21 pages, 12 figure, accepted to Computer Vision and Pattern Recognition Conference (CVPR) 2026 Findings Track

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 9455-9465) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02283 2026-08-04 cs.HC cs.MM 新提交 79%

Embodied Empathy: A Multimodal AR and LLM-Powered System for Self-Attachment Psychotherapy with Self-Initiated Humour

具身共情:一种用于自我依恋心理治疗的多模态AR与大语言模型驱动系统,结合自发起幽默协议

Xinyan Ye, Gwyneth Phang, Anandha Gopalan, Abbas Edalat

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.MM

AI总结 该研究针对心理健康从业者供给不足的问题,开发结合SIHP与SAT的多模态AR及LLM系统,经8天16人研究验证其可行性,可改善情绪并转变用户对AI对话工具的期望。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28978 2026-08-04 cs.AI cs.CE 版本更新 79%

VFEAgent: A Multimodal Agent Framework for End-to-End Automated Finite Element Analysis

VFEAgent: 面向端到端自动化有限元分析的多模态智能体框架

Jiachen Zhang, Junyi Lao, Chenghao Liu, Siyuan Liu, Shixin Wu, Linsen Zhang, Boyu Wang, Songfang Huang

机构 * Peking University(北京大学) China Agricultural University(中国农业大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 提出VFEAgent多智能体系统,通过多模态视觉-语言流水线和验证优先的代码合成框架,实现从输入图像和问题描述到有限元建模与仿真的端到端自动化。

Comments 9 pages, 3 figures, 2 tables. Equal contribution: Jiachen Zhang and Junyi Lao. Corresponding author: Songfang Huang. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00066 2026-08-04 cs.CV 新提交 77%

PhysAgent: A Multi-Agent Framework for Reliable Remote Heart Rate Estimation

PhysAgent:用于可靠远程心率估计的多智能体框架

Yehui Yang, Bo Zhao, Junzhe Cao, Hui Ma, Yue Sun, Wenjin Wang, Zitong Yu

专题命中 多模态Agent :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 PhysAgent是一种推理时多智能体候选验证框架,以多个基础rPPG估计器输出为待验证生理假设,结合Qwen3-VL-4B多模态大语言模型推理与确定性融合,提升远程心率估计的稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06090 2026-08-04 cs.SE cs.AI cs.CV 版本更新 62%

SVRepair: Structured Visual Reasoning for Automated Program Repair

SVRepair: 结构化视觉推理用于自动化程序修复

Jincheng Wang, Liwei Luo, Xiaoxuan Tang, Jingxuan Xu, Sheng Zhou, Dajun Chen, Wei Jiang, Yong Li

机构 * Ant Group(蚂蚁集团) Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems(浙江可感知智能系统重点实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 SVRepair 通过结构化视觉表示框架,结合多模态信息提升程序修复的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02217 2026-08-04 cs.CV 新提交 57%

VC-Tooler: Learning Compositional and Adaptive Visual Tool Use

VC-Tooler:学习组合式与自适应视觉工具使用

Yizheng Wu, Jiashen Hua, Bing Deng, Jieping Ye

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 VC-Tooler是一种学习组合式与自适应视觉工具使用的模型,通过分层合成轨迹库与两阶段训练,在通用和具身基准上达到开源模型最优性能,且具良好迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00548 2026-08-04 cs.CV 新提交 57%

DrawAI: Agentic Benchmark and Workflow for Making Raster Images Editable

DrawAI:用于生成可编辑光栅图像的智能体基准与工作流

Pu Cao, Qingye Kong, Xuedan Yin, Xuekun Zhao, Rupeng Yan, Qing Song, Yao Zhang, Lu Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 DrawAI提出图像到可编辑重建任务,构建含DrawAI-Bench基准与DrawAI-Flow工作流的智能体方案,经实验验证DrawAI-Flow可提升可编辑结构,不同模型-harness配置的重建质量与成本差异显著。

Comments Project URL: https://drawai.renaissancemind.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00540 2026-08-04 cs.CV 新提交 57%

DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

DiffuseAgent-MI:用于忠实视觉推理的基于分布、集成工具的自进化智能体

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 DiffuseAgent-MI是基于分布、集成工具的自进化视觉推理智能体,通过KL最小能量模型与轨迹级验证器提升忠实性,在多数据集上准确率及相关指标表现优于现有模型。

Comments 11 pages, 9 figures, accepted by ICML 2026 manitrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00289 2026-08-04 cs.AI cs.HC cs.RO 新提交 57%

RF-HOI: Recognize Human-Object Interaction with Radio Frequency Signals

RF-HOI:利用射频信号识别人体-物体交互

Lihao Wang, Linlu Gao, Jiacan Yu, Yanyu Lin, Yifan Yin, Jianxin Wang, Tianmin Shu, Renjie Zhao

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 该研究针对视觉HOI识别的隐私与光照问题,提出仅用射频信号的RF-HOI框架,融合毫米波雷达与RFID,结合合成RF数据提升性能,效果优于基线且接近视觉模型。

Comments Accepted by ACM IMWUT

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态训练与对齐 41 篇

2608.00986 2026-08-04 cs.CV 新提交 89%

Understanding and Overcoming Cross-modal Fusion Bias in Multimodal Anomaly Detection From A Fisher Information Perspective

从费舍尔信息视角理解和克服多模态异常检测中的跨模态融合偏差

Kaifang Long, Lianbo Ma, Liming Liu, Guoyang Xie

机构 * Northeastern University(东北大学) CATL(宁德时代)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV

AI总结 该研究针对多模态异常检测中被忽视的跨模态融合偏差问题,提出即插即用框架UCFB,经实验验证在多种设置下均实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27902 2026-08-04 cs.CV 版本更新 87%

One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

一个补丁就够:面向基于多模态大语言模型(MLLM)的场景文本定位的强化优化视觉标记接地

Rui Tang, Wentao Yang, Peirong Zhang, Yongxin Shi, Shun Zhang, Huiguo He, Lianwen Jin

机构 * South China University of Technology(华南理工大学) HiThink Research(海思思考研究院)

专题命中 多模态训练与对齐 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 针对现有多补丁场景文本定位范式的冗余噪声与定位歧义问题,提出以视觉为中心的单补丁文本定位框架 SPaTS,通过强化学习优化的单补丁选择等技术实现性能提升,显著优于前沿相关模型。

Comments 15 pages, 11 figures. Accepted to ACM Multimedia 2026

Journal ref Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01473 2026-08-04 cs.CV cs.CL cs.LG 新提交 85%

Slot2Text: Object-Centric Visual Tokenization for Efficient and Spatially Traceable Surgical MLLMs

Slot2Text:面向高效且空间可追溯的手术多模态大语言模型的以对象为中心的视觉分词

Guiqiu Liao, Matjaz Jogan, Daniel A. Hashimoto

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 Slot2Text将视觉输入转为槽潜变量,推出双模式手术MLLM,在多基准上实现高效推理,Slot2Text-Fast大幅降本,Slot2Text-Reason支持可追溯空间推理。

Comments 17 pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00043 2026-08-04 eess.SP cs.AI 新提交 83%

Multimodal Wearable-Based Olfactory-Induced Emotion Recognition in Arousal-Valence Dimensions

基于多模态可穿戴设备的嗅觉诱导唤醒-效价维度情感识别

Chen-Yang Xu, Lan Zhang, Fei-Yi Fan, Bin Hu, Qing-Hao Meng

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对现有嗅觉情感研究的维度失衡与多模态数据不足问题,构建多模态嗅觉情感数据集,提出STF-HFNet模型,在两个数据集上取得最优情感识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01437 2026-08-04 cs.AI 新提交 83%

Beyond Routing Saturation: A Long-Horizon Class-Incremental Perspective on Expert Routing in Multimodal Continual Instruction Tuning

超越路由饱和:多模态持续指令调优中专家路由的长程类增量视角

Huiyu Yi, Yongqi Xu, Bogang Zhang, Dunwei Tu, Xu Zhiming, Zhen-Hao Xie, Baile Xu, Furao Shen

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究针对多模态持续指令调优中专家路由的任务识别问题,构建含34个任务的FLEX基准,提出MCIL框架,适配CIL方法后使LoRA匹配和MacroScore分别提升最高16.3个百分点、4.6个点

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15720 2026-08-04 cs.CV cs.LG 版本更新 83%

Semi-MedRef: Semi-Supervised Medical Referring Image Segmentation with Cross-Modal Alignment

Semi-MedRef:基于跨模态对齐的半监督医学指引用图像分割

Yuchen Li, Ziru Wei, Zhen Zhao, Yi Liu, Luping Zhou

机构 * The University of Sydney(悉尼大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Changzhou University(常州大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出Semi-MedRef框架,通过三个组件维持医学图像与位置语言的一致性,实验显示其在低标签条件下优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏