arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-23 至 2026-06-23 共收录 198 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 15 篇

2606.21979 2026-06-23 cs.SD 新提交 50%

Toward Open-Set Speaker Attribute Prediction with Keyword-Appended LLM Embeddings

面向开放集说话人属性预测的关键词附加大语言模型嵌入

Byoungjun So, Jaejun Lee, Kyogu Lee

机构 * Department of Intelligence and Information, Seoul National University(首尔大学情报信息学系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔大学人工智能跨学科项目) Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究所)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 提出利用大语言模型嵌入进行开放集说话人属性预测,通过关键词附加策略和top-k负损失,在LibriTTS-P上超越闭集基准并泛化到未见同义词。

Comments This paper has been accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21933 2026-06-23 cs.SD 新提交 50%

ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech

ISCSLP 2026 CoT-TTS挑战赛:面向上下文感知文本转语音的思维链推理

Wei Xue, Junlan Feng, Shilei Zhang, Yue Wang, Ruosong Yang, Bei Liu, Liumeng Xue, Sitong Cheng, Jiahao Pan, Weizhen Bian, Boyi Kang, Bin Long

机构 * The Hong Kong University of Science and Technology(香港科技大学) China Mobile(中国移动) Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd., China Mobile(九天人工智能技术(北京)有限公司,中国移动) China Mobile (Hong Kong) Innovation Research Institute(中国移动(香港)创新研究院) Nanjing University(南京大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 针对现有可控TTS系统难以自动推断复杂对话场景中说话方式的问题,提出CoT-TTS挑战赛,要求系统从上下文推断说话方式并生成语音,包含文本和音频两个赛道,采用思维链推理和语音波形输出。

Comments 11 pages, ISCSLP 2026 challenge proposal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14343 2026-06-23 cs.LG 版本更新 50%

Localizing and Editing Knowledge in Large Audio-Language Models

定位与编辑大型音频-语言模型中的知识

Sung Kyun Chung, Jiaheng Dong, Qiuchi Hu, Gongping Huang, Hong Jia, Ting Dang

机构 * The University of Melbourne, Australia(墨尔本大学) University of Auckland, New Zealand(奥克兰大学) Wuhan University, China(武汉大学)

专题命中 音频语音多模态 :cross-modal(abstract)

AI总结 提出首个音频知识定位与编辑基准,通过语音感知因果追踪定位事实知识存储的层和模块,并应用编辑实现细粒度知识控制。

Comments Paper was accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频多模态 32 篇

2605.08945 2026-06-23 cs.CV 版本更新 83%

MLCR: Multi-Level Cue Refinement for Long-Term Multimodal Action Quality Assessment

PIDNet: 逐步隐式解耦网络用于多模态动作质量评估

Qiqi Li, Pengfei Wang, Hongyu Chen, Nenggan Zheng

机构 * Qiushi Academy for Advanced Studies (QAAS), Zhejiang University(浙江大学启斯特先进研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Software Technology, Zhejiang University(浙江大学软件学院) State Key Lab of Brain-Machine Intelligence(脑机智能国家重点实验室) Collaborative Innovation Center for Artificial Intelligence by MOE and Zhejiang Provincial Government (ZJU)(教育部-浙江省人工智能协同创新中心) Zhejiang Lab(浙江实验室)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出PIDNet,通过逐步整合多模态信息与全局质量语义,提升多模态动作质量评估的准确性。采用iMambaWave模块和三阶段融合网络,有效解耦模态特定信息并增强特征表示。

Comments 14 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04098 2026-06-23 cs.CV 版本更新 83%

A Physics-Informed, Behavior-Aware Digital Twin for Robust Multimodal Forecasting of Core Body Temperature in Precision Livestock Farming

一种物理知情、行为感知的数字孪生方法,用于精准畜牧业中核心体温的鲁棒多模态预测

Riasad Alvi, Mohaimenul Azam Khan Raiaan, Sadia Sultana Chowa, Arefin Ittesafun Abian, Reem E Mohamed, Md Rafiqul Islam, Yakub Sebastian, Sheikh Izzal Azid, Sami Azam

机构 * Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory(应用人工智能与智能系统实验室) Department of Computer Science and Engineering(计算机科学与工程系) Department of Data Science and Artificial Intelligence(数据科学与人工智能系) Department of Software Systems & Cybersecurity(软件系统与网络安全系) Energy and Resources Institute, Faculty of Science and Technology(能源与资源研究所,科学与技术学院) Faculty of Science and Technology(科学与技术学院) School of Engineering and Energy(工程与能源学院)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出物理知情数字孪生框架,结合不确定性感知的专家加权堆叠集成,利用ODE热调节模型、高斯过程、卡尔曼滤波和行为马尔可夫链,融合多模态数据实现奶牛核心体温的2小时提前预测,R²达0.783。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23581 2026-06-23 cs.DC cs.AI cs.CV 新提交 81%

Kamera: Unified Position-Invariant Multimodal KV Cache for Training-Free Reuse

Kamera: 统一的位置无关多模态KV缓存,用于免训练复用

Bole Ma, Jan Eitzinger, Harald Koestler, Gerhard Wellein

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Kamera,一种免训练的位置无关KV缓存复用方法,通过低秩条件补丁修复跨块绑定丢失,在MM-NIAH和文档QA上恢复完整精度,显著降低多模态代理的重计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22699 2026-06-23 cs.CV cs.MM 新提交 81%

Catching Lies Without Sending the Video: Privacy-Preserving Multimodal Deception Detection

无需发送视频即可识谎:隐私保护的多模态欺骗检测

Nikita Sharma, Pranav Sara, Karan Singla

机构 * University of California, San Diego(加州大学圣迭戈分校) Case Western Reserve University, Ohio(凯斯西储大学) WhissleAI, USA(WhissleAI(美国))

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 提出Whissle方法,通过设备端提取文本、情感、行为等紧凑摘要,在无需传输原始视频的情况下实现与云端模型相当的欺骗检测性能(AUC 0.741),并揭示先前75%准确率存在说话者泄露问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22043 2026-06-23 cs.AI cs.CV cs.LG 新提交 81%

When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR

视频语言模型何时停止观看?多模态RLVR中视觉捷径的形成与逆转受奖励强度控制

Zekun Xu

机构 * Zekun Xu(徐泽坤)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究多模态强化学习中视觉捷径的形成与逆转机制,发现惩罚强度可控制其出现和消除,且存在关键干预窗口。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02561 2026-06-23 cs.CV cs.AI 版本更新 81%

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

Oracle-RLAIF:一种利用排名反馈强化学习改进多模态视频模型微调框架的方法

Derek Shi, Ruben Glatt, Christine Klymko, Shubham Mohole, Hongjun Choi, Shashank Kushwaha, Sam Sakla, Felipe Leno da Silva

机构 * Stanford University(斯坦福大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Microsoft(微软公司)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Oracle-RLAIF框架,用通用排序器替代奖励模型,结合基于GRPO的排名损失函数GRPO_rank,实现更高效的多模态视频模型微调,在多个基准上优于现有方法。

Comments Proceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)

Journal ref Transactions on Machine Learning Research, Vol. 2026, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23593 2026-06-23 cs.RO cs.CV 新提交 79%

Real-Time Multimodal Activity-Aware Error Detection in Robot-Assisted Surgery

机器人辅助手术中的实时多模态活动感知错误检测

Seyed Hamid Reza Roodabeh, Zongyu Li, Homa Alemzadeh

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出统一框架,利用视频、运动学数据和文本提示等多模态输入,通过活动提示和活动感知视觉嵌入,在JIGSAWS和SAR-RARP50数据集上分别提升F1分数达5%和16.6%。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22870 2026-06-23 cs.CV cs.AI 新提交 79%

VideoLatent: Video-Language Learning via Latent Self-Forcing

VideoLatent: 通过潜在自强制进行视频-语言学习

Zi-Yuan Hu, Zicong Tang, Shijia Huang, Yanyang Li, Michael R. Lyu, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI(微图AI)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出VideoLatent,一种通过潜在自强制训练范式(包括潜在对齐和潜在多样性目标)进行视觉潜在推理的多模态大语言模型,仅依赖标准视频-问答三元组,在14个基准上优于现有模型,并大幅降低训练/推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22171 2026-06-23 cs.LG 新提交 78%

Beyond Time Series: Spatial Reasoning for Epidemic Forecasting via Multimodal Learning

超越时间序列:基于多模态学习的空间推理用于流行病预测

Diana Guadalupe Gomez, Chenwei Wu, Zhiyi Wang, Liyue Shen, Alexander Rodríguez

机构 * University of Michigan(密歇根大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 提出M-SPICE框架,通过注意力机制融合区域级时序数据与空间辅助信号,在COVID-19、流感和ILI预测任务上超越现有基线。

Comments To appear in the Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026), AI for Science Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17901 2026-06-23 cs.CV cs.MM cs.SD 版本更新 73%

Do Modern Video-LLMs Need to Listen? A Benchmark Audit and Scalable Remedy

现代视频大语言模型需要听觉吗?基准审计与可扩展补救措施

Geewook Kim, Minjoon Seo

机构 * NAVER Cloud AI(NAVER云AI) KAIST AI(韩国国立庆北大学AI)

专题命中 视频多模态 :cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM

AI总结 通过审计10个视频基准发现多数任务仅凭视觉即可解决,音频未被充分利用;提出在LLaVA-OneVision上附加语音/音频编码器,采用25倍令牌压缩,实验证明音频在需要语音理解或跨模态对齐的任务上带来显著提升。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23058 2026-06-23 cs.CV 新提交 70%

Three-Step Hierarchical Transformer for Multi-Pedestrian Trajectory Prediction

三步层次Transformer用于多人轨迹预测

Raphaël Delécluse, Hazem Wannous, Laurent Grisoni, Laurent Guimas

机构 * IMT Nord Europe, University of Lille, CNRS UMR 9189 - CRIStAL(IMT 北欧洲、里尔大学、法国国家科学研究中心 UMR 9189 - CRIStAL) University of Lille, CNRS UMR 9189 - CRIStAL(里尔大学、法国国家科学研究中心 UMR 9189 - CRIStAL) Explain

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出三步层次Transformer,通过分离时间编码、多模态融合和场景交互推理,在JRDB和城市数据集上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22550 2026-06-23 cs.CV cs.AI cs.CL cs.MM 新提交 70%

Training-Free Semantic Correction for Autoregressive Visual Models

自回归视觉模型的免训练语义校正

Junhao Chen, Chanyu Zhu, Zheqi Lv, Keting Yin, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Shandong University(山东大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出Gazer框架,通过多模态大语言模型反馈在自回归视觉模型采样循环中进行语义诊断与校正,无需额外训练即可提升语义对齐和组合准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20715 2026-06-23 cs.CV 新提交 70%

CDER-SME: A Cross-Device Event-RGB Micro-Expression Dataset under Multi-Level Stress Induction

CDER-SME:多级压力诱导下的跨设备事件-RGB微表情数据集

Jingting Li, Hui Sha, Su-Jing Wang

机构 * State Key Laboratory of Cognitive Science and Mental Health, Institute of Psychology, Chinese Academy of Sciences(中国科学院心理研究所认知科学与心理健康国家重点实验室) Department of Psychology, University of the Chinese Academy of Sciences(中国科学院大学心理学系) School of Computer Science, Jiangsu University of Science and Technology(江苏科技大学计算机科学学院)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出CDER-SME数据集,通过多级压力诱导框架收集跨设备事件-RGB数据,提供硬件无关的对齐流程,包含92名受试者和1963个专家标注样本,验证了跨模态融合提升微表情识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01602 2026-06-23 cs.LG cs.AI cs.IT math.IT 版本更新 70%

Estimating Mutual Information between Time Series and Temporal Event Sequences Across Diverse Analysis Tasks

估计时间序列与时间事件序列在不同分析任务中的互信息

Haoji Hu, Huaqing Mao, Yijun Lin, Xiaowei Jia, Jinwei Zhou, Minoh Jeong, Yao-Yi Chiang

机构 * University of Minnesota - Twin Cities(明尼苏达大学-双城分校) University of Pittsburgh(匹兹堡大学) Inha University(Inha大学)

专题命中 视频多模态 :multimodal(abstract,abstract_cn);分类 cs.AI

AI总结 提出一种非参数互信息估计器,直接度量连续时间序列与离散事件序列之间的依赖关系,无需数据转换或离散化,通过处理量化伪影和事件冗余实现鲁棒统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23061 2026-06-23 cs.CV cs.AI 新提交 62%

MotionHalluc: Diagnosing Kinematic Hallucinations in Fine-Grained Motion Reasoning

MotionHalluc: 诊断细粒度运动推理中的运动幻觉

Weile Guo, Shenghong He, Danying Mo, Chengdong Xu, Xuexun Liu, Chao Yu

机构 * Sun Yat-Sen University(中山大学) Shenzhen University(深圳大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出MotionHalluc基准,评估跨视频比较中的运动幻觉,并引入PPV方法通过注入运动测量值减少幻觉,平均性能提升10.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22409 2026-06-23 cs.CV cs.AI 新提交 62%

Gold Points Sniper: Self-guided Visual Reasoning in VLM for Fine-grained Action Understanding

金点狙击手:VLM中的自引导视觉推理用于细粒度动作理解

Haodi Liu, Xinhang Yang, Kunda Yan, Sen Cui, Zeyu Zhang, Changshui Zhang

机构 * Beijing National Research Center for Information Science and Technology (BNRist), Department of Automation, Tsinghua University(清华大学自动化系北京信息科学与技术国家研究中心) State Key Laboratory of General Artificial Intelligence, Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院通用人工智能国家重点实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出金点狙击手框架,通过金点提取器、选择性苏格拉底提问器和语义蕴含评估器三个模块,增强轻量级VLM的细粒度人类动作理解能力,在CAP基准上达到接近GPT-4o的性能且事实准确性更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20980 2026-06-23 cs.CV cs.AI cs.RO 新提交 62%

Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City

Robusto-2: 在利马与纽约市对自动驾驶中人类与VLM的基准测试

Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma, Victor Flores-Benites, David Ortega, Arturo Deza

机构 * Artificio Lima, Peru

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究通过视觉问答范式,比较人类驾驶员(来自利马和纽约)与视觉语言模型在利马和纽约的驾驶场景中的表现,发现人类与模型在回答事实、评级、反事实和推理四类问题时存在差异,但地理因素影响不显著。

Comments 11 pages main body. 42 pages total. Data publicly available online

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20867 2026-06-23 cs.CV cs.AI 新提交 62%

FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation

FOCA: 面向未来的条件化用于数据高效的视觉-语言-动作适应

Duc Minh Nguyen, Nghiem Tuong Diep, Binh Gia Nguyen, Trong-Bao Ho, Doanh Le, Tan Q. Nguyen, Thien-Loc Ha, Nhiem Tran, Bao Thach, Nhat X. Tran, Tuan A. Tran, Artur Habuda, Philip Lund Møller, Tran Nguyen Le, Daniel Sonntag, Matthias Niepert, Khoa D. Doan, Vu Duong, Hung Ngo, Minh N. Vu, Duy M. H. Nguyen, An Thai Le, Ngo Anh Vien

机构 * Center for AI Research, VinUniversity, Vietnam University of Utah, USA German Research Center for Artificial Intelligence (DFKI) Technical University of Denmark, Denmark University of Oldenburg, Germany University of Stuttgart, Germany Max Planck Research School for Intelligent Systems (IMPRS-IS), Germany

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出FOCA框架,结合未来交互嵌入预测与目标观测隐式对齐,实现数据高效的VLA少样本适应,在LIBERO、RoboCasa和真实机器人上取得新最优结果。

Comments Accepted at ICML 2026. Project page: https://focavla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23503 2026-06-23 cs.CV 新提交 57%

UniverSat: Resolution- and Modality-Agnostic Transformers for Earth Observation

UniverSat:面向地球观测的分辨率与模态无关的Transformer

Yohann Perron, Guillaume Astruc, Nicolas Gonthier, Clement Mallet, Loic Landrieu

机构 * LIGM, Ecole Nationale des Ponts et Chaussées, IP Paris, Univ Gustave Eiffel, CNRS(LIGM,巴黎国立桥梁与道路学院,IP巴黎,埃夫尔大学,CNRS) LASTIG, Univ Gustave Eiffel, IGN, ENSG(LASTIG,埃夫尔大学,国家地理信息学院,ENSG) IGN(国家地理信息学院) CNES(国家航天中心) EFEO(埃克塞特东方研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出UniverSat,一种基于通用补丁编码器的ViT骨干网络,能处理任意空间、光谱和时间分辨率的光学与非光学传感器数据,通过自监督学习在异构多模态语料上训练单一模型,在多个EO基准上取得强分类与分割结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22126 2026-06-23 cs.CL 新提交 57%

From Recognition to Understanding: Unlocking Cognitive Time Series Reasoning with LLMs

从识别到理解:利用LLM解锁认知时间序列推理

Xin Qiu, Junlong Tong, Yao Zhang, Yunpu Ma, Wei Zhang, Xiaoyu Shen

机构 * Institute of Digital Twin, Eastern Institute of Technology(东方理工数字孪生研究所) Zhejiang University(浙江大学) Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,慕尼黑大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对现有时间序列任务与LLM能力不匹配的问题,提出多模态基准TSCognition和统一框架TSAlign,通过认知推理任务和语义对齐提升LLM的时间序列推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21607 2026-06-23 cs.CV 新提交 57%

T-MOR: Learning Motion-Aware Skeleton Representations for Human Action Recognition

T-MOR:学习面向运动感知的骨架表示用于人体动作识别

Di Yang, Mahmoud Ali, Quan Kong, Gianpiero Francesca, Francois Bremond

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) Inria Center at Université Côte d'Azur(法国蔚蓝海岸大学Inria中心) Woven by Toyota Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出T-MOR框架,通过多模态对比学习对齐骨架运动与视觉、文本表示,仅用轻量骨架输入实现高效动作识别,并在大规模数据集PoseCap-1M上预训练,在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20857 2026-06-23 cs.AI cs.LG cs.RO 新提交 57%

SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models

SignVLA: 通过注意力LSTM和视觉-语言-动作模型实现实时手语引导的机器人操作

Ningwei Bai, Xinyu Tan, Harry Gardner, Zhengyang Zhong, Liuhaichen Yang, Luoyu Zhang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

机构 * University College London(伦敦大学学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出SignVLA框架,通过注意力LSTM网络将手语手势实时转换为语义指令,驱动VLA模型执行机器人操作任务,为听障用户提供无障碍交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27259 2026-06-23 cs.CV 版本更新 57%

Seeing the Scene Matters: Revealing Forgetting in Video Understanding Models with a Scene-Aware Long-Video Benchmark

看到场景才重要:通过场景感知的长视频基准揭示视频理解模型中的遗忘现象

Seng Nam Chen, Hao Chen, Chenglam Ho, Xinyu Mao, Jinping Wang, Yu Zhang, Chao Li

机构 * CUHK (SZ)(香港中文大学(深圳)) University of Cambridge(剑桥大学) UESTC(电子科技大学) CUHK(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SceneBench基准,揭示视频理解模型在长场景上下文中的遗忘问题,并提出Scene-RAG方法提升性能2.50%。

Comments Accepted to CVPR 2026 (Highlight)

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07298 2026-06-23 cs.CV 版本更新 57%

Mimic Human Cognition, Master Multi-Image Reasoning: A Meta-Action Framework for Enhanced Visual Understanding

模仿人类认知,掌握多图像推理:增强视觉理解的元动作框架

Jianghao Yin, Qingbin Li, Kun Sun, Cheng Ding, Jie Wang, Qin Chen, Jie Zhou, Nan Wang, Changqing Li, Pei Wu, Jian Xu, Zheming Yang, Liang He

机构 * East China Normal University(华东师范大学) ByteDance(字节跳动)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出受人类认知启发的元动作框架CINEMA,将多图像推理分解为五个结构化元动作,结合检索树采样和两阶段强化学习,在多个基准上超越GPT-4o。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23078 2026-06-23 eess.IV 新提交 50%

A Systematic Survey on Event Camera Representation Learning

事件相机表示学习系统综述

Hongwei Ren, Youxin Jiang, Tuopusen Huang, Xiangqian Wu

专题命中 视频多模态 :multimodal(abstract)

AI总结 综述从原始事件流转换为可学习表示的角度,分类梳理了基于密集和稀疏表示的方法,分析其在结构规则性、时间保真度、稀疏保持和架构兼容性上的权衡,并总结基准与未来方向。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22336 2026-06-23 stat.ML cs.LG 新提交 50%

Null-Calibrated Conformal Selection via Target-Membership Scores

通过目标隶属度分数进行零校准的共形选择

Seungjin Choi

机构 * CROID Research and aSSIST University(CROID研究院和aSSIST大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出基于目标隶属度分数的共形选择方法,通过零校准(NCCS)生成有限样本有效的零p值,在方差驱动和多模态目标上优于传统预测导向分数。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22729 2026-06-23 cs.RO 新提交 50%

Temporal Logic Guidance for Action-Only Diffusion Policies with World Models

基于时序逻辑的动作扩散策略与世界模型引导

Moritz Zoellner, Anastasios Manganaris, Rohan Paleja

机构 * German Academic Exchange Service (DAAD)(德国学术交流中心(DAAD))

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出一种利用世界模型实现时序逻辑鲁棒性可微评估的引导方法,在不重新训练的情况下改善动作扩散策略的约束满足,在Robomimic任务中将违规率从80%降至4%。

Comments Accepted at the ICRA 2026 Workshop on Bridging the Gap between Robot Learning and Human-Robot Interaction. 3 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏