arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-05 至 2026-06-05 共收录 88 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 10 篇

2605.17249 2026-06-05 cs.RO 75%

SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation

SEDualVLN:一种空间增强的双系统用于视觉语言导航

Jingzhi Huang, Junkai Huang, Wenxuan Song, Haoyang Yang, Hailong Huang, Haoang Li, Yi Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract)

AI总结 本文提出SEDualVLN,一种空间增强的双系统框架,用于解决视觉语言导航中的长距离导航和动态推理问题,通过两个系统协同工作实现高效导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05702 2026-06-05 cs.AI cs.CV 73%

Seeing Time: Benchmarking Chronological Reasoning and Shortcut Biases in Vision-Language Models

Seeing Time: 视觉-语言模型中的时间顺序推理与捷径偏差基准测试

Haoyu Zhou, Qing Qing, Caichong Li, Qixin Zhang, Yongcheng Jing, Ziqi Xu, Juncheng Hu, Xikun Zhang, Renqiang Luo

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computing Technologies, RMIT University(皇家墨尔本理工学院计算技术学院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一个新基准,通过三个专门数据集评估视觉-语言模型在图像内和跨图像的时间顺序推理能力,并揭示模型常利用颜色等表面线索而非真正时间特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05635 2026-06-05 cs.CV cs.MM 73%

ShotCrop$^3$: Cropping Human-Centric Images into Cinematic Triple-Shot Compositions

ShotCrop$^3$:将人物中心图像裁剪为电影级三镜头构图

Dehong Kong, Lina Lei, Lingtao Zheng, Chenyang Wu, Ailing Zhang, Xinran Qin, Teng Ma, Jiaqi Xu, Zhixin Wang, Zhikai Chen, Xuecheng Qi, Renjing Pei, Fan Li

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Sun Yat-sen University(中山大学)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.MM

AI总结 提出三镜头构图任务,通过三阶段训练流程(思维链微调、半监督微调和组相对策略优化)从单张人物中心图像生成远景、中景和特写三张裁剪图,并附带简短描述,以支持视觉叙事。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24470 2026-06-05 cs.CV 70%

TempRet: Temporal Enhancement and Two-Stage Reranking for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge

TempRet: 面向CVPR 2026 EPIC-KITCHENS-100多实例检索挑战的时间增强与两阶段重排序

Zixu Li, Yupeng Hu, Zhiwei Chen, Zhiheng Fu, Xiaowei Zhu, Weili Guan, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 针对第一人称视频检索中时间动态被忽视的问题,提出基于CLIP双编码器、视频端时间Transformer和两阶段重排序的TempRet方法,在EK-100 MIR基准上达到67.97%平均mAP和82.92%平均nDCG。

Comments Technical Report for CVPR 2026 EPIC-KITCHENS-100 Multi-Instance Retrieval Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05748 2026-06-05 cs.MM cs.AI cs.CL 67%

UNIVID: Unified Vision-Language Model for Video Moderation

UNIVID:用于视频审核的统一视觉语言模型

Kejuan Yang, Yizhuo Zhang, Mingyuan Du, Yue Zhang, Dixin Zheng, Kaili Zhao, Yang Xiao, Hanzhong Liang, Kenan Xiao

机构 * Bytedance(字节跳动)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 提出UNIVID统一视觉语言模型,通过生成可解释的策略感知字幕,实现端到端视频审核,减少违规泄露42.7%和过度审核率37.0%。

Comments 7 pages, 3 figures. Accepted to ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05758 2026-06-05 cs.CV cs.AI cs.LG 62%

DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models

DRIFT:一种用于视觉-语言模型中连续输出解码的残差流适配器

Zhuoming Liu, Jinhong Lin, Kwan Man Cheng, Lin Zhang, Shayok Bagchi, Yin Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) West Lafayette Jr./Sr. High School(韦斯特拉法叶高中)

专题命中 图文多模态 :MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出DRIFT框架,通过结合基础预测器和基于流匹配的生成式精化模块,将预训练视觉-语言模型适配到连续解码任务,在视觉定位和机器人控制等任务上优于回归和生成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25956 2026-06-05 cs.CV 57%

RAPTOR+: A Visually Grounded Vision-Language Framework to Improve Clinical Trust and Auditability in Automated Cancer Referral Processing

RAPTOR+: 一种基于视觉的视觉-语言框架,用于提高自动化癌症转诊处理中的临床信任度和可审计性

Sofiat Abioye, Ufaq Khan, Shazad Ashraf, Anusha Jose, Adam Byfield, Lukman Akanbi, Muhammad Bilal

机构 * Birmingham City University(伯明翰城市大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) University Hospitals Birmingham NHS Foundation Trust(伯明翰大学医院 NHS 基础信托) NHS England(英格兰国家卫生服务体系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出RAPTOR+多模态框架,通过微调视觉-语言模型实现端到端转诊理解,在结直肠癌转诊表单上显著提升提取准确性和证据定位能力。

Comments 12 pages 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16502 2026-06-05 cs.CV 57%

Topology-Aware Layer Pruning for Large Vision-Language Models

面向拓扑的层剪枝用于大型视觉-语言模型

Pengcheng Zheng, Chaoning Zhang, Ya Wen, Wang Liu, Qigan Sun, Jiarong Mo, Jiaquan Zhang, Jewon Lee, Tae-Ho Kim, Kuien Liu, Tianyu Li, Caiyan Qin, Yang Yang

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种面向拓扑的层剪枝框架,用于大型视觉-语言模型,通过利用拓扑持续同调量化层间拓扑一致性,实现自适应剪枝以保留关键表示转换。

Comments This manuscript has been withdrawn by the authors. It reproduced the methodology of Gardinazzi et al., arXiv:2410.11042, without citation, and utilized code and data from the associated repository (github.com/RitAreaSciencePark/ZigZagLLMs) without disclosure or violate the MIT License. A revised future version with full attribution may be prepared. For any feedback, please contact Pengcheng Zheng

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23497 2026-06-05 cs.CV 57%

VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation

VOLD:通过在线蒸馏将LLM推理能力转移到视觉语言模型

Walid Bousselham, Hilde Kuehne, Cordelia Schmid

机构 * Tuebingen AI Center(图宾根人工智能中心) University of Tuebingen(图宾根大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Inria, École Normale Supérieure, CNRS, PSL Research University(法国国家科学研究院、巴黎-萨克勒大学、École Normale Supérieure、PSL研究大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出VOLD框架,通过在线蒸馏将文本模型的推理能力转移到视觉语言模型,利用组相对策略优化与在线蒸馏结合,提升推理性能,并验证了冷启动对齐在在线训练中的重要性。

Comments www.walidbousselham.com/VOLD/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05497 2026-06-05 cs.LG 50%

LEVANTE-bench: Multi-Scale Comparison of VLMs to Children Using Cognitive Tasks (or, "Is Your VLM Smarter Than a 5th Grader?")

LEVANTE-bench: 使用认知任务对VLM与儿童进行多尺度比较(或者,“你的VLM比五年级学生聪明吗?”)

Alvin Wei Ming Tan, David Cardinal, Tania Lorido-Botran, Laura Bravo-Sanchez, Sunny Yu, Michael C. Frank

机构 * Stanford University(斯坦福大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出LEVANTE-bench基准,基于儿童认知任务数据,从多个尺度系统评估视觉语言模型与5-12岁儿童在六项任务上的对齐程度,发现模型与人类认知仅部分对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 7 篇

2606.05931 2026-06-05 cs.CL cs.AI cs.CV cs.IR cs.LG cs.MM eess.AS 90%

To Be Multimodal or Not to Be: Query-Adaptive Audio-Visual Person Retrieval via Active Modality Detection

多模态还是非多模态:通过主动模态检测的查询自适应音视频人物检索

Erfan Loweimi, Mengjie Qian, Kate Knill, Guanfeng Wu, Chi-Ho Chan, Abbas Haider, Muhammad Awan, Josef Kittler, Hui Wang, Mark Gales

机构 * University of Cambridge(剑桥大学) Queen's University Belfast(贝尔法斯特女王大学) University of Surrey(萨里大学) Cisco(思科) Southwest Jiaotong University(西南交通大学) Teesside University(泰赛德大学)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出一种查询自适应框架,通过跨模态分数一致性检测主动模态,在BBC Rewind语料库上达到94.2%的P@1,优于单模态和固定融合方法。

Comments INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05713 2026-06-05 cs.MM cs.SD eess.AS 88%

Beyond Generative Decoding: Discriminative Hidden-State Readout from a Native Omni-Modal LLM for Multimodal Sentiment Analysis

超越生成式解码:来自原生全模态大语言模型的判别性隐藏状态读出用于多模态情感分析

Bin Wen, Tien-Ping Tan

机构 * School of Computer Sciences, Universiti Sains Malaysia, Penang, Malaysia(计算机科学学院,马来西亚国际科学大学,槟城)

专题命中 音频语音多模态 :multimodal(title,abstract);omni-modal(title,abstract);分类 cs.MM、eess.AS

AI总结 针对多模态情感分析中生成式读出将连续回归绑定到离散自回归解码导致精度和效率损失的问题,提出基于原生全模态大语言模型Qwen2.5-Omni-7B的Thinker模块的判别性读出方法,通过轻量回归头直接映射最终层隐藏状态,在单消费级GPU上实现最先进性能。

Comments 18 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09061 2026-06-05 cs.SD eess.AS 79%

O_O-VC: Synthetic Data-Driven One-to-One Alignment for Any-to-Any Voice Conversion

O_O-VC: 基于合成数据驱动的任意到任意语音转换一一对一对齐

Huu Tuong Tu, Huan Vu, cuong tien nguyen, Dien Hy Ngo, Nguyen Thi Thu Trang

机构 * VNPT AI, VNPT Group(VNPT AI,VNPT集团) Hanoi University of Science and Technology(河内科学技术大学) Business AI Lab, National Economics University(国家经济大学商业人工智能实验室)

专题命中 音频语音多模态 :any-to-any(title,abstract);分类 eess.AS

AI总结 本文提出了一种基于合成数据驱动的任意到任意语音转换方法,通过利用高质量预训练多说话人文本到语音模型生成的合成语音数据,学习源语音到目标语音的直接映射,从而在保留语言内容的同时捕捉说话人特定特征,并在零样本场景中提升适应性和性能。

Comments EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19446 2026-06-05 eess.AS 79%

Leveraging Cascaded Binary Classification and Multimodal Fusion for Dementia Detection through Spontaneous Speech

利用级联二分类和多模态融合进行自发语音中的痴呆症检测

Yin-Long Liu, Yuanchao Li, Rui Feng, Liu He, Jia-Xin Chen, Yi-Ming Wang, Yu-Ang Chen, Yan-Han Peng, Jia-Hong Yuan, Zhen-Hua Ling

专题命中 音频语音多模态 :multimodal(title,abstract);分类 eess.AS

AI总结 本文提出了一种级联二分类和多模态融合的方法,用于通过自发语音进行早期痴呆症检测,解决了类别不平衡问题,并在Mini-Mental State Examination评分回归任务中实现了优于基线方法的性能。

Comments Accepted by Interspeech 2025

Journal ref Proc. Interspeech 2025, pp. 544-548, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05760 2026-06-05 cs.CV 74%

ExpSpeech-Net: Multimodal Fusion of Expression and Speech for Deepfake Detection

ExpSpeech-Net: 表情与语音的多模态融合用于深度伪造检测

Ruchika Sharma, Rudresh Dwivedi

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 音频语音多模态 :multimodal(title);分类 cs.CV

AI总结 提出轻量级ExpSpeech-Net模型,通过融合面部表情和语音模式,利用SqueezeNet和RNN骨干网络及智能特征选择,实现高效深度伪造检测,准确率达94.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05561 2026-06-05 cs.CL cs.AI 62%

InfoShield: Privacy-Preserving Speech Representations for Mental Health Screening via Information-Theoretic Optimization

InfoShield:通过信息论优化实现心理健康筛查的隐私保护语音表示

Xueyang Wu, Siyuan Liu, Kezhuo Yang, Guang Ling

机构 * Shenzhen NeurStar Inc., China(深圳NeurStar公司,中国) University of York, United Kingdom(约克大学,英国) Shanghai Jiao Tong University, China(上海交通大学,中国)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 提出InfoShield框架,通过最小化语音表示与敏感属性间的互信息,在保持抑郁分类性能的同时有效降低人口统计信息泄露风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06047 2026-06-05 cs.CL 57%

Automatic Labelling of Speech Translation Errors

语音翻译错误的自动标注

Dominik Macháček, Maike Züfle, Ondrej Klejch

机构 * Charles University(查尔斯大学) University of Edinburgh(爱丁堡大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL

AI总结 针对语音翻译缺乏置信度评估方法的问题,提出STEL标注协议,通过文本和多模态系统分析,发现直接语音处理对任务必要且与文本系统互补。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 15 篇

2606.06285 2026-06-05 cs.AI 83%

TRACE: A Temporal Conditional Estimation for Multimodal Time Series Foundation Models

TRACE: 面向多模态时间序列基础模型的时间条件估计

Ziwen Kan, Yishuo Chen, Kecheng Li, Andrew Wen, Xiaomeng Wang, Liwei Wang, Jihao Duan, Song Wang, Hongfang Liu, Tianlong Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出TRACE条件估计范式,通过利用可用辅助模态推断缺失目标模态,解决多模态时间序列中的时间错位和部分模态缺失问题,在医疗和情感分析基准上优于现有融合方法。

Comments 5 figures and 5 tables in the main paper, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05997 2026-06-05 cs.CV 83%

Multimodal Sexism Identification and Characterization using Large Language Models and Gradient Boosting

使用大语言模型和梯度提升的多模态性别歧视识别与表征

Kyriakos Chaviaras, Maria Lymperaiou, Athanasios Voulodimos

机构 * Artificial Intelligence and Learning Systems Laboratory(人工智能与学习系统实验室) School of Electrical and Computer Engineering(电气与计算机工程学院) National Technical University of Athens(雅典国家技术大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出基于特征工程和梯度提升回归模型的后融合管道,结合视觉、文本、人口统计、生物特征及LLM语义指标,用于识别和表征模因和短视频中的多模态性别歧视。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03890 2026-06-05 cs.CV 81%

4DPC$^2$hat: Towards Dynamic Point Cloud Understanding with Failure-Aware Bootstrapping

4DPC$^2$hat: 面向动态点云理解的失败感知自举学习

Xindan Zhang, Weilong Yan, Yufei Shi, Xuerui Qiu, Tao He, Ying Li, Ming Li, Hehe Fan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出首个针对动态点云理解的多模态大语言模型4DPC$^2$hat,通过构建大规模跨模态数据集4DPC$^2$hat-200K和引入Mamba增强的时间推理模块及失败感知自举学习策略,显著提升了动作理解与时间推理能力。

Comments Accept by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05917 2026-06-05 cs.CV cs.CL 76%

MemoryCard: Topic-Aware Multi-Modal Clue Compression for Long-Video Question Answering

MemoryCard: 面向长视频问答的主题感知多模态线索压缩

Qing Yang, Pengcheng Huang, Xinze Li, Zhenghao Liu, Yukun Yan, Yu Gu, Ge Yu, Gang Li, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Digital China Group(数字中国集团)

专题命中 视频多模态 :multi-modal(title);分类 cs.CV、cs.CL

AI总结 提出MemoryCard框架,通过将长视频分割为主题事件单元并生成事件级摘要和代表性视觉时刻,以记忆卡形式增强VLMs的长视频问答能力,在相同视觉令牌预算下准确率提升高达21.8%。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05774 2026-06-05 cs.CV cs.AI cs.CL 75%

Active Video Perception: Iterative Evidence Seeking for Agentic Long Video Understanding

主动视频感知:用于代理长视频理解的迭代证据寻求

Ziyang Wang, Honglu Zhou, Shijie Wang, Junnan Li, Caiming Xiong, Silvio Savarese, Mohit Bansal, Michael S. Ryoo, Juan Carlos Niebles

机构 * Salesforce AI Research(Salesforce AI研究院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出了一种主动视频感知框架AVP,通过迭代计划-观察-反思过程,主动决定视频内容的观察目标和时间,以提高长视频理解的准确性和效率。

Comments Website: https://activevideoperception.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05769 2026-06-05 cs.CV 70%

Imagine Before You Predict: Interleaved Latent Visual Reasoning for Video Event Prediction

在预测之前想象:用于视频事件预测的交错潜在视觉推理

Tianxiang Jiang, Linquan Wu, Sheng Xia, Songze Li, Ziang Yan, Haoyu Yang, Yu Qiao, Yi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) City University of Hong Kong(香港城市大学) Nanjing University(南京大学) Fudan University(复旦大学) Zhejiang University(浙江大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出Future-L1框架,通过交错潜在视觉推理在自回归解码中交替语言token和连续潜在视觉跨度,结合LA-DAPO强化学习优化,在视频事件预测任务上取得最先进结果。

Comments https://github.com/OpenGVLab/Future-L1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05677 2026-06-05 cs.CV cs.AI cs.CL 67%

LongSpace: Exploring Long-Horizon Spatial Memory from Perception to Recall in Video

LongSpace: 从感知到回忆的视频长程空间记忆探索

Shiqiang Lang, Jing Liu, Haoyang He, Peiwen Sun, Yuanteng Chen, Tao Liu, Lan Yang, Longteng Guo, Honggang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) The Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对长视频中空间记忆的挑战,提出LongSpace框架,通过分块建模、3D结构线索注入和层级感知记忆实现长程空间推理,并在LongSpace-Bench等基准上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06260 2026-06-05 cs.IR cs.AI cs.CL 62%

OneReason Technical Report

OneReason 技术报告

OneRec Team, Biao Yang, Boyang Ding, Chenglong Chu, Dunju Zang, Fei Pan, Han Li, Hao Jiang, Honghui Bao, Huanjie Wang, Jian Liang, Jiangxia Cao, Jiao Ou, Jiaxin Deng, Jinghao Zhang, Kun Gai, Lu Ren, Peiru Du, Pengfei Zheng, Rongzhou Zhang, Ruiming Tang, Shiyao Wang, Siyang Mao, Siyuan Lou, Teng Shi, Wei Yuan, Wenlong Xu, Xingchen Liu, Xingmei Wang, Xinqi Jin, Yan Sun, Yan Wang, Yifei Hu, Yingzhi He, Yufei Ye, Yuhao Wang, Yunhao Zhou, Yuqin Dai, Zhao Liu, Zhipeng Wei, Zhixin Ling, Ziming Li, Zixing Zhang, Ziyuan Liu, An Zhang, Changxin Lao, Chaoyi Ma, Chengru Song, Defu Lian, Fan Yang, Guowang Zhang, Hao Peng, Jiayao Shen, Jie Chen, Jun Xu, Junmin Chen, Kun Zhang, Kuo Cai, Mingxing Wen, Minmao Wang, Minxuan Lv, Qi Zhang, Qiang Luo, Sheng Yu, Shijie Li, Shijie Yi, Shuang Yang, Shugui Liu, Shuni Chen, Tinghai Zhang, Tingting Gao, Xiang Wang, Xiangyu Wu, Xiangyu Zhao, Xiao Lv, Xiaoyou Zhou, Xuming Wang, Yong Du, Zejian Zhang, Zhaojie Liu, Zhiyang Zhang, Zhuang Zhuang, Ziqi Wang, Ziyi Zhao

机构 * OneRec Team(OneRec团队)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 针对生成式推荐模型中推理能力难以激活的问题,提出 OneReason 方法,通过增强感知和认知能力实现有效推理。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05404 2026-06-05 cs.AI cs.CL cs.LG 62%

Harnessing Generalist Agents for Contextualized Time Series

利用通用智能体进行情境化时间序列分析

Zihao Li, Kaifeng Jin, Yuanchen Bei, Jiaru Zou, Avaneesh Kumar, Xuying Ning, Yanjun Zhao, Mengting Ai, Baoyu Jing, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出TimeClaw框架,通过集成可执行时间工具、经验驱动能力进化和情景多模态记忆,使通用大语言模型智能体具备情境化时间推理能力,在能源、金融等多领域基准上取得性能提升。

Comments Preprint. 38 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05736 2026-06-05 cs.CV 57%

VTI-CoT: Visual-Textual Interleaved Chain of Thought for Video Reasoning

VTI-CoT: 用于视频推理的视觉-文本交织思维链

Shufan Zhang, Ziyue Lin, Bairun Wang, Lei Jin, Xuanding Ding, Xinzhu Ma, Kunlin Yang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Hong Kong(香港大学) Beijing Shanwei Zhixing Technology Co., Ltd.(北京尚维智行科技有限公司) Tsinghua University(清华大学) Beihang University(北航)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出VTI-CoT框架,通过视觉-文本交织的思维链结合OCR压缩技术,提升视频推理准确性和训练效率。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05620 2026-06-05 cs.CL 57%

An ERP Study on Recursive Locative Processing in Mandarin-Speaking Children with Autism

自闭症儿童递归处所加工的ERP研究

Xiaoyi Wang, Chenxi Fu, Ziman Zhuang, Caimei Yang

机构 * Soochow University(苏州大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CL

AI总结 通过ERP实验,研究自闭症儿童处理递归处所结构时在预测、语义整合和句法重析三个阶段的时间动态差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05185 2026-06-05 cs.CY cs.CV cs.LG 57%

Drishti AI-Event Guardian: An Intelligent Real-Time Crowd Monitoring and Emergency Response System for Mass Gathering Events

Drishti AI-Event Guardian:面向大规模聚集事件的智能实时人群监控与应急响应系统

Ritabrata Roy Choudhury, Arkajyoti Karmakar, Rudra Pratap Mitra

机构 * School of Computer Engineering, Kalinga Institute of Industrial Technology(计算机工程学院,凯林加工业技术学院) School of Electronics Engineering, Kalinga Institute of Industrial Technology(电子工程学院,凯林加工业技术学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出Drishti AI-Event Guardian框架,结合YOLOv8、异常检测和梯度提升回归等多模态深度学习技术,实现实时人群密度估计、异常检测、预测建模、人脸识别、医疗紧急报告、聊天机器人和智能警卫重分配,在Kumbh Mela和RCB Victory Parade事件中验证了低延迟和高精度。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24481 2026-06-05 cs.CV 57%

OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

OmniEgo-R$^2$:面向CVPR 2026首届跨领域EgoCross挑战赛的路由推理框架

Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对跨领域自我中心视频推理中的时间边界模糊、语义粒度不匹配和决策不稳定问题,提出OmniEgo-R$^2$路由推理框架,在Source-Limited和Open-Source赛道均获第二名。

Comments Technical Report for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏