arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-01 至 2026-07-01 共收录 65 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2606.30698 2026-07-01 cs.RO 新提交 75%

Vision-Language Procedural Reasoning for Context-Aware Reward Modeling of Robotic Endovascular Guidewire Navigation

面向机器人血管内导丝导航的视觉-语言程序化推理与上下文感知奖励建模

Wentong Tian, Jiyuan Zhao, Tianliang Yao, Yuxiang Fan, Zhengyu Shi, Dong Liu, Peng Qi

机构 * Department of Control Science and Engineering, College of Electronic and Information Engineering, and Shanghai Institute of Intelligent Science and Technology, Tongji University(同济大学电子与信息工程学院控制科学与工程系,以及上海智能科学与技术研究院) Department of Electronic Engineering, Faculty of Engineering, The Chinese University of Hong Kong(香港中文大学工程学院电子工程系) Shanghai Operation Robot Co., Ltd.(上海微创医疗机器人(集团)股份有限公司)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract)

AI总结 提出视觉-语言程序化推理框架,利用多模态大模型实时理解视觉上下文,动态调整奖励权重,实现单策略适应复杂血管导航任务,提升可靠性与效率。

Comments This paper has been accepted by IEEE/RSJ IROS 2026. 7 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31249 2026-07-01 cs.CV 新提交 57%

Rethinking the Role of Feature Engineering and Learning Strategies in Few-Shot Hidden Emotion Recognition

重新思考特征工程与学习策略在少样本隐藏情感识别中的作用

Xiaochuan Guo, Jihao Gu, Haixu Liu, Yuxin Liu, Qi Wang, Yufei Wang, Fei Wang, Kun Li, Dan Guo

机构 * Hefei University of Technology(合肥工业大学) University College London(伦敦大学学院) The University of Sydney(悉尼大学) Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯光科技有限公司) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Beihang University(北京航空航天大学) The University of New South Wales(新南威尔士大学) United Arab Emirates University(阿拉伯联合酋长国大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出跨注意力机制与多实例学习框架,利用多源特征(2D/3D骨架、面部Blendshapes、DINOv2/v3、X-CLIP、Gemini)解决长视频中弱稀疏隐式情感识别,在IJCAI挑战赛Track 3中获第一名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22158 2026-07-01 cs.CV 新提交 57%

Improving Reasoning in Vision-Language Models via Perception Verified Self-Training

通过感知验证自训练提升视觉-语言模型的推理能力

Sourabh Sharma, Sonam Gupta, Sadbhawna

机构 * Malaviya National Institute of Technology Jaipur(马拉维亚国家理工学院斋浦尔分校) IBM Research(IBM研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出感知验证自训练框架,通过解耦感知与推理的CoT模板和无监督评估方法PerceptEval,结合两阶段课程学习,提升视觉-语言模型在视觉推理中的准确性并减少幻觉。

Comments Accepted at The European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2606.30646 2026-07-01 cs.SD cs.AI cs.CL eess.AS 新提交 82%

ASR-Agnostic Multimodal Spectrotemporal Modeling for Early Dementia Detection

ASR无关的多模态谱时建模用于早期痴呆检测

Chukwuemeka Ugwu, Oluwafemi Richard Oyeleke

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 提出一种不依赖语音识别的框架,直接从梅尔频谱图中提取谱时位移场作为数字生物标志物,结合CNN-ConvGRU声学嵌入和交叉注意力融合,在三种语言语料库上验证了多模态融合的语料依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31158 2026-07-01 cs.RO cs.AI 新提交 79%

LLM-Powered Interactive Robotic Action Synthesis from Multimodal Speech, Gestures, and Music

基于多模态语音、手势和音乐的LLM驱动交互式机器人动作合成

Snehasis Banerjee, Ranjan Dasgupta

机构 * TCS Research, Tata Consultancy Services(塔塔咨询服务公司TCS研究院)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出利用大语言模型融合语音、手势和音乐节拍等多模态输入,合成复杂机器人动作序列的框架,实现更自然的人机交互。

Comments IROS 2025 Workshop on Action and Interaction: Humans and Robots in Collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30675 2026-07-01 eess.AS cs.AI cs.LG q-bio.QM 新提交 62%

Listening Between the Lines: Joint Learning of ASR Embeddings and LLM-Augmented Linguistics for Dementia Detection

弦外之音:ASR嵌入与LLM增强语言学联合学习用于痴呆检测

Olivier Jiyoun Jung, Jonghyeon Park, Myungwoo Oh

机构 * Division of Communication and Media, Ewha Womans University, South Korea(韩国梨花女子大学传播与媒体学院) NAVER Cloud, South Korea(韩国NAVER Cloud)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 提出多模态框架,结合Whisper的声学表示与LLM提取的语言特征,通过门控融合网络实现痴呆检测,在ADReSS和ADReSSo上F1分别达89.47%和90.14%。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2606.31187 2026-07-01 cs.CV 新提交 79%

Learning to Deny: Action Denial in Multimodal Large Language Models

学习拒绝:多模态大语言模型中的动作否定

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。

Comments Accepted to ECCV 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27922 2026-07-01 cs.CV cs.AI 新提交 62%

Reflect-R1: Evidence-Driven Reflection for Self-Correction in Long Video Understanding

Reflect-R1:长视频理解中基于证据驱动的自纠正反思

Shuimu Chen, Yuteng Chen, Yuanshen Guan, Zebang Cheng, Zeyu Zhang, Shengqian Qin, Bin Xia, Jiaran Li, Wenming Yang, Fei Ma

机构 * Tsinghua University(清华大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) University of California(加利福尼亚大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出Reflect-R1框架,通过直觉、验证、仲裁三阶段管道动态检索客观视觉证据,并设计阶段解耦强化学习算法SD-GRPO解决策略耦合,在长视频理解基准上达到最优性能。

Comments 2026 ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31167 2026-07-01 cs.RO cs.AI 新提交 57%

MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents

MIRTH:面向视觉-语言-动作智能体的基于互信息推理的时间枢纽

Hao Sun, Yu Song, Shiyu Teng, Ziwei Niu, Yen-Wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出MIRTH框架,通过双尺度时间记忆枢纽、互信息优化的潜在推理令牌和并行动作解码,解决VLA模型的时间短视、推理鸿沟和推理低效问题,在LIBERO和真实机器人上达到SOTA并展现错误恢复能力。

Comments Accepted as main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2606.31517 2026-07-01 cs.IR cs.CV 新提交 83%

Unsupervised Data-Efficient Cross-Modal Retrieval with Global-Neighborhood Alignment Hashing

基于全局邻域对齐哈希的无监督数据高效跨模态检索

Runhao Li, Xiaoxu Ma, Zhenyu Weng, Yue Zhang, Guibo Luo, Huiping Zhuang, Zhiping Lin, Yap-Peng Tan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) College of Computer and Information Engineering, Henan Normal University(河南师范大学计算机与信息工程学院) VinUniversity(Vin大学)

专题命中 跨模态检索 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 提出全局邻域对齐哈希(GNAH),通过原型锚定全局对齐和对比随机邻域对齐,在少量图像-文本对下学习紧凑二进制码,实现数据高效的无监督跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30682 2026-07-01 cs.SD cs.AI eess.AS 新提交 62%

ALM2Vec: Learning Audio Embeddings for Universal Audio Retrieval with Large Audio-Language Models

ALM2Vec: 利用大型音频语言模型学习通用音频检索的音频嵌入

Fengjie Lu, Chenang Jiang, Jiarui Hai, Helin Wang, Aaron Yee

机构 * Zhejiang University(浙江大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI、eess.AS

AI总结 提出ALM2Vec框架,利用预训练大型音频语言模型学习统一嵌入空间,实现跨域、任务感知的音频检索,支持指令感知检索,在标准基准上表现优异。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 12 篇

2606.32012 2026-07-01 cs.LG cs.CV 新提交 85%

CoMet: Context and Multiplicity Decomposition for Multimodal Uncertainty Estimation

CoMet:多模态不确定性估计的上下文与多样性分解

Sanghyuk Chun, William Yang, Amaya Dharmasiri, Olga Russakovsky

机构 * Princeton University(普林斯顿大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出CoMet方法,将多模态大模型的不确定性分解为上下文项和多样性项,通过轻量级后验模块高效估计,无需自回归生成或重复采样,在多个基准上优于现有方法。

Comments 33 pages, 13.3MB

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31093 2026-07-01 cs.DC 新提交 82%

Omni-Flow: A Unified Workflow Orchestration and Distributed KV Cache Sharing Framework for Multimodal Inference

Omni-Flow:面向多模态推理的统一工作流编排与分布式KV缓存共享框架

Bin Xiao, Jingfu Dong, Changran Wang, Yitian Chen, Xiaoyu Zhao, Yuqi Peng, Jianping Lin, Yuchen Xie

专题命中 多模态生成 :multimodal(title,abstract);omni-modal(abstract)

AI总结 提出Omni-Flow框架,通过三层抽象(控制流、数据流、计算流)统一编排多模态推理工作流,实现异构单元协同、分布式KV缓存共享与高效传输,支持多种多模态场景。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13368 2026-07-01 cs.AI cs.CV 新提交 81%

IterCAD: An Iterative Multimodal Agent for Visually-Grounded CAD Generation and Editing

IterCAD:一种用于视觉引导的CAD生成与编辑的迭代多模态智能体

Tao Hu, Jiaxin Ai, Licheng Wen, Xueheng Li, Shu Zou, Siqi Li, Nianchen Deng, Xinyu Cai, Hongbin Zhou, Pinlong Cai, Daocheng Fu, Yu Yang, Hairong Zhang, Botian Shi, Xuemeng Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出IterCAD,一种闭环交互式CAD生成与编辑的多模态智能体框架,通过渐进式SFT和几何感知强化学习优化,在代码可执行性和几何精度上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31959 2026-07-01 cs.CV 新提交 79%

AnyBokeh: Physics-Guided Any-to-Any Bokeh Editing with Optical Fingerprint Transfer

AnyBokeh: 物理引导的任意到任意散景编辑与光学指纹迁移

Xinyu Hou, Xiaoming Li, Zongsheng Yue, Chen Change Loy

专题命中 多模态生成 :any-to-any(title,abstract);分类 cs.CV

AI总结 提出AnyBokeh框架,通过估计源模糊状态的光学指纹并迁移到目标焦点和光圈设置,实现任意到任意散景编辑,避免全聚焦重建和测试时校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31451 2026-07-01 cs.RO cs.AI 新提交 79%

UniTac: A Unified Multimodal Model for Cross-Sensor Tactile Understanding and Generation

UniTac: 一种用于跨传感器触觉理解与生成的统一多模态模型

Jiahang Tu, Fengyu Yang, Chenyang Ma, Xihang Yu, Ziyao Zeng, Shaokai Wu, Hanbin Zhao, Zhi Tao, Chao Zhang, Hui Qian, Alex Wong

机构 * Zhejiang University(浙江大学) Yale University(耶鲁大学) University of Oxford(牛津大学) MIT(麻省理工学院) Shanghai Jiaotong University(上海交通大学) UNIX AI

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 提出UniTac,首个统一多模态模型,通过双级表示编码传感器和物体属性,实现触觉理解与生成,在跨传感器任务上达到最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30811 2026-07-01 cs.CV cs.MM cs.SD eess.AS 新提交 75%

AVTok: 1D Unified Tokenization for Holistic Audio-Video Generation

AVTok: 用于整体音视频生成的1D统一分词化

Kien T. Pham, I Chieh Chen, Qifeng Chen, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态生成 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 提出AVTok统一分词器,采用双流Transformer架构和分层训练策略,将音视频对编码为紧凑的一维潜在表示,在音视频重建及下游生成任务中表现优异。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31732 2026-07-01 cs.CV 新提交 57%

UniCoder: Unified Visual-to-Code Generation via Symbolic Rewards and Reference-Guided Code Optimization

UniCoder: 通过符号奖励和参考引导代码优化的统一视觉到代码生成

Yaozhi Zheng, Yilei Jiang, Manyuan Zhang, Yuxuan Wan, Kaituo Feng, Tianshuo Peng, Bo Zhang, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出UniCoder框架,通过符号属性对齐实现密集元素级奖励,并利用参考引导代码优化策略克服探索停滞,在多个基准上达到与专有模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31326 2026-07-01 cs.CV 新提交 57%

Bridging Video Understanding and Generation in a Unified Framework

桥接视频理解与生成的统一框架

Yuqi Wang, Runyi Li, Ruoyu Feng, Renjie Chen, Wenfeng Lin, Mingyu Guo

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出Vega统一框架,通过共享词汇表联合建模文本与视觉表示,结合自回归预测关键帧语义令牌与扩散模型渲染密集视频帧,在视频生成和理解基准上均取得强性能。

Comments technical blog

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31278 2026-07-01 cs.CV 新提交 57%

Editing Everything Everywhere All at Once

一次性编辑所有内容

Fabio Quattrini, Carmine Zaccagnino, Enis Simsar, Marta Tintoré Gazulla, Rita Cucchiara, Alessio Tonioni, Silvia Cascianelli

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学) ETH Zurich(苏黎世联邦理工学院) Google(谷歌)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出MICE方法,通过修改联合注意力机制中的加性偏置来调控多实例编辑中的交互,实现无需训练的多实例图像编辑,在保持全局一致性的同时增强属性绑定。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31095 2026-07-01 cs.CV 新提交 57%

Do Not Break the Vessels: Structure-Preserving Mean Flow for Vascular Image Translation

不要破坏血管:用于血管图像翻译的结构保持平均流

Changjin Sun, Zhuo Hu, Kaini Wang, Baixuan Wu, Shuo Gao, Runan Zheng, Cheng Xue, Yudong Zhang, Guangquan Zhou

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学系) Zhejiang University(浙江大学) Suzhou Microclear Medical Instruments Co.(苏州微清医疗器械有限公司)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 提出结构保持平均流(SPMF)框架,通过拓扑不变传输和正交约束,在扩散模型中保持血管结构,并在NIRII-to-2PF和眼底数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30898 2026-07-01 cond-mat.mtrl-sci physics.chem-ph 新提交 50%

Bridging electrode preparation and electrocatalyst performance with physics-based causal AI

基于物理的因果AI桥接电极制备与电催化剂性能

Evelyna Wang, Linda Hung, Sam Witty, Michaela Burke Stevens, Kevin Tran

专题命中 多模态生成 :multi-modal(abstract)

AI总结 利用物理结构因果模型从多模态小数据集提取电催化剂性能的定量因果见解,分离活性位点与电极厚度的影响。

Comments 36 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31988 2026-07-01 astro-ph.CO astro-ph.IM 新提交 50%

Joint inference of weak lensing convergence map and cosmology with diffusion models

弱引力透镜收敛图与宇宙学的扩散模型联合推断

Benjamin Remy, Chihway Chang, Rebecca Willett

专题命中 多模态生成 :multimodal(abstract)

AI总结 提出基于扩散模型的隐式推断方法,联合推断宇宙学参数和收敛图,无需显式可微前向模型,在模拟数据上验证了后验校准和场统计的正确性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 15 篇

2606.31349 2026-07-01 eess.SP cs.AI 新提交 83%

PGUDA: Pressure-Guided Unsupervised Domain Adaptation with Cross-Modal Knowledge Distillation for sEMG-Based Gesture Recognition

PGUDA: 基于压力引导的无监督域适应与跨模态知识蒸馏用于sEMG手势识别

Yurui Liu, Xiao-Cong Zhong, Qisong Wang, Xuefu Wang, Dan Liu, Jinwei Sun

机构 * School of Instrumentation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学仪器科学与工程学院)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 提出PGUDA框架,利用压力信号的鲁棒性通过跨模态知识蒸馏引导sEMG特征对齐,在跨主体和跨会话任务中平均准确率58.08%,仅需5%标注数据即可达到全监督性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31367 2026-07-01 cs.MM cs.CV 新提交 81%

Evidence Triangulation for Multimodal Fact-Checking in the Wild

野外多模态事实核查的证据三角测量

Stefanos-Iordanis Papadopoulos, Zacharias Chrysidis, Christos Koutlis, Symeon Papadopoulos, Panagiotis C. Petrantonakis

机构 * Information Technologies Institute, Centre for Research & Technology, Hellas(希腊研究与技术中心信息技术研究所) Department of Electrical and Computer Engineering, Aristotle University of Thessaloniki(塞萨洛尼基亚里士多德大学电气与计算机工程系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 针对多模态事实核查中合成数据与真实数据差距大的问题,提出X-POSE基准和TRENT模型,通过三个并行交叉注意力流和关系融合机制进行证据三角测量,在真实数据上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31895 2026-07-01 cs.CV 新提交 79%

RESOLVE: A Multi-Resolution and Multi-Modal Dataset for Roadside Cooperative Perception

RESOLVE:用于路边协同感知的多分辨率多模态数据集

Shaozu Ding, Linan Song, Marco De Vincenzi, Dajiang Suo

机构 * The Polytechnic School, Arizona State University(亚利桑那州立大学理工学院) Department of Computer Science and Engineering, New York University(纽约大学计算机科学与工程系)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV

AI总结 提出RESOLVE数据集,包含多分辨率LiDAR和相机-LiDAR同步数据,用于评估路边3D检测与跟踪中的单模态与融合架构,揭示多模态融合如何补偿LiDAR点稀疏性。

Comments Accepted to ECCV 2026. Including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31219 2026-07-01 cs.CV 新提交 79%

CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization

CooperScene: 具有C-V2X通信特性的多模态协作自主基准

Bo Wu, Ruoshen Mo, Justin Yue, Yanyu Zhang, Janice Nguyen, Guoyuan Wu, Amit Roy-Chowdhury, Matthew J. Barth, Hang Qiu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 提出CooperScene数据集,通过真实C-V2X通信特性、多模态传感器和3GPP标准,建立多车协作感知基准,包含59K帧、344K标注对象。

Comments Accepted to ECCV 2026. 15 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31211 2026-07-01 cs.CV cs.HC 新提交 79%

AA: A Multi-view Multimodal Dataset for Screen-based Gaze Estimation

AA: 用于屏幕式视线估计的多视角多模态数据集

Chang Liu, Jiaqi Liu, Zhoutong Ye, Xinjie Shen, Chun Yu, Yuanchun Shi

机构 * Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 提出AA数据集,包含8个屏幕摄像头和2个侧视角摄像头的同步面部观测及精确视线目标,支持多视角多模态学习,解决单视角数据集的视角变化和遮挡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31069 2026-07-01 cs.CL cs.DL cs.HC cs.IR 新提交 79%

Building a Multimodal Dataset of Academic Paper for Keyword Extraction

构建用于关键词提取的学术论文多模态数据集

Jingyu Zhang, Xinyi Yan, Yi Xiang, Yingyi Zhang, Chengzhi Zhang

机构 * Department of Information Management, Nanjing University of Science and Technology(南京理工大学经济管理学院信息管理系) Department of Archives and E-government, Soochow University(苏州大学社会学院档案与电子政务系)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 针对关键词提取任务缺乏多模态数据的问题,构建包含文本、图像、音频和关键词的学术论文多模态数据集,实验表明融合多模态文本能有效提升关键词提取性能。

Journal ref ASIST, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31270 2026-07-01 cs.CV cs.AI cs.CL cs.CY cs.LG 新提交 75%

Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents

从失败中学习:计算机使用代理的推理时自我改进

Xueqiao Sun, Xiaohan Wang, Ludwig Schmidt, Serena Yeung-Levy, Yuhui Zhang

机构 * Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(abstract);MLLM(abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 提出失败驱动的自我改进循环,利用LLM诊断失败模式并生成代码补丁,在OSWorld基准上将OpenCUA-72B模型成功率从42.3%提升至48.9%,无需额外训练成本。

Comments Published in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏