arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1566 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1566 篇

2607.06186 2026-07-14 cs.RO 版本更新 50%

Calf-Integrated Arms for Bimanual Quadruped Loco-Manipulation

用于双足四足运动操纵的小腿集成手臂

Yan Pan, Yuanchuan Ren, Chipui Chan, Jingcheng Sun, Chengxu Zhou

机构 * University College London(伦敦大学学院)

专题命中 其他VLM :vision-language model(abstract)

AI总结 研究双足四足运动操纵设计权衡问题,核心方法是将特定操纵器集成到前小腿,实现双手地面操纵且四足着地、基座可行走,借助视觉语言模型排序技能,模拟中完成三项双手任务。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06015 2026-07-08 cs.SD 新提交 50%

Music I Care About: Automated Multimodal Benchmarking of LLM Music Perception Skills on (Almost) Any Music

我关心的音乐:对(几乎)任何音乐的大语言模型音乐感知技能进行自动化多模态基准测试

Tomáš Sourada, Katia Vendrame, Jan Hajič

机构 * Charles University(查尔斯大学) Brno University of Technology(布拉格技术大学)

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 针对当前音乐基准测试的局限,引入MusICA-MetaBench框架,利用结构化符号表示和预定义模板生成按需基准测试,通过ChoraleBricks数据集展示并确定规模,经与基线比较证明能测音乐感知,推动了大语言模型音乐感知跨模态评估。

Comments 9 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04630 2026-07-07 cs.SE 版本更新 50%

Foundation Models for Software Engineering of Cyber-Physical Systems: the Road Ahead

网络物理系统软件工程的基础模型:未来之路

Chengjie Lu, Pablo Valle, Jiahui Wu, Erblin Isaku, Hassan Sartaj, Aitor Arrieta, Shaukat Ali

专题命中 其他VLM :vision-language model(abstract)

AI总结 探讨基础模型在网络物理系统软件工程中的应用,指出除语言模型外其他模型潜力大。通过文献等得出前瞻性研究路线图,突出挑战与机会,还讨论了应用模型的常见挑战,为研究和实践提供指导。

Comments 3 figures, 20 tables, 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26654 2026-06-26 cs.CL cs.HC cs.IR 新提交 50%

SocialPersona: Benchmarking Personalized Profiling and Response with Multimodal Social-Media Context

SocialPersona: 基于多模态社交媒体上下文的个性化画像与回复基准测试

Qinkai Zhang, Yanyan Zhao, Xin Lu, Yulin Hu, Pengtao Han, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 提出SocialPersona基准,评估多模态大语言模型从社交媒体时间线推断用户偏好并用于对话的能力,实验表明模型在细粒度与近期偏好上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16053 2026-06-16 cs.SI cs.CY 新提交 50%

Modeling Engagement with Brand and Organizational TikTok Videos Using Machine-Assisted Theory-Ensemble Annotation

使用机器辅助理论集成标注建模品牌和组织TikTok视频的参与度

Sander Paekivi, Andres Karjus

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 利用多模态大语言模型标注77个理论驱动的结构变量,分析约1万个TikTok视频,以预测参与度并探索短视频文化差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10253 2026-06-10 physics.optics physics.app-ph 新提交 50%

Multi-channel Optical Vision Model

多通道光学视觉模型

Ali Momeni, Guillaume Noetinger, Tim Tuuva, Romain Fleury

专题命中 其他VLM :vision-language model(abstract)

AI总结 本文利用光学神经网络中的空间复用,将通道作为可训练表示坐标,通过在线物理前向/代理反向训练,在图像分类和回归任务中实现多通道功能,并构建了混合光电视觉语言模型。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09486 2026-06-09 cs.MM 新提交 50%

LangRetrieval: Language-Guided Self-Evolving Satellite-to-Radar Retrieval via CSI-Driven Reward

LangRetrieval: 基于CSI驱动奖励的语言引导自进化卫星到雷达检索

Chunlei Shi, Junming Hou, Yi-Lin Wei, Jiong Wang, Yecheng Zhang, Yichao Dong, Wenqi Ren, Dan Niu

专题命中 其他VLM :vision-language model(abstract)

AI总结 提出LangRetrieval框架,通过语言引导的条件流匹配和自进化语义优化,利用多阈值CSI奖励提升卫星到雷达降水检索精度。

Comments 17 pages, 9 figures. Submitted to IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04610 2026-06-04 cs.DB 50%

Selectivity Estimation for Semantic Filters on Image Data

图像数据语义过滤器的选择性估计

Matthias Urban, Vu Huy Nguyen, Gabriele Sanmartino, Paolo Papotti, Carsten Binnig

专题命中 其他VLM :vision-language model(abstract)

AI总结 针对图像数据上的语义过滤器,提出基于共享嵌入空间的语义直方图方法,通过估计查询特异性来绕过传统在线采样,实现高效选择性估计,将查询优化与执行的端到端运行时开销降低高达86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27918 2026-05-28 cs.DC 50%

Addressing Variable Heterogeneity in Distributed Multimodal Training with Entrain

解决分布式多模态训练中的变量异构性问题:Entrain

Insu Jang, Mosharaf Chowdhury

专题命中 其他VLM :MLLM(abstract)

AI总结 提出Entrain框架,通过宏观批次的静态模型并行配置和层次化微批次分配算法,解决多模态大语言模型训练中的数据异构性和变量波动,提升吞吐量达1.40倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23847 2026-05-25 cs.RO 50%

Instrumentation for Imitation Learning: Enhancing Training Datasets for Clothes Hanger Insertion

模仿学习的仪器化:增强衣架插入训练数据集

Remko Proesmans, Thomas Lips, Francis wyffels

机构 * AI and Robotics Lab (IDLab-AIRO)(人工智能与机器人实验室(IDLab-AIRO)) Ghent University—imec(根特大学—imec)

专题命中 其他VLM :vision language model(abstract)

AI总结 本文通过仪器化(在物体中集成传感器)提供状态信息,训练扩散策略进行衣架插入任务,实验表明仪器化策略比纯视觉策略成功率提高14-25%,且黑箱模仿学习能自动优先使用仪器信号。

Comments Accepted for presentation at ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14296 2026-05-18 cs.CY 50%

On the Trustworthiness of Generative Foundation Models: Guideline, Assessment, and Perspective

生成基础模型的可信度:指南、评估与视角

Yue Huang, Chujie Gao, Siyuan Wu, Haoran Wang, Xiangqi Wang, Yujun Zhou, Yanbo Wang, Jiayi Ye, Jiawen Shi, Qihui Zhang, Yuan Li, Han Bao, Zhaoyi Liu, Tianrui Guan, Dongping Chen, Ruoxi Chen, Kehan Guo, Andy Zou, Bryan Hooi Kuen-Yew, Caiming Xiong, Elias Stengel-Eskin, Hongyang Zhang, Hongzhi Yin, Huan Zhang, Huaxiu Yao, Jaehong Yoon, Jieyu Zhang, Kai Shu, Kaijie Zhu, Ranjay Krishna, Swabha Swayamdipta, Taiwei Shi, Weijia Shi, Xiang Li, Yiwei Li, Yuexing Hao, Zhihao Jia, Zhize Li, Xiuying Chen, Zhengzhong Tu, Xiyang Hu, Tianyi Zhou, Jieyu Zhao, Lichao Sun, Furong Huang, Or Cohen Sasson, Prasanna Sattigeri, Anka Reuel, Max Lamparth, Yue Zhao, Nouha Dziri, Yu Su, Huan Sun, Heng Ji, Chaowei Xiao, Mohit Bansal, Nitesh V. Chawla, Jian Pei, Jianfeng Gao, Michael Backes, Philip S. Yu, Neil Zhenqiang Gong, Pin-Yu Chen, Bo Li, Dawn Song, Xiangliang Zhang

专题命中 其他VLM :vision-language model(abstract)

AI总结 本文提出生成基础模型的可信度框架,通过多学科协作制定指导原则,引入动态评估平台TrustGen,揭示可信度进展与挑战,并探讨未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10501 2026-05-12 cs.DC 50%

Accelerating Compound LLM Training Workloads with Maestro

通过Maestro加速复合大语言模型训练工作负载

Xiulong Yuan, Hongqing Chen, Jiaxuan Peng, Fan Zhou, Zhixiang Ruan, Zekun Wang, Bo Zheng, Rui Men, Haiquan Wang, Zhipeng Zhang, Langshi Chen, Man Yuan, Jiaqi Gao, Zhengping Qian, Junyang Lin, Yong Li, Wei Lin, Junhua Wang, Jingren Zhou

专题命中 其他VLM :MLLM(abstract)

AI总结 本文提出Maestro框架,针对复合LLM训练中的静态异构性和动态不规则性,通过分段图重构和波前调度算法提升硬件利用率,减少40%的GPU消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19417 2026-05-08 cs.HC 50%

MER 2026: From Discriminative Emotion Recognition to Generative Emotion Understanding

MER 2026:从判别性情感识别到生成性情感理解

Zheng Lian, Xiaojiang Peng, Kele Xu, Ziyu Jia, Xinyi Che, Zebang Cheng, Fei Ma, Laizhong Cui, Yazhou Zhang, Xin Liu, Liang Yang, Jia Li, Fan Zhang, Liumeng Xue, Erik Cambria, Guoying Zhao, Bjorn W. Schuller, Jianhua Tao

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 MER2026延续系列挑战趋势,包含四个赛道,聚焦双人交互、细粒度识别、偏好预测和生理信号情感识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17816 2026-04-21 cs.CR 50%

Privacy-Preserving Product-Quantized Approximate Nearest Neighbor Search Framework for Large-scale Datasets via A Hybrid of Fully Homomorphic Encryption and Trusted Execution Environment

面向大规模数据集的隐私保护产品量化近邻搜索框架:通过全同态加密和可信执行环境的混合方案

Shozo Saeki, Minoru Kawahara, Hirohisa Aman

专题命中 其他VLM :visual language model(abstract)

AI总结 本文提出PPPQ-ANN框架,结合全同态加密和可信执行环境,优化大规模数据集的隐私保护近邻搜索,实现快速数据库生成和高吞吐量检索。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04609 2026-04-21 cs.CL 50%

When More Words Say Less: Decoupling Length and Specificity in Image Description Evaluation

当更多词语说更少:在图像描述评估中解耦长度与特异性

Rhea Kapur, Robert Hawkins, Elisa Kreiss

机构 * Stanford University(斯坦福大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他VLM :vision-language model(abstract)

AI总结 本文提出通过对比集定义描述特异性,验证人们更偏好信息密集的描述,无论长度如何,且长度分配影响特异性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08664 2026-04-13 cs.RO 50%

Generative Simulation for Policy Learning in Physical Human-Robot Interaction

生成仿真在物理人机交互中政策学习中的应用

Junxiang Wang, Xinwen Xu, Tiancheng Wu, Julian Millan, Nir Pechuk, Zackory Erickson

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 其他VLM :vision-language model(abstract)

AI总结 本文提出零样本生成仿真框架,通过自然语言提示生成多样化的物理人机交互场景,用于自主收集合成数据并训练基于视觉的模仿学习策略,实现从仿真到现实的零样本迁移。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14611 2026-04-10 cs.HC 50%

Exploring MLLMs Perception of Network Visualization Principles

探索 MLLMs 对网络可视化原则的感知

Jacob Miller, Markus Wallinger, Ludwig Felder, Timo Brand, Henry Förster, Johannes Zink, Chunyang Chen, Stephen Kobourov

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 研究测试多模态大语言模型是否能在网络布局属性感知任务中匹配人类表现,发现MLLMs在同等条件下表现优于非专家,且提示工程可提升性能,表明其可能依赖视觉代理而非计算实际值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06393 2026-04-03 cs.IR 50%

MuCo: Multi-turn Contrastive Learning for Multimodal Embedding Model

MuCo:多轮对比学习用于多模态嵌入模型

Geonmo Gu, Byeongho Heo, Jaemyung Yu, Jaehui Hwang, Taekyung Kim, Sangmin Lee, HeeJae Jun, Yoohoon Kang, Sangdoo Yun, Dongyoon Han

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 本文提出MuCo,一种基于对话的多轮对比学习框架,通过多轮查询-目标对提升多模态嵌入模型的训练效率和表征一致性。

Comments CVPR 2026 camera-ready; 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10045 2026-03-20 cs.CL 50%

Do Language Models Associate Sound with Meaning? A Multimodal Study of Sound Symbolism

语言模型是否将声音与意义关联?一种多模态研究声音象征主义

Jinhong Jeong, Sunghyun Lee, Jaeyoung Lee, Seonah Han, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) Korea University(韩国大学)

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 研究语言模型在多模态输入中对声音象征性的处理,通过分析不同语义维度下的音节注意力分数,揭示模型对声音与意义关联的理解机制。

Comments 33 pages, 27 tables, 10 figures, accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14008 2026-03-17 cs.NI 50%

Measuring Weather Effects and Link Quality Dynamics in LEO Satellite Networks

测量低轨卫星网络中天气影响和链路质量动态

Clemens Lottermoser, Simon Damm, Stefan Schmid

专题命中 其他VLM :vision-language model(abstract)

AI总结 本文通过Starlink案例研究,分析了影响链路质量的动态因素,发现大气液态水路径(LWP)是关键影响因素,尤其在降雨时导致下载吞吐量下降,同时网络升级也提升了性能。

Comments satellite networks, non-terrestrial networks, LEOs, measurements, weather

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08060 2026-03-10 cs.HC 50%

CinemaWorld: Generative Augmented Reality with LLMs and 3D Scene Generation for Movie Augmentation

CinemaWorld: 基于 LLM 和 3D 场景生成的生成增强现实用于电影增强

Keiichi Ihara, DaeHo Lee, Manato Abe, Hye-Young Jo, Ryo Suzuki

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 CinemaWorld 利用 LLM 和 3D 场景生成技术,通过增强现实将电影内容与现实环境结合,提升观影沉浸感和娱乐性。

Comments 13 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12942 2026-02-16 eess.SP 50%

HoRAMA: Holistic Reconstruction with Automated Material Assignment for Ray Tracing using NYURay

基于NYURay的Holistic Reconstruction with Automated Material Assignment用于射线追踪的全面重建

Mingjun Ying, Guanyue Qian, Xinquan Wang, Peijie Ma, Dipankar Shakya, Theodore S. Rappaport

专题命中 其他VLM :vision language model(abstract)

AI总结 HoRAMA通过结合MASt3R-SLAM和视觉语言模型实现快速生成RT兼容的3D模型,提升无线传播预测精度并缩短重建时间。

Comments 7 pages, 4 figures, 2 tables, accepted by 2026 IEEE International Conference on Communications (ICC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03220 2026-02-12 eess.SP 50%

Multimodal-Wireless: A Large-Scale Dataset for Sensing and Communication

多模态无线:一种大规模数据集用于传感与通信

Tianhao Mao, Le Liang, Jie Yang, Hao Ye, Shi Jin, Geoffrey Ye Li

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 本文提出多模态无线数据集,用于多模态传感与通信研究,包含高分辨率CSI与多种传感器数据,支持通信与协同感知应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17321 2026-02-10 cs.RO cs.CL 50%

OpenGVL -- Benchmarking Visual Temporal Progress for Data Curation

OpenGVL -- 视觉时间进程数据整理的基准测试

Paweł Budzianowski, Emilia Wiśnios, Michał Tyrolski, Gracjan Góral, Igor Kulakov, Viktor Petrenko, Krzysztof Walas

机构 * Lute IDEAS Research Institute(IDEAS研究机构) Simple Automation Poznań University of Technology(波兹南技术大学) University of Warsaw(华沙大学)

专题命中 其他VLM :vision-language model(abstract)

AI总结 OpenGVL通过评估开源模型在时序任务预测中的表现,揭示其在机器人数据整理中的局限性,并提供自动化数据筛选的实用工具。

Comments Workshop on Making Sense of Data in Robotics: Composition, Curation, and Interpretability at Scale at CoRL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08444 2026-02-10 cs.HC 50%

GlyphWeaver: Unlocking Glyph Design Creativity with Uniform Glyph DSL and AI

GlyphWeaver: 通过统一的 glyph DSL 和 AI 解锁 glyph 设计创意

Can Liu, Shiwei Chen, Zhibang Jiang, Yong Wang

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 GlyphWeaver 通过统一的 glyph DSL 和 AI 技术,为非程序员提供创建复杂 glyph 可视化的工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19611 2026-02-10 cs.HC 50%

Scene2Hap: Generating Scene-Wide Haptics for VR from Scene Context with Multimodal LLMs

Scene2Hap: 从场景上下文生成VR场景中的全域触觉反馈

Arata Jingu, Easa AliAbbasi, Sara Safaee, Paul Strohmeier, Jürgen Steimle

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 Scene2Hap通过多模态大语言模型生成VR场景中的触觉反馈,提升沉浸感与真实感。

Comments Accepted at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20030 2026-02-10 cs.SI 50%

Counting How the Seconds Count: Understanding Algorithm-User Interplay in TikTok via ML-driven Analysis of Video Content

秒数如何计数:通过机器学习分析视频内容理解TikTok上的算法-用户互动

Maleeha Masood, Shreya Kannan, Zikun Liu, Deepak Vasisht, Indranil Gupta

专题命中 其他VLM :vision language model(abstract)

AI总结 通过机器学习分析TikTok视频内容,研究算法与用户互动的时间演变及用户体验影响。

Comments To contact, email maleeha2@illinois.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26521 2026-02-05 cs.CL 50%

Hebrew Diacritics Restoration using Visual Representation

希伯来文附加符号恢复使用视觉表示

Yair Elboher, Yuval Pinter

机构 * Faculty of Computer and Information Science(计算机与信息科学学院) Ben-Gurion University of the Negev(贝叶尔谢瓦巴内吉尔大学)

专题命中 其他VLM :visual language model(abstract)

AI总结 DiVRit通过视觉表示方法实现希伯来文附加符号恢复,利用零样本分类和视觉语言模型提升准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04157 2026-02-05 cs.RO 50%

A Modern System Recipe for Situated Embodied Human-Robot Conversation with Real-Time Multimodal LLMs and Tool-Calling

一种面向情境具身人机对话的现代系统配方,结合实时多模态大语言模型与工具调用

Dong Won Lee, Sarah Gillet, Louis-Philippe Morency, Cynthia Breazeal, Hae Won Park

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 本文提出了一种结合实时多模态大语言模型与工具调用的系统配方,用于提升情境具身人机对话的交互质量与效率。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03416 2026-02-04 cs.IR 50%

AesRec: A Dataset for Aesthetics-Aligned Clothing Outfit Recommendation

AesRec:一个用于美学对齐的服装搭配推荐数据集

Wenxin Ye, Lin Li, Ming Li, Yang Shen, Kanghong Wang, Jimmy Xiangji Huang

专题命中 其他VLM :vision-language model(abstract)

AI总结 AesRec数据集通过系统化的定量美学注释,为开发与美学对齐的服装推荐系统提供了支持,实验表明整合量化美学信息能提升用户审美指导与个性化需求的满足。

详情

展开后加载摘要…

URL PDF HTML 收藏