arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-24 至 2026-03-24 共收录 92 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 27 篇

2512.21778 2026-03-24 cs.CV 88%

Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models

Scene-VLM:通过视觉-语言模型进行多模态视频场景分割

Nimrod Berman, Adam Botach, Emanuel Ben-Baruch, Shunit Haviv Hakimi, Asaf Gendler, Ilan Naiman, Erez Yosef, Igor Kviatkovsky

机构 * Ben-Gurion University(本·古里安大学) Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(title,abstract);分类 cs.CV

AI总结 本文提出Scene-VLM,首个基于视觉-语言模型的视频场景分割框架,通过融合视觉与文本信息实现多模态推理,提升场景分割的准确性和可解释性。

Comments Accepted for publication at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20314 2026-03-24 cs.CV cs.LG 86%

VGS-Decoding: Visual Grounding Score Guided Decoding for Hallucination Mitigation in Medical VLMs

VGS-Decoding:基于视觉 grounding 分数的解码方法用于医疗 VLM 中的幻觉抑制

Govinda Kolli, Adinath Madhavrao Dukre, Behzad Bozorgtabar, Dwarikanath Mahapatra, Imran Razzak

机构 * MBZUAI Rajiv Gandhi University of Knowledge Technologies(拉贾·甘地知识技术大学) Aarhus University(奥胡斯大学) Khalifa University(卡里玛大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 本文提出 VGS-Decoding 方法,通过视觉 grounding 分数指导解码以减少医疗 VLM 的幻觉问题,实验表明在多个数据集上取得了显著提升,且仅引入2倍推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21488 2026-03-24 cs.CV 85%

Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation

学习轨迹感知的多模态大语言模型用于视频推理分割

Jingnan Luo, Mingqi Gao, Jun Liu, Bin-Bin Gao, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出TrajSeg框架,通过双向文本轨迹对齐提升视频对象轨迹感知能力,采用帧级内容整合模块和统一掩码解码器实现端到端训练,实验表明其在视频推理分割任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19248 2026-03-24 cs.CV cs.AI 84%

No Need For Real Anomaly: MLLM Empowered Zero-Shot Video Anomaly Detection

无需真实异常:MLLM赋能的零样本视频异常检测

Zunkai Dai, Ke Li, Jiajia Liu, Jie Yang, Yuanyuan Qiao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Northwestern Polytechnical University(西北工业大学)

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LAVIDA框架,利用多模态大语言模型和异常暴露采样器,解决视频异常检测中数据稀少和语义理解不足的问题,实现零样本下的帧级和像素级异常检测最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21944 2026-03-24 cs.CV 83%

Group3D: MLLM-Driven Semantic Grouping for Open-Vocabulary 3D Object Detection

Group3D: 基于多模态大语言模型的开放词汇3D目标检测语义分组

Youbin Kim, Jinho Park, Hogun Park, Eunbyung Park

机构 * Department of Artificial Intelligence, Sungkyunkwan University(成均馆大学人工智能系) Department of Artificial Intelligence, Yonsei University(延世大学人工智能系)

专题命中 视觉定位与Grounding :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 Group3D通过将语义约束整合到实例构建过程中,解决多视角开放词汇3D目标检测中的几何过合并问题,实现语义与几何一致性融合的检测框架。

Comments 24 pages, 7 figures, Project page: https://ubin108.github.io/Group3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17495 2026-03-24 cs.CV 83%

GroundingME: Exposing the Visual Grounding Gap in MLLMs through Multi-Dimensional Evaluation

GroundingME:通过多维评估揭示MLLMs中的视觉 grounding 隙

Rang Li, Lei Li, Shuhuai Ren, Hao Tian, Shuhao Gu, Shicheng Li, Zihao Yue, Yudong Wang, Wenhan Ma, Zhe Yang, Jingyuan Ma, Zhifang Sui, Fuli Luo

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) LLM-Core Xiaomi(小米LLM-Core) The University of Hong Kong(香港大学) Renmin University of China(中国人民大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出GroundingME基准,通过四个维度评估MLLMs的视觉 grounding 能力,揭示其在区分相似物体、理解空间关系、处理遮挡和拒绝无解查询方面的不足,发现最佳模型仅达到45.1%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13406 2026-03-24 cs.CV cs.AI 81%

Nuanced Emotion Recognition Based on a Segment-based MLLM Framework Leveraging Qwen3-Omni for AH Detection

基于段落式MLLM框架的细致情绪识别:利用Qwen3-Omni进行AH检测

Liang Tang, Hongda Li, Jiayu Zhang, Long Chen, Shuxian Li, Siqi Pei, Tiaonan Duan, Yuhao Cheng

机构 * Qwen3-Omni

专题命中 视觉定位与Grounding :MLLM(title);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于段落式MLLM框架的细致情绪识别方法,利用Qwen3-Omni模型在AH检测中实现85.1%的准确率,验证了多模态大语言模型在捕捉复杂情绪冲突中的优势。

Comments 5 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01304 2026-03-24 cs.CV 79%

Phrase Grounding-based Style Transfer for Single-Domain Generalized Object Detection

基于短语定位的风格迁移单域通用目标检测

Hao Li, Wei Wang, Cong Wang, Zhigang Luo, Xinwang Liu, Kenli Li, Xiaochun Cao

机构 * School of Computer, National University of Defense Technology, Changsha, China(国防科技大学计算机学院,中国长沙) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, Shenzhen, China(中山大学深圳校区计算机科学与技术学院,中国深圳) Hong Kong Polytechnic University, Department of Computing, Hong Kong(香港理工大学计算学院,香港) College of Computer Science and Electronic Engineering, Hunan University, Changsha, China(湖南大学计算机科学与电子工程学院,中国长沙)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出基于短语定位的风格迁移方法,通过学习目标域风格提升模型泛化能力,实验表明在多个天气驾驶基准上取得最佳性能。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21222 2026-03-24 cs.CV 79%

A Large-Scale Remote Sensing Dataset and VLM-based Algorithm for Fine-Grained Road Hierarchy Classification

一个大规模遥感数据集和基于视觉-语言的算法用于细粒度道路层级分类

Ting Han, Xiangyi Xie, Yiping Chen, Yumeng Du, Jin Ma, Aiguang Li, Jiaan Liu, Yin Gao

机构 * School of Geospatial Engineering and Science(地理工程与科学学院) Laboratory of Intelligent Collaborative Computing(智能协同计算实验室) United Nations University Institute in Macau(联合国澳门研究所) Moganshan Geospatial Information Laboratory(莫干山地理信息实验室)

专题命中 视觉定位与Grounding :VLM(title);vision-language model(abstract);分类 cs.CV

AI总结 本文提出SYSU-HiRoads数据集和RoadReasoner算法,用于从遥感图像中自动多级道路制图。数据集包含3631平方公里的GF-2影像,提供高精度道路掩码和层级标签,算法通过增强频率敏感特征和多尺度上下文,实现道路表面掩码、拓扑保持网络和语义一致的层级分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22228 2026-03-24 cs.CV cs.AI 73%

SpatialReward: Verifiable Spatial Reward Modeling for Fine-Grained Spatial Consistency in Text-to-Image Generation

SpatialReward: 可验证的空间奖励建模以实现文本到图像生成中的细粒度空间一致性

Sashuai Zhou, Qiang Zhou, Junpeng Ma, Yue Cao, Ruofan Hu, Ziang Zhang, Xiaoda Yang, Zhibin Wang, Jun Song, Cheng Yu, Bo Zheng, Zhou Zhao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SpatialReward,一种专门评估生成图像中空间布局的可验证奖励模型,通过多阶段流程提升空间一致性与生成质量,实验表明其能更贴近人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05848 2026-03-24 cs.CV cs.AI cs.RO 62%

Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals

目标力:教视频模型实现物理条件化的目标

Nate Gillman, Yinghua Zhou, Zitian Tang, Evan Luo, Arjan Chakravarthy, Daksh Aggarwal, Michael Freeman, Charles Herrmann, Chen Sun

机构 * Brown University(布朗大学) Cornell University(康奈尔大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Goal Force框架,通过显式力矢量和中间动力学定义目标,使视频模型能零样本泛化到复杂现实场景,实现基于物理的视频生成与规划。

Comments Camera ready version (CVPR 2026). Code and interactive demos at https://goal-force.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08138 2026-03-24 cs.CV cs.AI cs.MM 62%

Understanding Temporal Logic Consistency in Video-Language Models through Cross-Modal Attention Discriminability

通过跨模态注意力可区分性理解视频-语言模型中的时间逻辑一致性

Chengzhi Li, Heyan Huang, Ping Jian, Zhen Yang, Yaning Tian, Zhongbin Guo

机构 * School of Computer Science and Technology, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学与技术学院,北京,中国) Beijing Engineering Research Center of High Volume Language Information Processing and Cloud Computing Applications, Beijing Institute of Technology, Beijing, China(高性能语言信息处理与云计算应用北京工程研究中心,北京理工大学,北京,中国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨视频-语言模型在时间逻辑一致性问题上的核心原因,提出TCAS方法提升跨模态注意力的时序分辨能力,实验验证了方法对时间逻辑一致性的提升效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13275 2026-03-24 cs.LG cs.AI 62%

PREBA: Surgical Duration Prediction via PCA-Weighted Retrieval-Augmented LLMs and Bayesian Averaging Aggregation

PREBA:通过PCA加权检索增强LLMs和贝叶斯平均聚合进行手术持续时间预测

Wanyin Wu, Kanxue Li, Baosheng Yu, Haoyun Zhao, Yibing Zhan, Dapeng Tao, Hua Jin

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李科钦医学院) First People’s Hospital of Yunnan Province(云南省第一人民医院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 PREBA通过PCA加权检索增强和贝叶斯平均聚合,结合机构特定临床证据和统计先验,提升手术持续时间预测的准确性和稳定性,实验显示其性能显著优于零样本推理方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06931 2026-03-24 cs.AI cs.LG 62%

Automated Formalization via Conceptual Retrieval-Augmented LLMs

通过概念检索增强的LLM实现自动化形式化

Wangyue Lu, Lun Du, Sirui Li, Ke Weng, Haozhe Sun, Hengyu Liu, Minghe Yu, Tiancheng Zhang, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(东北大学计算机科学与工程学院,沈阳 110819,中国) Ant Research, Ant Group, Beijing, China(蚂蚁集团北京蚂蚁研究院,中国) Department of Computer Science, Aalborg University, Denmark(丹麦奥尔堡大学计算机科学系) Software College, Northeastern University, Shenyang 110819, China(东北大学软件学院,沈阳 110819,中国)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CRAMF框架,通过检索数学概念定义提升LLM形式化能力,解决模型幻觉和语义鸿沟问题,在三个基准测试中实现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13925 2026-03-24 cs.CV cs.AI 62%

Segmenting Visuals With Querying Words: Language Anchors For Semi-Supervised Image Segmentation

通过查询词进行视觉分割:用于半监督图像分割的语言锚点

Numair Nadeem, Saeed Anwar, Muhammad Hamza Asad, Abdul Bais

机构 * University of Regina, Canada(里嘉大学) The University of Western Australia, Australia(西澳大学) University Canada West, Canada(加拿大西大学)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HVLFormer,通过生成多尺度文本查询和引入跨视角一致性正则化,提升视觉与文本对齐,以实现更准确的半监督图像分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16196 2026-03-24 cs.CV cs.LG 62%

Learn from Foundation Model: Fruit Detection Model without Manual Annotation

从基础模型学习:无需人工标注的水果检测模型

Yanan Wang, Zhenghao Fei, Ruichen Li, Yibin Ying

机构 * College of Biosystems Engineering and Food Science, Zhejiang University(浙江大学生物系统工程与食品科学学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Zhejiang University(浙江大学杭州全球科技创新中心) Faculty of Science, National University of Singapore(新加坡国立大学科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出SDM-D框架,通过SDM和知识蒸馏技术,在无标注数据下训练高效的小模型,实现水果检测的高精度与速度,超越现有开放集检测方法。

Comments 35 pages, 11figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22249 2026-03-24 cs.CV 57%

EgoGroups: A Benchmark For Detecting Social Groups of People in the Wild

EgoGroups:一种用于检测真实场景中人类社交群体的基准测试

Jeffri Murrugarra-Llerena, Pranav Chitale, Zicheng Liu, Kai Ao, Yujin Ham, Guha Balakrishnan, Paola Cascante-Bonilla

机构 * Stony Brook University(石英布克大学) Rice University(里士满大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 本文提出EgoGroups基准测试,通过第一视角数据集捕捉全球城市中的社交动态,评估了最新VLM/LLMs和监督模型在群体检测中的表现,发现零样本设置下VLM和LLMs优于监督基线,人群密度和文化区域显著影响模型性能。

Comments Project Page: https://lab-spell.github.io/EgoGroups/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21728 2026-03-24 cs.AI cs.CL 57%

EvoIdeator: Evolving Scientific Ideas through Checklist-Grounded Reinforcement Learning

EvoIdeator:通过基于检查表的强化学习进化科学思想

Andreas Sauter, Yuyue Zhao, Jacopo Urbani, Wenxiang Hu, Zaiqiao Meng, Lun Zhou, Xiaohui Yan, Yougang Lyu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Vrije Universiteit Amsterdam(荷兰瓦赫宁根大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出EvoIdeator框架,通过基于检查表的反馈与强化学习结合,提升大语言模型生成高质量科研提案的能力,实验表明其在关键科学指标上优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23956 2026-03-24 cs.CV 57%

SwitchCraft: Training-Free Multi-Event Video Generation with Attention Controls

SwitchCraft: 无需训练的多事件视频生成与注意力控制

Qianxun Xu, Chenxi Song, Yujun Cai, Chi Zhang

机构 * Westlake University(西湖大学) Duke Kunshan University(杜克-昆山大学) The University of Queensland(昆士兰大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 SwitchCraft通过引入事件对齐查询引导和自动平衡强度求解器,提升多事件视频生成的提示对齐、事件清晰度和场景一致性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01583 2026-03-24 cs.CV 57%

3DSceneEditor: Controllable 3D Scene Editing with Gaussian Splatting

3DSceneEditor: 基于高斯散射的可控3D场景编辑

Ziyang Yan, Yihua Shao, Minwen Liao, Siyu Chen, Nan Wang, Muyuan Lin, Jenq-Neng Hwang, Hao Zhao, Fabio Remondino, Lei Li

机构 * D Optical Metrology unit, Fondazione Bruno Kessler(3D光学测绘单元,布鲁诺·凯斯勒基金会) Department of Information Engineering and Computer Science, University of Trento(信息工程与计算机科学系,特伦托大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出3DSceneEditor,通过高斯散射实现高效精准的3D场景编辑,整合实例分割模型与CLIP实现语义对齐,支持对象添加、重定位等操作,实验表明其在精度和效率上优于现有方法。

Comments Accepted by WACV 2026, Project Page: https://ziyangyan.github.io/3DSceneEditor

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21386 2026-03-24 cs.CV 57%

Mitigating Objectness Bias and Region-to-Text Misalignment for Open-Vocabulary Panoptic Segmentation

缓解对象性偏差和区域到文本对齐问题以实现开放词汇全景分割

Nikolay Kormushev, Josip Šarić, Matej Kristan

机构 * University of Ljubljana(卢布尔雅那大学) ETH Zurich(苏黎世联邦理工学院) University of Zagreb(扎格reb大学) Faculty of Comp. and Inf. Science(计算机与信息科学系) Dept. of Computer Science(计算机科学系) Faculty of Elec. Eng. and Computing(电子工程与计算科学系)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出OVRCOAT框架,通过CLIP条件对象性调整和开放词汇掩码到文本细化,解决开放词汇全景分割中的对象性偏差和区域对齐问题,提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21176 2026-03-24 cs.CV 57%

GIDE: Unlocking Diffusion LLMs for Precise Training-Free Image Editing

GIDE: 解锁扩散大语言模型用于精确无训练图像编辑

Zifeng Zhu, Jiaming Han, Jiaxiang Zhao, Minnan Luo, Xiangyu Yue

机构 * Xi'an Jiaotong University MMLab, The Chinese University of Hong Kong(西安交通大学MMLab,香港中文大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出GIDE框架,通过离散噪声逆向机制实现无训练图像编辑,支持多种指令并保持背景不变,实验表明其在语义正确性和感知质量上显著优于现有方法。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21069 2026-03-24 cs.CV 57%

NoOVD: Novel Category Discovery and Embedding for Open-Vocabulary Object Detection

NoOVD:开放词汇物体检测中的新类别发现与嵌入

Yupeng Zhang, Ruize Han, Zhiwei Chen, Wei Feng, Liang Wan

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学院) Key Research Center for Surface Monitoring and Analysis of Relics, State Administration of Cultural Heritage(文物表面监测与分析国家重点研究中心) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳先进技术大学计算机科学与人工智能学院) School of Artificial Intelligence, Nanchang University(南昌大学人工智能学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出NoOVD框架,通过自蒸馏机制和K-FPN模块提升开放词汇物体检测中新类别的识别与嵌入效果,同时引入R-RPN提升召回率,实验表明在多个数据集上表现优异。

Comments CVPR 2026 Accept

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13285 2026-03-24 cs.CV 57%

CausalCLIP: Causally-Informed Feature Disentanglement and Filtering for Generalizable Detection of Generated Images

CausalCLIP:基于因果信息的特征解耦与过滤以实现生成图像的通用检测

Bo Liu, Qiao Qin, Qinghui He

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CausalCLIP框架,通过解耦因果与非因果特征并利用因果推理原理过滤,提升生成图像检测的泛化能力,实验表明在不同生成模型上准确率和平均精度均优于现有方法。

Comments 9 pages,Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20433 2026-03-24 cs.SD cs.AI cs.CL eess.AS 57%

ALICE: A Multifaceted Evaluation Framework of Large Audio-Language Models' In-Context Learning Ability

ALICE:大型音频-语言模型上下文学习能力的多维评估框架

Yen-Ting Piao, Jay Chiehen Liao, Wei-Tang Chien, Toshiki Ogimoto, Shang-Tse Chen, Yun-Nung Chen, Chun-Yi Lee, Shao-Yuan Lo

机构 * National Taiwan University, Taiwan(台湾国立成功大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出ALICE框架,通过三阶段评估六个LALMs在音频条件下的上下文学习能力,发现上下文示例虽能提升格式合规性,但难以改善核心任务表现,揭示了跨模态整合的潜在局限。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01212 2026-03-24 physics.optics quant-ph 50%

BIFROST: A First-Principles Model of Polarization Mode Dispersion in Optical Fiber

BIFROST:光纤偏振模色散的首原则模型

Patrick R. Banner, Steven L. Rolston, Joseph W. Britton

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 BIFROST是首个基于物理原理的光纤偏振模色散模型,通过物理参数如环境温度和外部应力研究真实光纤,用于量子网络中偏振编码的波分复用PMD补偿方案预测。

Comments Minor edits and additions following peer review; 16 pages + references, 8 figures, 2 tables

Journal ref Phys. Rev. Applied 25(3), 034054 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 2 篇

2602.19961 2026-03-24 cs.CL cs.IR 67%

Unlocking Multimodal Document Intelligence: From Current Triumphs to Future Frontiers of Visual Document Retrieval

解锁多模态文档智能:从当前成就到视觉文档检索的未来前沿

Yibo Yan, Jiahao Huo, Guanbo Feng, Mingdong Ou, Yi Cao, Xin Zou, Shuliang Liu, Yuanhuiyi Lyu, Yu Huang, Jungang Li, Kening Zheng, Xu Zheng, Philip S. Yu, James Kwok, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算) Hong Kong University of Science and Technology(香港科技大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 文档图表理解 :multimodal large language model(abstract);MLLM(abstract)

AI总结 本文综述了视觉文档检索领域,探讨了多模态大语言模型时代下的方法演进与挑战,提出未来发展方向。

Comments Under review. This version updates the relevant works released before 15 March, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22187 2026-03-24 cs.CV cs.AI 62%

Seeing is Improving: Visual Feedback for Iterative Text Layout Refinement

视觉反馈提升布局:用于迭代文本布局优化的视觉反馈

Junrong Guo, Shancheng Fang, Yadong Qu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VFLM模型,通过视觉反馈迭代优化文本布局,提升生成质量,实验表明其优于现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 5 篇

2603.21142 2026-03-24 cs.RO 82%

Dynamic Control Barrier Function Regulation with Vision-Language Models for Safe, Adaptive, and Realtime Visual Navigation

动态控制屏障函数调节与视觉-语言模型用于安全、适应性和实时视觉导航

Jeffrey Chen, Rohan Chandra

机构 * Department of Computer Science, University of Virginia(弗吉尼亚大学计算机科学系)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract)

AI总结 本文提出AlphaAdj框架,利用视觉-语言模型动态调整控制屏障函数参数,以实现在动态环境中安全、高效和实时的导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08935 2026-03-24 cs.RO cs.CV 57%

Expand Your SCOPE: Semantic Cognition over Potential-Based Exploration for Embodied Visual Navigation

拓展你的SCOPE:基于潜在探索的语义认知用于具身视觉导航

Ningnan Wang, Weihuang Chen, Liming Chen, Haoxuan Ji, Zhongyu Guo, Xuchong Zhang, Hongbin Sun

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SCOPE框架,通过利用前沿信息驱动潜在探索,提升具身视觉导航中的决策质量与目标相关性,实验表明其在准确性和泛化能力上优于现有方法。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏