arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-06-08 至 2026-06-08 共收录 58 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 5 篇

2510.11014 2026-06-08 cs.RO cs.AI cs.CV 版本更新 82%

MatterDoor: Sampling Zero-shot Spatio-semantic Priors using Generative Models

MatterDoor: 使用生成模型采样零样本空间语义先验

Subhransu S. Bhattacharjee, Hao Lu, Dylan Campbell, Rahul Shome

机构 * School of Computing, Australian National University(澳大利亚国立大学计算机学院)

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 针对机器人通过门缝观察时场景结构缺失的问题,提出MatterDoor方法,利用预训练生成模型(VLM引导外推、单目深度估计、语义分割)采样隐藏房间的语义3D点云先验,在Matterport3D基准上验证了零样本空间语义先验的有效性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14380 2026-06-08 cs.RO 版本更新 75%

CRAFT: Coaching Reinforcement Learning Autonomously using Foundation Models for Multi-Robot Coordination Tasks

CRAFT:利用基础模型自主教练强化学习以完成多机器人协调任务

Seoyeon Choi, Kanghyun Ryu, Jonghoon Ock, Negar Mehr

机构 * Department of Mechanical Engineering, University of California Berkeley(机械工程系,加州大学伯克利分校)

专题命中 GUI与屏幕智能体 :VLM(abstract,abstract_cn);vision language model(abstract)

AI总结 提出CRAFT框架,利用大语言模型分解任务、生成奖励函数,并通过视觉语言模型优化,实现多机器人协调学习,在四足导航和双臂操作任务中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06761 2026-06-08 cs.RO cs.AI 新提交 74%

AxisGuide: Grounding Robot Action Coordinate System in RGB Observations for Robust Visuomotor Manipulation

AxisGuide: 在RGB观测中接地机器人动作坐标系以实现鲁棒的视觉运动操控

Jiyun Jang, Yujin Sung, Woosung Joung, Daewon Chae, Sangwon Lee, Sohwi Kim, Jinkyu Kim, Jungbeom Lee

机构 * Korea University(韩国大学) University of Michigan(密歇根大学) KT R&D Center(KT研发中心) Kakao Mobility(Kakao移动)

专题命中 GUI与屏幕智能体 :grounding(title);分类 cs.AI

AI总结 针对视觉运动策略在分布偏移下动作执行失败的问题,提出AxisGuide方法,通过渲染机器人基座坐标系轴并叠加提示通道,增强动作坐标理解,显著提升泛化性能。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14289 2026-06-08 cs.AI 版本更新 57%

EVA: Evolving Semantic Adversaries for Red-Teaming GUI Agents Against Environmental Injection Attacks

EVA: 针对环境注入攻击的红队GUI智能体的演化语义对抗方法

Yijie Lu, Manman Zhao, Tianjie Ju, Zihe Yan, Xinbei Ma, Yuan Guo, Daizong Ding, Gongshen Liu, Zhuosheng Zhang

机构 * School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Independent Researcher(独立研究者)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);分类 cs.AI

AI总结 提出EVA框架,通过演化语义对抗载荷攻击多模态大语言模型驱动的GUI智能体,揭示语义欺骗是攻击成功的关键,实现85%攻击成功率且快速收敛。

Comments Accepted by

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与鲁棒性 6 篇

2606.06943 2026-06-08 cs.CV cs.AI 新提交 81%

SS-TPT: Stability and Suitability-Guided Test-Time Prompt Tuning for Adversarially Robust Vision-Language Models

SS-TPT:面向对抗鲁棒视觉语言模型的稳定性和适用性引导的测试时提示微调

Sunoh Kim, Daeho Um

机构 * Dankook University, Yongin, South Korea(首尔大学,韩国永兴) University of Seoul, Seoul, South Korea(首尔大学,韩国首尔)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 提出SS-TPT方法,通过稳定性与适用性分数评估增强视图质量,引导测试时提示微调,在保持高吞吐量的同时显著提升对抗鲁棒性。

Comments Accepted in ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23292 2026-06-08 cs.AI cs.LG 版本更新 62%

Agentic Physical AI toward a Domain-Specific Foundation Model for Energy Systems: A Case Study on Nuclear Reactor Control

面向能源系统的领域特定基础模型的具身物理人工智能:以核反应堆控制为例

Yoon Pyo Lee, Samrendra Roy, Kazuma Kobayashi, Sajedul Talukder, Diab Abueidda, Seid Koric, Souvik Chakraborty, Syed Bahauddin Alam

机构 * The Grainger College of Engineering, Nuclear, Plasma & Radiological Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格雷格学院工程学院、核等工程学院) Department of Nuclear Engineering, Hanyang University(汉阳大学核工程系) University of Texas - El Paso(德克萨斯大学埃尔帕索分校) National Center for Supercomputing Applications(国家超级计算应用中心) Department of Applied Mechanics, Indian Institute of Technology Delhi(印度德里理工学院应用力学系) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度德里理工学院亚里人工智能学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出通过紧凑语言模型作为具身物理人工智能,利用基于物理模拟器验证的策略优化替代感知推理,在核反应堆控制任务中实现领域特定基础模型,并展示了规模扩展带来的可靠性提升和策略集中化行为。

Comments Accepted for publication in npj Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06938 2026-06-08 cs.CV 新提交 57%

When CLIP Sees More, It Fights Back Harder: Multi-View Guided Adaptive Counterattacks for Test-Time Adversarial Robustness

当CLIP看得更多,它反击得更猛烈:多视图引导的自适应对抗攻击用于测试时对抗鲁棒性

Sunoh Kim, Daeho Um

机构 * Dankook University(Dankook 大学) University of Seoul(首尔大学) Yongin, South Korea(韩国 Yongin) Seoul, South Korea(首尔, 韩国)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 提出多视图引导的自适应对抗攻击(MAC),通过构建输入图像的增强视图、执行对抗攻击精炼嵌入、自适应调整攻击强度并聚合视图,显著提升CLIP在测试时的对抗鲁棒性。

Comments Accepted in CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06743 2026-06-08 cs.SD cs.AI cs.CL 新提交 57%

HybridCodec: Fast Dual-Stream, Semantically Enhanced Neural Audio Codec

HybridCodec: 快速双流、语义增强的神经音频编解码器

Arjun Gangwar, S Umesh

机构 * Indian Institute of Technology, Madras(印度理工学院马德拉斯分校)

专题命中 幻觉与鲁棒性 :multimodal large language model(abstract);分类 cs.AI

AI总结 提出HybridCodec,一种结合语义蒸馏与双流架构的统一神经音频编解码器,实现强解耦、跨语言鲁棒性及3倍速度提升。

Comments 5 pages, 5 tables, 1 figure, Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07335 2026-06-08 cs.CR 新提交 50%

Defending Jailbreak Attacks on Large Language Models via Manifold Trajectory Kinetics

通过流形轨迹动力学防御大语言模型的越狱攻击

Hangtao Zhang, Yucheng Zhao, Sishun Liu, Ziqi Zhou, Zeyu Ye, Wei Wan, Minghui Li, Shengshan Hu, Yanjun Zhang, Yi Liu, Leo Yu Zhang

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 提出流形轨迹动力学(MTK)方法,通过分析提示词在模型层间的邻域结构演化来检测越狱攻击,在伪恶意提示和自适应攻击下均表现鲁棒。

Comments Accepted to USENIX Security '26 Cycle 2. Code is available at https://github.com/Rookie143/mtk

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04874 2026-06-08 cs.CL 版本更新 50%

Agent Planning Benchmark: A Diagnostic Framework for Planning Capabilities in LLM Agents

Agent规划基准:LLM Agent规划能力的诊断框架

Haoyu Sun, Wenxuan Wang, Mingyang Song, Jujie He, Weinan Zhang, Yang Liu, Yang Yang, Yu Cheng

机构 * Tongji University(同济大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Fudan University(复旦大学) Skywork AI University of California, Santa Cruz(加州大学圣克鲁兹分校) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 幻觉与鲁棒性 :MLLM(abstract_cn)

AI总结 提出Agent规划基准(APB),通过4209个多模态案例和五个设置,诊断LLM Agent在长程规划、工具噪声鲁棒性、校准拒绝和推理时改进方面的系统弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. VLM训练与架构 15 篇

2606.06853 2026-06-08 cs.CV cs.AI 新提交 86%

MotionEnhancer: Leveraging Video Diffusion for Motion-Enhanced Vision-Language Models

MotionEnhancer: 利用视频扩散模型增强运动感知的视觉-语言模型

Yifan Xu, Chao Zhang, Ruifei Ma, Fei Gao, Zhifei Yang, Jiaxing Qi, Zhipeng Chen

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Beijing Digital Native Digital City Research Center(北京数字原生数字城研究中心) School of Computer Science, Peking University(北京大学计算机学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出MotionEnhancer,通过从视频扩散模型中提取运动先验并利用注意力对齐增强视觉-语言模型的运动理解能力,无需额外参数或架构修改,在运动级视频理解基准上取得一致提升。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20950 2026-06-08 cs.CV cs.AI 版本更新 86%

Focus-then-Context: Subject-Centric Progressive Visual Token Reduction for Vision-Language Models

聚焦-然后-上下文:面向视觉-语言模型的主体导向渐进视觉标记缩减

Yulin Zhao, Zheng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院) ShenZhen Loop Area Institute(深圳河套学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出了一种主体导向的渐进视觉标记缩减方法SPpruner,通过模拟人类视觉感知系统的'聚焦-然后-上下文'机制,有效减少视觉标记数量,提升视觉-语言模型的推理效率,实验表明其在速度和资源消耗上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07025 2026-06-08 cs.CV cs.AI 版本更新 86%

The Geometry of Representational Failures in Vision Language Models

视觉语言模型中表征失败的几何结构

Daniele Savietto, Declan Campbell, André Panisson, Marco Nurisso, Giovanni Petri, Jonathan D. Cohen, Alan Perotti

机构 * Dipartimento di Fisica, Università di Torino(都灵大学物理系) Princeton Neuroscience Institute and AI Lab, Princeton University(普林斯顿大学神经科学研究所和AI实验室) Intesa Sanpaolo AI Research(Intesa Sanpaolo AI研究中心) Dipartimento di Scienze Matematiche, Politecnico di Torino(都灵理工学院数学科学系) Network Science Institute, Northeastern University London, UK(伦敦大学东北方大学网络科学研究所)

专题命中 VLM训练与架构 :vision language model(title);InternVL(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 通过分析开源视觉语言模型的概念向量几何重叠,揭示多目标视觉任务中幻觉等错误与认知约束的关联,并提出基于干预的验证方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07026 2026-06-08 cs.CV cs.AI cs.MM 版本更新 81%

Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models

模态间隙驱动的子空间对齐训练范式用于多模态大语言模型

Xiaomin Yu, Yi Xin, Yuhui Zhang, Wenjie Zhang, Chonghan Liu, Hanzhen Zhao, Chen Liu, Xiaoxing Hu, Ziyue Qiao, Hao Tang, Xiaobin Hu, Chengwei Qin, Hui Xiong, Yu Qiao, Shuicheng Yan

机构 * HKUST(GZ)(香港科技大学(广州)) NUS(新加坡国立大学) sh AILab SII Stanford(斯坦福大学) UCLA(加州大学洛杉矶分校) Yale(耶鲁大学) SJTU(上海交通大学) GBU(国防大学) PKU(北京大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对多模态对比学习中的模态间隙问题,提出固定帧模态间隙理论,并基于该理论设计无训练的对齐策略ReAlign和可扩展训练范式ReVision,利用无配对数据实现视觉与语言表示的高效对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06042 2026-06-08 cs.CV 版本更新 77%

LoomVideo: Unifying Multimodal Inputs into Video Generation and Editing

LoomVideo: 统一多模态输入到视频生成与编辑

Jianzong Wu, Hao Lian, Jiongfan Yang, Dachao Hao, Ye Tian, Yunhai Tong, Jingyuan Zhu, Biaolong Chen, Qiaosong Qi, Aixi Zhang, Wanggui He, Mushui Liu, Jinlong Liu, Pipei Huang, Hao Jiang

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出LoomVideo,一种5B参数的高效统一架构,通过多模态大语言模型和零开销Scale-and-Add条件机制,实现视频生成与编辑,显著降低计算复杂度并加速推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01740 2026-06-08 cs.AI cs.CV cs.LG 版本更新 75%

MACD: Model-Aware Contrastive Decoding via Counterfactual Data

MACD:基于反事实数据的模型感知对比解码

Qixin Xiao, Kun Zhou

机构 * University of Michigan, Ann Arbor, MI, USA(密歇根大学,安娜堡分校) University of California San Diego, La Jolla, CA, USA(加州大学圣地亚哥分校)

专题命中 VLM训练与架构 :InternVL(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出MACD方法,利用视频语言模型自身反馈识别导致幻觉的目标区域,生成目标级反事实输入,结合对比解码减少幻觉,提升多模型在复杂场景下的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22574 2026-06-08 cs.CV cs.AI 版本更新 73%

Enhancing Video Representations with Spatiotemporal-Semantic Residual to Mitigate Hallucinations in Video Large Multimodal Models

增强视频表示中的时空语义残差以缓解视频大型多模态模型中的幻觉

Yuansheng Gao, Jinman Zhao, Tong Zhang, Xingguo Xu, Wenbin Xing, Han Bao, Zonghui Wang, Wenzhi Chen

机构 * Zhejiang University(浙江大学) University of Toronto(多伦多大学) Dalian University of Technology(大连理工大学) Sun Yat-sen University(中山大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出ViSSRes方法,通过轻量级MLP网络学习视频表示的残差,从时空和语义一致性优化,在推理时仅需单次前向传播,有效降低幻觉率并提升视频理解性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07338 2026-06-08 cs.CV 新提交 70%

VeriDrive: Verifiable Counterfactual Supervision for Cost-Efficient Vision-Language Planning

VeriDrive: 可验证的反事实监督用于成本高效的视觉-语言规划

Zikai Zhang, Hubert P. H. Shum, Toby P. Breckon

机构 * Department of Computer Science, Durham University(杜伦大学计算机科学系)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出VeriDrive框架,通过结构化感知-评估-修正链生成可验证的反事实监督,降低视觉-语言驾驶规划的数据构建成本,并在nuScenes数据集上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07451 2026-06-08 cs.CV cs.AI cs.CL cs.LG 新提交 67%

TEVI: Text-Conditioned Editing of Visual Representations via Sparse Autoencoders for Improved Vision-Language Alignment

TEVI: 基于稀疏自编码器的文本条件视觉表示编辑以改进视觉-语言对齐

Sweta Mahajan, Sukrut Rao, Jiahao Xie, Alexander Koller, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克研究所信息学院,萨尔兰信息学院,德国萨尔布吕肯) Department of Language Science and Technology, Saarland University, Saarbrücken, Germany(语言科学与技术系,萨尔兰大学,德国萨尔布吕肯)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出TEVI框架,利用稀疏自编码器解耦图像嵌入,并通过文本条件掩码模块选择性重构嵌入,以改善CLIP等视觉-语言模型的图像-文本对齐,在多个检索基准上取得提升。

Comments 20 pages, 13 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05225 2026-06-08 cs.LG cs.AI 版本更新 62%

MACS: Modality-Aware Capacity Scaling for Efficient Multimodal MoE Inference

MACS: 模态感知容量缩放用于高效多模态MoE推理

Bo Li, Chuan Wu, Shaolin Zhu

机构 * School of Software, Tsinghua University, Beijing, China(清华大学软件学院,北京,中国) TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院,中国) School of New Media and Communication, Tianjin University, China(天津大学新媒体与传播学院,中国)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 针对多模态MoE大模型在专家并行推理中因信息异质性和模态动态性导致的效率瓶颈,提出无需训练的MACS框架,通过熵加权负载和动态模态自适应容量机制优化资源分配,显著提升多模态基准性能。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07113 2026-06-08 cs.AI 新提交 57%

Beyond Post-hoc Explanation: Toward Glassbox AI via Probabilistic Mediation

超越事后解释:通过概率中介迈向玻璃箱AI

Manuele Leonelli

机构 * Manuele Leonelli(曼努埃尔·莱奥内利)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 针对大语言模型在关键领域的不透明性,提出玻璃箱框架,利用贝叶斯网络作为事前中介层,实现可审计推理、不确定性量化和可争议输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07000 2026-06-08 cs.AI 新提交 57%

Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

教方法而非答案:用于多模态策略优化的特权辅导蒸馏

Shizhe Xiang, Ke An, Wenlong Yu, Yue Liu, Jian Luan, Pei Fu, Qilong Wang

机构 * Tianjin University(天津大学) Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Xiaomi Inc(小米公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 提出PTD-PO框架,通过构建特权提示提供密集的令牌级监督,避免暴露答案,并采用Top-K JS散度稳定蒸馏,显著提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01802 2026-06-08 cs.SD cs.AI 版本更新 57%

MOSS-Audio Technical Report

MOSS-Audio 技术报告

Chen Yang, Chufan Yu, Hanfu Chen, Jie Zhu, Jingqi Chen, Ke Chen, Wenxuan Wang, Yang Wang, Yaozhou Jiang, Yi Jiang, Zhengyuan Lin, Ziqi Chen, Zhaoye Fei, Chenghao Liu, Donghua Yu, Jun Zhan, Kang Yu, Kexin Huang, Liwei Fan, Mingshu Chen, Qinyuan Cheng, Ruixiao Li, Shimin Li, Songlin Wang, Xingjian Zhao, Yang Gao, Yitian Gong, Yiyang Zhang, Zhe Xu, Xipeng Qiu

机构 * OpenMOSS Team(开放MOSS团队)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 提出统一音频-语言模型 MOSS-Audio,通过 DeepStack 跨层特征注入和时间标记实现语音、环境声和音乐的理解,在音频字幕、时间感知问答、时间戳转录和音频推理任务上取得强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07402 2026-06-08 cs.CL 新提交 50%

M$^3$Exam: Benchmarking Multimodal Memory for Realistic User-Agent Interactions

M$^3$Exam: 面向真实用户-智能体交互的多模态记忆基准

Zhengjun Huang, Wenxuan Liu, Zhoujin Tian, Wei Chen, Junle Chen, Yuqian Wu, Fangyuan Zhang, Qintian Guo, Xiaofang Zhou

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Beijing University of Chemical Technology(北京化工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beijing Institute of Technology (Zhuhai)(北京理工大学(珠海)) Tencent Hy(腾讯(深圳)) Peng Cheng Laboratory(鹏城实验室)

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 提出M$^3$Exam基准,用于评估多模态大语言模型在真实用户-智能体交互中的跨模态推理和隐式信息推断能力,并设计M$^3$Proctor方法通过按需处理视觉源提升准确率13%,同时降低索引构建时间和检索token超70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07342 2026-06-08 cs.CL cs.NE 新提交 50%

LLM-Guided Evolution for Medical Decision Pipelines

LLM引导的医疗决策流程进化

Ivan Sviridov, Artem Oskin, Ivan Panin, Iaroslav Bespalov, Dmitry Dylov, Ivan Oseledets, Aleksandr Nesterov

机构 * Sber AI Lab(Sber AI实验室) AIRI

专题命中 VLM训练与架构 :VLM(abstract_cn)

AI总结 提出LLM引导的MAP-Elites进化方法,无需微调即可优化医疗决策流程,在分诊、咨询和图像分类任务中超越手工设计基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 其他VLM 3 篇

2606.07171 2026-06-08 cs.CV 新提交 87%

When Recovery Matters: The Blind Spot of Surrogate Privacy in MLLM Editing

当恢复至关重要时:MLLM编辑中替代隐私的盲点

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui LI, Shiqi Wang, Sam Kwong

机构 * City University of Hong Kong(香港城市大学) Hon Hai Research Institute(鸿海研究院) Lingnan University(岭南大学)

专题命中 其他VLM :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大模型编辑中的隐私风险,提出首个面向恢复的替代隐私保护编辑基准SPPE,涵盖36个细粒度隐私类别和65个编辑指令,并设计可编辑性评估与替代到源编辑恢复两个任务及对应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07032 2026-06-08 cs.CV cs.AI 新提交 82%

Never Seen Before: Benchmarking Genuine Zero-Shot Composed Image Retrieval with Consistent Video-Sourced Datasets

前所未见:基于一致视频源数据集的真正零样本组合图像检索基准测试

Zhenyu Yang, Zemin Du, Shengsheng Qian, Changsheng Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他VLM :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI

AI总结 针对现有零样本组合图像检索数据集存在参考与目标图像不相关、非真正零样本的问题,提出ZeroSight基准,包含来自视频的一致参考-目标对和训练无关的MLLM驱动方法SC4CIR,通过三重对称一致性检查识别难负样本,实验表明现有方法性能被高估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07161 2026-06-08 cs.CV 新提交 57%

TraRA: Trajectory-level Recognition Aggregation for Video Text Spotting in Urban Surveillance

TraRA: 面向城市监控视频文本识别的轨迹级识别聚合方法

Duc Tri Tran, Trung Thanh Nguyen, Vijay John, Phi Le Nguyen, Yasutomo Kawanishi

机构 * RIKEN(日本理化学研究所) Hanoi University of Science and Technology(河内科学技术大学) Nagoya University(名古屋大学) Lawrence Technological University(劳伦斯技术大学) Ritsumeikan University(立命馆大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出TraRA方法,通过轨迹级文本识别聚合,利用时间与多模态一致性,解决监控视频中运动模糊、遮挡等导致的帧级识别不一致问题,在多个基准上提升跟踪与识别性能。

Comments 22nd IEEE International Conference on Advanced Visual and Signal-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏