arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 511 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 511 篇

2606.23041 2026-07-03 cs.CV 新提交 77%

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

SPAR: 语义-像素自对齐与自适应路由的统一多模态模型

Hongxiang Li, Hongxu Chen, Chenyang Zhu, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出SPAR框架,通过非对称双流统一分词器协调语义感知与像素重建,利用自对齐生成范式消除外部依赖,并引入动态令牌路由实现灵活多模态交互,在统一架构中达到生成、重建与视觉理解的最优性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00816 2026-07-02 cs.CV 新提交 77%

Towards High-Resolution Visual Perception via Hierarchical Entity Exploration

通过层次化实体探索实现高分辨率视觉感知

Ziyu Ma, Shidong Yang, Yuxiang Ji, Yiming Hu, Tongwen Huang, Yong Wang, Jianfei Cai, Xiangxiang Chu

机构 * AMAP, Alibaba Group, China(阿里巴巴集团高德地图,中国) Monash University, Australia(莫纳什大学,澳大利亚)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出无训练、模型无关的层次化实体探索框架HEE,通过动态查询引导、双评分机制和置信度回溯,解决高分辨率图像中细粒度细节丢失问题,在多个基准上超越现有方法。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00338 2026-07-02 cs.CV 新提交 77%

DroneFINE: Domain-Aware Parameter-Efficient Fine-Tuning of Vision-Language Detectors for Drone Images

DroneFINE: 面向无人机图像的视觉-语言检测器的域感知参数高效微调

Ke Wu, Yanan Zhang, Yingjie Gao, Wenhao Li, Chenyu Zhou, XinZhu Ma, Jiaxin Chen, Di Huang

机构 * National College for Excellent Engineers, Beihang University, Beijing, China(北京航空航天大学优秀工程师学院) School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) School of Computer Science and Information Engineering, Hefei University of Technology, Hefei, China(合肥工业大学计算机科学与信息工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室) Innovation Center for Intelligent System Cognition and Decision-Making, Beijing, China(智能系统认知与决策创新中心) Information Science Academy of China Electronics Technology Group Corporation, Beijing, China(中国电子科技集团有限公司信息科学研究院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对无人机图像与视觉语言模型预训练数据之间的域差异,提出包含HyperAdapter和SemanticGate的域感知参数高效微调方法,在减少可训练参数的同时达到与全微调相当的性能。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31924 2026-07-01 cs.CV 新提交 77%

InstanceControl: Controllable Complex Image Generation without Instance Labeling

InstanceControl: 无需实例标注的可控复杂图像生成

Xiaoyu Liu, Huan Wang, Fan Li, Zhixin Wang, Jiaqi Xu, Ming Liu, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) HUAWEI Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出InstanceControl方法,利用视觉语言模型自动建立文本与视觉条件间的实例对应,无需人工标注,通过自适应掩码细化策略实现复杂多实例场景的精确可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21222 2026-06-23 cs.RO cs.AI 新提交 77%

FleetAgent: Teleoperation Assistant for Autonomous Fleets via Vectorized V2N Messages

FleetAgent: 通过向量化V2N消息实现自主车队远程操作助手

Juntong Peng, Qi Chen, Deyuan Qu, Takayuki Shimizu, Yaobin Chen, Ziran Wang

机构 * College of Engineering, Purdue University(普渡大学工程学院) Toyota InfoTech Labs(丰田信息技术实验室)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 提出FleetAgent,一种基于多模态大语言模型的云端助手,通过紧凑的向量化V2N消息实现高效远程操作监控,显著降低上行负载和内存占用,并提升操作员优先级判断与干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18780 2026-06-18 cs.CV cs.CL cs.MM 新提交 77%

SAMA: Semantic Anchor-aligned Augmentation for Unified Low-Resource Multimodal Information Extraction

SAMA:面向统一低资源多模态信息抽取的语义锚定对齐增强

Quanjiang Guo, Chong Mu, Jiazhou Pan, Ming Jia, Ling Tian, Hui Gao, Zhao Kang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出语义锚定对齐增强框架SAMA,通过构建结构化语义锚引导多专家多模态大模型生成高保真文本,并利用锚保留扩散机制合成图像,结合双约束过滤模块,在低资源多模态信息抽取任务中显著提升性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14277 2026-06-15 cs.CV 新提交 77%

One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

一层的垃圾是另一层的宝藏:LVLMs中自适应逐层视觉标记选择

Yongru Chen, Kai Zhang, Zeliang Zong, Yuchen Lu, Wenming Tan, Ye Ren, Jilin Hu

机构 * Hikvision Research Institute(海康威视研究院) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出自适应逐层视觉标记选择(ALVTS),通过轻量级选择器为不同层路由重要标记,实现高效压缩,在89%压缩率下保留96.7%精度。

Comments Accepted by CVPR 2026 (highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12072 2026-06-11 cs.CV 新提交 77%

World Model Self-Distillation: Training World Models to Solve General Tasks

世界模型自蒸馏:训练世界模型以解决通用任务

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

机构 * Department of Computer Science(计算机科学系)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出结合自蒸馏与强化学习的框架,从预训练视频生成器中提取任务解决能力,无需配对任务视频,在基准测试中超越原始模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09110 2026-06-09 cs.CV 新提交 77%

HDRAgent: An Agentic Framework for Multi-Exposure HDR Imaging

HDRAgent: 一种用于多曝光HDR成像的智能体框架

Weiyu Zhou, Tao Hu, Yijian Wang, Xiaogang Xu, Ruixing Wang, Qingsen Yan

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Shenzhen Research Institute, Northwestern Polytechnical University(西北工业大学深圳研究院) Zhejiang University(浙江大学) Camera Group, DJI(大疆相机部门)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 提出首个智能体驱动的HDR成像框架HDRAgent,通过细粒度上下文知识匹配、感知-失真反馈机制和智能体引导的生成对齐策略,自适应选择重建策略,减少复杂动态场景中的鬼影和局部伪影。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08615 2026-06-09 cs.CV cs.CL 新提交 77%

Harnessing Streaming Video in the Wild

利用野外流式视频

Dingyu Yao, Shuhuan Gu, Qingyi Si, Junhao Zhou, Chenxu Yang, Chuanyu Qin, Naibin Gu, Zheng Lin, Weiping Wang, Nan Duan, Jiaqi Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) JD.COM(京东)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出Streaming Harness系统,通过Streaming-Train-248K数据集和训练目标,使视觉语言模型具备主动交互、长期记忆和实时处理能力,并构建Streaming-Eval基准评估流式视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08031 2026-06-09 cs.CV 新提交 77%

Vision-Language Asymmetry in Bistable Image Captioning

双稳态图像描述中的视觉-语言不对称性

Arohan Agate

机构 * Arohan Agate

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 通过83个双稳态刺激的行为基线和稀疏自编码器分析,发现视觉塔中同时激活两种解释,但因果干预仅能翻转默认主导刺激的描述,揭示视觉表征与语言承诺之间的不对称性。

Comments Accepted at ICML 2026 Workshop on Philosophy of Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12364 2026-07-15 cs.CV cs.AI 新提交 76%

Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction

迷失在视觉翻译中:用于脑电到图像重建的基于视觉语言模型的感知语义连贯框架

Sukriti Tiwari, BHVSP Subrahmanyam, Nidhi Goyal, Sai Amrit Patnaik

机构 * Mahindra University(马欣德拉大学) MU-VT Interdisciplinary Advanced Research Centre for Transformative Technologies, Mahindra University(马欣德拉大学MU-VT变革性技术跨学科高级研究中心)

专题命中 VLM训练与架构 :VLM(title);分类 cs.CV、cs.AI

AI总结 研究脑电到图像重建中视觉保真度与语义可恢复性评估问题,引入基于四个视觉语言模型的框架,通过结构化问题评估图像对,产生宽容感知和语义对齐分数,提炼出脑机接口连贯分数,有效评估感知语义可恢复性。

Comments 27 pages, 3 figures, 13 tables. Accepted at the 5th International Workshop on Human Brain and Artificial Intelligence (HBAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06722 2026-08-10 cs.HC 新提交 75%

CustomDance: Customized 3D Dance Generation with Coarse-to-Fine Human-Centered Interactive Control

CustomDance:基于以人为中心的粗到细交互式控制的定制化3D舞蹈生成

Xulong Tang, Kaixing Yang, Xiaohu Guo, Prabhakaran Balakrishnan, Rawan Alghofaili

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 CustomDance是基于粗到细交互式控制的定制化3D舞蹈生成系统,通过三阶段流程实现AI辅助编舞,在定量和定性比较中优于基线,为用户提供全面控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01020 2026-08-04 cs.CR 新提交 75%

Inverting the Hidden: Unveiling Multimodal Privacy Leakage in Collaborative LVLM Inference

反转隐藏内容:揭示协作式大型视觉语言模型(LVLM)推理中的多模态隐私泄露

Shuaifan Jin, Zhibo Wang, Qiyuan Wang, Yiting Han, Yajie Zhou, Yuanfan Zhang, Jiahui Hu, Xiaoyi Pang

专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract)

AI总结 该研究针对协作式LVLM推理的隐私风险,提出RASR多模态重建攻击,可从深层LVLM隐藏状态恢复隐私信息,图像重建MSE降约50%、文本恢复token准确率达99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22794 2026-06-23 cs.RO 新提交 75%

UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models

UniFS:面向视觉-语言-动作模型的统一快慢层次架构

Lin Sun, Zhiwei Guan, Conglin Wang, Zihong Chen, Jianhai Yu, Zongsheng Li, Boyong He, Tao Sun, Jiale Cao, Lige Liu

机构 * Tianjin University(天津大学) Yiwu Research Institute of Fudan University(复旦大学义乌研究院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 提出UniFS统一快慢层次架构,通过分层更新频率、潜向量反转和多级监督策略,解决快慢双系统视觉-语言-动作模型中的频率困境和信息耦合问题,在LIBERO上实现98.3%成功率并提速2.1倍。

Comments Code is opensourced at https://github.com/linsun449/UniFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21398 2026-06-23 cs.RO 新提交 75%

BIT-Nav: Brain-Inspired Trajectory Memory for Embodied Navigation

BIT-Nav: 具身导航的脑启发轨迹记忆

Rithvik Jonna, Aakash Gurram, Man Namgung, Wyatt Mackey, Tinoosh Mohsenin

机构 * Johns Hopkins University(约翰霍普金斯大学) DEVCOM Army Research Laboratory(DEVCOM陆军研究实验室)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 提出BIT-Nav框架,通过轻量级学习轨迹记忆增强冻结的视觉-语言模型导航,解决长序列中帧采样稀疏问题,以恒定token成本编码结构化运动历史。

Comments Accepted to CVPR 2026: 2nd Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15021 2026-06-16 cs.RO 新提交 75%

Steering Autoregressive Vision-Language-Action Policies via Action Token Intervention

通过动作令牌干预引导自回归视觉-语言-动作策略

Jason Chan, Jonathan C. Kao

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 提出Token Steering方法,在推理时通过干预动作令牌空间动态引导VLA模型轨迹生成,无需训练或微调,显著提升家务操作任务成功率。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12366 2026-06-11 cs.RO 新提交 75%

APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies

APT: 动作专家预训练提升视觉-语言-动作策略的指令泛化能力

Kechun Xu, Zhenjie Zhu, Anzhe Chen, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Zhejiang Humanoid Robot Innovation Center(浙江人形机器人创新中心)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 针对连续动作专家模型对分布外语言指令泛化差的问题,提出APT两阶段训练方法,先预训练动作专家作为视觉-动作先验,再通过门控融合注入语言,显著提升泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09148 2026-06-09 cs.CL 新提交 75%

Explicit Representation Alignment for Multimodal Sentiment Analysis

显式表示对齐用于多模态情感分析

Baode Wang, Ziming Wang, Huacan Wang, Ronghao Chen, Biao Wu

机构 * AgentAlpha

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 针对多模态情感分析中表示不对齐问题,提出利用视觉-语言模型将视觉内容转为文本描述,结合语义标记选择和批量级均匀性正则化,实现跨模态对齐,在多个基准上取得最优性能。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23335 2026-07-28 cs.CV 新提交 74%

The Gate Always Closes: On Injecting Auxiliary Signals into Frozen Vision-Language Models

门总是关闭:关于向冻结的视觉语言模型注入辅助信号

Moshiur Farazi, Sameera Ramasinghe, Bekir Sait Ciftler, Mahbub Ahmed Turza, Shafin Rahman

机构 * University of Doha for Science and Technology(多哈科技大学) Pluralis Research(普卢拉利斯研究公司) North South University(南北大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

AI总结 研究视觉语言模型中辅助信号注入问题,发现优化器常使门控路径关闭。利用抑制现象,通过双曲视觉关系图的几何辅助损失正则化LoRA微调,实验表明该方法能保持关系准确率,还指出嵌入范数对齐及固定注入的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27484 2026-06-29 cs.CV 新提交 74%

Fine-tuning a multimodal large language model for clinician-grade autism behavioral scoring from short home videos

微调多模态大语言模型用于从短视频中对自闭症行为进行临床级评分

Mohammadmahdi Honarmand, Parnian Azizian, Aaron Kline, Kae Nurge, Zerin Nasrin Tumpa, Saimourya Surabhi, Kaitlyn Dunlap, Yang Qian, Ali Kargarandehkordi, Sameer Neupane, Peter Washington, Dennis P. Wall

机构 * Stanford University(斯坦福大学) University of Hawaii at Manoa(夏威夷大学马诺阿分校) University of California San Francisco(加利福尼亚大学旧金山分校)

专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV

AI总结 微调Gemini 2.5 Pro模型,从400个临床评分的家庭视频中提取30个行为特征,在99名儿童上实现与临床医生评分的一致性提升40%,并零样本达到53%的自闭症诊断F1提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19338 2026-06-18 cs.CV 新提交 74%

Beyond the Current Observation: Evaluating Multimodal Large Language Models in Controllable Non-Markov Games

超越当前观测:评估多模态大语言模型在可控非马尔可夫博弈中的表现

Shengyuan Ding, Xilin Wei, Xinyu Fang, Haodong Duan, Dahua Lin, Jiaqi Wang, Yuhang Zang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLM训练与架构 :multimodal large language model(title);分类 cs.CV

AI总结 提出RNG-Bench基准套件,通过配对记忆和3D迷宫两个博弈,评估多模态大模型在非马尔可夫环境中重建历史观测并据此行动的能力,发现主要错误源于遗忘而非决策,微调可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18472 2026-06-18 cs.CV 新提交 74%

Domain Generalizable Adaptation of 3D Vision-Language Models via Regularized Fine-Tuning

通过正则化微调实现可域泛化的3D视觉-语言模型适应

Sneha Paul, Zachary Patterson, Nizar Bouguila

机构 * Concordia University(康考迪亚大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

AI总结 提出ReFine3D框架,通过选择性层调优、多视图一致性、同义词提示及点渲染视觉监督等正则化策略,提升3D大语言模型在域泛化中的性能。

Comments Accepted at Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12843 2026-08-14 cs.CV cs.AI 新提交 73%

Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval

用于基于文本的行人异常检索的、带分歧感知重排序的异构视觉语言集成方法

Huu-An Vu, Cam Tu Tran Thi, Thanh Toan Le Ngo, Hoang Vo, Do Trung Hieu, Hieu Dinh Trung Pham, Khang Minh Le, Huy Minh Nhat Nguyen

机构 * Hanoi University of Science and Technology(河内科技大学) University of Information Technology, VNU-HCM(胡志明市国家大学信息技术大学) Vietnam National University, Ho Chi Minh City(胡志明市国家大学) VinUniversity Vietnamese-German University(越南德国大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究针对大规模基于文本的行人异常检索难题,提出带分歧感知重排序的异构视觉语言集成方法,在PAB基准上取得90.92% mAP等优异指标,验证了方案有效性。

Comments Accepted at the ECCV 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09176 2026-08-11 cs.CV cs.AI 新提交 73%

Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

并非所有视觉 token 都可安全移除:后果敏感型视觉 token 压缩

Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang

机构 * The University of Sydney(悉尼大学) Tongji University(同济大学) University of Surrey(萨里大学) Nankai University(南开大学) Cornell University(康奈尔大学) City University of Hong Kong(香港城市大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究针对视觉语言模型提出后果敏感型视觉 token 压缩方法,可在相同总 token 预算下降低高风险错误,还能减少代价加权错误并降低延迟,泛化性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03711 2026-08-05 cs.CV cs.CL cs.LG 新提交 73%

Attention is Case-Sensitive

注意力对字母大小写敏感

Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach

专题命中 VLM训练与架构 :vision-language model(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27066 2026-07-30 cs.CV cs.AI 新提交 73%

SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence

SciFigAlign:通过微调视觉内容与稿件证据的对齐来对科学图表进行评分

Chuanzhi Xu, Zihan Deng, Huiqi Liang, Chengkun Yue, Zhanlin Cui, Pengfei Ye, Weidong Cai

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文构建了含3857张科学图表的标注数据集,提出基于稿件证据的多模态评分器SciFigAlign,其在测试集上的MAE为0.3524,相对最佳LLM基准降低59%误差,证实需视觉与稿件证据的学习对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25527 2026-07-29 cs.CV cs.AI 新提交 73%

Argus-Unified: Towards A Compact and Economical Unified Model for Image Understanding and Generation

阿格斯统一模型:迈向紧凑且经济的图像理解与生成统一模型

Weiming Zhuang, Jiabo Huang, Jingtao Li, Zhizhong Li, Chen Chen, Sina Sajadmanesh, Lingjuan Lyu

机构 * Sony AI(索尼人工智能公司)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究旨在统一图像理解与生成,提出阿格斯统一模型,利用预训练视觉语言模型,引入混合视觉令牌,分两阶段训练,以最少数据和低成本实现良好性能,达当前最优,可作统一模型开发基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24560 2026-07-28 cs.CV cs.AI 新提交 73%

EgoPlay: Event-Triggered Video Editing for Egocentric Streams

EgoPlay:用于第一人称视角视频流的事件触发式视频编辑

Jinjie Mai, Gordon Guocheng Qian, Willi Menapace, Arpit Sahni, Chaoyang Wang, Ashkan Mirzaei, Runjia Li, Sergey Tulyakov, Bernard Ghanem, Peter Wonka, Rameen Abdal

机构 * Snap Inc.(Snap公司) King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究第一人称视角视频流编辑问题,提出EgoPlay,通过微调预训练模型,在单个端到端模型中联合学习事件识别等,构建数据集训练双向视频扩散编辑器,在Ego4D基准测试中表现出色,优于现有基线。

Comments Accepted to SIGGRAPH Asia 2026 as a Conference Paper. Project page: https://egoplay2026.github.io/egoplay

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17653 2026-07-21 cs.CV cs.LG cs.MM 新提交 73%

LFM: Leveraging Foundation Models for Source-Free Universal Domain Adaptation

LFM:利用基础模型进行无源通用域适应

Jing Li, Pan Liu, Meng Zhao, Wanli Xue, Yanhong Yang, Xu Cheng, Fan Shi, Jianhua Zhang, Qinghua Hu, Shengyong Chen

机构 * School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) Engineering Research Center of Learning-Based Intelligent System, Ministry of Education of the People’s Republic of China, Tianjin University of Technology(中华人民共和国教育部基于学习的智能系统工程研究中心,天津理工大学) School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) Engineering Research Center of City Intelligence and Digital Governance, Ministry of Education of the People’s Republic of China, Tianjin University(中华人民共和国教育部城市智能与数字治理工程研究中心,天津大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 研究在无源数据时将预训练源模型适应到目标域的问题,提出LFM框架,利用视觉语言模型计算相似度确定标签转移类型、识别未知样本,通过共识策略精炼伪标签训练目标模型,实验验证了该框架的有效性和优越性。

Comments Accepted by IEEE Transactions on Multimedia (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏