arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 511 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 511 篇

2608.02704 2026-08-05 cs.AI cs.LO q-bio.NC 新提交 57%

Predictive Set Theory: A Generative Framework for Cognitive Architecture with Operationalized Core Mechanisms

预测集合论:具有可操作核心机制的认知架构生成框架

Yiyang Yu

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出预测集合论(PST)这一形式生成框架,从第一性原理重构认知架构,解决经典认知问题,并确立其原创性与完整性。

Comments 103 pages. This preprint establishes the theoretical framework of Predictive Set Theory, providing a generative design specification for cognitive architecture. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02660 2026-08-05 cs.CY cs.AI cs.HC 新提交 57%

AI Alignment and Fiduciary Obligation

AI对齐与受托义务

Benjamin Lange

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出将受托理论应用于长期AI助手部署,以开发者对用户负有的忠诚、注意、善意和坦诚四项受托义务为基础构建AI对齐标准,为AI对齐研究提供新视角。

Comments 10 pages, 1 table. Accepted at the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00279 2026-08-04 eess.IV cs.CV 新提交 57%

Learning to See Locally and Align Clinically with Pathology Semantics for Radiology Report Generation

学习局部感知并与病理学语义临床对齐的放射学报告生成方法

Xuan Cuong Ngo

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对放射学视觉-语言模型的图像-文本对齐缺陷,提出病理学感知对齐框架PALM,结合共享病理学原型与掩码证据建模,在多数据集上提升报告生成与异常鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00056 2026-08-04 eess.SP cs.LG eess.IV 新提交 57%

Domain-Generalized Adaptive Semantic Communication for Collaborative Perception

面向协同感知的域泛化自适应语义通信

Fan Gao, Youzheng Wang, Ning Ge

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 提出域泛化语义通信框架RSTA,通过跨域原型对齐等技术解决车路协同感知中观测域偏移与信道损坏耦合退化问题,在多基准测试中取得AP指标提升且部署开销极低。

Comments Accepted by IEEE ICCC 2026. 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01979 2026-08-04 cs.CV cs.CL 新提交 57%

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs

ET-Prune:面向文本丰富型多模态大语言模型的视觉 token 剪枝的证据感知动态预算分配

Zizhong Ding, Junxian Li, Kai Liu, Shaoqiu Zhang, Xiao Xiao, Linghe Kong, Yulun Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 ET-Prune 是一种无需训练的视觉 token 剪枝框架,通过证据分配实现动态预算,在文本丰富的多模态任务中,于约一半 token 保留量下,在 OCRBench-v2、MMBench v1.1 等基准上取得优于基线的性能,实现了质量与成本的良好平衡。

Comments Code and supplementary material is at https://github.com/Labyrinth0419/ET-Prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01437 2026-08-04 cs.AI 新提交 57%

Beyond Routing Saturation: A Long-Horizon Class-Incremental Perspective on Expert Routing in Multimodal Continual Instruction Tuning

超越路由饱和:多模态持续指令调优中专家路由的长程类增量视角

Huiyu Yi, Yongqi Xu, Bogang Zhang, Dunwei Tu, Xu Zhiming, Zhen-Hao Xie, Baile Xu, Furao Shen

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 该研究针对多模态持续指令调优中专家路由的任务识别问题,构建含34个任务的FLEX基准,提出MCIL框架,适配CIL方法后使LoRA匹配和MacroScore分别提升最高16.3个百分点、4.6个点

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01397 2026-08-04 cs.RO cs.CV 新提交 57%

SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space

SG-WAM:几何感知策略空间中的自引导世界建模

Ruiteng Zhao, Zhengshen Zhang, Yue Su, Wenshuo Wang, Jiahui Li, Zhiyuan Yang, Francis E. H. Tay, Marcelo H. Ang, Haiyue Zhu

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 SG-WAM是自引导的几何感知世界动作模型框架,通过策略衍生空间联合优化动态预测等,在LIBERO等数据集上实现高成功率,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01392 2026-08-04 cs.CV 新提交 57%

FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision

FineMoLA:基于片段级监督的细粒度动作-语言对齐研究

Tongyan Wang, Zhengyuan Li, Muhan Lin, Shengyang Luo, Yifan Shen, Aniket Bera, Baijian Yang, Yingjie Victor Chen

机构 * Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 针对现有动作-语言数据集仅提供片段级监督导致细粒度对齐不足的问题,提出弱监督框架FineMoLA,将动作-语言对齐建模为最优传输问题,在SnapMoGen上的实验显示其动作-文本定位性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28463 2026-07-31 cs.CV 新提交 57%

VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding

VisualRouter:面向长视频理解的查询驱动视觉采样

Haiyue Zhang, Yi Bin, Xun Jiang, Zeyu Ma, Duo Peng, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出无训练即插即用框架VisualRouter,通过将查询分为全局或局部并采用对应采样策略,提升了大型视觉语言模型的长视频理解性能,在多个基准数据集上优于均匀采样及现有无训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27917 2026-07-31 cs.AI 新提交 57%

One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

统一多语言多模态的LVLM安全对齐:一个通用锚点

Enyi Shi, Fei Shen, Chuancheng Shi, Linxia Zhu, Shuyi Miao, Jinhui Tang, Tat-Seng Chua

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 针对LVLM面临的多语言多模态复合攻击防御难题,提出MLS-Neurons驱动的跨维度安全对齐框架,仅更新约0.03%参数实现安全监督迁移,在多语言多模态安全基准上性能优于SOTA且保留通用实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27779 2026-07-31 cs.CV 新提交 57%

CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography

CXR-Retrieve:胸部X线摄影中的组合式文本到图像检索

Tomer Erez, Moshe Kimhi, Chaim Baskin, Ehud Rivlin

机构 * Technion – Israel Institute of Technology(以色列理工学院) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对胸部X线检索的目标不匹配问题,提出CXR-Retrieve基准与标签感知对比微调方法,在双病理组合和否定查询的Precision@5上较CXR-CLIP分别提升8.5和22.0个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26885 2026-07-30 cs.CV 新提交 57%

SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation

SCALPEL:基于大语言模型驱动的编码器学习的医学视觉-语言语义跨模态对齐框架

Yunzhan Fu, Enyu Bao, Xiangyu Shen, Yihao Wu, Chunbo Jiang, Fangli Guan, Liqi Yan

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV

AI总结 针对现有医学视觉-语言预训练的三大瓶颈,本文提出SCALPEL框架,通过临床报告对比微调、非对称对齐策略及解剖-否定感知目标,在三大医学基准上实现了多项任务的最优性能。

Comments 14 pages, 3 figures, accepted by PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24424 2026-07-28 cs.CV 新提交 57%

MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning

MAViE:用于细粒度视觉感知和高效多模态推理的多尺度自适应视觉编码器

Shaofei Lei

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型问题,提出多尺度自适应视觉编码器MAViE,通过融合多层特征、进行令牌路由及引入相关策略,在统一框架下实验,减少视觉令牌数量,提升多任务分数并降低处理时间,还给出模型设计与评估协议。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23631 2026-07-28 cs.CV 新提交 57%

PathSelect: Sequential Token Selection for Whole Slide Pathology

PathSelect:用于全切片病理学的序列令牌选择

Jingzhi Chen, Landi He, Zehong Chen, Peihang Wu, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对全切片图像给视觉语言模型带来的计算瓶颈,提出解耦路由框架PathSelect,将令牌剪枝重构成序列选择过程,训练时引入方差保持噪声门等,推理时模块分离,有效减少令牌数,提高准确率并优于基于采样的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23600 2026-07-28 cs.CV 新提交 57%

ConFusion: Continuous Fusion Space Learning for Fine-Grained Controllable Infrared and Visible Image Fusion

ConFusion:用于细粒度可控红外与可见光图像融合的连续融合空间学习

Guo Yurong, He Yufei, Li Yonghao, Chang Dongliang, Zhang Ke, Ma Zhanyu

机构 * North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究可控红外与可见光图像融合,提出ConFusion框架,通过高斯条件空间感知调制学习连续融合空间,采用双分支架构及相关模块实现实例级细粒度可控融合,实验证明其在融合质量和下游任务上达先进水平。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23046 2026-07-28 cs.CV 新提交 57%

Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs

用于高分辨率多模态大语言模型中高效视觉令牌剪枝的结构化冗余建模

Jouwon Song, Woohyeong Kim, Kyeongbo Kong

机构 * LG Electronics(LG电子) Pusan National University(釜山国立大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对高分辨率多模态大语言模型视觉令牌爆炸致延迟瓶颈问题,提出单向前向剪枝器SFPruner,通过语义引导岭杠杆方案和基于排名的方向掩码两个互补机制,在单次前向传递中实现冗余感知重要性选择,有效减少令牌选择时间并保持性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22078 2026-07-27 cs.CV 新提交 57%

CommandLM: Data driven behavior level descriptor for ego vehicles

CommandLM:用于自动驾驶车辆的数据驱动行为级描述符

Boris Tokic, Constantin Selzer, Fabian B. Flohr

机构 * Munich University of Applied Sciences(慕尼黑应用技术大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对自动驾驶系统中可解释行为级决策需求,提出多模态大语言模型CommandLM,通过融合多传感器数据生成行为描述,经特定训练和适配器处理,实验表现优于基线,人工评估显示其输出可助力行为审计,实现高效透明的行为级理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22043 2026-07-27 cs.CL cs.CV 新提交 57%

Scaling Native Multimodal Pre-Training From Scratch

从零开始扩展原生多模态预训练

Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) LLM Department, Tencent(腾讯大语言模型部)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究在固定计算预算下训练基于Transformer的视觉语言模型的最优模型大小和token数量,发现语言和多模态目标扩展行为不同,推导效率前沿,还表明原生多模态预训练能促进跨模态转移,为扩展多模态基础模型奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21417 2026-07-24 cs.CV 新提交 57%

Towards Privacy-Preserving Federated Prompt Tuning under Data Heterogeneity: A Subspace-Decomposed Expert Approach

面向数据异构性下的隐私保护联邦提示调优:一种子空间分解专家方法

Yuhua Wang, Xiaodong Li, Yihao Guo, Yuxiang Jia, Qinnan Zhang, Yifan Sun, Hainan Zhang, Yongxin Tong, Zhiming Zheng

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Center for the Applied Statistics, School of Statistics, Renmin University of China(中国人民大学统计学院应用统计中心) School of Computer Science & Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Software, Beihang University(北京航空航天大学软件学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.CV

AI总结 研究针对数据异构性下的隐私保护联邦提示调优问题,提出FedSEPT方法,采用子空间分解专家建模及实例感知专家融合技术,在11个异构基准实验中,于相同隐私约束下,该方法在局部适配和全局泛化间实现更好权衡。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20981 2026-07-24 cs.AI 新提交 57%

Beyond Independent Optimization: Compression, MoE Routing, and Quantization Interactions in Multimodal Edge Intelligence

超越独立优化:多模态边缘智能中的压缩、混合专家路由和量化交互

Jay Gor, Karm Dave, Akshita Abrol, Rajesh Gupta, Sudeep Tanwar, Zhengkui Wang

机构 * Nirma University(尼玛大学) Singapore Institute of Technology(新加坡理工学院) Marwadi University(马尔瓦迪大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 研究多模态边缘智能中高效推理受多种因素限制,回顾相关模型进展,指出技术间相互影响不能独立优化,介绍关键设计权衡,引入视频MoE模型诊断方法,强调多方面开放研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20511 2026-07-24 cs.AI 新提交 57%

SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning

SiGMA:用于多模态持续指令微调的符号引导合并与适配

Keonhee Park, Gunhee Kim

机构 * Seoul National University(首尔国立大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 研究多模态持续指令微调中存在的问题,提出SiGMA框架,通过训练时符号引导自适应调优、推理时符号引导合并减轻负面干扰,在相关基准实验中显著减少干扰且性能优于现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17712 2026-07-21 cs.AI 新提交 57%

Learning to Detect Cross-Modal Negation: An Analysis of Latent Representations and an Attention-Based Solution

学习检测跨模态否定:潜在表示分析与基于注意力的解决方案

Ali AbuSaleh, Leon Hammerla, Alexander Mehler

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 研究跨模态否定检测难题,提出新型跨模态注意力架构,分析发现文本与视觉否定的不对称性,结合自监督视频表示推进时间否定建模,为多模态系统学习语义对齐表示提供新方法。

Comments This manuscript is an accepted version of the article (published at ICNLP2026). Published in IEEE Xplore, DOI:10.1109/ICNLP69856.2026.11527861 document: https://ieeexplore.ieee.org/abstract/document/11527861

Journal ref 2026 8th International Conference on Natural Language Processing (ICNLP), Xi'an, China, 2026, pp. 613-622

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15661 2026-07-20 cs.CV 新提交 57%

Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All Approach

用于医学视觉语言模型的模型合并:一个基准和一种赢家通吃的方法

Lichao Mou, Shilan Zhang, Chunlei Li, Bingcong Yan, Jingliang Hu, Yilei Shi, Shengwu Xiong, Xiao Xiang Zhu, Lei Li, Yaxiong Chen

机构 * Wuhan University of Technology(武汉理工大学) Technical University of Munich(慕尼黑工业大学) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究医学LVLMs的模型合并,提出涵盖多种成像模态和临床任务类型的MergeMedBench基准,评估现有合并方法,提出赢家通吃方法,该方法简单且无超参数,优于现有方法,为LoRA合并提供新视角和实用基线。

Comments Project Page: https://github.com/MedAI-T/MergeMedBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13931 2026-07-16 cs.CV 新提交 57%

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Macau(澳门大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13395 2026-07-16 cs.LG 新提交 57%

Self-Improving is Often Sudden: Enlightenment-style Finetuning for Large-Scale Models

自我提升往往是突然的:大规模模型的顿悟式微调

Jing-Xiao Liao, Tianwei Zhang, Yu-Hao Jiang, Feifei Zhang, Hang-Cheng Dong, Feng-Lei Fan

机构 * School of Computer Science and Artificial Intelligence, Guangdong University of Education(广东第二师范学院计算机科学与人工智能学院) School of Instrumentation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学仪器科学与工程学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 研究大规模模型自主提升,提出顿悟式无训练后微调范式,通过修改关键模块捷径且不更新权重,针对大语言和视觉语言模型有不同实例化,实验证明有效解锁预训练网络潜力,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12557 2026-07-15 cs.CV 新提交 57%

Gaussian Mixture Modeling for Event-Aware Visual Allocation in Long Video Understanding

用于长视频理解中事件感知视觉分配的高斯混合模型

Yifan Lu, Ziqi Zhang, Chunfeng Yuan, Jun Gao, Bing Li, Weiming Hu

机构 * Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information, CASIA(中国科学院自动化所多模态信息超智能安全北京市重点实验室) State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Hello Group(未知(保留英文)) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对长视频理解中视觉分配问题,提出GMM-EVA方法,利用高斯混合模型建模事件级结构,采用差异化分配策略,在多个长视频基准实验中显著优于均匀采样,以约一半视觉令牌预算达可比性能,凸显高效性。

Comments accepted at PRCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11886 2026-07-14 cs.CV 新提交 57%

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

读回:预训练的多模态语言模型是文本到图像生成的零样本奖励模型

Runhui Huang, Qihui Zhang, Zhe Liu, Yu Gao, Jie Wu, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) ByteDance Seed(字节跳动Seed) Peking University(北京大学)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 研究提出SpectraReward将预训练多模态语言模型转为图像生成强化学习奖励模型,用图像条件提示对数似然作奖励,还引入Self-SpectraReward形成闭环框架。经广泛实验验证,二者能提升生成性能,表明奖励-策略对齐是关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11199 2026-07-14 cs.CV 新提交 57%

DynEval: Holistic Evaluations of T2I Generative Models in the Wild

DynEval:对自然环境下的文本到图像生成模型进行全面评估

Shyam Marjit, Dheeraj Baiju, Anuj Shikarkhane, Akhil Sakthieswaran, Sayak Paul, Anirban Chakraborty

机构 * Indian Institute of Science(印度科学研究所) Hugging Face(拥抱脸)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对文本到图像生成模型评估难题,提出DynEval动态评估框架,通过构建两个数据集,利用课程学习策略微调评估器,在多基准测试中与人类判断相关性更高,可对多个T2I模型进行细粒度分析。

Comments Accepted at ECCV 2026. Project page: https://vcl-iisc.github.io/dyneval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10860 2026-07-14 cs.CV 新提交 57%

AU-Guided Synthetic Video Generation for Micro-Expression Recognition

用于微表情识别的基于动作单元引导的合成视频生成

Pei-Sze Tan, Sailaja Rajanala, Yee-Fan Tan, Raphael C. -W. Phan, Huey-Fang Ong

机构 * CyPhi AI Lab, Monash University Malaysia(马来西亚莫纳什大学CyPhi人工智能实验室)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 针对现有微表情识别数据集的局限,提出基于动作单元引导生成合成微表情数据集EquiME的方法,经实验其在跨数据集微表情识别任务中性能有竞争力,且在不同架构中变化低,为微表情识别研究提供了新资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10130 2026-07-14 cs.CV 新提交 57%

TextGaze: Prompting Gaze Target Estimation with Textual Scene Cues

TextGaze:利用文本场景线索提示注视目标估计

Junhui She, Fei Wang, Kun Li, Yiqi Nie, Yuxin Liu, Zhangling Duan, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui University(安徽大学) United Arab Emirates University(阿联酋大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究注视目标估计问题,提出TextGaze统一跨模态架构,利用大型视觉语言模型平衡多分支与简化设计范式,通过冻结编码器提取视觉特征、设计融合模块等进行联合预测,在多数据集上评估有竞争力,为传统设计提供简化替代。

Comments Accepted by IJCAI 2026. All contents are available at: https://github.com/idremo/TextGaze-IJCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏