Minimalist Compliance Control
极简合规控制
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
AI总结 极简合规控制通过仅使用电机电流或电压信号实现无需力传感器的合规控制,适用于多种机器人和规划方法。
Comments Project website: https://minimalist-compliance-control.github.io/
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
极简合规控制
专题命中 幻觉与鲁棒性 :vision-language model(abstract)
AI总结 极简合规控制通过仅使用电机电流或电压信号实现无需力传感器的合规控制,适用于多种机器人和规划方法。
Comments Project website: https://minimalist-compliance-control.github.io/
U-VLM:用于报告生成的分层视觉语言模型
机构 * Medical Image Insights Co. Ltd.(医疗影像洞察有限公司) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV
AI总结 U-VLM通过分层视觉语言建模在CT-RATE和AbdomenAtlas 3.0上实现了最先进的报告生成性能,展示了精心设计的视觉编码器预训练的重要性。
Hepato-LLaVA:一种基于稀疏拓扑包注意力机制的专家多模态大语言模型,用于肝细胞病理分析的整张图像
机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学) ; Department of Pathology, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(pathology department, 国家癌症中心/国家癌症临床研究中心/癌症医院, 中国医学科学院和北京协和医学院)
专题命中 VLM训练与架构 :LLaVA(title,abstract);MLLM(title);分类 cs.CV
AI总结 Hepato-LLaVA通过稀疏拓扑包注意力机制和HepatoPathoVQA数据集,实现肝细胞病理分析的高精度诊断与描述。
Comments 10 pages, 3 figures
MOON: 基于生成式多模态大语言模型的电商产品理解多模态表示学习
机构 * Alibaba Group(阿里巴巴集团)
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 MOON通过生成式多模态大语言模型改进电商产品理解的多模态表示学习,引入引导的MoE模块、核心语义区域检测和负采样策略,提升零样本性能和泛化能力。
Comments Accepted by WSDM 2026 (oral). 11 pages, 9 figures
视觉-语言模型是否会泄露所学内容?基于自适应令牌加权的模型逆向攻击
机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学) ; University of Maryland, College Park(马里兰大学学院公园分校)
专题命中 VLM训练与架构 :vision-language model(title,abstract);grounding(abstract);分类 cs.LG
AI总结 本研究提出SMI-AW攻击方法,揭示视觉-语言模型在隐私泄露方面的脆弱性,通过自适应令牌加权提升图像重建效果,验证了VLMs在敏感领域中的隐私风险。
Comments Accepted to CVPR 2026
MLLM-4D: 向基于视觉的空间-时间智能迈进
机构 * University of Macau(澳门大学) ; Xi'an Jiaotong University(西安交通大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; GVC Lab, Great Bay University(大湾大学GVC实验室)
专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV
AI总结 MLLM-4D通过改进的数据筛选和训练策略,实现了从2D输入中强大的空间-时间理解和推理能力。
傅里叶-注意力表示学习:一种引导少样本泛化的视觉-语言模型框架
机构 * Vietnamese German University(越南德语大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
AI总结 本文提出FARL框架,通过傅里叶分析解缠视觉表示,提升视觉-语言模型在少样本场景下的泛化能力。
通过概念空间对齐实现统一的视觉-语言建模
机构 * University of Edinburgh(爱丁堡大学) ; FAIR at Meta(Meta公司FAIR团队)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 通过概念空间对齐实现统一的视觉-语言建模,V-SONAR在多语言和多模态任务中超越现有模型。
Comments ICLR 2026
MOSAIC:一个用于跨范式比较和评估同质和异质多智能体RL、LLM、VLM和人类决策者的统一平台
机构 * School of Optics and Photonics, Beijing Institute of Technology, Beijing 100081, China(北京理工大学光学工程学院) ; School of Automation Science and Electrical Engineering, Beihang University, Beijing 100191, China(北京航空航天大学自动化科学与电气工程学院) ; Faculty of Science, Ain Shams University, Cairo, Egypt(爱思唯命大学科学学院)
专题命中 VLM训练与架构 :VLM(title);vision-language model(abstract);分类 cs.AI、cs.LG
AI总结 MOSAIC是一个开源平台,通过统一接口和跨范式评估框架,支持在相同环境中比较不同决策范式的智能体,促进可重复的跨领域研究。
Comments 13 pages, 2 figures
AgilePruner: 一种针对大视觉-语言模型中自适应视觉标记剪枝的实证研究
机构 * Pusan National University(釜山国立大学) ; LG Electronics(LG电子)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG
AI总结 AgilePruner通过实证研究揭示了基于注意力和多样性的视觉标记剪枝方法的优劣,并提出了一种改进的自适应剪枝机制。
Comments Accepted to ICLR 2026
Prune2Drive: 一种用于自动驾驶中加速视觉-语言模型的即插即用框架
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Carnegie Mellon University(卡内基梅隆大学) ; Sichuan University(四川大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; The University of Hong Kong(香港大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
AI总结 Prune2Drive通过视觉令牌修剪框架在自动驾驶中加速视觉-语言模型,实现显著速度提升和内存节省,性能影响小。
Comments Accepted by CVPR 2026
TokenCom: 一种用于多模态和多任务令牌通信的视觉-语言模型
机构 * Hunan Provincial Key Laboratory of Intelligent Computing and Language Information Processing, Hunan Normal University(湖南省级智能计算与语言信息处理重点实验室,湖南师范大学) ; School of Information Science and Engineering, Hunan Normal University(信息科学与工程学院,湖南师范大学) ; Changsha Social Laboratory of Artificial Intelligence, Hunan University of Technology and Business(长沙人工智能社会实验室,湖南工业大学) ; School of Computer Science, Hunan University of Technology and Business(计算机科学学院,湖南工业大学) ; Department of Computer Science, Brunel University London(伦敦布鲁内尔大学计算机科学系) ; National Mobile Communications Research Laboratory, Southeast University(东南大学国家移动通信研究中心) ; Department of Electrical and Computer Engineering, University of Houston(电子与计算机工程系,休斯顿大学)
专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract);分类 cs.CV
AI总结 TokenCom提出了一种新的视觉-语言模型框架TaiChi,通过双视觉分词器和双向注意力网络提升多模态和多任务令牌通信的性能。
PointAlign:用于3D视觉-语言模型的特征级对齐正则化
机构 * University of Science and Technology of China(中国科学技术大学) ; Fuzhou University(福州大学) ; Fudan University(复旦大学) ; Nanjing University(南京大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
AI总结 PointAlign通过特征级对齐正则化提升3D视觉-语言模型的几何信息保留与任务性能
Comments CVPR 2026 Accepted
动态令牌重加权用于鲁棒的视觉-语言模型
机构 * Stony Brook University(石溪大学) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV
AI总结 DTR通过优化KV缓存动态调整视觉令牌权重,提升视觉-语言模型对多模态劫持攻击的鲁棒性,同时保持模型性能。
Comments CVPR 2026
StructXLIP: 通过多模态结构线索增强视觉-语言模型
专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI
AI总结 StructXLIP通过引入多模态结构线索提升视觉-语言模型的跨模态检索性能。
Comments Accepted by CVPR 2026
学习如何注视:面向3D CT的疾病感知视觉-语言预训练
机构 * Computer Vision Group, University of Freiburg, Germany Adaptive \& Agentic AI (A3) Lab, Aarhus University, Denmark Department of Radiology, Medical Center -- University of Freiburg, Germany Chair of Algorithms ; Data Structures, University of Freiburg, Germany ELLIS Institute Finland School of Electrical Engineering, Aalto University, Finland
专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG
AI总结 本文提出了一种面向3D CT的疾病感知视觉-语言预训练模型,通过对比预训练和基于提示的疾病监督,实现了文本到图像检索、疾病分类及内扫描片段定位的统一模型。
超越8位:HDR-UGC视频的主观和客观质量评估
机构 * Laboratory for Image and Video Engineering (LIVE), UT Austin(图像与视频工程实验室(LIVE),得克萨斯大学奥斯汀分校) ; Google/YouTube(谷歌/YouTube)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 本文提出HDR-Q,首个针对HDR-UGC视频的多模态大语言模型,通过HDR感知编码器和HAPO框架实现超越8位的高质量视频评估。
RAISE:基于需求的进化精炼用于无训练文本到图像对齐
机构 * Department of ECE, University of Alberta, Canada(阿尔伯塔大学电子工程系) ; Huawei Technologies, Canada(华为技术有限公司)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 RAISE是一种无训练、需求驱动的进化框架,通过动态调整生成过程实现高效且通用的文本到图像对齐。
Comments CVPR 2026
Seek-CAD: 一种基于局部推理的自优化生成模型用于3D参数化CAD设计
机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) ; School of Information and Intelligent Science, Donghua University(信息与智能科学学院,东华大学)
专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 Seek-CAD通过结合视觉和链式思维反馈,利用本地开源模型生成3D参数化CAD模型,提升生成效率和实用性。
Comments Accepted to ICLR 2026. The datatset has been released publicly and can be acessed in https://github.com/Sunny-Hack/Seek-CAD
SemHiTok:一种通过语义引导的层次代码本实现的统一图像分词器,用于多模态理解和生成
机构 * Sun Yat-sen University(中山大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室) ; University of Hong Kong(香港大学) ; South China University of Technology(华南理工大学)
专题命中 VLM训练与架构 :LLaVA(abstract);MLLM(abstract);分类 cs.CV、cs.AI
AI总结 SemHiTok通过语义引导的层次代码本实现统一图像分词器,提升多模态理解和生成性能。
Comments ICLR 2026
基于事件的帧选择用于有效长视频理解
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学) ; College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
AI总结 本文提出基于事件的帧选择方法,通过分层事件感知流程提升长视频理解的效率和效果。
MARS: 通过自适应排名搜索实现多模态收敛的统一
机构 * University of Michigan(密歇根大学) ; NVIDIA(英伟达)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG
AI总结 MARS通过自适应排名搜索优化多模态大语言模型微调,平衡训练动态并提升性能。
Comments 17 pages; Project Page: this https URL: https://minkyoungcho.github.io/mars/
UniView: 通过统一参考特征从单张图像增强新颖视角合成
机构 * Tianjin University(天津大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 UniView通过统一参考特征提升单张图像新颖视角合成性能,采用检索增强系统和多模态大语言模型选择参考图像,并结合解耦三重注意力机制提高合成效果。
重新审视在跨模态不匹配下的LVLMs视觉标记减少
专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV
AI总结 本文提出VisionDrop方法,通过视觉-only修剪框架减少LVLMs中的视觉标记,无需额外训练,提升推理效率并保持性能。
Comments AAAI 2026
SFCo-Nav: 通过慢LLM与快速属性图对齐的协作实现高效的零样本视觉语言导航
机构 * Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(上海导航与位置基于服务重点实验室,上海交通大学)
专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)
AI总结 SFCo-Nav通过慢LLM与快速属性图对齐的协作,实现了高效的零样本视觉语言导航,显著提升效率并降低计算成本。
Comments Accepted by 2026 IEEE International Conference on Robotics and Automation (ICRA)
DragFlow: 通过基于区域的监督释放DiT先验以实现拖拽编辑
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(国立新加坡大学)
专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG
AI总结 DragFlow通过基于区域的监督利用FLUX先验,改进基于拖拽的图像编辑效果,实现对点式和区域式基线的超越。
Comments Accepted by ICLR 2026
EditReward:一种用于指令引导图像编辑的人类对齐奖励模型
机构 * University of Waterloo(滑铁卢大学) ; McGill University(麦吉尔大学) ; Independent(独立研究者)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI
AI总结 EditReward是一种基于人类偏好的奖励模型,通过大规模标注数据提升图像编辑任务的质量与性能,展示了在指令引导图像编辑中的卓越对齐能力。
Comments Accepted by ICLR 2026. Project Page: https://tiger-ai-lab.github.io/EditReward
像放射科医生一样推理:用于可验证报告生成的推理链和强化学习
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI
AI总结 BoxMed-RL通过推理链和强化学习生成可验证的放射科报告,提升报告的准确性和可解释性。
多模态强化学习中的token感知聚焦
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Nanjing University(南京大学) ; Wuhan University(武汉大学)
专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出VPPO算法,通过token感知优化提升多模态强化学习的视觉推理能力。
Comments Accepted by ICLR 2026, project page: https://github.com/huaixuheqing/VPPO-RL
NERFIFY:一个将NeRF论文转化为代码的多智能体框架
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV
AI总结 NERFIFY通过多智能体框架将NeRF论文转化为可训练的代码,提升复现效率和质量。
Comments Accepted to CVPR 2026. Project page: https://seemandhar.github.io/NERFIFY/