arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-08 至 2026-04-08 共收录 63 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 15 篇

2511.00181 2026-04-08 cs.CV cs.CR 57%

From Evidence to Verdict: An Agent-Based Forensic Framework for AI-Generated Image Detection

从证据到判决:一种基于智能体的AI生成图像检测框架

Mengfei Liang, Yiting Qu, Yukun Jiang, Michael Backes, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA亥姆霍兹信息安全中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出AIFo框架,通过多智能体协作进行多阶段取证分析,整合逆向图像搜索、元数据提取等工具,实现高准确率的AI生成图像检测。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 4 篇

2604.05793 2026-04-08 cs.CR cs.CV 79%

BodhiPromptShield: Pre-Inference Prompt Mediation for Suppressing Privacy Propagation in LLM/VLM Agents

BodhiPromptShield: 预推理提示调解用于抑制LLM/VLM代理中的隐私传播

Bo Ma, Jinsong Wu, Weiqi Yan

机构 * Auckland University of Technology(奥克兰理工大学) University of Chile(智利大学)

专题命中 文档图表理解 :VLM(title,abstract);分类 cs.CV

AI总结 本文提出BodhiPromptShield框架,通过检测敏感片段、路由和延迟恢复来抑制LLM/VLM代理中的跨阶段隐私传播,实验显示在控制提示隐私基准(CPPB)上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04997 2026-04-08 cs.IR cs.AI cs.CL cs.CV cs.LG 75%

Evaluation of Embedding-Based and Generative Methods for LLM-Driven Document Classification: Opportunities and Challenges

嵌入式与生成方法在LLM驱动文档分类中的评估:机遇与挑战

Rong Lu, Hao Liu, Song Hou

专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文比较了基于嵌入和生成模型在地学技术文档分类中的表现,发现增强的生成视觉-语言模型在零样本准确率上表现更优,但监督微调对训练数据不平衡敏感。

Comments Accepted at the IMAGE'25 Workshop (PCW-11), Society of Exploration Geophysicists (SEG). Published version available at https://doi.org/10.1190/image2025-w11-03.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14998 2026-04-08 cs.CV 57%

FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR

FinCriticalED:一个用于金融事实级OCR的视觉基准

Yueru He, Xueqing Peng, Yupeng Cao, Yan Wang, Lingfei Qian, Haohang Li, Yi Han, Shuyao Wang, Ruoyu Xiang, Fan Zhang, Zhuohan Xie, Mingquan Lin, Prayag Tiwari, Jimin Huang, Guojun Xiong, Sophia Ananiadou

机构 * Columbia University(哥伦比亚大学) Stevens Institute of Technology(史蒂文斯理工学院) Georgia Institute of Technology(佐治亚理工学院) New York University(纽约大学) University of Minnesota(明尼苏达大学) Halmstad University(哈尔姆斯塔德大学) Harvard University(哈佛大学) University of Manchester(曼彻斯特大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出FinCriticalED基准,用于评估OCR和视觉语言模型在金融关键证据上的保真度,发现数值和货币单位是最脆弱的事实类型,揭示了词汇准确性和事实可靠性之间的差距。

Comments Xueqing Peng: Corresponding-Author

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05038 2026-04-08 cs.CL 50%

Guided Query Refinement: Multimodal Hybrid Retrieval with Test-Time Optimization

引导查询细化:多模态混合检索与测试时优化

Omri Uzan, Asaf Yehudai, Roi pony, Eyal Shnarch, Ariel Gera

机构 * Stanford University(斯坦福大学) IBM Research(IBM研究院) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 文档图表理解 :vision-language model(abstract)

AI总结 本文提出引导查询细化方法,通过测试时优化提升多模态检索性能,使视觉中心模型在效率和性能上达到更优平衡。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 7 篇

2511.18359 2026-04-08 cs.CV 83%

TRANSPORTER: Transferring Visual Semantics from VLM Manifolds

TRANSPORTER:从VLM流形转移视觉语义

Alexandros Stergiou

机构 * University of Twente, NL(荷兰特温特大学)

专题命中 GUI与屏幕智能体 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 本文提出TRANSPORTER方法,通过logits-to-video任务生成视频,揭示VLM预测背后的规则,为模型可解释性提供新方向。

Comments Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Project page: https://alexandrosstergiou.github.io/TRANSPORTER

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05014 2026-04-08 cs.RO cs.AI cs.CV 73%

StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing

StarVLA:一种积木式代码库,用于视觉-语言-动作模型开发

StarVLA Community

机构 * Von Neumann Institute, HKUST(香港科技大学冯·诺依曼研究所)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 StarVLA通过模块化架构、可重用训练策略和统一评估接口,解决VLA方法碎片化问题,提升可复现性和跨架构兼容性。

Comments Open-source VLA infra, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26788 2026-04-08 cs.RO cs.CV 70%

ReMemNav: A Rethinking and Memory-Augmented Framework for Zero-Shot Object Navigation

ReMemNav:一种重新思考和记忆增强的零样本物体导航框架

Feng Wu, Wei Zuo, Wenliang Yang, Jun Xiao, Yang Liu, Xinhua Zeng

机构 * Fudan University(复旦大学) Tongji University(同济大学)

专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 ReMemNav通过整合全景语义先验和事件记忆,改进了零样本物体导航中的空间推理和决策,提升了成功率和探索效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10610 2026-04-08 cs.CR cs.AI 70%

LaSM: Layer-wise Scaling Mechanism for Defending Pop-up Attack on GUI Agents

LaSM:用于防御GUI代理中弹出攻击的分层缩放机制

Zihe Yan, Jiaping Gui, Zhuosheng Zhang, Gongshen Liu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出LaSM机制,通过分层放大关键层的注意力和MLP模块,提升模型对任务相关区域的对齐性,有效防御弹出攻击,同时不影响模型整体能力。

Comments Accepted by CVPR-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05642 2026-04-08 cs.CR 50%

T2T: Captioning Smartphone Activities Using Mobile Traffic

T2T: 利用移动流量进行智能手机活动描述

Jiyu Liu, Yong Huang, Yanzhao Lu, Yun Tie, Wanqing Tu

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出T2T系统,通过加密移动流量生成智能手机活动描述,解决语义鸿沟和文本标注不足问题,实现高可读性文本生成。

Comments Accepted by IEEE International Joint Conference on Neural Networks 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05525 2026-04-08 cs.GR 50%

CrowdVLA: Embodied Vision-Language-Action Agents for Context-Aware Crowd Simulation

CrowdVLA: 一种用于情境感知人群模拟的具身视觉-语言-动作代理

Juyeong Hwang, Seong-Eun Hong, Jinhyun Kim, JaeYoung Seon, Giljoo Nam, Hanyoung Jang, HyeongYeop Kang

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 CrowdVLA通过引入视觉-语言-动作代理,解决了人群模拟中监督不足、控制不稳定和数据偏差等问题,推动模拟从运动导向转向感知驱动的决策制定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05477 2026-04-08 cs.CL 50%

Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction

不要盲目行动:通过动作-效果验证和自我修正实现鲁棒的GUI自动化

Yuzhe Zhang, Xianwei Xue, Xingyong Wu, Mengke Chen, Chen Liu, Xinran He, Run Shao, Feiran Liu, Huanmin Xu, Qiutong Pan, Haiwei Wang

机构 * Beijing University of Technology(北京工业大学) Baidu Inc.(百度公司)

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出VeriGUI框架,通过动作-效果验证和自我修正机制,解决GUI自动化中环境噪声导致的失败问题,提升恢复性能。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 2 篇

2604.05210 2026-04-08 cs.CV 77%

Integration of Object Detection and Small VLMs for Construction Safety Hazard Identification

对象检测与小型视觉语言模型的整合用于建筑安全危险识别

Muhammad Adil, Mehmood Ahmed, Muhammad Aqib, Vicente A. Gonzalez, Gaang Lee, Qipei Mei

机构 * Infrastructure Human Tech (IHT) Lab, Department of Civil and Environmental Engineering, University of Alberta, Edmonton, Alberta, Canada(基础设施人类技术(IHT)实验室,土木与环境工程系,阿尔伯塔大学,埃德蒙顿,阿尔伯塔,加拿大)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract);InternVL(abstract);分类 cs.CV

AI总结 本文提出了一种结合对象检测与多模态推理的轻量级框架,以提高建筑工地安全危险识别的准确性和效率,实验表明该方法在多个小型视觉语言模型上均提升了检测性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06028 2026-04-08 cs.CL cs.AI cs.IR 57%

A Multi-Stage Validation Framework for Trustworthy Large-scale Clinical Information Extraction using Large Language Models

一种用于可信大规模临床信息提取的多阶段验证框架

Maria Mahbub, Gregory M. Dams, Josh Arnold, Caitlin Rizy, Sudarshan Srinivasan, Elliot M. Fielstein, Minu A. Aghevli, Kamonica L. Craig, Elizabeth M. Oliva, Joseph Erdos, Jodie Trafton, Ioana Danciu

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) Program Evaluation and Resource Center, Office of Mental Health and Office of Suicide Prevention, Department of Veterans Affairs(退伍军人事务部心理健康办公室和自杀预防办公室项目评估与资源中心) Vanderbilt University Medical Center(范德比尔特大学医学中心) VA Maryland Health Care System(退伍军人事务部马里兰医疗保健系统) VA Desert Pacific Healthcare Network(退伍军人事务部沙漠太平洋医疗网络) VA Connecticut Health Care System(退伍军人事务部康涅狄格医疗保健系统) Yale School of Medicine(耶鲁医学院)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出多阶段验证框架,通过弱监督评估提升LLM在临床信息提取中的可信度与准确性,验证了在大规模数据中应用的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 18 篇

2407.14971 2026-04-08 cs.CV cs.AI cs.CL cs.LG 85%

Sim-CLIP: Unsupervised Siamese Adversarial Fine-Tuning for Robust and Semantically-Rich Vision-Language Models

Sim-CLIP: 无监督的孪生对抗微调用于鲁棒且语义丰富的视觉-语言模型

Md Zarif Hossain, Ahmed Imteaj

机构 * Florida Atlantic University(佛罗里达大西洋大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Sim-CLIP通过无监督对抗微调提升CLIP视觉编码器的鲁棒性,同时保持语义表示。采用孪生架构和余弦相似度目标,避免大批次对比学习和额外动量编码器,实现低计算开销的鲁棒训练。

Comments Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18117 2026-04-08 cs.CV 83%

Online In-Context Distillation for Low-Resource Vision Language Models

在线上下文蒸馏用于低资源视觉语言模型

Zhiqi Kang, Rahaf Aljundi, Vaggelis Dorovatas, Karteek Alahari

机构 * Inria(法国国家信息与自动化研究所) Toyota Motor Europe(丰田汽车欧洲公司)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出在线上下文蒸馏方法,通过小模型与强教师模型协作,利用稀疏演示高效缩小性能差距,提升小模型性能达33%,在低资源条件下实现与零样本性能相当的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01831 2026-04-08 cs.LG cs.AI 81%

Routing-Based Continual Learning for Multimodal Large Language Models

基于路由的多模态大语言模型持续学习

Jay Mohta, Kenan Emir Ak, Gwang Lee, Dimitrios Dimitriadis, Yan Xu, Mingwei Shen

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于路由的持续学习方法,用于多模态大语言模型,有效缓解灾难性遗忘并提升跨模态迁移性能,同时保持训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04972 2026-04-08 cs.CV 79%

RCP: Representation Consistency Pruner for Mitigating Distribution Shift in Large Vision-Language Models

RCP:一种用于缓解大视觉-语言模型中分布偏移的表示一致性剪枝方法

Jianwei Zhang, Chaoning Zhang, Sihan Cao, Wang Liu, Pengcheng Zheng, Jiaxin Huang, Caiyan Qin, Yalan Ye, Wei Dong, Yang Yang

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Machine Learning Department, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学机器学习系) School of Robotics and Advanced Manufacture, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)机器人与先进制造学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出RCP框架,通过累积视觉token剪枝与延迟修复机制,有效缓解大视觉-语言模型中的分布偏移问题,实验表明可剪除高达88.9%的视觉token并减少85.7%的FLOPs,同时保持较低的精度损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05614 2026-04-08 cs.RO 78%

Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment

通过显式语言-动作对齐实现层次化视觉-语言-动作模型的 grounding

Theodor Wulff, Federico Tavella, Rahul Singh Maharjan, Manith Adikari, Angelo Cangelosi

机构 * The University of Manchester(曼彻斯特大学)

专题命中 VLM训练与架构 :grounding(title,abstract)

AI总结 本文提出通过显式语言-动作对齐训练框架,提升视觉-语言-动作模型的 grounding 能力,基于 LanguageTable 数据集验证了多模态 grounding 表示的有效性,并建立强基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06124 2026-04-08 cs.CV cs.AI 76%

Lightweight Multimodal Adaptation of Vision Language Models for Species Recognition and Habitat Context Interpretation in Drone Thermal Imagery

轻量级多模态适应:为无人机热成像中的物种识别和栖息地上下文解释优化视觉语言模型

Hao Chen, Fang Qiu, Fangchao Dong, Defei Yang, Eve Bohnett, Li An

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Florida(佛罗里达大学) Auburn University(奥本大学)

专题命中 VLM训练与架构 :vision language model(title);分类 cs.CV、cs.AI

AI总结 本研究提出轻量级多模态适应框架,用于提升视觉语言模型在无人机热成像中的物种识别与栖息地上下文解释能力,通过热数据集优化模型性能,实现从RGB到热辐射的高效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06126 2026-04-08 cs.LG cs.AI 73%

Gym-Anything: Turn any Software into an Agent Environment

Gym-Anything: 将任意软件转化为智能体环境

Pranjal Aggarwal, Graham Neubig, Sean Welleck

机构 * CMU(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Gym-Anything框架,通过多智能体任务将任意软件转化为交互式计算机使用环境,生成涵盖医疗、天文、工程等领域的10K+长周期任务,提升现实场景下的智能体研究效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05839 2026-04-08 cs.AI 70%

Vision-Guided Iterative Refinement for Frontend Code Generation

基于视觉引导的前端代码生成迭代精修

Hannah Sansford, Derek H. C. Law, Wei Liu, Abhishek Tripathi, Niresh Agarwal, Gerrit J. J. van den Burg

机构 * School of Mathematics, University of Bristol, UK(英国布里斯托大学数学学院) Amazon AGI(亚马逊AGI)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出一种全自动的批评者循环框架,利用视觉语言模型提供结构化反馈以指导代码生成的迭代优化,实验证明其在前端开发中能显著提升代码质量。

Comments Accepted at ICLR 2026 Workshop on AI with Recursive Self-Improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05601 2026-04-08 cs.CV 70%

ID-Selection: Importance-Diversity Based Visual Token Selection for Efficient LVLM Inference

基于重要性与多样性的视觉令牌选择:用于高效大视觉-语言模型推理

Zhaohong Huang, Wenjing Liu, Yuxin Zhang, Fei Chao, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出ID-Selection方法,结合重要性估计与多样性意识迭代选择,有效平衡令牌重要性与多样性,在极端剪枝比下实现高效推理与性能保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07833 2026-04-08 cs.CV 70%

MIMIC: Multimodal Inversion for Model Interpretation and Conceptualization

MIMIC:多模态逆向用于模型解释与概念化

Animesh Jain, Alexandros Stergiou

机构 * University of Twente(特温特大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出MIMIC框架,通过逆向处理多模态模型内部编码,提升模型可解释性与概念化能力,采用联合逆向与特征对齐目标,结合三种正则化器提升空间对齐、图像平滑与语义真实度。

Comments Accepted at CVPRw 2026 - How Do Vision Models Work? (HOW) Workshop, Project page: https://anaekin.github.io/MIMIC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06079 2026-04-08 cs.CV cs.AI 62%

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10075 2026-04-08 cs.CV cs.GR cs.LG 62%

Thinking Like Van Gogh: Structure-Aware Style Transfer via Flow-Guided 3D Gaussian Splatting

像梵高一样思考:通过流引导的3D高斯点划法实现结构感知的风格迁移

Lebin Zhou, Jingchuan Xiao, Zhendong Wang, Jinhao Wang, Rongduo Han, Nam Ling, Cihan Ruan

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出一种流引导的3D高斯点划法框架,通过将二维艺术运动转换为三维高斯几何,实现结构感知的风格迁移,同时采用亮度-结构解耦策略和VLM-as-a-Judge评估框架,提升艺术真实感。

Comments 7 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05445 2026-04-08 cs.CL cs.AI cs.CV 62%

Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling

学习什么重要:可解释视觉语言奖励建模的动态维度选择与聚合

Qiyuan Chen, Hongsen Huang, Jiahe Chen, Qian Shao, Jintai Chen, Hongxia Xu, Renjie Hua, Chuan Ren, Jian Wu

机构 * Zhejiang University(浙江大学) Soochow Securities Co.,Ltd.(东吴证券股份有限公司) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VL-MDR框架,通过动态分解评价为细粒度可解释维度,提升视觉语言奖励建模的可解释性与效率,实验显示其在基准测试中优于现有模型,并有效缓解视觉幻觉。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05831 2026-04-08 cs.LG cs.AI 62%

HeartcareGPT: A Unified Multimodal ECG Suite for Dual Signal-Image Modeling and Understanding

HeartcareGPT:一种统一的多模态ECG套件,用于双信号-图像建模与理解

Yihan Xie, Sijing Li, Tianwei Lin, Zhuonan Wang, Chenglin Yang, Yu Zhong, Wenjie Yan, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HeartcareGPT,通过Dual Stream Projection Alignment机制,实现ECG信号与图像的统一建模,提升多视角ECG理解能力,并建立医学多模态大语言模型向生理信号领域扩展的方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00727 2026-04-08 cs.LG cs.CR cs.CV 62%

Perturb and Recover: Fine-tuning for Effective Backdoor Removal from CLIP

扰动与恢复:用于从CLIP中有效移除后门的微调

Naman Deep Singh, Francesco Croce, Matthias Hein

机构 * University of Tübingen & Tübingen AI Center(蒂宾根大学 & 蒂宾根人工智能中心) EPFL(瑞士联邦理工学院洛桑)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出PAR机制,通过微调有效移除CLIP中的后门,实验表明其在不同编码器和攻击类型上均能保持良好性能,且无需真实训练数据。

Comments CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07310 2026-04-08 cs.CV 57%

MATRIX: Mask Track Alignment for Interaction-aware Video Generation

MATRIX:用于交互感知视频生成的遮罩跟踪对齐

Siyoon Jin, Seongchan Kim, Dahyun Chung, Jaeho Lee, Hyunwook Choi, Jisu Nam, Jiyoung Kim, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 MATRIX通过引入遮罩跟踪对齐方法,提升视频生成中交互感知能力,增强语义对齐与传播,减少漂移和幻觉。

Comments Project Page is available at: https://cvlab-kaist.github.io/MATRIX/, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏