arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2931
2512.03746 2025-12-04 cs.CV cs.CL

Thinking with Programming Vision: Towards a Unified View for Thinking with Images

通过编程视觉思考:迈向图像思考的统一视角

Zirun Guo, Minjie Hong, Feng Zhang, Kai Jia, Tao Jin

机构 * Zhejiang University(浙江大学) ByteDance BandAI(字节跳动BandAI)

AI总结 CodeVision提出一种灵活的代码作为工具框架,通过两阶段训练提升模型对图像变化和多工具推理的鲁棒性,实验显示显著提升性能并促进新兴能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03720 2025-12-04 cs.CR cs.AI

Context-Aware Hierarchical Learning: A Two-Step Paradigm towards Safer LLMs

上下文感知的分层学习:一种更安全LLM的两阶段范式

Tengyun Ma, Jiaqi Yao, Daojing He, Shihao Peng, Yu Li, Shaohui Liu, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Great Bay University(大贝大学) Zhejiang University(浙江大学)

AI总结 本文提出上下文感知分层学习(CAHL)以提升LLM对工具完成攻击的鲁棒性,通过动态平衡语义理解和指令约束,有效增强模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03087 2025-12-04 cs.MM cs.AI

When Harmful Content Gets Camouflaged: Unveiling Perception Failure of LVLMs with CamHarmTI

当有害内容被伪装时:通过CamHarmTI揭示LVLMs的感知失败

Yanhui Li, Qi Zhou, Zhihong Xu, Huizhong Guo, Wenhai Wang, Dongxia Wang

机构 * Zhejiang University(浙江大学)

AI总结 本文提出CamHarmTI基准,揭示LVLMs在识别伪装有害内容时的感知不足,并通过微调提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00293 2025-12-04 cs.CV

MagicView: Multi-View Consistent Identity Customization via Priors-Guided In-Context Learning

MagicView: 通过先验引导的上下文学习实现多视角一致的身份定制

Hengjia Li, Jianjin Xu, Keli Cheng, Lei Wang, Ning Bi, Boxi Wu, Fernando De la Torre, Deng Cai

机构 * Zhejiang University(浙江大学) Carnegie Mellon University(卡内基梅隆大学) Qualcomm Inc.(高通公司)

AI总结 MagicView 通过先验引导的上下文学习实现多视角一致的身份定制,有效提升多视角一致性与文本对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03724 2025-12-04 cs.CL

MemOS: A Memory OS for AI System

MemOS:人工智能系统中的内存操作系统

Zhiyu Li, Chenyang Xi, Chunyu Li, Ding Chen, Boyu Chen, Shichao Song, Simin Niu, Hanyu Wang, Jiawei Yang, Chen Tang, Qingchen Yu, Jihao Zhao, Yezhaohui Wang, Peng Liu, Zehao Lin, Pengyuan Wang, Jiahao Huo, Tianyi Chen, Kai Chen, Kehang Li, Zhen Tao, Huayi Lai, Hao Wu, Bo Tang, Zhengren Wang, Zhaoxin Fan, Ningyu Zhang, Linfeng Zhang, Junchi Yan, Mingchuan Yang, Tong Xu, Wei Xu, Huajun Chen, Haofen Wang, Hongkang Yang, Wentao Zhang, Zhi-Qin John Xu, Siheng Chen, Feiyu Xiong

机构 * MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) Institute for Advanced Algorithms Research, Shanghai(上海先进算法研究所) Research Institute of China Telecom(中国电信研究院) Tongji University(同济大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Renmin University of China(中国人民大学) Beihang University(北航) Shanghai Jiao Tong University(上海交通大学)

AI总结 MemOS是一种面向人工智能系统的内存操作系统,通过统一管理不同类型的内存资源,提升长上下文推理和持续个性化的能力。

Comments 36 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03144 2025-12-04 cs.CV cs.CL cs.MM

MERIT: Multilingual Semantic Retrieval with Interleaved Multi-Condition Query

MERIT: 多语言语义检索与交错多条件查询

Wei Chow, Yuan Gao, Linfeng Li, Xian Wang, Qi Xu, Hang Song, Lingdong Kong, Ran Zhou, Yi Zeng, Yidong Cai, Botian Jiang, Shilin Xu, Jiajun Zhang, Minghui Qiu, Xiangtai Li, Tianshu Yang, Siliang Tang, Juncheng Li

机构 * Zhejiang University(浙江大学)

AI总结 MERIT提出首个多语言交错多条件语义检索数据集,通过Coral框架提升检索性能45.9%,并验证了其在多个基准上的泛化能力。

Comments NeurIPS 2025; Project Page, Code, and Dataset at: https://merit-2025.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12836 2025-12-04 cs.IR cs.AI

A Survey on Recommendation Unlearning: Fundamentals, Taxonomy, Evaluation, and Open Questions

推荐去学习的综述:基本原理、分类、评估和开放问题

Yuyuan Li, Xiaohua Feng, Chaochao Chen, Qiang Yang

机构 * School of Communication Engineering, Hangzhou Dianzi University(杭州电子科技大学通信工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Hong Kong Polytechnic University, Academy for AI(香港理工大学人工智能学院)

AI总结 本文综述了推荐去学习的基本原理、分类、评估方法及开放问题,旨在推动更高效、可扩展的去学习技术发展。

Comments Accepted by TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03036 2025-12-03 cs.CV cs.AI

ViSAudio: End-to-End Video-Driven Binaural Spatial Audio Generation

ViSAudio:端到端视频驱动的双耳空间音频生成

Mengchen Zhang, Qi Chen, Tong Wu, Zihan Liu, Dahua Lin

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Stanford University(斯坦福大学) Beihang University(北航) The Chinese University of Hong Kong(香港中文大学)

AI总结 ViSAudio通过端到端双耳空间音频生成框架,从静音视频直接生成高质量空间音频,提升空间沉浸感和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02790 2025-12-03 cs.CV

UnicEdit-10M: A Dataset and Benchmark Breaking the Scale-Quality Barrier via Unified Verification for Reasoning-Enriched Edits

UnicEdit-10M: 一个通过统一验证打破规模-质量壁垒的数据集和基准

Keming Ye, Zhipeng Huang, Canmiao Fu, Qingyang Liu, Jiani Cai, Zheqi Lv, Chen Li, Jing Lyu, Zhou Zhao, Shengyu Zhang

机构 * Zhejiang University(浙江大学) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学)

AI总结 UnicEdit-10M通过统一验证方法构建大规模高质量数据集和基准,解决图像编辑中规模与质量的矛盾,评估模型在空间和知识推理中的表现。

Comments 31 pages, 15 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12669 2025-12-03 cs.CV

3DIS: Depth-Driven Decoupled Instance Synthesis for Text-to-Image Generation

3DIS: 基于深度的解耦实例合成用于文本到图像生成

Dewei Zhou, Ji Xie, Zongxin Yang, Yi Yang

机构 * CCAI, Zhejiang University(中国浙江大学计算机辅助智能学院)

AI总结 3DIS提出了一种基于深度的解耦实例合成方法,通过分阶段生成场景深度图和渲染细粒度属性,提升文本到图像生成中多实例的布局精度和属性渲染效果。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02536 2025-12-03 cs.CV

WeMMU: Enhanced Bridging of Vision-Language Models and Diffusion Models via Noisy Query Tokens

WeMMU: 通过噪声查询标记增强视觉-语言模型与扩散模型的桥梁

Jian Yang, Dacheng Yin, Xiaoxuan He, Yong Li, Fengyun Rao, Jing Lyu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知联合实验室,中国科学技术大学) ZheJiang University(浙江大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 WeMMU通过噪声查询标记和VAE分支,提升视觉-语言模型与扩散模型的连接效率,缓解泛化崩溃问题,实现稳定持续学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02061 2025-12-03 cs.LG cs.AI cs.CE

Ada-MoGE: Adaptive Mixture of Gaussian Expert Model for Time Series Forecasting

Ada-MoGE:一种自适应高斯专家混合模型用于时间序列预测

Zhenliang Ni, Xiaowen Ma, Zhenkai Wu, Shuai Xiao, Han Shu, Xinghao Chen

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Zhejiang University(浙江大学)

AI总结 Ada-MoGE通过自适应确定专家数量和高斯带通滤波优化,提升时间序列预测的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01983 2025-12-02 cs.LG cs.DC cs.IT cs.NI eess.SP math.IT

Feature-Based Semantics-Aware Scheduling for Energy-Harvesting Federated Learning

基于特征的语义感知调度用于能量收集联邦学习

Eunjeong Jeong, Giovanni Perin, Howard H. Yang, Nikolaos Pappas

机构 * Department of Computer and Information Science(计算机与信息科学系) Linköping University(林奈技术大学) Department of Information Engineering(信息工程系) University of Brescia(布雷西亚大学) ZJU-UIUC Institute(浙大-伊利诺伊大学联合研究所) Zhejiang University(浙江大学)

AI总结 本文提出了一种基于特征的语义感知调度框架,通过引入版本年龄信息度量标准,有效降低计算复杂性,提升能量收集联邦学习的效率和性能。

Comments This paper is currently under review for presentation at a peer-reviewed conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01939 2025-12-02 cs.SE cs.AI

An Empirical Study of Agent Developer Practices in AI Agent Frameworks

关于AI代理框架中代理开发者实践的实证研究

Yanlin Wang, Xinyi Xu, Jiachi Chen, Tingting Bi, Wenchao Gu, Zibin Zheng

机构 * Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) The University of Melbourne(墨尔本大学) Technical University of Munich(慕尼黑技术大学)

AI总结 本文通过实证研究分析了基于LLM的代理框架在开发效率、功能抽象、学习成本、性能优化和可维护性方面的差异,揭示了开发者在选择和使用框架时的挑战与需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01831 2025-12-02 cs.LG cs.AI

Deconstructing Generative Diversity: An Information Bottleneck Analysis of Discrete Latent Generative Models

解构生成多样性:基于信息瓶颈理论的离散潜在生成模型分析

Yudi Wu, Wenhao Zhao, Dianbo Liu

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出基于信息瓶颈理论的框架,分析离散潜在生成模型中生成多样性的来源,并揭示了三种不同的策略:多样性优先、压缩优先和解耦。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01732 2025-12-02 cs.LG math.OC

Beyond Scaffold: A Unified Spatio-Temporal Gradient Tracking Method

超越架设:一种统一的时空梯度跟踪方法

Yan Huang, Jinming Xu, Jiming Chen, Karl Henrik Johansson

机构 * Division of Decision and Control Systems, School of EECS, KTH Royal Institute of Technology(决策与控制系统系,皇家理工学院) College of Control Science and Engineering, Zhejiang University(控制科学与工程学院,浙江大学)

AI总结 ST-GT通过统一时空梯度跟踪方法,有效缓解数据异质性和局部梯度噪声,实现强凸问题的线性收敛和非凸问题的次线性收敛,提升通信效率。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01296 2025-12-02 cs.CV

EGG-Fusion: Efficient 3D Reconstruction with Geometry-aware Gaussian Surfel on the Fly

EGG-Fusion: 基于几何感知高斯surfel的高效实时3D重建

Xiaokun Pan, Zhenzhe Li, Zhichao Ye, Hongjia Zhai, Guofeng Zhang

机构 * State Key Lab of CAD\&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) SenseTime Research(商汤科技研究院)

AI总结 EGG-Fusion提出一种基于几何感知高斯surfel的实时3D重建系统,通过信息滤波融合方法提升精度和实时性,实现20%以上的精度提升。

Comments SIGGRAPH ASIA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01255 2025-12-02 cs.CR cs.CL cs.SE

Large Language Models Cannot Reliably Detect Vulnerabilities in JavaScript: The First Systematic Benchmark and Evaluation

大语言模型无法可靠地检测JavaScript中的漏洞:首个系统性基准和评估

Qingyuan Fei, Xin Liu, Song Li, Shujiang Wu, Jianwei Hou, Ping Chen, Zifeng Kang

机构 * Lanzhou University(兰州大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Technology Support Center of the Cyberspace Administration of China(国家互联网信息办公室技术支撑中心) Fudan University(复旦大学) Beijing University of Posts(北京邮电大学)

AI总结 本文首次提出FORGEJS框架,构建首个系统性JavaScript漏洞检测基准ARENAJS,并揭示LLM在漏洞检测中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01246 2025-12-02 cs.RO

COMET: A Dual Swashplate Autonomous Coaxial Bi-copter AAV with High-Maneuverability and Long-Endurance

COMET:一种双摆臂自主 coaxial 双旋翼 AAV,具有高机动性和长续航能力

Shuai Wang, Xiaoming Tang, Junning Liang, Haowen Zheng, Biyu Ye, Zhaofeng Liu, Fei Gao, Ximin Lyu

机构 * the School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能系统工程学院) Research Institute of Multiple Agents and Embodied Intelligence, Peng Cheng Laboratory(多智能体与具身智能研究院,鹏城实验室) State Key Laboratory of Industrial Control Technology, Zhejiang University(工业控制技术国家重点实验室,浙江大学) Differential Robotics Technology Co., Ltd.(差分机器人技术有限公司)

AI总结 COMET 是一种具有双摆臂机制的 coaxial 双旋翼 AAV,通过优化效率和机动性,实现了高续航能力与稳定飞行性能。

Comments 8 pages, 8 figures, accepted at IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00748 2025-12-02 cs.CV cs.AI

Probabilistic Modeling of Multi-rater Medical Image Segmentation for Diversity and Personalization

多评分者医学图像分割的概率建模用于多样性和个性化

Ke Liu, Shangde Gao, Yichao Fu, Shangqi Gao, Chunhua Shen

机构 * Zhejiang University(浙江大学) University of Cambridge(剑桥大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 ProSeg通过概率建模实现医学图像分割的多样化和个性化,结合专家偏好和边界模糊性,提升分割结果的多样性和个性化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12077 2025-12-02 cs.CV

Learning to Hear by Seeing: It's Time for Vision Language Models to Understand Artistic Emotion from Sight and Sound

通过视觉学习听觉:现在是让视觉语言模型理解艺术情感的时候了

Dengming Zhang, Weitao You, Jingxiong Li, Weishen Lin, Wenda Shi, Xue Zhao, Heda Zuo, Junxian Wu, Lingyun Sun

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 VAEmotionLLM通过两阶段框架,利用有限音频预训练使视觉语言模型理解艺术中的多模态情感

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22969 2025-12-02 cs.AI cs.MA

Multi-Agent Conditional Diffusion Model with Mean Field Communication as Wireless Resource Allocation Planner

多智能体条件扩散模型与均场通信作为无线资源分配规划器

Kechen Meng, Sinuo Zhang, Rongpeng Li, Xiangming Meng, Yansha Deng, Chan Wang, Ming Lei, Zhifeng Zhao

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Zhejiang University-University of Illinois Urbana-Champaign (ZJU-UIUC) Institute, Zhejiang University(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所) Department of Engineering, King’s College London(伦敦国王学院工程系)

AI总结 多智能体条件扩散模型与均场通信用于无线资源分配规划,通过扩散模型和逆动态模型提升样本效率与策略可扩展性,理论保证收敛稳定性,实验显示在无线网络优化中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21526 2025-12-02 cs.LG cs.CV

TRiCo: Triadic Game-Theoretic Co-Training for Robust Semi-Supervised Learning

TRiCo:三元博弈协同训练用于鲁棒半监督学习

Hongyang He, Xinyuan Song, Yangfan He, Zeyu Zhang, Yanshu Li, Haochen You, Lifan Sun, Wenqiao Zhang

机构 * University of Warwick(沃里克大学) Emory University(埃默里大学) University of Minnesota – Twin Cities(明尼苏达大学双城分校) ANU(澳大利亚国立大学) Brown University(布朗大学) Columbia University(哥伦比亚大学) UCSD(加州大学圣地亚哥分校) Zhejiang University(浙江大学)

AI总结 TRiCo通过三元博弈协同训练框架提升半监督学习的鲁棒性和性能,实现更稳健的伪标签选择和决策边界优化。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10349 2025-12-02 cs.RO cs.CV

Ensuring Force Safety in Vision-Guided Robotic Manipulation via Implicit Tactile Calibration

通过隐式触觉校准确保视觉引导的机器人操作中的力安全

Lai Wei, Jiahua Ma, Yibo Hu, Ruimao Zhang

机构 * Sun Yat-sen University(中山大学) UC San Diego(加州大学圣地亚哥分校) Zhejiang University(浙江大学)

AI总结 本文提出SafeDiff框架,通过隐式触觉校准提升机器人操作中的力安全,结合视觉和触觉数据优化状态规划,减少有害力风险。

Comments Website URL: see https://i-am-future.github.io/safediff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00352 2025-12-02 cs.LG stat.ML

Sample-Efficient Tabular Self-Play for Offline Robust Reinforcement Learning

样本高效的目标导向自博弈用于离线鲁棒强化学习

Na Li, Zewu Zheng, Wei Ni, Hangguan Shan, Wenjie Zhang, Xinyu Li

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Edith Cowan University(埃迪斯·科温大学) University of New South Wales(新南威尔士大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出RTZ-VI-LCB算法,通过乐观鲁棒值迭代和数据驱动的伯恩斯坦惩罚项,实现离线鲁棒双人零和马尔可夫游戏的最优样本复杂性保证。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00351 2025-12-02 cs.LG stat.ML

Provable Memory Efficient Self-Play Algorithm for Model-free Reinforcement Learning

可证明的内存高效自博弈算法用于无模型强化学习

Na Li, Yuchen Jiao, Hangguan Shan, Shefeng Yan

机构 * College of Information Science and Electronic Engineering(信息科学与电子工程学院) Zhejiang University(浙江大学) School of Information and Electronics(信息与电子学院) Beijing Institute of Technology(北京理工大学) Institute of Acoustics(声学研究所) Chinese Academy of Sciences(中国科学院)

AI总结 本文提出了一种内存高效的自博弈算法,用于解决多智能体强化学习中的内存效率、样本复杂度和预热成本问题。

Comments ICLR 2024. arXiv admin note: substantial text overlap with arXiv:2110.04645 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00076 2025-12-02 cs.RO cs.CV

Arcadia: Toward a Full-Lifecycle Framework for Embodied Lifelong Learning

Arcadia:迈向一个完整的生命周期框架用于具身终身学习

Minghe Gao, Juncheng Li, Yuze Lin, Xuqi Liu, Jiaming Ji, Xiaoran Pan, Zihan Xu, Xian Li, Mingjie Li, Wei Ji, Rong Wei, Rui Tang, Qizhou Wang, Kai Shen, Jun Xiao, Qi Wu, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Unitree Tech(单位树科技) Peking University(北京大学) Nanjing University(南京大学) Manycore Tech(Manycore科技) Bytedance Seed(字节跳动种子) University of Adelaide(阿德莱德大学)

AI总结 Arcadia提出了一种闭环框架,通过紧密耦合四个阶段实现具身终身学习,支持持续改进和端到端泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23475 2025-12-01 cs.CV

AnyTalker: Scaling Multi-Person Talking Video Generation with Interactivity Refinement

AnyTalker: 通过交互细化扩展多人物谈话视频生成

Zhizhou Zhong, Yicheng Ji, Zhe Kong, Yiying Liu, Jiarui Wang, Jiasun Feng, Lupeng Liu, Xiangyi Wang, Yanjia Li, Yuqing She, Ying Qin, Huan Li, Shuiyang Mao, Wei Liu, Wenhan Luo

机构 * Hong Kong University of Science and Technology(香港科技大学) Video Rebirth(视频重生) Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

AI总结 AnyTalker通过引入身份感知注意力机制和高效训练流程,实现了多人物谈话视频生成的高可扩展性和自然交互性。

Comments Homepage: https://hkust-c4g.github.io/AnyTalker-homepage

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23146 2025-12-01 cs.CV

InstanceV: Instance-Level Video Generation

InstanceV: 实例级视频生成

Yuheng Chen, Teng Hu, Jiangning Zhang, Zhucun Xue, Ran Yi, Lizhuang Ma

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 InstanceV通过实例级控制和全局语义一致性,实现高质量视频生成,并在实例感知指标上超越现有最佳模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23031 2025-12-01 cs.CV cs.AI

From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning

从幻觉到意图:用于视觉-语言推理的视觉理由学习

Changpeng Wang, Haozhe Wang, Xi Chen, Junhan Liu, Taofeng Xue, Chong Peng, Donglian Qi, Fangzhen Lin, Yunfeng Yan

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Meituan(美团)

AI总结 本文提出视觉理由学习(ViRL),通过将视觉动作作为核心推理元素,提升视觉-语言推理模型的透明度和可信度。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏