arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2925
2604.24339 2026-04-28 cs.CV cs.AI

See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection

看得更远,想得更深:通过低级视觉线索和反思提升VLM的推理能力

Zhiheng Wu, Tong Wang, Shuning Wang, Naiming Liu, Yumeng Zhang

机构 * Baidu Inc.(百度公司) Zhejiang University(浙江大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 本文提出ForeSight框架,通过低级视觉线索和有效视觉反馈提升VLM推理能力,构建新数据集CG-SalBench,并验证其在参数规模相同和部分指标上优于现有SOTA模型。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24332 2026-04-28 cs.LG cs.CR

Mitigating Error Amplification in Fast Adversarial Training

缓解快速对抗训练中的误差放大

Mengnan Zhao, Lihe Zhang, Bo Wang, Tianhang Zheng, Hong Zhong, Geyong Min

机构 * Anhui University(安徽大学) Dalian University of Technology(大连理工大学) Zhejiang University(浙江大学) University of Exeter(埃克塞特大学)

AI总结 本文分析了指导强度对模型性能的影响,提出DDG策略动态调整扰动预算和监督信号,缓解对抗过拟合和鲁棒性准确性权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06542 2026-04-28 cs.LG cs.DC cs.MA stat.ML

On the Surprising Effectiveness of a Single Global Merging in Decentralized Learning

在去中心化学习中单一全局融合的惊人效果

Tongtian Zhu, Tianyu Zhang, Mingze Wang, Zhanpeng Zhou, Can Wang

机构 * Zhejiang University(浙江大学) Mila, Quebec AI Institute(魁北克AI研究院) Université de Montréal(蒙特利尔大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文研究了去中心化学习中通信调度策略,发现集中通信预算在后期阶段可显著提升测试性能,通过单一全局融合实现完全连接,有效提升高数据异质性下的学习性能。

Comments We discover and theoretically explain why and when a single global parameter merging in decentralized learning can recover the performance of federated learning, even in highly heterogeneous and communication-constrained environments

Journal ref ICLR 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24123 2026-04-28 cs.CV

FDIM: A Feature-distance-based Generic Video Quality Metric for Versatile Codecs

FDIM:一种基于特征距离的通用视频质量度量标准,适用于多种编码器

Jiayi Wang, Lichun Zhang, Xiaoqi Zhuang, Jiaqi Zhang, Lu Yu, Yin Zhao

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Zhejiang Key Laboratory of Multimodal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室) Central Media Technology Institute, Huawei(华为中央媒体技术研究所)

AI总结 本文提出FDIM,一种基于特征距离的通用视频质量度量标准,适用于传统和神经视频编码器。FDIM结合深度和手工特征,通过大规模数据训练,实现对不同编码器和动态范围的强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24029 2026-04-28 cs.CV cs.CL cs.IR cs.MM

DeepTaxon: An Interpretable Retrieval-Augmented Multimodal Framework for Unified Species Identification and Discovery

DeepTaxon: 一种可解释的检索增强多模态框架,用于统一的物种识别与发现

Jiawei Wang, Ming Lei, Yaning Yang, Xinyan Lin, Yuquan Le, Qiwei Ma, Zhiwei Xu, Zheqi Lv, Yuchen Ang, Zhe Quan, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Hunan University(湖南大学) Xiangtan University(湘潭大学) Hunan Normal University(湖南师范大学) Zhejiang University(浙江大学) Cornell University(康奈尔大学) Meituan(美团)

AI总结 DeepTaxon通过可解释的检索增强多模态框架,统一物种识别与发现,通过检索证据进行链式推理,提升识别和发现的准确性与可解释性。

Comments 13 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24001 2026-04-28 cs.AI

CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation

CT-FineBench:用于CT报告生成细粒度评估的诊断可信度基准

Ruifeng Yuan, Wanxing Chang, Weiwei Cao, Bowen Shi, Zhongyu Wei, Ling Zhang, Jianpeng Zhang

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) Hupan Lab(沪幻实验室) Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 CT-FineBench通过基于问题回答的流程构建,评估CT报告的细粒度事实一致性,优于传统指标,能更敏感地捕捉临床细节错误。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23633 2026-04-28 cs.AI

Causal Discovery as Dialectical Aggregation: A Quantitative Argumentation Framework

因果发现作为辩证聚合:一种定量论证框架

Sheng Wei, Yulin Chen, Beishui Liao

机构 * The College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ZLAIRE, Zhejiang University(浙江大学ZLAIRE实验室) School of Philosophy, Zhejiang University(浙江大学哲学学院) The State Key Lab of Brain-Machine Intelligence(脑机智能国家重点实验室)

AI总结 本文提出QACD框架,通过将条件独立性结果表示为等级可撤消论证,提升因果发现的鲁棒性,在噪声或不一致条件下提高结构一致性和干预可靠性。

Comments Accepted at the 23rd International Conference on Principles of Knowledge Representation and Reasoning (KR 2026). This arXiv version includes supplementary material and additional implementation details

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27507 2026-04-28 cs.CV

Chat-Scene++: Exploiting Context-Rich Object Identification for 3D LLM

Chat-Scene++: 利用语境丰富的物体识别用于3D大语言模型

Haifeng Huang, Yilun Chen, Zehan Wang, Jiangmiao Pang, Zhou Zhao

机构 * School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出Chat-Scene++框架,通过将3D场景表示为语境丰富的物体序列,提升细粒度物体定位和上下文推理能力,在五个3D视觉语言基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15846 2026-04-28 cs.CL

Gated Tree Cross-Attention for Checkpoint-Compatible Syntax Injection in Decoder-Only LLMs

基于门控树交叉注意力的检查点兼容语法注入解码器-only LLMs

Xinyu Gao, Shaonan Wang, Nai Ding

机构 * College of Biomedical Engineering & Instrument Science, Zhejiang University(浙江大学生物医学工程与仪器科学学院) Department of Language Science and Technology, The Hong Kong Polytechnic University(香港理工大学语言科学与技术系)

AI总结 本文提出一种检查点兼容的门控树交叉注意力机制,用于在解码器-only LLMs中注入语法结构,提升语法鲁棒性而不影响问答和常识推理性能。

Comments ACL 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20058 2026-04-28 stat.ML cs.LG stat.AP

Modeling Parkinson's Disease Progression Using Longitudinal Voice Biomarkers: A Comparative Study of Statistical and Neural Mixed-Effects Models

利用纵向语音生物标志物建模帕金森病进展:统计与神经混合效应模型的比较研究

Ran Tong, Lanruo Wang, Tong Wang, Wei Yan

机构 * Department of Mathematical Sciences(数学科学系) Naveen Jindal School of Management(奈文·金达管理学院) Department of Biology(生物系) University of Texas at Dallas(德克萨斯大学达拉斯分校) Duke University(杜克大学) The Second Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院第二附属医院) Department of Neurosurgery(神经外科系)

AI总结 本文比较了统计与神经混合效应模型在分析帕金森病纵向语音数据中的表现,发现GAMM在预测性能和可解释性上更优,而神经模型在小样本下易过拟合。

Comments Published version: Computer Methods and Programs in Biomedicine Update, DOI: 10.1016/j.cmpbup.2026.100242. Version note: https://doi.org/10.5281/zenodo.19804672

Journal ref Computer Methods and Programs in Biomedicine Update, Volume 9, 2026, Article 100242

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21107 2026-04-28 cs.LG q-bio.MN

Doloris: Dual Conditional Diffusion Implicit Bridges with Sparsity Masking Strategy for Unpaired Single-Cell Perturbation Estimation

Doloris:双条件扩散隐式桥梁与稀疏掩码策略用于无配对单细胞扰动估计

Changxi Chi, Jun Xia, Yufei Huang, Zhuoli Ouyang, Cheng Tan, Yunfan Liu, Jingbo Zhou, Chang Yu, Liangyu Yuan, Siyuan Li, Zelin Zang, Stan Z. Li

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Centre for Artificial Intelligence and Robotics Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences(人工智能与机器人中心 香港创新研究院 中国科学院) Southern University of Science and Technology(南方科技大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Doloris模型,通过双条件扩散模型和稀疏掩码策略解决无配对单细胞扰动数据建模问题,有效捕捉单细胞扰动多样性并取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11334 2026-04-28 cs.CV

MARRS: Masked Autoregressive Unit-based Reaction Synthesis

MARRS:基于掩码自回归单元的反应合成

Yabiao Wang, Shuo Wang, Jiangning Zhang, Jiafu Wu, Qingdong He, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学控制系统研究所) Tencent Youtu Lab(腾讯优图实验室)

AI总结 本文提出MARRS框架,通过单元区分运动变分自编码器、动作条件融合和互单元调制,生成协调精细的反应动作,解决传统VQ方法的量化损失和计算复杂性问题。

Comments Accepted to IEEE TVCG 2026. Project page: https://aigc-explorer.github.io/MARRS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13903 2026-04-28 cs.CR cs.AI cs.DC

CoreGuard: Safeguarding Foundational Capabilities of LLMs Against Model Stealing in Edge Deployment

CoreGuard: 保障边缘部署中大语言模型的基础能力免受模型窃取攻击

Qinfeng Li, Tianyue Luo, Xuhong Zhang, Yangfan Xie, Zhiqiang Shen, Lijun Zhang, Yier Jin, Hao Peng, Xinkui Zhao, Xianwei Zhu, Jianwei Yin

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Washington University in St. Louis(圣路易斯华盛顿大学) University of Science and Technology of China(中国科学技术大学) College of Computer Science and Technology, Zhejiang Normal University(浙江师范大学计算机科学与技术学院) China Electronics Technology Design and Research Institute(中国电子技术设计与研究院)

AI总结 本文提出CoreGuard,一种高效的边缘部署LLM保护方法,通过减少计算和通信开销实现上界安全保护,防止模型窃取和滥用。

Comments Accepted by NeurIPS 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23413 2026-04-28 cs.CL

Beyond Local vs. External: A Game-Theoretic Framework for Trustworthy Knowledge Acquisition

超越局部与外部:一种博弈论框架用于可信知识获取

Rujing Yao, Yufei Shi, Yang Wu, Ang Li, Zhuoren Jiang, XiaoFeng Wang, Haixu Tang, Xiaozhong Liu

机构 * Nankai University(南开大学) The Hong Kong Polytechnic University(香港理工大学) Worcester Polytechnic Institute(沃斯通理工学院) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Indiana University Bloomington(印第安纳大学布利克学院)

AI总结 本文提出GTKA框架,通过博弈论平衡知识效用与隐私,设计隐私感知子查询生成器、对抗重建攻击者和可信本地整合器,减少敏感意图泄露并保持高答案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22880 2026-04-28 cs.CL

TexOCR: Advancing Document OCR Models for Compilable Page-to-LaTeX Reconstruction

TexOCR: 提升可编译页面到LaTeX重建的文档OCR模型

Chengye Wang, Lin Fu, Zexi Kuang, Yilun Zhao

机构 * Yale University(耶鲁大学) Zhejiang University(浙江大学)

AI总结 本文提出TexOCR-Bench和TexOCR-Train,通过监督微调和强化学习训练出2B参数模型,提升科学PDF到可编译LaTeX的重建能力,验证了可验证奖励在结构和编译指标上的改进。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22777 2026-04-28 cs.AI cs.LG

An Intelligent Fault Diagnosis Method for General Aviation Aircraft Based on Multi-Fidelity Digital Twin and FMEA Knowledge Enhancement

基于多保真度数字孪生和FMEA知识增强的通用航空飞机智能故障诊断方法

Zhihuan Wei, Yang Hu, Xinhang Chen, Yiming Zhang, Jie Liu, Wei Wang

机构 * Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) School of Reliability and Systems Engineering, Beihang University(北京航空航天大学可靠性与系统工程学院) Department of Mechanical Engineering, City University of Hong Kong(香港城市大学机械工程系)

AI总结 本文提出基于多保真度数字孪生的智能故障诊断框架,通过高保真飞行动态仿真、FMEA驱动故障注入、多保真残差特征提取和大语言模型增强的可解释报告生成模块,解决通用航空飞机故障诊断中的数据稀缺、故障类型多样和故障特征弱等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01635 2026-04-28 cs.LG cs.AI cs.DC cs.PF

Reliable Microservice Tail Latency Prediction via Decoupled Dual-Stream Learning and Gradient Modulation

通过解耦双流学习和梯度调制实现可靠微服务尾延迟预测

Wenzhuo Qian, Hailiang Zhao, Jiayi Chen, Ziqi Wang, Tianlv Chen, Zhiwei Ling, Xinkui Zhao, Kingsum Chow, Albert Y. Zomaya, Shuiguang Deng

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Software Technology, Zhejiang University(浙江大学软件学院) Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) School of Computer Science, University of Sydney(悉尼大学计算机科学学院)

AI总结 本文提出USRFNet框架,通过解耦需求与容量建模,利用图神经网络和门控MLP分别建模流量和资源动态,结合层次张量融合提升预测精度,实验显示在三个真实世界基准上MAPE降低15.62%-26.11%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22550 2026-04-27 cs.CR cs.AI

ArmSSL: Adversarial Robust Black-Box Watermarking for Self-Supervised Learning Pre-trained Encoders

ArmSSL: 用于自监督学习预训练编码器的对抗鲁棒性黑盒水印技术

Yongqi Jiang, Yansong Gao, Boyu Kuang, Chunyi Zhou, Anmin Fu, Liquan Chen

机构 * Nanjing University of Science and Technology(南京理工大学) The University of Western Australia(西澳大学) Zhejiang University(浙江大学) Southeast University(东南大学)

AI总结 本文提出ArmSSL,一种在保持实用性的同时,确保黑盒可验证性和对抗鲁棒性的自监督学习水印框架。通过特征空间正交性和潜在表示纠缠技术,实现对水印的强保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22018 2026-04-27 q-bio.NC cs.AI cs.LG eess.SP

Foundation models for discovering robust biomarkers of neurological disorders from dynamic functional connectivity

用于从动态功能连接中发现神经疾病稳健生物标记物的基础模型

Deepank Girish, Yi Hao Chan, Sukrit Gupta, Jing Xia, Jagath C. Rajapakse

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院,新加坡) Department of Biomedical Engineering and the School of Artificial Intelligence and Data Engineering, Indian Institute of Technology Ropar, India(印度理工学院罗帕尔分校生物医学工程系和人工智能与数据工程学院) College of Instrument and Computer Science, Zhejiang University, China(浙江大学仪器与计算机科学学院)

AI总结 本文提出RE-CONFIRM框架,评估深度学习模型中潜在生物标记物的稳健性,发现传统指标不足,提出Hub-LoRA技术提升模型性能并产生神经生物学忠实的生物标记物。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20979 2026-04-27 cs.LG

Toward Robust and Efficient ML-Based GPU Caching for Modern Inference

迈向鲁棒且高效的基于机器学习的GPU缓存

Peng Chen, Jiaji Zhang, Hailiang Zhao, Yirong Zhang, Shenyao Chen, Jiahong Yu, Xueyan Tang, Yixuan Wang, Hao Li, Jianping Zou, Gang Xiong, Kingsum Chow, Shuibing He, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Kuaishou(快手)

AI总结 本文提出学习增强型LRU算法,通过整合预测提升缓存性能,实现1-一致性与O(k)-鲁棒性,同时在GPU上构建LCR缓存,实验显示在LLM和DLRM任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21593 2026-04-24 cs.CL

Language as a Latent Variable for Reasoning Optimization

语言作为潜在变量用于推理优化

Linjuan Wu, Haoran Wei, Jialong Tang, Shuang Luo, Baosong Yang, Yongliang Shen, Weiming Lu

机构 * Zhejiang University(浙江大学)

AI总结 研究探讨语言作为潜在变量对推理性能的影响,提出polyGRPO框架通过多语言数据优化模型,提升推理准确率和跨任务泛化能力。

Comments 17 pages, 7 figures, Under Reviewing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21324 2026-04-24 cs.CV

Temporal Prototyping and Hierarchical Alignment for Unsupervised Video-based Visible-Infrared Person Re-Identification

时序原型与层次对齐用于无监督的基于视频的可见-红外人员重识别

Zhiyong Li, Wei Jiang, Haojie Liu, Mingyu Wang, Wanchong Xu, Weijie Mao

机构 * College of Control Science and Engineering, Zhejiang University(控制科学与工程学院,浙江大学) School of Computer Science and Technology, Zhejiang University of Water Resources and Electric Power(计算机科学与技术学院,浙江水利电力大学)

AI总结 本文提出HiTPro框架,通过时序感知特征编码器和层次交叉原型对齐,解决无监督视频基于可见-红外人员重识别问题,实现跨模态一致性与不变性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21291 2026-04-24 cs.CV cs.AI

Exploring the Role of Synthetic Data Augmentation in Controllable Human-Centric Video Generation

探索合成数据增强在可控人类中心视频生成中的作用

Yuanchen Fei, Yude Zou, Zejian Kang, Ming Li, Jiaying Zhou, Xiangru Huang

机构 * Hunan University(湖南大学) Westlake University(西湖大学) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Sun Yat-Sen University(中山大学)

AI总结 本文研究合成数据对可控人类视频生成的影响,提出基于扩散的框架实现细粒度控制,并通过实验揭示合成与真实数据的互补作用,为高效选择合成样本提升视频真实感提供方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21268 2026-04-24 cs.LG cs.AI cs.CV

Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding

两次测量,一次点击:通过强化学习共进化提议者和视觉评论者进行GUI定位

Wenkai Wang, Xiyun Li, Hongcan Guo, Wenhao Yu, Tianqing Fang, Haitao Mi, Dong Yu, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Tencent AI Lab(腾讯AI实验室) The University of Hong Kong(香港大学)

AI总结 本文提出通过强化学习共进化提议者和视觉评论者,以提升GUI定位的准确性和鲁棒性,通过动态平衡训练目标,增强模型在复杂界面布局中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11275 2026-04-24 cs.LG cs.NA math.NA

Higher Order Approximation Rates for ReLU CNNs in Korobov Spaces

ReLU CNNs在Korobov空间中的高阶逼近速率

Yuwen Li, Guozhi Zhang

机构 * School of Mathematical Sciences, Zhejiang University(浙江大学数学科学学院)

AI总结 本文研究了ReLU CNNs在Korobov空间中高阶Korobov函数的L_p逼近误差,通过深度CNNs将经典二阶逼近速率提升至(m+1)阶(模对数因子),关键在于用CNNs近似高阶稀疏网格基函数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16879 2026-04-23 cs.CV

Adaptive Forensic Feature Refinement via Intrinsic Importance Perception

通过内在重要性感知实现自适应的 forensic 特征细化

Jiazhen Yang, Junjun Zheng, Kejia Chen, Xiangheng Kong, Jie Lei, Zunlei Feng, Bingde Hu, Yang Gao

机构 * Zhejiang University(浙江大学) Alibaba Inc(阿里巴巴公司) Zhejiang University of Technology(浙江工业大学)

AI总结 本文提出I2P框架,通过自适应识别关键层表示并约束任务驱动的参数更新,提升SID任务的特定性同时保留预训练表示的可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14593 2026-04-23 cs.CL cs.AI

Mechanistic Decoding of Cognitive Constructs in Large Language Models

大语言模型中认知结构的机制解码

Yitong Shou, Manhao Guan

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文提出基于Representation Engineering的Cognitive Reverse-Engineering框架,分析社会比较嫉妒的认知机制,揭示模型内部对嫉妒的结构化编码,并展示如何机械检测和抑制有毒情绪状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12652 2026-04-23 cs.CV cs.AI

PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning

PromptEcho:基于视觉语言模型的无标注奖励用于文本到图像强化学习

Jinlong Liu, Wanggui He, Peng Zhang, Mushui Liu, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

AI总结 PromptEcho通过冻结的视觉语言模型计算token级交叉熵损失,无需标注或训练奖励模型,提升文本到图像模型的提示跟随能力,实验显示在多个基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18263 2026-04-23 cs.LG cs.CV cs.GR

From Competition to Synergy: Unlocking Reinforcement Learning for Subject-Driven Image Generation

从竞争到协同:解锁受主体驱动的图像生成中的强化学习

Ziwei Huang, Ying Shu, Hao Fang, Quanyu Long, Wenya Wang, Qiushi Guo, Tiezheng Ge, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Customized-GRPO方法,通过Synergy-Aware Reward Shaping和Time-Aware Dynamic Weighting解决强化学习中身份保持与提示遵循的平衡问题,提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02242 2026-04-23 cs.CV

Sampling-Aware Quantization for Diffusion Models

面向采样意识的扩散模型量化

Qian Zeng, Jie Song, Yuanyu Wan, Huiqiong Wang, Mingli Song

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) Ningbo Innovation Center, Zhejiang University(浙大宁波创新中心) State Key Laboratory of Blockchain and Security, Zhejiang University(浙江大学区块链与安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 本文提出面向采样意识的量化策略,通过混合阶轨迹对齐技术提升采样精度与效率,实验表明在保持高速采样器收敛特性的同时,生成质量更优。

Comments 17 pages, 12 figures, CVPR2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏