arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2909
2511.04711 2026-05-27 cs.CR cs.AI cs.LG

SWAP: Towards Copyright Auditing of Soft Prompts via Sequential Watermarking

SWAP:通过顺序水印实现软提示的版权审计

Wenyuan Yang, Yichen Sun, Changzheng Chen, Zhixuan Chu, Jiaheng Zhang, Yiming Li, Dacheng Tao

机构 * Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 针对软提示的版权保护问题,提出一种基于顺序水印的审计方法SWAP,通过将水印嵌入到更复杂的输出分布顺序空间中,实现无害且鲁棒的版权验证。

Comments This paper has been accepted by the International Journal of Computer Vision (IJCV), 2026. The first two authors contributed equally to this work. 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18603 2026-05-27 cs.AI cs.CV

Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning

Doc-CoB:通过视觉链式框推理增强文档理解

Ye Mo, Kai Ye, Xianwei Mao, Zirui Shao, Gang Huang, Bo Zhang, Hangdi Xing, Kehan Chen, Huan Zhou, Zixu Yan, Jiajun Bu, Sheng Zhou

机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可感知与智能系统重点实验室,浙江大学) Alibaba Group(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 提出Doc-CoB框架,通过粗到细的布局感知视觉推理,结合多模态大语言模型,逐步聚焦查询相关布局区域,提升文档理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26115 2026-05-26 cs.CV

TriSplat: Simulation-Ready Feed-Forward 3D Scene Reconstruction

TriSplat: 面向仿真的前馈式3D场景重建

Weijie Wang, Zimu Li, Jinchuan Shi, Zeyu Zhang, Botao Ye, Marc Pollefeys, Donny Y. Chen, Bohan Zhuang

机构 * Zhejiang University(浙江大学) ETH Zurich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心) Microsoft(微软) Monash University(莫纳什大学)

AI总结 提出TriSplat,一种前馈式重建网络,使用有向三角形图元表示场景,直接从稀疏视图图像预测并导出可直接用于仿真的网格场景。

Comments Project Page: https://lhmd.top/trisplat, Code: https://github.com/ziplab/TriSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25814 2026-05-26 cs.CL cs.AI

Adaptive Graph Refinement and Label Propagation with LLMs for Cost-Effective Entity Resolution

自适应图优化与基于大语言模型的标签传播用于经济高效实体解析

Hongtao Wang, Renchi Yang, Haoran Zheng, Xiangyu Ke

机构 * Hong Kong Baptist University(香港 Baptist 大学) Zhejiang University(浙江大学)

AI总结 提出Alper框架,通过迭代概率标签传播整合匹配与聚类,自适应融合图传播弱信号与LLM强查询,在预算约束下最大化边际增益,实现高效实体解析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25775 2026-05-26 cs.CV

DRFusion: Drift-Resilient Temporally Consistent Infrared-Visible Video Fusion

DRFusion: 抗漂移的时间一致红外-可见光视频融合

Xingyuan Li, Haoyuan Xu, Shulin Li, Xiang Chen, Zhiying Jiang, Jinyuan Liu

机构 * College of Computer Science Technology, Zhejiang University, Hangzhou, China School of Software Technology \& DUT-RU International School of ISE, Dalian University of Technology, Dalian, China College of Information Science Technology, Dalian Maritime University, Dalian, China

AI总结 提出一种抗漂移的视频融合方法,将任务重构为历史条件运动生成,通过稳定历史引导和软时间锚定实现时间一致性,并采用解耦结构-运动适应策略,在融合质量和时间稳定性上达到最优。

Comments 11 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25749 2026-05-26 cs.IR cs.AI cs.LG

DeGRe: Dense-supervised Generative Reranking for Recommendation

DeGRe: 密集监督的生成式重排序用于推荐

Chaotian Song, Jingyao Zhang, Chenghao Chen, Zisen Sang, Dehai Zhao, Guodong Cao, Boxi Wu, Deng Cai, Jia Jia

机构 * College of Software, Zhejiang University Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Beijing China State Key Lab of CAD\&CG, Zhejiang University Hangzhou China Rajax Network Technology, Taobao Shangou of Alibaba Shanghai China College of Software, Zhejiang University Rajax Network Technology, Taobao Shangou of Alibaba State Key Lab of CAD\&CG, Zhejiang University

AI总结 提出DeGRe框架,通过离线探索中的密集监督信号(Lookahead Evaluator)指导在线生成器(Online Generator)进行单步贪婪解码,解决重排序中的启发式标签偏差和信用分配问题。

Comments Accepted to KDD 2026 (ADS Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25693 2026-05-26 cs.CL cs.DB cs.MA

From Facts to Insights: A Persona-Driven Dual Memory Framework and Dataset for Role-Playing Agents

从事实到洞察:面向角色扮演智能体的角色驱动双记忆框架与数据集

Rongsheng Zhang, Ruofan Hu, Weijie Chen, Jiji Tang, Junnan Ren, Wanying Wu, Xunuoyan Chen, Tangjie Lv, Tao Jin, Zhou Zhao

机构 * Zhejiang University(浙江大学) Fuxi AI Lab, Netease Inc.(复活AI实验室,网易公司)

AI总结 针对长期对话中角色扮演智能体因上下文窗口限制而丧失角色一致性的问题,提出角色记忆数据集RoleMemo和双记忆框架DualMem,通过将记忆解耦为事实认知和角色条件洞察,结合监督微调与强化学习,在4B参数模型上超越基于DeepSeek-V3.2的零样本角色无关框架。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25626 2026-05-26 cs.CL

Beyond Literal Translation: Evaluating Cultural Effectiveness in Social Media UGC

超越字面翻译:评估社交媒体用户生成内容中的文化有效性

Linjuan Wu, Ruiqi Zhang, Xinze Lyu, Ye Guo, Daoxin Zhang, Zhe Xu, Yao Hu, Yixin Cao, Yongliang Shen, Weiming Lu

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Xiaohongshu Inc.(小红书公司)

AI总结 针对社交媒体用户生成内容翻译中文化传递与情感共鸣不足的问题,提出CULTURE-MT基准,通过构建涵盖14个领域、4种文化负载类型的1002条UGC笔记,并引入文化有效性评估标准,实验表明传统指标无法捕捉文化有效性,且基础LLM的文化有效性与模型规模相关。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25430 2026-05-26 cs.AI

CODESKILL: Learning Self-Evolving Skills for Coding Agents

CODESKILL:学习自进化技能的编码智能体

Yanzhou Li, Yiran Zhang, Xiaoyu Zhang, Xiaoxia Liu, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

AI总结 提出CODESKILL框架,通过强化学习从编码智能体轨迹中提取多粒度程序性技能并维护技能库,提升下游任务解决能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25426 2026-05-26 cs.GR cs.CV

Learning View-Dependent Splatting Kernels

学习视图相关的溅射核

Huakeng Ding, Zhanpeng Liu, Fan Pei, Kun Zhou, Hongzhi Wu

机构 * State Key Lab of CAD and CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室) Hangzhou Research Institute of Holographic and AI Technology(杭州全息与人工智能技术研究院)

AI总结 提出一种可微框架,通过自动学习视图相关的2D核,在基于溅射的管线中提升新视角合成质量与表示效率。

Comments Accepted to SIGGRAPH 2026. 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25345 2026-05-26 cs.GR cs.CV

Depth Peeling for High-Fidelity Gaussian-Enhanced Surfel Rendering

用于高保真高斯增强面元渲染的深度剥离

Keyang Ye, Hongzhi Wu, Kun Zhou

机构 * State Key Lab of CAD&CG, Zhejiang University(计算机辅助设计与图形学国家重点实验室,浙江大学) Hangzhou Research Institute of Holographic and AI Technology(杭州全息与人工智能技术研究院)

AI总结 提出DP-GES,通过半透明边界增强不透明面元并利用深度剥离建立逐像素排序,实现无排序高斯溅射和正确透射率调制,消除锯齿和弹出伪影,提升重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17287 2026-05-26 cs.CV

LISA: Language-guided Interference-aware Spatial-Frequency Attention for Driver Gaze Estimation

LISA: 语言引导的干扰感知空间-频率注意力用于驾驶员视线估计

Jun Ma, Zhenye Yang, Ruichen Zhou, Pei Zhang, Huan Li, Jinpeng Chen

机构 * School of Computer Science (National Pilot Software Engineering School), Beijing University of Posts and Telecommunications(北京邮电大学计算机科学学院(国家级试点软件工程学院)) Key Laboratory of Trustworthy Distributed Computing and Service (BUPT), Ministry of Education(教育部可信分布式计算与服务重点实验室(BUPT)) School of Electrical Engineering, Guangxi University(广西大学电气工程学院) Zhejiang University(浙江大学)

AI总结 提出LISA框架,结合频域先验与视觉语言知识,通过双域融合机制和训练时解耦策略,实现鲁棒的驾驶员视线估计,在遮挡和光照变化下达到最优性能。

Comments 9 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13643 2026-05-26 cs.CL

Prefix Teach, Suffix Fade: Local Teachability Collapse in Strong-to-Weak On-Policy Distillation

前缀教导,后缀消退:强到弱在线策略蒸馏中的局部可教性崩溃

Kaiyuan Liu, Ziyuan Zhuang, Yang Bai, Bing Wang, Rongxiang Weng, Jieping Ye

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Meituan LongCat Team, China(美团LongCat团队,中国) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院)

AI总结 本文发现强到弱在线策略蒸馏中,教师反馈在生成轨迹的后缀部分缺乏局部对比度,导致“局部可教性崩溃”,并提出基于变化点检测的截断规则来优化监督区域,实验表明该方法优于全轨迹蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12374 2026-05-26 cs.CV cs.AI cs.LG

Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models

填补GAP:多模态大语言模型中视觉推理的粒度对齐范式

Yanting Miao, Yutao Sun, Dexin Wang, Mengyu Zhou, Pascal Poupart, Lei Lv, Qi Zhao, Li Wang, Hao Li, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Alibaba University of Waterloo(阿里大学水力学院) Vector Institute(向量研究所) Zhejiang University(浙江大学)

AI总结 提出GAP(粒度对齐范式),通过特征级、上下文级和能力引导级对齐,解决多模态大语言模型中视觉潜在推理的特征空间不匹配问题,提升感知与推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18735 2026-05-26 cs.CV cs.AI

$M^3-Verse$: A "Spot the Difference" Challenge for Large Multimodal Models

$M^3-Verse$: 大型多模态模型的“找不同”挑战

Kewei Wei, Bocheng Hu, Jie Cao, Xiaohan Chen, Zhengxi Lu, Wubing Xia, Weili Xu, Jiaao Wu, Junchen He, Mingyu Jia, Ciyun Zhao, Ye Sun, Yizhi Li, Zhonghan Zhao, Jian Zhang, Gaoang Wang

机构 * Zhejiang University, China(浙江大学) Shanghai AI Lab, China(上海人工智能实验室) Hangzhou Normal University, China(杭州师范大学)

AI总结 提出 $M^3-Verse$ 基准,通过多视角视频对评估 LMM 在一致空间中对物体动态变化的理解能力,并验证了现有模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15264 2026-05-26 cs.CV

DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion

DriveGen3D: 通过高效视频扩散提升前馈驾驶场景生成

Weijie Wang, Jiagang Zhu, Zeyu Zhang, Xiaofeng Wang, Zheng Zhu, Guosheng Zhao, Chaojun Ni, Haoxiao Wang, Guan Huang, Xinze Chen, Yukun Zhou, Wenkang Qin, Duochao Shi, Haoyun Li, Yicheng Xiao, Donny Y. Chen, Jiwen Lu

机构 * Zhejiang University(浙江大学) GigaAI Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Peking University(北京大学) Monash University(墨尔本大学)

AI总结 提出DriveGen3D框架,结合快速视频扩散Transformer(FastDrive-DiT)和前馈3D重建模块(FastRecon3D),实现高质量、可控的动态3D驾驶场景生成,在长视频和3D一致性上达到最优。

Comments ICME 2026 Oral, Project Page: https://lhmd.top/drivegen3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24621 2026-05-26 cs.CV

FreeRet: MLLMs as Training-Free Retrievers

FreeRet: 无需训练的多模态大语言模型检索器

Yuhan Zhu, Xiangyu Zeng, Chenting Wang, Xinhao Li, Chunxu Liu, Yicheng Xu, Ziang Yan, Yi Wang, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Institute of Science Tokyo(东京科学研究院) Zhejiang University(浙江大学)

AI总结 提出FreeRet框架,将现成的多模态大语言模型转化为无需额外训练的两阶段检索器,通过语义嵌入和重排序提升检索性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23651 2026-05-26 cs.RO

HeLoM: Hierarchical Learning for Whole-Body Loco-Manipulation by a Hexapod Robot

HeLoM: 六足机器人全身移动操作的分层学习

Xinrong Yang, Peizhuo Li, Hongyi Li, Yifeng Peng, Arhaan Jain, Junkai Lu, Linnan Chang, Yuhong Cao, Yifeng Zhang, Ge Sun, Guillaume Sartoretti

机构 * MARMoT Lab, Department of Mechanical Engineering, National University of Singapore(机械工程系,新加坡国立大学MARMoT实验室) Center for X-mechanics, Zhejiang University(浙江大学X力学中心)

AI总结 提出HeLoM分层框架,通过协调多肢控制实现六足机器人对重/不规则物体的稳定推动,在仿真和实物实验中验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22299 2026-05-26 cs.LG cs.AI

HEAPr: Hessian-based Efficient Atomic Expert Pruning in Output Space

HEAPr: 基于Hessian的输出空间中高效原子专家剪枝

Ke Li, Zheng Yang, Zhongbin Zhou, Feng Xue, Zhonglin Jiang, Wenxiao Wang

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) FABU Inc.(FABU公司) Hangzhou Kuaidi Science and Technology Co., Ltd.(杭州快的科学技术有限公司)

AI总结 针对MoE模型粗粒度专家剪枝导致精度下降的问题,提出HEAPr算法,通过将专家分解为原子专家并利用二阶信息(最优脑外科原理)评估重要性,在输出空间简化计算,实现高比例无损压缩。

Comments ICLR 2026

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25179 2026-05-26 cs.CL

Locality Matters for Training-Free Audio Token Compression in Audio-Language Models

局部性对音频-语言模型中免训练音频令牌压缩的重要性

Jiale Luo, Xiaoyu Liang, Haoji Hu

机构 * Zhejiang University(浙江大学)

AI总结 提出局部时间二分图合并(LTBM)方法,通过显式时间窗口约束合并相似邻近音频令牌,实现免训练的编码器空间压缩,并验证了局部性归纳偏置在音频令牌压缩中的任务依赖性优势。

Comments Preprint. 8 pages main text, 10 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25045 2026-05-26 cs.AI

AION: Next-Generation Tasks and Practical Harness for Time Series

AION:下一代时间序列任务与实用框架

Tianxiang Zhan, Xiaobao Song, Tong Guan, Shirui Pan, Ming Jin

机构 * Griffith University(格里菲斯大学) Shenzhen University(深圳大学) Zhejiang University(浙江大学)

AI总结 针对时间序列研究向结合预测、上下文推理、工具使用和结构化决策支持的现实任务转变,提出AION框架,通过时间锚定、知识推理和可靠性机制(如实验后分析和分层审查)实现更详细的过程追踪和审查步骤。

Comments Project page and code are available at https://github.com/ztxtech/aion

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25022 2026-05-26 cs.CV cs.AI

D3S2: Diffusion-Guided Dataset Distillation for Semantic Segmentation

D3S2: 扩散引导的语义分割数据集蒸馏

Wenjie Zheng, Haoji Hu, Jiali Lu, Xingze Zou, Jing Wang

机构 * Zhejiang University(浙江大学)

AI总结 针对语义分割数据集蒸馏中的长尾类别不平衡、像素级对齐和高计算成本问题,提出两阶段框架D3S2,通过类别平衡掩码选择和扩散引导图像合成生成紧凑训练集,在极低压缩率下显著提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25009 2026-05-26 cs.CV

ClueAegis: Heuristic-to-Reasoning Cognitive-skill Learning for Unified Evidence-based Synthetic Image Detection

ClueAegis:面向统一基于证据的合成图像检测的启发式到推理认知技能学习

Huangsen Cao, Hongkang Chu, Yuxi Li, Ying Zhang, Chen Li, Jing Lyu, Yongwei Wang, Yu Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) WeChat Vision, Tencent Inc(腾讯微信视觉实验室) University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 针对现有合成图像检测方法缺乏结构化取证推理的问题,提出一种启发式到推理的认知技能学习框架ClueAegis,通过两阶段智能体流程实现技能选择与证据引导推理,在跨域泛化和鲁棒性上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25004 2026-05-26 cs.LG cs.AI

Metropolis-Scale Resilient and Trustworthy Traffic Flow Inference Using Multi-Source Data

基于多源数据的都市尺度弹性可信交通流推断

Qishen Zhou, Yifan Zhang, Michail A. Makridis, Anastasios Kouvelas, Yibing Wang, Simon Hu

机构 * School of Transportation, Jilin University(吉林大学交通运输学院) Department of Computer Science, City University of Hong Kong (Dongguan)(香港城市大学(东莞)计算机科学系) Institute for Transport Planning and Systems, ETH Zurich(苏黎世联邦理工学院交通规划与系统研究所) Institute of Intelligent Transportation Systems, College of Civil Engineering and Architecture, Zhejiang University(浙江大学智能交通系统研究所) ZJU-UIUC Institute, Zhejiang University(浙江大学-UIUC研究院)

AI总结 提出任务感知注意力神经过程(TA-ANP)统一概率框架,融合浮动车数据和稀疏固定检测器数据,实现高精度、可信的不确定性量化的全局交通状态推断,并在都市尺度数据集上取得最优性能。

Comments The paper has been submitted to Elsevier for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24860 2026-05-26 eess.SY cs.AI cs.ET cs.LG cs.RO cs.SY

DBPnet: Damper Characteristics-Based Bayesian Physics-Informed Neural Network for Wheel Load Estimation

DBPnet:基于阻尼特性的贝叶斯物理信息神经网络用于车轮载荷估计

Tianyi Wang, Tianyi Zeng, Zimo Zeng, Feiyang Zhang, Yujin Wang, Xiangyu Li, Yiming Xu, Sikai Chen, Junfeng Jiao, Christian Claudel, Xinbo Chen

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程系) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) College of Electrical Engineering, Zhejiang University(浙江大学电气工程学院) School of Automotive Studies, Tongji University(同济大学汽车学院) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院) Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系)

AI总结 提出DBPnet,一种结合阻尼特性嵌入模块的贝叶斯物理信息神经网络,通过悬架连杆级建模和物理信息损失函数,实现鲁棒的车轮载荷估计。

Comments 14 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24817 2026-05-26 cs.CR cs.AR cs.CL cs.LG

RouteScan: A Non-Intrusive Approach to Auditing MoE LLMs Safety via Expert Routing Telemetry

RouteScan: 通过专家路由遥测对MoE大语言模型安全性进行非侵入式审计

Bo Lv, Zhiheng Xu, KeDong Xiu, Ruyi Ding, Tianhang Zheng, Zhibo Wang, Kui Ren

机构 * Zhejiang University(浙江大学) Donghua University(东华大学) Louisiana State University(路易斯安那州立大学)

AI总结 提出RouteScan,一种利用MoE模型GPU级专家路由遥测(如预填充阶段活跃线程数)作为微架构指纹,通过轻量级检测流水线识别恶意提示的非侵入式审计框架,在未见过的有害领域AUROC超0.93,新越狱包装下超0.96,且相比基于内容的审计方法具有隐私优势。

Comments 20 pages. Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24687 2026-05-26 cs.CV cs.AI

HoloFair: Unified T2I Fairness Evaluation and Fair-GRPO Debiasing

HoloFair: 统一的T2I公平性评估与Fair-GRPO去偏

Ruyi Chen, Lu Zhou, Xiaogang Xu, Chiyu Zhang, Jiafei Wu, Liming Fang

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) School of Software Technology, Zhejiang University, Ningbo, China(浙江大学宁波校区软件学院) Ningbo Global Innovation Center, Zhejiang University, Ningbo, China(浙江大学宁波全球创新中心) Collaborative Innovation Center of Novel Software Technology and Industrialization(新型软件技术与产业化协同创新中心)

AI总结 提出HoloFair基准框架,通过多属性组间偏差指数(MGBI)评估文本到图像模型的公平性,并引入基于强化学习的Fair-GRPO方法进行去偏,在SD3.5-Medium模型上显著提升多维公平性且保持图像质量。

Comments Accepted to ICML 2026. Code and dataset are available at https://github.com/1059684669/HoloFair

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16100 2026-05-26 cs.CV

Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP

重新评估CLIP中的模态内错位假设

Jonas Herzog, Yue Wang

机构 * Zhejiang University(浙江大学)

AI总结 本文质疑CLIP的模态内错位假设,通过理论分析和实验证明图像嵌入距离不存在所谓的自由度,且模态内任务性能差异主要源于任务歧义而非错位。

Comments Accepted for CVPR'26. Project Page: https://vision-kek.github.io/Is-CLIP-Really-Misaligned/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22925 2026-05-26 cs.IR cs.AI cs.LG

BEAR: Towards Beam-Search-Aware Optimization for Recommendation with Large Language Models

BEAR:面向大语言模型推荐中束搜索感知的优化

Weiqin Yang, Bohao Wang, Zhenxiang Xu, Jiawei Chen, Shengjia Zhang, Jingbang Chen, Canghong Jin, Can Wang

机构 * Zhejiang University(浙江大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hangzhou City University(杭州市城市大学)

AI总结 针对监督微调与束搜索推理之间的不一致性,提出BEAR正则化方法,通过确保正例每个token在解码步骤中排名前B来避免过早剪枝,显著提升推荐性能。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00375 2026-05-26 cs.RO

DPNet: Doppler LiDAR Motion Planning for Highly-Dynamic Environments

DPNet: 面向高动态环境的多普勒激光雷达运动规划

Wei Zuo, Zeyi Ren, Chengyang Li, Yikun Wang, Mingle Zhao, Shuai Wang, Wei Sui, Fei Gao, Yik-Chung Wu, Chengzhong Xu

机构 * The University of Hong Kong(香港大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) University of Macau(澳门大学) D-Robotics Zhejiang University(浙江大学)

AI总结 提出DPNet,通过多普勒卡尔曼神经网络跟踪快速障碍物并利用多普勒调谐模型预测控制实现高动态环境下的高频高精度运动规划。

Comments Accepted to IEEE Robotics and Automation Letters in April, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏