arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Zhejiang University(浙江大学)

共收录 2925
2604.24564 2026-05-01 cs.CL cs.IR cs.IT math.IT

MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG

MEG-RAG: 多模态证据 grounding 的量化研究以提升 RAG 中的证据选择

Xihang Wang, Zihan Wang, Chengkai Huang, Quan Z. Sheng, Lina Yao

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Zhejiang University(浙江大学) Peking University(北京大学) University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) CSIRO’s Data61(CSIRO 数据61)

AI总结 本文提出 MEG-RAG 框架,通过语义感知的多模态证据 grounding 方法提升 RAG 中的证据选择准确性与多模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23065 2026-05-01 cs.GR cs.CV

EAG-PT: Emission-Aware Gaussians and Path Tracing for Diffuse Indoor Scene Reconstruction and Editing

EAG-PT:考虑发射的高斯和路径追踪用于漫反射室内场景重建与编辑

Xijie Yang, Mulin Yu, Changjian Jiang, Kerui Ren, Tao Lu, Jiangmiao Pang, Dahua Lin, Bo Dai, Linning Xu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学)

AI总结 EAG-PT通过统一的2D高斯表示实现室内场景的物理重建与渲染,支持可编辑的漫反射全局光照,结合高效单次反弹优化和高质量多次反弹路径追踪,优于现有方法。

Comments SIGGRAPH 2026 Conference Paper; Project Page: https://eag-pt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26951 2026-04-30 cs.CL cs.AI cs.LG

Turning the TIDE: Cross-Architecture Distillation for Diffusion Large Language Models

将TIDE转向:用于扩散大语言模型的跨架构蒸馏

Gongbo Zhang, Wen Wang, Ye Tian, Li Yuan

机构 * Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 本文提出TIDE框架,通过跨架构蒸馏提升扩散大语言模型性能,采用三个模块解决不同架构间的知识转移问题,在八个基准测试中平均提升1.53分,尤其在代码生成任务中表现突出。

Comments 15 pages, 3 figures. Code: https://github.com/PKU-YuanGroup/TIDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11399 2026-04-30 cs.LG eess.SP

Quantifying Climate Change Impacts on Renewable Energy Generation: A Super-Resolution Recurrent Diffusion Model

量化气候变化对可再生能源发电的影响:一种超分辨率递归扩散模型

Xiaochong Dong, Jun Dan, Yingyun Sun, Yang Liu, Xuemin Zhang, Shengwei Mei

机构 * College of Information Science & Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Department of Engineering, King’s College London(伦敦国王学院工程系)

AI总结 本文提出超分辨率递归扩散模型(SRDM),用于提升气候数据的时间分辨率并模拟风能和光伏发电的长期预测,通过案例研究验证了其在不同气候路径下的优越性。

Comments Accepted by CSEE Journal of Power and Energy Systems in Jul. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26353 2026-04-30 cs.CV

GateMOT: Q-Gated Attention for Dense Object Tracking

Mingjin Lv, Zelin Liu, Feifei Shao, Yi-Ping Phoebe Chen, Junqing Yu, Wei Yang, Zikai Song

机构 * Huazhong University of Science and Technology, Wuhan, China(华中科技大学,武汉,中国) Zhejiang University, Hangzhou, China(浙江大学,杭州,中国) La Trobe University, Melbourne, Australia(拉筹伯大学,墨尔本,澳大利亚)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26341 2026-04-30 cs.CV

SpatialFusion: Endowing Unified Image Generation with Intrinsic 3D Geometric Awareness

SpatialFusion:赋予统一图像生成内在三维几何意识

Haiyi Qiu, Kaihang Pan, Jiacheng Li, Juncheng Li, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) HiThink Research(HiThink研究院)

AI总结 本文提出SpatialFusion框架,通过引入混合变压器增强MLLM的三维几何建模能力,并利用深度适配器将显式几何约束注入扩散模型,提升空间感知任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26261 2026-04-30 cs.CV

Multiple Consistent 2D-3D Mappings for Robust Zero-Shot 3D Visual Grounding

多一致的2D-3D映射用于鲁棒的零样本3D视觉定位

Yufei Yin, Jie Zheng, Qianke Meng, Zhou Yu, Minghao Chen, Jiajun Ding, Min Tan, Yuling Xi, Zhiwen Chen, Chengfei Lv

机构 * Hangzhou Dianzi University(杭州电子科技大学) Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(Inria巴黎-鲁克蒙特研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒实验室)

AI总结 本文提出MCM-VG框架,通过建立多一致的2D-3D映射实现鲁棒的零样本3D视觉定位,解决开放词汇3D提案质量差的问题,提升目标定位和推理的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10998 2026-04-30 cs.CR cs.CL

SCOUT: A Defense Against Data Poisoning Attacks in Fine-Tuned Language Models

SCOUT:一种对抗微调语言模型数据中毒攻击的防御方法

Mohamed Afane, Abhishek Satyam, Ke Chen, Tao Li, Junaid Farooq, Juntao Chen

机构 * Department of Computer and Information Sciences, Fordham University(福特汉姆大学计算机与信息科学系) Department of Electrical Engineering, Zhejiang University(浙江大学电子工程系) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) Department of Electrical and Computer Engineering, University of Michigan-Dearborn(密歇根大学迪尔伯恩分校电气与计算机工程系)

AI总结 本文提出SCOUT框架,通过令牌级显著性分析检测数据中毒攻击,有效识别隐含触发器,提升对复杂攻击的防御能力。

Comments 9 pages, 3 figures

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21828 2026-04-30 cs.CV cs.CL

Structured and Abstractive Reasoning on Multi-modal Relational Knowledge Images

多模态关系知识图像上的结构化与抽象推理

Yichi Zhang, Zhuo Chen, Lingbing Guo, Wen Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

AI总结 本文提出STAR-64K数据集及两阶段增强框架,通过合成多模态指令数据提升模型在抽象推理任务中的性能,实验表明小型模型在STAR任务中超越GPT-4o。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10150 2026-04-30 cs.LG cs.AI

Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective

重新思考RLVR中的熵干预:从熵变化视角

Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen

机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Tencent(腾讯) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 本文从熵变化角度分析RLVR中的熵崩溃问题,提出STEER方法通过理论估计熵变化来调整token权重,有效缓解熵崩溃并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25806 2026-04-29 cs.CL cs.AI cs.HC

MAIC-UI: Making Interactive Courseware with Generative UI

MAIC-UI: 用生成式UI制作交互式课程ware

Shangqing Tu, Yanjia Li, Keyu Chen, Sichen Zhang, Jifan Yu, Daniel Zhang-Li, Lei Hou, Juanzi Li, Yu Zhang, Huiqin Liu

机构 * Tsinghua University(清华大学) Guangzhou University(广州大学) Zhejiang University(浙江大学)

AI总结 MAIC-UI通过零代码系统实现教育者快速编辑交互式课程ware,采用多模态知识分析、生成-验证-优化流程和点击定位编辑技术,提升教学效果和学习公平性。

Comments You can try our demo at https://open.maic.chat/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25562 2026-04-29 cs.CR cs.AI

SnapGuard: Lightweight Prompt Injection Detection for Screenshot-Based Web Agents

SnapGuard: 基于截图的轻量级提示注入检测方法

Mengyao Du, Han Fang, Haokai Ma, Jiahao Chen, Kai Xu, Quanjun Yin, Ee-Chien Chang

机构 * National University of Defense Technology(国防科技大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 针对基于截图的网络代理面临的提示注入攻击问题,提出SnapGuard方法,通过视觉稳定指标和文本信号分析实现高效检测,达到F1得分0.75,速度提升8倍。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11100 2026-04-29 cs.AI

ReCreate: Reasoning and Creating Domain Agents Driven by Experience

ReCreate:基于经验的推理与创造领域代理框架

Zhezheng Hao, Hong Wang, Jian Luo, Jianqing Zhang, Yuyan Zhou, Qiang Lin, Can Wang, Hande Dong, Jiawei Chen

机构 * Zhejiang University(浙江大学) Tencent(腾讯) Independent Researcher(独立研究者) Shanghai Jiao Tong University(上海交通大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 本文提出ReCreate框架,通过利用代理交互历史,自动创建和适应领域代理,优于人类设计和现有自动化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08323 2026-04-29 cs.CV

Detecting Dental Landmarks from Intraoral 3D Scans: the 3DTeethLand challenge

从口内3D扫描中检测牙齿标志:3DTeethLand挑战

Achraf Ben-Hamadou, Nour Neifar, Ahmed Rekik, Oussama Smaoui, Firas Bouzguenda, Sergi Pujades, Niels van Nistelrooij, Shankeeth Vinayahalingam, Kaibo Shi, Hairong Jin, Youyi Zheng, Tibor Kubík, Oldřich Kodym, Petr Šilling, Kateřina Trávníčková, Tomáš Mojžiš, Jan Matula, Jeffry Hartanto, Xiaoying Zhu, Kim-Ngan Nguyen, Tudor Dascalu, Huikai Wu, and Weijie Liu, Shaojie Zhuang, Guangshun Wei, Yuanfeng Zhou

机构 * Department of Oral Maxillofacial Surgery, Radboud University Medical Center, Geert Grooteplein Zuid 10, 6525 GA Nijmegen, Netherlands organization= State Key Lab of CAD\&CG, Zhejiang University, Hangzhou, 310058 , country= China organization= Department of Computer Graphics Multimedia, Brno University of Technology , city= Brno , country= Czech Republic text= National Dental Centre Singapore organization= Guangxi Colleges Universities Key Laboratory of Intelligent Software ,country= Wuzhou University text= National University of Singapore organization= Department of Computer Science , country = University of Copenhagen organization= School of Software, Shandong University , country= China Centre de Recherche en Num\' e rique de Sfax, Laboratory of Signals, Systems, Artificial Intelligence Inria, Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK, France

AI总结 本文提出3DTeethLand挑战,通过公开数据集评估牙齿标志检测算法,推动临床应用。挑战引入340个口内3D扫描数据,49支队伍参与,最终6支进入决赛,展示高精度与召回率的平衡方法。

Comments MICCAI 2024, 3DTeethLand, Challenge report, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17387 2026-04-29 cs.RO

High-Precision and High-Efficiency Trajectory Tracking for Excavators Based on Closed-Loop Dynamics

基于闭环动力学的高精度高效率挖掘机轨迹跟踪

Ziqing Zou, Cong Wang, Yue Hu, Xiao Liu, Bowen Xu, Rong Xiong, Changjie Fan, Yingfeng Chen, Yue Wang

机构 * Zhejiang University(浙江大学) Fuxi Robotics Lab, NetEase Inc.(网易弗西机器人实验室)

AI总结 本文提出EfficientTrack方法,结合模型学习和闭环动力学,解决液压挖掘机非线性动力学难题,提升轨迹跟踪精度与效率,实验证明其在仿真和实际应用中均优于传统方法。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Hangzhou, China, 2025, pp. 5617-5624

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25477 2026-04-29 cs.CV cs.AI

DDA-Thinker: Decoupled Dual-Atomic Reinforcement Learning for Reasoning-Driven Image Editing

DDA-Thinker: 解耦双原子强化学习用于推理驱动的图像编辑

Hanqing Yang, Qiang Zhou, Yongchao Du, Sashuai Zhou, Zhibin Wang, Jun Song, Tiezheng Ge, Cheng Yu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

AI总结 本文提出DDA-Thinker框架,通过解耦的规划模块与固定生成模型,提升图像编辑中的推理能力,采用双原子强化学习分解反馈,结合可验证检查清单提升训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25444 2026-04-29 cs.CL

One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement

一个refiner解锁所有:通过强化查询细化实现推理时间推理 elicitation

Yixiao Zhou, Dongzhou Cheng, zhiliang wu, Yi Yang, Yu Cheng, Hehe Fan

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出ReQueR框架,通过强化学习训练专门的Refiner策略,将推理 elicitation作为推理时间对齐任务,实现对多种模型的推理能力解锁,提升性能2.1%。

Comments Accepted to ACL26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25427 2026-04-29 cs.CV

A Systematic Post-Train Framework for Video Generation

视频生成的系统性后训练框架

Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

机构 * The University of Hong Kong(香港大学) JD Explore Academy(京东探索研究院) Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 本文提出系统性后训练框架,通过四个协同阶段提升视频生成的视觉质量、时间一致性和指令遵循性,同时保持预训练阶段的可控性。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25419 2026-04-29 cs.AI

JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR

JURY-RL: 选票提议,证明判定用于无标签的RLVR

Xinjie Chen, Biao Fu, Jing Wu, Guoxin Chen, Xinggao Liu, Dayiheng Liu, Minpeng Liao

机构 * Zhejiang University, Hangzhou, China(浙江大学,杭州,中国) Tongyi Lab, Alibaba Group, Hangzhou, China(通义实验室,阿里巴巴集团,杭州,中国)

AI总结 JURY-RL提出一种无标签RLVR框架,通过模型回放提议候选答案,形式验证器判定是否可获正奖,从而稳定训练并提升数学推理性能。

Comments Preprint. 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25300 2026-04-29 cs.CV eess.IV

DenseScout: Algorithm-System Co-design for Budgeted Tiny Object Selection on Edge Platforms

DenseScout: 面向边缘平台的预算有限小目标选择的算法-系统联合设计

Xiong Zhouzhi, Zimo Zeng, Yi Chen, Shuqi Xu, Yunfeng Yan, Donglian Qi

机构 * College of Electrical Engineering, Zhejiang University(浙江大学电气工程学院)

AI总结 本文提出DenseScout,一种轻量级密集响应选择器,用于在边缘平台预算有限的情况下高效选择小目标候选区域,通过算法-系统联合设计提升部署性能。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24819 2026-04-29 cs.SE cs.AI

Programming with Data: Test-Driven Data Engineering for Self-Improving LLMs from Raw Corpora

用数据编程:面向自改进大语言模型的测试驱动数据工程

Chenkai Pan, Xinglong Xu, Yuhang Xu, Yujun Wu, Siyuan Li, Jintao Chen, Conghui He, Jingxuan Wei, Cheng Tan

机构 * Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出通过数据编程方法,将数据工程生命周期映射到软件开发生命周期,实现对大语言模型的可靠训练与改进,通过数据修复提升模型性能。

Comments 57 pages, 28 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14862 2026-04-29 cs.CL cs.AI

Schema Key Wording as an Instruction Channel in Structured Generation under Constrained Decoding

模式键作为在受限解码下的指令通道在结构生成中的应用

Yifan Le

机构 * Zhejiang University(浙江大学)

AI总结 本文探讨了在受限解码中模式键作为隐式指令通道的作用,提出结构生成是多通道指令问题,并通过实验展示模式键词汇对准确性的影响,揭示了不同模型对不同通道的依赖性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17729 2026-04-29 cs.CV cs.AI

SARE: Sample-wise Adaptive Reasoning for Training-free Fine-grained Visual Recognition

SARE:基于样本的自适应推理用于无训练细粒度视觉识别

Jingxiao Yang, DaLin He, Miao Pan, Kaixiang Yao, Ge Su, Wenqi Zhang, Yifeng Hu, Tangwei Li, Yuke Li, Xuhong Zhang

机构 * Zhejiang University(浙江大学) Netease Yidun AI Lab(网易云智AI实验室)

AI总结 SARE提出一种样本自适应推理框架,通过结合快速候选检索与细粒度推理,利用历史失败经验提升无训练细粒度视觉识别的准确性和效率。

Comments preprint, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04682 2026-04-29 cs.CV

HATIR: Heat-Aware Diffusion for Turbulent Infrared Video Super-Resolution

HATIR: 用于湍流红外视频超分辨率的热感知扩散

Yang Zou, Xingyue Zhu, Kaiqi Han, Jun Ma, Xingyuan Li, Zhiying Jiang, Jinyuan Liu

机构 * Northwestern Polytechnical University(西北工业大学) Dalian University of Technology(大连理工大学) Zhejiang University(浙江大学) Dalian Maritime University(大连海事大学)

AI总结 HATIR通过热感知变形先验联合建模湍流退化与结构细节损失,提出相位引导流估计器和湍流感知解码器,构建首个湍流红外视频超分辨率数据集FLIR-IVSR,提升非均匀退化下的结构恢复精度。

Journal ref Proceedings of the 40th Annual AAAI Conference on Artificial Intelligence (AAAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24690 2026-04-28 cs.CL

Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination

LLMs能否成为历史学家?通过中国科举制度评估LLMs的历史研究能力

Lirong Gao, Zeqing Wang, Yuyan Cai, Jiayi Deng, Yanmei Gu, Yiming Zhang, Jia Zhou, Yanfei Zhang, Junbo Zhao

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

AI总结 本文提出ProHist-Bench基准,基于中国科举制度评估LLMs的历史研究能力,揭示其在复杂历史问题上的不足,旨在推动领域特定推理LLM的发展。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24575 2026-04-28 cs.CV

Diffusion Model as a Generalist Segmentation Learner

扩散模型作为通用分割学习者

Haoxiao Wang, Antao Xiang, Haiyang Sun, Peilin Sun, Changhao Pan, Yifu Chen, Minjie Hong, Weijie Wang, Shuang Chen, Yue Chen, Zhou Zhao

机构 * Zhejiang University(浙江大学) South China University of Technology(华南理工大学) Nanjing University(南京大学) Peking University(北京大学)

AI总结 本文提出DiGSeg,利用预训练扩散模型实现通用分割框架,通过编码图像和掩码到潜在空间,并结合CLIP对齐的文本路径,实现基于外观和任意文本提示的结构化分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24487 2026-04-28 cs.RO

Guiding Vector Field Generation via Score-based Diffusion Model

通过基于分数的扩散模型引导向量场生成

Zirui Chen, Shiliang Guo, Shiyu Zhao

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) WINDY Lab, Department of Artificial Intelligence, Westlake University(西湖大学人工智能系WINDY实验室)

AI总结 本文提出基于分数的引导向量场(SGVF),利用生成模型直接从数据分布构建向量场,解决传统方法在复杂路径中的不足,实验表明其在机器人导航中表现优异。

Comments 8 pages, 6 figrues, ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24468 2026-04-28 cs.CR cs.CL cs.DC cs.LG

A Survey on Split Learning for LLM Fine-Tuning: Models, Systems, and Privacy Optimizations

关于用于LLM微调的分裂学习的综述:模型、系统和隐私优化

Zihan Liu, Yizhen Wang, Rui Wang, Xiu Tang, Sai Wu

机构 * Zhejiang University(浙江大学)

AI总结 本文综述了分裂学习在LLM微调中的应用,探讨了模型、系统和隐私优化方法,旨在为该领域提供清晰的方向和系统的分类比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24459 2026-04-28 cs.CV

TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering

TextGround4M:一种对齐提示的布局感知文本渲染数据集

Dongxing Mao, Yilin Wang, Linjie Li, Zhengyuan Yang, Alex Jinpeng Wang

机构 * Central South University(中南大学) Zhejiang University(浙江大学) Microsoft Research(微软研究院)

AI总结 本文提出TextGround4M数据集,通过细粒度布局监督提升文本生成的准确性,引入轻量训练策略和布局评估指标,验证了布局感知在文本到图像生成中的重要性。

Comments aaai poster; Project page: https://dongxingmao.github.io/TextGround4M.github.io/

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, vol. 40, no. 10, pp. 7918-7926, Mar. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24350 2026-04-28 cs.LG cs.AI cs.CR

Unveiling the Backdoor Mechanism Hidden Behind Catastrophic Overfitting in Fast Adversarial Training

揭示隐藏在快速对抗训练中灾难性过拟合背后的后门机制

Mengnan Zhao, Lihe Zhang, Tianhang Zheng, Bo Wang, Baocai Yin

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院) School of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 本文通过后门视角解释了快速对抗训练中的灾难性过拟合,提出统一框架并提出缓解策略,实验验证了方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏