arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-04-09 至 2026-04-09 共收录 6
2604.06966 2026-04-09 cs.CV

MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation

MAR-GRPO:用于AR-扩散混合图像生成的稳定GRPO

Xiaoxiao Ma, Jiachen Lei, Tianfei Ren, Jie Huang, Siming Fu, Aiming Hao, Jiahong Wu, Xiangxiang Chu, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图) Zhejiang University(浙江大学)

AI总结 本文提出稳定RL框架用于MAR,通过多轨迹期望减少梯度噪声,结合不确定性估计和一致性aware的token选择策略,提升图像生成质量与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06777 2026-04-09 cs.CV

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization

行走与言说:通过多模态代理策略优化弥合图像推理与行动之间的差距

Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yuchen Zhou, Xiaobo Xia, Yuanyu Wan, Lijun Zhang, Tat-Seng Chua

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) AI Business, Alibaba Group(阿里巴巴集团智能计算研究院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, China(上海交通大学自动化与智能感知学院) School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能工程学院(深圳)) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) School of Software Technology, Zhejiang University, China(浙江大学软件学院) School of Computing, National University of Singapore, Singapore, Singapore(新加坡国立大学计算机学院)

AI总结 本文提出MAPO方法,通过强制生成视觉内容的显式文本描述,结合语义对齐与任务奖励,提升多模态推理能力,实验表明其在多个视觉推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06502 2026-04-09 cs.LG

VLMShield: Efficient and Robust Defense of Vision-Language Models against Malicious Prompts

VLMShield: 有效且稳健的视觉语言模型对抗恶意提示防御

Peigui Qi, Kunsheng Tang, Yanpu Yu, Jialin Wu, Yide Song, Wenbo Zhou, Zhicong Huang, Cheng Hong, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) University of Washington(华盛顿大学)

AI总结 本文提出VLMShield,通过多模态聚合特征提取框架提升视觉语言模型对恶意提示的防御能力,实验显示其在鲁棒性、效率和实用性方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20284 2026-04-09 cs.CV cs.GR eess.IV

STAC: Plug-and-Play Spatio-Temporal Aware Cache Compression for Streaming 3D Reconstruction

STAC:用于流式3D重建的时空感知缓存压缩

Runze Wang, Yuxuan Song, Youcheng Cai, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出STAC框架,通过时空感知缓存机制提升流式3D重建的内存效率和重建质量,减少内存消耗并加速推理。

Comments 10 pages, 6 figures. Accepted by CVPR 2026. This version includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00635 2026-04-09 cs.CV

Erased, But Not Forgotten: Erased Rectified Flow Transformers Still Remain Unsafe Under Concept Attack

被擦除,但未被遗忘:擦除的修正流变换器在概念攻击下仍不安全

Nanxiang Jiang, Zhaoxin Fan, Enhan Kang, Daiheng Gao, Yun Zhou, Yanxia Chang, Zheng Zhu, Yeying Jin, Wenjun Wu

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院未来区块链与隐私计算北京高精尖创新中心) University of Science and Technology of China(中国科学技术大学) National University of Defense Technology(国防科技大学) GigaAI National University of Singapore(新加坡国立大学)

AI总结 本文提出ReFlux,首个针对最新修正流T2I框架评估概念擦除鲁棒性的攻击方法,通过反注意力优化和动态引导策略,验证了概念擦除在修正流变换器中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02945 2026-04-09 cs.CL

ACE-Merging: Data-Free Model Merging with Adaptive Covariance Estimation

ACE-Merging:无数据模型融合与自适应协方差估计

Bo Xu, Haotian Wu, Hehai Lin, Weiquan Huang, Beier Zhu, Yao Shu, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出ACE-Merging方法,通过自适应协方差估计实现无数据模型融合,解决专家模型间干扰问题,实验表明其在视觉和语言基准上优于现有方法。

Comments Accepted to CVPR 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏