arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

2026-04-20 至 2026-04-20 共收录 12
2602.09953 2026-04-20 cs.CL

ATTNPO: Attention-Guided Process Supervision for Efficient Reasoning

ATTNPO:基于注意力的高效推理过程监督

Shuaiyi Nie, Siyu Ding, Wenyuan Zhang, Linhao Yu, Tianmeng Yang, Yao Chen, Weichong Yin, Yu Sun, Hua Wu, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc.(百度公司) Tianjin University(天津大学)

AI总结 本文提出ATTNPO,通过利用模型内在注意力信号进行步骤级信用分配,有效减少推理长度并提升性能,适用于9个基准测试。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15923 2026-04-20 cs.SD cs.CV

Hierarchical Codec Diffusion for Video-to-Speech Generation

层次编码扩散用于视频到语音生成

Jiaxin Ye, Gaoxiang Cong, Chenhui Wang, Xin-Cheng Wen, Zhaoyang Li, Boyuan Cao, Hongming Shan

机构 * Fudan University(复旦大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

AI总结 本文提出HiCoDiT,利用残差向量量化编码的层次结构,通过低层和高层块生成不同层级的语音令牌,以实现强音频视觉对齐,实验表明其在保真度和表达性上优于基线。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15821 2026-04-20 cs.DC cs.LG

Breaking the Training Barrier of Billion-Parameter Universal Machine Learning Interatomic Potentials

突破十亿参数通用机器学习互原子势的训练障碍

Yuanchang Zhou, Hongyu Wang, Yiming Du, Yan Wang, Mingzhen Li, Siyu Hu, Xiangyu Zhang, Weijian Liu, Chen Wang, Zhuoqiang Guo, Long Wang, Jingde Bu, Yutong Lu, Guangming Tan, Weile Jia

机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所 processors 国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Independent Researcher(独立研究者) Sun Yat-Sen University(中山大学)

AI总结 本文提出MatRIS-MoE和Janus框架,解决十亿参数uMLIP训练中的高维分布式训练与计算效率问题,将训练时间从周缩短至小时,为AI4S基础模型树立新标杆。

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15814 2026-04-20 cs.CV cs.RO

Continual Hand-Eye Calibration for Open-world Robotic Manipulation

连续手眼校准用于开放世界机器人操作

Fazeng Li, Gan Sun, Chenxi Liu, Yao He, Wei Cong, Yang Cong

机构 * School of Automation Science and Engineering, South China University of Technology(华南理工大学自动化科学与工程学院) State Key Laboratory of Robotics, the Institutes for Robotics and Intelligent Manufacturing, Chinese Academy of Sciences(中国科学院机器人研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出连续手眼校准框架,通过空间重放策略和结构保持蒸馏,解决开放世界中持续学习中的灾难性遗忘问题,实验验证其在多个数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15701 2026-04-20 cs.CL

Improving Reasoning Capabilities in Small Models through Mixture-of-Layers Distillation with Stepwise Attention on Key Information

通过关键信息的分步注意力混合层蒸馏提升小模型的推理能力

Yao Chen, Jiawei Sheng, Wenyuan Zhang, Tingwen Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

AI总结 本文提出一种基于分步注意力的混合层蒸馏方法,通过引导学生模型逐步聚焦关键信息,提升小模型的推理能力,并在多个数学和常识推理数据集上取得一致性能提升。

Comments Accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15370 2026-04-20 cs.CR cs.LG

TopFeaRe: Locating Critical State of Adversarial Resilience for Graphs Regarding Topology-Feature Entanglement

TopFeaRe: 在拓扑-特征纠缠视角下定位图的对抗鲁棒性临界状态

Xinxin Fan, Wenxiong Chen, Quanliang Jing, Chi Lin, Shaoye Luo, Wenbo Song, Yunfeng Lu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学) Beihang University(北京航空航天大学)

AI总结 本文提出TopFeaRe方法,通过定位图的对抗鲁棒性临界状态,结合复杂动态系统理论,创新性地建模对抗攻击、设计拓扑-特征纠缠函数,并验证了在多个真实数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02210 2026-04-20 cs.CV

HiFi-Inpaint: Towards High-Fidelity Reference-Based Inpainting for Generating Detail-Preserving Human-Product Images

HiFi-Inpaint:迈向高保真参考基于修复生成细节保留的人-产品图像

Yichen Liu, Donghao Zhou, Jie Wang, Xin Gao, Guisheng Liu, Jiatong Li, Quanwei Zhang, Qiang Lyu, Lanqing Guo, Shilei Wen, Weiqiang Wang, Pheng-Ann Heng

机构 * University of Chinese Academy of Sciences(中国科学院大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学)

AI总结 本文提出HiFi-Inpaint框架,通过Shared Enhancement Attention和Detail-Aware Loss解决人-产品图像生成中的细节保留问题,并构建了HP-Image-40K数据集,实验表明其在生成高保真图像方面表现优异。

Comments Accepted by CVPR 2026 (Project page: https://correr-zhou.github.io/HiFi-Inpaint/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05638 2026-04-20 cs.CV

SurgMotion: A Video-Native Foundation Model for Universal Understanding of Surgical Videos

SurgMotion: 一种用于外科视频通用理解的视频原生基础模型

Jinlin Wu, Felix Holm, Chuxi Chen, An Wang, Yaxin Hu, Xiaofan Ye, Zelin Zang, Miao Xu, Lihua Zhou, Huai Liao, Danny T. M. Chan, Ming Feng, Wai S. Poon, Hongliang Ren, Dong Yi, Nassir Navab, Gaofeng Meng, Jiebo Luo, Hongbin Liu, Zhen Lei

机构 * Center for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences, Hong Kong, China(人工智能与机器人中心,香港科学与创新研究院,中国科学院,香港,中国) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京,中国) Computer Aided Medical Procedures, Technical University of Munich, Munich, Germany(医学辅助程序,慕尼黑技术大学,德国慕尼黑) Electronic Engineering Department, The Chinese University of Hong Kong, Hong Kong, China(电子工程系,香港中文大学,香港,中国) Neuromedical Centre, Hong Kong University Shenzhen Hospital, Shenzhen, China(神经医学中心,香港大学深圳医院,深圳,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Department of Respiratory Medicine, The First Affiliated Hospital of Sun Yat-sen University, Guangzhou, China(呼吸科,中山大学附属第一医院,广州,中国)

AI总结 SurgMotion通过引入视频原生基础模型,将学习范式从像素级重建转向潜在运动预测,通过三种关键技术改进提升外科视频理解能力,实验表明其在手术流程识别、动作三元组识别和技能评估等任务中均取得显著优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10959 2026-04-20 cs.LG cs.AI cs.CL stat.ML

Revisiting Entropy Regularization: Adaptive Coefficient Unlocks Its Potential for LLM Reinforcement Learning

重新审视熵正则化:自适应系数解锁其在大语言模型强化学习中的潜力

Xiaoyun Zhang, Xiaojian Yuan, Di Huang, Wang You, Chen Hu, Jingqing Ruan, Ai Jian, Kejiang Chen, Xing Hu

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) StepFun Inc(StepFun公司)

AI总结 本文重新审视熵正则化在强化学习中的应用,提出自适应熵正则化框架,通过动态平衡探索与利用提升数学推理性能。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13215 2026-04-20 cs.CV

DVP-MVS++: Synergize Depth-Normal-Edge and Harmonized Visibility Prior for Multi-View Stereo

DVP-MVS++: 融合深度-法线-边缘与协调视图先验以实现多视图立体摄影

Zhenlong Yuan, Dapeng Zhang, Zehao Li, Chengxuan Qian, Jianing Chen, Yinda Chen, Kehua Chen, Tianlu Mao, Zhaoxin Li, Hao Jiang, Zhaoqi Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) DSLAB, School of Information Science & Engineering, Lanzhou University(兰州大学信息科学与工程学院DSLAB) School of Mathematical Science, Jiangsu University(江苏大学数学学院) MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学脑科学与智能感知教育部重点实验室) Agricultural Information Institute, Chinese Academy of Agricultural Sciences(中国农业科学院农业信息研究所) Key Laboratory of Agricultural Big Data, Ministry of Agriculture and Rural Affairs(农业农村部农业大数据重点实验室)

AI总结 本文提出DVP-MVS++方法,通过融合深度-法线-边缘对齐和协调跨视图先验,提升多视图立体摄影中鲁棒性和视图感知的补丁变形能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22171 2026-04-20 cs.CV

An Empirical Study of Validating Synthetic Data for Text-Based Person Retrieval

基于文本的人检索中合成数据验证的实证研究

Min Cao, Yuxin Lu, Ziyin Zeng, Dong Yi, Jinqiao Wang, Mang Ye

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Frontis Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artifcial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research, Wuhan, China(武汉人工智能研究所,武汉,中国) School of Computer Science, Wuhan University(武汉大学计算机学院)

AI总结 本文首次系统研究文本基于人检索中合成数据的有效性,提出统一合成 pipeline 并通过实验揭示其作为替代或补充的真实数据的实用性。

Comments 20 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07520 2026-04-20 cs.CV cs.IR

From Limited Labels to Open Domains:An Efficient Learning Method for Drone-view Geo-Localization

从有限标签到开放领域:一种用于无人机视角地理定位的高效学习方法

Zhongwei Chen, Zhao-Xu Yang, Hai-Jun Rong, Jiawei Lang, Guoqi Li

机构 * State Key Laboratory for Strength and Vibration of Mechanical Structures(强度与振动机械结构国家重点实验室) Shaanxi Key Laboratory of Environment and Control for Flight Vehicle(飞行器环境与控制陕西省重点实验室) School of Aerospace Engineering(航空工程学院) Xi’an Jiaotong University(西安交通大学) Institute of Automation(自动化研究所) Chinese Academy of Sciences(中国科学院) School of Artificial Intelligence(人工智能学院) University of Chinese Academy of Sciences(中国科学院大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文提出CDIKTNet,通过有限监督实现无人机视角地理定位的跨域不变知识迁移,解决传统方法依赖配对数据和跨视图相关性学习难题,提升少样本和跨域初始化性能。

Comments Accepted by IEEE Transactions on Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏