arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1952
2605.31058 2026-06-01 cs.CL cs.SE

Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination

组合合成:通过原子分解与重组扩展代码RLVR

Jiasheng Zheng, Boxi Cao, Boxi Yu, Yuzhong Zhang, Jialun Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Lero the Research Ireland Centre for Software, University of Limerick(利默尼克大学爱尔兰软件研究中心) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 提出原子分解与重组(ADR)框架,通过将代码任务分解为原子元素并受控重组,生成新颖且具有挑战性的可验证代码任务,以解决RLVR训练数据稀缺和扩展性问题,实验表明在多个下游领域显著提升代码能力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30833 2026-06-01 cs.CL cs.AI

Your Teacher Can't Help You Here: Combating Supervision Fidelity Decay in On-Policy Distillation

你的老师在这里帮不了你:对抗在线策略蒸馏中的监督保真度衰减

Yanjiang Liu, Jie Lou, Xinyan Guan, Yuqiu Ji, Hongyu Lin, Ben He, Xianpei Han, Le Sun, Xing Yu, Yaojie Lu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Chinese Information Processing Laboratory(中文信息处理实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

AI总结 针对在线策略蒸馏中监督保真度衰减问题,提出前瞻组奖励方法,通过评估学生候选词在后续步骤中诱导的教师置信度并分配组归一化奖励,结合熵触发树注意力机制,显著提升长链推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30383 2026-06-01 cs.RO cs.AI

Structured interactions improve distributed coordination beyond model scaling in a real-world multi-robot system

结构化交互在真实世界多机器人系统中超越模型规模提升分布式协调能力

Junping Wang, Zhizhong Zhang, Yongqiang Tang, Geng Zheng, Jiaming Zhang, Shiji Song, Yanmei Li, Yushan Ma

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Department of Automation, Tsinghua University(清华大学自动化系) Liupanshan Laboratory, Ningxia University(宁夏大学鲁班实验室)

AI总结 通过真实多机器人实验,发现模块化层次化交互拓扑相比增加模型规模能更显著提升协调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25134 2026-06-01 cs.LG cs.AI

Theoretical Analysis of Sparse Optimization with Reparameterization, Weight Decay, and Adaptive Learning Rate

重参数化、权重衰减和自适应学习率下稀疏优化的理论分析

Huangyu Xu, Jingqin Yang, Qianqian Xu, Jiaye Teng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) School of Computer Science and Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学计算机科学与技术学院,北京,中国) Beijing Academy of Artificial Intelligence (BAAI), Beijing, China(北京人工智能研究院(BAAI),北京,中国) IIIS, Tsinghua University, Beijing, China(清华大学人工智能院,北京,中国) School of Statistics and Management, Shanghai University of Finance and Economics, Shanghai, China(上海财经大学统计与管理学院,上海,中国) Institute of Data Science and Statistics, Shanghai University of Finance and Economics, Shanghai, China(上海财经大学数据科学与统计研究所,上海,中国)

AI总结 针对稀疏优化中的不稳定问题,提出基于重参数化、权重衰减和自适应学习率的ReWA方法,通过改善优化景观实现比ℓ1正则化更好的稀疏性,同时保持测试精度。

Comments 32 pages, 5 figures. Submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16084 2026-06-01 cs.CV cs.AI

SpectralTrain: A Universal Framework for Hyperspectral Image Classification

SpectralTrain:一种通用的高光谱图像分类框架

Meihua Zhou, Liping Yu, Xinyu Tong, Wai Kin Fung, Ruiguo Hu, Jiarui Zhao, Nan Wan

机构 * School of Medical Information, Wannan Medical University(皖南医学院信息学院) University of Chinese Academy of Sciences(中国科学院大学) The Chinese University of Hong Kong(香港中文大学) Northeastern University(东北大学)

AI总结 提出SpectralTrain通用训练框架,通过课程学习与基于PCA的光谱下采样提升高光谱图像分类效率,在多个数据集上实现2-7倍训练加速且精度损失小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12192 2026-06-01 cs.CL

Query-focused and Memory-aware Reranker for Long Context Processing

面向长上下文处理的查询聚焦与记忆感知重排序器

Yuqing Li, Jiangnan Li, Mo Yu, Guoxuan Ding, Yanyu Chen, Zheng Lin, Wei Zhang, Jie Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Pattern Recognition Center, WeChat AI, Tencent(腾讯微信人工智能研究院模式识别中心) East China Normal University(华东师范大学)

AI总结 提出一种基于大语言模型中检索头注意力分数的列表式重排序框架,利用候选列表整体信息估计段落-查询相关性,无需Likert监督,在多个领域取得最优性能。

Comments Add new experiments and compare more baselines

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19673 2026-06-01 cs.LG cs.AI cs.CL

Bottom-up Policy Optimization: Your Language Model Policy Secretly Contains Internal Policies

自底向上策略优化:你的语言模型策略内部隐藏着内部策略

Yuqiao Tan, Minzheng Wang, Shizhu He, Huanxuan Liao, Chengfeng Zhao, Qiunan Lu, Tian Liang, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tencent AI Lab(腾讯AI实验室)

AI总结 本文通过分解Transformer残差流中的内部层策略和内部模块策略,提出自底向上策略优化(BuPO)方法,通过早期优化内部层来重建LLM的推理基础,在复杂推理基准上验证了有效性。

Comments Preprint. Our code is available at https://github.com/Trae1ounG/BuPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20784 2026-06-01 cs.CL cs.AI

Towards Atoms of Large Language Models

迈向大型语言模型的原子

Chenhui Hu, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国)

AI总结 本文提出原子理论,通过原子内积(AIP)定义、评估和识别大型语言模型的基本表示单元(原子),并证明在阈值激活稀疏自编码器(TSAE)下原子可识别,实验发现神经元和特征不满足理想原子标准,而通过匹配TSAE容量与数据规模可识别出近乎完美的原子。

Comments To be published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17111 2026-06-01 cs.RO cs.LG

Efficient Vision-Language-Action Models for Embodied Manipulation: A Systematic Survey

面向具身操作的高效视觉-语言-动作模型:系统综述

Weifan Guan, Qinghao Hu, Aosheng Li, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) AiRiA Nanjing University of Information Science and Technology(南京信息科学技术大学)

AI总结 本文系统综述了通过模型架构、感知特征、动作生成和训练/推理策略四个维度降低视觉-语言-动作模型延迟、内存占用及计算成本的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29734 2026-05-29 cs.CL

HTAM: Hierarchical Transition-Attended Memory for Operator Optimization

HTAM: 用于算子优化的层次化过渡注意力记忆

Yining Zhang, Mingyang Yi, Chen Wang, Xuwen Xiang, Tianhe Jia, Zedong Dan, Chengqing Zong, Yue Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院) Renmin University of China(中国人民大学)

AI总结 提出HTAM框架,通过构建层次化过渡图(HTG)组织粗粒度全局方向和细粒度局部策略,解决LLM在GPU算子优化中粒度不匹配问题,显著提升正确率和加速比。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29591 2026-05-29 cs.AI

Mind-Omni: A Unified Multi-Task Framework for Brain-Vision-Language Modeling via Discrete Diffusion

Mind-Omni:通过离散扩散实现脑-视觉-语言建模的统一多任务框架

Yizhuo Lu, Changde Du, Qingyu Shi, Hang Chen, Jie Peng, Liuyun Jiang, Shuangchen Zhao, Huiguang He

机构 * NeuBCI Lab, State Key Laboratory of Brain Cognition Brain-inspired Intelligence Technology, Institute of Automation, Chinese Academy of Sciences, Beijing, China School of Future Technology, University of Chinese Academy of Sciences, Beijing, China School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China Zhongguancun Academy, Beijing, China Peking University, Beijing, China

AI总结 提出Mind-Omni框架,利用离散扩散范式统一七种编码与解码任务,通过脑分词器将连续脑信号转化为离散令牌,实现多模态交互,并构建脑问答指令调优数据集,在多项任务上达到或超越专用模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20752 2026-05-29 cs.RO

GaussianDream: A Feed-Forward 3D Gaussian World Model for Robotic Manipulation

GaussianDream:用于机器人操作的前馈3D高斯世界模型

Zijian Zhang, Yuqing Jiang, Qian Cheng, Xiaofan Li, Si Liu, Ding Zhao, Ping Luo, Weitao Zhou, Haibao Yu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学)

AI总结 提出GaussianDream,一种前馈3D高斯世界模型插件,通过可学习查询编码当前帧3D空间结构和短期未来演化,在训练时用静态重建和未来预测头监督,推理时仅保留查询条件化动作生成,在多个机器人操作基准上达到最先进性能。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12588 2026-05-29 cs.CV

SDF-Net: Structure-Aware Disentangled Feature Learning for Opticall-SAR Ship Re-identification

SDF-Net:面向光学-SAR船舶重识别的结构感知解耦特征学习

Furui Chen, Han Wang, Yuhan Sun, Jianing You, Yixuan Lv, Zhuang Zhou, Hong Tan, Shengyang Li

机构 * Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心) Key Laboratory of Space Utilization, Chinese Academy of Sciences(中国科学院空间利用重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Software, Beihang University(北航软件学院)

AI总结 针对光学与SAR图像间辐射差异导致的船舶重识别挑战,提出SDF-Net,通过结构一致性约束和解耦特征学习,实现模态不变的身份特征提取,在HOSS-ReID数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29559 2026-05-29 cs.CL

LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents

LiteCoder-Terminal: 扩展用于学习语言代理的长时程终端环境

Xiaoxuan Peng, Kaiqi Zhang, Xinyu Lu, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 提出零依赖合成框架LiteCoder-Terminal-Gen,自动生成可执行且可验证的终端训练环境,构建大规模SFT和RL数据集,通过监督微调和直接多轮偏好优化显著提升语言代理在终端任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28962 2026-05-29 cs.CV

Resolving Endpoint Underfitting in Diffusion Bridges via Noise Alignment

通过噪声对齐解决扩散桥中的端点欠拟合

Yurong Gao, Zicheng Zhang, Congying Han, Tiande Guo, Xinmin Qiu

机构 * University of Chinese Academy of Sciences(中国科学院大学)

AI总结 针对扩散桥模型在目标端点附近出现的欠拟合问题,提出噪声对齐扩散桥(NADB),通过均值网络和噪声对齐映射解决噪声不匹配,在图像恢复和翻译任务中验证有效性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28868 2026-05-29 cs.LG cs.AI

TaxDistill: Improving Metagenomic Taxonomic Annotation via Distilled Genomic Foundation Models

TaxDistill:通过蒸馏基因组基础模型改进宏基因组分类注释

Rongye Ye, Lun Li, Zheng Luo, Yiran Zhan, Shuhui Song

机构 * National Genomics Data Center, China National Center for Bioinformation(中国生物信息中心国家基因组数据中心) Beijing Key Laboratory of Intelligent Governance and Application of Biological Big Data, China National Center for Bioinformation(北京生物大数据智能治理与应用重点实验室,中国生物信息中心) Beijing Institute of Genomics, Chinese Academy of Sciences(北京基因组研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 提出TaxDistill知识蒸馏框架,利用500M参数的基因组基础模型GenomeOcean作为教师网络生成软标签,以减轻初始检索工具引入的标签噪声,从而提升宏基因组序列分类性能。

Comments The manuscript contains 14 pages, 7 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23345 2026-05-29 cs.CV

SCOPE: Simulating Cross-game Operations in Playable Environments for FPS World Models

SCOPE: 在可玩环境中模拟跨游戏操作以构建FPS世界模型

Zizhao Tong, Yeying Jin, Hongfeng Lai, Zeqing Wang, Zhaohu Xing, Kexu Cheng, Haoran Xu, Zhao Pu, Shangwen Zhu, Ruili Feng, Jian Zhao, Yan Zhang, Hao Tang, Ling Shao

机构 * UCAS-Terminus AI Lab, University of Chinese Academy of Sciences(中国科学院大学Terminus AI实验室) Tencent(腾讯) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Waterloo(多伦多大学) Shanghai Jiaotong University(上海交通大学) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)

AI总结 提出SCOPE方法,通过在每个Transformer块中插入条件模块,将特征重塑为逐像素时间序列,以分离FPS游戏中局部作用域(scope)内的操作效果与全局生成,并引入跨游戏数据集CrossFPS,实现零样本迁移。

Comments Project page: https://z2tong.github.io/SCOPE/. Code is available at https://github.com/z2tong/SCOPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22661 2026-05-29 cs.SD

Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability

评估与奖励基于平均延续对数概率的表达性角色扮演TTS的LALM

Yong Ren, Jingbei Li, Haiyang Sun, Yujie Chen, Cheng Yi, Yechang Huang, Hao Gu, Ye Bai, Xuerui Yang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beihang University(北京航空航天大学)

AI总结 提出平均延续对数概率(MCLP)作为评估指标和奖励信号,用于提升大型音频语言模型在角色扮演文本转语音任务中的风格一致性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24562 2026-05-29 cs.CL

HaluNet: Learning Hallucination Risk from Internal Signals in LLM Question Answering

HaluNet:从LLM问答内部信号学习幻觉风险

Chaodong Tong, Qi Zhang, Zhuojun Jiang, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) China Industrial Control Systems Cyber Emergency Response Team(中国工业控制系统网络应急响应团队)

AI总结 提出HaluNet,利用单次生成的内部信号(token似然、预测熵和隐藏状态)估计答案级幻觉风险,通过LLM-as-a-Judge弱监督训练,在多个QA数据集上显著提升风险排序和错误检测率。

Comments 16 pages, 12 tables, and 11 figures. This version includes a major revision of the manuscript and updates the author list with the consent of all involved authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17220 2026-05-29 cs.CL

Mindscape-Aware Retrieval Augmented Generation for Improved Long Context Understanding

心智景观感知的检索增强生成以改进长上下文理解

Yuqing Li, Jiangnan Li, Zheng Lin, Ziyan Zhou, Junjie Wu, Weiping Wang, Jie Zhou, Mo Yu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) WeChat AI, Tencent(腾讯微信AI) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 提出MiA-RAG框架,通过层次化摘要构建心智景观并统一检索与生成的条件,实现全局语义表示指导下的长上下文检索与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28683 2026-05-28 cs.AI

VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

VeriTrip: 面向非结构化网络语料的旅行规划智能体可验证基准

Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学技术大学网络安全学院) Amap, Alibaba Group(阿里巴巴集团阿地图) NLPR & MAIS, Institute of Automation, CAS(中国科学院自动化研究所神经信息处理实验室及机器智能研究所) School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院)

AI总结 提出VeriTrip基准,通过多模态检索库和可验证知识库,评估智能体在非结构化网络语料中基于证据推理的旅行规划能力,揭示检索-推理权衡问题。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28296 2026-05-28 cs.LG nucl-ex physics.ins-det

Machine Learning methods for event classification and vertex reconstruction of the 12C + 12C reaction with the MATE-TPC

基于MATE-TPC的12C + 12C反应事件分类和顶点重建的机器学习方法

Minghui Zhang, Xiaobin Li, Jie Chen, Ningtao Zhang, Fenhua Lu, Junrui Ma, Jiazhen Yan, Wanqin Tu, Xiaodong Tang, Bingshui Gao, Chengui Lu, Zhichao Zhang, Jinlong Zhang, Weiping Liu

机构 * College of Science, Southern University of Science and Technology(南方科技大学科学学院) Institute of Modern Physics, Chinese Academy of Sciences(中国科学院现代物理研究所) School of Nuclear Science and Technology, University of Chinese Academy of Sciences(中国科学院大学核科学与技术学院) School of Physics, Peking University(北京大学物理学院)

AI总结 采用ResNet和VGG等深度学习模型对12C + 12C反应事件进行分类,准确率达97%(模拟)和90%(实验),并利用CNN重建反应顶点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28213 2026-05-28 cs.AI

Learning When to Optimize: Verified Optimization Skills from Expert GPU-Kernel Lineages

学习何时优化:来自专家GPU内核谱系的验证优化技能

Shuoming Zhang, Qiuchu Yu, Yangyu Zhang, Ruiyuan Xu, Xiyu Shi, Guangli Li, Xiaobing Feng, Huimin Cui, Jiacheng Zhao

机构 * SKLP, Institute of Computing Technology, Chinese Academy of Sciences(SKLP,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) University of New South Wales(新南威尔士大学)

AI总结 提出KLineage方法,通过反向遍历专家GPU内核实现并提取可重用的优化技能,学习优化的适用条件,从而提升LLM代理生成内核的优化质量与效率。

Comments Preprint, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28184 2026-05-28 cs.LG

Joint Training of Multi-Token Prediction in Reinforcement Learning via Optimal Coefficient Calibration

通过最优系数校准在强化学习中联合训练多令牌预测

Zili Wang, Jiajun Chai, Lin Chen, Xiaohan Wang, Shiming Xiang, Guojun Yin

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

AI总结 本文从优化角度分析多令牌预测与强化学习联合训练失败的原因,提出最优系数校准方法,通过在线跟踪最优系数实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22297 2026-05-28 cs.LG cs.AI

One LR Doesn't Fit All: Heavy-Tail Guided Layerwise Learning Rates for LLMs

一个学习率不适用于所有层:基于重尾引导的LLM逐层学习率

Di He, Songjun Tu, Keyu Wang, Lu Yin, Shiwei Liu

机构 * SIAT(深圳先进技术研究院) PCL(鹏城实验室) UCAS(中国科学院大学) UOT(图宾根大学) LIU1(智能系统马克斯·普朗克研究所) LIU2(图宾根ELLIS研究所) LIU3(图宾根人工智能中心)

AI总结 本文提出基于重尾自正则化理论的逐层学习率(LLR)方法,通过为Transformer各层分配不同学习率,加速训练并提升泛化能力,在多种模型和优化器上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28047 2026-05-28 cs.CL

Knowledge Dependency Estimation for Reliable Question Answering

面向可靠问答的知识依赖估计

Chaodong Tong, Qi Zhang, Nannan Sun, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) China Industrial Control Systems Cyber Emergency Response Team(中国工业控制系统网络应急响应团队)

AI总结 提出Knot方法,通过子集级反事实监督和潜在依赖因子覆盖建模,估计黑盒问答模型对不同知识单元的敏感性,以识别关键知识依赖。

Comments 12 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27911 2026-05-28 cs.AI

SuiChat-CN: Benchmarking Contextual Suicide Risk Assessment in Chinese Group Chats

SuiChat-CN:中文群聊情境自杀风险评估基准

Xiangyu Wang, Zhiwei Yu, Chengze Du, Dingchang Wang, Yuhan Ye, Fangyu Zheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学)

AI总结 针对即时通讯群聊中消息碎片化、多轮对话和隐晦表达带来的挑战,构建了首个中文群聊情境自杀风险评估基准SuiChat-CN,通过信号词提取和双向上下文扩展构建连贯对话片段,并利用专家验证的LLM辅助范式标注用户风险等级,实验表明上下文信息对可靠评估至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27404 2026-05-28 cs.CY cs.AI

Smaller, Younger, and More Impactful: How AI-Assisted Writing Transforms Research Teams

更小、更年轻、更具影响力:AI辅助写作如何改变研究团队

Haoyang Wang, Mingze Zhang, Yi Bu, Star Xing Zhao, Meijun Liu

机构 * School of Information, University of Texas at Austin(德克萨斯大学奥斯汀分校信息学院) National Science Library, Chinese Academy of Sciences(中国科学院国家科学图书馆) Department of Information Resources Management, School of Economics and Management, University of Chinese Academy of Sciences(中国科学院大学经济管理学院信息资源管理系) Department of Information Management, Peking University(北京大学信息管理系) Institute of Big Data, Fudan University(复旦大学大数据研究院) Institute for Global Public Policy, Fudan University(复旦大学全球公共政策研究院) Faculty of Finance, City University of Macau(澳门城市大学金融学院)

AI总结 本研究利用2020年以来的PLoS和Nature系列期刊全文,通过多种回归方法发现AI辅助写作使研究团队更年轻、规模更小,且不影响甚至提升科学影响力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19342 2026-05-28 cs.CV

Semantic-Enriched Latent Visual Reasoning

语义增强的潜在视觉推理

Tianrun Xu, Yue Sun, Qixun Wang, Jingyi Lu, Yuan Wang, Tianren Zhang, Longteng Guo, Fengyun Rao, Jing Lyu, Feng Chen, Jing Liu

机构 * Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) Zhongguancun Academy, Beijing, China(中关村学院) China Agricultural University, Beijing, China(中国农业大学) Peking University, Beijing, China(北京大学) Beijing Institute of Technology, Beijing, China(北京理工大学) Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院) WeChat Vision, Tencent Inc, Beijing, China(微信视觉,腾讯公司)

AI总结 提出两阶段学习框架SLVR,通过属性级语义监督和多查询组相对策略优化增强潜在表示的语义丰富性,提升潜在视觉推理的鲁棒性和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13278 2026-05-28 math.OC cs.LG

Proximal-Based Generative Modeling for Bayesian Inverse Problems

基于近端算子的贝叶斯逆问题生成建模

Boyang Zhang, Zhiguo Wang, Ya-Feng Liu

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉科学学院) School of Mathematics, Sichuan University(四川大学数学学院) School of Mathematical Sciences, Beijing University of Posts and Telecommunications(北京邮电大学数学科学学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Ministry of Education Key Laboratory of Mathematics and Information Networks(教育部数学与信息网络重点实验室)

AI总结 针对扩散模型在逆问题中似然分数难以计算的问题,提出基于近端算子的生成建模框架,利用Moreau-Yosida正则化与高斯卷积的理论等价性,通过Moreau分数匹配学习近端算子,实现无需显式似然评估的采样,理论上去除早期停止偏差并达到非渐近收敛,实验在重建质量和采样时间上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏