arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1952
2603.09117 2026-05-28 cs.LG cs.AI cs.CL

Decoupling Reasoning and Confidence: Resurrecting Calibration in Reinforcement Learning from Verifiable Rewards

解耦推理与置信度:在可验证奖励的强化学习中恢复校准

Zhengzhao Ma, Xueru Wen, Boxi Cao, Yaojie Lu, Hongyu Lin, Jinglin Yang, Min He, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences, Beijing, China(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) National Computer Network Emergency Response Technical Team/Coordination Center of China, Beijing, China(中国国家计算机网络应急技术配合中心)

AI总结 针对RLVR中模型校准退化问题,提出DCPO框架通过解耦推理与校准目标,在保持准确率的同时显著改善校准性能并缓解过度自信。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14082 2026-05-28 cs.LG

Toward Robust Semi-supervised Regression via Dual-stream Knowledge Distillation

通过双流知识蒸馏实现鲁棒半监督回归

Ye Su, Hezhe Qiao, Wei Huang, Lin Chen

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(重庆绿色智能技术研究所,中国科学院) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院) Singapore Management University(新加坡管理大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 针对半监督回归中未标记数据利用不足和伪标签噪声问题,提出双流知识蒸馏框架(DKD),通过蒸馏连续值知识和分布信息,并结合解耦分布对齐模块,提升回归预测的鲁棒性和样本效率。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17654 2026-05-28 cs.CL cs.AI

EVADE-Bench: Multimodal Benchmark for Evaluating and Enhancing Evasive Content Detection

EVADE-Bench:用于评估和增强规避性内容检测的多模态基准

Ancheng Xu, Zhihao Yang, Jingpeng Li, Guanghu Yuan, Longze Chen, Liang Yan, Jiehui Zhou, Zhen Qin, Hengyu Chang, Yukun Chen, Hamid Alinejad-Rokny, Min Yang

机构 * SIAT, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) University of New South Wales(新南威尔士大学)

AI总结 针对电商平台中LLM/VLM易受规避性内容攻击的问题,提出首个专家标注的中文多模态基准EVADE-Bench,评估26个模型并发现规则分类可提升检测一致性,多智能体分解策略能显著提高准确率。

Comments SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23959 2026-05-28 cs.CL cs.AI cs.LG

HGMEM: Hypergraph-based Working Memory to Improve Multi-step RAG for Long-Context Complex Relational Modeling

HGMem:基于超图的工作记忆以改进长上下文复杂关系建模的多步RAG

Chulun Zhou, Chunkang Zhang, Guoxin Yu, Fandong Meng, Jie Zhou, Wai Lam, Mo Yu

机构 * The Chinese University of Hong Kong.(香港中文大学) Pengcheng Laboratory.(鹏城实验室) WeChat AI, Tencent(微信AI,腾讯) University of Chinese Academy of Sciences.(中国科学院大学)

AI总结 提出HGMem超图工作记忆系统,通过超边表示记忆单元并渐进形成高阶交互,增强多步RAG中的全局理解和复杂推理能力。

Comments ICML 2026; Code released at https://github.com/Encyclomen/HGMem

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27333 2026-05-27 cs.CL

FinHarness: An Inline Lifecycle Safety Harness for Finance LLM Agents

FinHarness:面向金融LLM代理的内联生命周期安全约束框架

Haoxuan Jia, Yang Liu, Bin Chong, Yingguang Yang, Yancheng Chen, Jiayu Liang, Qian Li, Hanning Lu, Kefu Xu, Hao Zheng, Chongyang Zhang, Hao Peng, Philip S. Yu

机构 * Peking University(北京大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) Soochow University(苏州大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Leeds(利兹大学) Fullive Innovation (Beijing) AI Technology Co., Ltd.(全维创新(北京)人工智能科技有限公司) Beihang University(北京航空航天大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 针对金融LLM代理在阻止提示诱导的未授权操作与批准合法多步骤业务流程之间的冲突,提出FinHarness内联安全约束框架,通过查询监控、工具监控和级联模块实现逐步骤风险评估与自适应验证,显著降低攻击成功率并保持良性批准率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27045 2026-05-27 cs.CL

ExTax: Explainable Disinformation Detection via Persuasion, Emotion, and Narrative Role Taxonomies

ExTax:基于说服、情感和叙事角色分类学的可解释虚假信息检测

Shang Luo, Yingguang Yang, Zhenchen Sun, Yang Liu, Bin Chong, Jingru Chen, Yancheng Chen, Jiayu Liang, Kefu Xu, Hao Peng, Philip S. Yu

机构 * Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) North China University of Science and Technology(华北理工大学) Tsinghua University(清华大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Soochow University(苏州大学) Beihang University(北航) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

AI总结 提出ExTax框架,统一说服修辞、情感操纵和叙事角色为17维分类空间,通过熵驱动动态标签平滑和多头注意力融合分类与上下文特征,实现可解释的虚假信息检测,在跨域基准上达到0.8456 Macro F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26489 2026-05-27 cs.LG

The Stability of Singular Distribution: A Spectral Perspective on the Two-Phase Dynamics of Language Model Pre-training

奇异分布的稳定性:语言模型预训练两阶段动力学的谱视角

Hongtao Zhang, Wenjie Zhou, Chenxi Jia, Wei Chen, Xueqi Cheng

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学先进交叉学科学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) School of Mathematics, Southeast University, Nanjing, China(东南大学数学学院)

AI总结 本文发现语言模型预训练中奇异值谱的早期稳定现象(SoSD),并证明该现象与慢下降阶段同步,通过理论分析揭示了权重范数增长导致SoSD阈值,从而限制后续损失下降速率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26484 2026-05-27 cs.LG

Extra-Merge: Tracing the Rank-1 Subspace of Model Merging in Language Model Pre-Training

Extra-Merge:追踪语言模型预训练中模型合并的秩-1子空间

Wenjie Zhou, Bohan Wang, Hongtao Zhang, Chenxi Jia, Wei Chen, Xueqi Cheng

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学先进交叉学科学院) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, China(中国科学院人工智能安全国家重点实验室) University of Chinese Academy of Sciences, China(中国科学院大学) Alibaba Group, China(阿里巴巴集团) School of Mathematics, Southeast University, Nanjing, China(东南大学数学学院)

AI总结 本文通过分析预训练后期轨迹发现秩-1子空间现象,提出无需额外训练的Extra-Merge方法,沿该子空间外推以最小化损失,在GPT-2和LLaMA系列上优于标准合并基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26421 2026-05-27 cs.CV

HydraPrompt: An Adaptive and Asymmetric Framework of Vision-Language Models for Synthetic Image Detection

HydraPrompt: 面向合成图像检测的视觉语言模型自适应非对称框架

Senyuan Shi, Hao Tan, Zichang Tan, Shuhan Feng, Ajian Liu, Sergio Escalera, Jun Wan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) School of Advanced Interdisciplinary Sciences (SAIS), University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Shenzhen Institute of Advanced Technology (SIAT), Chinese Academy of Sciences(中国科学院深圳先进技术研究所) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) University of Barcelona(巴塞罗那大学)

AI总结 提出一种非对称提示框架HydraPrompt,通过动态调整类别中心对齐细粒度图像线索,结合条件监督对比学习,实现合成图像检测的SOTA性能。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26246 2026-05-27 cs.LG

The Bridge-Garden Dilemma in LLM Distillation: Why Mixing Hard and Soft Labels Works

LLM蒸馏中的桥园困境:为什么混合硬标签和软标签有效

Guanghui Wang, Kaiwen Lv Kacuila, Zhiyong Yang, Zitai Wang, Jin-Wen Wu, Longtao Huang, Qianqian Xu, Qingming Huang

机构 * School of Computer Science and Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学计算机科学与技术学院) Alibaba Group, Hangzhou, China(阿里巴巴集团) State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院人工智能安全国家重点实验室) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) Key Laboratory of Big Data Mining and Knowledge Management (BDKM), University of Chinese Academy of Sciences, Beijing, China(中国科学院大数据挖掘与知识管理重点实验室)

AI总结 针对大语言模型知识蒸馏中硬标签与软标签的混合使用,提出桥园分解理论解释其降低暴露偏差的机制,并开发自适应混合监督方法,在多个模型上实现性能提升和9.7倍训练成本降低。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22162 2026-05-27 astro-ph.IM astro-ph.SR cs.LG

Spectra as Language: Large Language Models for Scalable Stellar Parameter and Abundance Inference

光谱即语言:用于可扩展恒星参数和丰度推断的大型语言模型

Hai-Ling Lu, Yu-Yang Li, Yin-Bi Li, Cun-Shi Wang, A-Li Luo, Jun-Chao Liang, Shuo Li

机构 * National Astronomical Observatories, Chinese Academy of Sciences, Beijing 100101, China(中国科学院国家天文台) University of Chinese Academy of Sciences, Beijing 100049, China(中国科学院大学) School of Astronomy and Space Science, University of Chinese Academy of Sciences, Beijing 100049, China(中国科学院大学天文与空间科学学院) University of Chinese Academy of Sciences, Nanjing 211135, China(中国科学院大学南京校区)

AI总结 提出两阶段大型语言模型框架,将恒星光谱视为序列信号,实现有效温度、表面重力、金属丰度及约20种化学元素丰度的准确估计,并展示随数据量增加性能系统提升的可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27019 2026-05-27 cs.LG cs.CL cs.CR

Dynamic Adversarial Fine-Tuning Reorganizes Refusal Geometry

动态对抗微调重组拒绝几何结构

Wenhao Lan, Shan Li, Xinhua Lai, Meiqi Wu, Junbin Yang, Haihua Shen, Yijun Yang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Inner Mongolia University of Technology(内蒙古科技大学) Tsinghua University(清华大学) Shandong University(山东大学)

AI总结 研究动态对抗微调如何改变安全对齐语言模型中拒绝行为的因果控制载体(低维子空间),发现R2D2沿鲁棒性-效用前沿重组几何结构但未建立自适应鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13853 2026-05-27 cs.CL cs.AI

APEX-Searcher: Refining Credit Assignment with Subgoaling for Agentic Retrieval-Augmented Generation

APEX-Searcher: 通过子目标细化信用分配以增强智能体检索增强生成

Kun Chen, Qingchao Kong, Zhao Feifei, Wenji Mao

机构 * University of Chinese Academy of Sciences(中国科学院大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS部) Wenge Technology Co., Ltd(Wenger科技有限公司)

AI总结 针对复杂多跳问答中检索路径模糊和端到端强化学习奖励稀疏的问题,提出APEX-Searcher,通过分离规划与执行的信用分配(规划用RL优化、执行用SFT学习),在多个基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02360 2026-05-27 cs.CV cs.CL

LaRe: Latent Refocusing for Multimodal Reasoning

LaRe: 用于多模态推理的潜在重聚焦

Jizheng Ma, Xiaofei Zhou, Geyuan Zhang, Yanlong Song, Han Yan

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院)

AI总结 提出LaRe范式,在潜在空间内进行视觉重聚焦,结合语义增强训练,在提升推理准确率的同时大幅减少推理所需token数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08375 2026-05-27 cs.CV

Source-Free Domain Adaptation for Geospatial Point Cloud Semantic Segmentation

地理空间点云语义分割的无源域适应

Yuan Gao, Di Cao, Xiaohuan Xi, Sheng Nie, Shaobo Xia, Cheng Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所) International Research Center of Big Data for Sustainable Development Goals(可持续发展目标大数据国际研究中心) University of Chinese Academy of Sciences(中国科学院大学) Zhengzhou Institute for Advanced Research of Henan Polytechnic University(河南理工大学郑州研究院) Henan Polytechnic University(河南理工大学) School of Aeronautic Engineering, Changsha University of Science and Technology(长沙理工大学航空工程学院) China University of Geosciences, Beijing(中国地质大学(北京))

AI总结 提出LoGo无源域适应框架,通过局部类平衡原型估计和全局最优传输分布对齐,解决地理空间点云语义分割中的域偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25786 2026-05-26 cs.LG cs.AI

NPSolver: Neural Poisson Solver with Iterative Physics Supervision

NPSolver: 具有迭代物理监督的神经泊松求解器

Bocheng Zeng, Rui Zhang, Runze Mao, Mengtao Yan, Xuan Bai, Yang Liu, Zhi X. Chen, Hao Sun

机构 * Gaoling School of Artificial Intelligence(高岭人工智能学院) Renmin University of China(中国人民大学) School of Mechanics and Engineering Science(力学与工程科学学院) Peking University(北京大学) AI for Science Institute(AI for Science研究院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 提出NPSolver,通过迭代物理监督(利用少量PCG步骤)训练无标签的神经泊松求解器,并引入边界感知Transolver架构,在2D/3D不规则几何上优于物理信息和数据驱动基线。

Comments kdd 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25784 2026-05-26 cs.CV cs.MM

VertiCue-Bench: Diagnosing Whether MLLMs Use Height Cues to Resolve 2D Ambiguity in Remote Sensing Natural Scenes

VertiCue-Bench: 诊断多模态大语言模型是否利用高度线索解决遥感自然场景中的二维歧义

Jing Huang, Duanchu Wang, Junjie Yang, Zihang Cheng, Cheng Li, Lin Cui, Zhouyi Wu, Di Wang

机构 * Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 提出VertiCue-Bench基准,通过17个任务1534个实例诊断MLLMs是否真正利用冠层高度模型(CHM)的垂直线索解决遥感自然场景中的语义歧义,发现模型在感知高度线索与语义推理之间存在显著脱节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25764 2026-05-26 cs.CV cs.AI

Benchmarking Pathology Foundation Models for Spatial Domain Understanding

病理基础模型在空间域理解中的基准测试

Bokai Zhao, Yiyang Zhang, Yuanchi Zhu, Hanqing Chao, Long Bai, Tai Ma, Minfeng Xu, Ming Song, Tianzi Jiang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Brainnetome Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所脑网膜工程中心) Beijing Key Laboratory of Brainnetome and Brain-Computer Interface, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所北京脑网膜与脑机接口重点实验室) DAMO Academy, Alibaba Group(阿里云达摩院) ShanghaiTech University(上海科技大学)

AI总结 提出SpaPath-Bench基准,通过空间域识别任务评估病理基础模型在区分组织区域和捕获空间关系方面的表示能力。

Comments MICCAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25646 2026-05-26 cs.RO

G-DRAGON: Geospatial Reasoning and Dynamic Planning for Retrieval-Augmented Outdoor Navigation

G-DRAGON:面向检索增强的户外导航的地理空间推理与动态规划

Dongzhihan Wang, Yi Du, Jianan Sun, Yuan Xue, Yingchen Zhang, Bing Xiao, Chen Wang, Liang Xu

机构 * Spatial AI & Robotics Lab(空间人工智能与机器人实验室) University at Buffalo(布法罗大学) School of Future Technology(未来技术学院) Shanghai University(上海大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 提出G-DRAGON框架,通过轻量级LLM的生成式检索将自然语言命令映射到本地OSM实体,结合全局路径规划与SLAM系统,并利用前沿探索和开放集语义体素映射实现最后一英里目标定位,在仿真和真实场景中优于现有方法。

Comments Accepted by IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25537 2026-05-26 cs.RO

Action-Prior Denoising for Smooth Real-Time Chunking

基于动作先验去噪的平滑实时分块

Dongyang Liu, Zhaowen Zheng, Yu Sun, Longxu Zhang, Yixuan Liu, Hao Wan

机构 * ROKAE (Shandong) Robot Group Co., Ltd.(ROKAE(山东)机器人集团有限公司) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 提出Soft RTC方法,通过动作先验去噪训练时模拟执行延迟,在保持近朴素运行时间的同时,降低高延迟动作变化并提升平滑性。

Comments 7 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25503 2026-05-26 cs.CV

Metric--Phase Fields: Decoupling Distance and Sign for Thin-Structure Reconstruction from Unoriented Point Clouds

度量-相位场:从无定向点云中解耦距离和符号以重建薄结构

Jiayi Kong, Xuhui Chen, Chen Zong, Fei Hou, Junhui Hou, Wenping Wang, Ying He

机构 * S-Lab, Nanyang Technological University, Singapore Key Laboratory of System Software (CAS), Institute of Software, Chinese Academy of Sciences, China University of Chinese Academy of Sciences, China School of Mathematics, Nanjing University of Aeronautics Department of Computer Science, City University of Hong Kong, Hong Kong SAR, China Department of Computer Science Engineering, Texas A\&M University, USA

AI总结 提出度量-相位场(MPF),通过解耦度量距离和拓扑相位,结合门控度量公式和残差相位注入,实现从无定向点云中稳定重建薄结构和开放边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25461 2026-05-26 cs.CV

MetaphorVU: Towards Metaphorical Video Understanding

MetaphorVU:迈向隐喻视频理解

Zhuoqun Li, Boxi Cao, Guiping Jiang, Fangrui Lv, Ruotong Pan, Jianan Wang, Xiangyu Wu, Hongyu Lin, Yaojie Lu, Yong Du, Ruyin Jia, Liyan, Tingting Gao, Han Li, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 针对当前多模态大语言模型在隐喻视频理解上的不足,提出首个系统性基准MetaphorVU-Bench,并设计基于隐喻知识图谱的推理增强框架MetaphorBoost,显著提升模型性能。

Comments ICML 2026 spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25364 2026-05-26 cs.CV

Can MLLMs Reason Beyond Language? VisReason: A Comprehensive Benchmark for Vision-Centric Reasoning

MLLMs 能否超越语言进行推理?VisReason:一个面向视觉中心推理的综合基准

Longteng Guo, Yifan Wang, Pengkang Huo, Tailai Chen, Yuze Wu, Jing Liu, Xinxin Zhu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 提出 VisReason 基准,包含 1505 个日常场景问题,评估多模态大模型在视觉中心推理上的表现,揭示人类与模型间的显著差距。

Comments Accepted by ACL 2026 Findings, resources released at https://github.com/CASIA-IVA-Lab/VisReason

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20749 2026-05-26 cs.LG cs.AI

The Devil is in the Condition Numbers: Why is GLU Better than non-GLU Structure?

魔鬼在于条件数:为什么GLU优于非GLU结构?

Xingyu Lyu, Qianqian Xu, Zhiyong Yang, Peisong Wen, Qingming Huang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing 100190, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京100190,中国) School of Computer Science and Technology, University of Chinese Academy of Sciences, Beijing 101408, China(中国科学院大学计算机科学与技术学院,北京101408,中国) Beijing Academy of Artificial Intelligence (BAAI), Beijing, China(北京人工智能研究院(BAAI),北京,中国)

AI总结 通过神经正切核分析,发现门控线性单元(GLU)通过重塑核谱、减小条件数来加速优化收敛,而非主要降低泛化差距。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14054 2026-05-26 cs.LG cs.CL

$π$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data

$\pi$-Play: 通过特权自蒸馏实现的多智能体自对弈,无需外部数据

Yaocheng Zhang, Yuanheng Zhu, Wenyue Chong, Songjun Tu, Qichao Zhang, Jiajun Chai, Xiaohan Wang, Wei Lin, Guojun Yin, Dongbin Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) Meituan(美团) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 提出$\pi$-Play框架,利用自对弈中生成的问答构建路径作为特权信息,结合自蒸馏实现密集反馈的多智能体协同进化,无需外部数据即可超越全监督搜索代理。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25091 2026-05-26 cs.AI

Evolutionary Enhanced Multi-Agent Reinforcement Learning for Cooperative Air Combat

进化增强的多智能体强化学习用于协同空战

Chengwei Li, Junlin Liu, Yang Gao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 针对多机协同空战中现有MARL方法探索效率低、样本利用率低和策略泛化差的问题,提出ACE-MAPPO混合学习框架,融合进化算法与MAPPO,通过遗传软更新、进化优先轨迹回放和对抗进化课程学习机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10548 2026-05-26 cs.CV

Blink: Dynamic Visual Token Resolution for Enhanced Multimodal Understanding

Blink: 动态视觉令牌分辨率增强多模态理解

Yuchen Feng, Zhenyu Zhang, Naibin Gu, Yilong Chen, Peng Fu, Zheng Lin, Shuohuan Wang, Yu Sun, Hua Wu, Weiping Wang, Haifeng Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Baidu Inc(百度公司)

AI总结 提出Blink框架,通过注意力引导的令牌超分辨率和动态丢弃机制,在单次前向传播中模拟人类眨眼式扫描,提升多模态大语言模型的视觉感知能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24423 2026-05-26 cs.AI

Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork

临时团队协作中上下文强化学习的极限基准测试

Yuheng Jing, Kai Li, Ziwen Zhang, Jiajun Zhang, Zeyao Ma, Jiaxi Yang, Lei Zhang, Zhe Wu, Jinmin He, Junliang Xing, Jian Cheng

机构 * C$^{2}$DL, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所C²DL实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) University of Science and Technology of China(中国科学技术大学) Qwen Team, Alibaba Group(阿里集团Qwen团队)

AI总结 提出ICRL4AHT基准,基于Overcooked-V2评估上下文强化学习在临时团队协作中的表现,发现算法在未见队友和布局下常不如随机基线,凸显多智能体环境下的适应挑战。

Comments 41 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24069 2026-05-26 cs.CR cs.AI

When the Manual Lies: A Realistic Benchmark to Evaluate MCP Poisoning Attacks for LLM Agents

当手册撒谎:评估LLM智能体MCP投毒攻击的现实基准

Shi Liu, Xuehai Tang, Xikang Yang, Liang Lin, Biyu Zhou, Wenjie Xiao, Wantao Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)

AI总结 针对LLM智能体通过模型上下文协议(MCP)集成外部工具时面临的工具描述投毒(TDP)攻击,提出MCP-TDP安全基准,包含32个真实测试用例,评估8种主流LLM发现严重漏洞,并提出反应性自我纠正防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23913 2026-05-26 cs.DC cs.CL

Can LoRA Fusion Support Cross-Domain Tasks in Cloud-Edge Collaboration?

LoRA融合能否支持云边协作中的跨域任务?

Yatong Wang, Fali Wang, Naibin Gu, Zheng Lin, Zhengxiao Liu, Dingyu Yao, Zhiwei Zhang, Jianxin Shi, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) The Pennsylvania State University, University Park, USA(宾夕法尼亚州立大学) Beihang University, Beijing, China(北航大学)

AI总结 针对云边协作中跨域问题解决的需求,提出剪枝-训练-恢复框架和冲突解决模块LoRA-CR,发现现有LoRA融合方法在跨域基准MMLU-CD上表现不佳,而LoRA-CR通过缓解参数冲突将性能提升高达3.8%。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏