arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4547
2602.02350 2026-05-14 cs.AI cs.LG cs.MA

Context Learning for Multi-Agent Discussion

多智能体讨论中的上下文学习

Xingyuan Hua, Sheng Yue, Xinyi Li, Yizhe Zhao, Jinrui Zhang, Ju Ren

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Cyber Science and Technology, Sun Yat-sen University Shenzhen Campus(中山大学深圳校区网络科学与技术学院) College of Computer Science, Northwest University(西北大学计算机学院) State Key Laboratory of Internet Architecture, Tsinghua University(清华大学互联网体系结构实验室)

AI总结 本文提出M2CL方法,通过动态生成上下文指令提升多智能体讨论的一致性与协作效率,实验表明其在多个任务中性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21577 2026-05-14 cs.LG

Collaborative Parameter Learning: Mitigating Forgetting via Parameter-Level Gradient Analysis

协同参数学习:通过参数级梯度分析缓解遗忘

Mutian Yang, Zisen Zhan, Yutong Chen, Haolin Li, Kaiwen Wang, Kaili Zheng, Yuguang Wang, Qi Wang, Jiandong Gao, Ji Wu

机构 * Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国) Institute of Medical Technology, Peking University Health Science Center, Peking University, Beijing, China(北京大学医学部医学技术研究所,北京大学,北京,中国) College of Information Science and Engineering, Northeastern University, Shenyang, China(东北大学信息科学与工程学院,沈阳,中国) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) Beijing National Research Center for Information Science and Technology, Beijing, China(北京信息科学与技术国家研究中心,北京,中国)

AI总结 本文提出协同参数学习方法,通过分析参数级梯度相似性,识别冲突参数和协作参数,冻结冲突参数以减少遗忘,提升模型在多任务和多语言场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09675 2026-05-14 cs.CL

d-TreeRPO: Towards More Reliable Policy Optimization for Diffusion Language Models

d-TreeRPO:迈向更可靠的扩散语言模型策略优化

Leyi Pan, Shuchang Tao, Yunpeng Zhai, Zheyu Fu, Liancheng Fang, Minghua He, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Aiwei Liu, Lijie Wen

机构 * Tsinghua University(清华大学) Tongyi Lab(通义实验室) University of Illinois at Chicago(伊利诺伊大学香槟分校) Peking University(北京大学)

AI总结 本文提出d-TreeRPO框架,通过树状回滚和可验证奖励提升扩散语言模型策略优化的可靠性,理论证明预测信心提升可减少预测概率偏差,并在多个推理基准上取得显著提升。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10642 2026-05-14 cs.RO cs.AI

UniJEPA: Enhancing Robot Policy via Unified Continuous and Discrete Representation Learning

UniJEPA:通过统一的连续和离散表示学习增强机器人策略

Jianke Zhang, Yucheng Hu, Yanjiang Guo, Xiaoyu Chen, Yichen Liu, Wenna Chen, Chaochao Lu, Jianyu Chen

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China.(清华大学交叉信息研究院) Shanghai Qi Zhi Institute, Shanghai, China(上海启智研究院) Peking University, Beijing, China(北京大学) Shanghai AI Lab, Shanghai, China(上海人工智能实验室)

AI总结 本文提出UniJEPA,通过大规模预训练学习高维视觉特征,结合理解、规划和连续未来表示学习,提升机器人在开放环境中的任务执行能力。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13456 2026-05-14 cs.AI cs.RO

Block-wise Adaptive Caching for Accelerating Diffusion Policy

块级自适应缓存用于加速扩散策略

Kangye Ji, Yuan Meng, Hanyun Cui, Ye Li, Jianbo Zhou, Shengjia Hua, Lei Chen, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本文提出BAC方法,通过块级自适应缓存加速扩散策略,利用特征相似性非均匀时间动态特性,减少计算开销,实现无损动作生成加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12522 2026-05-14 cs.CL cs.AI

Differences in Text Generated by Diffusion and Autoregressive Language Models

扩散模型与自回归语言模型生成文本的差异

Zeyang Zhang, Chengwei Liang, Xingyan Chen, Meiqi Gu, Minrui Luo, Jingzhao Zhang, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Xiongan AI Institute(雄安人工智能研究院)

AI总结 研究比较了扩散模型与自回归语言模型在生成文本中的差异,发现扩散模型在语义连贯性和多样性上表现更优,但熵较低,这主要归因于双向上下文和解码算法的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12294 2026-05-13 cs.AI

Executable Agentic Memory for GUI Agent

可执行代理记忆用于GUI代理

Zerui Qin, Sheng Yue, Xingyuan Hua, Yongjian Fu, Ju Ren

机构 * Tsinghua University, China(清华大学, 中国) Sun Yat-sen University, China(中山大学, 中国)

AI总结 本文提出EAM,一种结构化知识图谱,通过检索与执行过程提升GUI规划的鲁棒性,实验显示其在AndroidWorld上优于现有基线模型,并显著降低token成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12197 2026-05-13 cs.LG

A Unified Graph Language Model for Multi-Domain Multi-Task Graph Alignment Instruction Tuning

多领域多任务图对齐指令微调的统一图语言模型

Haibo Chen, Xin Wang, Jiaheng Chao, Ling Feng, Wenwu Zhu

机构 * Tsinghua University(清华大学)

AI总结 本文提出UniGraphLM,通过多领域多任务GNN编码器学习可泛化的图表示,并与LLM进行自适应对齐,以解决跨领域和任务的图对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12064 2026-05-13 cs.CV

TAR: Text Semantic Assisted Cross-modal Image Registration Framework for Optical and SAR Images

TAR:基于文本语义的跨模态图像配准框架用于光学和SAR图像

Zhuoyu Cai, Dou Quan, Ning Huyan, Pei He, Shuang Wang, Licheng Jiao

机构 * Key Laboratory of Intelligent Perception and Image Understanding of Ministry of Education of China, School of Artificial Intelligence, Xidian University(中国教育部智能感知与图像理解重点实验室,西安电子科技大学人工智能学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出TAR框架,通过文本语义先验缓解模态差距,提升跨模态特征学习,解决大形变下的光学与SAR图像配准问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12056 2026-05-13 cs.AI

OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

OmniRefine: 一种面向对齐的协作压缩方法以提高多模态大语言模型的效率

Yuchen Deng, Zidang Cai, Hai-Tao Zheng, Jie Wang, Feidiao Yang, Yuxing Han

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Pengcheng Laboratory(鹏城实验室)

AI总结 本文提出OmniRefine,一种无需训练的两阶段框架,通过跨模态对齐和协作压缩提升多模态大语言模型的推理效率与性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11884 2026-05-13 cs.LG

Sobolev Regularized MMD Gradient Flow

Sobolev正则化最大均值差异梯度流

Chenyang Tian, Bharath K. Sriperumbudur, Arthur Gretton, Zonghao Chen

机构 * Tsinghua University(清华大学) Pennsylvania State University(宾夕法尼亚州立大学) University College London(伦敦大学学院) Google Deepmind(谷歌DeepMind)

AI总结 本文提出Sobolev正则化最大均值差异(SrMMD)梯度流,通过梯度惩罚改善MMD目标的非凸性,提供连续和离散时间下的全局收敛性保证,且无需依赖等周假设。该方法适用于生成建模和采样任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11856 2026-05-13 cs.CV cs.CL

UniVLR: Unifying Text and Vision in Visual Latent Reasoning for Multimodal LLMs

UniVLR: 统一文本与视觉的视觉潜在推理用于多模态大语言模型

Houcheng Jiang, Jiajun Fu, Junfeng Fang, Chen Gao, Xiang Wang, Xiangnan He, Yong Li

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Zhongguancun Academy(中关村学院)

AI总结 UniVLR提出一种统一的视觉潜在推理框架,将文本推理和辅助视觉证据视为共享的视觉工作空间,通过压缩统一表示提升多模态大语言模型的视觉推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09965 2026-05-13 cs.CV

Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse

迈向通用游戏玩家:对游戏多元宇宙中基础模型的调查

Kuan Zhang, Dongchen Liu, Qiyue Zhao, Tianyu Xin, Yue Su, Haisheng Wang, Han Yin, Hongbo Ma, Peize Li, Tianjun Gu, Xiangnan Wu, Xinran Zhang, Yongxuan Li, Zirong Chen, Yiming Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) MMLab, The University of Hong Kong(香港大学MMLab) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文探讨了在游戏多元宇宙中训练通用游戏玩家的基础模型,分析了数据集、模型、工具和基准四个支柱,并提出五阶段路线图,旨在实现能够同时创造和演化游戏世界的通用智能体。

Comments 51 pages, 7 figures, github: https://github.com/THUSI-Lab/Awesome-LFMs-Play-Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08151 2026-05-13 cs.DC cs.AI

SPECTRE: Hybrid Ordinary-Parallel Speculative Serving for Resource-Efficient LLM Inference

SPECTRE:混合普通-并行推测服务用于资源高效的LLM推理

Jincheng Xie, Yawen Ling, Qi Xiao, Feiyu Zhang, Zhongyi Huang, Wen Hu, Yu Zheng

机构 * Tsinghua University(清华大学) AI Infra Team at JDT(AI基础设施团队) JD iCity, JD Technology, JD Intelligent Cities Research(京东i城、京东科技、京东智能城市研究院)

AI总结 SPECTRE通过利用未充分利用的尾部模型服务作为远程草稿生成器,提升大型模型推理效率,采用混合策略、推测优先调度和草稿压缩技术,实现并行处理,提升吞吐量并减少干扰。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09725 2026-05-13 cs.DC cs.LG

Efficient Remote KV Cache Reuse with GPU-native Video Codec

高效利用GPU原生视频编解码器实现远程KV缓存重用

Liang Mi, Weijun Wang, Jinghan Chen, Ting Cao, Haipeng Dai, Yunxin Liu

机构 * Nanjing University(南京大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

AI总结 本文提出基于GPU原生视频编解码器的远程KV缓存重用方案,通过紧凑布局和高效传输减少TTFT,实验显示比现有方法提升3.51倍。

Comments Accepted by SIGCOMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00297 2026-05-13 cs.LG

From Observations to States: Latent Time Series Forecasting

从观测到状态:潜在时间序列预测

Jie Yang, Yifan Hu, Yuante Li, Kexin Zhang, Kaize Ding, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学)

AI总结 本文提出LatentTSF方法,通过将时间序列预测从观测回归转向潜在状态预测,解决潜在混沌问题,提升预测准确性和表示质量。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18152 2026-05-13 cs.CV cs.AI

UnfoldLDM: Degradation-Aware Unfolding with Iterative Latent Diffusion Priors for Blind Image Restoration

UnfoldLDM: 基于迭代潜在扩散先验的退化感知展开网络用于盲图像恢复

Chunming He, Rihan Zhang, Zheng Chen, Bowen Yang, Chengyu Fang, Yunlong Lin, Yulun Zhang, Fengyang Xiao, Sina Farsiu

机构 * Duke University(杜克大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Tsinghua University(清华大学) Xiamen University(厦门大学)

AI总结 本文提出UnfoldLDM,结合深度展开网络与潜在扩散模型,解决盲图像恢复中的退化依赖和过平滑偏差问题,通过多粒度退化感知模块和退化抗性LDM提取先验,提升恢复质量与视觉效果。

Comments 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24145 2026-05-13 cs.AI

OpsAgent: An Evolving Multi-agent System for Incident Management in Microservices

OpsAgent:一种用于微服务中 incident 管理的演进多智能体系统

Yu Luo, Jiamin Jiang, Jingfei Feng, Lei Tao, Qingliang Zhang, Xidao Wen, Yongqian Sun, Shenglin Zhang, Dan Pei

机构 * Nankai University(南开大学) Alibaba Cloud(阿里云) Lenovo(联想) Tsinghua University(清华大学)

AI总结 本文提出 OpsAgent,一种轻量级自演进多智能体系统,通过训练自由数据处理器将异构可观测数据转化为结构化文本描述,并结合多智能体协作框架实现诊断推理的透明性和可审计性,实验证明其在微服务系统中的泛化性、可解释性和成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03206 2026-05-13 cs.AI cs.CL

Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner

连续离散扩散:使你的扩散语言模型成为潜在推理器

Cai Zhou, Chenxiao Yang, Yi Hu, Chenyu Wang, Chubin Zhang, Muhan Zhang, Lester Mackey, Tommi Jaakkola, Stephen Bates, Dinghuai Zhang

机构 * Massachusetts Institute of Technology(麻省理工学院) Microsoft Research(微软研究院) Toyota Technological Institute at Chicago(丰田技术研究所(芝加哥)) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 本文提出CCDD模型,结合连续和离散空间,提升扩散语言模型的表达能力和训练效果,通过联合多模态扩散过程实现高质量的生成与推理。

Comments 29 pages. Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02955 2026-05-13 cs.CV

MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models

MotionBench: 视觉语言模型视频细粒度运动理解的基准测试与改进

Wenyi Hong, Yean Cheng, Zhuoyi Yang, Weihan Wang, Lefan Wang, Xiaotao Gu, Shiyu Huang, Yuxiao Dong, Jie Tang

机构 * Tsinghua University(清华大学) Zhipu AI(智谱AI)

AI总结 MotionBench针对视觉语言模型在细粒度视频运动理解方面的不足,提出综合评估基准,通过六类运动导向问题类型评估模型运动层面感知能力,并提出Through-Encoder融合方法提升模型对有限序列长度内细粒度运动的感知。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11716 2026-05-13 cs.AI

SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models

SafeSteer: 多模态大语言模型中的解码级防御机制

Xinyi Zeng, Xue Yang, Jingyuan Zhang, Huanqian Yan, Xiang Chen, Kaiwen Wei, Hankun Kang, Yu Tian

机构 * Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Kuaishou Technology(快手科技) School of Computer Science and Technology, Beihang University(北航计算机科学与技术学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Chongqing University(重庆大学) Wuhan University(武汉大学)

AI总结 本文提出SafeSteer,通过解码阶段的轻量探针和模态语义对齐向量,提升多模态大语言模型的安全性,实验表明其能提升33.40%的安全性而不需微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11601 2026-05-13 cs.CL cs.AI

DiffScore: Text Evaluation Beyond Autoregressive Likelihood

DiffScore:超越自回归似然的文本评估

Wen Lai, Yingli Shen, Dingnan Jin, Qing Cui, Jun Zhou, Maosong Sun, Alexander Fraser

机构 * Ant Group(蚂蚁集团) Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学)

AI总结 DiffScore通过基于掩码大扩散语言模型的掩码重建方法,消除位置偏差,建立从局部流畅到全局连贯的评估体系,并提供诊断工具提升文本评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11556 2026-05-13 cs.AI cs.LG

Hindsight Hint Distillation: Scaffolded Reasoning for SWE Agents from CoT-free Answers

hindsight提示蒸馏:从无链式思维答案的SWE代理中获得引导式推理

Shengjie Wang, Guanghe Li, Zonghan Yang, Yang Gao

机构 * Tsinghua University(清华大学)

AI总结 本文提出HHD方法,通过利用模型自身失败的自我回滚生成 hindsight提示,指导在线回滚完成任务,无需CoT标注,实验显示其在SWE-bench Verified上提升8%。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11447 2026-05-13 cs.IR cs.AI

Conditional Memory Enhanced Item Representation for Generative Recommendation

基于条件记忆的增强项表示用于生成推荐

Ziwei Liu, Yejing Wang, Shengyu Zhou, Xinhang Li, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Independent Researcher(独立研究者) Tsinghua University(清华大学)

AI总结 本文提出ComeIR框架,通过重构SID-token嵌入为项感知输入并恢复解码时的token粒度,解决生成推荐中项表示构造的瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11424 2026-05-13 cs.CV

VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors

VidSplat:基于几何引导视频扩散先验的高斯点云重建

Jimin Tang, Wenyuan Zhang, Junsheng Zhou, Zian Huang, Kanle Shi, Shenkun Xu, Yu-Shen Liu, Zhizhong Han

机构 * School of Software, Tsinghua University(清华大学软件学院) Department of Computer Science, Wayne State University(韦恩州立大学计算机科学系)

AI总结 VidSplat通过几何引导的视频扩散先验,解决稀疏视图下3D场景重建问题,提出免训练生成框架,迭代合成新视角以恢复完整3D场景。

Comments Accepted by SIGGRAPH Conference 2026. Project Page: https://tangjm24.github.io/VidSplat

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11015 2026-05-13 cs.CR cs.AI

DCVD: Dual-Channel Cross-Modal Fusion for Joint Vulnerability Detection and Localization

DCVD:双通道跨模态融合用于联合漏洞检测与定位

Wenxin Tang, Wenbin Li, Junliang Liu, Jingyu Xiao, Xi Xiao, Mingzhe Liu, Jinlong Yang, Xuan Liu, Yuehe Ma, Wang Luo, Qing Li, Lei Wang, Peng Xiangli

机构 * Tsinghua University(清华大学) Hunan University(湖南大学) Dalian Maritime University(大连海事大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen University(深圳大学) Northwestern Polytechnical University(西北工业大学) Shandong University(山东大学) BNU-HKBU United International College(北京师范大学-香港浸会大学联合国际学院) Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Guangzhou Intelligence Communications Technology Co., Ltd.(广州智能通信技术有限公司) The Fifth Electronic Research Institute of MIIT(中华人民共和国信息产业部第五电子研究所)

AI总结 本文提出DCVD框架,通过双通道融合实现功能级检测与语句级定位的联合优化,有效解决单一信息源和缺乏显式监督的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10780 2026-05-13 cs.CV cs.AI

Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization

超越最后一层:多层表示融合用于视觉标记化

Xuanyu Zhu, Yan Bai, Yang Shi, Yihang Lou, Yuanxing Zhang, Jing Jin, Yuan Zhou

机构 * Peking University(北京大学) Meituan Inc(美团公司) Tsinghua University(清华大学) IGDL

AI总结 本文提出DRoRAE,通过多层特征融合恢复丢失的视觉信息,提升图像生成质量,并揭示了表示丰富性与重建质量的log-linear关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09964 2026-05-13 cs.AI q-bio.QM

Learning the Interaction Prior for Protein-Protein Interaction Prediction: A Model-Agnostic Approach

学习蛋白质-蛋白质相互作用的优先级:一种模型无关的方法

Ziqi Gao, Chenyi Zi, Zijing Liu, Ziqiao Meng, Yu Li, Jia Li

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) National University of Singapore(新加坡国立大学) IDEA Research(IDEA研究院)

AI总结 本文提出L3-PPI方法,通过生物启发的L3路径正则化图提示学习,提升蛋白质相互作用预测性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09461 2026-05-13 cs.AI

VulTriage: Triple-Path Context Augmentation for LLM-Based Vulnerability Detection

VulTriage:基于LLM的漏洞检测三路径上下文增强

Wenxin Tang, Xiang Zhang, Junliang Liu, Jingyu Xiao, Xi Xiao, Jinlong Yang, Yuehe Ma, Zhenyu Liu, Zhengheng Li, Zicheng Wang, Wang Luo, Qing Li, Lei Wang, Peng Xiangli

机构 * Tsinghua University(清华大学) Henan University(河南大学) Dalian Maritime University(大连海事大学) The Chinese University of Hong Kong(香港中文大学) Northwestern Polytechnical University(西北工业大学) BNU-HKBU United International College(北京理工大学-香港大学联合国际学院) Southeast University(东南大学) Jilin University(吉林大学) Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Guangzhou Intelligence Communications Technology Co., Ltd.(广州智能通信技术有限公司) The Fifth Electronic Research Institute of MIIT(信息产业部第五电子研究所)

AI总结 本文提出VulTriage框架,通过三路径上下文增强提升LLM在漏洞检测中的性能,实验表明其在关键指标上优于现有方法,且在低资源和类别不平衡场景下具有良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08978 2026-05-13 cs.AI

Learning to Explore: Scaling Agentic Reasoning via Exploration-Aware Policy Optimization

学习探索:通过探索意识策略优化实现代理推理的扩展

Xingyuan Hua, Sheng Yue, Ju Ren

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) School of Cyber Science and Technology, Sun Yat-sen University Shenzhen Campus, Shenzhen, China(中山大学深圳校区信息科学与技术学院) State Key Laboratory of Internet Architecture, Tsinghua University, Beijing, China(清华大学互联网体系结构国家重点实验室)

AI总结 本文提出一种探索意识强化学习框架,使LLM代理在不确定性高时主动探索,通过细粒度奖励函数和探索意识分组机制提升任务完成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏