Look Before You Leap: Autonomous Exploration for LLM Agents
先看再跳:面向LLM代理的自主探索
机构 * University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
AI总结 本文提出自主探索能力,通过探索检查点覆盖率指标,改进LLM代理在陌生环境中的适应性,采用探索与执行交替训练策略,提升任务执行的泛化能力。
高校专区
先看再跳:面向LLM代理的自主探索
机构 * University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
AI总结 本文提出自主探索能力,通过探索检查点覆盖率指标,改进LLM代理在陌生环境中的适应性,采用探索与执行交替训练策略,提升任务执行的泛化能力。
多级上下文令牌关系建模用于机器生成文本检测
机构 * Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) ; School of Software Engineering, South China University of Technology(华南理工大学软件学院) ; School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) ; State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)
AI总结 本文提出多级上下文令牌关系建模框架,通过局部校准和全局规则推理模块提升机器生成文本检测性能,实验显示在多种实际场景中效果显著。
VideoSeeker:通过原生代理工具调用激励实例级视频理解
机构 * University of Science and Technology of China(中国科学技术大学) ; Xiaohongshu Inc.(小红书公司) ; East China Normal University(华东师范大学) ; Xi’an Jiaotong University(西安交通大学)
AI总结 VideoSeeker通过整合代理推理与实例级视频理解任务,提升视频理解精度,实验表明其在实例级任务中比基线模型提升13.7%,超越GPT-4o和Gemini-2.5-Pro。
Comments Project Page: https://gaotiexinqu.github.io/VideoSeeker/
从失败到反馈:群体修订解锁对象级 grounding 的难题
机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) ; Technical University of Munich(慕尼黑技术大学) ; University of Science and Technology of China(中国科学技术大学) ; Cornell University(康奈尔大学)
AI总结 本文提出群体修订优化方法,通过生成改进候选响应提升硬案例学习效果,改进奖励和优势函数以增强高质量修订影响,优于现有GRPO方法。
Comments 8 pages, 5 figures, IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
AOT-POT:面向大规模PDE预训练的自适应算子变换
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Department of Electronic Engineering, Tsinghua University, China(清华大学电子工程系)
AI总结 本文提出AOT-POT方法,通过自适应算子变换将复杂多样的PDE解算子转化为统一形式,提升预训练效果,实验表明其在12个PDE基准上表现优异,参数仅增加3%。
CLOVER:端到端自动驾驶规划的闭环价值估计与排序
机构 * Department of Automation, University of Science and Technology of China(中国科学技术大学自动化系) ; Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) ; School of Electronic Information Engineering, Beihang University(北航电子信息技术学院) ; National College for Excellent Engineers, Beihang University(北航卓越工程师学院)
AI总结 CLOVER通过闭环价值估计与排序框架,解决端到端自动驾驶规划中训练与评估不匹配的问题,通过生成器和评分器的轻量级架构提升规划器性能,实现更准确的候选轨迹排序。
FutureWorld: 一个用于预测代理的实时强化学习环境,具有现实世界结果奖励
机构 * College of Software, Nankai University(南开大学软件学院) ; Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) ; School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; IIIS, Tsinghua University(清华大学智能系统与信息工程研究院) ; Zhongguancun Academy, Beijing, China(北京中关村学院)
AI总结 本文提出FutureWorld,一个实时强化学习环境,通过闭环预测、结果实现与参数更新,提升预测准确性与校准能力。
Comments The code will be released in the near future. The experiments are currently ongoing
TVRN:用于压缩感知的可逆神经网络时间视频重采样
机构 * MOE Key Laboratory of Brain-Inspired Intelligent Perception and Cognition(教育部脑科学与智能感知认知重点实验室) ; University of Science and Technology of China(中国科学技术大学) ; Information Science and Technology Institution(信息科学与技术研究所) ; MCC Lab(MCC实验室)
AI总结 本文提出TVRN框架,通过可逆架构和学习到的排名策略,解决压缩感知下的时间视频重采样问题,提升重建质量。
Comments Accepted by IEEE Transactions on Image Processing
高斯关系图变换器
机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(中国科学技术大学人工智能与数据科学学院) ; School of Biomedical Engineering, USTC(中国科学技术大学生物医学工程学院) ; Data Darkness Lab, Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州市先进研究机构数据暗室) ; Chinese Academy of Sciences(中国科学院)
AI总结 本文提出GelGT,通过结构-语义协作采样和高斯图注意力机制,解决关系图模型中长距离依赖和多信息联合建模问题,实验显示在多个真实数据集上达到最先进的预测性能。
通过闭环验证推理解锁复杂视觉生成
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出CLVR框架,结合视觉语言逻辑规划与像素级扩散生成,通过自动化数据引擎和PPRL解决多步推理中的优化问题,同时引入DSWM降低推理成本,实验表明其在多个基准上优于开源模型,实现了复杂视觉生成的扩展能力。
强制等变性的弊端及其通过表达能力的视角进行补偿
机构 * University of Science and Technology of China(中国科学技术大学) ; University of Edinburgh(爱丁堡大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文研究了强制等变性对表达能力的影响,发现其会降低表达能力,但通过扩大模型规模可补偿,并证明了补偿所需的规模上限,同时发现扩大后的架构具有更优的泛化能力。
看见重要之物:面向视觉生成的视觉偏好策略优化
机构 * Southeast University(东南大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) ; University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出ViPO,一种改进的GRPO方法,通过结构化像素级优势图提升视觉生成的对齐和泛化能力,优于传统GRPO。
超越沉没成本:通过专家混合的正交增长提升LLM预训练效率
机构 * ustc(中国科学技术大学) ; msra(微软亚洲研究院) ; stju(上海交通大学) ; xmu(厦门大学)
AI总结 本文提出正交增长策略,通过优化专家混合模型的深度和宽度,提升LLM预训练效率,实验证明在相同计算预算下,模型准确率提升10.6%。
Comments Accepted to ICML 2026
使用FP4量化优化大型语言模型训练
机构 * University of Science and Technology of China(科学技术大学) ; Microsoft Research Asia(微软亚洲研究院) ; Microsoft SIGMA Team(微软SIGMA团队)
AI总结 本文提出首个FP4训练框架,通过可微量化估计器和异常值钳制补偿策略,解决量化误差和表示能力限制问题,实现与BF16和FP8相近的精度,适用于大规模语言模型训练。
Journal ref Proceedings of the 42nd International Conference on Machine Learning, PMLR 267:62937-62957, 2025