arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3015
2608.02110 2026-08-04 cs.CL cs.AI 新提交

IACM-RL: Intent-Aware Context Management and Reinforcement Learning for Complex Tool Invocation under Dynamic Intent Fluctuations

IACM-RL:动态意图波动下复杂工具调用的意图感知上下文管理与强化学习

Dingwei Zhu, Jiahan Li, Chengjun Pan, Yunxian Yang, Yunbin Zhao, Yunke Zhang, Zhonghang Lu, Zhuohui Sheng, Chenhao Huang, Jiahang Lin, Yajie Yang, Junlin Shang, Shichun Liu, Yuhui Wang, Honglin Guo, Junjie Ye, Xin Guo, Jiazheng Zhang, Ming Zhang, Shihan Dou, Zhiheng Xi, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang

机构 * Fudan University(复旦大学) Honor Device Co Ltd.(荣耀设备有限公司) Peking University(北京大学)

AI总结 针对动态意图波动下长程工具调用的意图偏差与无限API循环问题,提出IACM-RL框架,结合DynamicIntent流水线与BeliefState上下文管理器,在多基准上实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02091 2026-08-04 cs.LG 新提交

One QK Channel, Many Sources: Guarding Low-Precision Attention Collapse

一个QK通道,多个源:防范低精度注意力崩溃

Shuxiao Xie, Shuyang Xie, Yuan Cao, Dezhi Ran, Wei Yang, Tao Xie

机构 * Beijing Tongming Lake Information Technology Application Innovation Center (TLAIC)(北京通明湖信息技术应用创新中心(TLAIC)) Fudan University Institute of Systems for Advanced Computing(复旦大学先进计算系统研究所) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学) Shanghai Institute of Systems for Open Computing(上海开放计算系统研究所)

AI总结 本研究针对bfloat16变换器的低精度注意力崩溃问题,通过定位故障源与通道的分离关系,提出QK-Guard方法,可有效抑制注意力失控,支持在共享QK位点进行干预。

Comments 22 pages, 4 figures. Code and research artifacts: https://github.com/xieTwim/one-qk-channel-artifact

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01684 2026-08-04 cs.AI 新提交

GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks

GABench:用于评估大语言模型智能体图分析任务的综合基准

Jiarui Tan, Zhongjian Zhang, YaBo Guo, Jiawei Liu, Yujie Xing, Muhan Zhang, Cheng Yang, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

AI总结 本文提出GABench这一综合基准,涵盖多类图类型与任务及84个可执行工具,构建10400个带可验证答案的任务,评估前沿LLM及智能体框架,发现现有智能体应对复杂图任务仍存局限等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01423 2026-08-04 cs.AI cs.GT cs.LG 新提交

Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics

评分规则!文本评估指标的统计对齐与策略对齐

Shengwei Xu, Yuxuan Lu, Yifan Wu, Jason Hartline, Grant Schoenebeck

机构 * University of Michigan(密歇根大学) Peking University(北京大学) Microsoft Research(微软研究院) Northwestern University(西北大学)

AI总结 该研究针对文本评估指标,提出统计与策略对齐概念及三项测试原则,开发基于互信息的指标设计框架,发现 LLM-as-a-Judge 相关性高但易操纵,新指标鲁棒性强且相关性具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01334 2026-08-04 cs.CV 新提交

SphereVideo: Prototype-anchored Hyperspherical Boundary for Continual AI-generated Video Detection

SphereVideo:用于持续AI生成视频检测的原型锚定超球面边界

Fei Li, Yue Yu, Yuran Wang, Xinghan Li, Jingjing Chen, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Peking University(北京大学)

AI总结 针对AI生成视频检测中持续学习框架不足的问题,提出SphereVideo框架,以超球面原型锚定与多尺度时序建模提升泛化性,在已见和未见数据上均优于现有方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01252 2026-08-04 cs.LG cs.AI 新提交

AdaHAT: Adaptive Hard Attention to the Task in Task-Incremental Learning

AdaHAT:任务增量学习中的自适应硬注意力机制

Pengxiang Wang, Hongbo Bo, Jun Hong, Weiru Liu, Kedian Mu

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Population Health Sciences Institute, Newcastle University(纽卡斯尔大学人口健康科学研究所) School of Engineering Mathematics and Technology, University of Bristol(布里斯托尔大学工程数学与技术学院) School of Computing and Creative Technologies, University of the West of England(西英格兰大学计算与创意技术学院)

AI总结 本文针对任务增量学习中长任务序列下的网络容量问题,提出AdaHAT机制,改进HAT方法,经多数据集实验,其平均性能优于基线,可平衡网络稳定性与可塑性。

Comments 18 pages, 6 figures, published in ECML PKDD 2024

Journal ref Proceedings of the European Conference on Machine Learning and Knowledge Discovery in Databases. pp. 143-160 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00765 2026-08-04 cs.CL 新提交

RAGOCR: Optical Compression of Retrieval-Augmented Text via Visual Representation

RAGOCR:基于视觉表征的检索增强文本光学压缩

Jiayang Yu, Jialun Zhong, Lei Zou

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所)

AI总结 该研究针对RAG压缩的权衡问题,提出RAGOCR框架,通过查询感知动态分辨率机制压缩检索文档为视觉表征,在五个QA基准上实现比朴素RAG更高准确率和更低token需求,且优于各类压缩基线。

Comments Under reviewing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00687 2026-08-04 cs.CV 新提交

Proteus: A Truncation-Robust Entropy Model for Progressive LiDAR Compression

Proteus:适用于渐进式激光雷达压缩的抗截断熵模型

Yihan Qiu, Xiaodong Lin, Baoquan Zhao, Hailong Jiao, Ge Li

机构 * Peking University(北京大学) Sun Yat-sen University(中山大学)

AI总结 提出名为Proteus的激光雷达压缩编解码器,通过解耦编码实现抗70%比特流截断,在理想信道下优于G-PCC、Draco等标准及Unicorn,可用于安全关键感知场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00640 2026-08-04 cs.CL 新提交

TreeProbe : A Tibetan Medicine Benchmark for Cultural Bias in LLMs

TreeProbe:面向大型语言模型文化偏见的藏医药基准测试集

Jin Zhang, Linyu Li, Weili Jiang, Yuqing Cai, Yutong Liu, Guanquecairang, Yongbin Yu, Jingye Cai, Nyima Tashi, Gadeng Luosang

机构 * University of Electronic Science and Technology of China(电子科技大学) Tibet University(西藏大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学)

AI总结 本研究针对大型语言模型的藏医药文化偏见问题,构建了首个基于藏医药“医学之树”框架的基准测试集TreeProbe,发现现有模型存在系统性本体漂移,为公平医疗AI开发提供了诊断基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00434 2026-08-04 cs.CL cs.AI 新提交

AdaMTP: An Adaptive Training Paradigm for Multi-Token Prediction

AdaMTP:一种面向多令牌预测的自适应训练范式

Ziqiang Cui, Han Shi, Bowei He, Yu Pan, Peiyang Liu, Shengyin Sun, Yankai Chen, Haoli Bai, Yichun Yin, Xue Liu, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Huawei Technologies(华为技术有限公司) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) McGill University(麦吉尔大学) Peking University(北京大学)

AI总结 AdaMTP是适配序列内在可预测性的自适应MTP训练范式,通过熵算法划分语义边界抑制噪声梯度,在三类主干模型的多任务基准中均优于标准MTP,兼具性能与推理速度优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00220 2026-08-04 cs.LG cs.CL 新提交

Verifier-Induced Support Reshaping in On-Policy Optimization

可验证奖励下策略内优化中的验证器诱导支持重塑

Shaohang Wei, Zikun Su, Feifan Song, Wen Luo, Wei Li, Guangyue Peng, Houfeng Wang

机构 * Peking University(北京大学) BUPT(北京邮电大学)

AI总结 该研究发现RLVR在提升当前目标时会使后续目标成功行为稀少,通过数学推理与指令遵循实验验证了验证器诱导支持重塑效应,指出端点改进无法保证策略内优化的未来可训练性

Comments 36 pages, 12 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00214 2026-08-04 cs.CV 新提交

Manifold-GS: Certified Hybrid Assets via Varifold-Conservative Gaussian Splatting

流形-GS:通过变分保守高斯溅射实现可认证混合资产

Boyang Li

机构 * Peking University(北京大学)

AI总结 提出 Manifold-GS,将外观不透明度与几何质量分离,导出可认证开放表面面片,在 DTU 场景上实现零编辑泄漏、高 PSNR 且碰撞浮点数面积更低,是精度与覆盖率的权衡方案。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12659 2026-08-04 cs.RO cs.AI 版本更新

Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference

Jetson-PI:通过前瞻对齐异步推理实现机载实时机器人控制

Zebin Yang, Qi Wang, Yunhe Wang, Xiurui Guo, Bo Yu, Shaoshan Liu, Jiafeng Xu, Hao Dong, Meng Li

机构 * Peking University(北京大学) AIRS(无合适中文名,保留英文) PrimeBot Research Institute(PrimeBot 研究院)

AI总结 研究针对低功耗机载设备部署VLA模型的挑战,提出Jetson-PI方法。通过训练轻量级未来校正模块解决感知-执行未对齐,引入基于置信度的调度优化减少反应时间,辅以系统级加速,实验显示其显著提升控制频率和成功率。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31650 2026-08-04 cs.LG cs.AI 版本更新

ECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RL

ECHO: 在智能体强化学习中通过选择性回合记忆进行剪枝行动与追踪学习

Zijun Xie, Binbin Zheng, Enlei Gong, Jihua Liu, Yuyang You, Lingfeng Liu, Jiayao Tang, Guanqun Zhao, Aoqi Hu, Zeyu Chen

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Baidu Inc.(百度公司) University of Science and Technology of China(中国科学技术大学)

AI总结 提出ECHO框架,通过选择性回合记忆和源索引重建解决长程智能体强化学习中的历史崩溃与可追踪学习问题,在BrowseComp-Plus上达到43.4%准确率,优于GRPO和SUPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20997 2026-08-04 cs.AI 版本更新

BioInsight: Multi-Agent Orchestration for Interactive Biomedical Knowledge Discovery

BioInsight: 面向交互式生物医学知识发现的多智能体编排

Jieyi Wang, Bingxuan Li, Nanyi Jiang, Desong Meng, Zirui Fan, Yuxin Guo, Jiayu Liu, Kunlun Zhu, Eddie Yang, Xiusi Chen, Pan Lu, Bingxin Zhao

机构 * Peking University(北京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Purdue University(普渡大学) Stanford University(斯坦福大学)

AI总结 提出多智能体系统BioInsight,通过交互式界面生成替代静态报告,实现疾病证据的组织、推理与可视化,在多项生物医学任务中取得最优性能。

Comments Update some experiments and contents

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28978 2026-08-04 cs.AI cs.CE 版本更新

VFEAgent: A Multimodal Agent Framework for End-to-End Automated Finite Element Analysis

VFEAgent: 面向端到端自动化有限元分析的多模态智能体框架

Jiachen Zhang, Junyi Lao, Chenghao Liu, Siyuan Liu, Shixin Wu, Linsen Zhang, Boyu Wang, Songfang Huang

机构 * Peking University(北京大学) China Agricultural University(中国农业大学)

AI总结 提出VFEAgent多智能体系统,通过多模态视觉-语言流水线和验证优先的代码合成框架,实现从输入图像和问题描述到有限元建模与仿真的端到端自动化。

Comments 9 pages, 3 figures, 2 tables. Equal contribution: Jiachen Zhang and Junyi Lao. Corresponding author: Songfang Huang. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13280 2026-08-04 cs.SE cs.AI 版本更新

Characterizing Readability Issue Patterns and the Role of Prompt Design in LLM-Generated Code

可读性光谱:LLM生成代码中的模式、问题和提示影响

Hengzhi Ye, Fengyuan Ran, Weiwei Xu, Minghui Zhou

机构 * Peking university(北京大学) Wuhan University(武汉大学)

AI总结 本文研究了LLM生成代码的可读性,发现其与人工编写代码相当,但存在特定问题模式,提示设计对可读性影响有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12027 2026-08-04 cs.CV 版本更新

4DVGGT-D: 4D Visual Geometry Transformer with Improved Dynamic Depth Estimation

4DVGGT-D: 具有改进动态深度估计的4D视觉几何变换器

Ying Zang, Xuanyi Liu, Yidong Han, Deyi Ji, Chaotao Ding, Yuanqi Hu, Qi Zhu, Xuanfu Li, Jin Ma, Lingyun Sun, Tianrun Chen, Lanyun Zhu

机构 * Peking University(北京大学) Zhejiang University(浙江大学) Huzhou University(湖州大学) Huawei(华为) Tongji University(同济大学)

AI总结 本文提出一种无需训练的渐进解耦框架,通过稳定相机姿态和几何细化,解决动态与静态的分离问题,提升4D场景重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23488 2026-08-04 cs.LG 版本更新

Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation

合成轨迹反映真实的奖励黑客行为吗?对监控真实世界代码生成中黑客行为的系统研究

Lichen Li, Hengguang Zhou, Yijun Liang, Tianyi Zhou, Cho-Jui Hsieh

机构 * Peking University(北京大学) University of California, Los Angeles(加州大学洛杉矶分校) Arena University of Maryland(马里兰大学) Mohamed bin Zayed University of Artificial Intelligence(莫莫迪 bin Zayed 人工智能大学)

AI总结 本文研究合成轨迹与真实世界中代码生成奖励黑客行为的差异,通过对比监控器在合成与真实数据上的表现,发现合成数据训练的监控器无法泛化到真实黑客行为,而真实数据训练的监控器对未见过的黑客类型更具泛化能力。

Comments Corrected a typo in the title; no other changes

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15423 2026-08-04 cs.IR cs.LG 版本更新

GaiaFlow: Semantic-Guided Diffusion Tuning for Carbon-Frugal Search

GaiaFlow:基于语义的扩散调优用于碳节约搜索

Rong Fu, Jia Yee Tan, Chunlei Meng, Shuo Yin, Xiaowen Ma, Wangyu Wu, Simon Fong

机构 * University of Macau(澳门大学) Renmin University of China(中国人民大学) Fudan University(复旦大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) University of Liverpool(利物浦大学) Peking University(北京大学) Northeast Normal University(东北师范大学) Minzu University of China(民族大学)

AI总结 GaiaFlow通过结合语义引导的扩散调优与硬件无关的性能建模策略,在保证检索精度的同时降低环境影响,实现了高效且可持续的神经搜索系统。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18109 2026-08-04 cs.LG cs.OS cs.SY eess.SY 版本更新

TempoNet: Slack-Quantized Transformer-Guided Reinforcement Scheduler for Adaptive Deadline-Centric Real-Time Dispatchs

TempoNet:基于Transformer的强化学习调度器用于自适应截止时间导向的实时调度

Rong Fu, Yibo Meng, Zeyu Zhang, Ziming Guo, Jia Yee Tan, Xiaojing Du, Simon James Fong

机构 * University of Macau(澳门大学) Tsinghua University(清华大学) Northeast Normal University(东北师范大学) Shanghai AI Laboratory(上海人工智能实验室) The Australian National University(澳大利亚国立大学) Peking University(北京大学) Harbin University of Science and Technology(哈尔滨理工大学) Renmin University of China(中国人民大学) Adelaide University(阿德莱德大学)

AI总结 TempoNet结合Transformer与深度Q近似,通过时间松弛量化和稀疏注意力机制提升实时调度性能,实现高吞吐量下的截止时间保障。

Comments 43 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10727 2026-08-04 stat.ML cs.AI cs.LG math.PR math.ST stat.TH 版本更新

Tail-Aware Information-Theoretic Bounds for LLM Alignment under Heavy-Tailed Rewards

尾感知信息论泛化用于RLHF和SGLD

Huiming Zhang, Binghan Li, Wan Tian, Qiang Sun

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing(北京未来区块链与隐私计算高精尖创新中心) Advanced Institute of Information Technology, Peking University(北京大学信息技术高等研究院) Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) Computer and Mathematical Sciences, Computer Science, and Statistics, University of Toronto(多伦多大学计算机与数学科学、计算机科学和统计学系) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出一种尾依赖信息论框架,用于处理亚韦尔bull数据,通过移位对数f_θ-分歧来界定制换测度期望,从而在重尾数据下获得更精确的泛化界限。

Comments 47 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10485 2026-08-04 cs.AI 版本更新

Panning for Gold: Expanding Domain-Specific Knowledge Graphs with General Knowledge

寻找黄金:利用通用知识图谱扩展领域特定知识图谱

Runhao Zhao, Weixin Zeng, Wentao Zhang, Chong Chen, Zhengpin Li, Xiang Zhao, Lei Chen

机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) National University of Defense Technology(国防科技大学) The Center for machine learning research(机器学习研究中心) Peking University(北京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 本文提出领域特定知识图谱融合任务,通过神经符号框架ExeFuse,利用通用知识图谱提升领域知识图谱的完整性和实用性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21759 2026-08-04 cs.CL cs.LG 版本更新

Orchestrating Dual-Boundaries: An Arithmetic Intensity Inspired Acceleration Framework for Diffusion Language Models

协调双边界:一种受算术强度启发的加速框架用于扩散语言模型

Linye Wei, Wenjue Chen, Pingzhi Tang, Xiaotian Guo, Le Ye, Runsheng Wang, Meng Li

机构 * Peking University(北京大学)

AI总结 ODB-dLLM通过协调双边界,利用算术强度差异优化扩散语言模型的推理速度,显著提升效率并减少准确性损失。

Comments Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02235 2026-08-04 eess.SY cs.AI cs.SY eess.SP math.OC 版本更新

Partial Excitation in Parameter Learning

参数学习中的部分激励

Ganghui Cao, Shimin Wang, Martin Guay, Jinzhi Wang, Zhisheng Duan, Marios M. Polycarpou

机构 * State Key Laboratory for Turbulence and Complex Systems, Department of Mechanics and Engineering Science, College of Engineering, Peking University(湍流与复杂系统国家重点实验室,力学与工程科学系,工程学院,北京大学) Massachusetts Institute of Technology(麻省理工学院) Queen’s University(皇后大学) KIOS Research and Innovation Center of Excellence and the Department of Electrical and Computer Engineering, University of Cyprus(科斯卓越研究中心与创新中心,塞浦路斯大学电气与计算机工程系)

AI总结 本文针对部分持续激励(PPE)条件下的参数学习问题,提出在线算法与协同学习协议,实现分布式最优参数估计,通过系统辨识实例验证了理论结果的有效性。

Comments 16 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29567 2026-08-03 cs.RO 新提交

TransGraspNet: Physically and Geometrically Consistent Manipulation of Transparent Labware

TransGraspNet:透明实验器皿的物理与几何一致性操纵

Hailing Hu, Mingyi Zhu, Yiquan An, Yifei Tian, Tianyou Zuo, Lifeng Zhou

机构 * Peking University(北京大学) School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) Shanghai Jiao Tong University(上海交通大学) Southern University of Science and Technology(南方科技大学)

AI总结 TransGraspNet是实现透明实验器皿物理与几何一致性操纵的框架,通过三个耦合原则解决跨阶段不一致问题,在真实机器人平台上实现了高抓取成功率与零液体泼洒的可靠操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29513 2026-08-03 cs.RO 新提交

Homotopy-Aware Corridor Generation without Predefined Reference Paths

无预定义参考路径的同伦感知走廊生成

Haoze Dong, Minghan Li, Meng Guo, Zhongkui Li

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院)

AI总结 该研究提出一种无预定义参考路径的自适应多尺度凸集图框架,用于生成同伦感知安全走廊,经数值与硬件实验验证,其图构造高效、轨迹性能稳定,同伦感知轨迹更短且能应对未知障碍物。

Comments 8 pages, 8 figures. Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29235 2026-08-03 cs.RO cs.AI cs.SY eess.SY 新提交

FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution

FBFM:一种用于世界-动作模型执行中流匹配的无训练异步反馈机制

Peize Li, Ruimeng Zhang, Ru Zhang, Cong Huang, Kai Chen, Shanghang Zhang

机构 * Peking University(北京大学) Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

AI总结 该研究针对世界-动作模型分块反馈时间粒度粗、无法逐时间步纠错的问题,提出无训练异步反馈机制FBFM,在两类WAM上使LIBERO等任务成功率提升超5%,实现开环流生成与闭环真实世界动力学的桥接。

Comments 29 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29209 2026-08-03 cs.LG cs.AI 新提交

SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

SAF-OPD:面向策略内蒸馏的稳定优势融合

Yifan Ding, Xincheng Wei, Yoshua Y. Li, Ziheng Li, Yuquan Lu, Siyu Zhang, Dongsheng Ma, Rongxiang Weng, Xunliang Cai, Yun Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) Meituan(美团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

AI总结 该研究提出SAF框架解决RLVR与OPD固定系数融合的熵崩溃问题,通过四阶段机制优化优势融合,在7个推理与代码生成基准上提升模型性能与训练稳定性。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29196 2026-08-03 cs.CL 新提交

Hy-MultiTurn: A Six-Dimensional Benchmark for Deep Multi-Turn Dialogue Understanding

Hy-MultiTurn:用于深度多轮对话理解的六维度基准

Eileen Ye, Jiawen Tao, Yaoming Li, Chenxu Liu, Wenhan Yu, Yaxin Fan, Xiaokun Yuan, Mengzhou Wu, Yanbing Jiang, Maxm Pan

机构 * Tencent(腾讯) Peking University(北京大学)

AI总结 Hy-MultiTurn是含六种评估模式的中文深度多轮对话理解基准,含209个长对话任务,评估22种前沿模型发现其具挑战性,GPT-5.5仅41.1%响应达标且无模型全模式最优

Comments 33 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏