arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

共收录 2226
2510.06843 2026-05-27 cs.CL cs.AI

Self-signals Driven Multi-LLM Debate for Efficient and Accurate Reasoning

自信号驱动的多LLM辩论以实现高效准确的推理

Xuhang Chen, Zhifan Song, Deyi Ji, Shuo Gao, Lanyun Zhu

机构 * University of Cambridge(剑桥大学) Sorbonne Université(索邦大学) University of Science and Technology of China(中国科学技术大学) Beihang University(北航大学) Nanyang Technological University(南洋理工大学)

AI总结 提出一种利用模型级置信度和token级语义焦点两种自信号来自适应引导多LLM辩论过程的方法,在提高准确性的同时减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25954 2026-05-26 cs.LG cs.AI

Step-TP: A Grounded, Step-Level Dataset with Chain-of-Thought Reasoning for LLM-Guided Tensor Program Optimization

Step-TP: 一个基于步骤级、带有思维链推理的 LLM 引导张量程序优化数据集

Mengfan Liu, Da Zheng, Junwei Su, Chuan Wu

机构 * The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学)

AI总结 为解决 LLM 在张量程序优化中缺乏可验证步骤级监督的问题,提出 Step-TP 数据集,通过结构化思维链推理和原子步骤监督实现可靠的多步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25553 2026-05-26 cs.CV cs.RO

ComPose: A Unified Completion-Pose Framework for Robust Category-Level Object Pose Estimation

ComPose:用于鲁棒类别级物体姿态估计的统一补全-姿态框架

Huan Ren, Yihan Chen, Chuxin Wang, Nailong Liu, Wenfei Yang, Tianzhu Zhang

机构 * University of Science and Technology of China(中国科学技术大学) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家空间科学探测重点实验室,深空探测实验室) Beijing Institute of Control Engineering(北京控制工程研究所)

AI总结 提出ComPose框架,通过关键点渐进补全模块和几何关系一致性损失,将形状补全与姿态估计紧密集成,在不依赖类别级形状先验的情况下提升点云不完整场景下的姿态估计精度和效率。

Comments Accepted by CVPR 2026 (Oral, Best Paper Award Candidate). Project page is available at renhuan1999.github.io/ComPose

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25381 2026-05-26 cs.LG

Not only where, But when: Temporal Scheduling for RLVR

不仅在哪里,而且何时:RLVR 的时间调度

Jinghao Zhang, Ruilin Li, Feng Zhao, Jiaqi Wang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Wuhan University(武汉大学)

AI总结 针对强化学习可验证奖励(RLVR)中忽略策略行为异质性的问题,提出时间调度方法,通过动态调整信用分配标准来优化学习动态,实验表明该方法能提升训练稳定性和效率。

Comments Github: https://github.com/Jinghaoleven/RLVR-Schedule

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25334 2026-05-26 cs.CV

Dual-Pathway Geometry-Aware MLLM for Spatial Intelligence

双路径几何感知多模态大语言模型用于空间智能

Yufei Zheng, Xuhan Zhu, Zide Liu, Chunpeng Zhou, Chenfeng Wang, Yongchao Xu, Yunnan Wang, Jiawei Liu, Pengfei Yu, Wei Zhai, Yang Cao, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto Inc.(利汽车公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出GAMSI,一种仅以RGB图像为输入、通过双路径查询和专家引导视觉对齐实现3D结构与度量尺度联合感知的多模态大语言模型,在七个空间智能基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25328 2026-05-26 cs.CV cs.MM

DIVA: Harnessing the Representation Divergence in Unified Multimodal Models for Mutual Reinforcement

DIVA: 利用统一多模态模型中的表示差异实现相互增强

Renjie Lu, Xulong Zhang, Xiaoyang Qu, Shangfei Wang, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd., Shenzhen, China(平安科技(深圳)有限公司,深圳,中国) University of Science and Technology of China(中国科学技术大学)

AI总结 针对统一多模态模型中理解与生成任务因监督信号差异导致相互干扰的问题,提出DIVA框架,通过分解视觉表示为共享和独有成分并利用互信息估计实现内部协同,在理解与生成任务上分别提升7.82%和8.46%。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25308 2026-05-26 cs.CV

Stabilizing Streaming Video Geometry via Dynamic Feature Normalization

通过动态特征归一化稳定流视频几何

Xiaoyang Lyu, Muxin Liu, Xiaoshan Wu, Ruicheng Wang, Yi-Hua Huang, Yang-Tian Sun, Shaoshuai Shi, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) USTC(中国科学技术大学) Voyager Research, Didi Chuxing(滴滴出行 Voyager 研究)

AI总结 针对流式RGB输入中单目几何模型的时间不一致问题(主要表现为尺度-偏移漂移),提出轻量级因果循环模块DyFN,通过动态调制特征统计量实现稳定几何估计,仅微调2%参数即可达到SOTA时间稳定性。

Comments 16 pages, 9 Figures, page: https://shawlyu.github.io/DyFN

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23454 2026-05-26 cs.CL

ARES: Automated Rubric Synthesis for Scalable LLM Reinforcement Learning

ARES: 面向可扩展大语言模型强化学习的自动评分标准合成

Xiaoyuan Li, Keqin Bao, Moxin Li, Yubo Ma, Yichang Zhang, Wenjie Wang, Fuli Feng, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

AI总结 提出ARES框架,从原始预训练文档自动生成问答对和实例级加权评分标准,用于可扩展的基于评分标准的强化学习,在多个开放任务上超越持续预训练、监督微调和二元奖励强化学习。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17537 2026-05-26 cs.AI

Self-supervised Hierarchical Visual Reasoning with World Model

基于世界模型的自监督分层视觉推理

Yuanfei Xu, Lin Liu, Wengang Zhou, Mingxiao Feng, Houqiang Li

机构 * Department of Electronic Engineering and Information Science, University of Science and Technology of China(电子工程与信息科学系,中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心)

AI总结 提出ResDreamer,一种分层世界模型,通过自监督方式学习残差表示,实现高效视觉推理,在3D开放环境中达到最先进的样本和参数效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07607 2026-05-26 cs.CV

FS-I2P:A Hierarchical Focus-Sweep Registration Network with Dynamically Allocated Depth

FS-I2P:一种具有动态分配深度的分层聚焦扫描配准网络

Zhixin Cheng, Yujia Chen, Xujing Tao, Bohao Liao, Xiaotian Yin, Baoqun Yin, Tianzhu Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) School of Computer Science and Information Engineering, Hefei University of Technology(计算机科学与信息工程学院,合肥工业大学) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(深空探测国家实验室,深空探测实验室) Institute of Advanced Technology, University of Science and Technology of China(先进技术研究院,中国科学技术大学)

AI总结 提出一种基于聚焦-扫描范式的分层交互模块和动态层分配策略,用于解决图像到点云配准中的尺度模糊和注意力漂移问题,在RGB-D Scenes V2和7-Scenes数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11557 2026-05-26 cs.AI

UniToolCall: Unifying Tool-Use Representation, Data, and Evaluation for LLM Agents

UniToolCall: 统一LLM智能体的工具使用表示、数据与评估

Yijuan Liang, Xinghao Chen, Yifan Ge, Ziyi Wu, Hao Wu, Changyu Zeng, Wei Xing, Xiaoyu Shen

机构 * University of Science and Technology of China(中国科学技术大学) Ningbo Institute of Digital Twin(宁波数字孪生研究所) Eastern Institute of Technology(东部技术研究所) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系)

AI总结 提出UniToolCall框架,通过标准化工具集构建、数据集生成和评估流程,结合22k+工具和390k+训练实例,引入锚点链接机制,在混合设置下使Qwen3-8B单轮严格精度达93.0%,超越GPT、Gemini和Claude。

Comments 21 pages, 10 figures, 9 tables. Code and datasets are publicly available at: https://github.com/EIT-NLP/UniToolCall

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05550 2026-05-26 cs.CL cs.CE

AutoSOTA: An End-to-End Automated Research System for State-of-the-Art AI Model Discovery

AutoSOTA:面向最先进AI模型发现的端到端自动化研究系统

Yu Li, Chenyang Shao, Xinyang Liu, Ruotong Zhao, Peijie Liu, Hongyuan Su, Zhibin Chen, Qinglong Yang, Anjie Xu, Yi Fang, Qingbin Zeng, Tianxing Li, Jingbo Xu, Fengli Xu, Yong Li, Tie-Yan Liu

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京理工大学,清华大学) Zhongguancun Academy(中关村学院) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出AutoSOTA系统,采用多智能体架构实现从论文复现到模型优化的全自动化,成功发现105个超越原始方法的新SOTA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09943 2026-05-26 cs.AI

PathMem: Toward Cognition-Aligned Memory Transformation for Pathology MLLMs

PathMem: 面向病理学多模态大模型的认知对齐记忆转换

Jinyue Li, Yuci Liang, Qiankun Li, Xinheng Lyu, Jiayu Qian, Huabao Chen, Kun Wang, Zhigang Zeng, Anil Anthony Bharath, Yang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shenzhen University(深圳大学) Nanyang Technological University(南洋理工大学) Imperial College London(伦敦帝国学院) Huazhong University of Science and Technology(华中科技大学)

AI总结 提出PathMem框架,通过长期记忆与工作记忆的动态转换机制,实现结构化病理知识整合与可解释记忆控制,在WSI报告生成和开放诊断任务上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05613 2026-05-26 cs.LG cs.AI

PiXTime: A Model for Federated Time Series Forecasting with Heterogeneous Data across Nodes

PiXTime: 一种跨节点异构数据联邦时间序列预测模型

Yiming Zhou, Jiahao Wang, Mingyue Cheng, Hao Wang, Defu Lian, Enhong Chen

机构 * University of Science and Technology of China(科学技术大学)

AI总结 提出基于Transformer的PiXTime框架,通过参数解耦架构(局部个性化模块+全局共享骨干)处理异构时间序列,实现联邦学习中的异构数据预测,并在多个基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05699 2026-05-26 cs.CR cs.AI

Membership Inference Attacks on Tokenizers of Large Language Models

大型语言模型分词器的成员推理攻击

Meng Tong, Yuntao Du, Kejiang Chen, Weiming Zhang, Ninghui Li

机构 * University of Science and Technology of China(中国科学技术大学) Purdue University(普渡大学)

AI总结 针对预训练大型语言模型成员推理攻击的挑战,提出以分词器作为新攻击向量,探索五种攻击方法,并设计自适应防御。

Comments To appear at USENIX Security Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24553 2026-05-26 cs.CV

IQA-Spider: Unifying Multi-Granularity Image Quality Assessment with Reasoning, Grounding and Referring

IQA-Spider:统一多粒度图像质量评估与推理、定位和指代

Xinge Peng, Yiting Lu, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出IQA-Spider框架,通过统一推理、定位和指代任务,实现多粒度图像质量评估,并采用两阶段设计解决现有方法仅支持部分感知维度的问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22794 2026-05-26 cs.AI cs.LG

MOSS: Self-Evolution through Source-Level Rewriting in Autonomous Agent Systems

MOSS:自主智能体系统中通过源代码级重写的自我进化

Qianshu Cai, Yonggang Zhang, Xianzhang Jia, Huajiang Zheng, Wei Xue, Jun Song, Xinmei Tian, Yike Guo

机构 * University of Science and Technology of China(中国科学技术大学) Hong Kong Generative AI Research & Development Center(香港生成式AI研究与开发中心) The Hong Kong University of Science and Technology(香港理工大学) Hong Kong Baptist University(香港 Baptist大学)

AI总结 提出MOSS系统,通过源代码级重写实现自主智能体系统的自我进化,利用生产故障证据自动批处理和多阶段确定性流水线,在OpenClaw上单周期内将平均评分从0.25提升至0.61。

Comments 12 pages, 3 figures, 2 tables. Preprint. Code: https://github.com/hkgai-official/Moss

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08063 2026-05-26 cs.CV cs.AI

Flow-OPD: On-Policy Distillation for Flow Matching Models

Flow-OPD:面向流匹配模型的在线策略蒸馏

Zhen Fang, Wenxuan Huang, Yu Zeng, Yiming Zhao, Shuang Chen, Kaituo Feng, Yunlong Lin, Lin Chen, Zehui Chen, Shaosheng Cao, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) University of California, Los Angeles(加州大学洛杉矶分校) The Chinese University of Hong Kong(香港中文大学) Xiaohongshu Inc.(小红书公司)

AI总结 提出Flow-OPD框架,通过两阶段对齐策略(单奖励GRPO微调专家+流式冷启动与在线策略蒸馏)解决流匹配模型在多任务对齐中的奖励稀疏和梯度干扰问题,并引入流形锚点正则化抑制美学退化,在GenEval和OCR指标上显著提升。

Comments Project Page: https://costaliya.github.io/Flow-OPD/ , Code: https://github.com/CostaliyA/Flow-OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03014 2026-05-26 cs.CL cs.AI

SentGraph: Hierarchical Sentence Graph for Multi-hop Retrieval-Augmented Question Answering

SentGraph: 用于多跳检索增强问答的层次化句子图

Junli Liang, Pengfei Zhou, Wangqiu Zhou, Wenjie Qing, Qi Zhao, Ziwen Wang, Qi Song, Xiangyang Li

机构 * University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

AI总结 提出SentGraph,一种句子级图RAG框架,通过构建层次化句子图并建模细粒度逻辑关系,解决多跳问答中证据链不完整的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10515 2026-05-26 cs.LG cs.CL

Adaptive Preference Optimization with Uncertainty-aware Utility Anchor

基于不确定性感知效用锚点的自适应偏好优化

Xiaobo Wang, Zixia Jia, Jiaqi Li, Qi Liu, Zilong Zheng

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

AI总结 提出一种通用离线偏好优化框架UAPO,通过引入锚点函数估计偏好数据标注的不确定性,支持非配对数据训练,提升数据利用效率和训练鲁棒性。

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24516 2026-05-26 cs.MA cs.AI

Adaptive Punishment for Cooperation in Mixed-Motive Games

混合动机博弈中促进合作的自适应惩罚

Min Tang, Fanqi Kong, Linyuan Lü, Xue Feng

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of General Artificial Intelligence, BIGAI(一般人工智能国家重点实验室,BIGAI)

AI总结 提出自适应惩罚合作方法(APC),通过动态惩罚概率和背叛严重程度确定惩罚强度,在迭代公共物品博弈中有效促进合作并降低惩罚成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24489 2026-05-26 cs.AI q-bio.BM

TIGER: Text-Informed Generalized Enzyme-Reaction Retrieval

TIGER:文本引导的通用酶-反应检索

Yuhang Zhang, Keyan Ding, Peilin Chen, Han Liu, Can Lin, Ruixi Chen, Shiqi Wang, Qi Song

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

AI总结 提出TIGER框架,利用蛋白质到文本生成模型提取文本语义知识,通过动态门控网络融合序列特征,实现酶与反应的双向检索,显著提升跨任务泛化性和鲁棒性。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24428 2026-05-26 cs.LG

Representation-Guided Discrete Molecular Graph Retrosynthesis

表示引导的离散分子图逆合成

Jiahai Huang, Anjie Qiao, Zhen Wang, Defu Lian, Yutong Lu

机构 * Sun Yat-sen University(中山大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出表示引导的分子图逆合成方法GRG,通过将预训练编码器的化学语义注入扩散模型,在USPTO-50k上达到58.6/77.2/83.4/87.1的top-1/3/5/10准确率,多样性提升至15.5,并加速收敛35%的epoch和30%的时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24426 2026-05-26 cs.CL

SEAL: Synergistic Co-Evolution of Agents and Learning Environments

SEAL: 智能体与学习环境的协同共演化

Yihao Hu, Zhihao Wen, Xiujin Liu, Pan Wang, Xin Zhang, Wei Wu

机构 * Ant Group(蚂蚁集团) Westlake University(西湖大学) University of Michigan--Ann Arbor(密歇根大学安娜堡分校) University of Science and Technology of China(中国科学技术大学)

AI总结 提出SEAL框架,通过协同演化智能体策略与训练环境,解决智能体与环境错配问题,在低资源多轮工具使用任务中提升性能并实现正向分布外迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24423 2026-05-26 cs.AI

Benchmarking the Limits of In-Context Reinforcement Learning for Ad-Hoc Teamwork

临时团队协作中上下文强化学习的极限基准测试

Yuheng Jing, Kai Li, Ziwen Zhang, Jiajun Zhang, Zeyao Ma, Jiaxi Yang, Lei Zhang, Zhe Wu, Jinmin He, Junliang Xing, Jian Cheng

机构 * C$^{2}$DL, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所C²DL实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) University of Science and Technology of China(中国科学技术大学) Qwen Team, Alibaba Group(阿里集团Qwen团队)

AI总结 提出ICRL4AHT基准,基于Overcooked-V2评估上下文强化学习在临时团队协作中的表现,发现算法在未见队友和布局下常不如随机基线,凸显多智能体环境下的适应挑战。

Comments 41 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24390 2026-05-26 cs.LG

Learning Laplacian Eigenspace with Mass-Aware Neural Operators on Point Clouds

学习拉普拉斯特征空间:基于质量感知神经算子的点云处理

Zherui Yang, Tao Du, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海智院) Laoshan Laboratory(崂山实验室)

AI总结 提出神经特征空间算子(NEO),通过预测稳定不变的低频子空间而非特征向量,结合质量感知神经算子和瑞利-里兹精化,实现点云上拉普拉斯-贝尔特拉米算子的快速谱分解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24371 2026-05-26 cs.CV cs.CL

SliceWorld: A Predictive and Controllable World-State Model for CT Report Generation

SliceWorld: 一种用于CT报告生成的预测性和可控世界状态模型

Yuanhe Tian, Yan Song

机构 * Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学)

AI总结 提出SliceWorld世界状态框架,通过编码CT切片序列为因子感知的潜在状态,实现未来切片预测、病变因子干预和LLM报告生成,在M3D-Cap和CT-RATE上提升NLG指标和临床评估。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24025 2026-05-26 cs.CV cs.LG

Towards Large Model Feature Coding

面向大模型特征编码

Youwei Pang, Changsheng Gao, Dong Liu, Huchuan Lu, Weisi Lin

机构 * NTU(国立台湾大学) USTC(中国科学技术大学) DUT(东吴大学)

AI总结 本文提出大模型特征编码(LaMoFC)基准与评估框架,通过构建涵盖4类16场景的特征数据集LaMoFCBench,揭示现有编码范式与大模型特征异构性之间的严重错位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23954 2026-05-26 cs.CL cs.AI cs.SD

EchoDistill:Alignment Noisy-to-Clean Self-Distillation for Robust Audio LLMs

EchoDistill:面向鲁棒音频大语言模型的噪声到干净自蒸馏对齐

Liang Lin, Chunxi Luo, Kaiwen Luo, Jie Zhang, Jin Wang, Yuanhe Zhang, Cai Yuchen, Qiankun Li, Gongli Xi, Zhenhong Zhou, Kun Wang, Junhao Dong

机构 * NTU(国立台湾大学) SHU(上海大学) ICT, CAS(中国科学院信息科技研究院) HDU(华中科技大学) BUPT(北京邮电大学) USTC(中国科学技术大学) SKL-NST, BUPT(北京邮电大学国家智能计算研究中心)

AI总结 提出EchoDistill框架,通过冻结的干净音频教师模型指导噪声学生模型进行组相对策略优化,实现噪声到干净的自蒸馏对齐,提升音频大语言模型在复杂噪声下的语义可靠性和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23945 2026-05-26 cs.AI cs.DC

Accelerating Long-Tail Generation in Synchronous RLHF Training via Adaptive Tensor Parallelism

通过自适应张量并行加速同步RLHF训练中的长尾生成

Long Zhao, Qinghe Wang, Jiaan Zhu, Youhui Bai, Zewen Jin, Chaoyi Ruan, Shengnan Wang, Cheng Li

机构 * Anhui University(安徽大学) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

AI总结 针对同步RLHF训练中长尾生成导致的GPU利用率低问题,提出自适应张量并行方法PAT,通过预测引导的在线重配置和轻量级状态迁移机制,显著降低生成延迟和端到端训练迭代延迟。

Comments 11page, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏