arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-08-20 至 2026-08-20 共收录 9
2608.19181 2026-08-20 cs.LG cs.AI cs.CL 新提交

Beyond Teacher Likelihood: Group-Calibrated On-Policy Distillation for Long-Context Reasoning

超越教师似然:面向长上下文推理的组校准在线策略蒸馏

Zhu Zhang, Jixun Wang, Xiaoang Xu, Xiaorong Wang, Zihan Zhou, Zhiyuan Wang, Shuo Wang, Chaojun Xiao, Yuezhi Zhou

机构 * Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) OpenBMB

AI总结 该研究针对长上下文推理中 OPD 的教师-验证器分歧问题,提出 GC-OPD 方法,结合验证器结果优化 OPD,在五个长上下文基准上显著提升 Qwen3 模型性能。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19098 2026-08-20 cs.LG cs.AI cs.CL 新提交

Open-MOPD: Diagnosing and Fixing Capability Imbalance in Multi-Teacher On-Policy Distillation

Open-MOPD:诊断与修复多教师在线蒸馏中的能力不平衡

Huan-ang Gao, Haohan Chi, Yong Yan, Shiyuan Feng, Hanlin Wu, Zheng Jiang, Bingxiang He, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou

机构 * SIA-Lab of Tsinghua AIR and ByteDance Seed(清华大学AIR与字节跳动种子SIA实验室) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

AI总结 本研究针对多教师在线蒸馏(M-OPD)的能力不平衡问题,提出 Open-MOPD 框架,通过三种机制将提升空间恢复率从 35.6% 提升至 83.4%,并开源了相关方案与评估套件。

Comments Project page: this https URL (https://bytedtsinghua-sia.github.io/Open-MOPD/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19072 2026-08-20 cs.AI cs.CL cs.LG 新提交

What is Missing from AI Post-Training AI: An Empirical Analysis

AI后训练AI缺失了什么?一项实证分析

Joy Jia Yin Lim, Xin Huang, Hao Peng, Yaxi Lu, Xin Cong, Zhong Zhang, Maosong Sun, Yankai Lin

机构 * Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学) Renmin University of China(中国人民大学)

AI总结 本文通过实证分析发现,LLM智能体后训练时存在策略锁定问题,其缺失的是执行过程中自发重新评估训练策略的机制,而非经验、指导或推理计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18988 2026-08-20 cs.CL cs.AI 新提交

DeepWeaver: Bridging the Evidence Synthesis Gap in Open-Ended Question Answering

DeepWeaver:弥合开放域问答中的证据合成鸿沟

Xujia Wang, Yizhe Zhang, Bin Xu, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

AI总结 该研究针对开放域问答中检索与生成间的证据合成鸿沟,提出DeepWeaver框架,通过Thought Block Chains编织证据,在LoQA和DeepResearch Bench基准上提升了问答的内容、引用及见解质量。

Comments 49 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18937 2026-08-20 cs.CL cs.AI 新提交

MedUAG: Unified Understanding and Generation for Medical Multimodal Models

MedUAG:面向医学多模态模型的统一理解与生成框架

Zijie Meng, Yuncheng Zhang, Hualiang Wang, Yitian Tang, Xiaotang Gai, Chen Shen, Songtao Jiang, Shaosheng Cao, Jian Wu, Xian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Tencent Jarvis Lab(腾讯Jarvis实验室)

AI总结 针对医学多模态领域缺乏统一理解生成框架的问题,本文构建了MedUAGCorpus数据集与MedUAGBench基准,开发了MedUAG模型,其在医学理解与生成任务中表现出色,为下一代医学多模态系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18878 2026-08-20 cs.AI cs.MA 新提交

DentAgent: Evidence-Centric Multi-Agent Coordination for Multimodal Dental Reasoning

DentAgent:以证据为中心的多智能体协调的多模态牙科推理框架

Zijie Meng, Xiwei Dai, Yixuan Tang, Jin Hao, Yang Feng, Fudong Zhu, Xiaoqiang Liu, Shaosheng Cao, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Angelalign Technology Inc.(时代天使科技有限公司) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 针对现有牙科AI系统模态或任务局限及证据不可追溯问题,提出以证据为中心的多智能体框架DentAgent,经四个基准测试,其多标签诊断性能超越资深专家17.3个百分点,可用于多模态牙科推理及人群口腔健康评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18827 2026-08-20 cs.LG cs.AI cs.CL 新提交

MLREF: Efficient Module Reuse for Reward Design in Reinforcement Learning via Large Language Models

MLREF:基于大语言模型的强化学习奖励设计中高效模块复用框架

Chenglin Liu, Xun Wang, Ruishuo Chen, Zhuoran Li, Longbo Huang

机构 * Institute for Interdisciplinary Information Sciences Tsinghua University(清华大学交叉信息研究院)

AI总结 该研究针对强化学习奖励设计瓶颈,提出MLREF框架,通过模块池复用奖励组件,结合三种优化机制,在17个任务上实现比强基线更优且更稳定的性能。

Comments 22 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18701 2026-08-20 cs.RO 新提交

SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation

SoftVTBench:面向可变形物体操作的形变感知视觉-触觉数据集与基准

Bowen Jing, Mingxin Wang, Ruiyang Hao, Chenchen Ge, Hanwen Shen, Junjie He, Yang Cui, Yiming Hou, Weitao Zhou, Jiawei Wang, Minglei Li, Dandan Zhang, Ding Zhao, Houde Liu, Xiaofan Li, Si Liu, Ping Luo, Haibao Yu

机构 * Tuojing Intelligence(拓境智能) Tsinghua University(清华大学) Southeast University(东南大学) Stevens Institute of Technology(斯蒂文斯理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Manchester(曼彻斯特大学) Simple AI Imperial College London(帝国理工学院) Carnegie Mellon University(卡内基梅隆大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

AI总结 本研究推出SoftVTBench视觉-触觉数据集与基准,定义形变感知成功率(DSR),发现触觉信息本身未必提升多模态融合,为可变形物体操作的物理交互研究提供资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18437 2026-08-20 cs.CL 新提交

Tangut Word Segmentation under Extreme Resource Scarcity: Integrating Traditional Lexicons and Unlabeled Text

资源极度匮乏下的西夏文分词:结合传统词典与未标注文本

Lifan Deng, Yongwei Zhang, Sen Sun, Bojun Sun, Jingsong Yu

机构 * Chinese Academy of Social Sciences(中国社会科学院) University of Chinese Academy of Social Sciences(中国社会科学院大学) Rixin College, Tsinghua University(清华大学日新书院) Institute of Linguistics, Chinese Academy of Social Sciences(中国社会科学院语言研究所) Institute of Ethnology and Anthropology, Chinese Academy of Social Sciences(中国社会科学院民族学与人类学研究所) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

AI总结 针对资源极度匮乏的西夏文分词问题,该研究结合传统词典与未标注文本,提出含可靠性校准词典格等的框架,借助TangutEncoder在分词级五折交叉验证中F1达0.911,实现了超出有限监督词汇的泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏