arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 614
2607.11481 2026-07-14 cs.RO 新提交

Towards Human-level Dexterous Teleoperation

迈向人类水平的灵巧遥操作

Puhao Li, Zeyuan Chen, Yingying Wu, Pengkun Wei, Yuyang Li, Tianyu Wang, Jiaxiao Shi, Mingrui Yu, Baoxiong Jia, Song-chun Zhu, Tengyu Liu, Siyuan Huang

机构 * Tsinghua University(清华大学) State Key Lab of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司) Peking University(北京大学)

AI总结 研究如何通过遥操作赋予机器人手内灵巧性,提出TeleDexter手 - 物体协同跟踪控制器,利用混合奖励训练,经单阶段强化学习及随机化处理可零样本迁移到真实机器人,在多项任务上取得高成功率并能训练自主策略。

Comments Project Website: https://bigai-dex.github.io/blog/teledexter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11433 2026-07-14 cs.AI 新提交

Omni-Decision: A Progressive Evidence-State Agent System for Omni-Modal QA

全决策:一种用于全模态问答的渐进式证据状态智能体系统

Ming Ma, Yi Zhu, Yiran Zhong, Feida Zhu, Weigao Sun, Junhan Shi, Lingrui Mei, Tianming Yang, Steven Hoi

机构 * Institute of Neuroscience, Chinese Academy of Sciences(中国科学院神经科学研究所) University of Chinese Academy of Sciences(中国科学院大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University(清华大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

AI总结 研究全模态问答中证据分散问题,提出全决策系统,将问答转化为证据闭合过程,维护结构化证据状态,通过确定性状态更新处理异构观察,提升了准确率,验证了证据状态控制在多步证据寻求中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11374 2026-07-14 cs.LG 新提交

Surprisingly Simple and Effective Multi-Domain Graph Foundation Model through Graph-to-Table Alignment

通过图到表对齐实现惊人简单且有效的多域图基础模型

Chunyu Hu, Tianyin Liao, Ge Lan, Xingxuan Zhang, Jianxin Li, Peng Cui, Ziwei Zhang

机构 * Nankai University(南开大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

AI总结 研究如何让表格基础模型有效捕获图结构信息,提出GTAlign框架,先预训练图编码器捕获图表示,通过社区引导持续预训练弥合差距,应用于目标域推理,实验表明该框架在节点和图分类上显著优于基线,提供简单无文本的图基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11312 2026-07-14 cs.CV 新提交

SLVMBench: Skill Learning from Video Memory

SLVMBench:从视频记忆中学习技能

Yudong Yang, Guangzhi Sun, Yixuan Li, Chao Zhang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学)

AI总结 SLVMBench是首个用于评估视频大语言模型从长视频记忆学习技能并应用于实时任务能力的基准测试,通过特定视频流和人工标注进行测试,发现现有视频LLMs在此方面有局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11185 2026-07-14 cs.AI 新提交

SCALECUA: Scaling Computer Use Agents with Verifiable Task Synthesis and Efficient Online RL

SCALECUA:通过可验证任务合成和高效在线强化学习扩展计算机使用代理

Bowen Lv, Xiao Liu, Yanyu Ren, Hanyu Lai, Bohao Jing, Hanchen Zhang, Yanxiao Zhao, Shuntian Yao, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学)

AI总结 研究针对计算机使用代理扩展能力受限问题,提出ScaleCUA框架,通过可验证任务合成及高效训练实现。包括设计VeriGen生成任务、前沿采样提高效率、视觉上下文分割加速训练,在相关平台取得新的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11163 2026-07-14 cs.CL cs.SD eess.AS 新提交

Unified Gradient Projection: Language-Balanced Continual Learning for Multilingual Low-Resource ASR

统一梯度投影:用于多语言低资源语音识别的语言平衡持续学习

Ziang Ren, Guodong Lin, Yuchen Ai, Kaize Tan, Wei-Qiang Zhang

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 针对多语言低资源语音识别中微调导致灾难性遗忘及跨任务干扰问题,提出统一梯度投影(UGP)方法,通过语言平衡重放的参考梯度约束参数更新,结合梯度级与数据级重放,有效减轻遗忘,实现有效适应。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11109 2026-07-14 cs.IR cs.CL 新提交

Generative Chinese Statute Retrieval

生成式中文法规检索

Yiteng Tu, Zitao Su, Weihang Su, Xuanyi Chen, Yueyue Wu, Yiqun Liu, Min Zhang, Qingyao Ai

机构 * Tsinghua University(清华大学) Quancheng Laboratory(清华实验室) Renmin University of China(中国人民大学)

AI总结 针对法规检索中口语化查询与正式法规语言的差距问题,提出GCSR生成式法规检索框架,通过多粒度结构化文档ID和多任务训练策略,将其转化为序列生成问题,实验证明该框架优于基线,凸显其在法律信息检索及推理任务中的有效性与潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11096 2026-07-14 cs.CV cs.SD stat.ML 新提交

Difference-Driven Gating: Adaptive Feature Fusion for U-Net Decoder

差异驱动门控:U-Net 解码器的自适应特征融合

Kai Li, Xuechao Zou, Jiashen Fu, Zijun Yan, Xintong Wang, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for Artificial Intelligence, BNRist, IDG/McGovern Institute for Brain Research, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院、北京信息科学与技术国家研究中心、IDG/麦戈文脑科学研究院) Chinese Institute for Brain Research (CIBR)(中国脑科学研究院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机与信息技术学院)

AI总结 研究 U-Net 风格模型中多尺度特征融合问题,提出基于特征差异和熵差异的门控方法,通过从两特征流差异导出注意力权重生成耦合门控映射,实验表明该方法优于现有方法,为特征融合提供新范式。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11083 2026-07-14 cs.SD 新提交

The SonicAGI System for the REAL-TSE Challenge

用于 REAL-TSE 挑战赛的 SonicAGI 系统

Kai Li, Wendi Sang, Jintao Cheng, Xiaolin Hu

机构 * Department of Computer Science and Technology, Institute for AI, BNRist, Tsinghua University(计算机科学与技术系、人工智能研究所、BNRist、清华大学) IDG/McGovern Institute for Brain Research, Tsinghua University(IDG/麦戈文脑科学研究所、清华大学) Chinese Institute for Brain Research (CIBR)(中国脑科学研究所)

AI总结 本文介绍 SonicAGI 参加 REAL-TSE 挑战赛的情况,采用以数据为中心的方法,在线引入 SwiftNet-Lookahead 控制延迟,离线用 USEF-TFGridNet 权衡质量与保真度,在官方评估中取得较好成绩,证明相关训练和建模对对话式 TSE 有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10815 2026-07-14 cs.RO 新提交

Learning Roller-Skating Motions of Humanoid Robots Based on Adversarial Motion Priors

基于对抗运动先验的仿人机器人轮滑运动学习

Yunkang Cheng, Yutong Wu, Menghan Li, Shihe Zhou, Mingguo Zhao

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing Key Laboratory of Embodied Intelligence Systems(北京具身智能系统重点实验室) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所)

AI总结 研究仿人机器人轮滑运动,提出基于对抗运动先验的强化学习框架,用于泵式滑行和推式滑行两种步态。通过动作捕捉收集数据并处理成参考运动状态,用独立管道学习步态,经模拟实验评估步态相关指标。

Comments 12 pages. Submitted preprint version. Accepted for oral presentation at CLAWAR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10784 2026-07-14 cs.LG cs.AI 新提交

LSTrans: Efficient Knowledge Transfer for Lightweight and Automated ECG Classification

LSTrans:用于轻量级和自动心电图分类的高效知识转移

Yi Zhao, Jiajun Gao, Chenyang Xu, Yuxi Zhou, Hao Wang

机构 * School of Mechano-Electronic Engineering Xidian University Xi'an, China(机械电子工程学院 西安电子科技大学 西安中国) School of Cyber Engineering Xidian University Xi'an, China(网络工程学院 西安电子科技大学 西安中国) DCST, BNRist, RIIT, Institute of Internet Industry Tsinghua University Beijing, China(DCST、BNRist、RIIT、互联网产业研究院 清华大学 北京中国)

AI总结 针对可穿戴设备上心电图分类计算成本高的问题,提出轻量级混合模型LSTrans,它结合一维卷积主干、Transformer编码器及知识蒸馏,在多基准数据集实验中实现诊断灵敏度与资源效率的平衡,减少内存占用和训练延迟。

Comments Submitted to BIBM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10745 2026-07-14 cs.CL 新提交

The First ChineseBabyLM Challenge: training data-efficient and cognitively plausible language models for Chinese

首个中文BabyLM挑战:训练数据高效且认知合理的中文语言模型

Siyuan Song, Zhiheng Qian, Yunhao Zhang, Linyang He, Xiaozhe Ji, Yingxin Lin, Hongao Zhu, Chongtian Shao, Chuhan Lang, Luan Li, Rui Wang, Renfen Hu, Shaonan Wang, Hai Hu

机构 * Princeton University(普林斯顿大学) Shanghai Jiao Tong University(上海交通大学) Chinese Academy of Sciences(中国科学院) Columbia University(哥伦比亚大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) University of California San Diego(加利福尼亚大学圣地亚哥分校) The Hong Kong Polytechnic University(香港理工大学)

AI总结 首个中文BabyLM挑战将在2026年自然语言处理与中文计算会议举办,要求用1亿中文词元从头训练语言模型,在自然语言理解、认知对齐和汉字知识三轨道评估,不限分词器、模型架构和训练轮数。

Comments 8 pages, 4 tables; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10336 2026-07-14 cs.RO cs.CV 新提交

PrismAD: Decoupled Planning via Semantic Mixture-of-Planners for End-to-End Autonomous Driving

PrismAD:通过语义规划器混合实现端到端自动驾驶的解耦规划

Kang Ding, Zhigui Lin, Hongsong Wang, Jie Gui, Qi Liu, Zhe Wang, Luqi Tang, Lei He

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与出行国家重点实验室) School of Cyberspace Security, Southeast University(东南大学网络空间安全学院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) School of Automotive Engineering, Wuhan University of Technology(武汉理工大学汽车工程学院) SAIC GM Wuling Automobile Co., Ltd.(上汽通用五菱汽车股份有限公司)

AI总结 研究针对自动驾驶规划器耦合问题,提出PrismAD框架,将场景令牌分组,用独立规划专家学习专门表示,语义感知路由器聚合预测,引入稀疏top-$K$激活,实验证明该框架性能具竞争力。

Comments 8 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10210 2026-07-14 cs.CR cs.CL 新提交

Toward Stronger Code Watermarking: A Grammar-Driven Approach to Optimizing the Trade-off Between Quality and Detectability

迈向更强的代码水印:一种语法驱动的方法来优化质量与可检测性之间的权衡

Licheng Yu, Aiwei Liu, Songze Li

机构 * Southeast University(东南大学) Tsinghua University(清华大学)

AI总结 针对大语言模型代码生成中质量与可检测性权衡难题,提出语法驱动水印方法(GDW),通过语法引导机制和角色感知调制注入水印,设计加权检测统计量,实验表明其在多方面优于现有方法且具鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10191 2026-07-14 cs.SD cs.AI 新提交

Breaking the Quality--Intelligibility Trade-off in Streaming Target Speaker Extraction via Deep-Feature-Anchored Preference Optimization

通过深度特征锚定偏好优化打破流式目标说话人提取中的质量-可懂度权衡

Shuhai Peng, Jinjiang Liu, Hui Lu, Liyang Chen, Guiping Zhong, Jiakui Li, Shiyin Kang, Zhiyong Wu

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) SenseTime(商汤科技)

AI总结 研究流式目标说话人提取中的质量-可懂度权衡问题,提出扩大Conformer卷积核及基于WavLM的DPO微调策略,实现了相对可懂度10.9%的提升,同时音频质量和说话人相似度也有改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10004 2026-07-14 cs.CV 新提交

Model Guides You How to Draw: Adaptive Visual Gating for Unified Multimodal Reasoning

模型指导绘图:用于统一多模态推理的自适应视觉门控

Wenxi Gao, Guanxi Lu, Didi Zhu, Hao Mark Chen, Quan Deng, Zhican Wang, Jiankang Deng, Hongxiang Fan

机构 * Imperial College London(伦敦帝国理工学院) Tsinghua University(清华大学)

AI总结 针对统一多模态模型在视觉推理中存在的问题,提出基于生成意图和视觉保真度两个内部信号的AdaViG方法,可动态评估视觉步骤,避免误导性视觉证据进入推理过程,提升了准确率并降低计算量和延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09661 2026-07-13 cs.CV 新提交

PanoWorld: Real-World Panoramic Generation

全景世界:真实世界全景生成

Haoyuan Li, Dizhe Zhang, Yuemei Zhou, Xiangkai Zhang, Haoran Feng, Xiaofan Lin, Wenjie Jiang, Bo Du, Ming-Hsuan Yang, Lu Qi

机构 * Insta360 Research(影石创新科技研究院) Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Wuhan University(武汉大学) UC Merced(加州大学默塞德分校)

AI总结 该研究旨在解决全景世界模型的远程记忆挑战,提出PanoWorld,利用旋转等变特性简化相机轨迹,通过DPRC和GMA进行建模与记忆增强,经三阶段训练优化,构建World360数据集验证其有效性,优于其他方法且将公开模型、代码和数据集。

Comments Project page: https://lihaoy-ux.github.io/panoworld-page/ Code:https://github.com/Insta360-Research-Team/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09537 2026-07-13 cs.LG 新提交

GatedLinear: Adaptive Routing of Complementary Linear Bases for Time Series Forecasting

门控线性:用于时间序列预测的互补线性基的自适应路由

Qitai Tan, Ruiwen Gu, Yilin Su, Mo Li, Xu Lin, Xiao-Ping Zhang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 针对时间序列预测中多样动态难以用单一机制处理的问题,提出门控线性框架,通过三种专门机制及三因式融合门实现互补线性基的自适应路由,实验显示其在精度、可解释性和参数规模上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09526 2026-07-13 cs.CV cs.AI 新提交

ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts

ALICE:从视觉、视觉语言和玻片级专家学习通用病理学基础模型

Jiawen Li, Tian Guan, Huijuan Shi, Xitong Ling, Mingxi Fu, Anjia Han, Chao He, Yonghong He

机构 * Institute of Biopharmaceutical and Health Engineering, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学生物医药与健康工程研究院,清华大学深圳国际研究生院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Department of Pathology, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院病理科) Medical Optical Technology R&D Center, Research Institute of Tsinghua, Pearl River Delta(清华珠三角研究院医学光学技术研发中心)

AI总结 研究提出通过多阶段凝聚蒸馏训练的ALICE统一基础模型,将多种教师模型知识整合到单个主干。它在大量图像上预训练,经多场景多任务评估,在任务匹配病理基础模型中平均排名最佳,证明凝聚蒸馏可整合能力用于广泛病理学应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06988 2026-07-13 cs.RO cs.AI 新提交

WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time

WAM-TTT:在测试时通过观察人类行为来引导世界行动模型

Yusen Feng, Bingchen Han, Jiangran Lyu, Kai Liu, Yixin Zheng, Yuxuan Wan, Weiheng Liu, Sun Han, Ruiqin Li, Yulong Zhang, Fangfu Liu, Xuesong Shi, Libin Liu, Yizhou Wang, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot CASIA(中国科学院自动化所) Tsinghua University(清华大学)

AI总结 研究旨在解决引导机器人基础模型的难题,提出WAM-TTT框架,通过自监督视频预测吸收人类视频到自适应内存,经元训练阶段对齐人机行为,测试时仅用未标记人类视频,实现高效可重复引导且优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04261 2026-07-13 cs.AI 新提交

Shortcut Learning in Legal Judgment Prediction: Empirical Evidence from the UK Employment Tribunal

法律判决预测中的捷径学习:来自英国就业法庭的实证证据

Joe Watson, Joana Ribeiro de Faria, Marcus Tomalin, Måns Magnusson, Huiyuan Xie, Hao Tian Yeung, Christine Carter, Jonathan Rutherford, Felix Steffek

机构 * Faculty of Law, University of Cambridge(剑桥大学法学院) The Psychometrics Centre, Cambridge Judge Business School, University of Cambridge(剑桥大学心理学测量中心,剑桥Judge商学院) Faculty of English, University of Cambridge(剑桥大学英语学院) Department of Statistics, Uppsala University(乌普萨拉大学统计系) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Engineering, University of Cambridge(剑桥大学工程系)

AI总结 研究英国就业法庭判决中索赔结果预测的捷径学习,用33158条索赔语料库预测结果,发现基于事后司法文本训练的法律判决预测系统性能或被夸大,去除泄漏特征后模型仍能提取有用信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08646 2026-07-10 cs.CL cs.AI 新提交

UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing

UltraX:通过自适应编程编辑大规模精炼预训练数据

Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

机构 * Peking University(北京大学) ModelBest Inc.(ModelBest公司) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对训练数据极限下大语言模型高质量数据利用问题,提出UltraX框架,通过引入插入完善编辑功能空间,构建程序监督生成管道,经实验验证其在各语料库平均性能最高,数据效率和精炼可靠性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08198 2026-07-10 cs.CV 新提交

Unpaired Joint Distribution Modeling via Multi-Scale Image Representations

通过多尺度图像表示进行无配对联合分布建模

Yihang Zou, Hui Zhang, Zuowei Shen, Chenglong Bao

机构 * Yau Mathematical Sciences Center, Tsinghua University(丘成桐数学科学中心,清华大学) Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) Qiuzhen College, Tsinghua University(清华大学求真书院) Department of Mathematics, National University of Singapore(新加坡国立大学数学系) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院) State Key Laboratory of Membrane Sciences, Tsinghua University(清华大学膜生物学国家重点实验室)

AI总结 研究从边际观测学习联合分布问题,提出LUD - MSR框架,通过辅助表示建模并优化证据下界,建立误差上界揭示权衡,引入MSR映射,实验证明该框架在真实去噪基准测试中有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08161 2026-07-10 cs.CL cs.CV 新提交

SQuaD-SQL: Efficient Text-to-SQL with Small Language Models via LLM-Guided Knowledge Distillation

SQuaD-SQL:通过大语言模型引导的知识蒸馏,利用小语言模型实现高效的文本到SQL转换

Wangyu Wu, Xiaojian Lin, Rong Fu, Zaiyang Yu, Xuhang Chen, Wenjun Yu, Zhenhong Chen

机构 * The University of Liverpool(利物浦大学) University of Macau(澳门大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Microsoft(微软) Shanghai University of International Business and Economics(上海国际经贸管理大学) Huizhou University(惠州市大学)

AI总结 研究如何让小语言模型在文本到SQL任务中接近大语言模型性能。核心方法是通过知识蒸馏和合成数据生成,包含基于大语言模型的合成数据生成、参数高效微调和领域自适应微调三个关键组件。主要贡献是在WikiSQL数据集上执行准确率达86.9%,推理更快、内存使用更低。

Comments Accepted at IEEE SMC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08080 2026-07-10 cs.CL 新提交

MASTE: A Multi-Agent Pipeline for Zero-Shot Aspect Sentiment Triplet Extraction

MASTE:一种用于零样本方面情感三元组提取的多智能体管道

Ao Hong, Lehang Wang, Zhirun Yue, Mingxin Wang, Zihan Wang, Houde Liu

机构 * Tsinghua University(清华大学) Wuhan University(武汉大学)

AI总结 研究针对方面情感三元组提取问题,提出多智能体管道MASTE,将其分解为四个阶段,由专门智能体处理不同子任务,实现完全无训练的零样本提取,在多个基准测试中显著优于基线,缩小与全监督方法差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24477 2026-07-10 cs.CV cs.AI cs.SD 新提交

video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

video-SALMONN-R$^3$: 学习重看、重问和重答以实现高效视频理解

Yixuan Li, Guangzhi Sun, Yudong Yang, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动) University of Cambridge(剑桥大学)

AI总结 提出video-SALMONN-R$^3$,首个通过强化学习实现重看机制的视频大语言模型,无需链式思维冷启动,采用重答和重问策略提升视频问答效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15920 2026-07-10 cs.CV 新提交

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

OmniOPSD:面向情感计算的理性特权在线自蒸馏

Zebang Cheng, Shuimu Chen, Boxue Yang, Yuanshen Guan, Jingyi Chen, Zheng Lian, Xiaojiang Peng, Fei Ma, LaiZhong Cui, Qi Tian

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Technology University(深圳技术大学) Tongji University(同济大学) Huawei(华为)

AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07678 2026-07-09 cs.LG 新提交

How Data Shapes RoPE Frequency Usage: From Positional Scale Matching to Length Generalization

数据如何塑造RoPE频率使用:从位置尺度匹配到长度泛化

Xinyi Wu, Siyuan Liu, Ali Jadbabaie

机构 * MIT IDSS(麻省理工学院信息系统与决策科学实验室) IIIS, Tsinghua University(清华大学交叉信息研究院)

AI总结 研究RoPE频率使用不均匀的原因,提出数据诱导依赖决定频率使用,最佳频率与1/W成比例,该原则解释了相关观察,还将频率选择与长度泛化联系,表明自然语言有自相似性,长上下文泛化取决于两种尺度匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07508 2026-07-09 cs.LG cs.AI 新提交

Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning

用于智能强化学习的单步异步优化

Zhenyu Hou, Yujiang Li, Jie Tang, Yuxiao Dong

机构 * Tsinghua University(清华大学)

AI总结 研究针对异步强化学习中训练稳定性和离策略挑战,提出单步异步优化(SAO)。核心方法是用单步采样取代分组采样,改进单步策略并引入裁剪策略。主要贡献是SAO训练稳定,性能优于GRPO及其变体,在模拟在线学习中有效且成功部署于模型训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07467 2026-07-09 cs.AI 新提交

SpaCellAgent: A Self-Evolving LLM-Based Multi-Agent Framework for Trajectory Analysis

SpaCellAgent:一种基于自进化大语言模型的轨迹分析多智能体框架

Songhan Wang, Haoang Chi, He Li, Zhiheng Zhang, Jiayan Yuan, Cheems Wang, Hao Peng, Xinwang Liu, Wenjing Yang

机构 * University of Shanghai for Science and Technology(上海理工大学) National University of Defense Technology(国防科技大学) Hong Kong Baptist University(香港浸会大学) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

AI总结 研究针对轨迹推断现有方法需大量人工干预的问题,提出基于大语言模型的多智能体框架SpaCellAgent,利用多智能体架构、动态工具编排引擎和自进化模块,经实验验证其能大幅提高分析效率,推动先进时空建模民主化。

Comments 27 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏