arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-04-21 至 2026-04-21 共收录 57
2604.18484 2026-04-21 cs.CV cs.MM cs.RO

XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments

XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型

Kangan Qian, ChuChu Xie, Yang Zhong, Jingrui Pang, Siwen Jiao, Sicong Jiang, Zilin Huang, Yunlong Wang, Kun Jiang, Mengmeng Yang, Hao Ye, Guanghao Zhang, Hangjun Ye, Guang Chen, Long Chen, Diange Yang

机构 * Tsinghua University(清华大学) Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技) National University of Singapore(新加坡国立大学) McGill University(麦吉尔大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 XEmbodied通过整合3D几何表示和物理线索,提升视觉-语言-动作模型在大规模具身环境中的空间推理和语义理解能力,其在18个公开基准测试中表现出色。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18107 2026-04-21 cs.CV

Test-Time Perturbation Learning with Delayed Feedback for Vision-Language-Action Models

基于延迟反馈的测试时扰动学习用于视觉-语言-动作模型

Zehua Zang, Xi Wang, Fuchun Sun, Xiao Xu, Lixiang Lium, Jiahuan Zhou, Jiangmeng Li

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) National Defense University(国防大学)

AI总结 本文提出PDF框架,通过不确定性数据增强和动作投票缓解轨迹过拟合,提升决策性能,实验显示在LIBERO和Atari任务中取得显著成效。

Comments 12 pages, 7 figures, 5 tables

Journal ref CVPR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18095 2026-04-21 cs.AI

DSAINet: An Efficient Dual-Scale Attentive Interaction Network for General EEG Decoding

DSAINet: 一种高效的双尺度注意力交互网络用于通用EEG解码

Zhiyuan Ma, Zeyuan Li, Zihao Qiu, Jinhao Li, Lingqin Meng, Xinche Zhang, Yixuan Liu, Xinke Shen, Sen Song

机构 * School of Biomedical Engineering, Tsinghua Laboratory of Brain and Intelligence, and IDG/McGovern Institute for Brain Research, Tsinghua University(生物医学工程系、脑与智能清华实验室及IDG/麦克戈文脑科学研究院,清华大学) School of Basic Medical Sciences and Tsinghua Laboratory of Brain and Intelligence, Tsinghua University(基础医学系及脑与智能清华实验室,清华大学) Department of Psychological and Cognitive Sciences, Tsinghua University(心理学与认知科学系,清华大学) Department of Biomedical Engineering, Southern University of Science and Technology(生物医学工程系,南方科技大学)

AI总结 DSAINet通过双尺度注意力机制构建共享时空表示,有效解决EEG解码中任务相关信号的时序差异问题,实现跨任务的高效解码与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18019 2026-04-21 cs.CV

Multi-View Hierarchical Graph Neural Network for Sketch-Based 3D Shape Retrieval

多视图分层图神经网络用于基于草图的3D形状检索

Hang Cheng, Muyan He, Mingyu Fan, Chengfeng Xie, Xi Cheng, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Control and Simulation Center, Harbin Institute of Technology(哈尔滨工业大学控制仿真中心)

AI总结 本文提出MV-HGNN框架,通过多视图图神经网络和视图选择器提升3D形状检索的表示能力,结合CLIP文本嵌入实现类别无关对齐,实验表明在类别级和零样本场景中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18003 2026-04-21 cs.AI

SELF-EMO: Emotional Self-Evolution from Recognition to Consistent Expression

SELF-EMO:从识别到一致表达的情感自我进化

Shaowei Zhang, Faqiang Qian, Yan Chen, Ziliang Wang, Kang An, Yong Dai, Mengya Gao, Yichao Wu

机构 * SenseTime Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) X-Humanoid

AI总结 SELF-EMO通过引入情感理解和表达辅助任务,结合角色自博弈机制和数据飞轮机制,实现情感识别与表达的自我进化,实验表明其在多个数据集上均取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18000 2026-04-21 cs.RO

Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models

揭示视觉-语言-动作模型中具身推理的幻觉

Haiweng Xu, Sipeng Zheng, Hao Luo, Wanpeng Zhang, Ziheng Xi, Zongqing Lu

机构 * Peking University(北京大学) Tsinghua University(清华大学) BeingBeyond

AI总结 本文通过BeTTER基准测试揭示现有VLA模型在动态场景中表现不佳,指出其根本问题在于架构瓶颈导致的语义表示退化,强调需解决高频率控制与高层推理间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17928 2026-04-21 cs.LG cs.AI

HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment

HEALing Entropy Collapse: 通过混合领域熵动力学对齐增强少样本RLVR的探索

Zhanyu Liu, Qingguo Hu, Ante Wang, Chenqing Liu, Zhishang Xiang, Hui Li, Delai Qiu, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Tsinghua University(清华大学) Xiamen Unisound Intelligence Technology Co., Ltd(厦门Unisound智能科技有限公司) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),中华人民共和国文化和旅游部,中国)

AI总结 本文提出HEAL框架,通过混合领域熵动力学对齐缓解少样本RLVR中的熵崩溃问题,提升探索多样性与推理性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17863 2026-04-21 cs.RO cs.AI

Periodic Steady-State Control of a Handkerchief-Spinning Task Using a Parallel Anti-Parallelogram Tendon-driven Wrist

使用平行反平行四边形腱驱动手腕实现手帕纺任务的周期稳态控制

Lei Liu, Haonan Zhang, Huahang Xu, Zefan Zhang, Lulu Chang, Lei Lv, Andrew Ross McIntosh, Kai Sun, Zhenshan Bing, Jiahong Dong, Fuchun Sun

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程系) School of Artificial Intelligence, Beihang University(北航人工智能学院) Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能量技术研究院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Automation, Nanjing University of Science and Technology(南京理工大学自动化学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能自主系统研究院) Department of Mechanical Engineering, Tsinghua University(清华大学机械工程系) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) State Key Laboratory for Novel Software Technology and the School of Science and Technology, Nanjing University (Suzhou Campus)(南京大学软件新技术国家重点实验室(苏州校区)) Hepato-pancreato-biliary Center, Beijing Tsinghua Changgung Hospital(北京清华长庚医院肝胆外科中心) Key Laboratory of Digital Intelligence Hepatology (Ministry of Education), Beijing, China(教育部数字智能肝病重点实验室(北京)) School of Clinical Medicine, Tsinghua Medicine, Tsinghua University(清华大学医学部临床医学学院)

AI总结 本文提出了一种平行反平行四边形腱驱动手腕,结合分层控制方案和粒子弹簧模型,实现了高动态手帕纺任务的高展开比和高精度跟踪。

Comments ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17841 2026-04-21 cs.RO

Driving risk emerges from the required two-dimensional joint evasive acceleration

驾驶风险源自所需二维联合规避加速度

Hao Cheng, Yanbo Jiang, Wenhao Yu, Rui Zhou, Jiang Bian, Keyu Chen, Zhiyuan Liu, Heye Huang, Hailun Zhang, Fang Zhang, Jianqiang Wang, Sifa Zheng

机构 * School of Vehicle and Mobility, Tsinghua University, Beijing 100084, China(车辆与移动系统学院,清华大学,北京100084,中国) State Key Laboratory of Intelligent Green Vehicle and Mobility, Beijing 100084, China(智能绿色车辆与移动国家重点实验室,北京100084,中国) School of Traffic & Transportation Engineering, Central South University, Changsha 410000, China(交通与运输工程学院,中南大学,长沙410000,中国) Singapore-MIT Alliance for Research and Technology (SMART), Massachusetts Institute of Technology, Singapore 138602, Singapore(新加坡-麻省理工联合研究技术联盟(SMART),麻省理工学院,新加坡138602,新加坡) School of Automotive Engineering, Chang’an University, Xi’an 710064, China(汽车工程学院,长安大学,西安710064,中国)

AI总结 本文提出二维规避加速度模型,用于更准确地量化碰撞风险,通过分析所有可能的规避方向,定义风险为所需最小相对加速度矢量的模,该方法在多个数据集上表现出更早的显著预警和更好的碰撞预测能力。

Comments 23 pages, 5 figures; supplementary information provided as an ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05489 2026-04-21 cs.AI cs.MA

SCMAPR: Self-Correcting Multi-Agent Prompt Refinement for Complex-Scenario Text-to-Video Generation

SCMAPR: 自校正多智能体提示精修用于复杂场景文本到视频生成

Chengyi Yang, Pengzhen Li, Jiayin Qi, Aimin Zhou, Ji Wu, Ji Liu

机构 * HiThink Research(HiThink研究院) East China Normal University(华东师范大学) Guangzhou University(广州大学) Tsinghua University(清华大学)

AI总结 本文提出SCMAPR框架,通过多智能体分阶段精修提升复杂场景下的文本到视频生成质量,实验表明在VBench和EvalCrafter等基准上平均得分提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28166 2026-04-21 cs.CR cs.AI

Evaluating Privilege Usage of Agents with Real-World Tools

评估具有现实工具的代理的特权使用

Quan Zhang, Lianhang Fu, Lvsi Lian, Gwihwan Go, Yujue Wang, Chijin Zhou, Yu Jiang, Geguang Pu

机构 * Xinjiang University(新疆大学) Tsinghua University(清华大学)

AI总结 本文提出GrantBox,一个用于评估代理特权使用的安全沙盒,通过集成真实工具和允许LLM代理调用真实特权,评估代理在提示注入攻击下的安全能力,发现LLM在面对复杂攻击时平均攻击成功率高达84.80%。

Comments Accepted to the FSE 2026 Ideas, Visions, and Reflections track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23404 2026-04-21 cs.CV cs.CL

Unleashing Spatial Reasoning in Multimodal Large Language Models via Textual Representation Guided Reasoning

通过文本表示引导推理来解锁多模态大语言模型中的空间推理

Jiacheng Hua, Yishu Yin, Yuhang Wu, Tai Wang, Yifei Huang, Miao Liu

机构 * College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) The University of Tokyo, Tokyo, Japan(东京大学,东京,日本)

AI总结 本文提出TRACE方法,通过生成文本表示来提升多模态大语言模型的空间推理能力,实验表明其在多个基准测试中表现优异。

Comments Accepted to ACL 2026. 22 pages, 6 figures, 10 tables. Project page: https://trace-reasoning.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04043 2026-04-21 cs.CL

When Helpers Become Hazards: A Benchmark for Analyzing Multimodal LLM-Powered Safety in Daily Life

当助手变成危险:一个多模态大语言模型在日常生活中的安全分析基准

Xinyue Lou, Jinan Xu, Jingyi Yin, Xiaolong Wang, Zhaolu Kang, Youwei Liao, Yixuan Wang, Xiangyu Shi, Fengran Mo, Su Yao, Kaiyu Huang

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(大数据与人工智能在交通运输中的关键实验室(北京交通大学),教育部) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) Tsinghua University(清华大学) Peking University(北京大学) University of Montreal(蒙特利尔大学)

AI总结 本文提出SaLAD基准,通过2013个真实世界图像-文本样本评估多模态大语言模型在日常生活中的安全影响,揭示模型在识别危险行为方面的局限性。

Comments Accepted by ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12643 2026-04-21 cs.CL

LexRel: Benchmarking Legal Relation Extraction for Chinese Civil Cases

LexRel:中国民事案件法律关系抽取基准测试

Yida Cai, Ranjuexiao Hu, Huiyuan Xie, Chenyang Li, Yun Liu, Yuxiao Ye, Zhenghao Liu, Weixing Shen, Zhiyuan Liu

机构 * Tsinghua University(清华大学) Peking University(北京大学) University of Glasgow(格拉斯哥大学) Beijing University of Posts and Telecommunications(北京邮电大学) Queen Mary University of London(伦敦玛丽女王大学) Northeastern University(东北大学)

AI总结 本文提出LexRel基准,用于评估法律关系抽取任务,揭示当前大语言模型在识别民事法律关系上的不足,并展示显式整合法律关系信息对下游法律AI任务的积极影响。

Comments Accepted to ACL 2026 (main conference). 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01643 2026-04-21 cs.CV

ViT$^3$: Unlocking Test-Time Training in Vision

ViT$^3$:解锁视觉中的测试时间训练

Dongchen Han, Yining Li, Tianyu Li, Zixuan Cao, Ziming Wang, Jun Song, Yu Cheng, Bo Zheng, Gao Huang

机构 * Tsinghua University(清华大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出ViT$^3$,一种线性复杂度的纯测试时间训练模型,通过系统研究揭示了视觉序列建模中TTT设计的六个实用原则,并在多个视觉任务中验证其性能。

Comments CVPR 2026, oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26721 2026-04-21 cs.AI cs.MM

MaLoRA: Gated Modality LoRA for Key-Space Alignment in Multimodal LLM Fine-Tuning

MaLoRA:基于关键空间对齐的门控模态LoRA

Xinhan Zheng, Huyu Wu, Xueting Wang, Duo Su, Haiyun Jiang

机构 * University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-鲁维尔研究所) Rajiv Gandhi University(拉贾·甘地大学) Palmer Research Laboratories(帕勒实验室)

AI总结 本文提出MaLoRA,通过门控机制对齐多模态LLM微调中的关键空间,揭示文本偏见源于注意力键空间内在不匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16756 2026-04-21 cs.AI cs.CL cs.CV cs.RO eess.AS

End-to-end Listen, Look, Speak and Act

端到端听、看、说和行动

Siyin Wang, Wenyi Yu, Xianzhao Chen, Xiaohai Tian, Jun Zhang, Lu Lu, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

AI总结 本文提出ELLSA模型,首个端到端全双工系统,实现视觉、文本、语音和行动的同步感知与生成,支持对话轮替、指令拒绝等复杂交互行为,推动更自然的人工智能发展。

Comments 22 pages, 8 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15253 2026-04-21 cs.CL cs.CV

Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding

超越上下文的规模:文档理解的多模态检索增强生成综述

Sensen Gao, Shanshan Zhao, Xu Jiang, Lunhao Duan, Yong Xien Chng, Qing-Guo Chen, Weihua Luo, Kaifu Zhang, Jia-Wang Bian, Mingming Gong

机构 * MBZUAI Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) University of Melbourne(墨尔本大学)

AI总结 本文综述了多模态检索增强生成在文档理解中的应用,提出基于领域、检索模态和粒度的分类体系,总结了关键数据集、基准测试和行业应用,指出了效率、细粒度表示和鲁棒性等挑战。

Comments Accepted by ACL2026 Main Conference; Project is available at https://github.com/SensenGao/Multimodal-RAG-Survey-For-Document

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08878 2026-04-21 cs.SD cs.AI cs.CL eess.AS

ControlAudio: Tackling Text-Guided, Timing-Indicated and Intelligible Audio Generation via Progressive Diffusion Modeling

ControlAudio:通过渐进扩散建模解决文本引导、时间指示和可理解音频生成

Yuxuan Jiang, Zehua Chen, Zeqian Ju, Yusheng Dai, Weibei Dou, Jun Zhu

机构 * Tsinghua University(清华大学) Shengshu AI(盛舒AI) University of Science and Technology of China(中国科学技术大学) Monash University(墨尔本大学)

AI总结 ControlAudio通过多任务学习和渐进扩散建模,实现文本、时间及音素特征的精细控制,提升音频生成的时序精度和语音清晰度,达到当前最优水平。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23808 2026-04-21 cs.LG cs.CL

Semantic-Space Exploration and Exploitation in RLVR for LLM Reasoning

在RLVR中对LLM推理进行语义空间探索与利用

Fanding Huang, Guanbo Huang, Xiao Fan, Yi He, Xiao Liang, Xiao Chen, Qinting Jiang, Faisal Nadeem Khan, Jingyan Jiang, Zhi Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) University of California, Los Angeles(加州大学洛杉矶分校) Shenzhen Technology University(深圳技术大学)

AI总结 本文提出VERL方法,通过有效秩和其时间导数改进RLVR,实现语义空间中探索与利用的平衡,提升LLM推理性能。

Comments Accepted as an ACL 2026 Findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18169 2026-04-21 cs.LG cs.CE cs.CL

PiERN: Token-Level Routing for Integrating High-Precision Computation and Reasoning

PiERN:基于令牌级别的路由以整合高精度计算与推理

Hengbo Xiao, Jingyuan Fan, Xin Tong, Jingzhao Zhang, Chao Lu, Guannan He

机构 * Peking University(北京大学) Peking University Changsha Institute for Computing and Digital Economy(北京大学长沙计算与数字经济研究院) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

AI总结 PiERN通过内生整合计算能力,提升语言模型在复杂系统中的精度与效率,实现高准确性、低延迟和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07809 2026-04-21 cs.LG

EvoCoT: Overcoming the Exploration Bottleneck in Reinforcement Learning

EvoCoT:克服强化学习中的探索瓶颈

Huanyu Liu, Jia Li, Yihong Dong, Chang Yu, Taozhi Chen, Lecheng Wang, Yongding Tao, Bin Gu, Ge Li

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) Imperial College London(伦敦帝国理工学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 EvoCoT通过两阶段链式思维优化框架,解决强化学习中稀疏奖励下的探索瓶颈问题,提升大语言模型的推理能力。

Comments Camera-ready version for ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03157 2026-04-21 q-bio.BM cs.LG

UniSim: A Unified Simulator for Time-Coarsened Dynamics of Biomolecules

UniSim: 一种统一的生物分子时间粗化动力学模拟器

Ziyang Yu, Wenbing Huang, Yang Liu

机构 * Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(清华大学人工智能产业研究院) Gaoling School of Artificial intelligence, Renmin University of China, Beijing, China(中国人民大学agog学校人工智能学院) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程研究中心,教育部)

AI总结 UniSim通过跨领域知识提升原子相互作用理解,采用多头预训练和随机插值框架,实现对小分子、肽类和蛋白质的高效模拟。

Comments ICML 2025 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17377 2026-04-21 cs.CL

AnchorMem: Anchored Facts with Associative Contexts for Building Memory in Large Language Models

AnchorMem: 基于关联上下文的锚定事实用于构建大语言模型的记忆

Zhanyu Shen, Sijie Cheng, Zhicheng Guo, Weiqin Wang, Yile Wang, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Tsinghua University(清华大学)

AI总结 本文提出AnchorMem,通过锚定事实与关联上下文构建大语言模型的记忆系统,解决传统方法依赖总结导致信息丢失的问题,实验表明其在LoCoMo基准上表现优异。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17298 2026-04-21 cs.CV

Frequency-guided Multi-level Reasoning for Scene Graph Generation in Video

基于频率的多级推理用于视频场景图生成

Chenxing Li, Yiping Duan, Xiaoming Tao

机构 * Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) State Key Laboratory of Space Network and Communications(空间网络与通信国家重点实验室) Beijing National Research Center for Information Science and Technology (BNRist)(北京国家信息科学与技术研究中心) School of Computer Science and Technology, Xinjiang University, Urumqi, China(新疆大学计算机科学与技术学院)

AI总结 本文提出FReMuRe模型,通过引入关系特定分支和频率感知双分支谓词嵌入网络,提升长尾关系的建模能力,增强场景图生成的鲁棒性与召回率。

Comments 5pages,3figures, 2tables, icassp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17293 2026-04-21 cs.CL

Beyond "I Don't Know": Evaluating LLM Self-Awareness in Discriminating Data and Model Uncertainty

超越“我不知道”:评估LLM在区分数据和模型不确定性中的自我意识

Jingyi Ren, Ante Wang, Yunghwei Lai, Xiaolong Wang, Linlu Gong, Weitao Li, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国)

AI总结 本文提出UA-Bench基准测试,评估LLM在区分数据不确定性和模型不确定性方面的能力,发现即使先进模型也难以可靠区分,并提出轻量数据合成与强化学习策略提升不确定性判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11552 2026-04-21 cs.SD cs.CL

MimicLM: Zero-Shot Voice Imitation through Autoregressive Modeling of Pseudo-Parallel Speech Corpora

MimicLM:通过自回归建模伪并行语音语料实现零样本语音模仿

Tao Feng, Yuxiang Wang, Yuancheng Wang, Xueyao Zhang, Dekun Chen, Chaoren Wang, Xun Guan, Zhizheng Wu

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 MimicLM通过自回归建模伪并行语音语料,利用合成语音作为训练源,保留真实录音作为目标,提升语音模仿的自然度和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07506 2026-04-21 cs.AI cs.CL

ReflectRM: Boosting Generative Reward Models via Self-Reflection within a Unified Judgment Framework

ReflectRM: 通过统一判断框架内的自我反思提升生成奖励模型

Kai Qin, Liangxin Liu, Yu Liang, Longzheng Wang, Yan Wang, Yueyang Zhang, Long Xia, Zhiyuan Sun, Houde Liu, Daiting Shi

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Baidu Inc.(百度公司)

AI总结 ReflectRM通过自我反思评估分析质量,提升偏好建模,实验表明其在四个基准测试中平均准确率提升3.7%,并有效缓解位置偏差。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14389 2026-04-21 cs.LG cs.AI

From $\log π$ to $π$: Taming Divergence in Soft Clipping via Bilateral Decoupled Decay of Probability Gradient Weight

从log π到π:通过双侧解耦衰减概率梯度权重来驯服发散

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Chaowen Hu, Cong Qin, Zekai Shao, Binbin Zheng, Lu Pan, Ke Zeng

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出DGPO方法,通过解耦衰减机制解决RLVR中概率梯度发散问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11182 2026-04-21 cs.CL

MetaMem: Evolving Meta-Memory for Knowledge Utilization through Self-Reflective Symbolic Optimization

MetaMem: 通过自反思符号优化实现元记忆的进化以促进知识利用

Haidong Xin, Xinze Li, Zhenghao Liu, Yukun Yan, Shuo Wang, Cheng Yang, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) School of Computer Science, Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学计算机学院)

AI总结 本文提出MetaMem框架,通过自反思符号优化增强记忆系统,帮助LLM更有效地利用记忆知识。实验表明,MetaMem在多个任务中显著优于基线模型,提升超过3.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏