arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-04-27 至 2026-04-27 共收录 12
2604.20834 2026-04-27 cs.RO

PokeVLA: Empowering Pocket-Sized Vision-Language-Action Model with Comprehensive World Knowledge Guidance

PokeVLA:通过全面的世界知识指导赋能便携式视觉-语言-动作模型

Yupeng Zheng, Xiang Li, Songen Gu, Yuhang Zheng, Shuai Tian, Weize Li, Linbo Wang, Senyu Fei, Pengfei Li, Yinfeng Gao, Zebin Xing, Yilun Chen, Qichao Zhang, Haoran Li, Wenchao Ding

机构 * CASIA(中国科学院自动化研究所) TARS Robotics(TARS机器人实验室) Tsinghua University(清华大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学) Tongji University(同济大学)

AI总结 本文提出PokeVLA,一种轻量但强大的具身体验模型,通过预训练视觉语言模型和多视角目标感知学习提升机器人操作效率与空间认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00813 2026-04-27 cs.CV cs.AI cs.RO

DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale

DVGT-2:面向大规模自动驾驶的视觉-几何-动作模型

Sicheng Zuo, Zixun Xie, Wenzhao Zheng, Shaoqing Xu, Fang Li, Hanbing Li, Long Chen, Zhi-Xin Yang, Jiwen Lu

机构 * Tsinghua University(清华大学) Xiaomi EV(小米电动车) University of Macau(澳门大学) Peking University(北京大学)

AI总结 本文提出VGA范式,通过密集3D几何信息提升自动驾驶决策,引入DVGT-2实现在线处理,结合时间因果注意力和滑动窗口策略,提升效率与重建性能。

Comments Code is available at https://github.com/wzzheng/DVGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22548 2026-04-27 stat.AP cs.LG

Multi-output Extreme Spatial Model for Complex Aircraft Production Systems

多输出极值空间模型用于复杂飞机生产系统

Cheolhei Lee, Xing Wang, Xiaowei Yue, Jianguo Wu

机构 * Grado Department of Industrial and Systems Engineering, Virginia Polytechnic Institute and State University(弗吉尼亚理工学院和州立大学工业与系统工程系) Department of Mathematics, Illinois State University(伊利诺伊州立大学数学系) Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) Department of Industrial Engineering and Management, Peking University(北京大学工业工程与管理系)

AI总结 本文提出多输出极值空间模型,用于复杂飞机生产系统中的极值预测与风险分析,通过双域线性函数捕捉动态,提升极端事件预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22335 2026-04-27 cs.CL

Context-Fidelity Boosting: Enhancing Faithful Generation through Watermark-Inspired Decoding

上下文保真度提升:通过水印启发式解码增强忠实生成

Weixu Zhang, Fanghua Ye, Qiang Gao, Jian Li, Haolun Wu, Yuxing Tian, Sijing Duan, Nan Du, Xiaolong Li, Xue Liu

机构 * Hunyuan AI Digital Human, Tencent(腾讯文深AI数字人) McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Wuhan University(武汉大学) University of Montreal(蒙特利尔大学) Tsinghua University(清华大学) MBZUAI

AI总结 本文提出CFB框架,通过增加源支持标记的生成概率减少大语言模型中的保真度幻觉,采用基于水印技术的logit调整策略,三种增强策略提升生成忠实度,无需重训练即可兼容多种LLM。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22324 2026-04-27 cs.LG

A Brain-Inspired Deep Separation Network for Single Channel Raman Spectra Unmixing

一种受大脑启发的深度分离网络用于单通道拉曼光谱解混

Gaoruishu Long, Jinchao Liu, Bo Liu, Jie Liu, Xiaolin Hu

机构 * College of Artificial Intelligence, Nankai University, Tianjin, China(南开大学人工智能学院) Guangdong Laboratory of Chemistry and Fine Chemical Industry, Guangdong, China(广东省化学与精细化工实验室) Smekal Tech (Shantou) Ltd.(斯梅卡科技(汕头)有限公司) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

AI总结 本文提出受语音分离启发的深度分离网络RSSNet,用于单通道拉曼光谱解混,通过分解千种成分库中的噪声混合光谱,优于现有方法,且能有效处理真实世界混合样品。

Comments Accepted by the 2026 International Joint Conference on Neural Networks (IJCNN 2026). 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22225 2026-04-27 cs.CL eess.AS

TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis

TTS-PRISM:一种用于细粒度诊断的感知推理和可解释语音模型

Xi Wang, Jie Wang, Xingchen Song, Baijun Song, Jingran Xie, Jiahe Shao, Zijian Lin, Di Wu, Meng Meng, Jian Luan, Zhiyong Wu

机构 * Tsinghua University(清华大学) MiLM Plus, Xiaomi Inc.(小鹏科技MiLM Plus) The University of Tokyo(东京大学)

AI总结 本文提出TTS-PRISM模型,通过多维诊断框架和可解释合成流程,实现对语音生成中细粒度声学问题的诊断与解释,实验表明其在人感知对齐上优于通用模型。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01907 2026-04-27 cs.CV cs.AI

Lifting Unlabeled Internet-level Data for 3D Scene Understanding

提升互联网级未标记数据用于3D场景理解

Yixin Chen, Yaowei Zhang, Huangyue Yu, Junchao He, Yan Wang, Jiangyong Huang, Hongyu Shen, Junfeng Ni, Shaofei Wang, Baoxiong Jia, Song-Chun Zhu, Siyuan Huang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Tsinghua University(清华大学)

AI总结 本文通过设计数据引擎利用互联网未标记视频生成训练数据,提升3D场景理解模型性能,验证了在不同感知粒度任务中的有效性。

Comments CVPR 2026. Project page: https://sv-pp.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07038 2026-04-27 cs.CV cs.CL

UNIKIE-BENCH: Benchmarking Large Multimodal Models for Key Information Extraction in Visual Documents

UNIKIE-BENCH:用于视觉文档中关键信息提取的大型多模态模型基准测试

Yifan Ji, Zhipeng Xu, Zhenghao Liu, Zulong Chen, Qian Zhang, Zhibo Yang, Junyang Lin, Yu Gu, Ge Yu, Maosong Sun

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系) Alibaba Group, Hangzhou, China(阿里巴巴集团)

AI总结 本文提出UNIKIE-BENCH基准,用于评估大型多模态模型在视觉文档关键信息提取中的性能,揭示了不同场景下模型的性能差异及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22630 2026-04-27 cs.CL cs.AI cs.LG

StateX: Enhancing RNN Recall via Post-training State Expansion

StateX:通过后训练状态扩展增强RNN回忆能力

Xingyu Shen, Yingfa Chen, Zhen Leng Thai, Xu Han, Zhiyuan Liu, Maosong Sun

机构 * Department of Science and Technology, Tsinghua University(清华大学科学技术部)

AI总结 StateX通过后训练方法扩展RNN状态,提升长上下文回忆与上下文学习性能,无需显著增加参数量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20662 2026-04-27 cs.AI

AutoReproduce: Automatic AI Experiment Reproduction with Paper Lineage

AutoReproduce:基于论文溯源的自动AI实验复现

Xuanle Zhao, Zilin Sang, Yuxuan Li, Qi Shi, Weilun Zhao, Shuo Wang, Duzhen Zhang, Xu Han, Zhiyuan Liu, Maosong Sun

机构 * Tsinghua University(清华大学) Xidian University(西安电子科技大学) OpenBMB(开放大脑实验室) University of the Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出AutoReproduce,通过论文溯源系统自动复现实验代码,采用多智能体框架和采样单元测试策略,验证了其在复现精度和执行性能上的优势。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.19277 2026-04-27 stat.ML cs.LG

On Pareto Optimality for Parametric Choice Bandits

关于参数选择老虎机的帕累托最优性

Jierui Zuo, Hanzhang Qin

机构 * Department of Management Science and Engineering, Tsinghua University, Beijing, China(清华大学管理科学与工程系,北京,中国) Department of Industrial Systems Engineering and Management, National University of Singapore, Singapore(新加坡国立大学工业系统工程与管理系,新加坡)

AI总结 本文研究在随机选择下在线商品组合优化问题,提出结合两个正则化最大似然估计器的强制探索乐观面对不确定性方案,分析了自归一化集中不等式、似然椭球置信集定理和近似乐观动作的遗憾界,推导了多名义logit模型的得分和曲率代理,得出帕累托最优区间和平衡点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.16327 2026-04-27 cs.AI cs.LG

On the Power of Foundation Models

基础模型的威力

Yang Yuan

机构 * IIIS, Tsinghua University(清华大学信息学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Qi Zhi Institute(上海启智研究院)

AI总结 本文通过范畴论探讨基础模型在提示学习和微调中的能力限制及泛化理论,提出新的泛化定理。

Comments ICML'23. This version polished paper with the help of LLM, fixed a few notational issues

详情

展开后加载摘要…

URL PDF HTML 收藏