arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-04-23 至 2026-04-23 共收录 22
2604.20350 2026-04-23 cs.CV

X-PCR: A Benchmark for Cross-modality Progressive Clinical Reasoning in Ophthalmic Diagnosis

X-PCR:眼科诊断中跨模态渐进临床推理的基准测试

Gui Wang, Zehao Zhong, YongSong Zhou, Yudong Li, Ende Wu, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen

机构 * School of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Tsinghua University(清华大学) University of Nottingham(诺丁汉大学) School of AI, Shenzhen University(深圳大学人工智能学院) Wenzhou Medical University(温州医科大学) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)

AI总结 本文提出X-PCR基准测试,通过完整眼科诊断流程评估多模态大语言模型的渐进推理和跨模态整合能力,包含26,415张图像和177,868个专家验证的VQA对,评估21个模型揭示其在渐进推理和跨模态整合方面的不足。

Comments Accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20347 2026-04-23 cs.RO cs.AI

A Vision-Language-Action Model for Adaptive Ultrasound-Guided Needle Insertion and Needle Tracking

面向自适应超声引导针插入与针跟踪的视觉-语言-动作模型

Yuelin Zhang, Qingpeng Ding, Longxiang Tang, Chengyu Fang, Shing Shin Cheng

机构 * Department of Mechanical and Automation Engineering, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科学与技术大学计算机科学与工程系) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Department of Mechanical and Automation Engineering, T Stone Robotics Institute, Shun Hing Institute of Advanced Engineering, Multi-Scale Medical Robotics Center, and Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学机械与自动化工程系、T Stone机器人研究所、Shun Hing先进工程研究所、多尺度医疗机器人中心以及医学智能与XR研究所)

AI总结 本文提出视觉-语言-动作模型,用于实现自适应超声引导针插入与跟踪,通过跨深度融合和跟踪条件化注册提升跟踪精度与插入成功率。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20263 2026-04-23 q-bio.QM cs.AI cs.LG

AROMA: Augmented Reasoning Over a Multimodal Architecture for Virtual Cell Genetic Perturbation Modeling

AROMA:增强的多模态架构下虚拟细胞基因扰动建模推理

Zhenyu Wang, Geyan Ye, Wei Liu, Man Tat Alexander Ng

机构 * AI for Life Sciences Lab, Tencent(腾讯AI生命科学实验室) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学)

AI总结 AROMA通过整合文本证据、图拓扑信息和蛋白质序列特征,提升虚拟细胞基因扰动预测的准确性和可解释性,构建了包含498k样本的 PerturbReason 数据集,实验表明其在多个细胞系中表现优异。

Comments Accepted to ACL 2026 as a Findings paper. Zhenyu Wang and Geyan Ye are equal contributors; Geyan Ye is the corresponding author and project lead

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20231 2026-04-23 cs.RO

Toward Cooperative Driving in Mixed Traffic: An Adaptive Potential Game-Based Approach with Field Test Verification

迈向混合交通的协作驾驶:一种基于自适应势游戏的适应性方法与实地测试验证

Shiyu Fang, Xiaocong Zhao, Xuekai Liu, Peng Hang, Jianqiang Wang, Yunpeng Wang, Jian Sun

机构 * State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(智能绿色车辆与移动国家重点实验室,清华大学) State Key Lab of Intelligent Transportation System, School of Transportation Science and Engineering, Beihang University(智能交通运输系统实验室,北京航空航天大学交通科学与工程学院)

AI总结 本文提出自适应势游戏框架,通过建立系统效用函数、引入Shapley值和动态优化人类驾驶车辆偏好,提升混合交通中的协作安全与效率,实验证实其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20147 2026-04-23 math.OC cs.LG

Robust Out-of-Distribution Stochastic Optimization

鲁棒的分布外随机优化

Xianyu Li, Huan Xu, Xiaolin Huang, Chao Shang

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Antai College of Economics & Management, Shanghai Jiao Tong University(上海交通大学安泰经济管理学院) Institute of Image Processing and Pattern Recognition, Shanghai Jiao Tong University(上海交通大学图像处理与模式识别研究所)

AI总结 本文提出一种新的数据驱动框架,用于在未知分布下进行鲁棒决策。通过学习不确定性集和min-max随机规划,提供分布外泛化保证,并在多物品新闻供应商和投资组合优化中验证了其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19773 2026-04-23 cs.CL cs.AI

PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models

PR-CAD:基于大语言模型的统一可控且忠实的文本到CAD生成的渐进式细化

Jiyuan An, Jiachen Zhao, Fan Chen, Liner Yang, Zhenghao Liu, Hongyan Wang, Weihua An, Meishan Zhang, Erhong Yang

机构 * School of Information Science, Beijing Language and Culture University, China(北京语言大学信息学院) School of Computer Science and Technology, Beijing Jiaotong University, China(北京交通大学计算机科学与技术学院) School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen), China(哈尔滨工业大学(深圳)计算机科学与技术学院)

AI总结 PR-CAD通过统一生成与编辑任务,提升文本到CAD生成的可控性和忠实性,采用高保真交互数据集和强化学习框架,实现设计创建与细化的一体化解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19591 2026-04-23 cs.CV

Structure-Semantic Decoupled Modulation of Global Geospatial Embeddings for High-Resolution Remote Sensing Mapping

全局地理嵌入的结构-语义解耦调制用于高分辨率遥感制图

Jienan Lyu, Miao Yang, Jinchen Cai, Yiwen Hu, Guanyi Lu, Junhao Qiu, Runmin Dong

机构 * Sun Yat-Sen University(中山大学) Tsinghua University(清华大学)

AI总结 本文提出SSDM框架,通过解耦全局地理表示为两个互补的跨模态注入路径,提升高分辨率遥感制图的结构和语义一致性,实现更准确的土地覆盖分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15861 2026-04-23 cs.CL cs.AI

CAST: Achieving Stable LLM-based Text Analysis for Data Analytics

CAST:实现稳定的大语言模型文本分析用于数据分析

Jinxiang Xie, Zihao Li, Wei He, Rui Ding, Shi Han, Dongmei Zhang

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Peking University(北京大学) Microsoft Research(微软研究院)

AI总结 CAST通过算法提示和先思考后发言提升大语言模型在表格数据分析中的输出稳定性,实验表明其在多个基准上表现最佳,稳定性提升达16.2%。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09756 2026-04-23 cs.CL

MOA: Multi-Objective Alignment for Role-Playing Agents

MOA:多目标对齐用于角色扮演代理

Chonghua Liao, Ke Wang, Yuchuan Wu, Ruoran Li, Fei Huang, Yongbin Li

机构 * Tsinghua University(清华大学) Tongyi Lab(通义实验室)

AI总结 本文提出MOA框架,通过多维细粒度评估提升角色扮演代理的多目标协调能力,实验表明其在PersonaGym和RoleMRC上优于监督学习和标准RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01233 2026-04-23 cs.CV cs.GR cs.HC

Towards Reliable Human Evaluations in Gesture Generation: Insights from a Community-Driven State-of-the-Art Benchmark

迈向可靠的 gesture 生成人类评估:来自社区驱动的最新基准的见解

Rajmund Nagy, Hendric Voss, Thanh Hoang-Minh, Mihail Tsakov, Teodor Nikolov, Zeyi Zhang, Tenglong Ao, Sicheng Yang, Shaoli Huang, Yongkang Cheng, M. Hamza Mughal, Rishabh Dabral, Kiran Chhatre, Christian Theobalt, Libin Liu, Stefan Kopp, Rachel McDonnell, Michael Neff, Taras Kucherenko, Youngwoo Yoon, Gustav Eje Henter

机构 * KTH Royal Institute of Technology(皇家理工学院) Bielefeld University(比勒菲尔德大学) University of Science – VNUHCM(越南胡志明市国家大学) Independent Researcher(独立研究者) Motorica AB(Motorica AB公司) Peking University(北京大学) Tsinghua University(清华大学) Astribot(Astribot公司) Max-Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) Trinity College Dublin(都柏林大学) University of California, Davis(加州大学戴维斯分校) SEED – Electronic Arts(SEED–电子艺界) Electronics and Telecommunications Research Institute (ETRI)(电子电信研究院)

AI总结 本文通过社区驱动的基准测试,揭示了 gesture 生成中人类评估的标准化问题,指出 motion 实际和语音-手势对齐的评估结果存在争议,强调需采用解耦的评估方法以提升基准测试的准确性。

Comments Accepted to CVPR 2026, Findings Track. 23 pages, 10 figures. The last two authors made equal contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25223 2026-04-23 cs.AI

FELA: A Multi-Agent Evolutionary System for Feature Engineering of Industrial Event Log Data

FELA:一种用于工业事件日志数据特征工程的多智能体进化系统

Kun Ouyang, Haoyu Wang, Dong Fang

机构 * Department of Electronic Engineering, Tsinghua University LIGHTSPEED STUDIOS, China

AI总结 本文提出FELA,一种基于大语言模型的多智能体系统,通过协作生成、验证和实现新颖特征,提升工业事件日志数据的特征工程效率与性能。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22955 2026-04-23 cs.LG

SARNet: A Spike-Aware consecutive validation Framework for Accurate Remaining Useful Life Prediction

SARNet:一种针对准确剩余寿命预测的时序验证框架

Junhao Fan, Wenrui Liang, Wei-Qiang Zhang

机构 * Georgetown University(乔治·华盛顿大学) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)

AI总结 SARNet通过引入时序卷积网络和时序验证机制,提升剩余寿命预测的准确性和可解释性,降低误差并保持轻量和鲁棒性。

Comments 5 pages, 2 figures, 3 tables. Equal contribution by Junhao Fan and Wenrui Liang. Corresponding author: Wei-Qiang Zhang. Accepted to ICASSP 2026

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03323 2026-04-23 cs.CL

Enhancing Agentic Textual Graph Retrieval with Synthetic Stepwise Supervision

通过合成的分步监督增强代理文本图检索

Ge Chang, Jinbo Su, Jiacheng Liu, Pengfei Yang, Yuhao Shang, Huiwen Zheng, Hongli Ma, Yan Liang, Yuanchun Li, Yunxin Liu

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Peking University(北京大学) School of Information, Renmin University of China(中国人民大学信息学院) Harbin Institute of Technology(哈尔滨工业大学) North China Electric Power University(华北电力大学) GDS Holdings Limited(GDS控股有限公司)

AI总结 本文提出一种基于LLM的文本图检索框架,通过合成分步监督优化检索过程,提升复杂图基问答任务的准确性和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18168 2026-04-23 cs.CL

Improving End-to-End Training of Retrieval-Augmented Generation Models via Joint Stochastic Approximation

通过联合随机近似改进检索增强生成模型的端到端训练

Hongyu Cao, Yuxuan Wu, Yucheng Cai, Xianyu Zhao, Zhijian Ou

机构 * Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能实验室) TasiTech Co., Ltd., China(TasiTech有限公司)

AI总结 本文提出JSA-RAG方法,通过联合随机近似提升检索增强生成模型的端到端训练效果,在五个数据集上表现优于传统RAG和VRAG。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23733 2026-04-23 cs.CL cs.CV

AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization

AdaMMS: 为异构多模态大语言模型设计的模型融合方法

Yiyang Du, Xiaochen Wang, Chi Chen, Jiabo Ye, Yiru Wang, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Zhifang Sui, Maosong Sun, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) State Key Laboratory of Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学) School of Software Microelectronics, Peking University(软件微电子学院,北京大学) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国) ModelTC Open Source Organization, Beijing, China(ModelTC开源组织,北京,中国)

AI总结 本文提出AdaMMS,一种针对异构多模态大语言模型的模型融合方法,通过映射、融合和搜索三个步骤解决异构模型融合难题,无需标注数据即可在视觉语言基准测试中超越现有方法。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18036 2026-04-23 cs.CL

Harnessing Multiple Large Language Models: A Survey on LLM Ensemble

利用多个大语言模型:关于LLM集成的综述

Zhijun Chen, Xiaodong Lu, Jingzheng Li, Pengpeng Chen, Zhuoran Li, Kai Sun, Yuankai Luo, Qianren Mao, Ming Li, Likang Xiao, Dingqi Yang, Xiao Huang, Yikun Ban, Hailong Sun, Philip S. Yu

机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University, Beijing, China(复杂与关键软件环境国家重点实验室,北京航空航天大学,北京,中国) Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Aviation System Engineering Institute of China, Beijing, China(中国航空系统工程研究院,北京,中国) Xi’an Jiaotong University, Xi’an, China(西安交通大学,西安,中国) Nanjing University, Nanjing, China(南京大学,南京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) University of Macau, Macau SAR, China(澳门大学,澳门特别行政区,中国) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学,香港,中国) University of Illinois at Chicago, Chicago, USA(伊利诺伊大学香槟分校,芝加哥,美国)

AI总结 本文系统回顾了LLM集成的最新发展,介绍了分类方法,讨论了相关研究问题,并提出了未来研究方向。

Comments 12 pages, 2 figures, codebase: https://github.com/junchenzhi/Awesome-LLM-Ensemble

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00585 2026-04-23 cs.CY cs.AI

Fairness Testing of Large Language Models in Role-Playing

大型语言模型在角色扮演中的公平性测试

Xinyue Li, Zhenpeng Chen, Jie M. Zhang, Ying Xiao, Tianlin Li, Weisong Sun, Yang Liu, Yiling Lou, Xuanzhe Liu

机构 * Peking University(北京大学) Tsinghua University(清华大学) King's College London(伦敦国王学院) Nanyang Technological University(南洋理工大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文通过生成33000个角色特定问题,评估10种先进LLM在角色扮演场景中的公平性,发现107580次偏见响应,揭示角色扮演中偏见的普遍性。

Comments Accepted by ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20721 2026-04-23 cs.RO

ALAS: Adaptive Long-Horizon Action Synthesis via Async-pathway Stream Disentanglement

ALAS: 通过异步路径流解构实现自适应长时域动作合成

Yutong Shen, Hangxu Liu, Lei Zhang, Penghui Liu, Yinqi Liu, Liuxiang Yang, Tongtong Feng

机构 * Beijing University of Technology(北京理工大学) Fudan University(复旦大学) University of Hamburg(汉堡大学) Hubei University of Chinese Medicine(湖北中医药大学) Tsinghua University(清华大学)

AI总结 本文提出ALAS框架,通过生物启发的双流解构方法,解决长时域任务中环境与技能耦合问题,提升跨域任务执行效率与成功率。

Comments 10 pages, 7 figures. arXiv admin note: substantial text overlap with arXiv:2508.07842

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11098 2026-04-23 cs.CV cs.LG eess.SP

Efficient Transceiver Design for Aerial Image Transmission and Large-scale Scene Reconstruction

高效空中图像传输与大规模场景重建的收发器设计

Zeyi Ren, Jialin Dong, Wei Zuo, Yikun Wang, Bingyang Cheng, Sheng Zhou, Zhisheng Niu

机构 * Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系) Department of Electrical and Computer Engineering, The University of Hong Kong, Hong Kong(香港大学电子与计算机工程系)

AI总结 本文提出一种基于深度学习的端到端收发器设计,整合3D高斯点划法提升场景恢复质量,通过稀疏导频方案降低传输开销,实现实时高效的大规模场景重建。

Comments 6 pages, 6 figures, Accepted in ISIT 2026 IEEE International Symposium on Information Theory-w

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16487 2026-04-23 math.NA cs.CV cs.NA

Generative Prior-Guided Neural Interface Reconstruction for 3D Electrical Impedance Tomography

生成先验引导的神经接口重建用于3D电阻抗断层成像

Haibo Liu, Junqing Chen, Guang Lin

机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) Department of Mathematics, School of Mechanical Engineering, Purdue University(帕克大学机械工程学院数学系)

AI总结 本文提出一种结合预训练3D生成先验与严格边界积分方程求解器的框架,解决3D电阻抗断层成像中复杂界面重建问题,通过数据驱动先验实现高精度几何重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20659 2026-04-23 cs.LG cs.AI

GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning

GRPO-VPS:通过可验证的过程监督增强组相对策略优化以实现有效的推理

Jingyi Wang, Lei Zhu, Tengjin Weng, Song-Li Wu, Haochen Tan, Jierun Chen, Chaofan Tao, Haoli Bai, Lu Hou, Lifeng Shang, Xiao-Ping Zhang

机构 * Tsinghua University(清华大学) Shenzhen University(深圳大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本文提出GRPO-VPS,通过在推理轨迹中探测模型对正确答案的信心,改进GRPO的轨迹级反馈,实现更精准高效的策略更新,实验显示在数学和通用领域任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18236 2026-04-23 cs.CV

Human-like Content Analysis for Generative AI with Language-Grounded Sparse Encoders

具有语言基础的稀疏编码的生成AI内容分析

Yiming Tang, Arash Lagzian, Srinivas Anumasa, Qiran Zou, Yingtao Zhu, Ye Zhang, Trang Nguyen, Yih-Chung Tham, Ehsan Adeli, Ching-Yu Cheng, Yilun Du, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Stanford University(斯坦福大学) Harvard University(哈佛大学)

AI总结 本文提出LanSE工具,通过自然语言描述将图像分解为可解释的视觉模式,实现了对生成AI内容的细粒度分析,提升了物理合理性评估并扩展至医学影像领域。

详情

展开后加载摘要…

URL PDF HTML 收藏