arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanjing University(南京大学)

2026-04-21 至 2026-04-21 共收录 12
2604.18418 2026-04-21 cs.CV

MedProbeBench: Systematic Benchmarking at Deep Evidence Integration for Expert-level Medical Guideline

MedProbeBench: 在深度证据整合中的系统性基准测试用于专家级医疗指南

Jiyao Liu, Jianghan Shen, Sida Song, Tianbin Li, Xiaojia Liu, Rongbin Li, Ziyan Huang, Jiashi Lin, Junzhi Ning, Changkai Ji, Siqi Luo, Wenjie Li, Chenglong Ma, Ming Hu, Jing Xiong, Jin Ye, Bin Fu, Ningsheng Xu, Yirong Chen, Lei Jin, Hong Chen, Junjun He

机构 * Fudan University(复旦大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Hong Kong(香港大学)

AI总结 本文提出MedProbeBench,首个利用高质量临床指南作为专家级参考的基准,通过1200+任务自适应评估标准和5130+原子性声明验证,评估17种LLM和深度研究代理在证据整合和指南生成中的能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18224 2026-04-21 cs.SE cs.AI

WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models

WebCompass:迈向多模态网络编码评估的代码语言模型

Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu Zhou, Haoyang Huang, Minghao Liu, Letian Zhu, Hongyi Ye, Jinhua Hao, Ken Deng, Zizheng Zhan, Han Li, Dailin Li, Yifan Yao, Ming Sun, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

AI总结 WebCompass提出一个多模态基准测试,用于评估代码语言模型在网络工程中的能力,涵盖生成、编辑和修复三种任务类型,通过多阶段人机协作流程,发现闭源模型在编辑和修复方面表现更优,但美学仍是开放源模型的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17863 2026-04-21 cs.RO cs.AI

Periodic Steady-State Control of a Handkerchief-Spinning Task Using a Parallel Anti-Parallelogram Tendon-driven Wrist

使用平行反平行四边形腱驱动手腕实现手帕纺任务的周期稳态控制

Lei Liu, Haonan Zhang, Huahang Xu, Zefan Zhang, Lulu Chang, Lei Lv, Andrew Ross McIntosh, Kai Sun, Zhenshan Bing, Jiahong Dong, Fuchun Sun

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程系) School of Artificial Intelligence, Beihang University(北航人工智能学院) Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能量技术研究院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Automation, Nanjing University of Science and Technology(南京理工大学自动化学院) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能自主系统研究院) Department of Mechanical Engineering, Tsinghua University(清华大学机械工程系) School of Computation, Information and Technology, Technical University of Munich(慕尼黑工业大学计算、信息与技术学院) State Key Laboratory for Novel Software Technology and the School of Science and Technology, Nanjing University (Suzhou Campus)(南京大学软件新技术国家重点实验室(苏州校区)) Hepato-pancreato-biliary Center, Beijing Tsinghua Changgung Hospital(北京清华长庚医院肝胆外科中心) Key Laboratory of Digital Intelligence Hepatology (Ministry of Education), Beijing, China(教育部数字智能肝病重点实验室(北京)) School of Clinical Medicine, Tsinghua Medicine, Tsinghua University(清华大学医学部临床医学学院)

AI总结 本文提出了一种平行反平行四边形腱驱动手腕,结合分层控制方案和粒子弹簧模型,实现了高动态手帕纺任务的高展开比和高精度跟踪。

Comments ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00861 2026-04-21 cs.CL cs.AI cs.IR

Erase to Improve: Erasable Reinforcement Learning for Search-Augmented LLMs

擦除以提升:用于搜索增强大语言模型的可擦除强化学习

Ziliang Wang, Kang An, Xuhui Zheng, Faqiang Qian, Weikun Zhang, Cijun Ouyang, Jialu Cai, Yuhang Wang, Yichao Wu

机构 * SenseAuto Shenzhen University(深圳大学) Nanjing University(南京大学)

AI总结 本文提出Erasable Reinforcement Learning框架,通过识别并擦除推理中的错误步骤,提升搜索增强大语言模型在多步推理中的鲁棒性,实验表明其在多个基准测试中取得显著提升。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19897 2026-04-21 cs.AI cs.CL cs.CV cs.HC

ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows

ScienceBoard: 评估多模态自主代理在真实科学工作流中的表现

Qiushi Sun, Zhoumianze Liu, Chang Ma, Zichen Ding, Fangzhi Xu, Zhangyue Yin, Haiteng Zhao, Zhenyu Wu, Kanzhi Cheng, Zhaoyang Liu, Jianing Wang, Qintong Li, Xiangru Tang, Tianbao Xie, Xiachong Feng, Xiang Li, Ben Kao, Wenhai Wang, Biqing Qi, Lingpeng Kong, Zhiyong Wu

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Peking University(北京大学) Nanjing University(南京大学) East China Normal University(华东师范大学) Yale University(耶鲁大学)

AI总结 ScienceBoard通过真实多领域环境和169个高质量任务评估多模态自主代理在科学工作流中的能力,发现现有代理在复杂任务中仅达到15%的成功率,揭示了改进设计原则的必要性。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17312 2026-04-21 cs.LG cs.AI

A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions

面向大数据稀缺性的大型语言模型强化学习综述:挑战与解决方案

Zhiyin Yu, Yuchen Mou, Juncheng Yan, Junyu Luo, Chunchun Chen, Xing Wei, Yunhui Liu, Hongru Sun, Yuxing Zhang, Jun Xu, Yatao Bian, Ming Zhang, Wei Ye, Tieke He, Jie Yang, Guanjie Zheng, Zhonghai Wu, Bo Zhang, Lei Bai, Xiao Luo

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) Nankai University(南开大学) Tongji University(同济大学) Nanjing University(南京大学) University of Wollongong(沃林根大学) Shanghai Jiao Tong University(上海交通大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文综述了在数据稀缺条件下大型语言模型强化学习的挑战与解决方案,提出三级框架,梳理现有方法并分析其优劣,为高效强化学习提供理论基础。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17274 2026-04-21 cs.CV cs.AI

Instinct vs. Reflection: Unifying Token and Verbalized Confidence in Multimodal Large Models

本能与反思:统一令牌和 verbalized 自信在多模态大模型中

Yunkai Dang, Yifan Jiang, Yizhu Jiang, Anqi Chen, Wenbin Li, Yang Gao

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 本文研究多模态大模型响应自信估计的本能-反思不一致问题,提出融合框架和均值对齐方法,提升校准和失败预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17243 2026-04-21 cs.CV

RemoteShield: Enable Robust Multimodal Large Language Models for Earth Observation

RemoteShield:为地球观测启用鲁棒的多模态大语言模型

Rui Min, Liang Yao, Shiyu Miao, Shengxiang Xu, Yuxuan Liu, Chuanyi Zhang, Shimin Di, Fan Liu

机构 * Hohai University(河海大学) Nanjing University(南京大学) Southeast University(东南大学)

AI总结 本文提出RemoteShield,一种针对地球观测的鲁棒多模态大语言模型,通过偏好学习提升在现实输入变化下的稳定性与一致性,实验显示其在多模态扰动下表现优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14732 2026-04-21 cs.RO cs.LG

World-Value-Action Model: Implicit Planning for Vision-Language-Action Systems

世界价值-动作模型:面向视觉-语言-动作系统的隐式规划

Runze Li, Hongyin Zhang, Junxi Jin, Qixin Zeng, Zifeng Zhuang, Yiqi Tang, Shangke Lyu, Donglin Wang

机构 * Westlake University(西湖大学) Nanjing University Suzhou Campus(南京大学苏州校区)

AI总结 本文提出World-Value-Action模型,通过隐式规划提升视觉-语言-动作系统在长时域决策中的性能,通过学习潜在表示和价值函数实现高效规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19880 2026-04-21 cs.LG cs.AI

What If Consensus Lies? Selective-Complementary Reinforcement Learning at Test Time

如果共识是谎言呢?测试时的选择性互补强化学习

Dong Yan, Jian Liang, Yanbo Wang, Shuo Lu, Ran He, Tieniu Tan

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

AI总结 本文提出SCRL框架,通过选择性正伪标签和熵门控负伪标签减少标签噪声影响,提升测试时强化学习的鲁棒性和泛化能力。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17078 2026-04-21 cs.AI

Understanding and Enforcing Weight Disentanglement in Task Arithmetic

理解并强制任务算术中的权重解耦

Shangge Liu, Yuehan Yin, Lei Wang, Qi Fan, Yinghuan Shi, Wenbin Li, Yang Gao, Dacheng Tao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) University of Wollongong, Australia(沃林根大学,澳大利亚) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

AI总结 本文提出Task-Feature Specialization(TFS)作为权重解耦的根本原理,通过促进权重向量的正交性,提出OrthoReg正则化方法以提升任务算术方法的性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16888 2026-04-21 cs.LG math.OC

Towards Fully Parameter-Free Stochastic Optimization: Grid Search with Self-Bounding Analysis

迈向完全无参数的随机优化:带有自界分析的网格搜索

Yuheng Zhao, Yu-Hu Yan, Amit Attia, Tomer Koren, Lijun Zhang, Peng Zhao

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家级重点实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) Tel Aviv University(特拉维夫大学)

AI总结 本文提出Grasp框架,通过自界分析实现完全无参数的随机优化,在非凸和凸情况下均取得优异收敛率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏