arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4547
2604.19092 2026-05-15 cs.RO cs.AI

RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation

RoboWM-Bench:用于评估机器人操作中世界模型的基准

Feng Jiang, Yang Chen, Kyle Xu, Yuchen Liu, Haifeng Wang, Zhenhao Shen, Jasper Lu, Shengze Huang, Yuanfei Wang, Chen Xie, Ruihai Wu

机构 * Peking University(北京大学) Tsinghua University(清华大学) Lightwheel

AI总结 本文提出RoboWM-Bench,用于评估视频世界模型在机器人操作中的执行能力,发现视觉合理性与实际执行性不一致,并分析了影响执行性能的因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21250 2026-05-15 cs.AI

Graph of States: Solving Abductive Tasks with Large Language Models

状态图:利用大语言模型解决假设推理任务

Yu Luo, Rongchen Gao, Lu Teng, Xidao Wen, Jiamin Jiang, Qingliang Zhang, Yongqian Sun, Shenglin Zhang, Jiasong Feng, Tong Liu, Wenjie Zhang, Dan Pei

机构 * Nankai University(南开大学) Wenzhou Medical University(温州医科大学) Alibaba Cloud(阿里云) Tsinghua University(清华大学)

AI总结 本文提出状态图框架,通过结构化信念状态和因果图实现逻辑依赖编码,解决假设推理中的证据伪造等问题,实验证明其在复杂任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16659 2026-05-15 cs.AI econ.GN q-fin.EC

LLMs learn scientific taste from institutional traces across the social sciences

大语言模型通过社会科学研究中的机构痕迹学习科学品味

Ziqin Gong, Ning Li, Huaikang Zhou

机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院)

AI总结 本文探讨机构痕迹作为训练信号,帮助AI在低可验证性领域进行评估判断,通过八个社会科学学科的四层研究提案基准测试,验证了微调LLM在不同领域的准确率,最高达85.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06718 2026-05-15 cs.CR cs.AI

GhostCite: A Large-Scale Analysis of Citation Validity in the Age of Large Language Models

GhostCite: 对大规模语言模型时代引用有效性的大规模分析

Zuyao Xu, Yuqi Qiu, Lu Sun, Fasheng Miao, Fubin Wu, Xiang Li, Xinyi Wang, Haozhe Lu, Zhengze Zhang, Yuxin Hu, Jialu Li, Luo Jin, Feng Zhang, Rui Luo, Xinran Liu, Yingxian Li, Jiaji Liu

机构 * Nankai University(南开大学) Tsinghua University(清华大学)

AI总结 研究通过三个实验分析LLM时代引用有效性,发现13个模型在引用生成任务中存在14.23%-94.93%的伪造引用率,2025年无效引用率上升80.9%,并揭示87.2%的研究人员使用AI工具,76.7%的审稿人未彻底检查参考文献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04265 2026-05-15 cs.LG cs.AI

Boosting LLM Reasoning via Human-Inspired Reward Shaping

通过人类启发的奖励塑造提升大语言模型推理能力

Wenze Lin, Zhen Yang, Xitai Jiang, Xiaoteng Ma, Gao Huang

机构 * Tsinghua University(清华大学) Southern University of Science and Technology(南方科技大学) Mind Lab

AI总结 本文提出T2T动态奖励框架,通过区分掌握与未掌握问题的不同学习策略,提升LLM推理性能,实验显示其在数学基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03417 2026-05-15 cs.CL

FactNet: A Billion-Scale Knowledge Graph for Multilingual Factual Grounding

FactNet:一个十亿级的知识图谱用于多语言事实 grounding

Yingli Shen, Wen Lai, Jie Zhou, Xueren Zhang, Yudong Wang, Kangyang Luo, Shuo Wang, Ge Gao, Alexander Fraser, Maosong Sun

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) ModelBest Inc.(ModelBest公司) Minzu University of China(民族大学)

AI总结 FactNet通过结合17亿条维基数据语句和301亿条证据指针,构建了一个十亿级多语言知识图谱,提供事实 grounding 的评估框架,并验证了跨语言结构的知识迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18903 2026-05-15 cs.LG cs.AI cs.CL

How Learning Rate Decay Wastes Your Best Data in Curriculum-Based LLM Pretraining

学习率衰减如何浪费你在基于课程的学习中的最佳数据

Kairong Luo, Zhenbo Sun, Haodong Wen, Xinyu Shi, Jiarui Cui, Chenyi Dang, Kaifeng Lyu, Wenguang Chen

机构 * Tsinghua University(清华大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 本文指出学习率衰减与课程式预训练数据排序的不兼容性限制了预训练效果,通过调整衰减策略和模型平均可提升1.64%的基准表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14232 2026-05-15 cs.CV

GenExam: A Multidisciplinary Text-to-Image Exam

GenExam:多学科文本到图像考试

Zhaokai Wang, Penghao Yin, Xiangyu Zhao, Changyao Tian, Yu Qiao, Wenhai Wang, Jifeng Dai, Gen Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

AI总结 GenExam是首个多学科文本到图像考试基准,包含10个学科1000个样本,通过四级分类评估模型的综合能力,揭示开源模型与闭源模型间的显著差距。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06202 2026-05-15 cs.CV cs.AI

LoRA in LoRA: Towards Parameter-Efficient Architecture Expansion for Continual Visual Instruction Tuning

LoRA in LoRA: 朝着参数高效架构扩展的方向:持续视觉指令微调

Chang Che, Ziqi Wang, Pengwan Yang, Qi Wang, Hui Ma, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) University of Amsterdam(阿姆斯特丹大学) Tsinghua University(清华大学)

AI总结 本文提出LiLoRA,一种高效的持续视觉指令微调架构扩展方法,通过共享LoRA矩阵A、低秩分解矩阵B以及余弦正则化损失,提升参数效率和任务学习性能。

Comments AAAI 2026 Oral Presentation. 9 pages

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(24):19978--19986, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13988 2026-05-15 cs.LG quant-ph

Neural Fields for NV-Center Inverse Sensing

神经场用于NV中心反向传感

Zhixuan Zhao, Tao Zhong, Yixun Hu, Nathalie P. de Leon, Christine Allen-Blanchette

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学)

AI总结 本文研究了基于钻石中氮-空位中心的噪声传感反向问题,提出NeTMY神经场方法,通过改进的正则化和优化策略提升反向传感性能。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07805 2026-05-15 cs.LG cs.AI cs.CL

Group Representational Position Encoding

群表示位置编码

Yifan Zhang, Zixiang Chen, Yifeng Liu, Zhen Qin, Huizhuo Yuan, Kangping Xu, Yang Yuan, Quanquan Gu, Andrew Chi-Chih Yao

机构 * Princeton University(普林斯顿大学) University of California, Los Angeles(加州大学洛杉矶分校) IIIS, Tsinghua University(清华大学人工智能研究院)

AI总结 GRAPE提出了一种基于群作用的位置编码框架,结合乘法旋转和加法logit偏置机制,扩展了RoPE和ALiBi的应用范围,适用于长上下文模型的位置几何设计。

Comments Published in ICLR 2026. Project Page: https://github.com/model-architectures/GRAPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13821 2026-05-14 cs.AI cs.LG

Harnessing Agentic Evolution

利用代理进化

Jiayi Zhang, Yongfeng Gu, Jianhao Ruan, Maojia Song, Yiran Peng, Zhiguang Han, Jinyu Xiang, Zhitao Wang, Caiyin Yang, Yixi Ouyang, Bang Liu, Chenglin Wu, Yuyu Luo

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepWisdom Singapore University of Technology and Design(新加坡科技设计大学) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Université de Montréal & Mila(蒙特利尔大学及Mila)

AI总结 本文提出AEvo框架,通过统一接口整合程序和代理进化,提升长周期搜索性能,在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13448 2026-05-14 stat.ML cs.LG math.PR

On the Limits of Latent Reuse in Diffusion Models

扩散模型中潜在重用的极限

Yifeng Yu, Lu Yu

机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

AI总结 研究扩散模型在分布偏移下潜在重用的可靠性,分析源-目标子空间主角偏差与环境噪声对目标域得分误差的影响,提出混合源-目标训练方法以确定共享潜在维度的依赖关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13375 2026-05-14 cs.CV cs.AI

GRIP-VLM: Group-Relative Importance Pruning for Efficient Vision-Language Models

GRIP-VLM:基于组相对重要性的高效视觉-语言模型压缩

Mingzhe Huang, Weijun Wang, Xin Ding, Liang Mi, Hao Wen, Yuanchun Li, Lichen Pang, Shansong Yang, Yunxin Liu, Ting Cao

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Juhaokan Technology Co.,Ltd(极皓科技有限公司) Nanjing University(南京大学) University of Science and Technology of China(中国科学技术大学)

AI总结 GRIP-VLM通过强化学习框架解决视觉语言模型中大规模视觉token处理的计算瓶颈,通过组相对重要性策略优化实现高效压缩,达到15%的推理加速。

Comments 10 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07770 2026-05-14 cs.DC cs.CL

ArcLight: A Lightweight LLM Inference Architecture for Many-Core CPUs

ArcLight:一种为多核CPU设计的轻量级大语言模型推理架构

Yuzhuang Xu, Xu Han, Yuxuan Li, Wanxiang Che

机构 * Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学)

AI总结 本文提出ArcLight,一种为多核CPU优化的LLM推理架构,通过高效内存管理和线程调度及精细控制的张量并行性,解决多核CPU上的跨节点内存访问瓶颈,实现更高的推理吞吐量。

Comments Accepted by ACL 2026 Demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07458 2026-05-14 cs.CV

SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning

SpatialReward: 通过显式空间推理弥合在线强化学习中图像编辑的感知差距

Yancheng Long, Yankai Yang, Hongyang Wei, Wei Chen, Tianke Zhang, Haonan fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)

AI总结 本文提出SpatialReward,通过显式空间推理提升在线强化学习中图像编辑的感知准确性,其在MMRB2和EditReward-Bench上表现优异,并在MultiEditReward-Bench上超越专用评估器。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15616 2026-05-14 cs.CV

LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models

LENS:基于大语言模型的多级多模态推理评估

Ruilin Yao, Bo Zhang, Jirui Huang, Xinwei Long, Yifang Zhang, Tianyu Zou, Yufei Wu, Shichao Su, Yifan Xu, Wenxi Zeng, Zhaoyu Yang, Guoyou Li, Shilan Zhang, Zichan Li, Yaxiong Chen, Shengwu Xiong, Peng Xu, Jiajun Zhang, Bowen Zhou, David Clifton, Luc Van Gool

机构 * Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Lab(上海人工智能实验室) University of Oxford(牛津大学) INSAIT, Sofia Un. St Kliment Ohridski(索菲亚大学克里门特·欧里迪斯基学院)

AI总结 LENS提出一个包含3.4K图像和60K+问题的多级评估基准,涵盖8个任务和12种日常场景,用于评估大语言模型在多模态推理中的表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13321 2026-05-14 cs.RO

HCSG: Human-Centric Semantic-Geometric Reasoning for Vision-Language Navigation

HCSG:以人类为中心的语义-几何推理用于视觉-语言导航

Haoxuan Xu, Tianfu Li, Wenbo Chen, Yi Liu, Jin Wu, Huashuo Lei, Yunfan Lou, Lujia Wang, Hesheng Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学) University of Science and Technology Beijing(北京科技大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 HCSG提出了一种以人类为中心的框架,通过结合几何预测和语义解释,提升动态环境中视觉-语言导航的安全性和社交智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13316 2026-05-14 cs.CV

Test-time Sparsity for Extreme Fast Action Diffusion

测试时稀疏性用于极端快速动作扩散

Kangye Ji, Yuan Meng, Jianbo Zhou, Ye Li, Chen Tang, Zhi Wang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出测试时稀疏性方法,通过动态预测可剪枝的残差计算来加速动作扩散,解决开放环境中的动态策略问题,实验表明在减少92% FLOPs的同时提升5倍生成速度,保持无损性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13301 2026-05-14 cs.AI cs.CL

Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling

通过简单统一的扩展实现金牌级竞赛推理

Yafu Li, Runzhe Zhan, Haoran Zhang, Shunkai Zhang, Yizhuo Li, Zhilin Wang, Jiacheng Chen, Futing Wang, Xuyang Hu, Yuchen Fan, Bangjie Xu, Yucheng Su, Xinmiao Han, Chenxi Li, Haodi Lei, Yufeng Zhao, Zejin Lin, Qianjia Cheng, Tong Zhu, Xiaoye Qu, Ganqu Cui, Peng Ye, Yun Luo, Zhouchen Lin, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

AI总结 本文提出一种简单统一的方法,将训练好的推理模型扩展为金牌级竞赛解题器,通过反熵课程和两级强化学习提升证明搜索能力,最终在数学和物理竞赛中取得金牌水平表现。

Comments Technical Report. 77 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13293 2026-05-14 cs.CV

Img2CADSeq: Image-to-CAD Generation via Sequence-Based Diffusion

Img2CADSeq:通过序列扩散生成图像到CAD

Shiyu Tan, Zixuan Zhao, Hao Gao, Zhiheng Chen, Xiaolong Yin, Enya Shen

机构 * School of Software Tsinghua University China(软件学院清华大学中国) Tsinghua University(清华大学)

AI总结 本文提出Img2CADSeq,通过序列扩散模型生成高质量CAD模型,采用三级代码本和对比学习解决模态差异问题,实现工业领域应用。

Comments Accepted by SIGGRAPH 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13255 2026-05-14 cs.AI

Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning

尊重自我不确定性在在线自我蒸馏中的高效大语言模型推理

Junlong Ke, Zichen Wen, Weijia Li, Conghui He, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 本文提出EGRSD方法,通过三种信号统一token级更新,提升大语言模型推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13123 2026-05-14 cs.RO

Multi-Depth Uniform Coverage Path Planning for Unmanned Surface Vehicle Surveying

多深度均匀覆盖路径规划用于无人水面舰艇勘测

Maider Larrazabal, Tong Yang, Izaro Goienetxea, Jaime Valls Miro

机构 * AZTI Foundation(AZTI基金会) Tsinghua University(清华大学) University of the Basque Country (UPV/EHU)(巴斯克国家大学(UPV/EHU)) University of Technology Sydney(悉尼技术大学) IKERBASQUE

AI总结 本文提出一种新型自动覆盖路径规划算法,用于无人水面舰艇的水深勘测。通过整合粗略的深度信息预处理目标区域,并自适应引导路径生成和探测范围配置,优化路径间距以实现更一致的海底覆盖。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13083 2026-05-14 cs.RO

TouchAnything: A Dataset and Framework for Bimanual Tactile Estimation from Egocentric Video

TouchAnything: 一个用于从第一人称视频中估计双臂触觉的数据库和框架

Jianyi Zhou, Ziteng Gao, Feiyang Hong, Zirui Liu, Guannan Zhang, Weisheng Dai, Ruichen Zhen, Chuqiao Lyu, Haotian Wu, Yinian Mao, Xushi Wang, Yuxiang Jiang, Wenbo Ding, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院) Meituan Academy of Robotics(美团机器人研究院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文提出EgoTouch数据库和TouchAnything框架,通过多视角视频数据提升双臂触觉估计性能,实验表明结合腕部视角可提升接触和体积IoU指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12978 2026-05-14 cs.AI

Useful Memories Become Faulty When Continuously Updated by LLMs

有用的记忆在由LLMs持续更新时会变得错误

Dylan Zhang, Yanshan Lin, Zhengkun Wu, Yihang Sun, Bingxuan Li, Dianqi Li, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IIIS, Tsinghua University(清华大学人工智能研究院)

AI总结 研究发现,即使基于有用经验,LLM生成的记忆在持续更新后可能失效,建议将原始事件作为首要证据并明确控制记忆巩固过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12890 2026-05-14 stat.AP cs.LG

Steer-to-Detect: Probing Hidden Representations for Detection of LLM-Generated Texts

Steer-to-Detect:探测隐藏表示以检测LLM生成文本

Luxu Liang, Xiang Li

机构 * Tsinghua University(清华大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出Steer-to-Detect框架,通过改进的隐藏表示分离能力,有效检测LLM生成文本,理论和实验均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12703 2026-05-14 cs.CV cs.AI

MMCL-Bench: Multimodal Context Learning from Visual Rules, Procedures, and Evidence

MMCL-Bench:多模态上下文学习从视觉规则、程序和证据

Yifan Chen, Fei Yin, Qingyan Bai, Zicheng Lin, Yujiu Yang

机构 * University of Cambridge(剑桥大学) HKUST(香港科技大学) Tsinghua University(清华大学)

AI总结 MMCL-Bench提出一个多模态上下文学习基准,要求模型从视觉或混合模态教学上下文中学习规则、程序和经验模式,并应用于新实例。评估发现当前系统在多模态上下文学习上仍不稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11679 2026-05-14 cs.AI

Explaining and Breaking the Safety-Helpfulness Ceiling via Preference Dimensional Expansion

通过偏好维度扩展解释并打破安全与有益性天花板

ShiYing Huang, Liang Lin, Yuer Li, Kaiwen Luo, Zhenhong Zhou, An Zhang, Junhao Dong, Kun Wang, Zhigang Zeng

机构 * Huazhong University of Science and Technology(华中科技大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Chongqing University(重庆大学)

AI总结 本文提出MORA方法,通过多维奖励整合解决多目标对齐中的安全与有益性矛盾,实验显示在序列对齐中提升5%-12.4%,同时对齐中整体奖励提升4.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10819 2026-05-14 cs.RO cs.AI cs.CV

ALAM: Algebraically Consistent Latent Action Model for Vision-Language-Action Models

ALAM:基于代数一致的潜在动作模型用于视觉-语言-动作模型

Zuojin Tang, Haoyun Liu, Xinyuan Chang, Changjie Wu, Dongjie Huo, Yandan Yang, Bin Liu, Zhejia Cai, Feng Xiong, Mu Xu, jiachen Luo, De Ma, Zhiheng Ma, Gang Pan

机构 * Zhejiang University(浙江大学) Amap, Alibaba Group(阿里集团阿地图) Nanjing University(南京大学) Shenzhen University of Advanced Technology(深圳先进技术大学) Beijing University of Chemical Technology(北京化工大学) Embodied Intelligence General Platform Laboratory, Chery Auto(奇瑞汽车 embodied intelligence 通用平台实验室) Tsinghua University(清华大学) Queen Mary University of London(伦敦大学玛丽女王学院)

AI总结 ALAM通过代数一致的潜在动作模型从无标注视频中提取结构化先验,结合流匹配目标提升VLA学习性能,显著提高任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02022 2026-05-14 cs.AI

ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis

ATBench:一个多样且现实的代理轨迹基准,用于安全评估与诊断

Yu Li, Haoyu Luo, Yuejin Xie, Yuqian Fu, Zhonghao Yang, Shuai Shao, Qihan Ren, Wanying Qu, Yanwei Fu, Yujiu Yang, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) KAUST(卡塔尔人工智能科学中心) East China Normal University(华东师范大学)

AI总结 ATBench通过多样化的轨迹和现实场景评估代理安全,包含1000条轨迹,挑战性强,支持跨基准比较和长周期故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏