arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Xi'an Jiaotong University(西安交通大学)

2026-06-23 至 2026-06-23 共收录 7
2606.22557 2026-06-23 cs.AI cs.CL cs.HC 新提交

MacAgentBench: Benchmarking AI Agents on Real-World macOS Desktop

MacAgentBench: 在真实macOS桌面上基准测试AI代理

Yikun Fu, Bowen Fu, Zhenyu Wu, Shuang Cheng, Xiaowei Sun, Bowen Yang, Zehao Li, Yibo Zhao, Zichen Ding, Zhoumianze Liu, Shijie Wang, Biqing Qi, Bowen Zhou

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Tsinghua University(清华大学)

AI总结 提出MacAgentBench,包含676个跨25个应用的任务,采用规则评估和细粒度多检查点评分,实验表明最佳配置(OpenClaw上的Claude Opus 4.6)达到73.7% Pass@1,优势主要来自技能库而非框架设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22476 2026-06-23 cs.CV 新提交

CVSBench: A Comprehensive Benchmark for Cross-view Spatial Reasoning and Dreaming

CVSBench:跨视角空间推理与想象的全面基准

Ruixun Liu, Lingyu Zhang, Lanxuan Xue, Kaiyu Li, Bowen Fu, Xiangyong Cao

机构 * Faculty of Electronic and Information Engineering, Xi’an Jiaotong University(西安交通大学电子与信息工程学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security(教育部智能网络与网络安全重点实验室)

AI总结 提出CVSBench基准,通过卫星-街景对评估视觉语言模型的跨视角空间推理能力,发现模型在视角剧变下难以保持物体与布局一致性,引入3D场景想象管道可显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21119 2026-06-23 cs.CV cs.AI 新提交

MammoExpert: Benchmarking Chain-of-Thought Reasoning in Mammography Diagnosis

MammoExpert:乳腺X线诊断中的思维链推理基准测试

Di Dai, Bo Liu, Youcheng Li, Haojun Yu, Zhouhang Bian, Quanlin Wu, Dong Wang, Sichen Meng, Hongye Xuan, Zijie Lan, Shenda Hong, Liwei Wang

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) School of Computer Science and Engineer, Beijing University of Aeronautics and Astronautics(北京航空航天大学计算机科学与工程学院) Center for Data Science, Peking University(北京大学数据科学中心) Yizhun co. ltd(医准有限公司) International School, Beijing University of Post and Telecommunications(北京邮电大学国际学院) School of Public Health, University of Michigan, Ann Arbor(密歇根大学安娜堡分校公共卫生学院) Future Technology College, Xi'an Jiaotong University(西安交通大学未来技术学院) Peking University(北京大学)

AI总结 提出首个包含思维链推理标注的乳腺X线数据集MammoExpert,覆盖2379张图像和67种病理亚型,通过三阶段推理提升病灶分类准确率,在多个数据集上验证了有效性。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18239 2026-06-23 cs.RO 新提交

EBench: Elemental Diagnosis of Generalist Mobile Manipulation Policies

EBench: 通用移动操作策略的要素诊断

Ning Gao, Jinliang Zheng, Xing Gao, Haoxiang Ma, Hanqing Wang, Yukai Wang, Jiantong Chen, Zanxin Chen, Shujie Zhang, Mingda Jia, Xuekun Jiang, Zihou Zhu, Xinyu Li, Shuai Wang, Hao Li, Wenzhe Cai, Yuqiang Yang, Xudong Xu, Zhaoyang Lyu, Yao Mu, Tai Wang, Jiangmiao Pang, Jia Zeng, Weinan Zhang, Chunhua Shen

机构 * Shanghai AI Laboratory(上海人工智能实验室) Xi’an Jiaotong University(西安交通大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

AI总结 提出EBench基准,从5个能力和4个泛化维度诊断通用移动操作模型,揭示不同模型在成功率相近时能力差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29245 2026-06-23 cs.CR cs.CL cs.LG 版本更新

Implicit Identity Technologies for LLMs: Fingerprinting and Watermarking across Datasets, Models, and Generated Content

LLM的隐式身份技术:跨数据集、模型和生成内容的指纹识别与水印

Bing Liu, Shunping Wang, Yufan Zhu, Xinyi Yu, Jing Huang, Linkang Du, Hongbin Pei, Wei Luo

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University, Xi’an, China(西安交通大学计算机科学与工程学院) State Grid Henan Marketing Service Center, Henan, China(国网河南营销服务中心) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) School of Information Technology, Deakin University, Geelong, Australia(迪金大学信息技术学院)

AI总结 本文综述了LLM指纹识别和水印技术,提出隐式身份统一抽象,并基于生命周期分类法组织数据集、模型和生成内容的技术,建立评估框架。

Comments Accepted by IJCAI-ECAI 2026. 11 pages, 1 figure. Survey and taxonomy of LLM fingerprinting and watermarking for identity, provenance, generated-content attribution, and asset protection

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15967 2026-06-23 cs.CR cs.CV 版本更新

When Safe Concepts Become Unsafe: Multi-Concept Compositional Vulnerabilities in Text-to-Image Models

TwoHamsters:文本到图像模型中多概念组合不安全性的基准测试

Chaoshuo Zhang, Yibo Liang, Mengke Tian, Chenhao Lin, Zhengyu Zhao, Le Yang, Chong Zhang, Yang Zhang, Qian Wang, Chao Shen

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学计算机科学与工程学院) CISPA Helmholtz Center for Information Security(信息安全研究中心) School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院)

AI总结 本文提出TwoHamsters基准,通过17500个提示测试文本到图像模型在多概念组合不安全性的表现,揭示现有模型和防御机制在处理危险组合生成时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13864 2026-06-23 cs.CR cs.AI 版本更新

HardSecBench: Benchmarking the Security Awareness of LLMs for Hardware Code Generation

HardSecBench: 对大型语言模型在硬件代码生成中的安全意识的基准测试

Qirui Chen, Jingxian Shuai, Shuangwu Chen, Shenghao Ye, Zijian Wen, Xufei Su, Jie Jin, Jiangming Li, Jun Chen, Xiaobin Tan, Jian Yang

机构 * University of Science and Technology of China(中国科学技术大学) Xi’an Jiaotong University(西安交通大学) Nanjing University(南京大学) ZTE Corporation(中兴通讯)

AI总结 提出HardSecBench基准,包含924个任务覆盖Verilog RTL和固件C代码,评估LLM在硬件代码生成中的安全性,发现模型常满足功能需求但存在安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏