机构
*
Kavli Institute for Theoretical Physics, University of California Santa Barbara(加州大学圣芭芭拉分校凯文利理论物理研究所)
;
Center for Gravitational Physics, University of Texas at Austin(德克萨斯大学奥斯汀分校重力物理中心)
;
Department of Physics, University of California at Santa Barbara(加州大学圣芭芭拉分校物理系)
;
International Centre for Theoretical Sciences, Tata Institute of Fundamental Research(塔塔基础研究机构国际理论科学研究中心)
;
School of Natural Sciences, Institute for Advanced Study(高级研究院自然科学学院)
;
Chennai Mathematical Institute(钦奈数学研究所)
;
Kavli Institute for Cosmological Physics, The University of Chicago(芝加哥大学凯文利宇宙物理研究所)
;
Department of Particle Physics & Astrophysics, Weizmann Institute of Science(魏茨曼科学研究所粒子物理与天体物理系)
ExploitGym: Can AI Agents Turn Security Vulnerabilities into Real Attacks?
ExploitGym:AI代理能否将安全漏洞转化为实际攻击?
Zhun Wang, Nico Schiller, Hongwei Li, Srijiith Sesha Narayana, Milad Nasr, Nicholas Carlini, Xiangyu Qi, Eric Wallace, Elie Bursztein, Luca Invernizzi, Kurt Thomas, Yan Shoshitaishvili, Wenbo Guo, Jingxuan He, Thorsten Holz, Dawn Song
机构
*
UC Berkeley(加州大学伯克利分校)
;
Max Planck Institute for Security and Privacy(马克斯·普朗克安全与隐私研究所)
;
UC Santa Barbara(加州大学圣巴巴拉分校)
;
Arizona State University(亚利桑那州立大学)
;
Anthropic(Anthropic公司)
;
OpenAI
;
Google(谷歌)
机构
*
Department of Computer Science(计算机科学系)
;
University of Pisa(比萨大学)
;
Institute of Information Science and Technologies(信息科学与技术研究所)
;
National Research Council of Italy(意大利国家研究理事会)
;
Institute of Informatics and Telematics(信息学与电信研究所)
Stargazer: A Scalable Model-Fitting Benchmark Environment for AI Agents under Astrophysical Constraints
Stargazer:一种可扩展的AI代理在天体物理约束下的模型拟合基准环境
Xinge Liu, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin, Kristen Menou
机构
*
University of Toronto(多伦多大学)
;
Vector Institute(向量研究所)
;
Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所)
;
ELLIS Institute Tübingen(图宾根ELLIS研究所)
Skill Drift Is Contract Violation: Proactive Maintenance for LLM Agent Skill Libraries
技能漂移是合同违约:为LLM代理技能库的主动维护
Linfeng Fan, Yuan Tian, Ziwei Li, Zhiwu Lu
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院)
;
King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)
Japan K. Patel, Todd A. Wareing, Tenzin Kunkyab, Caleb Raman, Ilias Sachpazidis, Peter Szentivanyi, Ryan Clark, Gregory Gill, Pierre Lansonneur, Arjun Karnwal, Michael Kudla, Sergejs Unterkirhers, Junqi Song, Jun Yang, Anthony Magliari, Matthew C. Schmidt
No More, No Less: Task Alignment in Terminal Agents
无需更多,无需更少:终端代理的任务对齐
Sina Mavali, David Pape, Jonathan Evertz, Samira Abedini, Devansh Srivastav, Thorsten Eisenhofer, Sahar Abdelnabi, Lea Schönherr
机构
*
CISPA Helmholtz Center for Information Security(CISPA 涅槃中心信息安全研究所)
;
ELLIS Institute Tübingen and MPI for Intelligent Systems(图宾根 ELLIS 研究所和智能系统 MPI)
;
Tübingen AI Center(图宾根人工智能中心)
AcuityBench: Evaluating Clinical Acuity Identification and Uncertainty Alignment
AcuityBench:评估语言模型对医疗紧急情况识别和不确定性对齐
Robin Linzmayer, Georgianna Lin, Di Coneybeare, Jason Chu, Trudi Cloyd, Manish Garg, Miles Gordon, Elizabeth Hartofilis, Benjamin Hong, Ashraf Hussain, Eugene Y. Kim, Oluchi Iheagwara King, Ross McCormack, Erica Olsen, John K. Riggins, Mustafa N. Rasheed, Dana L. Sacco, Vinay Saggar, Osman R. Sayan, Amit Shembekar, Janice Shin-Kim, Wendy W. Sun, Bernard P. Chang, David Kessler, Noémie Elhadad
机构
*
Department of Computer Science, Columbia University, New York, NY, USA(计算机科学系,哥伦比亚大学,纽约,纽约州,美国)
;
Department of Biomedical Informatics, Columbia University, New York, NY, USA(生物医学信息学系,哥伦比亚大学,纽约,纽约州,美国)
;
Department of Emergency Medicine, Columbia University Irving Medical Center, New York, NY, USA(急诊医学系,哥伦比亚大学伊文思医疗中心,纽约,纽约州,美国)
机构
*
TUAREG, Universitat Politècnica de Catalunya (UPC)(TUAREG,西班牙巴塞罗那理工大学)
;
Mechanical Engineering, Delft University of Technology (TU Delft)(代尔夫特理工大学机械工程系)
;
CASE, Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心)
AgentShield: Deception-based Compromise Detection for Tool-using LLM Agents
AgentShield:基于欺骗的工具使用LLM代理 compromise 检测
Yassin H. Rassul, Tarik A. Rashid
机构
*
Computer Science and Engineering Department, School of Science and Engineering, University of Kurdistan Hewl\^{e}r, Erbil, Iraq(科罗曼嫩大学科学与工程学院计算机科学与工程系)
;
Engineering Department, School of Science(科学学院工程系)
;
Engineering, University of Kurdistan Hewl\ e r, Erbil, Iraq(科罗曼嫩大学工程学院)
;
Innovation Centre, University of Kurdistan Hewl\ e r, Erbil, Iraq(科罗曼嫩大学创新中心)
Finite and Corruption-Robust Regret Bounds in Online Inverse Linear Optimization under M-Convex Action Sets
有限的和抗腐败的在线逆线性优化在M-凸行动集下的后悔界
Taihei Oki, Shinsaku Sakaue
机构
*
Institute for Chemical Reaction Design and Discovery (ICReDD), Hokkaido University(化学反应设计与发现研究所(ICReDD),北海道大学)
;
D3 Center, The University of Osaka(大阪大学D3中心)
;
Center for Advanced Intelligence Project, RIKEN(先进智能项目中心,RIKEN)
;
CyberAgent, Tokyo, Japan(CyberAgent,日本东京)
;
National Institute of Informatics, Tokyo, Japan(信息技术国家研究所,日本东京)