arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Massachusetts Institute of Technology(麻省理工学院)

共收录 2219
2512.16762 2026-05-04 cs.LG

NRGPT: An Energy-based Alternative for GPT

NRGPT:一种基于能量的GPT替代方案

Nima Dehmamy, Benjamin Hoover, Bishwajit Saha, Leo Kozachkov, Jean-Jacques Slotine, Dmitry Krotov

机构 * IBM Research(IBM研究院) Georgia Tech(佐治亚理工学院) Brown University(布朗大学) MIT(麻省理工学院)

AI总结 NRGPT通过最小化修改将GPT与能量基模型框架统一,其推理过程被视为在能量景观上探索,实验证明在特定条件下可转化为梯度下降,适用于简单语言、代数任务和更复杂的语言建模。

Comments Accepted to ICLR 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26388 2026-05-04 eess.AS cs.AI cs.CL

Game-Time: Evaluating Temporal Dynamics in Spoken Language Models

Game-Time:评估口语语言模型中的时间动态

Kai-Wei Chang, En-Pei Hu, Chun-Yi Kuan, Wenze Ren, Wei-Chih Chen, Guan-Ting Lin, Yu Tsao, Shao-Hua Sun, Hung-yi Lee, James Glass

机构 * Massachusetts Institute of Technology, USA(麻省理工学院) National Taiwan University(台湾国立台湾大学) Academia Sinica(台湾“ Academia Sinica”) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立清华大学人工智能研究中心卓越研究中心)

AI总结 本文提出Game-Time基准测试,用于评估口语语言模型在时间动态方面的能力,发现现有模型在时间约束下表现不佳,揭示了时间感知和全双工交互的不足。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00393 2026-05-04 cs.LG

Model-Based Reinforcement Learning with Double Oracle Efficiency in Policy Optimization and Offline Estimation

基于双 oracle 效率的模型驱动强化学习:在策略优化和离线估计中的应用

Haichen Hu, Jian Qian, David Simchi-Levi

机构 * Laboratory for Information and Decision Systems(信息与决策系统实验室) Massachusetts Institute of Technology(麻省理工学院) The University of Hong Kong(香港大学)

AI总结 本文提出一种新的算法,通过 log-barrier 和 log-determinant 正则化,在离线 oracle 效率的 episodic RL 中实现最优 regret 绑定,且 oracle 复杂度与状态和动作空间大小无关,适用于大规模和连续环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00336 2026-05-04 cs.CL cs.AI

Budget-Aware Routing for Long Clinical Text

面向预算的路由:长临床文本

Khizar Qureshi, Geoffrey Martin, Yifan Peng

机构 * MIT, Cambridge, MA(麻省理工学院,马萨诸塞州剑桥) Cornell University, Ithaca, NY(康奈尔大学,纽约州伊萨克中心) Weill Cornell Medicine, New York, NY(韦尔医学院,纽约市)

AI总结 本文研究了在预算限制下选择临床文本上下文的方法,提出RCD目标平衡相关性、覆盖性和多样性,并通过实验展示不同单位化策略和路由启发式方法的效果差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00244 2026-05-04 cs.RO cs.CV

Lucid-XR: An Extended-Reality Data Engine for Robotic Manipulation

Lucid-XR:一种用于机器人操控的扩展现实数据引擎

Yajvan Ravan, Adam Rashid, Alan Yu, Kai McClennen, Gio Huh, Kevin Yang, Zhutian Yang, Qinxi Yu, Xiaolong Wang, Phillip Isola, Ge Yang

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) FortyFive Labs(FortyFive实验室) Caltech(加州理工学院) Harvard University(哈佛大学) UC San Diego(南加州大学)

AI总结 Lucid-XR通过XR头显直接运行的物理模拟环境生成多模态数据,实现零样本迁移至复杂环境,支持软材料、松散颗粒和刚体接触的精细操控任务。

Comments Project website: https://lucidxr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10652 2026-05-04 cs.HC cs.AI cs.CY cs.ET

Vibe Coding in Product Teams: Reconfiguring AI-Assisted Workflows, Prototyping, and Collaboration

产品团队中的Vibe编码:重新配置AI辅助的工作流、原型设计与协作

Jie Li, Youyang Hou, Laura Lin, Ruihao Zhu, Hancheng Cao, Abdallah El Ali

机构 * Netherlands and MIT Media Lab(荷兰和MIT媒体实验室) Notion Labs(Notion实验室) Collov AI Cornell University(康奈尔大学) Goizueta Business School, Emory University(埃默里大学戈伊兹埃塔商学院) Centrum Wiskunde & Informatica, The Netherlands and Utrecht University, The Netherlands(荷兰代尔夫特理工大学和乌得勒支大学)

AI总结 本文研究Vibe编码如何重塑产品开发流程与协作,揭示其四阶段工作流及带来的效率与创造力提升,同时指出代码不可靠、集成困难等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01946 2026-05-04 q-bio.QM cs.LG math.DS q-bio.NC

Characterizing control between interacting subsystems with deep Jacobian estimation

通过深度雅可比估计表征相互作用子系统的控制特性

Adam J. Eisen, Mitchell Ostrow, Sarthak Chandra, Leo Kozachkov, Earl K. Miller, Ila R. Fiete

机构 * Brain and Cognitive Sciences MIT(麻省理工学院脑科学与认知科学系) IBM Thomas J. Watson Research Center(IBM沃森研究中心) International Centre for Theoretical Sciences(国际理论科学研究院) Brown University(布朗大学)

AI总结 本文提出一种基于深度学习的非线性控制理论框架,通过动态雅可比估计表征子系统交互,展示了在高维混沌系统中优于传统方法的性能,并通过多区域RNN模型验证了控制方向的动态变化及行为操控能力。

Comments 10 pages, 6 figures

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10990 2026-05-04 cs.GT cs.LG econ.TH math.ST stat.ML stat.TH

Statistical Impossibility and Possibility of Aligning LLMs with Human Preferences: From Condorcet Paradox to Nash Equilibrium

大语言模型与人类偏好的统计不可能性与可能性:从康德斯悖论到纳什均衡

Kaizhao Liu, Qi Long, Zhekun Shi, Weijie J. Su, Jiancong Xiao

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Pennsylvania(宾夕法尼亚大学) Princeton University(普林斯顿大学)

AI总结 本文探讨了对齐大语言模型与人类偏好的统计限制,证明在一般概率偏好模型下,康德斯循环几乎必然存在,从而表明基于奖励的方法无法完全对齐偏好。同时,研究了非奖励方法下LLM采用混合策略的条件,证明在Luce模型下,少数群体偏好得以保留的统计可能性。

Comments Accepted for publication in the Annals of Statistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28186 2026-05-01 cs.GT cs.AI cs.CC cs.LG econ.TH

Computing Equilibrium beyond Unilateral Deviation

在单方面偏离之外计算均衡

Mingyang Liu, Gabriele Farina, Asuman Ozdaglar

机构 * LIDS, EECS, Massachusetts Institute of Technology(LIDS电子工程系,麻省理工学院)

AI总结 本文提出一种新的均衡概念,通过最小化联盟偏离激励来保证存在性,针对平均收益和最大内联盟收益扩展框架,并证明计算此类均衡的复杂性下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27052 2026-05-01 math.OC cs.LG math.DG

Man, Machine, and Mathematics

人、机器与数学

Akshunna S. Dogra

机构 * NSF AI Institute for Artificial Intelligence and Fundamental Interactions(美国国家科学基金会人工智能与基本相互作用研究所) EPSRC Centre for Doctoral Training: Mathematics of Random Systems(英国工程与物理科学研究委员会博士培训中心:随机系统数学) Center of Mathematical Sciences and Applications, Harvard University(哈佛大学数学科学中心) Department of Physics, Massachusetts Institute of Technology (MIT)(麻省理工学院(MIT)物理系) Department of Mathematics, Imperial College London(伦敦帝国理工学院数学系) MathePhysics

AI总结 本文探讨构建统一框架以指导学习、优化与建模领域的发展,提出解决可解问题的通用收敛定理,并利用动力系统、几何和基础物理中的工具简化学习研究。

Comments 31 pages, 8 figures, 3 appendices. Survey article/scientific manifesto covering learning and optimisation from a broad perspective, especially within computational contexts

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26973 2026-05-01 cs.NE cs.LG stat.CO

MAEO: Multiobjective Animorphic Ensemble Optimization for Scalable Large-scale Engineering Applications

MAEO:多目标非形集合优化用于可扩展的大规模工程应用

Omer F. Erdem, Dean Price, Paul Seurin, Majdi I. Radaideh

机构 * Department of Nuclear Engineering and Radiological Sciences, University of Michigan, Ann Arbor, MI 48109, United States(核工程与辐射科学系,密歇根大学,安阿伯,MI 48109,美国) Department of Computer Science and Engineering, University of Michigan, Ann Arbor, MI 48109, United States(计算机科学与工程系,密歇根大学,安阿伯,MI 48109,美国) Department of Nuclear Science and Engineering, Massachusetts Institute of Technology, 60 Vassar St., Cambridge, MA 02139(核科学与工程系,麻省理工学院,60 Vassar街,剑桥,MA 02139) Idaho National Laboratory, Idaho Falls, ID 83415, United States(爱达荷国家实验室,爱达荷福尔斯,ID 83415,美国)

AI总结 MAEO通过非形集合策略统一先进进化算法,解决多目标优化中收敛性、多样性与计算效率的平衡问题,经基准测试和核反应堆优化验证其有效性。

Comments 33 pages, 9 figures, 5 tables, under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14067 2026-05-01 cs.CL cs.AI cs.LG

Efficient-DLM: From Autoregressive to Diffusion Language Models, and Beyond in Speed

Efficient-DLM:从自回归到扩散语言模型,以及速度上的突破

Yonggan Fu, Lexington Whalen, Zhifan Ye, Xin Dong, Shizhe Diao, Jingyu Liu, Chengyue Wu, Hao Zhang, Enze Xie, Song Han, Maksim Khadkevich, Jan Kautz, Yingyan Celine Lin, Pavlo Molchanov

机构 * Georgia Tech(佐治亚理工学院) University of Chicago(芝加哥大学) University of Hong Kong(香港大学) MIT(麻省理工学院)

AI总结 本文提出Efficient-DLM方法,通过改进自回归到扩散语言模型的转换,提升生成速度并保持任务准确性,实验显示其在精度和效率上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.12622 2026-05-01 cs.AI cs.CR cs.ET cs.LG cs.SY eess.SY

The AI Risk Repository: A Comprehensive Meta-Review, Database, and Taxonomy of Risks From Artificial Intelligence

人工智能风险仓库:人工智能风险的全面元综述、数据库和分类

Peter Slattery, Alexander K. Saeri, Emily A. C. Grundy, Jess Graham, Michael Noetel, Risto Uuk, James Dao, Soroush Pour, Stephen Casper, Neil Thompson

机构 * MIT AI Risk Initiative(麻省理工学院人工智能风险倡议)

AI总结 本文构建了首个公开可访问的人工智能风险数据库,通过系统综述和专家咨询,分类了777个风险,涵盖因果因素和领域分类,为协调管理AI风险提供基础。

Journal ref Patterns 101517 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22750 2026-04-30 cs.CL cs.AI cs.CY cs.HC cs.SE

How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks

AI代理如何花费你的钱?分析和预测代理编码任务中的令牌消耗

Longju Bai, Zhemin Huang, Xingyao Wang, Jiao Sun, Rada Mihalcea, Erik Brynjolfsson, Alex Pentland, Jiaxin Pei

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学) All Hands AI Google Deepmind(谷歌DeepMind) Microsoft AI(微软AI) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文研究了代理编码任务中令牌消耗模式,发现代理任务消耗远高于代码推理和代码聊天,且模型在任务执行前难以准确预测自身令牌使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23163 2026-04-30 cs.AI cs.CL cs.CR cs.IT cs.MA math.IT

A Decision-Theoretic Formalisation of Steganography With Applications to LLM Monitoring

基于决策理论的隐写术形式化及其在大语言模型监控中的应用

Usman Anwar, Julianna Piskorz, David D. Baek, David Africa, Jim Weatherall, Max Tegmark, Christian Schroeder de Witt, Mihaela van der Schaar, David Krueger

机构 * University of Cambridge(剑桥大学) Massachusetts Institute of Technology(麻省理工学院) UK AI Safety Institute(英国人工智能安全研究所) University of Oxford(牛津大学) Mila, University of Montreal(蒙特利尔大学米尔人工智能实验室)

AI总结 本文提出决策理论视角下的隐写术形式化方法,通过通用V-信息量定义隐写差距,用于检测和缓解大语言模型中的隐写推理行为。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26566 2026-04-30 eess.SY cs.LG cs.SY

Learning to Route Electric Trucks Under Operational Uncertainty

在运营不确定性下学习电动卡车路由

Stavros Orfanoudakis, Ziyan Li, Ruixiao Yang, Nikolay Aristov, Pedro P. Vergara, Chuchu Fan, Elenna Dugundji

机构 * Delft University of Technology, Intelligent Electrical Power Grids(代尔夫特理工大学,智能电力电网) Massachusetts Institute of Technology, Center of Transportation and Logistics(麻省理工学院,交通与物流中心) Massachusetts Institute of Technology, Department of Aeronautics and Astronautics(麻省理工学院,航空与航天系)

AI总结 本文提出了一种基于学习的框架,用于在充电约束和运营不确定性下解决电动卡车路由问题,通过强化学习和事件驱动的半马尔可夫决策过程,提高了训练效率和性能。

Comments Reinforcement Learning, Electric Truck Routing, Freight Transportation, Graph Neural Networks, Stochastic Optimization, Vehicle Routing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26212 2026-04-30 cs.RO

2D and 3D Grasp Planners for the GET Asymmetrical Gripper

用于GET非对称夹具的2D和3D抓取规划器

Andrew Goldberg, Ethan Ransing, Anton Kourakin, Cael Magner, Edward H. Adelson, Ken Goldberg

机构 * The AUTOLab at UC Berkeley(伯克利大学自动实验室) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出GET-2D-1.0和GET-3D-1.0两种规划器,前者基于单视图RGB-D图像,后者基于3D模型和光线追踪,实验表明GET-2D-1.0在抓取成功率等指标上优于基线,但GET-3D-1.0计算成本更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26143 2026-04-30 physics.comp-ph cond-mat.mtrl-sci cs.LG

Mixture of Experts Framework in Machine Learning Interatomic Potentials for Atomistic Simulations

机器学习原子势中的专家混合框架

Gabriel de Miranda Nascimento, Marc L. Descoteaux, Laura Zichi, Chuin Wei Tan, William C. Witt, Nicola Molinari, Sriteja Mantha, Daniil Kitchaev, Mordechai Kornbluth, Karim Gadelrab, Charles Tuffile, Boris Kozinsky

机构 * Department of Materials Science and Engineering, Massachusetts Institute of Technology, Cambridge, MA, USA(材料科学与工程系,麻省理工学院,剑桥,马萨诸塞州,美国) John A. Paulson School of Engineering and Applied Sciences, Harvard University, Cambridge, MA, USA(约翰·A·波尔森工程与应用科学学院,哈佛大学,剑桥,马萨诸塞州,美国) Robert Bosch LLC Research and Technology Center, Watertown, MA, USA(罗伯特·博世 LLC 研究与技术中心,沃特敦,马萨诸塞州,美国)

AI总结 本文提出一种基于E(3)等价Allegro架构的多保真度专家混合框架,用于提升原子模拟的计算效率与精度,通过在不同区域分配不同能力的模型,解决界面机械不匹配问题,验证了其在Pt+CO催化系统中的有效性。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26018 2026-04-30 cond-mat.str-el cs.AI cs.LG

QERNEL: a Scalable Large Electron Model

QERNEL:一种可扩展的大型电子模型

Khachatur Nazaryan, Liang Fu

机构 * Department of Physics, Massachusetts Institute of Technology, Cambridge, MA-02139,USA(麻省理工学院物理系)

AI总结 QERNEL通过结合FiLM参数条件和高效架构元素,以低计算成本提升表达能力,用于半导体莫尔异质双层中电子相互作用研究,发现量子液态与晶体态之间的突变相变。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25982 2026-04-30 cs.LG cs.AI cs.CY cs.ET

Open Problems in Frontier AI Risk Management

前沿人工智能风险管理中的开放问题

Marta Ziosi, Miro Plueckebaum, Stephen Casper, Henry Papadatos, Ze Shen Chin, Peter Slattery, James Gealy, Tim G. J. Rudner, Brian Tse, Ariel Gil, Patricia Paskov, Maximilian Negele, Rokas Gipiškis, Nada Madkour, Vera Lummis, Rupal Jain, Luise Eder, Kristina Fort, Malou C. van Draanen Glismann, Inès Belhadj, Amin Oueslati, Anna K. Wisakanto, Richard Mallah, Koen Holtman, Ranj Zuhdi, Daniel S. Schiff, Jessica Newman, Malcolm Murray, Robert Trager

机构 * Oxford Martin AI Governance Initiative, University of Oxford(牛津大学人工智能治理倡议) MIT Computer Science and Artificial Intelligence Laboratory, MIT(麻省理工学院计算机科学与人工智能实验室) MIT Future Tech(麻省理工学院未来技术) Stanford University(斯坦福大学) Governance and Responsible AI Lab, Purdue University(普渡大学治理与负责任的人工智能实验室) University of Toronto(多伦多大学) Mercatus Center, George Mason University(乔治·马歇尔大学麦卡锡中心) Vilnius University(维尔纽斯大学) Vijil SaferAI AI Standards Lab(人工智能标准实验室) The Future Society(未来社会) Concordia AI(康科德人工智能) Pivotal Research Center for AI Risk Management & Alignment(人工智能风险管理和对齐中心) UC Berkeley Center for Long-Term Cybersecurity(伯克利大学长期网络安全中心) Independent(独立)

AI总结 本文探讨前沿人工智能风险管理中的核心问题,通过文献综述识别未解决的挑战,并分类问题类型以指导未来研究与治理。

Comments 81 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25942 2026-04-30 cs.LG

A Multimodal and Explainable Machine Learning Approach to Diagnosing Multi-Class Ejection Fraction from Electrocardiograms

一种多模态且可解释的机器学习方法用于从心电图中诊断多类射血分数

Catherine Ning, Yu Ma, Cindy Beini Wang, Sean McMahon, Joseph Radojevic, Steven Zweibel, Dimitris Bertsimas

机构 * Operations Research Center, Massachusetts Institute of Technology(麻省理工学院运营研究中心) Wisconsin School of Business, University of Wisconsin–Madison(威斯康星大学麦迪逊分校商学院) Heart and Vascular Institute, Hartford Hospital(哈特福德医院心脏与血管研究院)

AI总结 本文提出一种结合工程化12导联ECG时间序列特征与结构化电子健康记录变量的多模态机器学习框架,用于四类临床射血分数分类,并通过SHAP属性分析提高模型可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13969 2026-04-30 cs.AI cs.IR cs.LG

Autonomous Knowledge Graph Exploration with Adaptive Breadth-Depth Retrieval

自主知识图谱探索与自适应广度-深度检索

Joaquín Polonuer, Lucas Vittor, Iñaki Arango, Ayush Noori, David A. Clifton, Luciano Del Corro, Marinka Zitnik

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) Departamento de Computación, FCEyN, Universidad de Buenos Aires(布宜诺斯艾利斯大学计算机系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏州市先进研究中心) ELIAS Lab, Departamento de Ingeniería, Universidad de San Andrés(圣安德鲁大学工程系ELIAS实验室) Kempner Institute for the Study of Natural and Artificial Intelligence, Allston, MA, USA(自然与人工智能研究所,马萨诸塞州阿利斯顿) Broad Institute of MIT and Harvard, Cambridge, MA, USA(MIT和哈佛大学Broad研究所) Harvard Data Science Initiative, Cambridge, MA, USA(哈佛大学数据科学倡议)

AI总结 本文提出ARK工具,通过全局词搜索和邻域探索平衡知识图谱的广度与深度检索,提升多跳遍历效率,在STaRK上达到59.1%的平均Hit@1和67.4的平均MRR,优于其他方法。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19543 2026-04-30 cs.RO

A Virtual Mechanical Interaction Layer Enables Resilient Human-to-Robot Object Handovers

虚拟机械交互层实现人机物体传递的鲁棒性

Omar Faris, Sławomir Tadeja, Fulvio Forni

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Department of Mechanical Engineering, Massachusetts Institute of Technology(麻省理工学院机械工程系)

AI总结 本文提出虚拟模型控制层和增强现实技术,提升人机物体传递过程中对物体姿态变化的适应能力,并通过实验验证了其在复杂不确定性下的鲁棒性。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20876 2026-04-30 cs.CL

Decide less, communicate more: On the construct validity of end-to-end fact-checking in medicine

少做决定,多进行沟通:关于医学领域端到端事实核查构建效度的探讨

Sebastian Joseph, Lily Chen, Barry Wei, Michael Mackert, Iain J. Marshall, Paul Pu Liang, Ramez Kouzy, Byron C. Wallace, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Stanford University(斯坦福大学) Indiana University School of Medicine(印第安纳大学医学院) King’s College London(伦敦国王学院) Massachusetts Institute of Technology(麻省理工学院) The University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心) Northeastern University(东北大学)

AI总结 本文探讨医学领域端到端事实核查系统的构建效度,指出其在连接现实声明与科学证据、处理模糊声明及主观真实性标签方面的挑战,主张将其视为互动沟通问题。

Comments ACL 2026 Findings camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02077 2026-04-30 cs.CR cs.AI cs.MA

Open Challenges in Multi-Agent Security: Towards Secure Systems of Interacting AI Agents

多智能体安全中的开放挑战:迈向交互式AI智能体的安全系统

Christian Schroeder de Witt, Klaudia Krawiecka, Igor Krawczuk, Ben Hagag, William L. Anderson, Peter Belcak, Ben Bucknall, Xiaohong Cai, Ayush Chopra, Doron Cohen, Ron F. Del Rosario, Andis Draguns, Annie Gray, Keren Katz, Vasilios Mavroudis, Jaron Mink, Sumeet Ramesh Motwani, Jonathan Petit, Leif-Sebastian Rembeck, Chandler Smith, John Sotiropoulos, Steven Young, Sarah Scheffler, Mary Llewellyn

机构 * Oxford Witt Lab, University of Oxford(牛津Witt实验室,牛津大学) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Association for Computing Machinery (ACM)(计算机协会(ACM)) Independent(独立) MATS Research(MATS研究) CyLab Security & Privacy Institute, Carnegie Mellon University(CyLab安全与隐私研究所,卡内基梅隆大学) Qualcomm Inc.(高通公司) Oxford Martin AI Governance Initiative(牛津马丁人工智能治理倡议) Carnegie Mellon University(卡内基梅隆大学) MIT Media Lab(麻省理工媒体实验室) SAP SE(SAP德国分公司) OWASP GenAI Security Project - Agentic Security Initiative(OWASP生成式AI安全项目-代理安全倡议) Contramont Research(Contramont研究) The Alan Turing Institute(艾伦·图灵研究所) Department of Economics, New York University(纽约大学经济系) Zenity(Zenity公司) King’s College London(伦敦国王学院) Arizona State University(亚利桑那州立大学) Torr Vision Group, University of Oxford(托尔视觉组,牛津大学) Deep Cyber Ltd(Deep Cyber有限公司)

AI总结 本文探讨多智能体交互带来的安全挑战,提出多智能体安全新领域,旨在解决智能体间及与人类、机构的交互中出现的安全问题,分析安全与效用、安全与安全之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25788 2026-04-29 cs.RO

KinDER: A Physical Reasoning Benchmark for Robot Learning and Planning

KinDER:机器人学习与规划的运动学与动力学推理基准

Yixuan Huang, Bowen Li, Vaibhav Saxena, Yichao Liang, Utkarsh Aashu Mishra, Liang Ji, Lihan Zha, Jimmy Wu, Nishanth Kumar, Sebastian Scherer, Danfei Xu, Tom Silver

机构 * Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学) Georgia Tech(佐治亚理工学院) University of Cambridge(剑桥大学) NVIDIA(英伟达) MIT(麻省理工学院)

AI总结 KinDER基准针对机器人学习与规划中的物理推理挑战,包含25个生成环境、Python库和评估套件,旨在通过系统比较不同方法提升机器人物理推理能力。

Comments Project website: https://prpl-group.com/kinder-site/. 21 pages, 8 figures. Accepted to Robotics Science and Systems (RSS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25601 2026-04-29 cs.HC cs.AI

Emotive Architectures: The Role of LLMs in Adjusting Work Environments

情感建筑:大型语言模型在调整工作环境中的作用

Lara Vartziotis, Tina Vartziotis, Frank Beutenmueller, Stella Salta, Konstantinos Moraitis, Miltiadis Katsaros, Sotirios Kotsopoulos

机构 * National Technical University of Athens(希腊国家技术大学) TWT GmbH Science & Innovation(TWT GmbH 科技与创新部门) Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文探讨了LLM在融合物理与虚拟环境中的应用,通过实时调整光照、声学等参数,提升用户专注度与幸福感,并提出伦理考量与包容性设计的重要性。

Comments 19 pages, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25119 2026-04-29 cs.LG cs.CY

Evaluation without Generation: Non-Generative Assessment of Harmful Model Specialization with Applications to CSAM

无生成评估:有害模型专业化非生成性评估及其在CSAM中的应用

Vinith M. Suriyakumar, Ayush Sekhari, Lena Stempfle, Robertson Wang, Michael Simpson, Rebecca Portnoff, Marzyeh Ghassemi, Ashia C. Wilson

机构 * MIT(麻省理工学院) Thorn

AI总结 本文提出无生成评估方法,通过分析模型内部状态而非输出来评估模型能力,用于检测儿童性虐待材料等高风险领域,提供可扩展的非生成性评估方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08567 2026-04-29 cs.CL cs.MA

Multi-User Large Language Model Agents

多用户大语言模型代理

Shu Yang, Shenzhe Zhu, Hao Zhu, José Ramón Enríquez, Di Wang, Alex Pentland, Michiel A. Bakker, Jiaxin Pei

机构 * Stanford University(斯坦福大学) KAUST UT Austin(得克萨斯大学奥斯汀分校) MIT(麻省理工学院)

AI总结 本文首次系统研究多用户LLM代理,提出统一交互协议并设计压力测试场景,揭示前沿模型在优先级维护、隐私保护和协调效率方面的系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24698 2026-04-28 cs.CL

The Chameleon's Limit: Investigating Persona Collapse and Homogenization in Large Language Models

Chameleon的极限:探究大型语言模型中的人格崩溃与同质化

Yunze Xiao, Vivienne J. Zhang, Chenghao Yang, Ningshan Ma, Weihao Xuan, Jen-tse Huang

机构 * CMU(卡内基梅隆大学) UChicago(芝加哥大学) MIT(麻省理工学院) UTokyo(东京大学) RIKEN AIP(理化学研究所AIP分部) JHU(约翰霍普金斯大学)

AI总结 研究发现大型语言模型中存在人格崩溃现象,导致代理行为模式趋同。通过提出覆盖度、均匀度和复杂度指标,揭示模型在不同维度和领域的人格表现差异,并释放工具支持群体评估。

详情

展开后加载摘要…

URL PDF HTML 收藏