arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-19 至 2026-05-19 共收录 196 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 41 篇

2605.03409 2026-05-19 cs.AI 57%

Robust Agent Compensation (RAC): Teaching AI Agents to Compensate

鲁棒代理补偿(RAC):教AI代理补偿

Srinath Perera, Kaviru Hapuarachchi, Frank Leymann, Rania Khalaf

机构 * University of Stuttgart(斯图加特大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究提出了一种基于日志的恢复范式RAC,通过架构扩展实现安全网,可应用于大多数代理框架以支持可靠执行。RAC可在不修改现有代理代码的情况下启用,通过现有的扩展点在大多数现有代理框架中实现,并通过τ-bench和REALM-Bench验证,证明在解决复杂问题时,RAC在延迟和token经济性方面优于现有最先进的LLM-based恢复方法。

Comments Accepted at ACM Conference on AI and Agentic Systems (ACM CAIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17359 2026-05-19 cs.CL 57%

Learning Transferable Topology Priors for Multi-Agent LLM Collaboration Across Domains

学习跨领域的多智能体LLM协作可转移拓扑先验

Taolin Zhang, Zijie Zhou, Jiuheng Wan, Tingyuan Hu, Chengyu Wang, Xiaofeng He, Richang Hong

机构 * Hefei University of Technology(合肥工业大学) China University of Petroleum (Beijing)(中国石油大学(北京)) East China Normal University(东华大学) Alibaba Group(阿里巴巴集团)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出TopoPrior框架,通过学习可转移的拓扑先验来提升多智能体LLM在跨领域协作中的效率,减少在线搜索开销并提高可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17320 2026-05-19 cs.OS cs.AI 57%

TClone: Low-Latency Forking of Live GUI Environments for Computer-Use Agents

TClone:用于计算机使用代理的低延迟活GUI环境分叉

Yutong Huang, Vikranth Srivatsa, Alex Asch, Hansin Tushar Patwa, Yiying Zhang

机构 * University of California, San Diego(加州大学圣迭戈分校) GenseeAI

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 TClone通过分离快速分支创建与持久快照,实现了对计算机使用代理的活GUI环境的低延迟版本控制,从而提高代理执行的安全性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16728 2026-05-19 cs.AI 57%

Body-Grounded Perspective Formation and Conative Attunement in Artificial Agents

具身视角形成与意图同调在人工体中

Hongju Pae

机构 * Active Inference Institute, CA, USA(主动推断研究所,加利福尼亚州,美国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种最小架构,用于人工体中的具身视角形成,通过引入内感受性活力信号、Fisher式度量以及意图同调机制,展示了如何在无奖励的网格世界中将学习到的身体倾向转化为稳定的体定向行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16704 2026-05-19 cs.LG 57%

Convex Dataset Valuation for Post-Training

训练后凸集估值

Siqi Zeng, Christopher Jung, Rui Li, Zhe Kang, Ming Li, Nima Noorshams, Zhigang Wang, Fuchun Peng, Han Zhao, Xue Feng

机构 * Department of Computer Science, University of Illinois Urbana-Chamapign, Urbana, IL, USA(伊利诺伊大学厄巴纳-香槟分校计算机科学系) Meta, Menlo Park, CA, USA(Meta)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文研究了在训练后利用凸集估值选择辅助数据集以提升大语言模型性能,提出基于核均值匹配的凸集估值方法,有效解决数据冗余问题,实验表明其在低计算开销下表现优于现有方法。

Comments Published as a conference paper at ICML '26. 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04375 2026-05-19 eess.SY cs.AI cs.SY 57%

Experiment-as-Code Labs: A Declarative Stack for AI-Driven Scientific Discovery

实验作为代码实验室:面向AI驱动科学发现的声明式栈

Zhenning Yang, Yuhan Chen, Patrick Tser Jern Kon, Tongyuan Miao, Hongyi Lin, Venkat Viswanathan, Danai Koutra, Ang Chen

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出实验作为代码实验室框架,通过声明式配置编译至设备API,实现AI代理与自动化实验室设备的高效协同,推动AI在科学发现中的应用突破。

Comments Experiment-as-Code (EaC) white paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16349 2026-05-19 cs.LG 57%

Geometric Asymmetry in MoE Specialization: Functional Decorrelation and Representational Overlap

MoE专业化中的几何不对称性:功能去相关与表征重叠

Feilong Liu

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究揭示MoE专业化中功能去相关与表征重叠共存的几何结构,通过实验表明路由稀疏性影响功能分离与子空间分歧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16274 2026-05-19 cs.HC cs.AI 57%

ChartDesign: Towards LLM Designer of Data Visualization

ChartDesign: 向数据可视化设计的LLM设计师迈进

Mohammed Afaan Ansari, Aniruddh Bansal, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出ChartDesign,利用大语言模型生成数据可视化设计属性,提升图表设计性能,实现84%的准确率,并在未见领域中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18502 2026-05-19 math.OC 50%

The distance-based formation controller design for multi-agent systems in port-Hamiltonian form

基于距离的多智能体系统在端哈密顿形式中的编队控制器设计

Jingyi Zhao, Yongxin Wu, Héctor García de Marina, Yuhu Wu, Yann Le Gorrec

专题命中 其他安全 :safety(abstract)

AI总结 本文研究了在多智能体系统端哈密顿动力学下,基于距离的编队控制与碰撞避免的集成问题,提出了一种利用仅吸引力势场和安全屏障的新型设计,通过LaSalle不变性原理保证系统稳定性,并通过数值模拟验证了控制策略的有效性。

Journal ref The 23rd IFAC World Congress, IFAC, Aug 2026, Busan, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17423 2026-05-19 cs.CV 50%

Soap2Soap: Long Cinematic Video Remaking via Multi-Agent Collaboration

Soap2Soap:通过多智能体协作实现长 cinematic 视频重制

Yiren Song, Huilin Zhong, Kevin Qinghong Lin, Haofan Wang, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室) University of Oxford(牛津大学) Lovart AI(Lovart人工智能)

专题命中 其他安全 :alignment(abstract)

AI总结 本研究提出 Soap2Soap 框架,通过多智能体协作实现长 cinematic 视频重制,解决视频到视频生成中长期一致性与叙事保真度的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03170 2026-05-19 cs.SD 50%

TED-TTS: Training-Free Intra-Utterance Emotion and Duration Control for Text-to-Speech Synthesis

TED-TTS: 无需训练的语句内情感和时长控制用于文本到语音合成

Qifan Liang, Yuansen Liu, Ruixin Wei, Nan Lu, Junchuan Zhao, Ye Wang

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出TED-TTS,一种无需训练的可控框架,用于预训练零样本TTS,实现语句内情感和时长表达。通过段落感知的情感条件策略和时长控制策略,结合因果掩码和单调流对齐过滤,实现平滑的情感变化并保持全局语义一致性,同时利用大规模多情感和时长标注数据集进行自动提示生成,实验表明其在多情感和时长控制中达到最先进的语句内一致性,同时保持基础TTS模型的语音质量。

Comments 24 pages, 9 figures, 7 tables, 3 lists

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17193 2026-05-19 cs.MA 50%

Multi-LLM Systems Exhibit Robust Semantic Collapse

多语言模型系统表现出稳健的语义崩溃

Weiyi Kong, Shiyang Lai, Jinghua Piao, James Evans

专题命中 其他安全 :alignment(abstract)

AI总结 研究探讨了多语言模型系统在闭环设置中维持开放知识生产的基本限制,发现系统在语义表示上出现系统性收敛,尽管表面上有词汇变化。

Comments 64 pages, 8 figures, 7 tables; includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07245 2026-05-19 cs.CV 50%

Zero-Shot Textual Explanations via Translating Decision-Critical Features

通过翻译决策关键特征实现零样本文本解释

Toshinori Yamauchi, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学) National Institute of Informatics(国家信息研究所)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出TEXTER方法,通过隔离决策关键特征生成更准确的文本解释,提升模型可解释性。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19953 2026-05-19 cs.CV 50%

Supervise Less, See More: Training-free Nuclear Instance Segmentation with Prototype-Guided Prompting

少监督,多观察:基于原型引导的提示方法实现无训练核实例分割

Wen Zhang, Qin Ren, Wenjing Liu, Haibin Ling, Chenyu You

机构 * Stony Brook University(石溪大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出SPROUT框架,通过组织学先验知识构建滑片特定参考原型,利用部分最优传输方案指导特征对齐,使SAM模型无需训练即可实现精准核分割。

Comments ICML 2026; 44 pages, 25 figures, 26 tables; Code at https://github.com/Y-Research-SBU/SPROUT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16611 2026-05-19 cond-mat.mtrl-sci 50%

Machine Learning Approaches to Point Defects in Non-Metallic Materials: A Review of Methods

机器学习在非金属材料中点缺陷的研究:方法综述

Yu Kumagai, Shin Kiyohara

专题命中 其他安全 :alignment(abstract)

AI总结 本文综述了机器学习在非金属材料点缺陷中的应用,重点分析了缺陷形成能的计算方法及当前研究的挑战与瓶颈。

Comments Appear in APEX-NEXT soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16537 2026-05-19 cs.RO 50%

Nori Bot: A Sub-$1,000 Floor-to-Counter Mobile Manipulator

Nori Bot:一款不到1000美元的 floor-to-counter 移动机械臂

Antonio Li, Sungjoon Park, Wen Ni Chew

机构 * LeRobot

专题命中 其他安全 :safety(abstract)

AI总结 Nori Bot 通过600mm Z轴提升、Raspberry Pi 4与OpenClaw协同控制以及软件安全栈解决移动机械臂的三大限制,成本仅为同类商业平台的3%。

Comments 7 pages, 3 figures, 2 tables. Columbia University Deep Learning Robot Manipulation course project, Spring 2026

详情

展开后加载摘要…

URL PDF HTML 收藏