arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3278 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3278 篇

2605.05402 2026-05-08 cs.AI cs.CV eess.IV 57%

Intelligent CCTV for Urban Design: AI-Based Analysis of Soft Infrastructure at Intersections

智能监控摄像头用于城市设计:基于AI的交叉口软基础设施分析

Vinit Katariya, Seungjin Kim, Curtis Craig, Nichole Morris, Hamed Tabkhi

机构 * University of Wyoming(怀俄明大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of Minnesota(明尼苏达大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出基于AI的分析框架,利用现有监控摄像头评估软干预措施对车速和安全的影响,通过深度学习和视角基速度估计,发现软基础设施能有效降低车速,为交通政策评估提供低成本证据。

Comments 16 pages, 6 figures, 7 tables, Submitted/Under Review at the International Journal of Transportation Research (Submitted on 12 Jan 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27118 2026-05-01 cs.RO cs.AI 57%

PALCAS: A Priority-Aware Intelligent Lane Change Advisory System for Autonomous Vehicles using Federated Reinforcement Learning

PALCAS:基于联邦强化学习的优先级感知智能变道建议系统用于自动驾驶车辆

Yassine Ibork, Nhat Ha Nguyen, Myounggyu Won, Lokesh Das

机构 * School of Computing, Wichita State University(维斯科大学计算学院) Department of Computer Science, University of Memphis(孟菲斯大学计算机科学系)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出基于多智能体联邦强化学习的优先级感知智能变道建议系统PALCAS,用于自动驾驶车辆,通过引入新的优先级感知安全变道奖励函数,提升变道决策的合理性和交通效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26561 2026-04-30 cs.MA cs.AI 57%

Preserving Disagreement: Architectural Heterogeneity and Coherence Validation in Multi-Agent Policy Simulation

保持分歧:多智能体政策模拟中的架构异质性与一致性验证

Ariel Sela

机构 * Ariel Sela

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出AI委员会框架,通过120次模拟测试两种干预措施,发现架构异质性可减少一致性,但一致性验证在不同场景下产生分歧-多样性权衡。

Comments 14 pages, 7 tables, 120 deliberations across 2 policy scenarios

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02854 2026-04-30 cs.RO cs.AI 57%

CoFL: Continuous Flow Fields for Language-Conditioned Navigation

CoFL:基于连续流场的语言条件导航

Haokun Liu, Zhaoqi Ma, Yicheng Chen, Masaki Kitagawa, Wentao Zhang, Zicen Xiong, Jinjie Li, Moju Zhao

机构 * Matterport3D ScanNet

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 CoFL通过端到端策略将鸟瞰图观测与语言指令映射为连续流场,实现工作空间条件下的场学习,提升导航精度与安全性,支持实时推理和闭环控制。

Comments 18 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25796 2026-04-29 cs.AI 57%

StratFormer: Adaptive Opponent Modeling and Exploitation in Imperfect-Information Games

StratFormer:不完全信息游戏中的自适应对手建模与利用

Andy Caen, Mark H. M. Winands, Dennis J. N. J. Soemers

机构 * Department of Advanced Computing Sciences, Maastricht University(马斯特里赫特大学高级计算科学系)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 StratFormer通过双阶段课程学习,结合双轮标记和桶率特征,实现了对不完全信息游戏对手的建模与利用,其在Leduc Hold'em上表现出色,平均收益超过GTO。

Comments Accepted at Computers and Games 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25444 2026-04-29 cs.CL 57%

One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement

一个refiner解锁所有:通过强化查询细化实现推理时间推理 elicitation

Yixiao Zhou, Dongzhou Cheng, zhiliang wu, Yi Yang, Yu Cheng, Hehe Fan

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本文提出ReQueR框架,通过强化学习训练专门的Refiner策略,将推理 elicitation作为推理时间对齐任务,实现对多种模型的推理能力解锁,提升性能2.1%。

Comments Accepted to ACL26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25154 2026-04-29 cs.LG cs.DB 57%

Prior-Aligned Data Cleaning for Tabular Foundation Models

对表格基础模型的先验对齐数据清洗

Laure Berti-Equille

机构 * IRD(法国国家科研 institutes)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出L2C2框架,通过强化学习实现表格数据清洗的先验对齐,实验表明该方法在提升TabPFN准确率和跨数据集迁移能力方面表现优异。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24572 2026-04-28 cs.AI cs.MA 57%

FastOMOP: A Foundational Architecture for Reliable Agentic Real-World Evidence Generation on OMOP CDM data

FastOMOP:一种用于OMOP CDM数据上可靠代理现实世界证据生成的基础架构

Niko Moeller-Grell, Shihao Shenzhang, Zhangshu Joshua Jiang, Richard JB Dobson, Vishnu V Chandrabalan

机构 * Lancashire Teaching Hospitals NHS Foundation Trust(兰开夏教学医院国家健康服务信托基金会) Lancaster University(兰卡斯特大学) EPSRC DRIVE-Health, Department of Biostatistics & Health Informatics(EPSRC DRIVE-Health,生物统计学与健康信息学部门) King’s College London(伦敦国王学院) Institute for Health Informatics(健康信息学研究所) University College London(伦敦大学学院) NIHR Biomedical Research Centre(英国国家健康服务研究院生物医学研究中心) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院国家健康服务信托基金会) Health Data Research UK London(英国健康数据研究伦敦) South London and Maudsley NHS Foundation Trust and King’s College London(伦敦南部及莫德利国家健康服务信托基金会和伦敦国王学院) Department of Biostatistics & Health Informatics, Institute of Psychiatry, Psychology & Neuroscience(生物统计学与健康信息学部门,精神病学、心理学与神经科学研究所)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出FastOMOP架构,通过分离治理、可观测性和编排三层,解决代理系统在现实世界证据生成中的安全性和可靠性问题,验证结果显示其在不同数据集上均能保持高可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24114 2026-04-28 cs.CL 57%

IRIS: Interleaved Reinforcement with Incremental Staged Curriculum for Cross-Lingual Mathematical Reasoning

IRIS:交错强化与增量阶段课程用于跨语言数学推理

Navya Gupta, Rishitej Reddy Vyalla, Avinash Anand, Chhavi Kirtani, Erik Cambria, Zhengchen Zhang, Zhengkui Wang, Timothy Liu, Aik Beng Ng, Simon See, Rajiv Ratn Shah

机构 * Singapore Institute of Technology(新加坡理工学院) IIIT Delhi(德里印度理工学院) University of California, San Diego(加州大学圣地亚哥分校) Nanyang Technological University(南洋理工大学) NVIDIA

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 IRIS通过结合逐步增加难度的监督微调与逆课程强化学习,提升多语言数学推理能力,尤其在低资源和双语环境下表现突出。

Comments Accepted in ACL main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23970 2026-04-28 cs.AI cs.CV cs.HC cs.MA 57%

LLM-Guided Agentic Floor Plan Parsing for Accessible Indoor Navigation of Blind and Low-Vision People

基于大语言模型的代理楼层计划解析用于视障和低视力人士的无障碍室内导航

Aydin Ayanzadeh, Tim Oates

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出一种基于代理的框架,将单张楼层平面图转换为结构化的知识库,生成安全的无障碍导航指令。系统通过多代理模块生成空间知识图谱,并通过路径规划器生成导航指令,实验结果显示在真实场景和基准数据集上均优于单次调用基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05983 2026-04-28 cs.PL cs.CL 57%

Arch: An AI-Native Hardware Description Language for Register-Transfer Clocked Hardware Design

Arch:一种面向AI的硬件描述语言用于寄存器传输时钟硬件设计

Shuqing Zhao

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 Arch是一种面向AI的硬件描述语言,用于微架构规格和AI辅助代码生成,通过参数化时钟和复位类型,提供类型安全的硬件描述方法,支持多种硬件结构,提升设计可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23049 2026-04-28 cs.AI 57%

A Decoupled Human-in-the-Loop System for Controlled Autonomy in Agentic Workflows

解耦的人机协同系统用于代理工作流中的受控自主性

Edward Cheng, Jeshua Cheng

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出解耦的人机协同系统架构,通过显式接口和结构化执行模型分离人类交互管理与应用流程,提供四维框架实现上下文感知的人类参与,支持代理通信协议层面的HITL实现,为工作流的可扩展治理和渐进自主性奠定基础。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25111 2026-04-28 cs.LG cs.PL cs.SE 57%

SEVerA: Verified Synthesis of Self-Evolving Agents

SEVerA: 验证合成自进化代理

Debangshu Banerjee, Changming Xu, Eugene Ie, Ming Zhang, Daiyi Peng, Chu-Cheng Lin, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google(谷歌)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 SEVerA通过引入形式化guarded生成模型,结合搜索、验证和学习三阶段框架,在程序验证、符号数学合成等任务中实现零约束违规,提升自进化代理的正确性和性能。

Comments First Formally Verified Self-Evolving LLM Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20332 2026-04-28 cs.AI 57%

Mobile-R1: Towards Interactive Capability for VLM-Based Mobile Agent via Systematic Training

Mobile-R1: 通过系统性训练提升基于视觉语言模型的移动代理的交互能力

Jihao Gu, Qihang Ai, Yingyao Wang, Pi Bu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Ziming Wang, Yingxiu Zhao, Ming-Liang Zhang, Jun Song, Yuning Jiang, Bo Zheng

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出Mobile-R1系统性训练方法,通过分层课程学习提升移动代理的探索与自我纠正能力,并构建中文移动数据集和基准测试。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20911 2026-04-24 cs.CR cs.AI 57%

Omission Constraints Decay While Commission Constraints Persist in Long-Context LLM Agents

在长上下文LLM代理中,遗漏约束衰减而执行约束持续存在

Yeran Gamage

机构 * University of South Florida(佛罗里达州立大学) Independent AI Security Researcher(独立人工智能安全研究员)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究发现,在长上下文LLM代理中,遗漏约束随上下文压力衰减,而执行约束持续存在,这种不对称性称为安全回忆分歧(SRD)。

Comments 19 pages, 5 figures. Includes evaluation framework for replication and 4,416-trial dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19734 2026-04-22 cs.RO cs.AI 57%

UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling

UniT:迈向人类到人形机器人政策学习和世界建模的统一物理语言

Boyu Chen, Yi Chen, Lu Qiu, Jerry Bai, Yuying Ge, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 UniT通过三分支交叉重建机制建立统一物理语言,实现人类到人形机器人的跨身体迁移,提升政策学习和世界建模的效率与鲁棒性。

Comments Project page: https://xpeng-robotics.github.io/unit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16654 2026-04-22 cs.CL 57%

IYKYK (But AI Doesn't): Automated Content Moderation Does Not Capture Communities' Heterogeneous Attitudes Towards Reclaimed Language

IYKYK (但AI不): 自动内容审查未能捕捉社区对重新获得语言的异质态度

Christina Chance, Rebecca Pattichis, Arjun Subramonian, James He, Shruti Narayanan, Saadia Gabriel, Kai-Wei Chang

机构 * University of California Los Angeles(加州大学洛杉矶分校) Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 研究通过定量和定性方法分析LGBTQIA+、黑人和女性社区对重新获得污辱词的态度,发现注释者之间一致性低,且自动审查工具与人工判断不一致,揭示了重新获得污辱词的主观性和语境依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19087 2026-04-22 cs.AI 57%

OLLM: Options-based Large Language Models

OLLM:基于选项的大型语言模型

Shashank Sharma, Janina Hoffmann, Vinay Namboodiri

机构 * Department of Computer Science(计算机科学系) University of Bath(巴斯大学) Department of Psychology(心理学系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 OLLM通过引入学习选项提升语言模型的生成可控性与鲁棒性,利用低维选项空间实现更高效的奖励优化,减少常见对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14387 2026-04-22 cs.AI 57%

SEAT: Sparse Entity-Aware Tuning for Knowledge Adaptation while Preserving Epistemic Abstention

SEAT:稀疏实体感知调谐以实现知识适应同时保持认知回避

William F. Shen, Xinchi Qiu, Nicola Cancedda, Nicholas D. Lane

机构 * University of Cambridge(剑桥大学) Meta

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 SEAT通过稀疏调谐和实体扰动KL正则化,在保持认知回避能力的同时提升知识获取,无需对齐数据或后续重对齐,有效提升未知查询的人工评估回避率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11290 2026-04-21 cs.CL 57%

SafeConstellations: Mitigating Over-Refusals in LLMs Through Task-Aware Representation Steering

SafeConstellations: 通过任务感知的表示引导缓解大语言模型的过度拒绝行为

Utsav Maskey, Sumit Yadav, Mark Dras, Usman Naseem

机构 * Macquarie University(麦考瑞大学) IOE, Pulchowk Campus(IOE普楚克校区)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出SafeConstellations方法,通过任务感知的表示引导在推理时调整表示轨迹,减少大语言模型在处理良性指令时的过度拒绝现象,同时保持模型实用性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17701 2026-04-21 cs.IT cs.AI math.IT 57%

WISV: Wireless-Informed Semantic Verification for Distributed Speculative Decoding in Device-Edge LLM Inference

WISV:无线感知语义验证用于设备-边缘分布式推测解码

Zixuan Liu, Zhiyong Chen, Nan Xue, Shengkang Chen, Jiangchao Yao, Meixia Tao, Wenjun Zhang

机构 * Cooperative Medianet Innovation Center(联合中位网创新中心) Department of Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子工程系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出WISV框架,通过通道感知语义接受策略优化分布式推测解码,提升接受长度和降低交互轮次,实验证明在设备边缘LLM推理中具有显著性能优势。

Comments submitted to IEEE Trans

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17178 2026-04-21 cs.CL 57%

Cognitive Policy-Driven LLM for Diagnosis and Intervention of Cognitive Distortions in Emotional Support Conversation

认知驱动的LLM用于情绪支持对话中认知扭曲的诊断与干预

Lin Zhong, Renjin Zhu, Shujuan Ma, Jinhao Cui, Lingzhi Wang, Hao Chen, Qing Liao

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) City University of Macau, Macao SAR, China(澳门城市大学) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出CogBiasESC数据集和CoPoLLM框架,用于提升LLM在情绪支持对话中识别和干预认知扭曲的能力,实验显示其在诊断准确性和安全性方面优于现有方法。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17132 2026-04-21 cs.CL 57%

Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding

请拒绝回答我!通过自适应对比解码缓解大语言模型中的过度拒绝问题

Yupeng Qi, Ziyu Lyu, Lixin Cui, Lu Bai, Feng Xia

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学信息科学与技术学院深圳校区) School of Information, Central University of Finance and Economics(中央财经大学信息学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 本文提出自适应对比解码方法,通过对比安全提示下的输出分布,缓解大语言模型的过度拒绝问题,同时保持对恶意查询的高拒绝率。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16469 2026-04-21 cs.DC cs.AI 57%

B-PASTE: Beam-Aware Pattern-Guided Speculative Execution for Resource-Constrained LLM Agents

B-PASTE:面向资源受限LLM代理的束感知模式引导推测执行

Yanfei Song

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 B-PASTE通过束感知技术,在资源受限条件下实现局部分支假设的推测执行,优先执行快路径并利用安全并行,提升端到端效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01728 2026-04-17 cs.RO cs.LG cs.LO 57%

Constrained Decoding for Safe Robot Navigation Foundation Models

安全机器人导航基础模型的约束解码

Parv Kapoor, Akila Ganlath, Michael Clifford, Changliu Liu, Sebastian Scherer, Eunsuk Kang

机构 * Carnegie Mellon University(卡内基梅隆大学) Toyota InfoTech Labs(丰田信息科技实验室)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出SafeDec框架,通过约束解码确保机器人导航基础模型满足信号时间逻辑规范,提升安全性和行动生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14512 2026-04-17 cs.CR cs.AI cs.FL cs.LO 57%

CBCL: Safe Self-Extending Agent Communication

CBCL:安全的自扩展代理通信

Hugo O'Connor

机构 * Anuna Research(Anuna研究)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 CBCL通过约束消息和扩展到确定性上下文无关语言,确保代理通信的安全性和可扩展性,采用形式化方法验证其安全性。

Comments 10 pages. Accepted at IEEE LangSec Workshop 2026 (camera-ready). Reference implementation, Lean 4 formalization, and verified parser: https://codeberg.org/anuna/cbcl-rs ; Nostr transport binding: https://codeberg.org/anuna/cbcl-nostr

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14316 2026-04-17 cs.AI 57%

Seeing Through Experts Eyes A Foundational Vision Language Model Trained on Radiologists Gaze and Reasoning

通过专家之眼:一个基于放射学家目光和推理训练的基础视觉语言模型

Kinhei Lee, Peiyuan Jing, Zhenxuan Zhang, Yue Yang, Tao Wang, Dominic C Marshall, Yingying Fang, Guang Yang

机构 * Bioengineering Department and Imperial-X(生物工程系和Imperial-X) Imperial College London(帝国理工学院伦敦分校) College of physics and information engineering, Fuzhou University(福州大学物理与信息工程学院) Department of Surgery and Cancer, Imperial College London(外科与癌症部门,帝国理工学院伦敦分校) National Heart and Lung Institute, Imperial College London(国家心脏和肺研究所,帝国理工学院伦敦分校) Cardiovascular Research Centre, Royal Brompton Hospital(心血管研究中心,皇家布里顿医院) School of Biomedical Engineering & Imaging Sciences, King’s College London(生物医学工程与成像科学学院,国王学院伦敦分校)

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出GazeX模型,通过放射学家的眼动数据模拟专家推理过程,提升医学影像分析的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03236 2026-04-17 cs.AI 57%

MAGMA: A Multi-Graph based Agentic Memory Architecture for AI Agents

MAGMA:一种基于多图的代理记忆架构用于AI代理

Dongming Jiang, Yi Li, Guanpeng Li, Bingzhe Li

机构 * Department of Computer Science, The University of Texas at Dallas(德克萨斯大学达拉斯分校计算机科学系) Department of Electrical and Computer Engineering, University of Florida(佛罗里达大学电气与计算机工程系)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 MAGMA通过多图结构实现记忆表示,提升长时序推理任务的性能,提供透明推理路径和细粒度检索控制。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13757 2026-04-16 cs.AI cs.HC 57%

Rethinking AI Hardware: A Three-Layer Cognitive Architecture for Autonomous Agents

重新思考人工智能硬件:一种三层认知架构用于自主代理

Li Chen

机构 * LI CHEN(李晨)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Tri-Spirit架构,通过分解智能为规划、推理和执行三层,提升自主系统效率,实验显示任务延迟和能耗降低显著。

Comments A system architecture paper with simulation-based evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12986 2026-04-15 cs.CR cs.AI 57%

Parallax: Why AI Agents That Think Must Never Act

Parallax:为什么具有思考能力的AI代理必须永不行动

Joel Fokou

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Parallax框架,通过认知-执行分离、对抗验证与渐进确定性、信息流控制和可逆执行四大原则,解决具有执行能力的AI代理安全问题,实验显示其在98.9%的攻击中有效阻止。

Comments 20 pages, 1 figure, 5 tables. Open-source reference implementation: https://github.com/openparallax/openparallax. Documentation: https://docs.openparallax.dev. Feedback welcome via email or GitHub issues

详情

展开后加载摘要…

URL PDF HTML 收藏