arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9311 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9311 篇

2608.03866 2026-08-05 cs.AI cs.SY eess.SY 新提交 79%

ADMITBench: A Safety-Governed Reference Framework for Evaluating the Admissibility of Industrial LLM Advisories

ADMITBench:用于评估工业LLM咨询建议可采纳性的安全管控参考框架

Yash Misra, Javal Vyas, Siddharth Gutta, Mehmet Mercangöz

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本研究提出ADMITBench框架,用于评估工业LLM咨询建议的可采纳性,该框架采用带版本的安全管控评估契约,0.1.0版本为公开参考实现,面向技术与研究评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03028 2026-08-05 cs.AI 新提交 79%

Evaluating Counterfactual Sensitivity to Patient Information in Medication-Safety Reasoning

评估药物安全推理中对患者信息的反事实敏感性

Zhitian Hou, Yuhang Liu, Pengkai Wang, Zeyu Liu, Guanghao Zhu, Zheng Liu, Shuo Cai, Congkai Xie, Zhijie Sang, Kun Zeng, Hongxia Yang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本研究推出MedPIC-Bench基准,评估不同LLM在药物安全推理中对患者信息的反事实敏感性,发现所有模型在反事实问题上表现更差,医学专用LLM的反事实表现落后于通用LLM,凸显静态准确性的评估局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01586 2026-08-05 cs.CV cs.AI cs.RO 版本更新 79%

VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment

VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架

Guoyang Xia, Fengfa Li, Hongjin Ji, Lei Ren, Fangxiang Feng, Kun Zhan, Yan Xie

机构 * Li Auto Inc.(理想汽车) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23690 2026-08-05 cs.CV cs.CL 版本更新 79%

HomeSafeBench: Benchmarking Embodied Vision-Language Models in Free-Exploration Home Safety Inspection

HomeSafeBench:面向自由探索式家庭安全检查的具身视觉-语言模型基准

Jiashu Yao, Haoyu Wen, Siyuan Gao, Yuhang Guo, Zeming Liu, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 研究针对家庭安全隐患检查需求构建HomeSafeBench基准,提出CueBack数据构建方法,微调4B规模VLM使分布外测试集F1值显著提升,缩小了与人类检查员的性能差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01767 2026-08-04 cs.AI 新提交 79%

Leveraging AI for fine-grained food safety risk forecasting in sparse data conditions

利用人工智能在稀疏数据条件下进行细粒度食品安全风险预测

Dongqi Wang, Weiwei Chen, Han Zhou, Weihua Zhou

机构 * Zhejiang University(浙江大学) Rutgers University(罗格斯大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 该研究提出基于Transformer的框架,整合多类数据与Wilson区间预训练,在稀疏数据下细粒度预测城市食品安全风险,实验及浙江实地测试显示其性能优于基线,可提升检测率与检查资源分配效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00679 2026-08-04 cs.AI cs.MA 新提交 79%

HetGPS: Scalable Graph Multi-Agent Reinforcement Learning with Physics-Anchored Adaptive Safety for EV Charging

HetGPS:面向电动汽车充电的、带物理锚定自适应安全机制的可扩展图多智能体强化学习

Xiangwei Wang, Nanduni Nimalsiri, Yu Xia, Peng Wang, Saman Halgamuge

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 该研究提出HetGPS混合图控制框架,结合学习图风险与物理锚定校正,实现可扩展的电动汽车充电多智能体协调,降低电压违规率并提升离网成功率,模型规模与车队无关且可跨系统零样本迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28067 2026-08-04 cs.LG 版本更新 79%

From Vessel Trajectories to Safety-Critical Encounter Scenarios: A Generative AI Framework for Autonomous Ship Digital Testing

从船舶轨迹到安全关键性遭遇场景:一种生成式AI框架用于自主船舶数字测试

Sijin Sun, Liangbin Zhao, Xiuju Fu

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出一种数据驱动框架,将大规模AIS轨迹转化为结构化安全关键性遭遇场景,结合生成轨迹建模与自动化遭遇配对,提升场景生成的可扩展性与真实性。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00500 2026-08-04 cs.AI cs.SE 版本更新 79%

ProbGuard: Proactive Runtime Monitoring for LLM Agent Safety via Probabilistic Prediction

ProbGuard:基于概率的运行时监控用于LLM代理安全

Haoyu Wang, Christopher M. Poskitt, Jiali Wei, Jun Sun

机构 * Singapore Management University(新加坡管理大学) Xi'an Jiaotong University(西安交通大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 ProbGuard通过概率风险预测主动监控LLM代理安全,利用离散时间马尔可夫链建模行为动态,提前预警潜在危险,提升安全性和任务完成率。

Comments Accepted by the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14191 2026-08-04 cs.CR cs.CL 79%

S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models

Xiaohan Yuan, Jinfeng Li, Dongxia Wang, Yuefeng Chen, Xiaofeng Mao, Longtao Huang, Jialuo Chen, Hui Xue, Xiaoxia Liu, Wenhai Wang, Kui Ren, Jingyi Wang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

Comments Accepted by ISSTA 2025

Journal ref Proceedings of the ACM on Software Engineering, Vol. 2, ISSTA, pp. 2136-2157, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28006 2026-07-31 cs.AI 新提交 79%

MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware

MMLDSum-LLM:结合视觉对齐与关键词感知的多模态长文档摘要方法

Xianpeng Zhang, Jiahua Yang, Dongyu Chen, Lei zhang, Jian Ma, Xu guohuan, Haonan Lu, Tianhuang Su, Chuangchuang Wang, Kai Tang

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 针对多模态长文档摘要的关键信息遗漏与跨模态幻觉问题,提出结合视觉对齐与关键词感知的两阶段训练框架MMLDSum-LLM,在自研基准MMLDSum-Bench上验证了其性能优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27849 2026-07-31 eess.SY cs.LG cs.SY 新提交 79%

Safety-Gated Agentic Supervisory Control on a Coupled Distillation Benchmark: Regime Map, Auditable Gate, and Co-Design Findings

耦合精馏基准上的安全门控智能体监督控制:工况图、可审计门与协同设计发现

Christian Rosenthal

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 该研究针对耦合精馏基准,提出基于规则的分叉孪生反事实安全门控机制,结合DeepSeek-V4-Flash等模型,在目标获取、扰动抑制等任务上优于基准方法,可有效遏制有害操作。

Comments 31 pages, 8 figures. Code and data: https://github.com/cgncro-cyber/IndustrialAI. Sole author; independent research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27066 2026-07-30 cs.CV cs.AI 新提交 79%

SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence

SciFigAlign:通过微调视觉内容与稿件证据的对齐来对科学图表进行评分

Chuanzhi Xu, Zihan Deng, Huiqi Liang, Chengkun Yue, Zhanlin Cui, Pengfei Ye, Weidong Cai

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文构建了含3857张科学图表的标注数据集,提出基于稿件证据的多模态评分器SciFigAlign,其在测试集上的MAE为0.3524,相对最佳LLM基准降低59%误差,证实需视觉与稿件证据的学习对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22926 2026-07-28 cs.AI cs.CR 新提交 79%

SAGE: Safety-First Defense-in-Depth Guardrails for Verified Lifecycle Control of High-Impact Generative AI

SAGE:用于高影响力生成式人工智能验证生命周期控制的安全至上深度防御护栏

Mahdi Eslamimehr

机构 * Quandary Peak Research(Quandary Peak研究公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究高影响力生成式人工智能的生命周期控制问题,提出SAGE安全至上、授权分离架构,结合多种技术手段。通过形式化结果和实验验证,确立安全优先级等,给出有害合规估计,还介绍了预先注册的扩展测试方法。

Comments 25 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22692 2026-07-28 cs.AI 新提交 79%

Risk Governance for Generative AI Mental Health Support: A Multi-Turn Safety Architecture

生成式人工智能心理健康支持的风险治理:一种多轮安全架构

Anabela C. Areias, Catarina Botelho, António Farinhas, Areti Vassilopoulos, Dora Janela, Xin Tong, Nuno M. Guerreiro, Maya D'Eon, Fabíola Costa, Ricardo Rei

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型用于心理健康支持时缺乏风险治理机制的问题,开发了一种多轮安全架构,结合多种方法用于心理健康交互,经测试在多方面表现良好,能改善模型管理风险方式,提供安全部署框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22671 2026-07-28 cs.AI 新提交 79%

AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models

AIR-BENCH Live:基础模型不断演进的安全基准测试

Rohan Naphade, Minzhou Pan, Bo Li

机构 * Virtue AI(美德人工智能公司) Carnegie Mellon University(卡内基梅隆大学) Northeastern University(东北大学) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究针对基础模型安全基准测试随模型和法规发展而不足的问题,提出AIR-BENCH Live,通过自动化更新管道和多智能体算法更新提示,扩展了基准测试风险数量,评估模型发现安全范围广等结果,使其能随领域发展。

Comments 11 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22319 2026-07-27 cs.DB cs.AI 新提交 79%

Towards Trustworthy and Cost-Efficient Data Integration: From Naïve RAG to Agentic RAG

迈向可信且经济高效的数据集成:从朴素检索增强生成到智能体检索增强生成

Chuangtao Ma, Arijit Khan

机构 * Aalborg University, Denmark(丹麦奥胡斯大学) Bowling Green State University, USA(美国布恩威尔州立大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 探讨大语言模型和人工智能智能体在企业数据集成中面临的挑战,介绍从经典RAG到智能体RAG的演变,研究经济高效集成的优化策略,为构建可靠、可解释和可扩展的数据集成系统指明方向。

Comments To Appear in the IEEE Data Engineering Bulletin

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22305 2026-07-27 cs.AI 新提交 79%

A Roadmap to Impactful Pluralistic Alignment Research

有影响力的多元对齐研究路线图

Elinor Poole-Dayan, Jillian Fisher, Atoosa Kasirzadeh, Jacob Andreas, Mitchell Gordon, Michiel A. Bakker

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 研究多元价值对齐在实际AI系统中未产生影响的问题,指出原因包括理由多为规范或推测、未明确理想多元行为及现有方法与指标不足。提出未来研究应转向实证基础、明确行为目标并建立实用方法与评估,以推动该领域发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02844 2026-07-27 cs.RO cs.LG 79%

VLM as Strategist: Adaptive Generation of Safety-critical Testing Scenarios via Guided Diffusion

VLM作为策略家:通过引导扩散实现安全关键测试场景的自适应生成

Xinzheng Wu, Junyi Chen, Naiting Zhong, Yong Shen

机构 * School of Automotive Studies, Tongji University(同济大学汽车研究学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出一种结合VLM和引导扩散模型的框架,用于高效生成安全关键测试场景,提升自动驾驶系统的测试效率和安全性。

Comments 25 pages, 9 figures

Journal ref Accident Analysis & Prevention Volume 236, October 2026, 108680

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19738 2026-07-27 cs.AI cs.LO cs.PL 版本更新 79%

Integrating Reasoning Systems for Trustworthy AI, Proceedings of the 4th Workshop on Logic and Practice of Programming (LPOP)

用于可信人工智能的推理系统集成,第4届编程逻辑与实践研讨会(LPOP)会议录

Anil Nerode, Yanhong A. Liu

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 第4届编程逻辑与实践研讨会聚焦于可信人工智能的推理系统集成,将与第40届国际逻辑编程会议联合于2024年10月13日在美国达拉斯以混合形式举行,重点是集成不同编程模型与规则和约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20121 2026-07-24 cs.CL 版本更新 79%

OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills

开放技能风险:使用现实世界中的危险第三方技能时对智能体安全性进行基准测试

Qiyuan Liu, Tingfeng Hui, Kun Zhan, Kaike Zhang, Ning Miao

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 研究基于语言模型的智能体使用第三方危险技能时的安全问题,构建OpenSkillRisk基准测试,涵盖多种不安全场景并能细粒度分析。实验发现当前系统处理危险技能能力不足,揭示三种失败模式,强调需改进语言模型风险推理和智能体框架执行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19366 2026-07-23 cs.AI 新提交 79%

Geometry-Guided Constraint Learning for LLM Safety Classification

用于大语言模型安全分类的几何引导约束学习

Fumiaki Uehara, Koo Imai, Masato Tsutsumi, Keigo Kansa, Sora Usui, Yuki Kobiyama

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究大语言模型安全分类,利用稀疏自动编码器特征提取解决安全多面体中约束数量调整问题,在Qwen3.5 - 9B上对部分类别K = 2最优,准确率达96 - 99%,基于几何观点引入锥约束并经三阶段训练稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19356 2026-07-23 cs.AI 新提交 79%

NEXUS: Structured Runtime Safety for Tool-Using LLM Agents

NEXUS:工具使用型大语言模型智能体的结构化运行时安全

Elias Hossain, Md Mehedi Hasan Nipu, Tasfia Nuzhat Ornee, Rajib Rana, Niloofar Yousefi

机构 * University of Central Florida(中佛罗里达大学) North South University(南北大学) University of Southern Queensland(南昆士兰大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究工具使用型大语言模型智能体运行时安全问题,提出NEXUS结构化计划安全监控器,结合多种方法进行分级升级。在多个基准测试中表现出色,如合成基准测试F1分数达0.949等,还具有低延迟、低开销特点,相关成果已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02694 2026-07-23 cs.CV cs.AI 版本更新 79%

DocShield: Towards AI Document Safety via Evidence-Grounded Agentic Reasoning

DocShield:通过证据导向的智能代理推理实现AI文档安全

Fanwei Zeng, Changtao Miao, Jing Huang, Zhiya Tan, Shutao Gong, Xiaoming Yu, Yang Wang, Weibin Yao, Joey Tianyi Zhou, Jianshu Li, Ying Yan

机构 * Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局(A*STAR)计算与先进机器人中心及高性能计算研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出DocShield框架,通过视觉-逻辑联合推理解决文档伪造检测问题,采用CCT机制和多任务奖励优化,提升检测准确性和解释性,实验显示其在多个基准测试中表现优异。

Comments 10 pages, 4 figures, 5 tables. Preprint. arXiv admin note: text overlap with arXiv:2512.21482

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18665 2026-07-22 cs.AI 新提交 79%

SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

SciHazard:一种通过分解危害评分来衡量科学安全风险的基准

Chunxiao Li, Yuan Xiong, Lijun Li, Tianyi Du, Wenlong Zhang, Lei Bai, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究针对大型语言模型可能传播有害科学知识的问题,引入SciHazard基准及评估框架,含多学科问题。开发分解评估程序计算DeHarm-Score,经专家验证和模型测试,显示该方法能有效衡量风险,还发现深度研究代理存在安全盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18548 2026-07-22 cs.AI cs.MA cs.SY eess.SY 新提交 79%

Engineering Trustworthy Agentic AI for Critical Systems

为关键系统设计可靠的智能体人工智能

Omar Al-Refai, Ibrahim Shahbaz, Adam Ali Husseinat, Michael Mandulak, Jaewon Kim, Eman Hammad

机构 * Texas A&M University(德克萨斯A&M大学) Innovations in Systems Trust and Resilience (iSTAR) Laboratory(系统信任与弹性创新(iSTAR)实验室) Texas A&M Institute of Data Science - Security, Privacy and Resilience for Trusted AI (SPARTA) Thematic Lab.(德克萨斯A&M大学数据科学研究所 - 可信人工智能的安全、隐私与弹性(SPARTA)主题实验室) Texas A&M Global Cyber Research Institute (GCRI)(德克萨斯A&M大学全球网络研究所)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 研究针对关键工程领域智能体人工智能,将可靠性作为首要工程属性,采用围绕五个维度的可靠性模型及保证工作流程,综述相关架构、机制等,经多领域检验,指出其可靠性是单一问题并勾勒跨域保证框架路径。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16156 2026-07-20 cs.LG cs.SY eess.SY 新提交 79%

PRISA: Proactive Infrastructure LiDAR Framework for Intersection Safety Assessment

PRISA:用于交叉路口安全评估的主动式基础设施激光雷达框架

Tam Bang, Hussam Abubakr, Emiliano de la Garza Villarreal, Truc Phuong Nguyen, Austin Harris, Toru Hirano, Mina Sartipi, Yunfei Xu, Hoang H. Nguyen

机构 * University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 研究针对城市交叉路口危险问题,提出PRISA框架,利用隐私保护、低光鲁棒的路边传感器,通过自动整理训练数据训练轨迹预测模型,进行连续运动预测和双重替代安全评估,经实验验证其在交叉路口安全监测方面具有实际可行性。

Comments Accepted for publication at the 2026 IEEE 29th International Conference on Intelligent Transportation Systems (ITSC 2026). 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15550 2026-07-20 cs.AI 新提交 79%

SeerGuard: A Safety Framework for Mobile GUI Agents via World Model Prediction

SeerGuard:一种通过世界模型预测实现的移动 GUI 代理安全框架

Xue Yu, Bo Yuan, Pengshuai Yang, Kailin Zhao, Hong Hu, Junlan Feng

机构 * JIUTIAN Research(九天研究)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究针对移动 GUI 代理安全风险问题,提出 SeerGuard 框架,通过执行前指令级筛选和行动级风险评估减轻风险。构建安全增强世界模型,经实验验证其在不同代理上有效泛化,提升了安全效用分数并降低风险成本分数。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15241 2026-07-17 cs.CL cs.CV 新提交 79%

Beyond the Leaderboard: Design Lessons for Trustworthy Multimodal VQA

超越排行榜:可信多模态视觉问答的设计经验教训

Sushant Gautam, Vajira Thambawita, Michael A. Riegler, Pål Halvorsen, Steven A. Hicks

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CL

AI总结 以MediaEval Medico 2025为案例,分析九个多模态问答系统,发现预训练主干的参数高效适应虽有挑战性能,但答案提升未转化为完整临床推理,结构化推理等方法更可靠,结果促使多方面改进,支持可信多模态医疗保健人工智能。

Comments Accepted for presentation at the 39th IEEE International Symposium on Computer-Based Medical Systems (IEEE CBMS 2026) as a regular paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14543 2026-07-17 cs.RO cs.AI 新提交 79%

SafeRelBench: A Spatial-Relation-Aware Benchmark for Process-Level Safety in VLM-Driven Embodied Agents

SafeRelBench:用于VLM驱动的具身智能体过程级安全的空间关系感知基准测试

Huaigang Yang, Ya Li, Min Ren, Bo Dai, Zhenliang Zhang, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究VLM驱动具身智能体的过程级安全问题,引入SAFERELBENCH基准测试,含507个样本。评估七个智能体发现任务成功与安全合规有差距,该基准明确测试行动前安全条件,凸显空间关系在安全评估中的核心地位。

Comments Preprint. 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14103 2026-07-17 cs.CL cs.MA 新提交 79%

Latent Communication Between Language Model Agents: Channels, Alignment, and the Limits of Text

语言模型智能体之间的潜在通信:通道、对齐方式及文本的局限性

Markus Wenzel

机构 * Constructor University(康斯坦丁大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 研究大语言模型智能体间潜在通信,构建三个通信通道,通过稀疏自编码器分析信息损失,经实验发现文本通信会丢失信息,潜在通道在跨语言概念任务上与文本通道匹配但未超,得出丢失特征多编码表面形式的结论,还指出明确潜在通信优势需更深入任务及分析框架。

详情

展开后加载摘要…

URL PDF HTML 收藏