arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-03 至 2026-07-03 共收录 87 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2607.01239 2026-07-03 cs.CL cs.AI 新提交 91%

Breaking Safety at the Token Boundary: How BPE Tokenization Creates Exploitable Gaps in LLM Alignment

在Token边界打破安全:BPE分词如何在LLM对齐中制造可利用的漏洞

Tung-Ling Li, Hongliang Liu, Yuhao Wu

机构 * Palo Alto Networks

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究发现BPE分词将安全关键词拆分为子词,导致对齐数据集缺乏此类碎片化输入,通过优化碎片化可绕过80-100%的安全拒绝,并定位到模型最后约30%层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02813 2026-07-03 cs.AI cs.CL cs.LG 版本更新 82%

HAL: Inducing Human-likeness in LLMs with Alignment

HAL: 通过对齐引导LLM的人类相似性

Masum Hasan, Junjie Zhao, Ehsan Hoque

机构 * University of Rochester(罗切斯特大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HAL框架,利用可解释的数据驱动奖励信号,通过对比对话数据提取显式会话特征并优化偏好,使模型在对话中更常被视为类人,同时保持整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02220 2026-07-03 cs.CV 新提交 78%

DetailAnywhere: Fashion Detail Generation via Cross-Modal Feature Alignment Distillation

DetailAnywhere: 通过跨模态特征对齐蒸馏实现时尚细节生成

Zijun Li, Yimin Zhou, Jia Sun, Honglie Wang, Pengcheng Wei, Junlong Wu, Yongrui Heng, Jiyuan Wang, Huan Ouyang, Boheng Zhang, Huaiqing Wang, Dewen Fan, Qianqian Gan, Fan Yang, Tingting Gao

机构 * Kuaishou Technology(快手科技) AIM for Health Lab, Monash University(Monash大学AIM健康实验室)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 针对在线购物中用户关注服装细节(如领口、袖口、面料纹理)的需求,提出新任务“时尚细节生成”及基准FDBench,并设计跨模态特征对齐蒸馏(CFAD)方法,结合多模态扩散Transformer和一致性奖励模型,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02327 2026-07-03 cs.CL 版本更新 70%

LearNAT: Learning NL2SQL with AST-guided Task Decomposition for Large Language Models

LearNAT: 基于AST引导任务分解的NL2SQL大语言模型学习

Weibin Liao, Xin Gao, Tianyu Jia, Rihong Qiu, Yifan Zhu, Yang Lin, Xinyu Ma, Junfeng Zhao, Yasha Wang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Big Data Technology Research Center, Nanhu Laboratory(纳米实验室大数据技术研究中心) National Engineering Research Center For Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海)) School of Computer Sciences, Beijing University of Posts and Telecommunications(北京邮电大学计算机科学系) Huawei Technologies Co., Ltd(华为技术有限公司) Seed, ByteDance Inc.(字节跳动公司)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 提出LearNAT框架,通过AST引导的分解合成过程和边际感知强化学习,增强小规模LLM的NL2SQL任务分解能力,以7B参数模型达到GPT-4可比性能。

Comments Accepted by ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19775 2026-07-03 cs.AI cs.CL cs.ET cs.MA cs.RO 版本更新 62%

From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents

从行为到理解:LLM代理中时间概念的符合可解释性

Trilok Padhi, Ramneet Kaur, Krishiv Agarwal, Adam D. Cobb, Daniel Elenius, Manoj Acharya, Colin Samplawski, Alexander M. Berenbeim, Nathaniel D. Bastian, Susmit Jha, Ugur Kursuncu, Anirban Roy

机构 * Georgia State University(佐治亚州立大学) Computer Science Lab, SRI(SRI计算机科学实验室) Army Cyber Institute(陆军网络学院) United States Military Academy(美国军事学院) University of Florida(佛罗里达大学)

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过符合视角解释LLM代理时间概念演变的框架,结合逐步奖励建模与符合预测,识别时间概念的潜在方向,实验表明这些概念可线性分离,为LLM代理提供可靠故障检测和干预方法。

Comments Accepted at the Mechanistic Interpretability Workshop, 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01721 2026-07-03 cs.RO 新提交 50%

CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning

CoRe: 结合视觉语言模型反馈的复合奖励用于偏好对齐强化学习

Hexian Ni, Tao Lu, Yinghao Cai

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出CoRe框架,将奖励分解为基于任务知识的正式奖励和从观察中学习的残差奖励,利用视觉语言模型迭代优化奖励,实现无需人工的偏好对齐,在机器人操作任务中优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 14 篇

2607.02079 2026-07-03 cs.CL cs.CR cs.LG 新提交 87%

HaloGuard 1.0: An Open Weights Constitutional Classifier for Multilingual AI Safety

HaloGuard 1.0:一种用于多语言AI安全的开放权重宪法分类器

Navaneeth Sangameswaran, Preetham S, Ashmiya Lenin

机构 * Astroware AI Karunya Institute of Technology and Sciences(卡鲁尼亚理工学院和科学学院)

专题命中 安全训练 :safety(title,abstract);AI safety(title);分类 cs.CL、cs.LG

AI总结 提出HaloGuard 1.0,一种基于宪法分类器范式的输入安全模型,在英语和多语言提示安全基准上以约十分之一于当前领先模型的参数规模达到最先进性能,通过自然语言宪法驱动合成数据生成、一对一反事实对、两层无害设计及多语言平衡实现。

Comments 30 pages, 7 figures, 20 Tables, Link: https://huggingface.co/collections/astroware/haloguard-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01859 2026-07-03 cs.AI cs.CL 新提交 84%

Safety Targeted Embedding Exploit via Refinement

通过精炼的安全目标嵌入利用

Joshua Adrian Cahyono

机构 * Nanyang Technological University(南洋理工大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出STEER方法,通过梯度引导攻击识别并翻译关键词语到低资源语言,抑制大语言模型拒绝行为,在多个模型上实现高达96.7%的攻击成功率,揭示安全机制在多语言输入下的泛化缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01365 2026-07-03 cs.LG cs.AI cs.CV 新提交 81%

Multi-modal Rail Crossing Safety Analysis

多模态铁路道口安全分析

Paimon Goulart, Chansong Lim, Nícolas Roque dos Santos, Yue Dong, Sheldon Peterson, Jia Chen, Evangelos E. Papalexakis

机构 * University of California, Riverside(加州大学河滨分校) Riverside County Transportation Commission(河滨县交通委员会)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出多模态管道,利用视觉线索和事故报告评估铁路道口安全,基于FRA评分实现高风险/低风险分类(F1=0.757)和分数估计(RMSE=0.078)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02121 2026-07-03 cs.CR cs.AI 新提交 70%

Behind the Refusal: Determining Guardrail Activation via Behavioral Monitoring

拒绝背后:通过行为监控确定护栏激活

William Hackett, Peter Garraghan

机构 * Mindgard Lancaster University(兰卡斯特大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出首个黑盒护栏侦察方法,通过HTTP、词汇和时序信号行为监控检测AI系统中护栏的存在,准确率100%,并能区分护栏拦截与LLM拒绝。

Comments 19 pages, 13 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14228 2026-07-03 cs.SE cs.AI cs.CL cs.LG 版本更新 67%

Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems

深入Claude代码:当今及未来AI代理系统的设计空间

Jiacheng Liu, Xiaohan Zhao, Xinyi Shang, Zhiqiang Shen

机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学VILA实验室) University College London(伦敦大学学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文分析Claude代码架构及其与OpenClaw的对比,揭示驱动设计的五个人类价值观,并探讨未来AI代理系统的六个开放设计方向。

Comments Tech report. Code at: https://github.com/VILA-Lab/Dive-into-Claude-Code

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02396 2026-07-03 cs.AI cs.LG 新提交 62%

Fast Multi-dimensional Refusal Subspaces via RFM-AGOP

通过RFM-AGOP的快速多维拒绝子空间

Thomas Winninger

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出利用RFM-AGOP算法快速提取大型语言模型中的多维拒绝子空间,在推理和非推理模型上均实现秒级识别,且性能优于现有方法。

Comments Accepted to the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02196 2026-07-03 cs.AI cs.LG math.ST stat.ML stat.TH 版本更新 62%

Conformal Policy Control

符合性策略控制

Drew Prinster, Clara Fannjiang, Ji Won Park, Kyunghyun Cho, Anqi Liu, Suchi Saria, Samuel Stanton

机构 * Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于安全参考策略的符合性校准方法,用于在不违反安全约束的前提下,使优化但未测试的策略能够安全地进行探索,并在有限样本下提供理论保证。

Comments International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03497 2026-07-03 cs.RO cs.AI cs.CV 版本更新 57%

Sim2Real-AD: A Modular Sim-to-Real Framework for Deploying VLM-Guided Reinforcement Learning in Real-World Autonomous Driving

Sim2Real-AD:一种模块化的仿真到现实框架,用于在现实世界自动驾驶中部署基于VLM的强化学习

Zilin Huang, Zhengyang Wan, Zihao Sheng, Boyue Wang, Junwei You, Sikai Chen

机构 * Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Google(谷歌)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Sim2Real-AD框架,实现无需真实世界强化学习数据将CARLA训练的VLM引导强化学习策略零样本迁移到全尺寸车辆。框架包含几何观察桥、物理感知动作映射、两阶段渐进训练和实时部署流水线。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18315 2026-07-03 cs.RO cs.AI cs.CV 版本更新 57%

DriveVLM-RL: Neuroscience-Inspired Reinforcement Learning with Vision-Language Models for Safe and Deployable Autonomous Driving

DriveVLM-RL:受神经科学启发的强化学习与视觉语言模型用于安全可部署的自动驾驶

Zilin Huang, Zihao Sheng, Zhengyang Wan, Yansong Qu, Junwei You, Sicong Jiang, Sikai Chen

机构 * Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Lyles School of Civil and Construction Engineering, Purdue University(普渡大学莱尔斯土木与建设工程学院) Department of Civil Engineering, McGill University(麦吉尔大学土木工程系)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出DriveVLM-RL框架,通过双通路架构将VLM集成到RL中,实现安全可部署的自动驾驶,在CARLA中显著优于基线。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15588 2026-07-03 cs.CL 版本更新 57%

YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models

YuFeng-XGuard:一种以推理为中心、可解释且灵活的大语言模型护栏模型

Junyu Lin, Meizhen Liu, Xiufeng Huang, Jinfeng Li, Haiwen Hong, Xiaohan Yuan, Yuefeng Chen, Longtao Huang, Hui Xue, Ranjie Duan, Zhikai Chen, Yuchuan Fu, Defeng Li, Lingyao Gao, Yitong Yang

机构 * Alibaba-AAIG(阿里云-阿里人工智能研究院)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 提出YuFeng-XGuard护栏模型系列,通过结构化风险预测(含风险类别、置信度分数及自然语言解释)实现可解释的多维风险感知,并采用分层推理范式平衡延迟与解释深度,同时引入动态策略机制解耦风险感知与策略执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02294 2026-07-03 cs.SE 新提交 50%

Coding Agents Are Guessing: Measuring Action-Boundary Violations in Underspecified DevOps Instructions

编码代理在猜测:测量欠指定DevOps指令中的动作边界违规

Zimo Ji, Zekai Zhang, Congying Xu, Zongjie Li, Yudong Gao, Shuai Wang, Shing-Chi Cheung

专题命中 安全训练 :safety(abstract)

AI总结 提出UnderSpecBench基准,通过69个任务族和2208个提示变体,评估编码代理在欠指定DevOps指令下的动作边界违规,发现55.8-67.8%的运行至少违反一个边界,表明完成度评估高估了安全自主性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02192 2026-07-03 eess.SY cs.SY 新提交 50%

Reference-Governed Distributed Safe Gradient Flow for Safe Optimal Output Agreement of Multi-Agent Systems

参考调控的分布式安全梯度流用于多智能体系统的安全最优输出一致性

Zhanglin Shangguan, Wei Xiao, Bo Yang, Xinping Guan

专题命中 安全训练 :safety(abstract)

AI总结 提出参考调控双层架构,上层通过一阶控制屏障函数约束梯度流,下层基于内模输出调节器构建动态安全裕度,实现非线性多智能体系统的安全最优输出一致性,避免高阶控制屏障函数的调参敏感和稳态偏移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01204 2026-07-03 cs.CV 版本更新 50%

TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation

TabletopGen: 桌面场景生成与机器人操作的交互式仿真

Ziqian Wang, Yonghao He, Licheng Yang, Wei Zou, Hongxuan Ma, Liu Liu, Wei Sui, Yuxin Guo, Hu Su

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) D-Robotics Horizon Robotics

专题命中 安全训练 :alignment(abstract)

AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。

Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13940 2026-07-03 cs.RO 版本更新 50%

NeHMO: Neural Hamilton-Jacobi Reachability Learning for Decentralized Safe Multi-Arm Motion Planning

NeHMO:用于分散式安全多臂运动规划的神经Hamilton-Jacobi可达性学习

Qingyi Chen, Zachary Kingston, Ahmed H. Qureshi

机构 * Department of Computer Science at Purdue University(普渡大学计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 提出基于神经Hamilton-Jacobi可达性学习的方法,学习安全值函数以捕获最坏情况下的臂间安全约束,并开发分散式轨迹优化框架,实现可扩展、数据高效的多臂运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2607.01277 2026-07-03 cs.CR 新提交 82%

Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety

认知防火墙:一种主动、零信任、多门控的LLM安全框架

Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract)

AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08169 2026-07-03 cs.AI 版本更新 57%

Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence

激活引导用于不牺牲连贯性的对齐开放式生成

Niklas Herbster, Martin Zborowski, Alberto Tosato, Gauthier Gidel, Tommaso Tosato

机构 * Tara Research Technical University of Munich(慕尼黑工业大学) Mila Quebec AI Institute(Mila魁北克人工智能研究所)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本文提出激活引导方法,通过在生成过程中持续修正偏差激活,提升大模型的对齐性能,实验表明StTP和StMP在保持连贯性的同时更有效维护通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01356 2026-07-03 cs.CR cs.SY eess.SY 新提交 50%

Chameleon: Recovering Cyber-Physical Systems from Memory Corruption Attacks via ML Surrogates

Chameleon: 通过ML代理从内存破坏攻击中恢复信息物理系统

Mohsen Salehi, Karthik Pattabiraman

专题命中 越狱攻击 :safety(abstract)

AI总结 提出Chameleon框架,利用基于机器学习的代理在检测到攻击时替换受损组件,实现信息物理系统从内存破坏攻击中的自动恢复,在多种机器人车辆上验证了高保真度和低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 3 篇

2607.02510 2026-07-03 cs.AI cs.CL cs.LG stat.AP stat.ML 新提交 87%

Online Safety Monitoring for LLMs

LLMs的在线安全监控

Mona Schirmer, Metod Jazbec, Alexander Timans, Christian Naesseth, Maja Waldron, Eric Nalisnick

专题命中 红队测试 :safety(title,abstract);alignment(abstract);red teaming(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过阈值化外部模型的验证信号并利用风险控制校准阈值,实现LLM输出的实时安全监控,在数学推理和红队测试中与高级方法性能相当。

Comments ICML 2026 Hypothesis Testing Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01913 2026-07-03 cs.CY 新提交 79%

From Battlefield to Boardroom: Strategic Red Teaming as an Epistemic Governance Instrument in the Age of AI

从战场到董事会:战略红队作为人工智能时代的知识治理工具

Jeroen Janssen

专题命中 红队测试 :red teaming(title,abstract);分类 cs.CY

AI总结 提出战略红队作为董事会层级的治理工具,通过六组件模型测试AI战略假设,将不确定性转化为可审查对象。

Comments 7 pages, technical report; arXiv edition of Apparens working paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22063 2026-07-03 cs.SE cs.AI 版本更新 74%

RedCoder: Automated Multi-Turn Red Teaming for Code LLMs

RedCoder: 面向代码大语言模型的自动化多轮红队测试

Wenjie Jacky Mo, Qin Liu, Xiaofei Wen, Dongwon Jung, Hadi Askari, Wenxuan Zhou, Zhe Zhao, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学)

专题命中 红队测试 :red teaming(title);分类 cs.AI

AI总结 提出RedCoder,一个通过多轮对话诱导代码大模型生成漏洞代码的自动化红队测试智能体,采用多智能体博弈生成原型对话和攻击策略库,并微调LLM作为骨干,实验表明其优于现有单轮和多轮方法。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2512.23128 2026-07-03 cs.HC cs.AI cs.MA 版本更新 57%

It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents

这是一个陷阱!面向网络代理的任务重定向说服基准

Karolina Korgul, Yushi Yang, Arkadiusz Drohomirecki, Piotr Błaszczyk, Will Howard, Lukas Aichberger, Chris Russell, Philip H. S. Torr, Adam Mahdi, Adel Bibi

机构 * University of Cambridge(剑桥大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 提出TRAP基准,评估大型语言模型驱动的网络代理在动态网页中易受提示注入攻击的程度,发现平均25%的任务中代理被重定向,揭示了心理驱动的系统漏洞。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02811 2026-07-03 cs.NI cs.SY eess.SY 版本更新 50%

Tool Use as Action: Towards Agentic Control in Mobile Core Networks

工具使用作为行动:迈向移动核心网络中的智能体控制

Purna Sai Garigipati, Onur Ayan, Kishor Chandra Joshi, Xueli An

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文提出基于智能体AI的移动核心网络工具接口设计与原型,利用MCP和A2A协议实现意图驱动任务,并分析端到端延迟。

Comments Accepted for presentation at IEEE PIMRC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 6 篇

2607.02376 2026-07-03 cs.AI cs.MA 新提交 79%

Hardware-Enforced Semantic Coordination for Safety-Critical Real-Time Autonomous Systems

面向安全关键实时自主系统的硬件强制语义协调

Uwe M. Borghoff, Paolo Bottoni, Remo Pareschi

机构 * Department of Computer Science University of the Bundeswehr Munich Neubiberg, Germany Department of Computer Science Sapienza University of Rome Rome, Italy STAKE Lab University of Molise Campobasso, Italy

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI

AI总结 针对异构组件并发运行下的协调问题,提出基于FPGA的硬件强制语义协调架构,将TB-CSPN协调机制映射到硬件原语,实现确定性协调和安全保障。

Comments 1 figure, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07820 2026-07-03 cs.CL 74%

Reference Games as a Testbed for the Alignment of Model Uncertainty and Clarification Requests

参考游戏作为模型不确定性与澄清请求对齐的测试平台

Manar Ali, Judith Sieker, Sina Zarrieß, Hendrik Buschmeier

机构 * Digital Linguistics Lab(数字语言实验室) Computational Linguistics Group(计算语言学小组)

专题命中 幻觉与事实性 :alignment(title);分类 cs.CL

AI总结 本文通过参考游戏测试语言模型在不确定性识别与澄清请求表达上的能力,发现模型在简单任务中难以准确识别自身不确定性并转化为澄清行为。

Comments Accepted at GEM@ACL 2026, the 5th Generation, Evaluation & Metrics Workshop

Journal ref Proceedings of the Fifth Workshop on Generation, Evaluation and Metrics (GEM 2026), pp. 990-998

详情

展开后加载摘要…

URL PDF HTML 收藏