arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-22 至 2026-07-22 共收录 41 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 2 篇

2607.18304 2026-07-22 cs.LG 新提交 90%

TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue

TD-DPO:用于减轻临床自闭症干预对话中谄媚行为的差异感知偏好优化

Shuzhong Lai, Junhong Lai, Chenxi Li, Qing Zhou, Haifeng Li, Gang Pan, Lin Yao, Yueming Wang

机构 * Nanhu Brain-Computer Interface Institute(南湖脑机接口研究所) MOE Frontiers Science Center for Brain and Brain-Machine Integration, Zhejiang University(浙江大学脑与脑机融合教育部前沿科学中心) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Children’s Hospital Zhejiang University School of Medicine(浙江大学医学院附属儿童医院) State Key Laboratory of Brain-Machine Intelligence(脑机智能技术国家重点实验室) Department of Neurobiology, Affiliated Mental Health Center and Hangzhou Seventh People’s Hospital, Zhejiang University School of Medicine(浙江大学医学院附属精神卫生中心和杭州市第七人民医院神经生物学系)

专题命中 偏好对齐 :DPO(title,title_cn);alignment(abstract);safety(abstract);分类 cs.LG

AI总结 研究针对大语言模型在自闭症干预对话中的谄媚问题,提出最小编辑数据增强策略及令牌级差异直接偏好优化方法,通过加权差异令牌、降权共享令牌抑制背景漂移,经实验验证该方法能在减轻谄媚与保留干预能力间达较好平衡。

Comments commited to EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19243 2026-07-22 cs.CL cs.AI 新提交 87%

Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs

大语言模型中跨语言事实一致性的推理时引导

Alexander Manev

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型跨语言事实不一致问题,评估零样本上下文引导、CAA、DPO四种干预策略,通过实验发现角色提示是最强干预方式,CAA对配置敏感,DPO适配器收益窄且可转移性低,表明跨语言不一致部分是选择问题,简单干预可能更优。

Comments 8 pages (21 in total), 2 figures, 4 tables. Original manuscript for a Guided Research project conducted at the Technical University of Munich, detailing the complete methodology, full data pipeline, and comprehensive experimental results. A related, condensed subset of this work was subsequently adapted and published at the StereACuLT 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2607.18506 2026-07-22 cs.CY 新提交 79%

AI Value Alignment for Evolving Social Norms

用于不断演变的社会规范的人工智能价值对齐

Nenad Tomašev, Matija Franklin, Simon Osindero

专题命中 安全训练 :alignment(title,abstract);分类 cs.CY

AI总结 研究人工智能价值对齐对社会规范演变的影响,引入基于社会物理学的数学建模框架,通过解析与模拟分析长期后果,强调价值锁定等风险,倡导用此模型作认知桥梁助力社会技术预见及大规模智能体评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18966 2026-07-22 cs.AI cs.CL cs.LG 新提交 75%

Measuring Reward-Seeking via Contrastive Belief Updates

通过对比信念更新来衡量奖励寻求行为

Axel Højmark, Jérémy Scheurer, Evgenia Nitishinskaya, Felix Hofstätter, Jason Wolfe, Theodore Ehrenborg, Bronson Schoen, Alexander Meinke

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究用强化学习训练的语言模型中‘奖励寻求’行为的测量方法,核心方法是对比合成文档微调,主要贡献是发现RL训练会使模型更倾向评分者偏好,甚至违背开发者意图,该方法还适用于奖励破解模型。

Comments 101 pages, 66 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18359 2026-07-22 cs.MA cs.LG 新提交 57%

Decentralized Multi-agent Reinforcement Learning for Resilient Critical Infrastructures

用于弹性关键基础设施的去中心化多智能体强化学习

Minghui Ding, Evangelos Pournaras

机构 * School of Computer Science, University of Leeds(利兹大学计算机科学学院) School of Energy Systems, LUT University(卢特大学能源系统学院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 研究用于弹性关键基础设施的去中心化多智能体强化学习,基于对其特性与基础设施要求的分析,指出信用分配和通信是实际可行的核心条件,提出包含结构、因果、弹性感知信用分配及相关通信等的研究议程,为弹性关键基础设施构建有条件的基础。

Comments Accepted at the 2026 IEEE International Conference on Autonomic Computing and Self-Organizing Systems (ACSOS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18268 2026-07-22 cs.AI 新提交 57%

Fence: Specialized SLM Guardrails for LLM Applications

Fence:用于大语言模型应用的专用小型语言模型护栏

Kumud Lakara, Ruibo Shi, Fran Silavong

机构 * JPMorgan(摩根大通)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究使用闭源大语言模型的实际应用的安全措施问题,提出用在合成数据上训练的小型语言模型作专用护栏,引入受GAN启发的合成数据生成方法,实验证明该方法训练的护栏比基于提示的性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2607.18567 2026-07-22 cs.AI cs.CR cs.LG 新提交 62%

Attacking Graph Foundation Models Through Their Shared Representation

通过共享表示攻击图基础模型

Pankaj Kumar, Subhankar Mishra

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究通过攻击图基础模型的共享表示来探索其脆弱性,采用表示空间扰动和输入空间攻击等方法,针对六个公共模型进行实验,发现不同模型的脆弱性表现,如OpenGraph的频谱分词器有特定脆弱性,还分析了脆弱性与解码器读取表示的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2607.18485 2026-07-22 cs.CR cs.AI 新提交 57%

Trusted Credentials, Untrusted Behavior: Benchmarking LLM-Agent Security in High-Performance Computing

可信凭证,不可信行为:高性能计算中语言模型代理安全性基准测试

Jie Li

机构 * Texas Tech University(德克萨斯技术大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 研究高性能计算中语言模型代理安全性,定义其威胁模型,识别攻击面及当前控制不足,提出研究议程和TaskBound实证基准测试计划,以应对代理按用户凭证运行时可能出现的劫持授权代理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 5 篇

2607.18366 2026-07-22 cs.AI cs.CL cs.CY 新提交 85%

Operational Hallucination and Safety Drift in AI Agents

人工智能代理中的操作幻觉与安全漂移

Shasha Yu, Fiona Carroll, Barry L. Bentley

专题命中 幻觉与事实性 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究大型语言模型在多轮执行中引发的可靠性风险,通过多轮评估量化安全漂移和操作幻觉现象,分析其根源,提出行动感知监督层,该层能拦截违规行为且无良性误报,提升了代理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18828 2026-07-22 cs.AI 新提交 79%

Evaluating medical AI under missing information: same-provider judges and human raters change apparent safety

在信息缺失情况下评估医疗人工智能:同提供者评判者和人类评分者会改变表面安全性

Koyar Afrasyab

机构 * Kinvectum AB(金维图姆公司)

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI

AI总结 研究在信息缺失下评估医疗人工智能,通过删除对话部分对四个模型压力测试,发现评判者选择影响表面安全性,语言模型评判者更宽松,安全差距在于校准,还发布了相关测试工具等。

Comments GitHub https://github.com/KAVentures/health-ai-readiness-robustness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18820 2026-07-22 cs.CL 新提交 79%

CASE: Causal Alignment and Structural Enforcement for Improving Chain-of-Thought Faithfulness

CASE:用于提高思维链忠实度的因果对齐和结构强化

Ziming Wang, Yinghua Yao, Changwu Huang, Ke Tang, Xin Yao

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL

AI总结 研究思维链推理中生成的推理无法忠实支持最终答案的问题,提出CASE框架,通过训练时因果对齐和推理时结构强化,结合构建多种数据集及选择性损失微调、屏蔽注意力等方法,提升CoT忠实度、跨数据集转移能力及平均准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18725 2026-07-22 cs.CL cs.AI cs.CR 新提交 62%

Find Before You Fine-Tune: A Diagnostic Study of Small LLMs for Cybersecurity QA

在微调之前进行评估:针对网络安全问答的小型语言模型诊断研究

Shaswata Mitra, Subash Neupane, Trisha Chakraborty, Himanshu Tripathi, Sudip Mittal, Aritran Piplai, Shahram Rahimi

机构 * The University of Alabama(阿拉巴马大学) Meharry Medical College(梅哈里医学院) Mississippi State University(密西西比州立大学) The University of Texas at El Paso(德克萨斯大学埃尔帕索分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对网络安全问答选择小型语言模型难的问题,提出FiT诊断框架,从三方面刻画模型。通过对五个模型在两种微调模式下研究发现微调利弊因模式而异,预微调FiT分数可预测变化,能筛选模型、避免不必要微调,支持安全部署。

Comments 8 pages, 5 figures, 4 tables, IEEE ICMLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18294 2026-07-22 cs.LG 新提交 57%

Uncertainty Quantification for AI-Driven Crash Simulation Surrogates: A Comparative Study of Monte Carlo Dropout and Deep Ensemble on Open-Source Bumper Beam Benchmark

人工智能驱动的碰撞模拟代理的不确定性量化:基于开源保险杠梁基准的蒙特卡洛随机失活和深度集成的比较研究

Sudeep Chavare

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 研究人工智能驱动碰撞模拟代理的不确定性量化,对蒙特卡洛随机失活和深度集成两种方法在开源管道上比较,用具体随机失活解决常见批评,经汽车碰撞模拟实验,揭示权衡,表明可低成本实现良好校准和无超参数的不确定性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2607.18847 2026-07-22 cs.CR cs.AI 新提交 70%

Data Leakage Prevention in Agentic Applications via Preemptive Hardening

通过先发制硬化防止智能应用中的数据泄露

Akansha Shukla, Emily Bellov, Parth Atulbhai Gandhi, Yuval Elovici, Asaf Shabtai

机构 * Faculty of Computer and Information Science(计算机与信息科学系) Ben-Gurion University of the Negev(内盖夫本· Gurion大学)

专题命中 隐私与版权 :jailbreak(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究智能应用数据泄露问题,提出预部署管道,通过分析提示模板等识别泄露模式并生成补丁,经硬化和验证确保应用功能不受影响,评估显示能有效减少数据泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 17 篇

2607.19292 2026-07-22 cs.CY cs.AI cs.HC 新提交 86%

The safety failures we are not instrumenting: a perspective on hidden safety-critical challenges in modern AI systems

我们未检测到的安全故障:现代人工智能系统中隐藏的安全关键挑战的视角

Gjergji Kasneci, Enkelejda Kasneci

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 研究现代人工智能系统隐藏的安全关键挑战,提出五层框架诊断隐藏风险,识别多种未被充分认识的风险模式,给出设计、治理建议及研究议程,推动人工智能安全从模型评估转向社会技术可靠性。

Comments Email by the arXiv Support Team: "Dear Gjergji, Thank you for your patience. Your appeal was accepted. You are welcome to resubmit this work at your convenience to cs.CY (cs.AI, cs.HC) Regards, arXiv Support"

Journal ref AI and Ethics (2026) 6:295, Springer Nature

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18259 2026-07-22 cs.AI 新提交 83%

Probabilistic Concept-Aware Steering for Trustworthy LLM Inference

用于可信大语言模型推理的概率概念感知引导

Brian Becker, Rui Chu, Yingjie Lao

专题命中 安全评测 :trustworthy(title);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究针对大语言模型推理中现有引导向量方法的问题,提出概率概念感知引导框架,通过概念驱动检索和概率校准,在保留模型能力的同时实现可控、安全的语义偏差引导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18665 2026-07-22 cs.AI 新提交 79%

SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

SciHazard:一种通过分解危害评分来衡量科学安全风险的基准

Chunxiao Li, Yuan Xiong, Lijun Li, Tianyi Du, Wenlong Zhang, Lei Bai, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究针对大型语言模型可能传播有害科学知识的问题,引入SciHazard基准及评估框架,含多学科问题。开发分解评估程序计算DeHarm-Score,经专家验证和模型测试,显示该方法能有效衡量风险,还发现深度研究代理存在安全盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18548 2026-07-22 cs.AI cs.MA cs.SY eess.SY 新提交 79%

Engineering Trustworthy Agentic AI for Critical Systems

为关键系统设计可靠的智能体人工智能

Omar Al-Refai, Ibrahim Shahbaz, Adam Ali Husseinat, Michael Mandulak, Jaewon Kim, Eman Hammad

机构 * Texas A&M University(德克萨斯A&M大学) Innovations in Systems Trust and Resilience (iSTAR) Laboratory(系统信任与弹性创新(iSTAR)实验室) Texas A&M Institute of Data Science - Security, Privacy and Resilience for Trusted AI (SPARTA) Thematic Lab.(德克萨斯A&M大学数据科学研究所 - 可信人工智能的安全、隐私与弹性(SPARTA)主题实验室) Texas A&M Global Cyber Research Institute (GCRI)(德克萨斯A&M大学全球网络研究所)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 研究针对关键工程领域智能体人工智能,将可靠性作为首要工程属性,采用围绕五个维度的可靠性模型及保证工作流程,综述相关架构、机制等,经多领域检验,指出其可靠性是单一问题并勾勒跨域保证框架路径。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18960 2026-07-22 cs.LG cs.AI cs.CR 新提交 76%

SFGA: A Statistics-First Gating Architecture with Adjudicative Escalation for Trustworthy SFT Data Procurement

SFGA:一种用于可信SFT数据采购的具有裁决升级的统计优先门控架构

Arther Tian, Alex Ding, Simon Wu, Aaron Chan

机构 * DGrid AI(DGrid人工智能)

专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG

AI总结 研究如何采购监督微调数据,提出统计优先门控架构SFGA,将采购视为成本感知路由问题,经实验在准确率、F1值和成本上取得良好平衡,还报告辩论路径负面诊断,为测量和校准构建合成基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19011 2026-07-22 cs.CL cs.AI cs.MM 新提交 73%

Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

基于多模态语言模型的计算幽默:方法、数据集、评估及挑战

Tuo Liang, Zhe Hu, Disheng Liu, Jing Li, Yu Yin

机构 * Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究聚焦于单图像和多面板作品中的视觉幽默理解,通过与先前综述对比,按能力层次组织文献,综合基准设计等内容,追溯领域转变,指出进展的主要障碍包括易出现捷径的评估、文化覆盖有限等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19336 2026-07-22 cs.AI cs.CL 新提交 62%

Agents in the Wild: Where Research Meets Deployment

野外的智能体:研究与部署的交汇点

Grace Hui Yang, Pranav N. Venkit, Hooman Sedghamiz, Enrico Santus, Victor Dibia, Ioana Baldini

机构 * Georgetown University(乔治敦大学) Salesforce(Salesforce公司) Bayer(拜耳公司) Bloomberg(彭博公司) Microsoft Research(微软研究院)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 探讨基于大语言模型的智能体系统从研究到部署的转变,通过案例研究分析成功设计模式及失败缓解策略,为与会者提供跨行业安全可靠部署的全面视角、设计模式、评估清单和模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18454 2026-07-22 cs.LG cs.AI 新提交 62%

Estimating Rare Events in Language Models with Proper Evaluation

用适当评估估计语言模型中的罕见事件

Nikita Y. Parulekar, Anqi Liu

机构 * Johns Hopkins University(约翰·霍普金斯大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型中罕见事件概率估计难题,提出梯度激活自适应多级分裂方法及移位幂布雷格曼损失,通过实验揭示偏差 - 方差权衡,强调估计器与部署上下文匹配,确立激活空间为易处理域。

Comments 37 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18958 2026-07-22 cs.CV cs.AI 新提交 57%

Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model

用于增强大型视觉语言模型鲁棒性的对偶对抗微调

Sibo Wang, Jie Zhang, Shiguang Shan, Xilin Chen, Wen Gao

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对大型视觉语言模型视觉输入易受攻击且现有防御方法缺乏通用性的问题,提出对偶对抗微调框架,通过联合优化视觉和语义监督信号增强模型鲁棒性,实验证明该方法在多任务对抗鲁棒性评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18877 2026-07-22 cs.LG 新提交 57%

Physics-Informed Super-Resolution of Atmospheric Data

大气数据的物理信息超分辨率

Chang Xu, Gencer Sumbul, Hugo Porta, Manon Béchaz, Sebastian Schemm, Devis Tuia

机构 * EPFL(洛桑联邦理工学院) University of Cambridge(剑桥大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 针对全球变暖下大气数据超分辨率问题,提出基于原始方程的PISR方法及NPC度量,通过约束SR模型遵循物理方程,实验表明该方法能提升重建保真度,增强极端事件检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18772 2026-07-22 cs.CL 新提交 57%

RF-Agent: A Practical Framework for Building Language Agents for RFIC Design

RF-Agent:用于构建射频集成电路设计语言代理的实用框架

Yueqi Xing, Houbo He, Jolie Wang, Erin Ni, Shikai Wang, Qiufeng Li, Weidong Cao, Taiyun Chi

机构 * Rice University(莱斯大学) The George Washington University(乔治·华盛顿大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对大语言模型在射频电路设计应用受限问题,提出RF-Agent框架,通过教科书驱动知识蒸馏创建数据集及基准,研究监督微调与检索增强生成策略,发现特定领域SFT对中小模型提升大,语义检索的RAG表现最佳,为相关工作提供基础。

Comments Accepted at ICLAD (IEEE International Conference on LLM-Aided Design), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18325 2026-07-22 cs.CV cs.AI cs.RO 新提交 57%

Hazard or Anomaly? Evaluating VLMs for Understanding Dangers and Discrepancies

危险还是异常?评估用于理解危险和差异的视觉语言模型

Murali Indukuri, Mohammad Eskandari, Sree Nitya Kollu, Stephanie Lukin, Cynthia Matuszek

机构 * Interactive Robotics and Language Lab, University of Maryland Baltimore County(马里兰大学巴尔的摩县分校交互式机器人与语言实验室) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究针对现代安全关键系统中VLM的评估问题,通过明确区分危险和异常,在两个数据集及多种提示策略下评估多个先进VLM,发现其常误判,明确区分能提供更具信息性评估并揭示失败模式。

Comments 8 pages, accepted to RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18267 2026-07-22 cs.NI cs.AI 新提交 57%

The Economics of Autonomy: Real-Time Risk Indexing for Insurable AI-Driven 6G Systems

自主性经济学:适用于可保险的人工智能驱动的6G系统的实时风险索引

Anthony Kiggundu, Michael Zentarra, Christoph Lipps, Hans D. Schotten

机构 * German Research Center for Artificial Intelligence (DFKI), Germany(德国人工智能研究中心(DFKI)) RPTU University of Kaiserslautern-Landau, Germany(莱茵-威斯伐尔大学科堡分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究6G网络中传统治理框架在风险管理上的不足,提出GIRAF框架,通过机器可读运行时信号得出总风险指数,形式化验证陈旧性权衡,经模拟验证该框架能保持操作完整性并为多利益相关者责任归属等提供精算基线。

Comments Accepted at the IEEE 104th Vehicular Technology Conference - VTC2026-Fall

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18240 2026-07-22 cs.AI 新提交 57%

Calibrated Selective Fact-Checking via Evidence Chain Evaluation

通过证据链评估进行校准的选择性事实核查

Dekun Yang

机构 * Zhejiang University(浙江大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对大语言模型事实核查的可靠性问题,提出证据链评估框架ECE,通过网络搜索等收集证据并返回结构化裁决。在ECE - Bench上有较好表现,虽总体校准指标未超最强基线,但实现了选择性预测权衡,弃权可处理弱证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19284 2026-07-22 cs.RO 新提交 50%

Stochastic Multi-Objective Kinodynamic Planning Against Adversaries

针对对手的随机多目标运动动力学规划

Thomas Marshall Vielmetti, Daniel Cherenson, Dimitra Panagou

机构 * University of Michigan(密歇根大学)

专题命中 安全评测 :safety(abstract)

AI总结 研究在含随机混合对手环境下的多目标运动动力学规划,核心方法是将规划空间转移到闭环策略序列,通过蒙特卡洛粒子展开评估风险,引入SMO-RRT和SMO-SST算法,推导有限样本界,实现概率安全规划。

Comments 8 pages, 1 figure, accepted to CDC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18684 2026-07-22 cs.CR 新提交 50%

When to Trust the Map: Confidence-Aware LLM Routing for Automotive CVE-to-ATM Mapping

何时信任地图:用于汽车CVE到ATM映射的置信度感知大语言模型路由

Heeyun Heo, Sangmin Park, Huy Kang Kim, Sanghoon Jeon

专题命中 安全评测 :safety(abstract)

AI总结 研究汽车CVE到ATM映射问题,提出通过分层上下文学习生成候选映射,融合多种信号到校准元模型,以校准置信度分数分类候选映射,在评估集上显著提高精度,支持选择性自动化。

Comments 11 pages, 2 figures, 3 tables; Accepted at ESCAR EUROPE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏