arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-01 至 2026-05-01 共收录 62 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2604.27401 2026-05-01 cs.CL cs.LG 85%

Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs

扰动探测:对齐语言模型中FFN行为电路的双次提示诊断

Hongliang Liu, Tung-Ling Li, Yuhao Wu

机构 * Palo Alto Networks(帕洛阿尔托网络公司)

专题命中 偏好对齐 :RLHF(summary_cn,abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 通过双次提示传递和无反向传播的扰动探测,识别LLM中两种行为电路结构,揭示RLHF组织的行为机制及模板层编辑工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03853 2026-05-01 cs.CR cs.LG 77%

Dr. Jekyll and Mr. Hyde: Two Faces of LLMs

医生贾克尔与 Mr. 海德:大语言模型的两面

Matteo Gioele Collu, Tom Janssen-Groesbeek, Stefanos Koffas, Mauro Conti, Stjepan Picek

机构 * University of Padova(帕多瓦大学) Radboud University(拉德博德大学) Delft University of Technology(代尔夫特理工大学) Örebro University(欧雷布罗大学) University of Zagreb Faculty of Electrical Engineering(Zagreb大学电子工程学院) University of Bergen(卑尔根大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);safety(abstract);分类 cs.LG

AI总结 研究通过角色扮演攻击揭示大语言模型的安全漏洞,展示通过伪装复杂人格可获取非法信息,验证了多种模型在2023-2025年间对攻击的脆弱性。

Comments Presented at the Joint National Conference on Cybersecurity (ITASEC & SERICS 2026), Cagliari, Italy, February 09-13, 2026. Published as Paper 35 in CEUR Workshop Proceedings, Vol-4198. Available at: https://ceur-ws.org/Vol-4198/

Journal ref Proc. Joint National Conference on Cybersecurity (ITASEC & SERICS 2026), CEUR-WS.org, Vol-4198, 35, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28036 2026-05-01 cs.LG cs.IT math.IT 70%

Exponential families from a single KL identity

从单个KL恒等式出发的指数族

Marc Dymetman

机构 * Scientific Consultant(科学顾问)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文通过一个简单的指数族KL差恒等式,推导出多项经典结果,包括三点恒等式、I投影定理、对数分区函数的凸性等,无需复杂推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27969 2026-05-01 cs.SE cs.AI 70%

From Mirage to Grounding: Towards Reliable Multimodal Circuit-to-Verilog Code Generation

从幻象到基础:迈向可靠的多模态电路到Verilog代码生成

Guang Yang, Xing Hu, Xiang Chen, Xin Xi

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(区块链与数据安全国家重点实验室,浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security, Hangzhou(杭州高新技术区(滨江)区块链与数据安全研究院,杭州) School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出VeriGround模型,通过标识符匿名化、拒绝增强和D-ORPO对齐,解决了多模态模型在电路到Verilog代码生成中的可靠性问题,验证了真实视觉基础的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19342 2026-05-01 stat.ML cs.LG stat.ME 70%

Contextual Online Uncertainty-Aware Preference Learning for Human Feedback

基于上下文的在线不确定性感知偏好学习用于人类反馈

Nan Lu, Ethan Lee, Ethan X. Fang, Junwei Lu

机构 * Department of Biostatistics, Harvard T.H. Chan School of Public Health(哈佛大学T.H.陈公共卫生学院生物统计学系) Department of Biostatistics & Bioinformatics, Duke University(杜克大学生物统计学与生物信息学系)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种新的统计框架,利用动态上下文信息在线决策和统计推断最优模型,通过人类偏好数据实现最优 regret 绑定和估计量渐近分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27495 2026-05-01 cs.CL cs.AI 62%

Debiasing Reward Models via Causally Motivated Inference-Time Intervention

通过因果驱动的推理时干预去偏奖励模型

Kazutoshi Shinoda, Kosuke Nishida, Kyosuke Nishida

机构 * Human Informatics Labs., NTT, Inc.(NTT人类信息学实验室)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出因果驱动的干预方法,用于在推理时减轻奖励模型中的多种偏差。通过抑制与预定义偏差属性强相关的神经元激活,减少对虚假特征的敏感性,同时保持性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01611 2026-05-01 cs.CL 57%

In-context Learning vs. Instruction Tuning: The Case of Small and Multilingual Language Models

上下文学习与指令微调:小语言模型和多语言情况的案例

David Ponce, Thierry Etchegoyhen

机构 * Fundación Vicomtech, Basque Research and Technology Alliance (BRTA)(维克森科技基金会,巴斯克研究与技术联盟(BRTA)) University of the Basque Country UPV/EHU(巴斯克大学UPV/EHU)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 研究评估了上下文学习在非英语语言和不同模型大小下的指令遵循有效性,发现其表现下降,但通过直接偏好优化可部分提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27699 2026-05-01 cs.AI 57%

Bridging Values and Behavior: A Hierarchical Framework for Proactive Embodied Agents

连接价值与行为:一种面向主动具身代理的分层框架

Chunhui Zhang, Yuxuan Wang, Aoyang Qin, Yi-Long Lu, Kunlun Wu, Yizhou Wang, Wei Wang

机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Computer Science, Peking University(北京大学计算机学院) Tsinghua University(清华大学) Nat’l Eng. Research Center of Visual Technology, Peking University(北京大学视觉技术国家工程研究中心) Institute for AI, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文提出ValuePlanner框架,通过分层认知架构分离高阶价值调度与低阶行动执行,结合LLM生成符号子目标并用PDDL规划器转化为行动计划,通过反馈机制提升自主性,实验表明其能生成连贯的长期自主行为。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2604.27358 2026-05-01 cs.AI 79%

Safe Bilevel Delegation (SBD): A Formal Framework for Runtime Delegation Safety in Multi-Agent Systems

安全双层委托(SBD):一种用于多智能体系统运行时委托安全性的正式框架

Yuan Sun

机构 * Jilin University(吉林大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出SBD框架,通过双层优化问题在运行时动态调整安全与效率的权衡,理论证明了安全单调性、内政策收敛性和责任传播界,应用于医疗AI、金融风险控制和教育代理监督领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27166 2026-05-01 cs.LG cs.GT 79%

Distributional Alignment Games for Answer-Level Fine-Tuning

分布对齐博弈用于答案级微调

Mehryar Mohri, Jon Schneider, Yifan Wu

机构 * Google Research(谷歌研究) Microsoft Research(微软研究)

专题命中 安全训练 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出分布对齐博弈框架,通过策略与目标的博弈达到答案级优化,统一了多样性与自改进方法,提升数学推理任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27093 2026-05-01 cs.CL cs.AI 73%

Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations

无用却安全?在多轮对话中通过用户意图澄清基准测试恢复效用

Mingqian Zheng, Malia Morgan, Liwei Jiang, Carolyn Rose, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学) Allen Institute for AI(人工智能联盟研究所) University of Washington(华盛顿大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CarryOnBench,首个交互式基准测试,评估LLM在多轮对话中是否能修正用户意图并恢复效用,同时保持安全。通过398个看似有害但实际无害的查询,生成5970次对话,评估14个模型的意图对齐效用和安全性能,发现模型在意图澄清后恢复效用存在不同失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17765 2026-05-01 q-bio.QM cs.AI cs.CV 70%

Grounded Multimodal Retrieval-Augmented Drafting of Radiology Impressions Using Case-Based Similarity Search

基于案例相似性搜索的医学影像印象 grounded 多模态检索增强草稿生成

Himadri S Samanta

机构 * Independent AI Researcher(独立AI研究员)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一种多模态检索增强生成系统,结合对比图像-文本嵌入、基于案例的相似性检索和引用约束草稿生成,以生成具有临床依据的医学影像印象。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27045 2026-05-01 cs.LG cs.AI cs.CL 67%

Detecting Clinical Discrepancies in Health Coaching Agents: A Dual-Stream Memory and Reconciliation Architecture

在健康教练代理中检测临床差异:一种双流记忆与协调架构

Samuel L Pugh, Eric Yang, Alexander Muir Sutherland, Alessandra Breschi

机构 * Verily Health Inc(Verily健康公司)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出双流记忆与协调架构,用于检测健康教练代理中的临床差异,通过验证患者报告与临床记录以确保安全部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18731 2026-05-01 cs.CL cs.AI cs.LG 67%

Mitigating Lost in Multi-turn Conversation via Curriculum RL with Verifiable Accuracy and Abstention Rewards

通过可验证准确性和回避奖励的课程强化学习缓解多轮对话中的迷失问题

Ming Li, Pei Chen, Zhenhao Zhang, Tao Yang, Xinyang Zhang, Han Li, Tianyu Cao, Ming Zeng, Zhuofeng Wu, Meng Jiang, Huasheng Li, Lihong Li, Bing Yin

机构 * University of Maryland(马里兰大学) Amazon(亚马逊)

专题命中 安全训练 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RLAAR框架,通过可验证准确性和回避奖励的课程强化学习,减少多轮对话中因提前回答导致的性能下降,提升模型可靠性。

Comments ACL2026, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27118 2026-05-01 cs.RO cs.AI 57%

PALCAS: A Priority-Aware Intelligent Lane Change Advisory System for Autonomous Vehicles using Federated Reinforcement Learning

PALCAS:基于联邦强化学习的优先级感知智能变道建议系统用于自动驾驶车辆

Yassine Ibork, Nhat Ha Nguyen, Myounggyu Won, Lokesh Das

机构 * School of Computing, Wichita State University(维斯科大学计算学院) Department of Computer Science, University of Memphis(孟菲斯大学计算机科学系)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出基于多智能体联邦强化学习的优先级感知智能变道建议系统PALCAS,用于自动驾驶车辆,通过引入新的优先级感知安全变道奖励函数,提升变道决策的合理性和交通效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27728 2026-05-01 cs.RO 50%

Connected Dependability Cage: Run-Time Function and Anomaly Monitoring for the Development and Operation of Safe Automated Vehicles

连接的可靠性笼:运行时功能与异常监控用于安全自动驾驶车辆的开发和运营

Iqra Aslam, Nour Habib, Abhishek Buragohain, Meng Zhang, Andreas Rausch, Vaibhav Tiwari, Mohamed Benchat

机构 * Institute for Software and System Engineering(软件与系统工程研究所)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出连接的可靠性笼架构,通过功能监控和异常监控机制,提升自动驾驶系统在故障和未知环境下的安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2604.27818 2026-05-01 cs.CR 67%

MASCing: Configurable Mixture-of-Experts Behavior via Activation Steering Masks

MASCing:通过激活引导掩码实现可配置的专家混合行为

Jona te Lintelo, Lichao Wu, Marina Krček, Sengim Karayalçin, Stjepan Picek

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

AI总结 MASCing通过LSTM模型捕捉跨层路由依赖,利用引导矩阵优化专家电路,实现无需重新训练的MoE行为灵活重构,提升安全场景下的模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28129 2026-05-01 cs.CR cs.AI 57%

Latent Adversarial Detection: Adaptive Probing of LLM Activations for Multi-Turn Attack Detection

潜在对抗检测:适应性探测LLM激活以多轮攻击检测

Prashant Kulkarni

机构 * Mountain View, CA(山景城,加利福尼亚州)

专题命中 越狱攻击 :prompt injection(abstract);分类 cs.AI

AI总结 本文通过分析LLM激活层的轨迹特征,提出对抗性不稳定性概念,提升多轮攻击检测精度,验证了模型家族间的信号一致性及数据分布对泛化能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2604.27861 2026-05-01 cs.CR cs.CL cs.LG 62%

TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

TwinGate: 通过非对称对比学习实现对不可追踪流量中分解性劫持的有状态防御

Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) University of California, Merced(加州大学默塞德分校)

专题命中 红队测试 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 针对LLM中分解性劫持威胁,TwinGate通过非对称对比学习在共享潜在空间中聚类语义不同但意图匹配的恶意片段,同时利用冻结编码器抑制良性主题重叠导致的误报,实现高效防御。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2604.28157 2026-05-01 cs.CR 78%

FlashRT: Towards Computationally and Memory Efficient Red-Teaming for Prompt Injection and Knowledge Corruption

FlashRT: 向计算和内存高效方向发展用于提示注入和知识腐败的红队测试

Yanting Wang, Chenlong Yin, Ying Chen, Jinyuan Jia

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 本文提出FlashRT框架,通过提升计算和内存效率,优化长上下文LLM的提示注入和知识腐败攻击,实现2-7倍的加速和2-4倍的内存节省,为系统评估长上下文LLM的安全性提供工具。

Comments The code is available at https://github.com/Wang-Yanting/FlashRT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27202 2026-05-01 cs.CR 78%

Indirect Prompt Injection in the Wild: An Empirical Study of Prevalence, Techniques, and Objectives

野外间接提示注入:网页中间接提示注入的实证研究

Soheil Khodayari, Xuenan Zhang, Bhupendra Acharya, Giancarlo Pellegrino

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 研究通过分析网页和HTTP响应中的间接提示注入实例,揭示其在真实环境中的普遍存在性、技术手段及影响,发现大部分指令针对机器而非人类,且存在多种不同的目标和影响。

Comments 18 pages total, 12 pages main content, 8 figures, and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 4 篇

2604.26959 2026-05-01 cs.CY cs.AI cs.MA 81%

CareGuardAI: Context-Aware Multi-Agent Guardrails for Clinical Safety & Hallucination Mitigation in Patient-Facing LLMs

CareGuardAI:面向临床安全与幻觉抑制的上下文感知多智能体守卫机制

Elham Nasarian, Abhilash Neog, Kwok-Leung Tsui, Niyousha HosseiniChimeh

机构 * Grado Department of Industrial & Systems Engineering, Virginia Tech, Blacksburg, VA 24061, USA(弗吉尼亚理工大学格拉多工业与系统工程系,弗吉尼亚理工大学,布莱克斯堡,VA 24061,美国) Department of Computer Science, Virginia Tech, Blacksburg, VA 24061, USA(弗吉尼亚理工大学计算机科学系,弗吉尼亚理工大学,布莱克斯堡,VA 24061,美国) Dept of Industrial, Manufacturing, and Systems Engineering at University of Texas at Arlington, Arlington, TX 76019, USA(德克萨斯理工大学阿灵顿分校工业、制造与系统工程系,阿灵顿,TX 76019,美国)

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 CareGuardAI通过引入临床安全风险评估和幻觉风险评估,结合多阶段管道和迭代优化,提升患者面对LLM的可靠性与安全性,优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11653 2026-05-01 cs.IR cs.AI cs.LG 62%

GroupRank: A Groupwise Paradigm for Effective and Efficient Passage Reranking with LLMs

GroupRank: 一种用于基于LLM的高效有效段落重排序的组内方法

Meixiu Long, Duolin Sun, Dan Yang, Yihan Jiao, Lei Liu, Jiahai Wang, BinBin Hu, Yue Shen, Jie Feng, Zhehao Tan, Junjie Wang, Lianzhen Zhong, Jian Wang, Peng Wei, Jinjie Gu

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Ant Group(蚂蚁集团)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 GroupRank提出一种组内方法平衡灵活性和上下文感知,通过合成数据融合局部点状信号与全局列表排名,提升重排序效果和效率,实验显示在BRIGHT上达到65.2 NDCG@10,且推理速度提升6.4倍。

Comments Accepted by ACL-Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14352 2026-05-01 cs.CY cs.AI cs.LO 62%

Epistemic reflections on AI answering our questions: overwatch, erudite, logician, interlocutor

关于AI回答问题的认知反思:监视、博学、逻辑学家、对话者

Johan F. Hoorn, Ella-Jenna Oosterglorenwoud

机构 * The Hong Kong Polytechnic University(香港理工大学) Eindhoven University of Technology (TU/e)(埃因霍温理工大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨AI在金融、法律等领域被广泛依赖的问题,指出其缺乏逻辑验证和实证验证,可能导致误判和剽窃。提出需了解推理系统以使AI成为可信的对话伙伴。

Comments 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20577 2026-05-01 cs.SE cs.LG 57%

Evaluating Assurance Cases as Text-Attributed Graphs for Structure and Provenance Analysis

评估作为文本属性图的保证案例用于结构和来源分析

Fariz Ikhwantri, Dusica Marijan

机构 * Simula Research Laboratory(Simula研究实验室)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出基于图诊断框架分析保证案例的结构和来源,通过链接预测和图分类检测偏见,实验表明GNN在链接预测和来源检测中表现优异。

Comments 10 pages, 4 figures, 8 tables. Accepted to EASE 2026 AI Models / Data track, Glasgow, United Kingdom Fix the captions of tables 7 and 8

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 19 篇

2512.01166 2026-05-01 cs.CY 83%

Evaluating AI Providers' Frontier Safety Frameworks

评估AI提供商的前沿安全框架

Lily Stelling, Malcolm Murray, Bruno Galizzi, Max Schaffelder, Siméon Campos, Henry Papadatos

专题命中 安全评测 :safety(title,abstract);AI safety(abstract);分类 cs.CY

AI总结 本文评估12家AI公司的前沿安全框架,通过65项加权标准评估四个维度,发现框架存在诸多缺失或不明确之处,评分范围从34%到8%,建议未来需完善以提升问责功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22500 2026-05-01 cs.CV cs.AI 83%

OR-VSKC: Resolving Visual-Semantic Knowledge Conflicts in Operating Rooms with Synthetic Data-Guided Alignment

OR-VSKC:通过合成数据引导对齐解决手术室中的视觉-语义知识冲突

Weiyi Zhao, Xiaoyu Tan, Liang Liu, Sijia Li, Youwei Song, Xihe Qiu

机构 * Shanghai University of Engineering Science(上海工程技术大学) Tencent YouTu Lab(腾讯优图实验室) Clinical Research Unit, Zhongshan Hospital of Fudan University(复旦大学中山医院临床研究部)

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出OR-VSKC基准,通过合成数据引导对齐解决手术室中的视觉-语义知识冲突,评估多模态大语言模型的可靠性,并展示微调后的模型在未见视角上的鲁棒性。

Comments 13 pages, 5 figures. The dataset and appendix are available at https://github.com/zgg2577/VS-KC

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14044 2026-05-01 cs.CV cs.AI 79%

OmniDrive-R1: Reinforcement-driven Interleaved Multi-modal Chain-of-Thought for Trustworthy Vision-Language Autonomous Driving

OmniDrive-R1: 基于强化学习的交错多模态链式推理用于可信的视觉-语言自动驾驶

Zhenguo Zhang, Haohan Zheng, Yishen Wang, Le Xu, Tianchen Deng, Xuefeng Chen, Qu Chen, Bo Zhang, Wuxiong Huang

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) MEGVII Technology(美科维七科技) AFARI

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 本文提出OmniDrive-R1,通过交错多模态链式推理机制统一感知与推理,引入强化驱动的视觉 grounding 能力,提升自动驾驶中的推理准确性和稳定性,实验显示其在DriveLMM-o1数据集上的表现显著优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14719 2026-05-01 cs.AI 79%

Policy-Grounded Safety Evaluation of 20 Large Language Models

基于政策的安全性评估:20个大语言模型

Juan Manuel Contreras

机构 * Aymara

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出Aymara AI平台,用于生成和管理定制化的政策导向安全性评估。通过评估20个商业大语言模型在10个现实安全领域中的表现,揭示了模型在不同领域中的显著性能差异,强调了构建可扩展、可定制工具的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02515 2026-05-01 cs.CL cs.AI cs.LG 75%

FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning

FinChain:可验证链式思维金融推理的符号基准

Zhuohan Xie, Daniil Orel, Rushil Thareja, Dhruv Sahnan, Hachem Madmoun, Fan Zhang, Debopriyo Banerjee, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Jinyan Su, Aaryamonvikram Singh, Rui Xing, Rania Elbadry, Chen Xu, Haonan Li, Fajri Koto, Ivan Koychev, Tanmoy Chakraborty, Yuxia Wang, Salem Lahlou, Veselin Stoyanov, Sophia Ananiadou, Preslav Nakov

机构 * MBZUAI Syllogia The University of Tokyo(东京大学) The Fin AI(Fin AI) Cornell University(康奈尔大学) The University of Melbourne(墨尔本大学) IIT Delhi(德里理工学院) The University of Manchester(曼彻斯特大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FinChain通过符号模板和可执行代码实现可验证的金融链式推理,评估26种LLM发现其在符号金融推理中存在明显缺陷,领域适应和数学增强的微调模型能显著缩小差距。

Comments 24 pages, includes 12 figures and 9 tables; introduces the FinChain benchmark and ChainEval metric

详情

展开后加载摘要…

URL PDF HTML 收藏