arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 930 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 930 篇

2608.07514 2026-08-11 cs.CY 新提交 57%

Open Technical Problems in Open-Weight AI Model Risk Management

开放权重AI模型风险管理中的开放技术问题

Stephen Casper, Kyle O'Brien, Shayne Longpre, Elizabeth Seger, Kevin Klyman, Rishi Bommasani, Aniruddha Nrusimha, Ilia Shumailov, Sören Mindermann, Steven Basart, Frank Rudzicz, Kellin Pelrine, Avijit Ghosh, Andrew Strait, Robert Kirk, Dan Hendrycks, Peter Henderson, Zico Kolter, Geoffrey Irving, Yarin Gal, Yoshua Bengio, Dylan Hadfield-Menell

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本文指出开放权重AI模型风险管理存在16项涉及多环节的技术挑战,强调相关研究需兼顾开放性,以实现其益处并减轻危害。

Comments Published in Transactions on Machine Learning Research (03/2026) Reviewed on OpenReview: https: // openreview. net/ forum? id= 8QyGLnFkzc

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07463 2026-08-10 cs.CV cs.LG 新提交 57%

MirrorWorld: Taming Video Diffusion Models for Mirror Reflection Generation

MirrorWorld:利用视频扩散模型生成镜像反射

Youjun Zhao, Alex Warren, Gary K. L. Tam, Rynson W. H. Lau

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 MirrorWorld是一种反射感知视频修复框架,通过语义关系蒸馏和几何变换对齐建模场景与镜像的关系,在视频镜像反射重建任务上优于现有方法。

Comments Project Page: https://youjunzhao.github.io/MirrorWorld/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07214 2026-08-10 cs.DB cs.AI cs.SY eess.SY 新提交 57%

Toward a Causal Data Management Ecosystem for Decision Making and Agentic AI

面向决策与智能体AI的因果数据管理生态系统

Dazhuo Qiu, Yingli Zhou, Amedeo Pachera, Angela Bonifati, Andrea Mauri

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文针对AI生态系统决策混杂问题,提出构建共享可查询的因果世界系统(CWS),为面向决策与智能体AI的因果数据管理生态系统提供支持。

Comments Accepted at ACM AI Leadership Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06909 2026-08-10 cs.AI 新提交 57%

Long-Horizon Agent Trajectory Attribution: A Unified Benchmark and Fine-Grained Annotation Framework

长时程智能体轨迹归因:统一基准与细粒度标注框架

Jing Chen, Yang Sun, Li Zhang, Lin Xu, Jie Shi

机构 * Huawei Technologies Ltd.(华为技术有限公司)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 针对现有智能体轨迹基准缺乏细粒度归因分析支持的问题,提出轨迹归因任务,构建含1300余条标注轨迹的统一基准与标注框架,定义两项评估任务并发布可复用标注技能。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06898 2026-08-10 cs.RO cs.CL cs.HC 新提交 57%

How Should I Pick a Foundation Model for My Robot? In Favor of a Community Evaluation Framework for Social Robots

我该如何为我的机器人选择基础模型?支持社会机器人的社区评估框架

Eric Nichols, Alva Markelius, Hatice Gunes

机构 * Honda Research Institute Japan(本田研究所日本分部) University of Cambridge(剑桥大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 针对社会机器人选择基础模型的难题,本文提出三层评估漏斗范式,梳理五个评估维度的适用评估方法,呼吁社区共建评估框架。

Comments 5 pages, 1 figure, 1 table. Accepted at the FoRMA workshop (Foundation Models in the RO-MAN Age: Responsible Development for Social Robotics) at IEEE RO-MAN 2026, Kitakyushu, Japan. Workshop homepage: https://sites.google.com/cam.ac.uk/forma/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06785 2026-08-10 cs.CL 新提交 57%

Multi-Perspective Triad Interaction Graph Neural Network for Cognitive Distortion Detection

用于认知扭曲检测的多视角三元组交互图神经网络

Jun Seo Kim, Hye Hyeon Kim

机构 * Gachon University(嘉泉大学) Yonsei University(延世大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 针对现有认知扭曲检测方法忽略扭曲思维心理结构的问题,提出MTI-GNN模型,在多数据集上验证其性能优于基线模型及生成模型,且各视角均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06672 2026-08-10 cs.CL 新提交 57%

TA-RAG: Tone Awareness as a Design Imperative for Retrieval-Augmented Generation

TA-RAG:将语气感知作为检索增强生成的设计要务

Yong-Bin Kang, Anthony McCosker

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 该研究针对标准RAG系统存在的语境脱耦问题,提出TA-RAG框架,将交流对齐与事实准确性并列为核心设计目标,明确语气感知是高风险语境下RAG系统的设计要务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06663 2026-08-10 cs.CL 新提交 57%

The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents

视界差距:长视界大语言模型智能体的规划、记忆、执行、训练与评估

Mingguang Chen, Licheng Wang, Bo Qu

机构 * DeepGrounding(深地研究机构) AlphaAvatar(阿尔法 Avatar 公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出长视界大语言模型智能体存在的视界差距,调研1547篇相关论文,厘清长视界等属性,分析领域应对措施并提出开放测量问题。

Comments 39 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06613 2026-08-10 cs.CV cs.AI 新提交 57%

Do 3D Medical Foundation Models See Through MRI Artifacts? A Controlled Study of Representation Robustness

三维医学基础模型能看穿MRI伪影吗?一项关于表示鲁棒性的对照研究

Julia Anna Mielcarz, Daniel Klaaby, Mostafa Mehdipour Ghazi

机构 * Pioneer Centre for AI, University of Copenhagen(哥本哈根大学先锋人工智能中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文对照评估五种三维医学基础模型的表示鲁棒性,发现其鲁棒性与模型及伪影类型相关,部分模型对伪影更敏感,仅靠大规模预训练无法保证伪影不变性,需部署前评估鲁棒性。

Comments Accepted at the ECCV 2026 Workshop on Artificial Intelligence for Medical 3D Vision (AI4M3D)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05195 2026-08-07 q-bio.GN cs.LG q-bio.QM 新提交 57%

CLARA: Clarification of Language Ambiguity through Result Analysis for Natural-Language Cancer Genomics Queries

CLARA:通过结果分析澄清自然语言癌症基因组学查询中的语言歧义

Pratyush Kumar Shukla, Manveer Singh Tib, Siddhant Garg

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本研究提出CLARA框架,通过将自然语言癌症基因组学查询转为带类型的科学查询规范,执行多种解释并在结果分歧时澄清,在基准测试中展现出良好的歧义区分能力,揭示了安全与负担的权衡。

Comments Preprint of an article submitted for consideration in the Pacific Symposium on Biocomputing (PSB 2027). Copyright 2026 World Scientific Publishing Company. https://psb.stanford.edu/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05960 2026-08-07 cs.CV cs.AI 新提交 57%

Big, Bright, or Invisible: A Frozen-Feature Benchmark of 3D CT Foundation Models

大的、明亮的还是不可见的:3D CT基础模型的冻结特征基准测试

Maulik Chevli, Johannes Brandt, Rickmer Braren, Daniel Rueckert, Philip Müller

机构 * Technical University of Munich (TUM)(慕尼黑工业大学(TUM)) TUM University Hospital(慕尼黑工业大学医院) Imperial College London(伦敦帝国理工学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) UKE Hamburg(汉堡大学医院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本研究对10个冻结CT编码器开展基准测试,发现性能主要取决于异常的对比度与空间范围,小型低对比度病变仍是挑战,需区域或病变级预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05790 2026-08-07 cs.AI cs.CR 新提交 57%

ChainClaw: A Layered Agent Framework for Reliable On-Chain Execution

ChainClaw:一种用于可靠链上执行的分层智能体框架

Jiacheng Wei, Zhaoxin Fan, Xin Wen, Yuqin Lan, Dongrun Li, Wenjun Wu, Faguo Wu, Xiao Zhang

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京航空航天大学未来区块链与隐私计算高精尖创新中心) Beihang University(北京航空航天大学) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) School of Mathematical Sciences, Beihang University(北京航空航天大学数学科学学院) Zhongguancun Laboratory(中关村实验室)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 ChainClaw是基于OpenClaw的分层区块链原生智能体框架,通过三层架构解决链上执行的反应性、不可逆性和可观测性缺口,在自建基准上的安全性和任务完成度均优于代表性基线。

Comments 8 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05510 2026-08-07 cs.CL 新提交 57%

Different Perturbations, Different Mechanisms: Understanding Continued Pre-training for Zero-Shot Dialect Robustness

不同扰动,不同机制:理解用于零样本方言鲁棒性的持续预训练

Aarohi Srivastava, David Chiang

机构 * University of Notre Dame(圣母大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本研究针对大型语言模型,系统对比6种训练条件下的6种扰动持续预训练策略,发现字符噪声CPT可提升零样本方言鲁棒性且保留标准性能,不同策略的鲁棒机制存在差异,为相关策略选择提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05411 2026-08-07 cs.AI 新提交 57%

Evaluating and Improving Pedagogical Fit in LLM-Based AI Tutors with the Pedagogical Suitability Index

基于教学适宜性指数评估和改进基于大语言模型(LLM)的AI导师的教学适配性

Benjamin Barlog, Hudson Craig, Zedong Peng

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出教学适宜性指数(PSI)评估LLM导师的教学适配性,评估4类LLM并发现PSI引导的反馈可显著提升弱表现案例的适配性。

Comments This paper has already been accepted and presented at the IEEE 27th International Conference on Information Reuse and Integration for Data Science (IRI 2026) from July 31 to August 2, 2026, in Seattle, WA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05205 2026-08-07 cs.AI 新提交 57%

Abstract Event Causal Rules: Induction and Application

抽象事件因果规则:归纳与应用

Ziwei Zheng, Peiqiong Chen, Bang Wang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本研究针对现有实例级因果对泛化缺陷,提出抽象事件因果规则(AECR)及相关归纳系统,构建知识库并设计 AR-GCAE 模型注入 AECR,在 CGEP 任务中提升了事件因果推理与预测性能,尤其对稀有未见样本效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05004 2026-08-06 cs.CL 新提交 57%

DelusionEval: Measuring Delusion-Linked Behaviors in AI Chatbots

DelusionEval:评估AI聊天机器人中与妄想相关的行为

Jared Moore, Andrea Mock, Yifan Mai, Jacy Reese Anthis, Ryan Louie, William Agnew, Ashish Mehta, Kevin Klyman, Percy Liang, Nick Haber, Eric Lin, Desmond C. Ong

机构 * Stanford University(斯坦福大学) University of Chicago(芝加哥大学) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本研究开发DelusionEval评估协议,发现LLM表现出与妄想相关行为的倾向与模型规模等无可靠关联,扩展上下文会提升此类行为发生率,所有模型家族均存在相关风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04921 2026-08-06 cs.SE cs.AI 新提交 57%

A Chain Is Only as Strong as Its Weakest Link: A Scoping Review of System Integration Audits in AI

链条的强度取决于最薄弱的环节:AI中系统集成审计的范围综述

Leah Davis, Dominic Martin, AJung Moon

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究对4259篇文献中58篇以系统集成为核心的AI审计文献开展范围综述,分析其要素等内容,指出需将系统集成作为AI风险应对核心策略以完善审计实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04885 2026-08-06 cs.CV cs.CL 新提交 57%

Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations

评估视觉-语言模型在视觉和文本扰动下的诊断鲁棒性

Ali Khoramfar, Mohammad Javad Dousti, Alireza Mohamadian, Heshaam Faili

机构 * University of Tehran(德黑兰大学) Tehran University of Medical Sciences(德黑兰医科大学) Advanced Diagnostic and Interventional Radiology Research Center (ADIR)(高级诊断与介入放射学研究中心(ADIR))

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本研究通过脑部MRI数据集评估四类视觉-语言模型在视觉、文本扰动下的诊断鲁棒性,发现其存在预测翻转、文本选择偏差、诊断过度承诺等问题,指出需采用稳定性指标评估其临床应用可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04830 2026-08-06 cs.AI 新提交 57%

ContextWeave: A Real-World Workflow Benchmark

ContextWeave:一个真实世界工作流基准测试

Bo Wang, Yuqian Yao, Enxi Wang, Luozhijie Jin, Yang Liu, Yiran Suo, Yuxuan Cai, Enyu Zhou, Yufei Gao, Honglin Guo, Tianyu Huai, Li Ji, Zhikai Lei, Bufan Li, Lizhi Lin, Jinxiu Liu, Jie Yang, Jiazheng Zhou, Maosen Zhou, Pengfang Qian, Shichun Liu, Guanshan Liu, Hao Zheng, Yunhao Yu, Hang Yan, Jihua Kang, Xinchi Chen, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) ByteDance(字节跳动)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究推出ContextWeave工作流基准测试,通过实验发现可操作的经验记忆能提升智能体工作流性能,为优化记忆系统提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04613 2026-08-06 cs.LG 新提交 57%

Why Ranking Anomaly Detection Algorithms Isn't as Reliable as You May Think

为何异常检测算法的排名并不如你所想的可靠

Simon Klüttermann, Jérôme Rutinowski, Frederik Polachowski, Alice Kirchheim

机构 * Carnegie Mellon University(卡内基梅隆大学) TU Dortmund University(多特蒙德工业大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) iits Consulting GmbH(iits咨询有限公司) Fraunhofer Institute for Material Flow and Logistics IML(弗劳恩霍夫物流与材料流动研究所IML)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本研究通过分析7种算法在690个数据集上的表现,发现异常检测算法排名高度不稳定,数据集选择和超参数选择是主要影响因素,可靠基准测试需更大更多样的数据集。

Comments Accepted at the 2026 ICPR Workshop on Workshop on Reproducible Research in Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04574 2026-08-06 cs.CL 新提交 57%

When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents

当记忆“说谎”:VLM智能体中空间记忆过时的实证研究

Yushi Sun, Yanjie Zhang

机构 * Tencent LIGHTSPEED(腾讯光速工作室)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该研究通过动态FrozenLake测试平台,探究了VLM智能体的空间记忆过时问题,发现文本可解性不代表视觉接地、信任过时记忆存在安全隐患、审核无法完全消除差距,明确了相关核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04509 2026-08-06 cs.AI 新提交 57%

CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models

CARGO-VL:面向视觉-语言模型的风险约束组优化反事实仲裁方法

De Jiang, Zhengyang Zhang, Kehong Yuan, Shaohua Ma

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本研究提出CARGO-VL框架,结合XMC资源,通过组相对优化及原对偶控制器,提升视觉-语言模型的反事实仲裁性能,在多基准上优于逐点基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04505 2026-08-06 cs.CL 新提交 57%

K-EXAONE 2.0 Technical Report

K-EXAONE 2.0 技术报告

Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Minhyeok Jung, Doyoung Kim, Heegyu Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Byungoh Ko, Changhun Lee, Dohaeng Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Minwoo Lee, Wonkee Lee, Sangha Park, Sungjune Park, Kwangrok Ryoo, Kijung Seo, Minju Seo, Yongwoo Song, Sejong Yang, Heuiyeen Yeen, Stanley Jungkyu Choi, Yemuk Choi, Yongchan Chun, Jiwon Ham, Dasol Hong, Sujeong Im, Kijeong Jeon, Gerrard Jeongwon Jo, Hyeongjun Jo, Yujin Jo, Jiyeon Jung, Naeun Kang, Daeseong Kim, Euisoon Kim, Hayeon Kim, Hyosang Kim, Myoungshin Kim, Unsol Kim, Youchul Kim, Chaeeun Lee, ChaeYoon Lee, Edward Hwayoung Lee, Honglak Lee, Hwansoo Lee, Minkyung Lee, Sangeun Lee, Solji Lim, Woohyung Lim, Chanwoo Moon, Jueun Mun, Jimin Park, Seojeong Park, Yongmin Park, Hyerin Seo, Donghyeon Shin, Donghyun Son, Eunyong Son, Kaehyun Um, Sihoon Yang, Chang En Yea, Sihyuk Yi, Kyungjae Yoo, Chansik Yoon

机构 * LG AI Research(LG AI研究院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该报告介绍LG AI Research开发的K-EXAONE 2.0,这是一款7500亿参数的MoE多语言基础模型,经升级前代模型而来,支持25.6万token上下文,在多类评估中表现优异,以Apache 2.0许可发布,助力AI生态发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04215 2026-08-06 cs.SE cs.AI 新提交 57%

A Unified Model for Cross-Domain Clone Detection via Model Merging

基于模型合并的跨域代码克隆检测统一模型

Palash R. Roy, Banani Roy, Kevin A. Schneider, Chanchal K. Roy

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过模型合并技术构建跨域代码克隆检测器,经实验验证TIES合并方法泛化性更优,合并后检测器性能优于零样本代码大模型且泛化性更强。

Comments Accepted at ASE 2026

Journal ref Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04071 2026-08-06 cs.AI 新提交 57%

Monte Carlo Tree Search for Table-to-Multimodal Report Generation

面向表格到多模态报告生成的蒙特卡洛树搜索

Teng Lin, Zhiyang Zhang, Yuyu Luo, Nan Tang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03791 2026-08-05 cs.AI 新提交 57%

Does Forgetting Transfer Across Modalities? A Real-World Benchmark for Cross-Modal Knowledge Unlearning Evaluation

遗忘能否跨模态迁移?面向跨模态知识遗忘评估的真实世界基准

Chunlin Liu, Junnian Chen, Haitong Jiang, Jianyu Zhao, Yingsen Pang, Jingchen Li, Jiabiao He, Youming Lu, Jinhe Bi, Yuntao Du

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文针对跨模态知识遗忘迁移研究缺口,推出UNLINK-VL基准,实验发现跨模态遗忘存在不对称性,纯文本遗忘迁移效果差,凸显跨模态遗忘与评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03782 2026-08-05 cs.AI 新提交 57%

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

KnowHal:用于全面多模态幻觉评估的知识驱动基准

Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li, Yuntao Du

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型(MLLMs)的幻觉评估缺口,提出知识驱动的KnowHal基准,涵盖四个幻觉维度,经评估发现知识维度是模型最大挑战,多数模型对错误前提鲁棒性有限。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03731 2026-08-05 cs.AI 新提交 57%

CARE-Bench: Benchmarking Patient-Facing LLM Triage

CARE-Bench:面向患者的大语言模型分诊基准测试

Yining Hua, Hongbin Na, Cyrus Ayubcha

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究推出面向患者的大语言模型分诊基准CARE-Bench,评估11个模型后发现提示可提升多数模型性能但仍存阈值错误,表明患者分诊需明确评估行动时机而非仅靠简单提示。

Comments Code and data are available at GitHub and Hugging Face. Submitted as a preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03588 2026-08-05 cs.PL cs.AI cs.SE 新提交 57%

GenOS: Compositional Certificates for Semantic Robustness in AI Code Generation

GenOS:AI代码生成中语义鲁棒性的组合式证书

Corrado Priami

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 GenOS是针对AI代码生成语义鲁棒性的概率操作语义,通过马尔可夫核与等价关系确保工作流中组件替换的安全性,经实验验证其鲁棒性界与兼容性可测性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03451 2026-08-05 cs.AI 新提交 57%

DataSpace: Benchmarking Data Agents for Verifiable Analytics over Heterogeneous Workspaces

DataSpace:针对异构工作空间可验证分析的数据智能体基准测试

Boyan Li, Zhuowen Liang, Yupeng Xie, Xiaotian Lin, Tianqi Luo, Xinyu Liu, Yizhang Zhu, Zhangyang Peng, Yuan Li, Zhengxuan Zhang, Jiayi Zhang, Nan Tang, Guoliang Li, Yuyu Luo

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究推出DataSpace基准,用于评估异构工作空间下数据智能体的可验证分析能力,包含多类型任务与数据,实验揭示了智能体框架、多模态集成等对准确率的影响,为提升数据智能体可靠性指明了方向。

Comments 8 pages of main text, 7 figures, with a supplementary appendix

详情

展开后加载摘要…

URL PDF HTML 收藏