arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 930 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 930 篇

2606.25651 2026-06-29 cs.CL 新提交 57%

MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction

MedGuards: 用于可靠医疗错误检测与纠正的多智能体系统

Congbo Ma, Hu Wang, Yichun Zhang, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) Khalifa University(哈利法大学) New York University(纽约大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 提出MedGuards框架,通过多智能体上下文学习与置信度引导仲裁机制,无需额外训练即可检测、定位和纠正医疗文本错误,并引入关键词优先纠正评分(KPCS)评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15708 2026-06-29 cs.AI 新提交 57%

Artificial Intelligence Index Report 2026

人工智能指数报告2026

Sha Sajadieh, Loredana Fattorini, Raymond Perrault, Yolanda Gil, Vanessa Parli, Lapo Santarlasci, Juan Pava, Nestor Maslej, Russ Altman, Erik Brynjolfsson, Carla Brodley, Jack Clark, Virginia Dignum, Vipin Kumar, James Landay, Terah Lyons, James Manyika, Juan Carlos Niebles, Yoav Shoham, Elham Tabassi, Russell Wald, Toby Walsh, Dan Weld

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本报告追踪AI在推理、安全及现实任务执行方面的测试进展,分析治理框架、评估方法与技术发展之间的差距,并新增AI在科学与医学领域的独立章节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27174 2026-06-26 cs.LG 新提交 57%

RecallRisk-BERT: A Multi-Task Framework for Post-Report Medical Device Recall Triage

RecallRisk-BERT:用于报告后医疗器械召回分类的多任务框架

Ali Semih Atalay, Sevgi Yigit-Sert

机构 * Department of Computer Engineering, Faculty of Engineering, Ankara University(安卡拉大学工程学院计算机工程系)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 提出RecallRisk-BERT多任务模型,联合预测召回严重等级和根因类别,在FDA数据集上优于单任务基线,支持可扩展的召回分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26922 2026-06-26 cs.RO cs.AI 新提交 57%

Risk-Aware Selective Multimodal Driver Monitoring with Driver-State World Modeling

风险感知的选择性多模态驾驶员监控与驾驶员状态世界建模

Daosheng Qiu, Haozhuang Chi, Hao Su, Shu Long, Xinyue Miao, Yongle Dong, Wei Zhang

机构 * Hubei University(湖北大学) Nanyang Technological University(南洋理工大学) Osaka University(大阪大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出成本感知的选择性推理框架,结合轻量级RGB-生理学生网络和门控机制,在低延迟下减少不安全决策,实现可部署的多模态驾驶员监控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26794 2026-06-26 cs.CV cs.AI 新提交 57%

ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

ReasonCLIP-58M: CLIP的视觉基础常识推理监督

Sicheng Zhang, Muzammal Naseer, Binzhu Xie, Naufal Suryanto, Shi Qiu, Jamal Bentahar, Naveed Akhtar, Mubarak Shah

机构 * Khalifa University(卡利法大学) University of Western Australia(西澳大学) The Chinese University of Hong Kong(香港中文大学) University of Melbourne(墨尔本大学) University of Central Florida(佛罗里达中央大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出ReasonCLIP-58M框架,通过两阶段策略将大规模推理监督集成到CLIP模型中,构建ReasonLite-42M和ReasonPro-16M数据集及RCLIP-Bench基准,提升视觉基础常识推理和零样本检索性能。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26566 2026-06-26 cs.CR cs.CL 新提交 57%

Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models

跨模态对抗扩散:文本、视觉与视觉-语言模型的攻击、防御与评估融合综述

Abrar Alotaibi, Moataz Ahmed

机构 * Information and Computer Science Department, King Fahd University of Petroleum & Minerals(国王法赫德石油矿物大学信息与计算机科学系) College of Computer Science and Information Technology, Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·法伊塞尔大学计算机科学与信息科技学院) SDAIA-KFUPM Joint Research Center for Artificial Intelligence, King Fahd University of Petroleum & Minerals(SDAIA-KFUPM人工智能联合研究中心,国王法赫德石油矿物大学)

专题命中 安全评测 :jailbreak(abstract);分类 cs.CL

AI总结 本文整合了文本、图像分类器和视觉-语言模型上的对抗攻击与防御研究,提出统一分类法和评估框架,并识别了当前文献中的五个常见弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26346 2026-06-26 cs.AI 新提交 57%

How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?

工具增强的LLM智能体在真实世界能源分析任务中的表现如何?

David Akinpelu, Akintonde Abbas, Rereloluwa Alimi, Ayodeji Lana

机构 * Independent Researcher(独立研究员) Tume AI

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对能源领域缺乏智能体评估基准的问题,构建了包含243个专家策划问题的测试环境,评估工具增强的LLM智能体在数据检索、知识解释和定量建模三类任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25894 2026-06-25 cs.CV cs.AI 新提交 57%

Enhancing Brain MRI Anomaly Detection and Reasoning with ROI Rethink and Synthetic Data

通过ROI重思考与合成数据增强脑部MRI异常检测与推理

Shangkun Li, Jie Xu, Yi Guo, Zeju Li, Yuanyuan Wang

机构 * College of Biomedical Engineering, Fudan University(复旦大学 生物医学工程学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出BrReMark框架,通过显式区域标记和假设验证机制增强脑部MRI诊断的可信度,结合结构化推理轨迹的监督微调和强化学习,以及基于域随机化的病理合成增强,显著提升定位精度并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25819 2026-06-25 cs.CL cs.SE 新提交 57%

Beyond Function Calling: Benchmarking Tool-Using Agents under Tool-Environment Unreliability

超越函数调用:工具环境不可靠性下的工具使用智能体基准测试

Yang Tian, Zhengpeng Shi, Yu Zhou, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 提出ToolBench-X基准,在工具环境中注入五种可恢复可靠性风险,评估智能体任务完成能力,发现可靠工具下表现良好的智能体在可恢复风险下失败,失败主因是诊断和恢复能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25529 2026-06-25 cs.SD cs.AI 新提交 57%

STEB: A Speech-to-Speech Translation Expressiveness Benchmark for Evaluating Beyond Translation Fidelity

STEB:用于评估超越翻译保真度的语音到语音翻译表现力基准

Sitong Cheng, Weizhen Bian, Songjun Cao, Jin Li, Bei Liu, Chunyang Jiang, Yike Zhang, Weihao Wu, Yiming Li, Chi-Min Chan, Long Ma, Wei Xue

机构 * Hong Kong University of Science and Technology(香港科技大学) Tencent Youtu Lab(腾讯优图实验室) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出STEB基准,通过描述-总结框架评估语音到语音翻译在情感、场景风格和非语言发声方面的表现力,发现现有系统在语义保真度上表现良好但表现力保留不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25445 2026-06-25 cs.CV cs.AI 新提交 57%

C3-Bench: A Context-Aware Change Captioning Benchmark

C3-Bench:一种上下文感知的变化描述基准

Jae-Woo Kim, Hyeongbeom Kim, Ue-Hwan Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出C3-Bench基准,包含51种真实变化场景的4996对图像,并首次引入LLM-as-Judge评估框架,揭示现有模型在非训练分布场景下的系统性盲点。

Comments ECCV 2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25396 2026-06-25 cs.AI 新提交 57%

Long-Term Simulation Exposes Cognitive-Developmental Risks in AI Companions

长期模拟揭示AI伴侣的认知发展风险

Kaicheng Shen, Lingyu Li, Wen Wu, Yan Teng, Liang He, Yingchun Wang

机构 * Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海人工智能教育研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出TSJ框架,通过角色驱动用户模拟、动态心理状态更新和回顾性评估,在12,960模拟人天交互中揭示短期测试低估长期认知发展风险,并识别出幼儿期和成年初期为最脆弱阶段。

Comments 19 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19887 2026-06-25 cs.CR cs.AI 新提交 57%

FinRED: An Expert-Guided Benchmark Generation and Evaluation Framework for Financial LLM Red-Teaming

FFinRED:面向金融大语言模型红队测试的专家引导基准生成与评估框架

Chaeyun Kim, Daeyoung Park, Junghwan Kim, Jinyoung Jeong, Eunji Song, Yongtaek Lim, Minwoo Kim

机构 * DATUMO INC.(DATUMO公司) Korea Advanced Institute of Science and Technology (KAIST)(韩国先进科学研究院) Financial Security Institute (FSI)(金融安全研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出FinRED框架,通过专家引导的两级分类法将全球金融标准映射为威胁,并利用真实金融文档生成上下文丰富的红队行为提示,结合专家验证的评估标准,有效降低关键假阴性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24797 2026-06-24 cs.CV cs.AI 新提交 57%

EG-VQA: Benchmarking Verifiable Video Question Answering with Grounded Temporal Evidence

EG-VQA: 基于接地时间证据的可验证视频问答基准

Linpeng Huang, Weixing Chen, Zexin Chen, Yang Liu, Liang Lin

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Shenzhen University(深圳大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出EG-VQA基准,通过细粒度时间证据标注和EG-F1指标,揭示视频大模型在答案正确性与证据定位之间的差距,并引入EG-Reasoner模型弥合这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24716 2026-06-24 cs.CV cs.AI 新提交 57%

Evaluating the Interpretability of Sparse Autoencoders with Concept Annotations

评估稀疏自编码器与概念标注的可解释性

Jonas Klotz, Cassio F. Dantas, Pallavi Jain, Diego Marcos, Begüm Demir

机构 * The Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所) Technische Universität Berlin(柏林工业大学) INRAE(法国国家农业、食品与环境研究院) Inria, EVERGREEN(法国国家信息与自动化研究所,EVERGREEN) UMR TETIS, Univ Montpellier(UMR TETIS,蒙彼利埃大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出一种基于人类标注的评估框架,通过合成基准和二分匹配方法量化稀疏自编码器潜在变量与概念的对齐,并验证可解释性。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24619 2026-06-24 cs.AI 新提交 57%

When CQs Go Wrong: Challenges in CQ Verification with OE-Assist

当CQ出错时:OE辅助下CQ验证中的挑战

Anna Sofia Lippolis, Mohammad Javad Saeedizade, Robin Keskisärkkä, Aldo Gangemi, Eva Blomqvist, Andrea Giovanni Nuzzolese

机构 * University of Bologna(博洛尼亚大学) ISTC-CNR(意大利国家研究委员会认知科学与技术研究所) Linköping University(林雪平大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究能力问题(CQ)验证中的挑战,通过19名参与者使用LLM助手进行20项任务的实验,发现CQ的歧义和复杂性导致验证困难,提出需在发布前优化CQ以避免问题。

Comments Acceted poster at accepted-papers/poster-demo/" target="_blank" rel="noopener">https://2026.eswc-conferences.org/program/accepted-papers/poster-demo/ 23rd European Semantic Web Conference (Satellite Event)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24575 2026-06-24 cs.AI 新提交 57%

Quant Convergence: Bridging Classical Value Investing and Modern Factor Models for Systematic Equity Selection

量化收敛:连接经典价值投资与现代因子模型进行系统性股票选择

Augusto Eiji Yamazaki, Hugo Garrido-Lestache Belinchon

机构 * Milwaukee School of Engineering(密尔沃基工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究通过将格雷厄姆经典价值投资规则作为数学低通滤波器,结合现代因子模型,在S&P 500数据上测试XGBoost和AutoGluon等复杂模型,发现纯格雷厄姆随机森林实现了最高收益(232.13%)和较低风险,证明了价值投资规则能有效约束现代AI过度冒险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24420 2026-06-24 cs.CL 新提交 57%

Beyond Logprobs: A Multi-Signal Confidence Engine for LLM-Based Document Field Extraction

超越Logprobs:基于LLM的文档字段提取的多信号置信度引擎

Nitesh Kumar

机构 * Perfios Software Solutions Pvt. Ltd.(Perfios软件解决方案私人有限公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 提出ExtractConf,通过双视角文档解析(字段引导与文档引导)的不一致性,融合多信号实现高可靠置信度估计,在DocILE上AUC达0.928,准确率99.1%。

Comments Extended version of a paper accepted (Oral) at the RobustifAI Workshop, IJCAI-ECAI 2026, Bremen, Germany. 9 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24145 2026-06-24 cs.AI 新提交 57%

T2D-Bench: Evidence-Gated Evaluation of LLM Outputs for Type 2 Diabetes Using a Multi-Layer Clinical-Lifestyle Knowledge Graph

T2D-Bench:基于多层临床-生活方式知识图谱的2型糖尿病LLM输出证据门控评估

Saba A. Farahani, Hung Cao, Ramesh Jain, Amir M. Rahmani

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出T2D-Bench基准,通过多层知识图谱和证据门控机制,检测LLM输出中未满足指南约束的临床遗漏,并在2型糖尿病诊断、用药安全等场景中实现可测量纠正。

Comments 7 pages, 2 figures, 2 tables. Accepted as a poster at AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23763 2026-06-24 cs.CV cs.AI 新提交 57%

Listening makes Vision Clear for VLMs

倾听使VLMs视觉清晰

Yiyang Chen, Yixin Tan, Binrui Shen

机构 * Beijing Normal University(北京师范大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对视觉语言模型解码漂移导致注意力分布与语义不一致的问题,提出基于提示侧语义的PV-TAM方法,通过过滤模态边界标记偏差并利用注意力峰值分布评估提示与视觉区域对齐,显著提升定位指标。

Comments 18pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19910 2026-06-24 cs.CL cs.SD eess.AS 新提交 57%

Light-weight Pronunciation Assessment via Discrete Speech Token Surprisal

轻量级发音评估:基于离散语音标记的意外度

Syeda Faiza Ahmed Sara, Shammur Absar Chowdhury

机构 * Qatar Computing Research Institute, Doha, Qatar(卡塔尔计算研究所,多哈,卡塔尔)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出仅使用母语语音资源训练的轻量级发音评估框架,通过离散化语音标记和语言模型计算意外度,结合文本引导对齐特征,在无监督或少量校准下达到接近监督方法的性能。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23125 2026-06-23 eess.SP cs.AI 新提交 57%

AI-Empowered UAV-Assisted Backscatter Localization and ISAC for Zero-Energy IoT: A Comprehensive Survey

AI赋能的无人机辅助反向散射定位与通感一体化技术用于零能耗物联网:综述

Ruhul Amin Khalil

机构 * Engineering Requirements Unit (ERU), College of Engineering, United Arab Emirates University(工程需求单位(ERU)、工程学院、阿联酋大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文综述了AI赋能的无人机辅助反向散射定位与通感一体化技术在零能耗物联网中的应用,梳理了网络架构、无人机角色、反向散射模式等关键技术,并分析了开放挑战与未来方向。

Comments 33 pages, 19 figures, 7 tables. Submitted to Elsevier for Possible Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23583 2026-06-23 cs.CL 新提交 57%

Evaluation Awareness Is Not One Capability: Evidence from Open Language Models

评估意识并非单一能力:来自开放语言模型的证据

Nilesh Nayan, Aishwarya Sampath Kumar, Rishiraj Girmal, Shivani Anilkumar, Sankaran Vaidyanathan, David A. Nader Palacio, Reshmi Ghosh, Soundararajan Srinivasan

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) Microsoft Corp.(微软公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 通过37个开放权重模型实验,发现语言模型对评估线索的检测、行为变化和表征可控性三个维度弱耦合,表明评估意识是多维的,单一分数无法可靠预测部署安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22925 2026-06-23 cs.LG cs.NE 新提交 57%

EEG Benchmarking Needs a Task Specification Layer: NeuroDoc for Rulebook-Guided, Executable Benchmark Construction

EEG基准测试需要一个任务规范层:NeuroDoc用于基于规则手册的可执行基准构建

Chengxuan Qin, Zhige Chen, Shu Peng, Rui Yang, Jiping Cui, Yikai Dong, Jun Li, Liu Peng, Zhida Shang, Mingze Tang, Kay Chen Tan, Jibin Wu

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) School of Electrical Engineering, Electronics and Computer Science, University of Liverpool(利物浦大学电气工程、电子与计算机科学学院) School of Computer Science and Informatics, University of Liverpool(利物浦大学计算机科学与信息学学院) Department of Data Science and Artificial Intelligence, Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 提出NeuroDoc框架,通过结构化任务规范语言和共享规则手册,将异构EEG数据集标准化为可重用基准单元,并发布包含53个条目、245个任务定义的社区审查基准语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22613 2026-06-23 cs.AI 新提交 57%

SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment

SkillAudit:从固定套件基准测试到以技能为中心的评估

Dexu Yu, Youhua Li, Zhaoyang Guan, Xianhao Lin, Jining Luan, Zihao Rao, Xuanqi Lan, Yang Ran, Bo Lan, Nai-Xin Zhai, Hanwen Du, Junchen Fu, Wenhao Deng, Yongxin Ni, Chunxiao Li

机构 * Northeastern University(东北大学) City University of Hong Kong(香港城市大学) Northwestern University(西北大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Santa Clara University(圣克拉拉大学) Fenz AI Ohio State University(俄亥俄州立大学) University of Glasgow(格拉斯哥大学) National University of Singapore(新加坡国立大学) DeciLix Lab(DeciLix实验室)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出SkillAudit框架,自动生成技能的多维度评估报告,涵盖效用、效率/成本和安全性,通过基线比较和两阶段检测解决固定套件评估的不足。

Comments Preprint. Project page: https://skillaudit.github.io/. Code and evaluation artifacts: https://github.com/SkillAudit/skillaudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21445 2026-06-23 cs.AI 新提交 57%

AutoRAS: Learning Robust Agentic Systems with Primitive Representations

AutoRAS: 学习具有原始表示的鲁棒智能系统

Yang Yue, Xuancheng Zhu, Yuyang Ma, Guoshun Nan, Zihan Dou, Jingru Shan, Congyu Guo, Ji Zhang, Hua Wang, Jingfeng Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Guangxi Transportation Science and Technology Group Co., Ltd.(广西交通科技集团有限公司) Fudan University(复旦大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出AutoRAS框架,通过生成符号原始序列并利用执行安全信号和流式序列级目标优化,自动设计鲁棒智能系统,在正常和对抗设置下均表现最佳。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21102 2026-06-23 cs.CY 新提交 57%

Incoherent Values? Probing LLM Preferences Through Parametric Variation

不一致的价值?通过参数变化探测LLM的偏好

Elena Ajayi, Angelica Chowdhury, Seth Lazar

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

AI总结 本文通过参数化变体测试LLM的价值一致性,发现即使最强模型也存在显著不一致,且一致性不随能力提升而出现,但允许推理时间可减少不一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21078 2026-06-23 cs.CL 新提交 57%

A Validation-Gated Mechanistic Account of Suicidality Detection in LLMs

一种验证门控机制的自杀检测在LLMs中的解释

Nafiz Ahmed, Sarah Sharif, Dingjing Shi, Mike Banad

机构 * Intelligent Neuromorphic and Quantum Understanding for Innovative Research and Engineering (INQUIRE) Lab(智能神经形态与量子理解创新研究与工程实验室) School of Electrical and Computer Engineering(电气与计算机工程学院) University of Oklahoma(俄克拉荷马大学) School of Psychology(心理学学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 提出验证门控框架,通过因果分析发现Llama-3.1-8B-Instruct在自杀检测中依赖语义特征而非关键词,且该特征在多个模型和数据集中一致出现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21015 2026-06-23 cs.AI 新提交 57%

The AI Evaluability Gap: The Missing Layer for Managing Risk and Sustaining Value

AI可评估性差距:管理风险和维持价值缺失的层面

Vishal Srivastava, Tanmay Sah

机构 * Harrisburg University of Science and Technology(哈里斯堡科技大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出AI可评估性差距概念,指组织缺乏足够证据支持高风险治理决策,引入可评估性框架,区分运营认证和投资认证,强调证据充分性是AI治理缺失的层面。

Comments 24 pages, 9 figures. Conceptual framework paper introducing the AI Evaluability Gap, Evaluability as evidence sufficiency for governance decisions, Operational Certification, Investment Certification, and a six-property evidence lifecycle for AI governance

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20776 2026-06-23 cs.SE cs.AI cs.NE 新提交 57%

Formally Verified Code Synthesis for Structured Data Translation in a Medical Internet of Things

医疗物联网中结构化数据翻译的形式化验证代码合成

Colin Samplawski, Adam D. Cobb

机构 * Computer Science Laboratory, SRI International(SRI国际计算机科学实验室)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 提出一种基于LLM的进化代码合成系统,集成形式化验证步骤,用于医疗物联网中结构化数据翻译,确保生成代码满足预定义需求,并以脉搏血氧仪集成案例展示其低开销生成正确翻译的能力。

Comments Spotlight Paper at the Workshop on Structured Data for Health at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏