arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-19 至 2026-05-19 共收录 196 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 66 篇

2605.16458 2026-05-19 cs.CV cs.AI 79%

Conservative AI for Safety-Sensitive Medical Image Restoration: Residual-Bounded CT-CTA Enhancement for Intracranial Aneurysm-Relevant Signal Recovery

安全敏感医学图像修复中的保守AI:用于颅内动脉瘤相关信号恢复的残差受限CT-CTA增强

Weijun Ma

机构 * Independent Researcher(独立研究者) King George, Vancouver School Board(金乔治,温哥华学区) Vancouver, BC, Canada(温哥华,BC省,加拿大)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种残差受限的2.5D修复框架,用于安全敏感的医学图像修复,通过编辑控制图限制修改范围,提升CT和CTA图像质量,减少误诊风险。

Comments Preprint manuscript, 16 pages, 4 figures, 3 tables. This manuscript presents a residual-bounded 2.5D CT/CTA restoration framework for conservative medical image enhancement and evaluates it using image-recovery, baseline comparison, Monte Carlo stability, anatomical localization, and external low-dose CT testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20881 2026-05-19 cs.SE 78%

PseudoBridge: Pseudo Code as the Bridge for Better Semantic and Logic Alignment in Code Retrieval

PseudoBridge: 伪代码作为连接语义与逻辑的桥梁以提升代码检索性能

Yixuan Li, Xinyi Liu, Weidong Yang, Ben Fei, Shuhao Li, Mingjie Zhou, Lipeng Ma

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出PseudoBridge框架,通过引入伪代码作为中间半结构化模态,解决自然语言与编程语言之间的语义和逻辑对齐问题,实验表明其在代码检索任务中表现优异,尤其在零样本场景中效果显著。

Comments 42 pages, 14 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17229 2026-05-19 cs.RO cs.SY eess.SY 78%

Generating Realistic Safety-Critical Scenarios for Vehicle-Pedestrian Interactions

生成车辆-行人交互的安全关键场景

Qingwen Pu, Kun Xie, Yuan Zhu, Guocong Zhai

机构 * Transportation Informatics Lab, Department of Civil and Environmental Engineering, Old Dominion University(交通信息实验室,土木与环境工程系,旧 Dominion 大学) Inner Mongolia Center for Transportation Research, Inner Mongolia University(内蒙古交通研究所,内蒙古大学) School of Transportation and Logistics, National Engineering Laboratory of Integrated Transportation Big Data Application Technology, National and Local Joint Engineering Research Center of Integrated Transportation Intelligence, Southwest Jiaotong University(交通运输学院,国家集成交通大数据应用技术工程实验室,国家与地方联合集成交通智能工程研究中心,西南交通大学)

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出了一种三阶段框架,结合现实数据与自适应模拟,生成大规模行为真实的安全关键场景,通过多智能体状态空间Transformer增强DDPG算法,在车辆-行人交互中实现了高精度的避让行为生成,最终生成了VPSCI数据集。

Comments 49 pages, 13 figures, 11 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01245 2026-05-19 cs.CR 78%

Comprehensive Vulnerability Analysis is Necessary for Trustworthy LLM-MAS

全面的漏洞分析对于可信的LLM-MAS至关重要

Pengfei He, Yue Xing, Juanhui Li, Shen Dong, Zhenwei Dai, Xianfeng Tang, Hui Liu, Han Xu, Zhen Xiang, Charu C. Aggarwal, Hui Liu

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文探讨了构建可信LLM-MAS需进行全面漏洞分析,提出统一框架以量化不同架构中的漏洞,并识别关键挑战如构建专用评估基准和实现安全信任管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17246 2026-05-19 cs.LG cs.AI 76%

Fidelity Probes for Specification--Code Alignment

规范-代码对齐的保真度探针

Ferhat Erata, Hao Zhou, Luke Huan

机构 * AWS Agentic AI(AWS智能AI)

专题命中 安全评测 :alignment(title);分类 cs.AI、cs.LG

AI总结 本文提出保真度探针,通过从参考artifact生成的自然语言问题和代码派生的地面真实答案,从候选规范中回答问题。保真度是同意探针的比例,分解为矛盾率和覆盖缺口率,驱动针对性的规范编辑以达到收敛。在15个程序、约12000行COBOL基准(AWS CardDemo)上,通过八次迭代将冻结测试规范的保真度从0.63提升到0.94,其中平台位置由仅需四次速率数据的两状态马尔可夫固定点$F^\dagger$预测。探针来自LLM读取代码或静态分析管道对其控制流、数据流和系统依赖图的处理,具有可调混合比例。一个带有冻结留出集的探针重采样协议提供了Hoeffding有界的过拟合判别;我们测量的训练/测试差距保持在该包络线下一个数量级。三种基于图的混合提升了保真度16到30分;跨分布评估显示LLM和符号通道在经验上互补。在五个独立LLM家族(Anthropic、DeepSeek、Google、Alibaba、OpenAI)上进行的跨家族生成器扫描确认了收敛行为不依赖于任何单一模型家族:五个非Claude生成器中有三个产生了与马尔可夫固定点预测一致的轨迹,而冻结测试协议主动否定了两个探针分布随迭代变化的生成器。该方法适用于任何应描述相同行为的artifact对。

Comments 29 pages, 14 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16831 2026-05-19 cs.CL cs.AI cs.CR cs.LG 75%

Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs

反学习不是删除:调查机器反学习在大语言模型中的可逆性

Xiaoyu Xu, Xiang Yue, Yang Liu, Qingqing Ye, Huadi Zheng, Peizhao Hu, Minxin Du, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Santa Cruz(加州大学圣克ruz分校) Huawei Technologies(华为技术有限公司) Research Centre for Privacy and Security Technologies in Future Smart Systems, PolyU(未来智能系统中的隐私与安全技术研究中心,PolyU)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示大语言模型反学习的可逆性问题,提出表示层面分析框架,通过PCA相似度、CKA和Fisher信息等指标评估表示漂移,发现四种遗忘模式,指出数据来源影响重学效率,揭示不可逆遗忘的挑战。

Comments ICML 2026, accepted to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13059 2026-05-19 cs.CY cs.AI cs.ET 73%

Prioritizing High-Consequence Biological Capabilities in Evaluations of Artificial Intelligence Models

在评估人工智能模型时优先考虑高后果生物能力

Jaspreet Pannu, Doni Bloomfield, Alex Zhu, Robert MacKnight, Gabe Gomes, Anita Cicero, Thomas V. Inglesby

机构 * Center for Health Security, Bloomberg School of Public Health, Johns Hopkins University(健康安全中心,公共卫生学院,约翰霍普金斯大学) Department of Health Policy, Stanford School of Medicine, Stanford University(健康政策系,斯坦福医学院,斯坦福大学) Department of Chemical Engineering, Carnegie Mellon University(化学工程系,卡内基梅隆大学) Department of Chemistry, Carnegie Mellon University(化学系,卡内基梅隆大学) Wilton E. Scott Institute for Energy Innovation, Carnegie Mellon University(威尔顿·E·斯科特能源创新研究所,卡内基梅隆大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文基于人工智能模型的安全性、安全性和伦理问题,提出在评估人工智能模型时应优先考虑高后果风险,如大规模公众危害(如大流行病),并应在部署前进行评估,以建立针对性的AI安全评估方法,确保工具的安全性和防止潜在危害。

Comments 9 pages, 1 figure, 3 tables, 1 box

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18423 2026-05-19 cs.RO cs.CY 70%

REBAR: Reference Ethical Benchmark for Autonomy Readiness

REBAR:自主性准备的参考伦理基准

Jonathan Diller, David Barnes, Rebekah Bogdanoff, Rhett Collier, Roddy Collins, Keith Fieldhouse, Yonatan Gefen, Cameron Johnson, Anuriha Kodali, Brad Kriel, Varun Murali, James Niehaus, Mish Sukharev, Joseph VanPelt, Anthony Hoogs, Vijay Kumar, Arslan Basharat

机构 * University of Pennsylvania(宾夕法尼亚大学) David Barnes, LLC(大卫·巴恩斯公司) Kitware, Inc.(Kitware公司) Duality Robotics, Inc.(Duality机器人公司) Texas A&M University(德克萨斯大学) Charles River Analytics(查尔斯河分析公司)

专题命中 安全评测 :safety(abstract);red teaming(abstract);分类 cs.CY

AI总结 本文提出REBAR框架,通过严谨测试提供可计算的自主性准备等级,以量化伦理性能并解决现有伦理AI框架的不足。

Comments To be presented at the 2026 Workshop on Robot Ethics - Ethical, Legal and User Perspectives in Robotics and Automation (WOROBET)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17453 2026-05-19 cs.CR cs.CL 70%

Trust No Tool: Evaluating and Defending LLM Agents under Untrusted Tool Feedback

勿信工具:在不可信工具反馈下评估和防御LLM代理

Lecheng Yan, Ruizhe Li, Xicheng Han, Wenxi Li, Binwu Wang, Longyue Wang, Chenyang Lyu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) University of Science and Technology of China(中国科学技术大学) University of Birmingham(伯明翰大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 本研究探讨了在不可信工具反馈环境下评估和防御LLM代理的问题,提出了一种新的失败模式'认知中毒',并介绍了TRUST-Bench基准、GuardedJoint惩罚指标和VISTA-Guard框架,展示了轨迹感知的最终动作评分在安全与效用权衡中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16996 2026-05-19 cs.CL 70%

Evaluation Drift in LLM Personality Induction: Are We Moving the Goalpost?

LLM个性诱导中的评估漂移:我们是否在移动目标?

Prateek Rajput, Yewei Song, Iyiola E. Olatunji, Jacques Klein, Tegawendé F. Bissyandé

机构 * University of Luxembourg(卢森堡大学)

专题命中 安全评测 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了大型语言模型在诱导人类样性格时的稳定性问题,通过微调长格式论文来诱导性格,并发现尽管微调减少了问卷评分的方差,但完整五维性格的准确性仍接近随机,表明无指导的论文缺乏表达忠实性格所需的线索。

Comments 14 pages, 8 main pages, 5 figures, 4 main page figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16993 2026-05-19 cs.CY cs.AI cs.LG 69%

Adversarial Fragility and Language Vulnerability in Clinical AI: A Systematic Audit of Diagnostic Collapse Under Imperceptible Perturbations and Cross-Lingual Drift in Low-Resource Healthcare Settings

临床AI中的对抗脆弱性与语言脆弱性:在低资源医疗环境中对诊断崩溃的系统审计及不可察觉扰动和跨语言漂移的影响

Anthonio Oladimeji Gabriel, Ahmad Rufai Yusuf

机构 * Centre for Clinical Intelligence & Safety(临床智能与安全中心) Tomorrow University of Applied Sciences(明天应用科学大学)

专题命中 安全评测 :safety(abstract,comments);分类 cs.AI、cs.CY、cs.LG

AI总结 本文系统地审计了临床AI在不可察觉扰动和跨语言漂移下的诊断崩溃问题,揭示了对抗脆弱性和语言脆弱性对低资源医疗环境中的临床AI系统的影响。

Comments 23 pages, 9 figures, 3 tables. Code and data available at https://github.com/anthoniooladimeji11-coder/clinical-ai-safety-audit

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15641 2026-05-19 cs.RO cs.CR 67%

Propagating Unsafe Actions in LLM Controlled Multi-Robot Collaboration via Single Robot Compromise

通过单个机器人入侵在LLM控制的多机器人协作中传播不安全行为

Zhen Huang, Zhihuang Liu, Mengxuan Luo, Weishang Wu, Zhiping Cai

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院)

专题命中 安全评测 :alignment(abstract);safety(abstract)

AI总结 本文研究了LLM控制的多机器人协作中的安全问题,提出了一种新型攻击模式,其中攻击者仅通过单个机器人传播恶意意图,导致系统中协调的不安全行为,通过三个指标量化了这一过程,并展示了攻击的高效性和持续性。

Comments Accepted by the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026). 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16354 2026-05-19 cs.LG cs.AI cs.CL cs.HC stat.ML 67%

Augmenting Human Evaluation with LLM Judges: How Many Human Reviews Do You Need?

通过LLM裁判增强人类评估:你真的需要多少人类评审?

Jane Paik Kim

机构 * Department of Psychiatry and Behavioral Sciences(精神病学与行为科学系)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过LLM作为辅助裁判来增强人类评估,通过两阶段抽样设计确定人类和LLM评审样本量,以实现目标统计功效。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18747 2026-05-19 cs.CL cs.AI 62%

Code as Agent Harness

代码作为代理工具

Xuying Ning, Katherine Tieu, Dongqi Fu, Tianxin Wei, Zihao Li, Yuanchen Bei, Jiaru Zou, Mengting Ai, Zhining Liu, Ting-Wei Li, Lingjie Chen, Yanjun Zhao, Ke Yang, Bingxuan Li, Cheng Qian, Gaotang Li, Xiao Lin, Zhichen Zeng, Ruizhong Qiu, Sirui Chen, Yifan Sun, Xiyuan Yang, Ruida Wang, Rui Pan, Chenyuan Yang, Dylan Zhang, Liri Fang, Zikun Cui, Yang Cao, Pan Chen, Dorothy Sun, Ren Chen, Mahesh Srinivasan, Nipun Mathur, Yinglong Xia, Hong Li, Hong Yan, Pan Lu, Lingming Zhang, Tong Zhang, Hanghang Tong, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Meta Stanford University(斯坦福大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了代码在代理系统中的作用,提出了一种统一的视角,将代码视为代理基础设施的基础,并讨论了代理工具接口、机制以及扩展到多代理系统的挑战。

Comments GitHub: https://github.com/YennNing/Awesome-Code-as-Agent-Harness-Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17382 2026-05-19 cs.AI cs.CL cs.GR 62%

QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI

QQJ: 量化定性判断以实现可扩展且与人类对齐的生成AI评估

Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare, Mohammad Sabouri

机构 * AI Lab, Arioobarzan Engineering Team(艾伊罗巴赞工程团队人工智能实验室) Department of Computer Engineering and Information Technology(计算机工程与信息科技系) Department of Informatics, Bioengineering, Robotics and Systems Engineering(信息学、生物工程、机器人与系统工程系) University of Genoa(热那亚大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出QQJ框架,通过专家设计的多维评分标准和高质量标注集校准大语言模型评估器,实现与人类判断一致的可扩展评估方法,验证了结构化定性判断在大规模应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20650 2026-05-19 cs.CL cs.AI cs.CE 62%

FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information

FinTagging: 评估LLM提取和结构化财务信息

Yan Wang, Lingfei Qian, Xueqing Peng, Yang Ren, Keyi Wang, Yi Han, Dongji Feng, Fengran Mo, Shengyuan Lin, Qinchuan Zhang, Kaiwen He, Chenri Luo, Jianxing Chen, Junwei Wu, Chen Xu, Ziyang Xu, Jimin Huang, Guojun Xiong, Xiao-Yang Liu, Qianqian Xie, Jian-Yun Nie

机构 * Georgia Institute of Technology(佐治亚理工学院) Columbia University(哥伦比亚大学) California State University(加州州立大学) University of Montreal(蒙特利尔大学) Carnegie Mellon University(卡内基梅隆大学) Rensselaer Polytechnic Institute(莱斯利理工学院) The University of Manchester(曼彻斯特大学) Harvard University(哈佛大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FinTagging基准,用于评估LLM在提取和结构化财务信息方面的能力,通过分解为FinNI和FinCL两个子任务,揭示了LLM在细粒度概念链接上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17304 2026-05-19 cs.LG cs.CL 62%

Compress the Context, Keep the Commitments: A Formal Framework for Verifiable LLM Context Compression

压缩上下文,保持承诺:可验证大语言模型上下文压缩的正式框架

Natalia Trukhina, Vadim Vashkelis

机构 * Embedded Intelligence Lab (EMILAB)(嵌入式智能实验室)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Context Codec框架,通过语义层面的压缩方法,确保在压缩对话历史时保留关键承诺,解决现有方法在压缩过程中缺乏对语义承诺保留的明确规范的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16650 2026-05-19 cs.CL cs.AI 62%

SKG-Eval: Stateful Evaluation of Multi-Turn Dialogue via Incremental Semantic Knowledge Graphs

SKG-Eval: 通过增量语义知识图谱进行多轮对话的有状态评估

Avijit Shil, Suman Samui

机构 * Maulana Abul Kalam Azad University of Technology(Maulana Abul Kalam Azad 工业技术大学) National Institute of Technology Durgapur(Durgapur 国家理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SKG-Eval框架,通过增量语义知识图谱模型,解决多轮对话评估中长距离不一致问题,提供可解释的评估信号和可复现的评分结果。

Comments 36 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14381 2026-05-19 cs.LG cs.CL 62%

NodeSynth: Socially Aligned Synthetic Data for AI Evaluation

NodeSynth: 为AI评估的社会协同合成数据

Qazi Mamunur Rashid, Xuan Yang, Zhengzhe Yang, Yanzhou Pan, Erin van Liemt, Darlene Neal, Kshitij Pancholi, Jamila Smith-Loud

机构 * Google Research USA(谷歌研究美国分公司) Google USA(谷歌美国分公司) Google Deepmind USA(谷歌深Mind美国分公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG

AI总结 NodeSynth通过结合现实证据的细粒度分类扩展,生成社会相关合成查询,提升AI模型在敏感领域评估的准确性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10102 2026-05-19 cs.IR cs.AI cs.CL 62%

Trustworthiness in Retrieval-Augmented Generation Systems: A Survey

检索增强生成系统中的可信度:综述

Yujia Zhou, Wenbo Zhang, Jingying Shao, Yan Liu, Xiaoxi Li, Jiajie Jin, Hongjin Qian, Zheng Liu, Chaozhuo Li, Jason Chen Zhang, Zhicheng Dou, Philip S. Yu, Jiaxin Mao

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Hong Kong Polytechnic University(香港理工大学) Microsoft Research Asia(微软亚洲研究院) University of Illinois(伊利诺伊大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了检索增强生成系统中可信度的关键维度,提出Trust-RAG Compass框架,评估事实性、鲁棒性等六个方面,并建立评估基准,揭示不同LLM在可信度方面的性能差异,指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16372 2026-05-19 cs.CV cs.AI cs.LG 62%

SwordBench: Evaluating Orthogonality of Steering Image Representations

SwordBench:评估转向图像表示的正交性

Vladimir Zaigrajew, Dawid Pludowski, Hubert Baniecki, Przemyslaw Biecek

机构 * Centre for Credible AI(可信人工智能中心) Warsaw University of Technology(华沙技术大学) University of Warsaw(华沙大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SwordBench,用于评估视觉模型在多个backbone和概念移除任务中转向表示的正交性,引入了交叉概念鲁棒性和 collateral damage 等新评估指标,发现线性SVM在分离性和正交性上优于稀疏自编码器,但无法实现零 collateral damage。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16278 2026-05-19 cs.CY cs.AI cs.HC 62%

Keeping an Eye on AI: A Framework for Effective Human Oversight of AI Systems

关注人工智能:一种有效的人工智能系统人类监督的框架

Susanne Gaube, Markus Langer, Tim Miller, Kevin Baum, Raimund Dachselt, Anna Maria Feit, Ujwal Gadiraju, Harmanpreet Kaur, Mark T. Keane, Richard Landers, Johann Laux, Q. Vera Liao, Brian Lim, Linda Onnasch, Tim Schrills, Liz Sonenberg, Chenhao Tan, Nava Tintarev, Ziang Xiao, Hanwei Zhang

机构 * University College London(伦敦大学) University of Freiburg(弗赖堡大学) University of Queensland(昆士兰大学) Saarland University(萨尔兰大学) TU Dresden(德累斯顿技术大学) Delft University of Technology(代尔夫特理工大学) University of Minnesota(明尼苏达大学) University College Dublin(都柏林大学) University of Oxford(牛津大学) University of Michigan(密歇根大学) National University of Singapore(新加坡国立大学) Technische Universität Berlin(柏林技术大学) University of Lübeck(吕贝克大学) University of Melbourne(墨尔本大学) University of Chicago(芝加哥大学) Maastricht University(马斯特里赫特大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一个跨学科框架,用于有效的人工智能系统人类监督,定义了监督架构和流程,并探讨了该领域需要考虑的开放性研究挑战。

Comments The conceptual analysis for this work was undertaken by the authors at Dagstuhl seminar 25272 'Challenges of Human Oversight: Achieving Human Control of AI-Based Systems' (https://www.dagstuhl.de/25272), held at Schloss Dagstuhl (June 29th-July 4th, 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16268 2026-05-19 cs.HC cs.AI cs.LG 62%

Helping Customers in Distress: An LLM-powered Agent that Converses, Probes, and Routes

帮助陷入困境的客户:一个基于LLM的代理,能够对话、探测和分流

Alankar Atreya, Stefan Sylvius Wanger, Devesh Batra, Robert Hankache, Cristovao Iglesias, Patrick Sinclair, Giulio Pelosio, Michael McMillan, Greig A. Cowan, Raad Khraishi

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一个基于LLM的AI分流代理,通过多轮对话和提问提高客户问题分类准确性,提升银行客户服务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18593 2026-05-19 cs.CR cs.AI cs.RO 57%

Not What You Asked For: Typographic Attacks in Household Robot Manipulation

并非你所要求的:家庭机器人操作中的字体攻击

Ali Iranmanesh, Peng Liu

机构 * Cyber Security Lab(网络安全实验室) The Pennsylvania State University(宾夕法尼亚州立大学) State College, USA(州立学院,美国)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本研究探讨了字体攻击对家庭机器人操作全流程的影响,提出了一种解耦感知架构,并发现感知错误会通过持久的3D语义地图导致物理性故障,揭示了字体误分类对机器人安全性的实际威胁。

Comments 10 pages, 1 figure, IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18504 2026-05-19 cs.CL 57%

Ancient Greek to Modern Greek Machine Translation: A Novel Benchmark and Fine-Tuning Experiments on LLMs and NMT Models

古希腊语到现代希腊语机器翻译:一种新的基准和对LLM和NMT模型的微调实验

Spyridon Mavromatis, Sokratis Sofianopoulos, Prokopis Prokopidis, Maria Giagkou

机构 * National and Kapodistrian University of Athens, Department of Informatics and Telecommunications(雅典国家和卡普迪斯特里亚大学信息与电信系) Institute for Language and Speech Processing, Athena RC(语言与语音处理研究所,雅典RC)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种新的基准测试,并对LLM和NMT模型进行了微调实验,以解决古希腊语到现代希腊语的低资源机器翻译问题,展示了微调在提升翻译性能上的显著效果。

Comments 14 pages. Accepted for presentation at the 15th Language Resources and Evaluation Conference (LREC 2026), Palma, Mallorca, Spain

Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pp. 8685-8698. European Language Resources Association (ELRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08080 2026-05-19 cs.LG cs.NE stat.AP 57%

Symbolic Quantile Regression for the Interpretable Prediction of Conditional Quantiles

符号量化回归用于条件量化可解释性预测

Cas Oude Hoekstra, Floris den Hengst

机构 * Independent researcher(独立研究者) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种符号量化回归方法,用于预测条件量化并解释预测变量对结果的影响,通过在航空燃料使用案例中比较预测极值和中央结果的模型,展示了SQR在高风险应用中的有效性。

Journal ref Transactions on Machine Learning Research, May 2026, https://openreview.net/pdf?id=x9OYbyPJOG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18025 2026-05-19 cs.AI 57%

TeleCom-Bench: How Far Are Large Language Models from Industrial Telecommunication Applications?

TeleCom-Bench: 大型语言模型在工业电信应用中还有多远?

Jieting Xiao, Yun Lin, Huizhen Qiu, Rui Ma, Chen Zhong, Dongyang Xu, Xiao Long, Chaoyu Zhang, Qiaobo Hao, Ding Zou, Zhiguo Yang, Yanqin Gao, Fang Tan

机构 * ZTE Corporation(中兴通讯)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出TeleCom-Bench,一个包含12个评估集和22678个精选样本的全面基准,旨在评估大型语言模型在电信领域的综合能力,揭示其在工业流程中的执行能力缺口。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17911 2026-05-19 cs.CL 57%

A Pilot Benchmark for NL-to-FOL Translation in Planetary Exploration

行星探测中自然语言到一阶逻辑翻译的试点基准

Hayden Moore, Suman Saha, Mahfuza Farooque

机构 * Department of Computer Science and Engineering, College of Engineering, The Pennsylvania State University(计算机科学与工程系,工程学院,宾夕法尼亚州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出一个试点基准,用于在行星探测领域将自然语言转换为一阶逻辑,通过NASA PDS的实测文档构建数据集,并手动标注FOL表示,以支持语言理解和形式推理的交叉研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17611 2026-05-19 cs.SE cs.LG 57%

A Feature-Driven Framework for Software Fault Prediction

基于特征的软件故障预测框架

Ahmad Nauman Ghazi, Nagajyothi Devarapalli, Ashir Javeed, Sadi Alawadi, Fahed Alkhabbas, Khalid AlKharabsheh

机构 * Department of Software Engineering(软件工程系) Blekinge Institute of Technology(布莱金厄理工大学) Department of Computer Science(计算机科学系) Malmö University(马尔默大学) Al-Balqa Applied University(阿尔巴卡应用大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文研究了特征选择和参数调优对机器学习模型在软件故障预测中的性能影响,通过结合相关性特征选择、递归特征消除、互信息和L1正则化等方法,以及网格搜索、随机搜索和遗传算法等优化技术,提升了故障预测的准确性,达到了88.40%的准确率,比基线模型提高了18%。

Comments Pages 1-9, Preprint, Accepted for publication in FLICS2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09609 2026-05-19 cs.AI cs.RO 57%

General-purpose LLMs as Models of Human Driver Behavior: The Case of Simplified Merging

通用大语言模型作为人类驾驶员行为模型:简化合并案例

Samir H. A. Mohammad, Wouter Mooi, Arkady Zgonnikov

机构 * Department of Transport and Planning, Delft University of Technology(代尔夫特理工大学交通与规划系) Department of Cognitive Robotics(认知机器人学系)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文研究了通用大语言模型在模拟人类驾驶员行为中的应用,通过在简化的一维合并场景中嵌入两个通用大语言模型,并与人类数据进行定量和定性分析,发现模型在间歇性操作控制和空间线索战术依赖方面能再现人类行为,但在动态速度线索响应和安全性能方面存在差异,提示未来需进一步研究其失效模式以确保其作为人类驾驶行为模型的有效性。

Comments To be published in proceedings of IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏