Toward Comprehensive Risk Assessments and Assurance of AI-Based Systems
迈向基于AI系统的全面风险评估与保证
专题命中 安全评测 :safety(abstract);分类 cs.CY
AI总结 针对AI系统部署带来的新风险,本文提出一个整合运行设计域(ODD)的端到端AI风险框架,以统一术语、改进风险评估,确保安全部署。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
迈向基于AI系统的全面风险评估与保证
专题命中 安全评测 :safety(abstract);分类 cs.CY
AI总结 针对AI系统部署带来的新风险,本文提出一个整合运行设计域(ODD)的端到端AI风险框架,以统一术语、改进风险评估,确保安全部署。
构建面向空间生命科学、航空航天医学和深空探测的AI就绪数据系统
机构 * Blue Marble Space ; Computational and Systems Biology(计算与系统生物学) ; Trivedi Institute for Space and Global Biomedicine(Trivedi空间与全球医学研究所) ; Wellcome Sanger Institute(Wellcome桑格研究所) ; University of Cambridge(剑桥大学) ; Department of Systems Biology, Harvard Medical School(哈佛医学院系统生物学系) ; Amentum, Space Biosciences Division, NASA Ames Research Center(Amentum空间生物学 division, NASA Ames研究中心) ; Massachusetts Institute of Technology(麻省理工学院) ; Crown Point Technologies, Inc(Crown Point Technologies公司) ; BiosView Labs ; Directorate of Human and Robotic Exploration, European Space Agency(欧洲航天局人类和机器人探索部门) ; Texas State University(德克萨斯州立大学) ; McGowan Institute for Regenerative Medicine, Department of Surgery, University of Pittsburgh School of Medicine(McGowan再生医学研究所,匹兹堡大学医学院外科系) ; Center for Space Biomedicine, Trivedi Institute for Space and Global Biomedicine(空间生物医学中心,Trivedi空间与全球医学研究所) ; Department of Bioengineering, University of Pittsburgh(匹兹堡大学生物工程系) ; Stanley Center for Psychiatric Research, Broad Institute of MIT and Harvard(Stanley精神医学研究中心,MIT和哈佛Broad研究所) ; Department of Systems and Computational Biomedicine and WorldQuant Initiative, Weill Cornell Medicine(系统与计算生物医学系及WorldQuant计划,Weill Cornell医学院) ; San Diego Supercomputer Center, University of California San Diego(圣地亚哥超级计算机中心,加州大学圣地亚哥分校) ; Weill Institute for Neurosciences, Department of Neurology, University of California San Francisco(Weill神经科学研究所,加州大学旧金山分校神经病学系) ; Science for Life Laboratory, Department of Gene Technology, KTH Royal Institute of Technology(Science for Life实验室,基因技术系,皇家理工学院) ; European Molecular Biology Laboratory, European Bioinformatics Institute (EMBL-EBI)(欧洲分子生物学实验室,欧洲生物信息研究所(EMBL-EBI))
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 针对空间生物学数据异构性阻碍AI应用的问题,提出从FAIR到AI就绪再到空间就绪的三层数据架构,并建议建立国际协调机构以支持深空生物学研究。
Comments 26 pages, 3 figures, 1 table, 1 supplementary table
零标签驾驶场景复杂度检测基于联合嵌入预测架构
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 提出无监督方法,利用联合嵌入预测架构(JEPA)在无标签数据上通过时间预测误差作为零样本复杂度指标,有效区分复杂与简单驾驶场景。
Comments 12 pages, 6 figures
CAMI:成本感知的智能体引导多索引语义检索
机构 * IBM Software Innovation Lab India(IBM软件创新实验室印度)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出CAMI框架,将多索引构建形式化为预算约束的多目标组合选择问题,通过智能体发现、原子单元搜索和置信度感知调度,在严格预算下系统性地识别高召回率索引组合,相比标准基线召回率提升9.4%,预算减少5倍。
Comments Accepted to ACM CAIS 2026
Agent libOS: 一种受库操作系统启发的运行时,用于长时间运行、能力受控的LLM智能体
机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出Agent libOS运行时,将LLM智能体建模为具有进程标识、生命周期、能力控制和审计记录的AgentProcess,通过类似libc的工具包装和运行时原语边界实现安全调度与资源控制。
Comments 12 pages, 1 figure, 4 tables
EPIC-EuroParl-UdS:翻译与解读的信息论视角
机构 * Saarland University(萨尔兰大学) ; University of Hildesheim(希尔德斯海姆大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文介绍了更新和结合的双向英语-德语EPIC-UdS(口语)和EuroParl-UdS(书面)语料库,包含原始欧洲议会演讲及其翻译和解读。新版本修正了元数据和文本错误,优化内容,更新语言标注,并增加词对齐和词级意外指数等新层。
Comments 16 pages with appendices, 8 figures to be published in LREC-2026 main conference proceedings
Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pp. 6998--7013, 2026
SpecMind:基于认知的、交互式多轮框架用于后置条件推断
机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; FPT Software AI Center(FPT软件AI中心) ; VinUniversity(文大学) ; Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 SpecMind通过多轮交互式提示方法提升后置条件生成的准确性和完整性,利用反馈驱动模型迭代优化,增强代码理解和程序行为对齐。
Comments Accepted in ACL 2026 Main
为价值感知多智能体系统建模人类价值观
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本文提出一个形式化框架,用于表示人类价值观,以支持多智能体系统中的价值感知推理。通过社会心理学研究,建立价值关系和重要性模型,实现行为评估和价值感知决策机制。
Comments arXiv admin note: text overlap with arXiv:2305.02748
基于改写与否定的对比视觉-语言学习
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文提出SemCLIP模型,通过结合改写与否定的对比损失函数,提升视觉-语言模型在处理语义变化时的鲁棒性,实验证明其在零样本下游任务中表现稳定。
通过基于查询的模型协作进行专家指导的临床文本增强
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 本文提出基于查询的模型协作框架,利用专家知识指导文本增强,提升医疗信息保留并减少幻觉,实验显示在临床预测任务中表现优于传统方法。
Comments 18 pages, 6 figures, Accepted at ICML 2026
从准确性到视觉依赖性:审计与过滤交通视频问答中的模态崩溃
专题命中 安全评测 :safety(abstract)
AI总结 针对交通视频问答中模型依赖文本捷径而非视觉证据的问题,提出盲差距和视觉增益两个数据集级诊断指标,以及实例级捷径分数实现无训练过滤,提升视觉基础。
AERIS: 通过编排语言模型群在运行时实现空中边缘角色驱动智能
机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院)
专题命中 安全评测 :alignment(abstract)
AI总结 提出AERIS框架,通过编排专用小语言模型和轻量感知控制模块,在边缘实现空中平台的长时指令分解与实时闭环运行。
Comments 10 pages, 11 figures. Preprint version of the submitted manuscript
SciIR:面向科学图像推理生成的大规模训练数据集与基准
机构 * School of Computer Science and Technology, Huazhong University of Science and Technology, China(华中科技大学计算机科学与技术学院,中国) ; School of Airspace Science and Engineering, Shandong University, China(山东大学航空航天科学与工程学院,中国) ; Department of Electronic Engineering, Tsinghua University, China(清华大学电子工程系,中国)
专题命中 安全评测 :alignment(abstract)
AI总结 为解决文本到图像模型在科学图像生成中语义对齐与逻辑推理不足的问题,构建了包含8万+高质量科学图像-文本对的SciIR-82k数据集,并提出三层次科学推理框架及可验证评估基准SciIR-Bench,微调模型Qwen-Image-SciIR在基准上得分从35%提升至43%。
Comments Accepted to ECCV 2026
Rigel: 基于自蒸馏分数自适应的图像与视频字幕评估
机构 * Keio University(Keio大学)
专题命中 安全评测 :alignment(abstract)
AI总结 提出Rigel评估指标,通过自蒸馏从冻结LLM提取评估专用评分头,解决大词汇语言模型与小标签集不匹配问题,在视频字幕评估中超越现有方法。
TrafficAlign: 对齐大语言模型用于交通场景生成
专题命中 安全评测 :alignment(abstract)
AI总结 提出TrafficAlign框架,利用真实驾驶视频合成交通场景并对齐大语言模型,生成场景使自动驾驶模型碰撞率提升10.8%,微调后碰撞率降低36.1%。
Comments Accepted to CVPR 2026
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 2026, pp. 39744-39754
基于LLM的知识图谱方法实现医疗器械监管合规自动化
专题命中 安全评测 :safety(abstract)
AI总结 提出结合知识图谱与大语言模型的方法,从FDA文档提取监管知识并自动分类医疗器械,实现合规评估自动化,减少人工审查并加速上市。
Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025, pp. 321-328
在物理教育中使用大型语言模型
专题命中 安全评测 :alignment(abstract)
AI总结 本研究评估了2024年中至2025年底发布的前沿大型语言模型在解决大学物理问题(经典力学、电磁学、量子力学)和自动评分方面的能力,发现文本推理接近饱和,多模态集成解决了空间几何限制,但部分评分仍存在挑战。
Comments 22 pages
LatSearch:基于潜在奖励的搜索以加速推理时间扩展在视频扩散中
专题命中 安全评测 :alignment(abstract)
AI总结 本文提出LatSearch,通过潜在奖励引导的重采样和剪枝机制,提升视频扩散的推理效率和生成质量,验证其在VBench-2.0基准上的优越性。
Comments Accepted at ECCV 2026. Project page: see https://zengqunzhao.github.io/LatSearch
未来是代理的:多代理推荐系统定义、视角和开放挑战
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文探讨多代理推荐系统从被动生成到主动规划的转变,提出基于状态代理的框架,分析其在提升推荐效果中的作用,并通过实验验证代理系统在不同场景下的有效性。
Comments Added controlled experiments to illustrate the points of the paper. Also edited for more clarity in conveying the concepts
通过关键权重保护在量化大语言模型中保持公平性与安全性
机构 * Faculty of Computer Science, Universitas Indonesia(印度尼西亚大学计算机科学学院) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 AI治理与伦理 :safety(title,abstract);alignment(abstract);分类 cs.CL
AI总结 本文研究了静态和动态量化对公平性和安全性的影響,提出关键权重保护技术以减少偏见和安全风险,保持模型效率与可信度。
2025人工智能代理指数:记录已部署代理式人工智能系统的技术和安全特性
机构 * University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学) ; Harvard Law School(哈佛法学院) ; Stanford University(斯坦福大学) ; Concordia AI(康科迪亚AI) ; University of Pennsylvania(宾夕法尼亚大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Hebrew University of Jerusalem(耶路撒冷希伯来大学)
专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI、cs.CY
AI总结 本文提出2025人工智能代理指数,记录30种先进代理式AI系统的起源、设计、能力、生态系统及安全特性,揭示代理发展中的趋势和开发者透明度问题。
Comments To be publishesd at ACM FAccT 2026
高风险AI的确定性决策:具有RAG可部署性和机器学习准确性的零出口管道
机构 * Verificate Pty Ltd(Verificate公司)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究识别并量化了零样本大语言模型在教育咨询中的干预偏差,通过监督策略学习(决策树和XGBoost)消除该偏差,实现接近零的校准误差,并揭示了评估差距。
Comments 41 pages, 11 tables, no figures. Preprint intended for submission to EDM 2027 / LAK 2027. Includes a reproducibility package: trained ONNX Decision Transformer, generic training script, OULAD evaluation scripts, and per-arm results CSVs
通过多阶段LLM流水线实现结构保持的文档翻译:以马拉地语为例
机构 * Pune Institute of Computer Technology(普那计算机技术学院) ; L3Cube Labs(L3Cube实验室) ; Indian Institute of Technology Madras(印度理工学院马德拉斯分校)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 提出一种结构保持的马拉地语-英语政府文档翻译框架,集成布局感知OCR、坐标文本提取、LLM翻译和HTML重建,确保文档布局和结构一致性。
通过伦理困境对LLM进行亚里士多德式美德画像
机构 * Technical University of Munich(慕尼黑技术大学) ; Athens University of Economics and Business(雅典经济与商业大学) ; Archimedes, Athena Research Center(阿提卡研究中心)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 提出VirtueMap框架,通过七种非致命、非政治、非宗教的伦理困境,让人类或LLM对五种回应排序,基于95%共识的参考排序,使用归一化Borda对齐计算实践智慧、正义、诚实、勇气和节制的美德画像,在九个LLM家族中评估,平均排名一致性达90.3%。
Comments VirtueMap website: https://jtzach.github.io/Aristotle-Virtue-Map
为人民的AI,由人民,为人民:一种社会选择方法用于集体控制人工智能
机构 * Institute of Logic and Computation, TU Wien(逻辑与计算研究所,维也纳技术大学) ; Hasso Plattner Institute, University of Potsdam(哈索·platzer研究所,波茨坦大学) ; Center for Artificial Intelligence, University of Applied Sciences St. Pölten(人工智能中心,圣波尔滕应用科学大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文提出基于社会选择理论的集体控制AI方法,强调在机器学习全流程中融入公众意见,提供数学框架评估控制机制。
Comments Accepted for publication in Proceedings of the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)
Journal ref Proceedings of the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26), 2026, 4610-4629
揭示-修订:具有多模态注意力的可解释性偏见感知生成建模
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一个统一了跨模态注意力融合、Grad-CAM++属性分析和揭示-修订反馈循环的可解释性偏见感知生成框架,通过多模态MNIST和Fashion MNIST数据集验证了其在图像生成和子组审计中的性能。
Comments We are recently authors in conflict with this work; I am heartily requesting to withdraw this paper as soon as possible
人工智能中的物种歧视:评估大型语言模型对动物的歧视
机构 * Independent(独立学者) ; University of Cambridge(剑桥大学) ; Harvard University(哈佛大学) ; University of Stuttgart(斯图加特大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 研究评估大型语言模型是否表现出基于物种的歧视倾向,发现其在识别物种歧视言论方面可靠但较少谴责,且在文本生成中倾向于合理化对农场动物的伤害。
非完全人类品味:LLM调查替代者的程式化杂食性
机构 * Nanyang Technological University Singapore(新加坡南洋理工大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
AI总结 本研究使用多个大型语言模型生成大量调查替代者,发现其品味存在系统性正向偏差、丧失真实品味结构的复杂关系,且扭曲了品味与社会空间的关联。
重新思考基于LLM的推荐系统中的公平性:一项综述
专题命中 AI治理与伦理 :trustworthy(abstract)
AI总结 本文系统综述了基于大语言模型的推荐系统中的公平性问题,从偏见机制和公平目标两个维度组织现有研究,并探讨了评估与缓解策略,旨在为未来研究提供结构化基础。
基于人类-大语言模型对齐的歌词注释混合框架
机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 提出混合注释框架,通过预测人类与LLM在歌词情感标注中的潜在不一致,优化注释过程,并创建句子级歌词数据集。