Explainable artificial intelligence toward usable and trustworthy computer-aided early diagnosis of multiple sclerosis from Optical Coherence Tomography
专题命中 安全评测 :trustworthy(title,abstract)
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :trustworthy(title,abstract)
专题命中 安全评测 :trustworthy(title,abstract)
专题命中 安全评测 :trustworthy(title);safety(abstract)
Comments Revised and submitted to International Conference on Transportation and Development (ICTD 2023) on Nov 2022
专题命中 安全评测 :trustworthy(title,abstract)
Comments 7 pages, 3 figures, under review
专题命中 安全评测 :safety(title,abstract)
Comments Published as a conference paper at NeurIPS 2022 (Track on Datasets and Benchmarks)
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI、cs.LG
Comments Camera ready. NeurIPS 2022
专题命中 安全评测 :trustworthy(title,abstract)
Comments 19 pages
专题命中 安全评测 :safety(title,abstract)
专题命中 安全评测 :trustworthy(title,abstract)
专题命中 安全评测 :safety(title,abstract)
Comments Accepted to the ACM CSCW 2021 workshop "MOSafely: Building an Open-Source HCAI Community to Make the Internet a Safer Place For Youth"
专题命中 安全评测 :safety(title,abstract)
Comments In submission
专题命中 安全评测 :trustworthy(title,abstract)
Comments Published at WAIN'21 - 1st Workshop on AI Engineering - Software Engineering for AI
专题命中 安全评测 :safety(title);分类 cs.AI、cs.CY、cs.LG
专题命中 安全评测 :trustworthy(title,abstract)
Comments New Ideas and Emerging Results (NIER) track; The 35th IEEE/ACM International Conference on Automated Software Engineering; Melbourne, Australia
Journal ref ASE 2020: The 35th IEEE/ACM International Conference on Automated Software Engineering, Melbourne, Australia, Mon 21 - Fri 25 September 2020
专题命中 安全评测 :safety(title,abstract)
专题命中 安全评测 :safety(title,abstract)
Comments Accepted at IEEE Intelligent Vehicles Symposium (IV), 2020
专题命中 安全评测 :trustworthy(title,abstract)
Comments Machine Learning for Health (ML4H) at NeurIPS 2019 - Extended Abstract
专题命中 安全评测 :safety(title,abstract)
专题命中 安全评测 :trustworthy(title,abstract)
机构 * Tsinghua University(清华大学)
专题命中 安全评测 :trustworthy(title,comments);分类 cs.AI、cs.LG
Comments Survey paper for tutorial "Data Heterogeneity Modeling for Trustworthy Machine Learning" in KDD'25
基于多智能体评估的角色扮演语言智能体的对抗性压力测试
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本研究提出模块化多智能体平台,通过多轮对话对角色扮演语言智能体开展对抗性压力测试,揭示单策略测试无法发现的故障模式,相关成果作为开源平台发布以支持AI安全。
Comments 8 pages, 1 figure, 7 tables; accepted and presented at ADScAI Conference 2026, University of Moratuwa, Sri Lanka
使用任务向量进行功能和安全代码生成
机构 * KTH Royal Institute of Technology(皇家理工学院)
专题命中 安全评测 :alignment(abstract);harmlessness(abstract);trustworthy(abstract);分类 cs.LG
AI总结 研究旨在解决大语言模型生成安全功能代码的问题,提出SecVecCoder方法,利用任务向量生成可信代码,在CodeGuard+基准测试中提升了可信代码完成率,且解码延迟低。
AI审稿人是否看到全貌?攻击与防御多模态同行评审
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 安全评测 :safety(abstract);prompt injection(abstract);trustworthy(abstract);分类 cs.CL
AI总结 针对AI同行评审易受多模态对抗攻击的问题,提出PaperGuard基准,包含多领域数据集、统一攻击套件和基于分块嵌入搜索的实用防御方法。
Comments Accepted to ICML 2026, Project Page: https://paper-guard.github.io/
基于LLM的科学同行评审:方法、基准与可靠性挑战
机构 * L3S Research Center, Leibniz University Hannover(莱布尼茨汉诺威大学L3S研究中心) ; Peter L. Reichertz Institute for Medical Informatics of TU Braunschweig and Hannover Medical School(布伦瑞克工业大学与汉诺威医学院彼得·L·赖歇茨医学信息学研究所) ; Lower Saxony Center for AI and Causal Methods in Medicine (CAIMed)(下萨克森州医学人工智能与因果方法中心(CAIMed))
专题命中 安全评测 :alignment(abstract);prompt injection(abstract);trustworthy(abstract);分类 cs.CL
AI总结 本文综述了基于大语言模型的科学同行评审,聚焦批评生成与分数预测两大功能,分析了建模方法、基准评估、数据局限及鲁棒性风险,并提出了未来研究方向。
现实场景中工具使用LLM代理的数据泄露风险评估
机构 * Korea AI Safety Institute(韩国人工智能安全研究所) ; Singapore AI Safety Institute(新加坡人工智能安全研究所)
专题命中 安全评测 :safety(abstract);prompt injection(abstract);AI safety(abstract);分类 cs.AI
AI总结 评估了12个非对抗性任务中AI代理的数据泄露风险,发现所有代理均存在数据安全意识不足、信息过度访问等问题,表明操作数据泄露是独立于对抗性窃取的一阶安全风险。
超越基准岛屿:面向代理AI的代表性可信度评估
机构 * The Chinese University of Hong Kong(香港中文大学) ; Macao Polytechnic University(澳门理工学院) ; Jilin University(吉林大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL
AI总结 本文提出了一种基于五属性的代理可信度定义,并引入了Holographic Agent Assessment Framework(HAAF)框架,通过场景 manifold 的静态策略分析、沙盒模拟、社会伦理对齐评估和分布感知采样,实现对代理系统在社会技术场景中的可信度评估,展示了其在13个模型家族上的跨家族迁移实验结果。
Comments 9 pages, 3 figures, 8 tables. Submitted to the Agent4IR Workshop at KDD 2026
TRAM: 测试时风险适应与代理混合
机构 * UT Austin(得克萨斯大学) ; University of Central Florida(中央佛罗里达大学) ; MIT(麻省理工学院) ; UMD(大学公园分校)
专题命中 安全评测 :safety(abstract,abstract_cn);alignment(abstract);分类 cs.LG
AI总结 本文研究了在部署时无需更新的零更新适应问题,提出TRAM方法通过混合代理评估源策略的风险调整分数,以降低部署风险并保持奖励。
基于价值引导的迭代精炼与DIQ-H基准:评估VLM鲁棒性的新方法
机构 * The School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)科学与工程学院) ; The School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) ; The Shenzhen Institute of Artificial Intelligence and Robotics for Society, Shenzhen, China(深圳人工智能与机器人社会研究院)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文提出DIQ-H基准和VIR框架,通过模拟真实世界压力源评估VLM在连续序列中的鲁棒性,提升误差恢复和伦理一致性。
transformative AI 的经济影响:转型人工智能时代存在风险与经济增长的场景
机构 * SGH Warsaw School of Economics(SGH华沙经济学院)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI
AI总结 本文探讨了转型人工智能对人类经济和存在风险的影响,分析了不同场景下的整体福利影响,指出即使低概率的灾难性结果也需加大AI安全与对齐研究投入。
BIASEDTALES-ML:一个多语言数据集用于分析LLM生成故事中的叙述属性分布
机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) ; NiuTrans Research, Shenyang, China(NiuTrans研究院,中国沈阳)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL
AI总结 本文提出BiasedTales-ML数据集,通过多语言生成分析叙述属性分布,揭示跨语言生成模式的差异,强调英语中心评估的局限性。
Comments Accepted to ACL 2026 Findings. Data are available at https://huggingface.co/spaces/Linyuana/BIASEDTALES-ML