Robust and Interpretable Medical Image Classifiers via Concept Bottleneck Models
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.LG
Comments 18 pages, 12 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.LG
Comments 18 pages, 12 figures
专题命中 安全评测 :alignment(abstract);jailbreak(abstract);分类 cs.AI、cs.LG
Comments ICCV AROW 2023
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments 12 pages, 10 figures
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
Comments Published on PLDI 2019
不想让你的大语言模型(LLM)推荐核打击?试试用日语提问
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI;trustworthy(journal_ref)
AI总结 该研究发现,用日语提问可降低部分LLM在核打击场景中的发动率,其机制为模型的推理语言而非输入语言,且仅适用于在英语中已存在犹豫的模型,表明LLM安全行为具语言依赖性。
Journal ref Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026), Jul 2026, San Diego, United States. pp.489-502
沉默的偏见:LLMs所学习到的拒绝的黑暗面
专题命中 安全评测 :alignment(abstract,comments);safety(abstract);分类 cs.CL
AI总结 本文提出Silenced Bias Benchmark,通过激活引导减少问答中的拒绝,揭示模型潜在的公平性问题,挑战传统公平评估方法。
Comments Accepted to The 40th Annual AAAI Conference on Artificial Intelligence - AI Alignment Track (Oral)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.LG;red teaming(comments)
Comments This paper was accepted in NeurIPS 2024 workshop on Red Teaming GenAI: What can we learn with Adversaries?
专题命中 安全评测 :trustworthy(abstract,comments);safety(abstract);分类 cs.LG
Comments Under Review ACM Computing Surveys "Special Issue on Trustworthy AI"
人类与人工智能——促进可信且可理解的协作
专题命中 安全评测 :trustworthy(title)
AI总结 该研究围绕人类与AI的可信可理解协作,通过在线调查分析12个可解释性与可控性相关方面,发现二者受普遍重视但意见分散,受个人视角等多因素影响。
Comments Comments: 19 pages, dual-language (English and German)
面向基于大语言模型的软件的可信验收测试的需求增强生成技术
专题命中 安全评测 :trustworthy(title)
AI总结 该研究针对基于大语言模型的软件的验收测试缺口,提出需求增强生成技术与置信度校准级联判定方法,经工业案例验证可提升预言机质量、准确率与成本效率,具备工业可行性。
Comments Accepted at ASE2026
自信但不可靠:对基于脑MRI的视觉语言模型的行为安全审计
机构 * Georgia State University(佐治亚州立大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Emory University(埃默里大学) ; TReNDS Center(TReNDS中心)
专题命中 安全评测 :safety(title)
AI总结 本研究对6个指令微调VLMs开展脑MRI行为安全审计,发现其置信度校准差、存在大量高置信度错误,提出医学图像VLM评估需报告置信度可靠性等指标。
PERA:一种感知-推理-行动接口,用于6G的传感、认知推理和可信智能体响应
专题命中 安全评测 :trustworthy(title)
AI总结 研究针对下一代网络实现中传统机器学习和大语言模型的局限,提出基于感知-推理-行动(PERA)范式的生成网络智能,用多任务架构取代边缘模型,降低复杂性与能耗,通过案例研究验证其在链路状态分类和波束预测上的有效性。
Comments 9 pages, 5 figures, 1 table, magazine paper, submitted to IEEE for possible publication
面向代码大语言模型的知识对齐:针对演化API的对比性遗忘
专题命中 安全评测 :alignment(title)
AI总结 提出对比性遗忘方法CURE,在抑制废弃API的同时鼓励正确替代,使代码LLM适应演化库,实验表明该方法优于现有基线。
Comments The paper has been peer reviewed and accepted to the 42nd International Conference on Software Maintenance and Evolution (ICSME 2026)
VIGOR: 面向视频几何的时序生成对齐奖励
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 安全评测 :alignment(title)
AI总结 提出基于几何的奖励模型,利用预训练几何基础模型通过跨帧重投影误差评估多视图一致性,以点方式计算误差,并引入几何感知采样策略,通过后训练和推理时优化对齐视频扩散模型,提升生成视频的几何一致性。
Comments Project Page: https://vigor-geometry-reward.com/
TextDS: 分布偏移下场景文本检测的参数高效表示对齐
机构 * School of Electrical Engineering, Xi’an Jiaotong University(西安交通大学电气工程学院) ; Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系)
专题命中 安全评测 :alignment(title)
AI总结 提出TextDS框架,通过视觉基础模型、逐步LoRA适应和公共子空间融合,仅用4.9M参数实现跨域和退化条件下的鲁棒场景文本检测。
Comments Accepted by ECCV 2026. Project page: https://github.com/ZChenDang/TextDS
LALM-as-a-Judge:用于多轮口语对话安全评估的大型音频语言模型基准测试
机构 * Computer Engineering, Technion--Israel Institute of Technology, Haifa, Israel(技术学院电子工程系,技术离子技术研究所,以色列海法) ; Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,卡内基梅隆大学,美国匹兹堡)
专题命中 安全评测 :safety(title)
AI总结 针对口语对话中社会不安全内容评估仍以文本为中心、忽略韵律和转录失败的问题,提出包含24000个多轮口语对话的开放基准,评估6种大型音频语言模型在文本、音频和多模态设置下的敏感性、严重性顺序特异性和轮次位置偏差,发现音频提供非词汇证据,多模态增益非普遍且存在多种模式。
Comments Accepted to ICML 2026
迈向可信的人像编辑:评估 I2I 模型中的人口统计误表示
专题命中 安全评测 :trustworthy(title)
AI总结 本文通过控制基准测试,评估了指令引导的图像到图像编辑器中身份保留失败的两个模式(软擦除和刻板印象替换),发现肤色变浅等偏差普遍存在且人口统计不均,并提出提示级约束作为缓解措施。
Comments 22 pages, 10 figures. Huichan Seo, Minki Hong and Sieun Choi contributed equally
依赖引导的仓库级C到Rust翻译与强化对齐
专题命中 安全评测 :alignment(title)
AI总结 提出DepTrans框架,通过强化对齐语法训练和依赖引导迭代精炼,实现仓库级C到Rust的高效翻译,编译成功率和计算准确性分别提升22.8和17.3个百分点。
Comments Accepted by FSE 2026 Industry
可信赖的AI/ML回归与真实世界数据的无偏因果推断
专题命中 安全评测 :trustworthy(title)
AI总结 针对真实世界数据中高维混杂导致的AI/ML回归系统性预测偏差,提出无偏的ML/AI回归因果推断框架,确保平均处理效应的无偏估计。
Comments 17 pages, 4 figures, 4 tables; includes supplementary material
可信软件项目生成:以交互式定理证明器为例的案例研究
专题命中 安全评测 :trustworthy(title)
AI总结 本文研究利用交互式定理证明器(ITP)从自然语言需求自动生成大规模可信软件项目,通过将纯逻辑与有副作用的代码分离,在Rocq中完成验证并提取C++代码,成功生成一个RISC-V RV32I CPU解释器,证明了ITP作为LLM生成软件验证后端的可行性。
CapCLIP:一种用于无线胶囊内镜分析的视觉-语言表示对齐方法
机构 * School of Computer Science, AI and Electronics Faculty of Engineering and Digital Technologies(计算机科学与电子工程学院,工程与数字技术学院) ; School of Management Faculty of Mgmt, Law & Social Sciences(管理学院,管理、法律与社会科学学院) ; Centre for Visual Computing and Intelligent Systems(视觉计算与智能系统中心)
专题命中 安全评测 :alignment(title)
AI总结 CapCLIP通过将内镜图像与临床标准术语生成的文本描述对齐,提升无线胶囊内镜分析的泛化能力和语义解释性,优于现有方法。
MultEval: 支持LLM-as-a-Judge评估标准的协作对齐
专题命中 安全评测 :alignment(title)
AI总结 研究探讨了LLM-as-a-Judge评估标准的协作制定过程,提出MultEval系统支持多方协商和迭代修订标准,提升评估透明度与一致性。
Comments 17 pages, 5 figures
Journal ref Proceedings of the 5th Annual Symposium on Human-Computer Interaction for Work (CHIWORK '26), June 22--25, 2026, Linz, Austria
LARY:一种产生通用视觉到动作对齐基准的潜在动作表示
机构 * Meituan(美团)
专题命中 安全评测 :alignment(title)
AI总结 本文提出LARY基准,通过大规模人类视频数据评估潜在动作表示,发现通用视觉模型在动作控制上优于专用模型,且潜在空间比像素空间更符合物理动作空间。
Comments Project: https://meituan-longcat.github.io/LARYBench Code: https://github.com/meituan-longcat/LARYBench Dataset: https://huggingface.co/datasets/meituan-longcat/LARYBench
ReplicateAnyScene:通过文本-视觉-空间对齐实现零样本视频到3D场景的合成
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学)
专题命中 安全评测 :alignment(title)
AI总结 本文提出ReplicateAnyScene框架,通过五阶段流水线实现视频到结构化3D场景的零样本合成,引入C3DR基准评估重建质量,实验表明其在生成高质量3D场景方面优于现有方法。
Comments Project Page: https://xiac20.github.io/ReplicateAnyScene/
AVATAAR:通过时间自适应对齐和推理实现代理视频回答
专题命中 安全评测 :alignment(title)
AI总结 AVATAAR通过结合全局和局部视频上下文,以及预检索思考代理和重思模块,提升长视频问答的准确性和可解释性,实验显示在CinePile基准上显著提升各类问答任务性能。
Comments Accepted in the 5th IEEE Big Data Workshop on Multimodal AI (MMAI 2025), Dec 8-11, Macau, China, 2025 (Preprint Copy)
Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China
为何认知机器人很重要:来自OntoAgent和HARMONIC中LLM部署的启示
机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) ; University of Georgia(佐治亚大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 安全评测 :safety(title)
AI总结 研究探讨了在物理世界部署具身体AI代理所需的认知能力,通过HARMONIC架构评估LLM是否能复制OntoAgent的认知能力,发现LLM在知识状态评估上存在缺陷。