Rethinking Certification for Trustworthy Machine Learning-Based Applications
专题命中 安全评测 :trustworthy(title);分类 cs.LG
Comments Accepted in IEEE Internet Computing; 6 pages, 1 figure, 1 table
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :trustworthy(title);分类 cs.LG
Comments Accepted in IEEE Internet Computing; 6 pages, 1 figure, 1 table
专题命中 安全评测 :trustworthy(title);分类 cs.LG
Comments Overlapes with the new version
专题命中 安全评测 :alignment(title);分类 cs.LG
Comments This article has been accepted for publication in IEEE Access
专题命中 安全评测 :trustworthy(title);分类 cs.AI
专题命中 安全评测 :alignment(title);分类 cs.AI
Comments Master's project
专题命中 安全评测 :trustworthy(title);分类 cs.LG
专题命中 安全评测 :safety(title);分类 cs.CL
Comments Accepted for publication at AACL 2022
专题命中 安全评测 :trustworthy(title);分类 cs.LG
Comments Accepted copy, to be published in ISAMR 2022
专题命中 安全评测 :trustworthy(title);分类 cs.AI
专题命中 安全评测 :alignment(title);分类 cs.CL
专题命中 安全评测 :trustworthy(title);分类 cs.LG
Comments 9 pages, 5 figures, to be published in the proceedings of the 2021 IEEE CogMI conference. Christin Seifert and Folker Meyer are co-senior authors
专题命中 安全评测 :safety(title);分类 cs.LG
专题命中 安全评测 :trustworthy(title);分类 cs.CY
Comments Pre-print of paper submitted to Workshop on Reviewable and Auditable Pervasive Systems (WRAPS)
专题命中 安全评测 :alignment(title);分类 cs.LG
Comments 11 pages, 4, figures
专题命中 安全评测 :trustworthy(title);分类 cs.LG
专题命中 安全评测 :safety(title);分类 cs.LG
专题命中 安全评测 :alignment(title);分类 cs.LG
Comments Accepted to ICML 2019
专题命中 安全评测 :trustworthy(title);分类 cs.AI
专题命中 安全评测 :safety(title);分类 cs.LG
Comments 16 pages
Journal ref Asian Conference on Machine Learning 2013, Canberra : Australia (2013)
训练模型,而非读者:可验证激活解释的可解码性监督
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 研究自然语言自动编码器对隐藏激活解释评分的问题,提出RECAP等方法,能使指定内容可解码,提高解释忠实度与安全性,如在预训练模型上实现可靠探测解码,提升对真实声明评分及识别谎言能力。
NeurIPS与ICML 2025立场论文 track 的调查
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.CY
AI总结 本文审计了NeurIPS和ICML 2025立场论文 track 的公开投稿,发现其以改革派批判为主,建议增设方向设定类工作,并提出四项CFP层面干预措施以优化投稿结构。
听、推理与分段:使大型音频语言模型(LALMs)与编辑判断对齐以实现媒体章节化
机构 * University of Surrey(萨里大学)
专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 该研究针对LALMs在实际媒体章节化部署的不足,提出基于GRPO与CoT的AudioChaps框架,构建三类数据集,使AudioChaps-R1的平均F1较SOTA提升49个百分点,实现非结构化听觉流到结构化媒体的可靠转换。
Comments 19 pages, 9 figures, 8 tables
HarmProfile:刻画前沿大语言模型中的有害分布
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出HarmProfile基准数据集,收集23个前沿LLMs的超8万条有害输出,发现其有害性与多样性随模型能力增长,潜藏对齐表面下的危险知识。
重新审视关机问题
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文重新评估了AI关机问题的难度,指出现有论证未能证明其难以解决,且相关技术方案对模型性能造成了高安全代价。
Logit边界几何置信接口与稀疏层束 enclaves 协议:安全网络电子健康记录(EHR)互操作性的自包含底层架构
机构 * Light Imaging Technologies, Inc.(光成像技术公司)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出Logit边界几何置信接口与稀疏层束 enclaves 协议,构建EHR互操作的自包含底层架构,经GBI BoundaryBench v0.1评估,Qwen3-4B-Instruct-2507在该接口下无符合要求的输出,为接受边界提供实证证据。
Comments 39 pages; executable Julia verification code included as ancillary material; companion public benchmark: https://github.com/AlvinSpivey/GBI-BoundaryBench
Infra-Bayesian 强化学习智能体在最坏情况鲁棒性上优于经典强化学习
机构 * Purdue University(普渡大学) ; Carnegie Mellon University(卡内基梅隆大学) ; WorldQuant University(WorldQuant大学) ; UC Berkeley(加州大学伯克利分校) ; Aix-Marseille University(阿维尼翁-马赛大学) ; MIT(麻省理工学院) ; University of Zurich(苏黎世大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of Stuttgart(斯图加特大学) ; University of Buenos Aires(布宜诺斯艾利斯大学) ; California State University, Fresno(弗雷斯诺加州州立大学) ; University of Chicago(芝加哥大学)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 针对经典强化学习在模型误设和策略依赖不确定性下的失败,提出 Infra-Bayesian 框架,通过区分概率不确定性和 Knightian 不确定性并采用最坏情况决策,在有限状态无状态决策问题中实现更低的最坏情况遗憾。
Comments RLC 2026: Accepted to Finding the Frame Workshop
FinTrace: LLM工具调用在长周期金融任务中的轨迹级综合评估
机构 * Stevens Institute of Technology(斯蒂文斯理工学院) ; Independent Researcher(独立研究者) ; The FinAI(FinAI) ; Duke University(杜克大学)
专题命中 安全评测 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文提出FinTrace基准,通过800个专家标注的轨迹评估LLM工具调用,揭示模型在信息利用和最终答案质量上的不足,并通过FinTrace-Training数据集提升中间推理能力,但最终答案质量仍受限。
潜在上下文是否有帮助?北极航运中逆强化学习的受控评估
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本研究通过对北极航运航次的受控评估,发现非线性共享奖励模型优于线性基线,添加船舶特定潜在上下文反而降低性能,表明可观测特征已能解释行为差异,为安全关键领域的AI部署提供支持。
从经济智能体到智能体经济:经济世界模型的系统蓝图
机构 * Shenzhen Loop Area Institute(深圳河套学院) ; School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; University of Hong Kong(香港大学) ; Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。
Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models
SCP-NL2TL:用于自然语言到时间逻辑规范的带语义验证的选择性共形预测
机构 * University of California, Riverside(加州大学河滨分校) ; City University of Hong Kong(香港城市大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出SCP-NL2TL框架,结合选择性共形预测与语义验证,可生成自然语言到时间逻辑的规范并判断其可靠性,在三类逻辑上提升了翻译可靠性与鲁棒性,为可信自然语言接口提供了基础。