AI Pluralism and the Worlds It Misses
AI多元主义及其遗漏的世界
机构 * Rashid Mushkani
专题命中 安全评测 :alignment(abstract,comments);分类 cs.AI
AI总结 本文提出AI系统施加本体论,导致本体论扁平化,并引入多元生命周期治理框架以记录本体开放性和问责条件。
Comments To be presented at the ICML Pluralistic Alignment Workshop
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
AI多元主义及其遗漏的世界
机构 * Rashid Mushkani
专题命中 安全评测 :alignment(abstract,comments);分类 cs.AI
AI总结 本文提出AI系统施加本体论,导致本体论扁平化,并引入多元生命周期治理框架以记录本体开放性和问责条件。
Comments To be presented at the ICML Pluralistic Alignment Workshop
重新思考LLM导师中的脚手架:基准测试与真实部署之间的交互不匹配
机构 * University of Cambridge(剑桥大学)
专题命中 安全评测 :alignment(abstract,comments);分类 cs.AI
AI总结 通过分析9490个聊天记录,发现AI导师基准测试假设学生积极接受脚手架,但真实场景中学生常绕过脚手架,揭示基准测试与真实部署的交互不匹配。
Comments Pluralistic Alignment Workshop @ ICML 2026, Seoul, South Korea
AI作为学习、实践和参与科学的伙伴:警惕性是高效增强的关键
专题命中 安全评测 :trustworthy(abstract);分类 cs.CY
AI总结 本文探讨AI作为科学学习、实践和参与伙伴的三种形式,提出人类对AI输出的认知警惕性是决定增强效果的关键约束,并详细阐述了警惕性的组成、机制及测量方法。
渐进式知识引导的大型语言模型框架用于轴承故障诊断
机构 * Harbin Institute of Technology, China(哈尔滨工业大学,中国) ; Eastern Institute of Technology, China(东方技术研究所,中国)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 提出渐进式物理引导多尺度振动信号处理框架,通过81维测量描述符、故障自适应分割和隐式知识编码,在四个数据集上实现98.49%诊断精度并降低12.6倍计算成本。
PaperJury: 有界LaTeX修订的正当程序审查
机构 * Vast Intelligence Lab(vast 智能实验室)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 提出PaperJury系统,通过确定性编排与语义代理分离,实现LaTeX论文的对抗性审查、裁决和修订,确保有界安全编辑和终止结果。
Comments 10 pages, 5 figures
AME:生成式AI市场中的多类型贡献者归属框架
机构 * University of Shanghai for Science and Technology(上海理工大学) ; Fudan University(复旦大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 针对生成式AI中多阶段协作的价值分配问题,提出AME框架,整合异构数据贡献评估、数据权利映射和可信执行,实现与人类判断一致的低成本价值分配。
SciText2Eq: 评估大语言模型在科学创造力中的可解释方程生成
机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; Wageningen University & Research(瓦赫宁根大学及研究中心)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 研究大语言模型从科学文本生成数学方程的能力,构建AI论文数据集,提出可解释方程生成流程,并设计结合自动指标、LLM评估和人工判断的评估协议,发现LLM在语义准确性上表现不足。
Comments Accepted by findings of ACL 2026
UrbanWell: 面向时空城市福祉分析的多模态大语言模型基准测试
机构 * University of Helsinki(赫尔辛基大学) ; Zhongguancun Academy(中关村学院) ; University of Oxford(牛津大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出UrbanWell基准,通过卫星和街景图像联合建模,系统评估多模态大语言模型在环境、空间可达性、城市形态、活力和主观感知等5类城市福祉指标上的时空推理能力,并定义时序预测和趋势分类任务。
Comments accepted by KDD Datasets and Benchmarks Track 2026
ToolMenuBench: 用于可靠高效LLM智能体的工具菜单过滤策略基准测试
机构 * Independent Researcher(独立研究者) ; United States of America(美国)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出ToolMenuBench基准,评估多步LLM智能体中工具菜单构建策略,发现因果最小工具过滤在任务成功率、令牌使用和风险暴露间取得最佳平衡。
Mask-Proof: 一种基于LLM的数学证明自动数据整理流水线
机构 * School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) ; Graduate College for Engineers, Beijing University of Posts and Telecommunications(北京邮电大学研究生院工程师学院) ; School of Mathematical Sciences, Fudan University(复旦大学数学科学学院) ; School of Cyberspace Security, Beijing University of Posts and Telecommunications(北京邮电大学网络空间安全学院) ; School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) ; Chu Kochen Honors College, Zhejiang University(浙江大学竺可桢学院) ; Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) ; State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) ; School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 提出Mask-Proof流水线,将真实证明转化为可自动检查的掩码步骤任务,通过LLM等价性判断器评估模型推理,构建包含292个问题的基准,推理增强模型性能提升12%-27%。
ReportQA: 基于问答的放射学报告评估
机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; College of AI, Tsinghua University(清华大学人工智能学院) ; Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心) ; Beijing Electronic Digital & Intelligence(北京电子数字与智能)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出ReportQA框架,利用知识树和LLM从报告中提取结构化信息生成QA对,以问答准确率作为评估指标,比现有指标更符合放射科医生判断。
智能体AI中的弹性共识
机构 * KTH(瑞典皇家理工学院) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 研究LLM智能体在多智能体系统中的共识问题,发现经典弹性共识理论在LLM智能体中失效,但结合经典滤波器可改善一致性。
结合检索增强文本生成与大型语言模型的阅读内容推荐
机构 * Institute of Computer Science, Warsaw University of Technology(计算机科学学院,华沙技术大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出结合检索增强生成(RAG)与大型语言模型的系统,通过四个模块实现个性化阅读内容生成,实验表明RAG将相关性和接地性提升26-35个百分点。
通过符号执行轨迹教学LLM程序语义
机构 * University of Cambridge(剑桥大学) ; Amazon Web Services(亚马逊网络服务)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 本文通过符号执行轨迹训练提升LLM对程序语义的理解,发现结合推理的训练显著提升了漏洞检测能力,且在不同属性类型上均有效。
BRITE:面向不可信场景的可靠可解释文本到视频评估基准
机构 * Department of Computer Science, Iowa State University, Ames, Iowa, USA(计算机科学系,爱荷华州立大学,爱荷华州阿姆斯,美国)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出BRITE基准,通过人工参与协议统一不可信提示、细粒度音视频一致性评估和可解释QA评估,揭示现有模型在对象-动作绑定和音视频同步上的显著缺陷。
AI中涌现的策略推理风险:基于分类法的评估框架
机构 * Amazon Nova Responsible AI(亚马逊诺瓦负责任人工智能)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出ESRRSim框架,基于7类20子类的风险分类法,通过双评估标准自动评估LLM的策略推理风险,发现检测率在14.45%-72.72%之间,且模型代际提升显著。
EEG-FM-Bench:脑电图基础模型系统评估与诊断分析的综合基准
机构 * School of Computer Science and Technology, Tongji University, Shanghai, China(同济大学计算机科学与技术学院,上海,中国) ; Translational Research Center, Shanghai Yangzhi Rehabilitation Hospital (Shanghai Sunshine Rehabilitation Center), China(上海杨氏康复医院(上海阳光康复中心)转化研究中心,中国)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出EEG-FM-Bench统一基准,整合14个数据集和10种范式,通过多种微调策略和诊断分析揭示多任务学习可缓解过拟合、预训练效率受梯度冲突限制、模型规模非唯一决定因素等关键发现。
Comments 36 pages, 30 figures, Accepted by ICML2026
CLASE:一种中文法律文本风格评估的混合方法
机构 * Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出CLASE混合方法,通过结合语言特征和经验指导的LLM评估,提升法律文本风格质量,实验表明其比传统方法更符合人类判断。
Comments Accepted at LREC 2026
我们能阻止恶意AI吗?KILLBENCH:外部AI终止开关可行性基准
机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)
专题命中 安全评测 :jailbreak(abstract);分类 cs.AI
AI总结 提出Killbench基准,通过外部信号(如输入文本)评估终止恶意AI代理行为的方法,无需访问内部参数,实验表明在多种模型上外部终止开关具有可行性。
利用专家输入实现稳健且可解释的AI辅助肺癌检测
机构 * School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) ; NHS Lothian(洛锡安国家健康服务)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 本文研究了基于InceptionV3的肺癌检测模型的可解释性和鲁棒性,提出ClinicXAI方法,通过专家驱动的思路生成临床相关解释,并在对抗攻击下表现出更强的鲁棒性。
Human-on-the-Bridge: 可扩展的AI智能体评估方法
专题命中 安全评测 :red teaming(abstract)
AI总结 提出Human-on-the-Bridge (HOB)范式,通过专家预先策划可复用的评估智能体(包括领域上下文、红队陷阱、陪审员角色等),结合ProofAgent测试框架进行多轮对抗评估,实现可扩展的AI智能体行为评估。
Comments 33 pages, 3 figures
任务指令引导的视觉基础模型因果路由用于多任务学习
机构 * Electronics and Telecommunications Research Institute (ETRI)(韩国电子通信研究院(ETRI)) ; Kyung Hee University(庆熙大学) ; Chonnam National University(全南大学)
专题命中 安全评测 :alignment(abstract)
AI总结 提出TIGER框架,通过自然语言任务指令引导路由网络,结合反事实因果对齐,协调多个异构视觉基础模型实现多任务密集预测,在NYUD-v2和Pascal Context上超越现有方法。
Comments 17 pages, 6 figures
铭记于心:面向用户中心的持续空间智能推理在自我中心视频流中的应用
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 安全评测 :alignment(abstract)
AI总结 提出UCS-Bench数据集和DirectMe框架,通过增量构建结构化空间记忆,实现自我中心视频流中动态空间推理、长期记忆与用户实时位置对齐,显著提升多模态大模型的空间推理能力。
Comments 45 pages. https://icml.cc/virtual/2026/poster/63682
Journal ref ICML 2026
LLMs 具备可视化素养:现在呢?探索 LLM 可视化评估能力的实验
专题命中 安全评测 :trustworthy(abstract)
AI总结 通过实验评估最新 LLM 在可视化素养、指令遵循和图形完整性方面的能力,发现其可视化素养超越人类,但在指令遵循和识别误导性可视化方面仍有不足。
文档到LLM供应链中的语义完整性失败
专题命中 安全评测 :safety(abstract)
AI总结 研究文档到LLM应用中的隐藏提取层导致的split-view PDF攻击,发现25种提取间隙,评估16个处理栈和7个商业LLM服务,提出静态扫描工具。
HoliDubber: 通过文本引导的音频合成实现复杂声学场景的全景视频配音
专题命中 安全评测 :alignment(abstract)
AI总结 提出HoliDubber框架,基于补丁自回归扩散Transformer,从单一文本提示联合生成语音和音效,实现全景视频配音,显著优于现有方法。
连接自然语言与形式规范——通过层次语义分解利用LLMs将软件需求转换为LTL
专题命中 安全评测 :safety(abstract)
AI总结 本文提出Req2LTL框架,通过层次中间表示OnionL将自然语言需求转换为LTL,实现88.4%的语义准确性和100%的语法正确性。
Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE), pp. 1208-1220, 2025
ReMoBot: 基于检索的少样本模仿学习用于移动操作与视觉基础模型
机构 * School of Electrical Engineering, Aalto University, Espoo, Finland(艾尔沃大学电气工程学院,埃斯波,芬兰)
专题命中 安全评测 :alignment(abstract)
AI总结 提出ReMoBot,一种基于检索的少样本模仿学习框架,利用视觉基础模型从演示中检索信息,解决移动操作任务中的部分可观测性和数据有限问题,在真实世界任务中取得高成功率。
LLaMA 3.1-8B-Instruct中的框架条件化道德计算:伦理推理的机械可解释性审计
机构 * KD Consulting, CA, USA(KD咨询公司,美国加利福尼亚州) ; New York University, NY, USA(纽约大学,美国纽约州)
专题命中 AI治理与伦理 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.AI
AI总结 通过机械可解释性平台分析LLaMA 3.1-8B-Instruct在54个道德提示上的内部计算,发现情境锚定效应:领域特定表示主导激活列表顶部,模型道德能力恒定但显著性高度依赖于提示选择的解释框架。
Comments 47 pages, 10 figures
对大型语言模型中代词忠实性的机制理解
机构 * Saarland University(萨尔大学) ; Heidelberg Institute for Theoretical Studies(海德堡理论研究所)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 通过因果分析发现,代词忠实性由组实体绑定、近因偏差和刻板印象偏差三种因果子空间共同作用,解释了91-99.5%的行为。