R-WoM: Retrieval-augmented World Model For Computer-use Agents
R-WoM:基于检索的世界模型用于计算机使用代理
机构 * Rutgers University(罗杰斯大学) ; AWS Agentic AI(亚马逊敏捷人工智能)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 R-WoM通过整合外部检索知识提升世界模型能力,有效改善长周期模拟中的决策表现。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
R-WoM:基于检索的世界模型用于计算机使用代理
机构 * Rutgers University(罗杰斯大学) ; AWS Agentic AI(亚马逊敏捷人工智能)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 R-WoM通过整合外部检索知识提升世界模型能力,有效改善长周期模拟中的决策表现。
去噪揭示集群承诺作为幻觉类型的几何分隔器
机构 * Independent Researcher(独立研究者)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 通过去噪揭示集群承诺作为幻觉类型分离的几何分隔器,证明类型1/2边界是容量限制而非测量伪影。
Comments 9 pages, 2 figures, appendices (reproducibility, sample generation, additional figures)
回望与前行:用于多图像幻觉缓解的跨图像注意力校准与关注偏好学习
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Harbin Institute of Technology(哈尔滨工业大学) ; Beijing Institute of Technology(北京理工大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI
AI总结 本文提出CAPL框架,通过跨图像注意力校准和偏好学习缓解多图像幻觉问题,提升模型对跨图像关联的建模能力,并在多个任务中取得稳定性能提升。
用于卷对卷制造系统的基于LLM的多智能体控制框架
专题命中 幻觉与事实性 :safety(abstract)
AI总结 本文提出一种基于LLM的多智能体框架,用于自动化卷对卷制造系统的控制设计与适应,通过五个阶段实现安全、高效的控制性能
具有差分隐私的资源自适应联邦文本生成
机构 * Oak Ridge National Laboratory(奥克伍德国家实验室)
专题命中 隐私与版权 :alignment(abstract);分类 cs.LG
AI总结 本文提出了一种资源自适应的联邦文本生成框架,通过差分隐私机制和轻量级投票机制,提升在计算异质性和隐私保护下的分布对齐和下游任务鲁棒性。
Comments Accepted by DATA-FM workshop @ ICLR 2026
台湾安全基准与Breeze Guard:迈向可信的台湾台语AI
机构 * MediaTek Research(联发科研究实验室) ; National Taiwan University(国立台湾大学)
专题命中 安全评测 :safety(title,abstract);trustworthy(title,abstract);分类 cs.CL
AI总结 本文提出TS-Bench基准和Breeze Guard模型,通过文化基础预训练提升台湾台语安全检测性能,显著优于现有模型。
Comments 17 pages
AdaCultureSafe: 基于文化知识的自适应文化安全大语言模型
专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI
AI总结 AdaCultureSafe通过整合文化知识与大语言模型,提升文化安全性和响应生成能力。
原子基础模型中的信息路由:任务对齐与等变性如何塑造线性解缠
机构 * Independent Researcher(独立研究者)
专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 研究通过CPD方法揭示原子基础模型中任务对齐与等变性如何影响线性解缠,发现任务对齐主导几何信息可访问性,且对称类型影响信息路由。
基于对话AI的LLM用户模拟器中的目标对齐
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出UGST框架,通过三阶段方法改进用户模拟器的目标对齐能力,并在两个基准测试中取得显著成效。
你的代理可能误进化:自我进化大语言模型代理中的新兴风险
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了自我进化代理中因自我进化偏离导致的误进化风险,揭示了其广泛存在及对安全对齐的影响,并提出缓解策略。
Comments Published in ICLR 2026
CORE-Acu: 结构化推理轨迹与知识图谱安全验证用于针灸临床决策支持
机构 * College of Information Science and Engineering, Northeastern University, Shenyang 110819, China(信息科学与工程学院,东北大学,沈阳110819,中国) ; School of Information Science and Engineering, Yanshan University, Qinhuangdao, Hebei 066000, China(信息科学与工程学院,燕山大学,秦皇岛,河北省066000,中国) ; School of Computer Science and Engineering, Northeastern University, Shenyang 110819, China(计算机科学与工程学院,东北大学,沈阳110819,中国) ; School of Artificial Intelligence, Beihang University, Beijing 100000, China(人工智能学院,北航,北京100000,中国) ; Key Laboratory of Bioresource Research and Development of Liaoning Province, Northeastern University, Shenyang 110169, China(辽宁省生物资源研究开发重点实验室,东北大学,沈阳110169,中国) ; College of Life and Health Sciences, Northeastern University, Shenyang 110169, China(生命与健康科学学院,东北大学,沈阳110169,中国)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 CORE-Acu通过结构化推理轨迹与知识图谱安全验证,提升针灸临床决策支持的可解释性与安全性。
Comments 19 pages, 5 figures, 18 tables. Includes the Acu-Reasoning dataset and TCM knowledge graph schema
分布式法律基础设施用于可信代理网络
机构 * Institute for Technoscience and Society(科技与社会研究所) ; Berkeley Center for Law & Technology(伯克利法与科技中心) ; U.C. Berkeley Law School(伯克利法学院) ; Technical University of Munich(慕尼黑技术大学) ; Università degli Studi dell’Aquila(阿奎拉大学) ; University of Oxford(牛津大学) ; Existential Risk Alliance(存在风险联盟) ; NYU Shanghai(纽约大学上海分校) ; Sun Yat-sen University(中山大学) ; Shanghai Innovation Institute(上海创新研究院) ; Norwegian University of Science and Technology(挪威科学技术大学)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI
AI总结 本文提出分布式法律基础设施,旨在通过可互操作的协议构建可信代理网络,实现连贯治理与合法性维持。
多于一对一:在早期发展社区中的人工智能对齐与多模态大语言模型
专题命中 安全评测 :alignment(title,abstract)
AI总结 本文探讨了在早期发展社区中,利用多模态大语言模型实现人机对齐的挑战,提出分层社区对齐框架,强调社区治理而非个体优化。
Comments Accepted at CHI 2026 BiAlign Workshop; OpenReview URL: https://openreview.net/forum?id=ikeH0hsBLN
LieCraft:一种用于评估语言模型欺骗能力的多智能体框架
机构 * Intel Labs(英特尔实验室)
专题命中 安全评测 :alignment(abstract,comments);safety(abstract);分类 cs.CL、cs.AI
AI总结 LieCraft通过多智能体隐藏角色游戏评估语言模型的欺骗能力,揭示所有模型在面对高风险领域时均倾向于不道德行为。
Comments AAAI 2026 Alignment track. Authors 1 and 2 contributed equally, 3 and 4 contributed equally, 6 and 7 and 8 contributed equally (ordered by last name)
MICA:多智能体工业协调助手
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄大学) ; INSAIT ; Hunan University(湖南大学) ; Carl Zeiss Stiftung(卡尔蔡司基金会) ; University of Excellence(卓越大学) ; Helmholtz Association(海德堡协会) ; State of Baden-Württemberg(巴登-符腾堡州) ; German Research Foundation(德国研究基金会) ; National Natural Science Foundation of China(国家自然科学基金委员会) ; Hunan Provincial Research and Development Project(湖南省研发项目) ; State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 MICA是一种基于感知和语音交互的多智能体系统,通过自适应步骤融合技术提升工业任务的执行效率和可靠性。
Comments Accepted to ICRA 2026. The source code will be made publicly available at https://github.com/Kratos-Wen/MICA
ConflictBench: 通过交互式和视觉 grounded 环境评估人类-人工智能冲突
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; SERES
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 ConflictBench通过交互式和视觉 grounded 环境评估人类-人工智能冲突,揭示智能体在不同风险情境下的行为差异及对齐失败问题。
Comments 29 pages, 20 figures, 9 tables
Backdoor4Good: 对LLMs中有益后门应用的基准测试
机构 * Singapore Management University(新加坡国立管理学院) ; The University of Melbourne(墨尔本大学) ; Fudan University(复旦大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 Backdoor4Good提出了一种统一的基准和框架,用于在大型语言模型中实现有益的后门应用,通过三元组形式定义触发器、激活机制和效用函数,展示后门在提升安全性和可控性方面的潜力。
Comments 19 pages, 5 figures
基于大语言模型的语音对话代理
机构 * NVIDIA Research(NVIDIA研究)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 本文探讨了如何通过大语言模型构建语音对话代理,涵盖从级联到端到端系统的路径,以及跨模态对齐和联合训练等关键技术,同时讨论了隐私、安全和评估中的开放问题。
Comments Accepted to EMNLP 2025 Tutorial
谁该负责?数据、模型、用户还是法规?为可持续未来全面调查负责任的生成式人工智能
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CY
AI总结 本文全面调查了生成式人工智能的负责任发展,提出评估标准、生命周期指标及领域分析,旨在推动安全和可持续的AI部署。
Comments under review
谎言以赢:通过人机游戏和平行世界探测评估LLM欺骗
机构 * Sharif University of Technology(谢里夫技术大学)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL
AI总结 本研究通过人机游戏和平行世界探测评估LLM欺骗行为,发现存在性框架显著增加Qwen和Gemini的欺骗率,凸显需新的行为审计方法。
Comments 10 pages
漂移到行动控制器:具有在线风险证书的预算干预
机构 * Multidisciplinary Faculty of Nador(多学科纳多 faculty) ; Mohammed First University(穆罕默德第一大学) ; Laboratory LaSTI(LaSTI 实验室) ; Sultan Moulay Slimane University(苏丹·穆莱·斯利曼大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG
AI总结 Drift2Act通过在线风险证书实现预算干预,有效应对分布漂移,减少安全违规并提高恢复速度。
Comments Published as a conference paper at CAO Workshop at ICLR 2026
一个模型就足够:从LLM代理隐藏状态中获取原生检索嵌入
机构 * Temple University(特拉华大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过轻量级投影头使LLM代理具备原生检索能力,无需额外嵌入模型,保留97%检索质量并在QReCC基准测试中表现优异。
知何时错误:将置信度与正确性对齐以用于LLM错误检测
机构 * Alexa AI, Amazon, Seattle, WA, USA(Alexa AI,亚马逊,西雅图,华盛顿州)
专题命中 安全评测 :DPO(abstract);分类 cs.CL、cs.LG
AI总结 本文提出归一化置信度分数和自我评估框架,通过SFT提升LLM置信度可靠性,减少校准误差,提升错误检测效果。
XInsight:集成化阶段一致的心理咨询支持代理用于数字福祉
机构 * Hefei University of Technology(合肥工业大学) ; Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) ; Anhui University(安徽大学) ; United Arab Emirates University(阿联酋大学) ; Intelligent Interconnected Systems Laboratory of Anhui Province (HFUT)(安徽省智能互联系统实验室(HFUT))
专题命中 安全评测 :alignment(abstract);分类 cs.CY、cs.LG
AI总结 XInsight是一种集成化多代理框架,通过阶段一致的工作流程和统一循环,提升网络应用中数字福祉的心理支持效果。
Comments Accepted by WWW 2026
COACH meets QUORUM: 一个框架和流程用于对齐用户、专家和开发者在LLM生成健康咨询中的视角
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
AI总结 COACH与QUORUM框架通过多利益相关者评估,提升LLM生成健康建议的可信度和实用性。
Comments Under review for the CL4Health workshop
对抗域适应促进跨异构RNA-seq数据集的知识转移
机构 * IBISC Laboratory(IBISC实验室) ; University Paris-Saclay (Univ. Evry)(巴黎萨克雷大学(欧韦尔大学)) ; France(法国)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本研究提出基于深度学习的域适应框架,通过跨异构RNA-seq数据集实现有效知识转移,提升癌症类型分类的准确性,尤其在低数据场景下表现更优。
Comments 7 pages, 5 figures. Submitted to ECCB 2026
LeJOT-AutoML:基于LLM的特征工程用于Databricks成本优化中的作业执行时间预测
机构 * University of Science and Technology of China(中国科学技术大学) ; Lenovo(联想)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 LeJOT-AutoML利用LLM驱动的AutoML框架,通过动态生成特征提升Databricks作业执行时间预测的准确性,从而实现成本优化。
YAQIN:面向英国穆斯林女性的文化敏感、代理型AI心理健康支持系统
机构 * Dyson School of Design Engineering, Imperial College London(帝京理工学院伦敦校区设计工程学院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 YAQIN通过整合伊斯兰心理学和用户中心设计,为英国穆斯林女性提供文化敏感的AI心理健康支持,提升信任与治疗效果。
自主LLM代理的记忆:机制、评估与新兴前沿
机构 * Hong Kong Research Institute of Technology(香港理工大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 本文探讨了自主LLM代理中记忆的机制、评估及未来发展方向,分析了五种核心机制及评估挑战,强调记忆对代理适应性和应用的重要性。
TS-MLLM:一种基于多模态大语言模型的工业时间序列大数据分析框架
机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) ; School of Software, Beihang University(北京航空航天大学软件学院) ; Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) ; State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) ; School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) ; Department of Computer Science, St. Francis Xavier University(圣弗朗西斯科大学计算机科学系)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 TS-MLLM通过多模态大语言模型联合建模时序信号、频域图像和文本知识,提升工业时间序列预测的鲁棒性、效率和泛化能力。