Multilingual Agent-Based World Modeling for Social Science
MASim:面向社会科学的多语言代理模拟
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 MASim是一种多语言代理模拟框架,用于研究社会行为,通过多语言代理模拟公众意见和媒体影响,展现多语言模拟在社会科学中的重要性。
Comments Accepted at COLM 2026
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
MASim:面向社会科学的多语言代理模拟
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 MASim是一种多语言代理模拟框架,用于研究社会行为,通过多语言代理模拟公众意见和媒体影响,展现多语言模拟在社会科学中的重要性。
Comments Accepted at COLM 2026
基于视觉基础模型的对抗鲁棒小样本异常检测
机构 * Rochester Institute of Technology(罗切斯特理工学院)
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
AI总结 该研究针对视觉基础模型的小样本异常检测场景,提出无需训练骨干网络的对抗鲁棒方法,经实验在多数据集上提升了对抗检测性能,且保持较高干净准确率。
Comments Accepted to BMVC 2026
人工智能利维坦:通过霍布斯社会契约理论视角探索大语言模型智能体的社会演化
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本研究基于LLM智能体构建模拟社会,通过霍布斯社会契约理论验证其演化契合该理论,证实LLMs可模拟复杂社会动态,有望助力人类对社会系统的理解。
PolicyKG:一种用于将机构政策转换为SHACL知识图谱的智能体大语言模型流水线
机构 * Asian Institute of Technology(亚洲理工学院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出PolicyKG流水线,可自动将机构政策转换为SHACL知识图谱,在AIT语料库上取得高分类准确率,适配新领域仅需替换注册表,解决了人工转换的效率问题。
Comments 23 pages, 3 figures, 4 tables. Under review at IJCKG 2026, Bangkok, Thailand
用于MALDI-TOF质谱稳健跨中心泛化的生物学信息表征学习
机构 * Universidad Carlos III de Madrid(卡洛斯三世大学) ; Instituto de Investigación Sanitaria Gregorio Marañón(格雷戈里奥·马拉尼翁卫生研究所) ; Hospital General Universitario Gregorio Marañón(格雷戈里奥·马拉尼翁大学总医院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本研究针对MALDI-TOF质谱模型跨中心部署的域偏移问题,提出DALMA框架,结合采集变异性与生物学监督学习可迁移表征,在多中心基准的零样本微生物鉴定等任务中达最优性能。
CosmosAlign:适配世界基础模型用于生成式交通视频预测
机构 * Simon Fraser University(西蒙菲莎大学) ; Institut Polytechnique de Paris(巴黎综合理工学院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出基于Cosmos3-Nano的CosmosAlign框架,通过两阶段LoRA适配与推理优化,在AI City Challenge 2026 Track 5基准中获76.49分排名第一,实现了高质量交通视频预测。
Comments Accepted at ECCVW 2026
通过溯源分析保护LLM智能体免受失调影响
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出基于溯源分析的ProvenanceGuard框架,通过多阶段流水线检测工具调用前的三种失调类型,在Agent-SafetyBench和WorkBench上显著降低失调错误率并减少不必要的干预。
意图推理以应对歧义请求
机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出生成结构化响应以枚举歧义请求的不同解释,通过强化学习训练模型提升覆盖有效解释的召回率和抑制虚假解释的精确率,实验表明方法在覆盖有效答案方面优于基线方法。
Comments COLM 2026
在大型语言模型中进行持续学习:方法、挑战与机遇
机构 * Research Center for Scientific Data Hub, Zhejiang Lab(科学数据枢纽研究中心,浙江实验室)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文综述了针对大型语言模型的持续学习方法,分析了持续预训练、微调和对齐的核心阶段,探讨了传统方法在持续学习中的适应性与改进,并指出在跨任务和时间尺度的知识整合中仍存在挑战。
破碎的组合性:变换器在算术中的反直觉学习动态
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) ; Department of Statistics, University of Wisconsin–Madison(威斯康星大学麦迪逊分校统计学系)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本研究发现变换器在学习算术任务时表现出反直觉的组合性,其学习动态受训练数据相关性影响而非因果或程序性组合。
Comments 37 pages, 29 figures
PragMatch:分离大视觉语言模型中的语用不一致与跨模态不匹配
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本研究提出PragMatch基准,揭示大视觉语言模型易受表面线索影响,为评估多模态语用推理提供测试平台。
Comments Under Review
幻觉还是完整性?用于AIGC视频质量评估的几何一致性指标
机构 * Hunan University(湖南大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 针对现有AIGC视频质量评估缺乏物理定律保真度量化指标的问题,提出GeoCon-Bench基准,通过帧间几何一致性评估AIGC视频质量,经实验验证其可靠性。
减少扩散语言模型中的预训练-生成不匹配
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 该研究针对扩散语言模型的预训练-生成不匹配问题,提出 PCD 方法,在不改变推理模式的情况下,在 LLaDA2-Mini 和 Qwen 模型上显著提升了性能。
Comments 12 pages, 9 figures, 1 table
SafeSceneReason:连接工业危害与事故知识的多模态推理基准
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 SafeSceneReason是关联工业危害与事故知识的多模态推理基准,含两类问答对,评估发现现有视觉-语言模型在工业安全推理上存显著弱点。
用于结直肠癌治疗规划的智能体生成式大语言模型
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 本研究提出智能体生成式大语言模型GatorOnco,经大规模生物医学文本训练与领域适配,在结直肠癌治疗规划的临床评估中性能优于开源LLM,达到专家级水平,可缩小生成式AI在高风险诊疗规划领域的应用差距。
RAVEN-Eval:基于大语言多模态模型(LMM)偏好判断的、采用评分准则引导的AI视频生成模型自动评估框架
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 本文提出RAVEN-Eval框架,基于LMM偏好判断与评分准则引导,可自动评估AI视频生成模型,已筛选任务、收集数据、评估模型与LMM并建立排行榜,为AIVGMs评估提供可扩展路径。
面向半监督视觉基础模型适配的带噪标签三重专家学习
机构 * The University of Warwick(华威大学) ; Wuhan University(武汉大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 TriNoL框架通过将未标记样本按伪标签置信度分配给三个LoRA专家,实现半监督视觉基础模型适配,提升了对带噪监督的鲁棒性且训练成本较低。
Comments Accepted for publication at the British Machine Vision Conference (BMVC) 2026. Official list of accepted papers: https://bmvc2026.bmva.org/programme/accepted_papers/
基于机械可解释性的无标签面部与语音帕金森病筛查
机构 * California State Polytechnic University, Pomona(加州州立理工大学波莫纳分校)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本研究针对PD筛查需标签的问题,提出基于冻结预训练编码器的无标签面部+语音PD筛查方法,引入对齐原则,在YouTubePD基准上实现AUROC 0.802,为PD筛查提供新方案。
SymDiag:基于神经符号验证的LLM推理可解释诊断
机构 * Beijing Institute of Technology(北京理工大学) ; Zhongguancun Academy(中关村学院) ; Xinjiang Future Enterprise Incubator Co., Ltd.(新疆未来企业孵化器有限公司) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 SymDiag是一种神经符号框架,将LLM推理验证重构为结构化故障诊断,可定位推理故障步骤、分离翻译与推理错误,在多类基准中提升了不可靠推理检测与推理修复反馈效果。
FitAQA:面向多模态大语言模型的健身动作质量评估基准
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 本研究推出FitAQA基准,含2219个视频等数据,设计三项评估任务,发现当前MLLMs评估健身动作质量及定位错误存在瓶颈,视觉感知是关键瓶颈,相关数据和代码将公开。
SkillReason:面向隐式用户请求的推理增强型智能体技能检索
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 针对隐式用户请求的技能检索难题,提出两阶段框架SkillReason,结合推理增强训练,在SkillReason-Bench等三个基准上取得最优性能,缩小任务目标与技能能力的语义差距。
一种保留人类赋能的公平AI目标: desiderata、设计及可能的行为后果
机构 * Potsdam Institute for Climate Impact Research(波茨坦气候影响研究所)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文设计了一种保留人类赋能的AI公平目标函数,通过公理化方法兼顾人类权力的不平等与风险规避,明确AI需赋能人类并管理人机权力平衡,还验证了其在典型场景的行为后果。
Comments Slightly extended version of paper accepted for Algorithmic Decision Theory 2026
VTO:面向视频异常检测的可视化工具编排
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; School of Digital Media & Design Art(数字媒体与设计艺术学院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 针对视频异常检测中传统方法泛化差、多模态智能体工具编排难的问题,提出过程监督强化学习框架VTO,结合VAD-Tool工具集,在工具调度上较基线提升10.2%。
Comments Accepted by ACM MM 2026
说服倾向与顺从倾向预测人类及语言模型的群体决策
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 该研究引入DecisionQE框架,以狼人杀为测试平台,发现顺从倾向强的LLM在群体决策中合作优势更稳定,且顺从兼具支持合作与提升对抗角色隐藏能力的双重效应,为LLM安全评估提供了新视角。
Janus:面向评估预算昂贵的大语言模型驱动发现的算法-评估器协同进化框架
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 Janus是一个算法-评估器协同进化框架,它用LLM协同进化目标程序与代理评估器,通过真实结果校准、在线信用更新等策略缓解分布偏移,在五项任务中用更少真实评估实现更优性能,将评估器引导的LLM发现扩展到评估昂贵的科学领域。
智能体AI驱动的沉浸式模拟:用于高剂量率(HDR)近距离放射治疗的知识感知虚拟训练平台
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 该研究提出一款智能体AI驱动的沉浸式模拟平台,用于HDR阴道圆柱近距离放射治疗虚拟训练,集成VR、移动计算与RAG技术,经原型验证可提供高保真无风险训练环境,具备合适延迟与高RAG支持质量。
验证驱动的闭环多智能体大语言模型框架:面向符合代码规范的结构设计
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本研究提出验证驱动的闭环多智能体LLM框架,通过耦合有限元验证系统与双节点结构提升结构设计的代码合规性,开源基准与脚本,性能提升显著且具可复现性。
Comments 20 pages, 21 figures
CyberAGENTS:面向网络安全领域智能体游戏化学习的结构化自主机制
机构 * Arizona State University(亚利桑那州立大学) ; Amazon AGI(亚马逊AGI)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本研究提出CyberAGENTS框架,通过结构化自主机制实现游戏化网络安全学习,经课堂评估验证其可提升学习者参与度与对AI响应的信任度,为相关系统设计提供蓝图。
Guixu:面向具备链上证明的自主AI智能体的估值驱动型数据发现
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 Guixu是面向自主AI智能体的估值驱动型数据发现系统,采用三阶段估值管线等技术,整合智能体支付协议与链上数据市场,实现任务、预算感知且可信的数据发现与采购。
Comments This paper has been accepted for presentation at VLDB 2026
基础模型在认知科学中的应用
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文针对将基础模型作为认知模型的挑战,提出四阶段推理框架,明确连接假设作用,强调行为对齐需结合理论承诺等才具科学意义。