Swarm-Driven Multi-Agent Reasoning for Smart City Security
用于智慧城市安全的群体驱动多智能体推理
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究智慧城市安全问题,提出基于大语言模型的多智能体方法TPSC-Sec,通过专门智能体分析并经威胁信息素群体共识机制聚合假设,还引入Adaptive Verified TPSC,实验表明该方法能实现高效安全推理。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
用于智慧城市安全的群体驱动多智能体推理
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究智慧城市安全问题,提出基于大语言模型的多智能体方法TPSC-Sec,通过专门智能体分析并经威胁信息素群体共识机制聚合假设,还引入Adaptive Verified TPSC,实验表明该方法能实现高效安全推理。
LogSemFuse:用于可解释日志异常检测的语义证据融合
专题命中 推理与问题求解 :LLM(abstract)
AI总结 研究日志异常检测,提出LogSemFuse框架,结合骨干预测与多源语义证据,增强现有检测器,能产生异常决策和基于证据的解释,提升检测效果与可解释性,且开销小。
GRCD:用于多发现胸部X光对的地面区域变化检测
机构 * Department of Computer Science(计算机科学系)
专题命中 推理与问题求解 :language model(abstract)
AI总结 针对现有胸部X光多发现报告自动生成方法不足,提出GRCD框架。通过修正标注错误构建数据集,引入模块编码区域变化并注入语言模型,在多发现测试集上性能优于基线,消融实验验证设计有效性。
HKVLM:通过将语言查询绑定到冻结检测器实现忠实推理定位
机构 * Bo Ma
专题命中 推理与问题求解 :language model(abstract)
AI总结 提出HKVLM框架,通过将定位从语言路径中分离,利用冻结检测器和语言模型,仅训练轻量对齐钩子实现推理定位,在少样本冷启动场景下显著提升定位精度并减少幻觉。
MUSON:用于城市环境中社会合规导航的面向推理的多模态数据集
机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学研究生院) ; Graduate School of Computer Science, George Mason University(乔治·马歇尔大学计算机科学研究生院)
专题命中 推理与问题求解 :language model(abstract)
AI总结 研究社会合规导航问题,利用视觉语言模型,引入含10110个自我中心样本的多模态数据集MUSON,采用五步注释框架,为推进该导航提供有效基准。
De-attribute to Forget for LLM Unlearning
机构 * Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出基于数据归因奖励的LLM遗忘框架DareU,通过强化学习降低生成响应与遗忘数据的归因分数,实现有效遗忘并平衡模型效用。
LLM智能体安全性、多轮红队测试、越狱基准、对抗鲁棒性、安全关键系统
机构 * AIM Intelligence(AIM智能公司) ; KAERI(韩国原子能研究所)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出NRT-Bench基准,通过模拟核电站控制室的多轮红队测试,评估LLM智能体在安全关键系统中的对抗鲁棒性,发现不同模型的漏洞几乎不重叠,且防御效果高度依赖模型。
迈向揭示与修复LLM-in-the-Loop漏洞
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 通过构建首个LLM-in-the-loop漏洞数据集LLMCVE,分析发现LLM常作为目标或传播向量而非根因,并评估现有修复方法,揭示此类漏洞修复更具挑战性。
大语言模型的频谱特征
机构 * Rice University(莱斯大学) ; Dartmouth College(达特茅斯学院) ; Georgia Institute of Technology(佐治亚理工学院) ; University of California, Berkeley(加州大学伯克利分校) ; Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
AI总结 针对大规模管理和量化大语言模型的挑战,采用基于重尾自正则化理论的频谱形状指标,以权重经验谱密度形状信息为模型频谱特征,可用于模型谱系追踪等,还构建语料库进行基准测试。
优化用于药物警戒中因果关系评估的大语言模型:开发一种性能指标作为贝叶斯超参数优化的目标
机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系) ; Safety Operations, Novo Nordisk(诺和制药安全运营部) ; Clinical Development Centre Denmark, Novo Nordisk(丹麦临床开发中心,诺和制药) ; Statistical Data Science Lead, Pfizer(辉瑞统计数据科学负责人)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 研究针对药物警戒中因果关系评估优化大语言模型,开发高斯过程兼容的优化目标,用链思维提示评估GPT-5.2,通过贝叶斯优化研究温度优化效果,EWACS指标优化提升了因果关系分类一致性。
基于学习的自动化对抗红队测试用于大型语言模型的鲁棒性评估
机构 * Independent Researcher(独立研究者) ; Hunan University(湖南大学) ; Shenzhen Kaihong Digital Industry Development Co., Ltd.(深圳凯鸿数字产业开发有限公司) ; Central University of Finance and Economics(中央财经大学) ; Chongqing University(重庆大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Stevens Institute of Technology(斯蒂文斯理工学院) ; Cornell University(康奈尔大学) ; Oak Ridge National Laboratory(橡树岭国家实验室) ; Zhengzhou University of Light Industry(郑州轻工业大学) ; Xidian University(西安电子科技大学) ; The University of Texas at Dallas(德克萨斯大学达拉斯分校) ; AI Safety Research Lab, Institute of Advanced Computing(高级计算研究所人工智能安全研究实验室) ; University of Malaya(马来亚大学) ; Emory University(埃默里大学) ; Department of Nephrology, Affiliated Hospital of Guangdong Medical University(广东医学院附属医院肾内科)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL
AI总结 本文提出一种学习驱动的自动化红队测试框架,用于高效发现大型语言模型的漏洞,通过元提示引导的对抗性提示生成和分层执行检测流程,在六个威胁类别中实现标准化评估,实验发现47个漏洞,包括21个高严重性失败和12种新攻击模式。
Comments ACL ARR minor revision
RLIE:用于大语言模型的基于逻辑回归、迭代细化和评估的规则生成
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)
AI总结 研究提出RLIE框架,将大语言模型与概率建模结合学习加权规则集,经规则生成、逻辑回归、迭代细化和评估四阶段,评估多种推理策略,明确大语言模型在归纳推理中的潜力与局限,实现更可靠的神经符号推理。
关于用于进化优化的大语言模型的系统综述:从建模到求解
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 该综述聚焦进化优化,通过工作流框架系统回顾相关进展,将文献分为优化建模与求解两阶段,求解阶段再分三类范式,分析方法、局限性及与传统方法关系,还给出基准、比较及应用,并指出研究方向。
当评分量表不足时:LLM辅助发现土耳其教师叙述中的ADHD信号
机构 * Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系) ; Department of Child and Adolescent Psychiatry, Gazi University(加齐大学儿童与青少年精神病学系)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究通过分析土耳其教师评估表中的结构化评分和开放式叙述,利用大语言模型辅助的主题发现方法,揭示了叙述文本中未被结构化量表捕捉的ADHD互补信号。
Comments 15 pages. Accepted to CLPsych 2026. Camera-ready author version. The final version will appear in the ACL Anthology
Journal ref In Proceedings of the 10th Workshop on Computational Linguistics and Clinical Psychology (CLPsych 2026), pages 368-382, San Diego, California, USA, 2026. Association for Computational Linguistics
通过去噪自编码器和上下文大语言模型进行汽车硬件在环验证中的故障检测与可解释分类
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)
AI总结 提出用于汽车实时验证中故障检测与分类的通用且可解释的两阶段框架,先以去噪自编码器标记异常,再用大语言模型分类并给出解释,评估显示该方法有效。
SCURank: 基于摘要内容单元的多候选摘要排序以提升摘要生成
机构 * Department of Computer Science and Information Engineering, National Cheng Kung University(国立成功大学计算机科学与资讯工程系) ; Artificial Intelligence Research Center, Chang Gung University(长庚大学人工智能研究中心) ; Department of Artificial Intelligence, Chang Gung University(长庚大学人工智能系) ; Department of Computer Science, National Tsing Hua University(国立清华大学计算机科学系)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);small language model(abstract)
AI总结 SCURank通过摘要内容单元提升摘要生成,优于传统指标和LLM排序方法,验证了信息导向排序在多LLM蒸馏中的优势。
Comments Accepted by ACL 2026 Findings
望远镜:通过测量令牌重复概率改进大语言模型生成内容的零样本检测
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究区分大语言模型生成文本与人类写作的难题,提出用望远镜困惑度衡量模型令牌重复,揭示该特征在预训练早期出现,能有效进行零样本检测,性能优于其他方法。
Comments 50 pages, ICML, 20 figures, Equal contribution
大语言模型中的双语偏差:一项台湾主权基准研究
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 研究大语言模型在多语言环境下对政治敏感话题的语言一致性,通过对17个模型进行双语基准测试,发现显著语言偏差,提出量化指标并开源框架。
Comments 19 pages, 4 tables, benchmark code available at https://github.com/dAAAb/ai-taiwan-sovereignty-benchmark-pro
大语言模型的风险评估与安全分析
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 针对大语言模型在关键应用场景的安全问题,设计动态风险评估系统与分层防御系统,用熵加权计算多指标,结合多种技术,能识别隐蔽攻击并快速评估风险。
Robobench:作为具身大脑的多模态大语言模型的综合评估基准
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机学院,北京大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Institute for Brain and Intelligence, Fudan University(脑与智能研究院,复旦大学) ; University of Science and Technology Beijing(北京科技大学) ; Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)
AI总结 研究针对在动态非结构化环境中构建能感知、推理和行动的机器人的挑战,介绍RoboBench基准,涵盖多维度、多任务等,能评估多模态大语言模型,揭示其局限性并分析与下游控制关系,为量化高级认知提供支架。
Comments ECCV 2026 Camera Ready
大规模安全测试LLM智能体:从风险发现到基于证据的验证
机构 * AntGroup(蚂蚁集团) ; Zhejiang University(浙江大学) ; Fudan University(复旦大学) ; Alibaba Group(阿里巴巴集团) ; Hunan Institute of Advanced Technology(湖南先进技术研究院) ; Deakin University(迪肯大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 提出Vera框架,通过文献驱动的风险发现、组合生成可执行安全用例和自适应执行与证据验证三阶段流水线,实现端到端自动化安全测试,在四个生产级智能体框架上发现严重漏洞,平均攻击成功率93.9%。
ChatImage:通过交互式图像导航大语言模型的长文本回答
机构 * Zhejiang University(浙江大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 针对LLM长文本答案难以细粒度浏览的问题,ChatImage将其转为带点击热点的交互图像,支持局部查询,提升内容与交互区域的一致性,还开源实现并发布多格式评测基准。
Comments Project:https://wencanjiang.github.io/ChatImage
让每个人都参与进来:关于大语言模型辅助群体决策的实验研究
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 研究大语言模型辅助群体决策,通过随机实验,比较无辅助、一次性信息共享提示、人类辅助和大语言模型辅助四种条件下完成隐藏档案任务的情况,发现大语言模型辅助能增加信息共享,且成本有限,还开源数据和平台。
Comments To appear at ACM CSCW 2026
APeB:大型语言模型智能体个性化能力基准测试
机构 * The Chinese University of Hong Kong(香港中文大学) ; ByteDance(字节跳动)
专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI
AI总结 研究大型语言模型智能体在处理原始、未明确查询时的个性化问题,通过引入个性化产品搜索测试平台构建基准测试,评估发现模型处理明确查询较好,但早期查询有困难,简单方法能提升性能。
Comments NA
VCB Bench:用于音频基础大语言模型对话代理的评估基准
机构 * School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) ; Tencent AI Lab(腾讯AI实验室)
专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL
AI总结 针对现有音频语言模型基准局限,提出VCB Bench,基于真实人类语音构建,从指令跟随、知识理解、鲁棒性三个角度评估,揭示性能差距并指明改进方向,提供评估框架。
Comments 25 pages, 9 figures, accepted by ACL 2026 Findings
固定合成日语咨询对话中的结构化提示与自动评估
机构 * Japan National Institute of Occupational Safety and Health(日本国立职业安全卫生研究所) ; Kaze To Taiyo(凯泽・太阳) ; Saga Occupational Health Association(Saga职业健康协会) ; Department of Pharmacy, Zikei Hospital/Zikei Institute of Psychiatry(药剂科,Zikei医院/Zikei精神医学研究所) ; Department of Medical Welfare, Suzuka University of Medical Science(医疗福祉科, Suzuka医科大学) ; Graduate School of Human Sciences, Ritsumeikan University(人类科学研究生院,立命馆大学) ; Faculty of Nursing, National Defense Medical College(护理学部,国家防卫医疗大学) ; Support Center for Students with Disabilities, Aoyama Gakuin University(残疾学生支持中心,上智大学)
专题命中 评测与基准 :prompting(title);LLM(abstract);large language model(abstract);language model(abstract)
AI总结 研究通过人工智能生成的18份固定日语咨询对话记录,对比GPT - minimal、GPT - SMDP和Claude - SMDP三种情况,咨询专家与新的语言模型分别评级,发现SMDP对话在多方面获更高专家评级,语言模型评级可重复但偏宽松。
Comments 59 pages, 2 figures, 30 tables; supplemental material included; data and code at https://doi.org/10.5281/zenodo.21182321; preregistration at https://doi.org/10.17605/OSF.IO/VU286
OpenCoderRank: 基于生成式AI的个性化技术评估
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)
AI总结 OpenCoderRank是一种轻量级自托管平台,通过模拟真实世界限时技术评估,为资源受限环境提供定制化评估解决方案,结合BERTScore和LLM评估方法验证其有效性。
Comments Accepted to SynthIR Workshop (SIGIR 2026)
HAS-Bench:在可配置人类参与下评估基于大语言模型的人机系统
机构 * The University of Tokyo(东京大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; MBZUAI ; McGill University(麦吉尔大学) ; Zhejiang University(浙江大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 介绍基于图的HAS-Framework框架,在此基础上HAS-Bench在多方面可配置人类参与下评估人机系统,测量任务结果与协作行为,实验表明人类参与可提升任务完成等,但收益取决于参与方式等。
跨连续软件开发工具包版本对大语言模型生成的量子代码中的 API 漂移进行基准测试
机构 * Department of Computer Science(计算机科学系) ; Khalifa University(卡利法大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大语言模型生成的量子代码能否可靠适配特定 SDK 版本(API 漂移问题),引入量子 API 漂移基准,以 Qiskit 为例评估 17 个模型,揭示版本对齐是量子代码生成评估新维度及 API 漂移恢复情况。
探索用于沉浸式虚拟现实的上下文感知和大语言模型驱动的移动
机构 * Technical University of Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Human-Centered Technologies for Learning(以人为本的学习技术)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究提出由大语言模型驱动的移动技术,让用户用自然语言在虚拟环境中导航。通过评估三种移动方法,结合眼动追踪数据分析和标准化问卷,发现该方法有潜力成为可行的免手持替代方案,能促进虚拟空间免手持移动。
Comments 28 pages. To appear in the Proceedings of the ACM on Human-Computer Interaction (PACM HCI), Vol. 10, No. 5; presented at the 28th ACM International Conference on Mobile Human-Computer Interaction (MobileHCI 2026)