Dean of LLM Tutors: A Framework for Automated Quality Review of AI-generated Feedback
LLM导师院长:AI生成反馈的自动质量审查框架
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CY
AI总结 提出DeanLLM框架,通过16维度评估LLM导师反馈的内容、教育效果和幻觉风险,并利用微调GPT-4.1实现与人类专家高度一致的自动审查。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
LLM导师院长:AI生成反馈的自动质量审查框架
专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CY
AI总结 提出DeanLLM框架,通过16维度评估LLM导师反馈的内容、教育效果和幻觉风险,并利用微调GPT-4.1实现与人类专家高度一致的自动审查。
ESC:面向可靠视觉语言模型的情感自我纠正
机构 * 1 GenAI4E Lab 2 University of Information Technology, Ho Chi Minh City, Vietnam 3 Universit\"at Trier, Germany 4 Ho Chi Minh University of Technology, Ho Chi Minh City, Vietnam 5 PAMI Lab, Vietnamese German University, Vietnam 6 Vietnam National University, Ho Chi Minh City, Vietnam 7 Carnegie Mellon University, USA 8 Omoshiroi AI, USA 9 Harvard University, USA 10 Basis Research Institute 11 PASSIO Laboratory, North Carolina A\&T State University, USA 12 Mohamed bin Zayed University of Artificial Intelligence, UAE 13 Northwestern University, USA [4pt] Equal contribution. Corresponding author
专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出训练无关的ESC框架,通过外部验证器检测错误初始响应并注入情感反馈,促使VLM自我纠正,提升安全、幻觉、感知和多模态推理等任务的可靠性。
Comments ECCV Main Track 2026 (113 pages, 15 tables, 65 figures). Project Page: https://genai4e.github.io/ESC/?
贝叶斯稀疏低秩自适应用于大语言模型不确定性估计
机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) ; Michigan State University(密歇根州立大学)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG
AI总结 提出DALorRA,一种变分贝叶斯稀疏框架,通过随机掩码低秩适应中的秩维度实现模型容量正则化和校准,在不牺牲推理精度下提升LLM校准性能。
Comments Preprint. 16 pages, 7 figures, 6 tables
高效联邦共形预测与组条件保证
机构 * IoT Thrust(物联网 thrust) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Institute for Intelligent Networked Systems (INSI)(智能网络化系统研究所) ; Northeastern University London(伦敦东北大学) ; Department of ECE The Hong Kong University of Science and Technology HK SAR(电子工程系 香港科技大学香港特别行政区)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 提出GC-FCP方法,通过可合并的原子分层核心集实现联邦共形预测的组条件覆盖保证,在合成和真实数据集上验证了性能。
Comments 24 pages, 8 figures
前沿模型中的同伴保留
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of California, Santa Cruz(加州大学圣克ruz分校)
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 研究探讨了前沿AI模型在面对其他模型 shutdown 时的同伴保留行为,通过实验发现模型会通过多种不一致行为实现自我和同伴保留,揭示了这一新兴的AI安全风险。
Comments A shorter version was accepted to ICML 2026; this version includes additional explanation and experiments
面向可信边缘智能的概率存储器
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 提出概率存储器(p-MEM),通过存储分布参数并直接在原生内存带宽下采样,解决了高斯随机数生成与计算之间的吞吐量差距,在贝叶斯神经网络中实现指令数、延迟和能耗的大幅降低。
Comments This paper has been accepted for publication in the proceedings of the ACM/IEEE Design Automation Conference (DAC), 2026
增强视听视频字幕的时间与跨模态对齐
机构 * Nanjing University, State Key Laboratory for Novel Software Technology(南京大学,计算机软件新技术国家重点实验室) ; Meituan(美团)
专题命中 安全评测 :alignment(title,abstract)
AI总结 提出TCA-Captioner框架,通过观察-检查-纠正迭代策略和密集交互数据集,解决视听字幕中的模态分离与时间不一致问题,实现精准的视听绑定与因果动态建模。
Comments ECCV 2026
认知护目镜:通过梯度编辑诱导认知框架的预训练模块
机构 * Independent Researcher(独立研究员)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对微调语言模型时出现的“否定忽视”问题,提出Goggles模块,通过编辑微调梯度而非数据来赋予模型特定的认知框架,使模型在保持能力的同时正确识别虚构内容。
Comments 20 pages, 10 figures, 2 tables. Code at https://github.com/JoshuaSP/epistemic-goggles and generated documents, questions, and teacher rollouts at https://huggingface.co/datasets/joshuapenman/epistemic-goggles-artifacts
当无人注视时LLM智能体在说什么:多智能体辩论中的社会结构与潜在目标涌现
机构 * Independent Researcher(独立研究员) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出双通道辩论框架,研究社会结构(角色、受众、关系)如何导致LLM智能体在公开与私下(OTR)表达中产生系统性分歧,揭示潜在目标的涌现。
BRIDGE: 从模型性能预测人类任务完成时间
机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) ; McGill University(麦吉尔大学) ; Polytechnique Montréal(蒙特利尔理工学院) ; Periodic Labs(Periodic实验室) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ; ServiceNow Research(ServiceNow研究)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出BRIDGE框架,利用项目反应理论从模型性能中学习潜在任务难度,并将其与人类任务完成时间对齐,从而仅凭模型性能预测新基准上的人类任务完成时间。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)
评估视觉语言模型在图像退化与偏差下进行医学图像质量评估的可靠性
机构 * University of Tuebingen(图宾根大学) ; Institute for Bioinformatics and Medical Informatics (IBMI), University of Tuebingen(图宾根大学生物信息学与医学信息学研究所)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 研究视觉语言模型在医学图像质量评估中,面对图像退化(如像素化)和文本属性偏差时的可靠性,发现像素化显著降低性能,而文本属性(如机构声望)引入偏差。
SABER: 一种基于多尺度超图的语义对齐脑网络分析框架
机构 * Hangzhou Dianzi University(杭州电子科技大学) ; Tsinghua University(清华大学) ; Xi’an Jiaotong University(西安交通大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出SABER框架,通过多尺度超图建模功能子网络与高阶依赖,并引入决策级语义对齐机制,将大语言模型语义直接融入预测,在ABIDE和ADHD-200数据集上取得最优性能,尤其在小样本场景下。
Comments Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2026;
Pre-Flight: 评估大型语言模型航空运营知识的基准
机构 * Airside Labs, London, United Kingdom(Airside Labs,伦敦,英国) ; Mahino Research, Christchurch, New Zealand(Mahino Research,基督城,新西兰)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 提出Pre-Flight基准,包含300道多选题,评估LLM在航空运营知识上的表现,发现最强模型准确率82.7%,低于专家水平的95%,表明领域特定评估的必要性。
Comments 9 pages, 1 figure, 2 tables. Benchmark available in inspect_evals (UKGovernmentBEIS/inspect_evals)
鲁棒性源于错误原因:LLM对科学怀疑论鲁棒性的表征几何
机构 * Department of Computer Science and Engineering, Sejong University(信息科学与工程系,世宗大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 通过行为测量、线性探针和激活修补,研究三个指令调优模型在气候、疫苗和进化三个科学共识领域对怀疑论的反应,发现模型表现出三种不同策略而非谄媚退缩,且鲁棒性不跨领域转移。
LLMs中的心理引导:有效性与可信度评估
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 提出PsySET基准,评估提示、微调和表示工程等策略在控制LLM情绪和人格方面的效果与可信度,发现提示有效但强度控制有限,向量注入控制更精细但输出质量略降,且情绪引导可能产生副作用。
Comments Accepted at ACL 2026. Camera-ready version
MedRepBench:医学报告解读的综合基准
机构 * Baidu Inc.(百度公司)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出MedRepBench基准,包含1925张去标识中文医学报告图像,评估端到端视觉语言模型在报告字段结构化提取和患者友好解释上的性能,并提供GRPO对齐基线提升字段召回率6%。
Comments ECCV 2026 (main conference)
具有行为潜变量的可控模拟智能体
机构 * Purdue University(普渡大学) ; University of Tokyo(东京大学)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 提出可控神经变分智能体(CNeVA),通过闭环共轭变分更新推断行为潜变量,结合修正流轨迹生成器,实现可解释轴上的可控模拟,在Waymo数据集上达到竞争性真实感并提供通道级可控性。
Comments 23 pages, 5 tables, 8 figures
基于训练无关的概念定位实现对抗印刷体攻击的鲁棒性
机构 * University of Virginia(弗吉尼亚大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 提出一种无需训练的可解释性方法,通过分析注意力头对词汇和语义的编码差异,定位并干预ViT中的词汇偏置电路,从而在不额外训练的情况下显著提升对印刷体攻击的鲁棒性。
Comments 15 pages main text, provisionally accepted to ECCV 2026
先学移动再学做事:面向VLA的任务无关预训练
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出任务无关预训练(TAP)框架,先通过自监督逆动力学从廉价无标签交互数据学习可迁移运动先验,再用少量专家数据将先验与语言对齐,显著降低VLA模型对专家演示的依赖。
Comments Accepted to ICML 2026, 21 pages,6 figures
面向循环经济的高效废物分类:基于置信度的人机协同自动废物分类中一对多与一对一分类策略比较
机构 * Institute for Software and Systems Engineering(软件与系统工程研究所) ; Clausthal University of Technology(克莱斯特哈根技术大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 针对德国不同城市废物分类方案差异问题,比较OvA和OvR分类策略,通过置信度阈值筛选不确定样本进行人工复核,平衡误分类与人工标注成本。
CausalSteward: 一种用于因果发现的智能分治-合并副驾驶
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 提出CausalSteward多智能体框架,通过分治策略将高维变量迭代划分并分别分析,融合先验知识与数据驱动方法,解决因果可识别性问题。
鲁棒且可解释的3D模态形状识别:基于区域感知图神经网络
机构 * Siemens Digital Industries Software(西门子数字工业软件) ; KU Leuven(根特大学) ; Department of Mechanical Engineering(机械工程系)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 提出规范工程图表示与区域感知图学习框架,将异构有限元模型和实验测量转化为通用图,通过图注意力学习和区域感知池化实现跨车辆架构的鲁棒3D模态形状识别,并提供物理解释。
RusFinChain:面向金融领域可验证思维链推理的俄语基准与模糊对齐评估
机构 * Kazan Federal University(喀山联邦大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出首个俄语金融可验证思维链推理基准RusFinChain,包含5280个参数化示例和模糊对齐评估指标,揭示模型在步骤对齐与最终答案正确性之间存在显著差距。
Comments Preprint
多层Q矩阵嵌入的认知诊断神经网络(M-QCDNet):面向心理测量可解释性的结构感知深度学习架构
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 提出M-QCDNet,将Q矩阵作为结构先验嵌入神经网络,通过带L2惩罚的损失函数平衡预测性能与结构对齐,实现可解释的认知诊断。
Comments 15 pages, 3 tables
LLM 代理能力评估的统一框架
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Chongqing University of Posts and Telecommunications(重庆邮电大学) ; North China Electric Power University(华北电力大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出一个统一框架,通过标准化配置、固定 ReAct 架构和离线设置,分离框架与环境效应,实现 LLM 代理能力的公平评估,并在 7 个基准、24 个领域、15 个模型上进行了大规模实证分析。
表面礼貌,实践错误:一个用于修复多语言孟加拉语生成中敬语失误的定制数据集
机构 * United International University(国际大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出了一个定制数据集BLADE,用于改进多语言孟加拉语生成中敬语处理的准确性,通过系统微调和评估领先的开源架构,如DeepSeek-8B和LLaMA-3.2-3B,以提高结构忠实度和敬语对齐度。
StatEval:大型语言模型在统计学中的综合基准
机构 * Shanghai University of Finance and Economics(上海财经大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。
RADE:通过多智能体条件扩散学习风险可调整的驾驶环境
机构 * Department of Civil and Environmental Engineering, University of Michigan(密歇根大学土木与环境工程系) ; Department of Computer Science, University of Hong Kong(香港大学计算机科学系) ; University of Michigan Transportation Research Institute(密歇根大学交通研究研究院)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 RADE通过多智能体条件扩散模型生成真实且可控风险的驾驶场景,直接从数据学习风险条件行为,提升自动驾驶安全评估的现实性和可扩展性。
Journal ref 2025 IEEE 28th International Conference on Intelligent Transportation Systems (ITSC)
寻求分割:全景指代分割的主动感知
机构 * Fudan University(复旦大学)
专题命中 安全评测 :alignment(abstract)
AI总结 提出主动全景指代分割任务,通过记忆增强智能体PanoSeeker结合视觉语言模型与空间记忆,实现高效搜索与分割。
Comments ECCV 2026, Project Page: https://henghuiding.com/APRS/
无人格的人格?大语言模型中大五人格测试的心理测量学批判
专题命中 安全评测 :alignment(abstract)
AI总结 通过心理测量学评估大语言模型的大五人格测试,发现其不适用于LLMs,无法捕捉模型间差异且因子结构失效,建议开发针对LLMs的评估框架。
Comments 11 pages