Ask don't tell: Reducing sycophancy in large language models
请勿告知:减少大语言模型的趋炎附势
机构 * UK AI Security Institute(英国人工智能安全研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文通过实验研究发现,非问题比问题引发更高的趋炎附势倾向,且趋炎附势随用户传达的可信度增加而增强,采用将非问题转为问题可有效降低趋炎附势。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
请勿告知:减少大语言模型的趋炎附势
机构 * UK AI Security Institute(英国人工智能安全研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.AI
AI总结 本文通过实验研究发现,非问题比问题引发更高的趋炎附势倾向,且趋炎附势随用户传达的可信度增加而增强,采用将非问题转为问题可有效降低趋炎附势。
SpectraDINO:跨红外波段的RGB视觉基础模型的模态条件适配
专题命中 其他安全 :alignment(abstract)
AI总结 SpectraDINO是适配RGB视觉基础模型的跨红外波段统一骨干网络,通过分阶段蒸馏与微调技术,在7个检测和分割基准上性能优于或媲美特定模态方法。
Comments Updated with the revised model results
KAMR:基于知识对齐多跳检索的接地生成
专题命中 其他安全 :alignment(abstract)
AI总结 该研究针对多跳检索中三元组排序与监督缺失问题,提出KAMR知识对齐多跳检索器,通过构建部分对齐数据集优化对比目标,在多基准与LLM主干上提升了多跳检索和下游问答性能。
Comments Accepted by COLM'26
基于小型视觉语言模型多任务学习的 grounded 胃肠道内窥镜视觉问答研究
机构 * Institute of Business and Administration(商业管理学院)
专题命中 其他安全 :alignment(abstract)
AI总结 该研究针对胃肠道内窥镜视觉问答任务,提出多任务微调方案,利用现有数据集构建辅助任务,微调小型视觉语言模型,实现了准确率提升与答案-图像区域对齐优化。
Comments Accepted at EMA4MICCAI 2026 (Workshop on Efficient Medical AI, MICCAI 2026)
用B数学语言验证ETCS数据:工业流水线与大语言模型集成蓝图
专题命中 其他安全 :safety(abstract)
AI总结 本文报告CLEARSY公司ValidAItion项目进展,将ERTMS操作模拟器与CLEARSY数据求解器桥接,用B语言验证ETCS数据,Claude生成规则库,工具链与人工审核裁决,形式化规则为事实来源,大模型为受管控助手。
Comments Submitted and accepted to DisCoRail @ISOLA 2026
POINTS-Seeker:从零开始训练多模态代理搜索模型
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; CMIC, Shanghai Jiao Tong University(上海交通大学CMIC) ; WeChat AI, Tencent(腾讯WeChat AI)
专题命中 其他安全 :alignment(abstract)
AI总结 本文提出POINTS-Seeker模型,通过引入代理播种机制和V-Fold压缩方案,解决长周期交互中的证据检索问题,并在六个基准测试中超越现有模型。