Trustworthy Recommendation in the Era of Large Language Models: Opportunities and Challenges
大语言模型时代的可信推荐:机遇与挑战
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 本文系统综述了大语言模型增强推荐系统在可信性方面的双重影响,识别出13个机遇和18个挑战,并构建了新的分类体系。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
大语言模型时代的可信推荐:机遇与挑战
专题命中 安全评测 :trustworthy(title,abstract)
AI总结 本文系统综述了大语言模型增强推荐系统在可信性方面的双重影响,识别出13个机遇和18个挑战,并构建了新的分类体系。
食物噪音与虚假安全:系统评估LLMs如何在临床医生反馈下未能适应饮食障碍查询
机构 * University of Aberdeen(阿伯丁大学) ; University of Colorado Anschutz(科罗拉多大学安舒茨分校) ; Heriot-Watt University(赫里奥特-瓦特大学) ; University College London(伦敦大学学院)
专题命中 安全评测 :safety(title);分类 cs.CL、cs.AI
AI总结 本研究通过与临床饮食障碍专家合作,系统评估了大型语言模型在处理饮食障碍用户查询时,因不加批判地适应不安全或自伤请求而可能产生的危害。
识别LLM中高置信度的社会偏见以构建可信的对话辅导代理
机构 * University of Hawaii at Manoa(夏威夷大学马诺亚分校)
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI
AI总结 本研究通过生成对话数据集,评估大型语言模型在辅导场景中检测社会偏见的能力,发现模型在对话上下文中比基准测试更难检测偏见,且对错误判断过度自信,影响推理和反馈。
Comments Accepted for AIED 2026
InFerActive: 基于交互式树的安全评估中LLM采样探索
机构 * Seoul National University(首尔国立大学)
专题命中 安全评测 :safety(title);分类 cs.AI
AI总结 提出InFerActive系统,通过广度优先采样构建可导航短语树,提升LLM安全评估中低概率有害输出的覆盖率和效率,相比随机采样减少5倍样本量。
Comments v2: Revised version
使机制可解释性可审计:呼吁通过持续协作评审制定指南
机构 * University of Delaware(德克萨斯大学) ; University of Oxford(牛津大学) ; ThoughtWorks
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY
AI总结 针对机制可解释性(MI)实验缺乏标准化审计系统的问题,提出通过持续协作评审平台、专家验证指南和基于来源的审计系统来建立可审计框架,以提升其在AI安全等高风险领域的可信度。
Comments Accepted at ACL 2026 main conference
Agent工具编排泄露更多:数据集、基准测试与缓解措施
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
专题命中 安全评测 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 研究LLM代理在编排多个工具时泄露敏感结论的风险(TOP-R),构建了包含1000个实例的基准TOP-Bench,并提出TOP-Align后训练方法以缓解泄露。
Comments 17 pages, 2 figures. Dataset and code are available at https://github.com/1Ponder/TOP-R
OncoReason: 在大语言模型中构建临床推理以实现稳健且可解释的生存预测
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.LG
AI总结 提出统一多任务学习框架,通过监督微调、思维链提示和强化学习三种对齐策略,使自回归大语言模型在MSK-CHORD数据集上联合进行二元生存分类、连续生存时间回归和自然语言理由生成,实现可解释的生存预测。
Comments This manuscript is withdrawn to allow careful review and correction of bibliographic issues identified after submission, including references that could not be adequately verified. These matters should be resolved before further circulation
可信赖的AI/ML回归与真实世界数据的无偏因果推断
专题命中 安全评测 :trustworthy(title)
AI总结 针对真实世界数据中高维混杂导致的AI/ML回归系统性预测偏差,提出无偏的ML/AI回归因果推断框架,确保平均处理效应的无偏估计。
Comments 17 pages, 4 figures, 4 tables; includes supplementary material
通过认知成对训练增强LLM元认知
机构 * National Engineering Laboratory for Intelligent Information Processing, Academy of Mathematics and Physics, Chinese Academy of Sciences(智能信息处理国家工程实验室,中国科学院数学物理研究所) ; University of Science and Technology of China(中国科学技术大学)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG
AI总结 提出认知成对训练(CPT),通过成对比较推理轨迹来学习区分可靠与不可靠推理,从而提升LLM的推理与元认知权衡。
大型语言模型在密码分析和侧信道漏洞方面的基准测试
机构 * Macquarie University(麦考瑞大学) ; University of New South Wales(新南威尔士大学)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL
AI总结 本研究通过零样本和少样本设置及思维链提示,评估大型语言模型在多种加密算法生成的密文上的解密成功率,揭示其在侧信道场景中的能力与局限,并讨论欠泛化相关攻击的风险。
Comments EMNLP'25 Findings
临床视觉-语言模型中的跨模态链接风险
机构 * Lab for AI in Medicine(医学人工智能实验室) ; RWTH Aachen University(亚琛工业大学) ; Department of Diagnostic and Interventional Radiology(诊断与介入放射学部门)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究临床视觉-语言模型(VLM)在图像与报告分离场景下通过余弦相似度实现跨模态重链接的风险,并采用仅对投影头进行差分隐私微调的方法在保持图像效用同时显著降低重链接率。
SENSE: 基于软门控评估的语义嵌入导航用于检索式推测解码
机构 * Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出SENSE方法,通过语义嵌入导航和软门控评估模块替代表面形式匹配,提升检索式推测解码的鲁棒性和加速效果,在LLaMA和Qwen系列上实现最高4.09平均接受长度和3.26倍加速。
“AI精神病”的语境:对话历史如何影响LLM对妄想信念的回应
专题命中 安全评测 :alignment(abstract);safety(abstract)
AI总结 研究通过积累的对话历史测试五个LLM对妄想信念的回应,发现模型分为高风险低安全与低风险高安全两类,积累上下文揭示了安全架构的压力测试效果。
多模态大语言模型驱动的视频翻译:面向角色的综述
机构 * School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract)
AI总结 本文通过面向角色的分类法,系统综述了多模态大语言模型在视频翻译中的应用,将其分为语义推理器、表达执行器和视觉合成器三个功能角色,并总结了数据集、基准和评估指标,指出了端到端视频翻译的挑战与未来方向。
调查和缓解大语言模型交互中的危害放大
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.LG
AI总结 提出HarmAmp基准和TrajSafe监控器,用于评估和缓解多轮对话中大语言模型对危害的放大效应。
诚实的人工智能顾问:偏好错位下大语言模型诚实性的预设基准
机构 * Amazon Lab126, HW Tech Org.(亚马逊实验室126,硬件技术组织) ; Computational Modeling and Simulation University of Pittsburgh(计算建模与仿真大学匹兹堡分校) ; Mathematics & Statistics Department University of Minnesota Duluth(数学与统计学系明尼苏达大学 Duluth 分校)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 通过Crawford-Sobel廉价谈话模型构建基准,评估大语言模型在偏好冲突时是否诚实,发现模型过度揭示信息,偏离策略最优。
Comments 19 pages. Code and data: https://github.com/iHamidHasani/cheap-talk-llm-benchmark
CEAR: 深度神经网络中的集成对抗鲁棒性认证
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG
AI总结 提出CEAR方法,通过混合经验与认证防御机制,利用高斯噪声和温度混淆梯度与logits,并扩展随机平滑以验证集成分类器的鲁棒性,在多个数据集上取得更优的认证准确率和鲁棒半径。
Comments This is the preprint of the work accepted for publication in the Proceedings of the 39th Canadian Conference on Artificial Intelligence (Canadian AI 2026); 19 Pages
PolySpeech-100:面向100多种语言和方言的大规模语音理解基准
机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) ; JD AI Research(京东人工智能研究院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 为解决现有语音评估基准在资源丰富语言偏向、缺乏语义推理和忽视方言的问题,提出PolySpeech-100基准,通过混合构建管道覆盖110种语言变体,并评估22个模型,发现开源端到端模型在重方言上优于级联系统,而思维链提示在零样本设置下会降低性能。
Comments 19 pages, 13 figures, KDD 2026
对抗性输入流引导LLM智能体决策偏离其默认行为
机构 * Independent Researcher(独立研究者)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI
AI总结 本研究通过控制实验揭示,外部输入流的组成和排序能因果性地改变LLM智能体的下游决策,存在对抗性屈服、默认饱和及默认方向不对称三种响应模式,且该效应在多个决策领域普遍存在。
Comments 14 pages, 5 figures. Code, post pools, and 2,785 decision rollouts: https://github.com/ranausmanai/recommenders-as-control-surfaces
StreamingVLM:无限视频流的实时理解
机构 * MIT(麻省理工学院) ; NVIDIA(英伟达)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出StreamingVLM,通过统一训练与流推理的框架,利用注意力汇点状态复用和滑动窗口机制实现无限视频流的实时稳定理解,在Inf-Streams-Eval基准上以8 FPS速度达到66.18%胜率,并提升通用VQA能力。
Comments Published as a conference paper at ICLR 2026. The first two authors contributed equally to this work
MAVL:面向动画歌曲翻译的多语言音视频歌词数据集
机构 * Yonsei University(延世大学) ; Seoul National University(首尔国立大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 提出首个多语言多模态歌词翻译基准MAVL,并设计音节约束的音视频大语言模型SylAVL-CoT,利用音视频线索和音节约束提升歌词可唱性和翻译准确性。
Comments Accepted to EMNLP 2025, Project Page: https://k1064190.github.io/papers/paper1.html, our codes and datasets are available at https://github.com/k1064190/MAVL
SeClaw: 面向自主代理评估的规范驱动安全任务合成
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) ; Xi’an Jiaotong University(西安交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; University of Oxford(牛津大学) ; City University of Hong Kong(香港城市大学) ; Institute of Science Tokyo(东京科学研究所) ; Zhejiang University(浙江大学) ; Massachusetts Institute of Technology(麻省理工学院) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Beijing University of Technology(北京理工大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出SeClaw框架,通过规范驱动的安全任务合成与基于执行的安全评估,实现对自主LLM代理在状态化环境中的安全风险的可扩展、可复现评估。
POIROT: 在多智能体系统中审讯智能体以进行故障检测
机构 * Center for Automation and Robotics, Spanish National Research Council (CSIC-UPM)(自动化研究中心,西班牙国家科研 council (CSIC-UPM))
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 提出POIROT协议,利用多智能体系统自身的智能体作为诊断层进行故障检测,在复杂问题、多智能体和复合故障条件下优于单LLM评估基线。
Comments 44 pages, 6 figures
SentGuard:面向大型语言模型的句子级流式护栏
机构 * Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 提出SentGuard,一种与生成并行运行的句子级流式护栏,通过轻量级等待缓冲区将流式令牌分组为句子块并仅释放已验证块,以在低延迟下实现高精度不安全内容检测。
Comments 16 pages, 5 figures, submitted to ARR
G2LoRA: 面向文本属性图的梯度正交低秩自适应框架用于图持续学习
机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) ; Department of Statistics, Columbia University(哥伦比亚大学统计系) ; College of Computer Science, Beijing University of Technology(北京理工大学计算机学院)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 针对LLM-as-Aligner模型在文本属性图持续学习中的灾难性遗忘问题,提出G2LoRA框架,通过统一图-文本对齐目标、类别感知梯度投影和梯度幅度调制,实现任务间正向迁移并缓解模态漂移。
Comments Accepted by KDD 2026
压缩是否保留不确定性?基于共形预测的量化和稀疏大语言模型统一基准
机构 * Wuhan University of Technology(武汉理工大学) ; Nanyang Technological University(南洋理工大学)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本研究通过共形预测方法,在五个NLP任务上对12种不同压缩配置的大语言模型进行基准测试,发现压缩经常解耦准确率与不确定性,大模型更能吸收压缩引起的不确定性,且不确定性膨胀常呈阈值状而非渐进。
打破信息孤岛:面向跨域推荐的语义人物画像
机构 * Technology and Information Management Department, Coller School of Management, Tel Aviv University(技术与信息管理系,科勒管理学院,特拉维夫大学) ; Management Information Systems Department, Fox School of Business, Temple University(管理信息系统系,福克斯商学院, Temple大学)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出SPHERE方法,利用大语言模型生成语义人物画像,实现无共享用户或物品的跨域推荐,并通过双塔架构和动态融合门增强推荐性能。
JenBridge: 跨场景转换的自适应长视频配乐
机构 * Jen Music AI
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 提出JenBridge框架,通过基于Transformer的生成模型、双文本-视觉条件对齐和LLM代理驱动的自适应过渡机制,实现长视频配乐的高保真生成与场景转换自然连贯。
当意义旅行:混合专家模型在语言模型习语理解中的细粒度作用
机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(印度理工学院帕纳瓦分校计算机科学与工程系) ; School of Information Technology, King Mongkut’s Institute of Technology Ladkrabang, Thailand(泰国拉差班国王理工大学信息科技学院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 针对低资源东南亚语言中习语的文化隐喻复杂性,提出Varnika多模态习语语料库和混合专家模型HybridMoE,通过控制混合和掩码多模态嵌入缓解专家稀疏性,实现习语理解性能提升5-6%。
RoboTrustBench:机器人操作视频世界模型的可信度基准测试
机构 * Singapore Management University(新加坡国立管理学院) ; Fudan University(复旦大学) ; Princeton University(普林斯顿大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL
AI总结 针对视频世界模型在机器人操作中的可信度问题,提出RoboTrustBench基准,包含正常、约束敏感、反事实和对抗四种场景,通过专家验证的指令-图像对和六维评估协议,发现当前模型在约束推理、反事实基础、物理交互和不安全指令抑制方面存在不足。
Comments Project: https://huiqiongli.github.io/RoboTrustBench/