arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, Berkeley(加州大学伯克利分校)

2026-07-08 至 2026-07-08 共收录 2
2606.00476 2026-07-08 cs.AI 版本更新

Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents

做他们所说的,而不是他们所推理的:定位LLM智能体中的忠实性差距

Yufeng Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 通过将忠实性差距分解为推理-结论和结论-行动两个步骤,在可控的德克萨斯扑克模拟器中研究LLM智能体是否按照其陈述的推理行动。

Comments submitted to COLM social simulation with LLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10439 2026-07-08 cs.CV 版本更新

Filtering Memorization from Parameter-Space in Diffusion Models

从参数空间过滤记忆化在扩散模型中

Yu Zhe, Yang Jiayan, Wei Junhao, Yu-Lin Tsai, Wang Chen

机构 * RIKEN AIP(理化学研究所Advanced Institute for Peripheral Research) Science of Tokyo(东京科学大学) University of California, Berkeley(加州大学伯克利分校) Zhejiang University(浙江大学)

AI总结 本文提出BAF框架,通过分解LoRA更新并测量其与预训练骨干的主子空间对齐度,实现训练后记忆抑制,减少生成内容中的版权或敏感内容复现。

详情

展开后加载摘要…

URL PDF HTML 收藏