arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-30 至 2026-03-30 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2603.24124 2026-03-30 cs.LG cs.AI cs.CL 87%

The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation

对齐税:对齐语言模型中的响应同质化及其对不确定性估计的影响

Mingyi Liu

专题命中 幻觉与事实性 :alignment(title,abstract);RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现对齐语言模型存在响应同质化现象,影响不确定性估计方法的效果,提出通过叠加不确定性信号提升模型性能。

Comments 25 pages, 3 figures, 10 tables, 24 experiments across 5 benchmarks. v2: added SINdex head-to-head (Exp 27), NLI validation (Exp 28), decoding protocol analysis. Code: https://github.com/DigitLion/ucbd-experiment

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24133 2026-03-30 cs.CV cs.AI 57%

Compositional Image Synthesis with Inference-Time Scaling

基于推理时缩放的图像合成

Minsuk Ji, Sanghyeok Lee, Namhyuk Ahn

机构 * Inha University(仁荷大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种无需训练的框架,结合对象中心方法与自我完善,提升布局忠实度并保持美学质量,通过大语言模型生成布局并注入图像生成过程,利用对象中心视觉-语言模型进行迭代选择,实现更强的场景对齐。

Comments projcet page: https://github.com/gcl-inha/ReFocus

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26635 2026-03-30 cs.MA 50%

Deception and Communication in Autonomous Multi-Agent Systems: An Experimental Study with Among Us

自主多智能体系统中的欺骗与交流:以Among Us为例的实证研究

Maria Milkowski, Tim Weninger

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本文通过Among Us游戏研究自主智能体的欺骗与交流行为,发现智能体主要使用指示性语言,伪装者倾向使用解释和否认等行为,欺骗多表现为 equivocation 而非直接谎言,揭示了自主交流中真理与效用之间的根本矛盾。

Comments 8 pages + references, 9 figures. Accepted at AAMAS 2026

Journal ref Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), IFAAMAS, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26486 2026-03-30 cs.CV 50%

ClipTTT: CLIP-Guided Test-Time Training Helps LVLMs See Better

ClipTTT: CLIP引导的测试时间训练帮助LVLMs看得更清楚

Mriganka Nath, Anurag Das, Jiahao Xie, Bernt Schiele

机构 * Max Planck Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息学研究所,萨尔兰信息学园区)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出ClipTTT方法,通过CLIP模型的图像-文本对齐能力,在测试时引导LVLMs适应退化条件,减少幻觉并提升描述准确性。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏