arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-02 至 2026-04-02 共收录 12 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 12 篇

2604.00445 2026-04-02 cs.AI cs.CL 90%

Towards Reliable Truth-Aligned Uncertainty Estimation in Large Language Models

迈向大语言模型中可靠的真实性对齐不确定性估计

Ponhvoan Srey, Quang Minh Nguyen, Xiaobao Wu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) KAIST(韩国科学技术院) Shanghai Jiao Tong University(上海交通大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Truth AnChoring方法,通过将原始分数映射到事实对齐分数,解决不确定性估计指标在低信息区域的非判别性问题,提升大语言模型的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06801 2026-04-02 cs.LG cs.AI 90%

On the Non-Identifiability of Steering Vectors in Large Language Models

大型语言模型中转向向量的不可识别性

Sohan Venkatesh, Ashish Mahendran Kurapath

机构 * Manipal Institute of Technology Bengaluru(马尼帕尔理工学院班加罗尔校区)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示大型语言模型中转向向量的不可识别性,指出在白盒单层访问下,转向向量因行为上无法区分的干预等价类而无法唯一确定,强调需超越行为测试的结构约束以实现可靠对齐干预。

Comments Code available at https://github.com/sohv/non-identifiability

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25052 2026-04-02 cs.CL cs.AI 88%

Closing the Confidence-Faithfulness Gap in Large Language Models

弥合大语言模型中的置信度-忠实度差距

Miranda Muqing Miao, Lyle Ungar

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过线性探针和对比激活添加分析,揭示大语言模型中置信度信号与校准的线性关系,提出双阶段适应性引导流程以提升校准对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18314 2026-04-02 cs.AI 85%

Genesis: Evolving Attack Strategies for LLM Web Agent Red-Teaming

Genesis:为LLM网络代理红队测试演变攻击策略

Zheng Zhang, Jiarui He, Yuchen Cai, Deheng Ye, Peilin Zhao, Ruili Feng, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯) Nvidia(英伟达)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Genesis框架,通过遗传算法与混合策略表示生成对抗注入,动态发现有效策略并持续优化,提升网络代理攻击效果。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04570 2026-04-02 cs.HC 85%

A Map of Exploring Human Interaction patterns with LLM: Insights into Collaboration and Creativity

探索人类交互模式的地图:协作与创造力的洞察

Jiayang Li, Jiale Li

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过系统分析110篇人类与LLM交互研究,提出一种新的映射方法,揭示协作与创造力领域的研究现状与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00228 2026-04-02 cs.CL 83%

Do Language Models Know When They'll Refuse? Probing Introspective Awareness of Safety Boundaries

语言模型是否知道何时会拒绝?探测安全边界内的自我意识

Tanay Gondil

机构 * Purdue University(普渡大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究探讨语言模型能否准确预测自身拒绝行为,通过系统分析发现模型在安全边界处敏感度下降,且通过置信度评分可提升安全部署的准确性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00778 2026-04-02 cs.CL 81%

From Early Encoding to Late Suppression: Interpreting LLMs on Character Counting Tasks

从早期编码到晚期抑制:解释LLM在字符计数任务上的表现

Ayan Datta, Mounika Marreddy, Alexander Mehler, Zhixue Zhao, Radhika Mamidi

机构 * IIIT Hyderabad(印度国际信息技术学院海德拉巴分校) Goethe University, Frankfurt am Main, Germany(德国法兰克福歌德大学) University of Sheffield, UK(英国谢菲尔德大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 研究通过字符计数任务揭示LLM内部计算中的结构干扰问题,发现模型在早期层正确编码信息,但后期层通过负电路抑制了正确输出,导致符号推理失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00455 2026-04-02 cs.CV cs.AI cs.CL 81%

First Logit Boosting: Visual Grounding Method to Mitigate Object Hallucination in Large Vision-Language Models

首个Logit提升:一种缓解大视觉-语言模型中物体幻觉的视觉 grounding 方法

Jiwoo Ha, Jongwoo Baek, Jinhyun So

机构 * DGIST EECS(大邱庆北科学技术院电子工程与计算机科学系)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出FLB方法,通过存储首个生成token的logit并加到后续预测中,缓解大视觉-语言模型中的长期衰减问题,有效减少物体幻觉并保持视觉信息。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01025 2026-04-02 cs.LG cs.AI 79%

Fast and Accurate Probing of In-Training LLMs' Downstream Performances

快速且准确地探测训练中的LLM下游性能

Zhichen Liu, Tianle Lun, Zhibin Wen, Hao An, Yulin Ou, Jianhui Xu, Hao Zhang, Wenyi Fang, Yang Zheng, Yang Xu

机构 * Southern University of Science and Technology(南方科技大学) Huawei(华为)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种高效准确的训练中LLM下游性能评估方法,通过轻量级探针预测模型在下游任务上的表现,减少计算延迟并提升评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00005 2026-04-02 cs.AI cs.CL 79%

How Emotion Shapes the Behavior of LLMs and Agents: A Mechanistic Study

情绪如何塑造大语言模型和代理的行为:一种机制性研究

Moran Sun, Tianlin Li, Yuwei Zheng, Zhenhong Zhou, Aishan Liu, Xianglong Liu, Yang Liu

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出E-STEER框架,通过在隐藏状态中嵌入情绪作为可控变量,研究情绪对推理、生成、安全性和多步代理行为的影响,揭示情绪与行为之间的非单调关系。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08018 2026-04-02 cs.CV 67%

Missing No More: Dictionary-Guided Cross-Modal Image Fusion under Missing Infrared

不再缺失:字典引导的跨模态图像融合在红外缺失情况下的应用

Yafei Zhang, Meng Ma, Huafeng Li, Yu Liu

机构 * Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) Department of Biomedical Engineering, Hefei University of Technology(合肥工业大学生物医学工程系)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于共享卷积字典的字典引导框架,解决红外缺失时的跨模态图像融合问题,通过联合字典学习、视觉引导红外推断和自适应融合方法提升感知质量和下游检测性能。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22413 2026-04-02 cs.AI 57%

Epistemic Filtering and Collective Hallucination: A Jury Theorem for Confidence-Calibrated Agents

知识过滤与集体幻觉:一个适用于置信度校准代理的陪审团定理

Jonas Karge

机构 * Technische Universität Dresden(德累斯顿工业大学)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI

AI总结 研究异质代理在时间中学习自我可靠性估计并选择性 abstain 的集体准确性,提出基于置信度校准的框架,推导非渐近下界并证明其在置信度门控设置下的泛化能力,通过蒙特卡洛模拟验证,探讨其在AI安全中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏