arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Princeton University(普林斯顿大学)

2026-04-02 至 2026-04-02 共收录 3
2410.03131 2026-04-02 cs.AI cs.CL cs.LG

Code Comprehension then Auditing for Unsupervised LLM Evaluation

代码理解后审计用于无监督LLM评估

Bhrij Patel, Souradip Chakraborty, Mengdi Wang, Dinesh Manocha, Amrit Singh Bedi

机构 * University of Maryland, College Park(马里兰大学帕克分校) Princeton University(普林斯顿大学) University of Central Florida(中佛罗里达大学)

AI总结 本文提出CoCoA框架,通过先理解代码功能再评估任务对齐,提升无监督LLM评估的准确性与F1分数。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15556 2026-04-02 cs.LG cs.CL cs.CR

Certifiably Robust RAG against Retrieval Corruption

可验证的对抗检索污染的RAG

Chong Xiang, Tong Wu, Zexuan Zhong, David Wagner, Danqi Chen, Prateek Mittal

机构 * NVIDIA(英伟达) Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出RobustRAG,通过隔离-聚合策略有效防御检索污染攻击,并在三个数据集和三个LLM上验证了其在开放领域问答和自由文本生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00016 2026-04-02 cs.CL cs.AI

Are they human? Detecting large language models by probing human memory constraints

他们真的是人类吗?通过探测人类记忆限制来检测大语言模型

Simon Schug, Brenden M. Lake

机构 * Princeton University(普林斯顿大学)

AI总结 本文通过探测人类认知限制来区分大语言模型与人类,展示了在特定任务中人类工作记忆容量的限制可被利用以识别非人类参与者。

Comments Code available at https://github.com/smonsays/llm-humanness

详情

展开后加载摘要…

URL PDF HTML 收藏