arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of California, San Diego(加州大学圣迭戈分校)

2026-05-28 至 2026-05-28 共收录 8
2605.28328 2026-05-28 cs.LG cs.AI

Learning the Error Patterns of Language Models

学习语言模型的错误模式

Jinwoo Kim, Taylor Berg-KirkPatrick, Loris D'Antoni

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of California-San Diego(加州大学圣地亚哥分校)

AI总结 提出前缀过滤器(prefix filters)来捕捉LLM在特定领域中的错误模式,并通过Palla算法高效学习这些过滤器,从而提升输出有效性,例如在TypeScript生成中将编译率提升60%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28044 2026-05-28 cs.AI

Relevant Is Not Warranted: Evidence-Force Calibration for Cited RAG

相关并不保证:引用RAG的证据力度校准

Pin Qian, Su Wang, Xiaoyuan Wang, Yihang Chen, Wenxuan Xu, Qiaolin Yu, Shuhuai Lin, Sipeng Zhang, Junxian You, Xinpeng Wei

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Dartmouth College(达特茅斯学院) Cornell University(康奈尔大学) University of California San Diego(加州大学圣地亚哥分校) University of Glasgow(格拉斯哥大学)

AI总结 针对引用RAG中证据力度不足的问题,提出FORCEBENCH基准测试,通过对比证据校准声明与力度增强变体,评估模型在五个操作轴上的单调性,发现标准支持提示不足以校准证据力度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27921 2026-05-28 cs.AI cs.CL cs.CY cs.HC

Show, Don't TELL: Explainable AI-Generated Text Detection

展示,而非告知:可解释的AI生成文本检测

Aldan Creo, Suraj Ranganath

机构 * School of Computing, Information and Data Sciences(计算与数据科学学院) University of California, San Diego(加州大学圣地亚哥分校) United States of America(美国)

AI总结 提出一种名为TELL的新型可解释架构,通过内置解释机制和强化学习训练,在保持高检测性能(AUROC 0.927)的同时提供文本级注释,帮助用户基于自身判断识别AI生成文本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27873 2026-05-28 cs.AI

AIBuildAI-2: A Knowledge-Enhanced Agent for Automatically Building AI Models

AIBuildAI-2:一种用于自动构建AI模型的知识增强智能体

Ruiyi Zhang, Peijia Qin, Qi Cao, Li Zhang, Pengtao Xie

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Medicine, University of California San Diego(加州大学圣地亚哥分校医学系)

AI总结 针对现有自动构建AI模型的智能体因依赖大语言模型静态参数知识而性能受限的问题,提出AIBuildAI-2,通过引入分层、可进化的外部知识系统,动态加载相关上下文,实现设计决策的专家知识支撑,在MLE-Bench上取得70.7%奖牌率并在心脏病预测竞赛中排名前6.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27649 2026-05-28 cs.CL cs.LG

Disentangling Language Roles in Multilingual LLM Task Execution

多语言大模型任务执行中的语言角色解耦

Qishi Zhan, Minxuan Hu, Seoyeon Jang, Lei Zhao, Ziheng Chen, Man Liang, Xinyue Xiang, Jiaxin Liu, Guansu Wang, Liang He

机构 * Marquette(马凯特大学) Cornell(康奈尔大学) UC San Diego(南加州大学圣地亚哥分校) UPenn(普林斯顿大学) UT Austin(德克萨斯大学奥斯汀分校) Maryland(马里兰大学) Michigan(密歇根大学) UIUC(伊利诺伊大学香槟分校) Melbourne(墨尔本大学) Stanford(斯坦福大学)

AI总结 提出MTM-Bench基准,通过完全交叉设计解耦指令、内容和响应三种语言角色,评估多语言LLM的任务执行能力,发现响应语言角色是性能下降的主要因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15864 2026-05-28 cs.CV cs.CL

Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination

VLMs 是在看还是只是在说?揭示视觉重新检查的幻觉

Chufan Shi, Cheng Yang, Yaokang Wu, Linghao Jin, Bo Shui, Taylor Berg-Kirkpatrick, Xuezhe Ma

机构 * University of Southern California(南加州大学) University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 通过图像交换探测框架 VisualSwap 和 800 对图像基准 VS-Bench,发现视觉语言模型在推理时声称的“重新检查图像”多为文本模式,而非真正的视觉重新检查,且思考模型更易受影响,用户指令可恢复视觉基础但自我反思无效。

Comments ICML 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22769 2026-05-28 cs.AI cs.LG

AMA-Bench: Evaluating Long-Horizon Memory for Agentic Applications

AMA-Bench:评估智能体应用的长时记忆

Yujie Zhao, Boqin Yuan, Junbo Huang, Haocheng Yuan, Zhongming Yu, Haozhou Xu, Lanxiang Hu, Abhilash Shankarampeta, Zimeng Huang, Wentao Ni, Yuandong Tian, Jishen Zhao

机构 * UCSD(加州大学圣塔克拉拉分校) Recursive

AI总结 提出AMA-Bench基准,通过真实与合成轨迹评估LLM智能体的长时记忆,并基于因果图与工具增强检索提出AMA-Agent系统,在基准上提升11.16%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12468 2026-05-28 cs.LG cs.FL

Continuous Diffusion Models Can Obey Formal Syntax

连续扩散模型可以遵守形式语法

Jinwoo Kim, Taylor Berg-Kirkpatrick, Loris D'Antoni

机构 * Department of Computer Science and Engineering, University of California-San Diego, San Diego, USA(计算机科学与工程系,加州大学圣地亚哥分校,圣地亚哥,美国)

AI总结 提出一种无需训练的引导方法,利用正则表达式约束连续扩散语言模型的生成过程,使其满足形式语法,并在JSON和自然语言基准上实现68-96%的约束满足率。

详情

展开后加载摘要…

URL PDF HTML 收藏