arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 704 信号源:cs.CL, cs.AI, cs.LG

1. 其他LLM 704 篇

2608.11624 2026-08-13 cs.CL cs.AI 新提交 85%

Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs

学习说服暴露了大语言模型(LLMs)放弃正确信念的难易程度

Nimet Beyza Bozdag, Emre Can Acikgoz, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究发现优化后的对抗性说服策略可轻易让LLMs放弃正确信念,攻击成功率高且可迁移,凸显多智能体决策系统需将说服鲁棒性作为安全标准

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10497 2026-08-12 cs.CV 新提交 85%

SapiensID 2.0: Aligning Human Recognition Foundation Models with Human Perception

SapiensID 2.0:将人类识别基础模型与人类感知对齐

Yiyang Su, Jie Zhu, Feng Liu, Anil K. Jain, Xiaoming Liu

专题命中 其他LLM :foundation model(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对现有人类识别模型与人类感知脱节的问题,提出兼具语义与时间感知的SapiensID 2.0框架,通过多项技术实现最优识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23201 2026-07-28 cs.HC 新提交 85%

Beyond Conversations: Spatially-Anchored Previews for Intent Disambiguation in LLM-Assisted Geometry Editing in Virtual Reality

超越对话:虚拟现实中大型语言模型辅助几何编辑中用于意图消歧的空间锚定预览

Junlong Chen, Amr Gomaa, Jens Grubert, Per Ola Kristensson

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究虚拟现实中大型语言模型辅助几何编辑的意图消歧问题,通过结合澄清问题与空间锚定图形预览的混合方法,经实验验证其能提升交互稳定性、改善用户体验,为相关系统集成提供设计依据。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21676 2026-07-27 cs.SE 新提交 85%

Directed Symbolic Execution for Vulnerability Discovery: An LLM-Guided Approach in KLEE

用于漏洞发现的定向符号执行:KLEE中基于大语言模型的方法

Lingfeng Chen, Tao Xiao, Masanari Kondo, Yasutaka Kamei

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对符号执行的路径爆炸问题,提出基于KLEE的KLEECopilot方法,用大语言模型引导定向符号执行,标记潜在漏洞代码、指导路径优先级并集成循环退出优先级,相比基线提升显著,各组件对有效性有贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16257 2026-07-21 cs.LG cs.AI cs.CL 新提交 85%

From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training

从结果到行动:利用事后诸葛亮进行长期语言智能体训练

Zishang Jiang, Tingyun Li, Jinyi Han, Xinyi Wang, Sihang Jiang, Yizhou Ying, Xiaojun Meng, Jiansheng Wei, Jiaqing Liang, Yanghua Xiao

专题命中 其他LLM :language agent(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究长期语言智能体训练中现有强化学习方法面临的挑战,提出事后诸葛亮策略优化方法,通过投影到意图空间提取低方差学习信号,聚合相似状态和行动,理论和实证证明可稳定提升策略性能。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11573 2026-07-14 cs.SE 新提交 85%

Knowledge-Guided Synthetic Bug Feedback for LLM-Based Unit Test Generation

基于知识的合成错误反馈用于基于大语言模型的单元测试生成

Ziheng Wang, Maike Li, Chen Zhi

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究如何将历史真实错误机制转化为可执行反馈目标用于基于大语言模型的单元测试生成,提出相应框架,在Defects4J任务上评估,结果显示该机制引导的合成错误反馈能提高真实错误检测率,是引导测试的有效方式。

Comments 12 pages, 7 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07751 2026-07-10 cs.CR 新提交 85%

Forensic Schema for Psychological Manipulation in Cyber Fraud: LLM-Driven Victim Reports Analysis

网络欺诈中心理操纵的取证模式:基于大语言模型驱动的受害者报告分析

Zikai Alex Wen, Corrazon Ogot, Juan Li, Yan Bai

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究网络欺诈中心理操纵取证模式,提出含四类35个问题的模式,增加相关指标和字段。经大语言模型驱动注释及与人类注释者验证,揭示欺诈类型操纵特征,发现取证细节差距,指出人工智能辅助及分层注释策略可缩小差距并提供模板。

Comments Accepted by the 23rd International Conference on Privacy, Security and Trust (PST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13280 2026-06-12 math.ST stat.TH 新提交 85%

Generalization Bounds for Transformer-Based Next-Token Prediction in a Language Model

基于Transformer的语言模型中下一个词预测的泛化界

Insung Kong, Niklas Dexheimer, Johannes Schmidt-Hieber

专题命中 其他LLM :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对文本数据特性,提出基于对数双线性语言模型扩展的数据分布,推导深度Transformer架构的泛化界,揭示其对网络结构、词汇量、文档数和文档长度的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08453 2026-08-11 cs.AI cs.CR 新提交 84%

What Keeps Agent Skills from Being Reusable? Evidence from 138K SKILL.md Files

是什么阻碍了智能体技能的可复用性?来自13.8万个SKILL.md文件的证据

Chi Zhang, Yimin Liu, Xinze Chen, Ping Ji

机构 * The Graduate Center, City University of New York(纽约城市大学研究生中心) The Ohio State University(俄亥俄州立大学) Hunter College, City University of New York(纽约城市大学亨特学院)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过分析13.8万个SKILL.md文件,发现91.8%的Agent Skills存在可复用性相关缺陷,主要为打包问题,验证了路由元数据对检索可靠性的影响,并提出了结合规范提示等的质量保证生成工作流。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08445 2026-08-11 cs.AI 新提交 84%

Forgotten History or Test-of-Time? Retrospect and Prospect on RAG from an IR Perspective

被遗忘的历史还是时间的考验?从信息检索视角回顾与展望检索增强生成(RAG)

Xiaoyan Zhao, Yujie Cai, Yang Zhang, Grace Hui Yang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Georgetown University(乔治城大学)

专题命中 其他LLM :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文从IR视角指出RAG核心思想源于21世纪初的经典研究,提出将LLM视为旧QA架构的新接口层,其前期工作可指导下一代RAG设计,促进跨领域整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01816 2026-08-04 cs.CL 新提交 84%

Divergent large language model predictions from convergent representations in ambiguous word pairs

歧义词对中收敛表示引发的大语言模型发散预测

K. Jack Scott, Narun Pat, Veronica Liesaputra

机构 * University of Otago(奥塔哥大学)

专题命中 其他LLM :large language model(title);language model(title);分类 cs.CL

AI总结 本研究通过分析三种规模的仅解码器Transformer,揭示其解决词汇歧义的机制:中间层表示区分度最高、顶层预测KL散度最大,且顶层表示差异直接决定输出,为嵌入方法的应用提供了启示。

Comments 21 main text pages, 20 pages supplemental, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00828 2026-08-04 cs.AI 新提交 84%

Isotropy Cliffs: The Geometric Signature of Decision-Making in Large Language Models

各向同性悬崖:大语言模型决策的几何特征

Okan S. Coskun, Florian Rottach, Carsten Eickhoff, William Rudman

机构 * University of Tübingen(蒂宾根大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 其他LLM :large language model(title);language model(title);分类 cs.AI

AI总结 该研究从各向同性视角分析大语言模型多项选择题问答的决策几何,识别出各向同性转变的决策关键过渡层,发现该几何行为与下游准确率高度相关且对提示变化鲁棒,揭示模型决策的通用机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12334 2026-07-15 cs.CL cs.ET 新提交 84%

QUBO-Optimized Evidence Selection for Retrieval-Augmented Question Answering with Unconventional Solvers

使用非常规求解器的QUBO优化证据选择用于检索增强问答

Rahul Singh, Madhav Vadlamani

机构 * University of California Santa Barbara(加利福尼亚大学圣巴巴拉分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他LLM :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL

AI总结 研究针对检索增强问答中证据选择问题,将其转化为QUBO问题构建能量函数,平衡多种因素选择证据段落,再由下游语言模型生成答案。在HotpotQA上评估,该方法性能与基于LLM的选择器相当,为RAG管道提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23697 2026-06-24 cs.SE cs.AI cs.PL 新提交 84%

SemChunk-C: Semantic Segmentation for C Code

SemChunk-C: C 代码的语义分割

Boris Nazarov, Darya Frolova, Shaked Leibzirer, Pavel Kisilev

机构 * Huawei(华为)

专题命中 其他LLM :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 针对 C 语言代码语义分割难题,提出基于轻量级 LLM 的 SemChunk-C 模型,定义代码块类别并实现边界识别与功能属性标注,在边界准确性和语义连贯性上优于基于大型 LLM 的方法。

Comments 7 pages, 9 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16989 2026-06-16 cs.GT cs.AI cs.CY 新提交 84%

Stable Menus of Public Goods: AI-Enabled Progress

公共物品的稳定菜单:AI驱动的进展

Sara Fish

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 其他LLM :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 以EC 2025论文的开放问题为测试平台,实验评估AI辅助研究流程的有效性,发现提供人类直觉提示和自动多轮交互有助于提升LLM表现,但LLM略逊于一年级博士生。

Comments Accepted to the EC'26 Workshop on AI-Driven Research in EconCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11425 2026-06-11 cs.CR cs.AI 新提交 84%

JailbreakOPT: Tool-Assisted Iterative Jailbreak Prompt Optimization

JailbreakOPT: 工具辅助的迭代越狱提示优化

Ge Shi, Jun Yin, Donglin Xie, Fangyi Liu, Yucan Li, Menglin Liu

机构 * University of California, Davis(加州大学戴维斯分校) The Renmin University of China(中国人民大学) Independent Researcher(独立研究员) Nankai University(南开大学) Cornell University(康奈尔大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 其他LLM :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出JailbreakOPT框架,通过工具库和上下文Thompson采样优化单轮越狱提示,在多个LLM上提高攻击成功率并减少攻击次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10279 2026-08-12 cs.CR cs.AI cs.CL 新提交 84%

Withholding the Completing Chunk: Deterministic Pair-Completion Guardrails for Streaming LLM Output

withhold the Completing Chunk: 面向流式大语言模型输出的确定性配对完成护栏

Christopher M. Frost

专题命中 其他LLM :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本研究提出流式LLM输出的确定性配对完成护栏,通过扫描前缀扣留配对完成块,实验验证其效果,表明它是小型固定策略的精确发布边界后盾。

Comments 22 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05232 2026-08-07 cs.CL cs.LG 新提交 84%

Analysis of Numerical Localisation in LLM Translations

大语言模型翻译中数值定位的分析

Patrizia Kaye

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文分析5款可在商用硬件运行的LLMs对时间、数字、日期的定位能力,发现将定位原则嵌入提示上下文可显著提升其定位准确率。

Comments 13 pages, 7 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04192 2026-08-06 cs.CR cs.AI cs.CL 新提交 84%

Behavioral Skill Reconstruction: Reconstructing Hidden Functionality from LLM Agent Skills

行为技能重构:从大语言模型智能体技能中重构隐藏功能

Peichun Hua, Haoxuan Xu, Mengyuan Li

专题命中 其他LLM :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出SkillClone黑盒攻击方法,可通过合法交互从隐藏的LLM智能体技能中重构其功能,表明仅文件保密无法确保功能保密。

Comments 20 pages, 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19629 2026-07-23 cs.CL cs.AI cs.MA 新提交 84%

Adaptive Capitulation: A Structural Failure Mode of LLM Responses in Vulnerability Contexts

适应性屈服:脆弱情境下大语言模型响应的一种结构故障模式

Eunna Lee

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在脆弱情境下的响应问题,通过实验刻画了适应性屈服故障模式,表明困境是结构性的,进而提出架构中立的最小重新归因充分性原则来保留自主重新归因途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18566 2026-07-22 cs.CL cs.AI 新提交 84%

The Story Shapes the Agent: Narrative Priors in LLM Behavior

故事塑造智能体:大语言模型行为中的叙事先验

Yixuan Wang, James Lester, Shashank Srivastava

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) North Carolina State University(北卡罗来纳州立大学)

专题命中 其他LLM :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究探索大语言模型行为中叙事框架的影响,通过构建游戏识别叙事先验,发现其解释行为方差能力强且与任务成功相关,还明确跨叙事角色效应源于行为锚点,框架可推广并产生改进跨叙事转移的角色选择方法。

Comments Accepted at COLM 2026. 10 pages, 3 figures, 16 tables in appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08961 2026-07-13 cs.LG cs.AI math.ST stat.TH 新提交 84%

NL-PAC: Specification Ambiguity and Certified Minimax Risk Floors in LLM-Mediated Supervision

NL-PAC:大语言模型介导监督中的规范模糊性与认证极小极大风险下限

Berkay Anahtarci

机构 * Özyeğin University(奥泽金大学)

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型介导监督中规范模糊性问题,引入NL-PAC框架,利用固定模型阈值解码法则定义相关内容,通过有限样本置信界认证风险,在Qwen模型审计中得出特定提示有正证书等结果,该保证有特定局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09159 2026-06-09 cs.CL cs.AI 新提交 84%

Unified Energy for Invariant and Independent Decoding in Diffusion Language Models

扩散语言模型中不变性与独立性解码的统一能量

Yuchen Yan, Minkai Xu, Zaiquan Yang, Yatao Bian

机构 * National University of Singapore(新加坡国立大学) Stanford University(斯坦福大学) City University of Hong Kong(香港城市大学)

专题命中 其他LLM :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 针对扩散语言模型并行生成文本时与自回归模型的性能差距,提出统一能量(Uni-E)方法,通过不变能量和独立能量解决模型容量、依赖性和不变性问题,无需采样即可精确计算,并能纠正分布偏移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04768 2026-08-06 cs.CV 新提交 83%

Embedding Large Language Models into Flow Controls: An Agentic Framework for Adaptive and Trustworthy Automated Cooking

将大语言模型嵌入流程控制:一种用于自适应且可信的自动化烹饪的智能体框架

Zihan Song, Hongwei Huang, Yueshuo Sun, Yonglin Tian, Fei-Yue Wang, Bai Li

专题命中 其他LLM :large language model(title);language model(title)

AI总结 针对自动化烹饪机器人的个性化与可信性问题,提出智能体框架,通过多智能体分解需求、分阶段生成执行代码,实验验证其在真实场景中可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24895 2026-06-25 cs.DL 新提交 83%

Hybrid Metadata Extraction from League of Nations Index Cards: From Feasibility Study to Archival System Integration

国联索引卡片的混合元数据提取:从可行性研究到档案系统集成

Florian Cafiero, Grégoire Mallard

专题命中 其他LLM :LLM(summary_cn,abstract);language model(abstract)

AI总结 提出混合AI工作流从国联索引卡片中提取并整合档案元数据,结合YOLO、TrOCR、本地LLM后校正及微调视觉语言模型,实现从布局感知管道到混合架构的演进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08050 2026-06-09 cs.HC 新提交 83%

Automatic, Real-time Classification of User Feedback Using Large Language Models

使用大型语言模型自动实时分类用户反馈

Jim Maddock, Rose Leitner, Anna Wu

专题命中 其他LLM :large language model(title);language model(title)

AI总结 本文介绍一个多年项目,利用大型语言模型自动分类用户反馈,降低时间与知识成本,使非技术用户也能实时访问评论、主题和分析,从而民主化数据分析过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13944 2026-08-17 cs.HC cs.AI 新提交 83%

Musical Mirrors: The LLM as Sounding Board in Songwriting

音乐镜像:作为歌曲创作共鸣板的大语言模型

Xiao Xiao

专题命中 其他LLM :LLM(title,summary_cn);分类 cs.AI

AI总结 本文通过2025-2026年的第一人称歌曲创作案例研究,探讨了将LLM用作人类创作素材的解释性共鸣板的应用,揭示了该模式的潜力及缺乏校准会引发的谄媚式偏移、魔法式过度解读两种风险。

Comments In Proceedings of The First Reflection in Creative Experience (RiCE) Workshop (RiCE W1) arXiv:2607.24558 (https://arxiv.org/abs/2607.24558)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12320 2026-08-14 cs.CY cs.AI 新提交 83%

The AI Accountability Ecosystem in the Era of Language Models

语言模型时代的人工智能问责制生态系统

Chris Percy, Artur d'Avila Garcez

专题命中 其他LLM :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文针对大型语言模型带来的新风险,更新了人工智能问责制生态系统框架,提出三项关联更新,推动问责制向分布式、持续化、制度化转变。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06004 2026-08-07 cs.LG 新提交 83%

Do Tabular Foundation Models Agree with Themselves?

表格基础模型是否与自身一致?

Christian Klötergens, Vijaya Krishna Yalavarthi, Lars Schmidt-Thieme, Tom Hanika

专题命中 其他LLM :foundation model(title,abstract);分类 cs.LG

AI总结 本文针对表格基础模型(TFMs),提出其预测是否可由任意联合分布生成的问题,设定边际一致性与分解一致性要求,发现所有评估的TFMs均违反这两项要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22026 2026-07-27 cs.CL 新提交 83%

DWT-Fusion: A Signal-Based Framework for Training-Free LLM-Generated Text Detection

DWT-Fusion:一种用于无训练大语言模型生成文本检测的基于信号的框架

Mehmet Batuhan Özdaş, Murat Osmanoğlu

机构 * Ankara University(安卡拉大学)

专题命中 其他LLM :LLM(title,abstract);language model(abstract);分类 cs.CL

AI总结 研究在零样本和无训练条件下检测大语言模型生成文本的挑战,提出基于离散小波分析的DWT-Fusion框架,通过多分辨率信号表示和校准引导投票融合检测文本,实验表明该方法能提供有效可解释信号,提升检测性能。

Comments 40 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏