arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-05 至 2026-08-05 共收录 439 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 23 篇

2608.03035 2026-08-05 cs.CL 新提交 83%

Language Models Encode the Contextual Truth of Propositions

语言模型编码命题的语境真值

Rupak Sarkar, Pritika Ramu, Rachel Rudinger

专题命中 知识编辑与模型理解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究探究LLMs对语境真值的编码,发现其会维持语境真值的线性表征,伙伴断言可改变命题真值表征,还区分出两种谄媚形式并量化了其出现频率差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18673 2026-08-05 cs.CV 版本更新 82%

MissingBench-Verified: Probing Vision-Language Models' Inability to Detect Missing Object Parts

MissingBench-Verified:探究视觉语言模型检测缺失物体部分的无能

Wenqi Marshall Guo, Qingyun Qian, Shiyu Zhou, Guoping Luo, Shan Du

机构 * University of British Columbia(英属哥伦比亚大学) Weathon Software(威盛软件)

专题命中 知识编辑与模型理解 :language model(title,abstract);prompting(abstract)

AI总结 研究视觉语言模型检测缺失物体部分的能力,提出MissingBench-Verified基准,发现十个领先模型在此场景存在高失败率,现有缓解策略效果不佳,揭示当前VLM在检查监测任务中的根本局限,强调架构或训练干预的必要。

Comments Submitted to the ECCV 2026 Workshop on Explainable Computer Vision (eXCV). 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09445 2026-08-05 cs.CL cs.AI 版本更新 81%

Where Knowledge Collides: A Mechanistic Study of Intra-Memory Knowledge Conflict in Language Models

知识碰撞之处:语言模型中内存知识冲突的机理研究

Minh Vu Pham, Hsuvas Borkakoty, Yufang Hou

机构 * IT:U Austria(因特大学奥地利分校) IBM Research(IBM研究院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过机理可解释性方法揭示语言模型中预训练数据冲突知识的编码位置,探讨冲突知识在模型内部的存储机制及干预方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08044 2026-08-05 cs.LG cs.AI cs.CL 版本更新 80%

When Behavioral Safety Evaluation Fails: A Representation-Level Perspective

当行为安全评估失败时:表征层面的视角

Enyi Jiang, Anders Gjølbye, Yibo Jacky Zhang, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Technical University of Denmark(丹麦技术大学)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出行为安全与干预鲁棒性之间的“审计差距”,通过构建解离模型和引入潜在脆弱性评分(LVS),证明行为安全指标不足以衡量表征层面的鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03690 2026-08-05 cs.LG 新提交 79%

LAEF: A Lead-Agnostic ECG Foundation Model Towards Point-of-Care Diagnostics

LAEF:面向即时诊断的导联无关心电图基础模型

Edoardo Coppola, Stefano Fiorini, Pietro Liò, Mattia Savardi, Alberto Signoroni

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 该研究提出LAEF,一种7M参数的导联无关心电图基础模型,预训练于9.2M份12导联心电图,在18个下游数据集的1-2导联即时诊断场景下,性能优于零填充替代方案,与更大规模的12导联基线相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20381 2026-08-05 cs.CL cs.AI cs.HC 版本更新 73%

The production of meaning in the processing of natural language

自然语言处理中意义产生的机制

Christopher J. Agostino, Quan Le Thien, Nayan D'Souza, Louis van der Elst

机构 * Department of Physics, Indiana University(印第安纳大学物理系) Department of Linguistics, Indiana University(印第安纳大学语言学系) Imperial College London(伦敦帝国学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究自然语言处理中意义产生的机制,探讨量子逻辑与经典布尔理论在语义处理中的差异,分析模型在不同参数下的表现及对安全交互的影响。

Comments Accepted to QNLP 2026, 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03118 2026-08-05 cs.CL 新提交 70%

From SQL Errors to Concept Gaps: An AI-Powered Knowledge Graph Analytics Platform for Personalized Feedback

从SQL错误到概念缺口:用于个性化反馈的AI驱动知识图谱分析平台

Abdulrahman AlRabah, Weijian Zhou, Xing Gao, Abdussalam Alawini

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究提出一款AI驱动知识图谱平台,可关联SQL错误与课程概念缺口,经评估其概念提取有效性达95.7%,三元组正确率达63.8%,能为SQL学习提供个性化诊断反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02803 2026-08-05 cs.CV cs.AI 新提交 70%

SAGE: Semantic Explainability of Attention-Based Survival Models in Computational Pathology

SAGE:计算病理学中基于注意力的生存模型的语义可解释性

Abdallah Lamane, Abdul Rahman Diab, Ren-Chin Wu, William Lotter

专题命中 知识编辑与模型理解 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 该研究提出SAGE框架,可从ABMIL模型提取全局语义解释,在7个TCGA癌症队列的生存预测中恢复预后特征,揭示癌症特异性生物学,为病理学家解释模型行为提供支持。

Comments Proceedings of the MICCAI Workshop on Interpretability of Machine Intelligence in Medical Image Computing (iMIMIC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03225 2026-08-05 cs.CV 新提交 67%

Open-Linguistic Concept Unified Learning for Cross-Site Interpretable Dermatology Image Diagnosis

面向跨站点可解释皮肤病图像诊断的开放语言概念统一学习

Chengyu Wu, Junpeng Tan, Wanxiang Luo, Yaqi Wang, Yandong Wen, Yefeng Zheng

专题命中 知识编辑与模型理解 :language model(abstract);post-training(abstract)

AI总结 针对现有概念模型跨站点泛化差、适配FVLMs成本高的问题,提出开放语言概念统一学习框架UniCon,通过共享语义空间等三项创新实现多模态可解释皮肤病诊断,获顶级准确率且具备跨站点干预能力。

Comments accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03021 2026-08-05 cs.SD 新提交 67%

MeloCodec: Harnessing Melodic Priors for High-Fidelity Singing Voice Representation

MeloCodec:利用旋律先验实现高保真歌声表征

Yizhong Geng, Wenxin Fu, Kecan Mao, Qifei Li, Yingming Gao, Ruimin Wang, Chunfeng Wang, Hao Li, Ya Li, Wei Chen

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn)

AI总结 MeloCodec是整合旋律先验的新型音频编解码器框架,采用先分词后融合范式与两阶段训练策略,在歌声表征任务中优于基线,提升了音高一致性并实现可控音高操作。

Comments 7 pages, 3 figures, 3 tables. Accepted at IEEE ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26097 2026-08-05 cs.CV 版本更新 67%

Knowledge-guided Disentanglement with Atomic Actions for Action Recognition

面向动作识别的基于原子动作的知识引导解缠

Tianci Wu, Siqi Cao, Guangming Zhu, Jiang Lu, Siyuan Wang, Longfei Zhang, Jincai Huang, Jun Sheng, Liang Zhang

机构 * Xidian University(西安电子科技大学) National University of Defense Technology(国防科技大学) Human Institute of Advanced Technologyy(人类高级技术研究院) Shanghai Road Transport Development Center(上海市道路运输发展中心)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 本文提出KDA方法,用LLMs分解动作标签为原子动作,经KIM和KDM解缠,在多标签动作识别基准上达SOTA性能,且模块可通用集成。

Comments ACMMM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02882 2026-08-05 cs.CY 版本更新 67%

Reading Between the Tokens: Improving Preference Predictions through Mechanistic Forecasting

在token之间阅读:通过机制性预测改进偏好预测

Sarah Ball, Simeon Allmendinger, Frauke Kreuter, Niklas Kühl

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 通过机制性预测方法,利用语言模型内部表示结构提升偏好预测准确性,揭示其在社会科学预测中的应用潜力。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03817 2026-08-05 cs.CV cs.AI 新提交 57%

UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

UHP检测:大型视觉语言模型(LVLMs)在一致性空间中具有独特的幻觉模式

Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia, Mohamad Amin Yousefi, Asal Mohammadjafari Mamaqani, Behrad Samimi, Mohammad Hossein Rohban

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本研究针对LVLMs的幻觉问题,提出UHP检测框架,通过图像与文本扰动模态、陈述与否定逻辑极性构建四组一致性特征,训练分类器,在AMBER和PhD数据集上显著优于现有基线。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17447 2026-08-05 stat.ME cs.CL math.ST stat.ML stat.TH 版本更新 57%

Calibrating Semantic Uncertainty from Observable Language-Model Probabilities

从可观察的语言模型概率校准语义不确定性

Matthew F. Dixon

机构 * Artificial Intelligence Finance Institute (AIFI)(人工智能金融研究所) Quiota LLC(Quiota公司)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 研究如何从语言模型概率校准语义不确定性,引入语义映射方法,经测试该方法在处理专业市场文本和模拟时,语言衍生概率表现良好,能恢复后验且稳定,语义映射将问题转化为可测试统计问题并产生可审计后验估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13300 2026-08-05 eess.AS cs.AI cs.SD 交叉投稿 57%

PASE: Leveraging the Phonological Prior of WavLM for Low-Hallucination Generative Speech Enhancement

PASE:利用WavLM的语音学先验实现低幻觉生成式语音增强

Xiaobin Rong, Qinwen Hu, Mansur Yesilbursa, Kamil Wojcicki, Jing Lu

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本研究针对生成式语音增强的幻觉问题,提出PASE框架,通过适配WavLM为去噪专家、双流声码器训练,实现低幻觉的语音增强,性能优于现有最优模型。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03410 2026-08-05 cs.CV 新提交 50%

Earth Embeddings

地球嵌入

Adam J. Stewart, Heng Fang, Isaac A. Corley, Xiao Xiang Zhu

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 该研究介绍地球嵌入的类型、特性与应用场景,通过案例展示其实用工作流程,为嵌入的选择等提供指导,并探讨相关开放问题,助力地球观测领域的高效分析。

Comments book chapter

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他LLM 33 篇

2608.02645 2026-08-05 cs.SE cs.AI 新提交 92%

Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures

经验证的工具调用可提升非原子故障下LLM智能体的可靠性

Isham Kalappurackal Mansoor, Abhishek Phadke, Pratip Rana

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对非原子故障导致LLM智能体可靠性不足的问题,提出带后置条件验证、重试前逻辑和幂等键的工具包装器,可减少重复动作并保持任务成功率,且无需修改底层LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03093 2026-08-05 cs.CR 新提交 91%

DHMark: Public-Key Watermarking for LLM-Generated Text via Diffie-Hellman-Guided Rejection Sampling

DHMark:基于Diffie-Hellman引导拒绝采样的LLM生成文本公钥水印

Haocheng Fu, Yuqi Qian, Luyao Wang, Yun Cao

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 DHMark是一种LLM生成文本的公钥水印框架,通过Diffie-Hellman引导拒绝采样分离载荷授权与文本证据,在多类攻击下保持高有效率且负控制接受率为0。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13981 2026-08-05 cs.CR 版本更新 91%

VirtualCrime: Evaluating the Criminal Potential and Agentic Behaviors of Large Language Models via Sandbox Simulation

VirtualCrime: 通过沙盒模拟评估大语言模型的犯罪潜力

Yilin Tang, Yu Wang, Lanlan Qiu, Wenchang Gao, Yunfei Ma, Baicheng Chen, Tianxing He

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本文提出VirtualCrime框架,通过三代理系统评估大语言模型的犯罪能力,设计40种多样化的犯罪任务,并评估8种强大的LLM,发现模型在犯罪过程中生成详细计划并执行智能犯罪过程,但有时会采取严重行动伤害NPC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15030 2026-08-05 cs.AI 90%

Collab-REC: An LLM-based Agentic Framework for Balancing Recommendations in Tourism

Collab-REC:一种基于LLM的代理框架,用于平衡旅游推荐

Ashmi Banerjee, Adithi Satish, Fitri Nur Aisyah, Wolfgang Wörndl, Yashar Deldjoo

机构 * Technical University of Munich(慕尼黑技术大学) Polytechnic University of Bari(巴里理工大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI

AI总结 提出一种多代理框架Collab-REC,通过三个LLM代理(个性化、流行度、可持续性)生成城市建议,并由非LLM调节器迭代优化,以缓解流行度偏差并提高推荐多样性。

Comments Accepted at ACM Transactions on Recommender Systems (TORS), August 2026

Journal ref ACM Transactions on Recommender Systems (TORS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03970 2026-08-05 cs.AI 新提交 89%

Should We Type or Talk to LLM Agents? A Comprehensive Study of Voice and Keyboard Input Perturbations

我们应该向大语言模型智能体打字还是说话?语音与键盘输入扰动的综合研究

Zizhao Hu, Nathan Elijah Segura, Mohammad Rostami, Jesse Thomason

专题命中 其他LLM :LLM(title,summary_cn);language model(abstract);分类 cs.AI

AI总结 本文通过提出HIVE工具集,研究语音与键盘输入扰动对LLM智能体性能的影响,发现语音转录扰动损害更大、两种扰动影响源于标记留存数量等七项结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22014 2026-08-05 cs.CL cs.AI 版本更新 88%

Toward Understanding the Transferability of Adversarial Suffixes in Large Language Models

面向大型语言模型中对抗性后缀的可迁移性理解

Sarah Ball, Niki Hasrati, Alexander Robey, Avi Schwarzschild, Frauke Kreuter, Zico Kolter, Andrej Risteski

机构 * Ludwig-Maximilians-Universität München(慕尼黑莱布尼茨-马克斯大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型的对抗性后缀可迁移性,分析出三个与迁移成功高度相关的统计属性,其成果可用于提升越狱攻击的实际效果。

Comments Accepted at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01366 2026-08-05 cs.MA cs.AI 版本更新 88%

Asking Questions the Right Way: A Multi-Agent Conversational System for Prompt Formulation in Complex Task Resolution

以正确方式提问:用于复杂任务解决中提示词生成的多智能体对话系统

B. Sankar, Pawni Yadav, Srinidhi Ranjini Girish, Amogh A. S

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出多智能体对话系统PAWNI,通过三层提示框架优化提示生成前端,实验显示其可提升提示结构完整性、LLM输出质量并降低人类工作量,支持人-AI协作优化。

Comments 53 pages, 31 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02985 2026-08-05 cs.LG cs.CL stat.ML 新提交 88%

Temporal Leakage in LLM Backtesting: Measurement, Validation, and Adjusted Scores

大语言模型回测中的时间泄漏:测量、验证与调整后得分

Zeyu Zhang, Bradly C. Stadie

机构 * Northwestern University(西北大学)

专题命中 其他LLM :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 该研究指出LLM回测的标准污染检测方法无效,提出利用已知截止时间和匹配干净对照组测量时间泄漏的方法,可检测并调整回测得分,澄清部分模型优势源于近期性而非真实技能。

Comments 12 pages main content, 45 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03160 2026-08-05 cs.MM cs.CV 新提交 88%

Caved or Convinced: Temporal Sampling Gates Claim Deference in Video Large Language Models

屈服还是信服:时序采样门控视频大语言模型的主张依从性

Yuxin Cao, Wei Song, Jingling Xue, Jin Song Dong

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对视频大语言模型的两种失败情况,区分了可用性与权重两个原因,提出反转测试缓解屈服于错误主张的问题,提升了顺序准确率并使模型可弃权而非猜测。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20851 2026-08-05 cs.CV 版本更新 88%

Poisoning Prompt-Guided Sampling in Video Large Language Models

针对视频大语言模型中提示引导采样的投毒攻击

Yuxin Cao, Wei Song, Jingling Xue, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学) CSIRO’s Data61(CSIRO数据61)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract)

AI总结 该研究针对视频大语言模型的提示引导采样提出PoisonVID投毒攻击,在多种模型与采样器组合上实现高攻击成功率,揭示了PGS存在的结构性安全隐患。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01243 2026-08-05 cs.CL 版本更新 87%

Suffix-Constrained Greedy Search Algorithms for Causal Language Models

后缀约束的贪心搜索算法用于因果语言模型

Ayoub Hammal, Pierre Zweigenbaum, Caio Corro

机构 * Université Paris-Saclay, CNRS, LISN(巴黎萨克雷大学、法国国家科学研究中心、LISN) Université de Rennes, INSA Rennes, CNRS, IRISA(雷恩大学、里昂国立应用科学学院、法国国家科学研究中心、IRISA)

专题命中 其他LLM :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 本研究提出后缀约束贪心搜索算法,用于在因果语言模型中确保最终答案的结构化提取,同时不损害性能甚至提升结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02356 2026-08-05 cs.AI 版本更新 83%

SkillTrace: Traversing a Query-Skill Graph for Composable LLM Agents

SkillTrace:遍历查询-技能图以构建可组合的大语言模型智能体

Yue Yao, Shengyuan Wang, Xin Chen, Minke Zhang, Jia He, Bingjun Luo, Tom Gedeon

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SkillTrace通过查询-技能图的三个层级关系实现技能组合,在SkillsBench和ALFWorld上取得SOTA性能,且对不同骨干语言模型具备通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03676 2026-08-05 cs.DC 新提交 80%

TAOT: Topology-Aware Optimal Transport for Dynamic Expert Replica Placement in MoE Training

TAOT:MoE训练中面向动态专家副本放置的拓扑感知最优传输方法

Lingyun Zhang, Henghua Zhang, Shilei Gu, Kai Mo, Shuai Han, Shiyong Li, Yanpeng Wang, Dou Shen

专题命中 其他LLM :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 针对MoE训练中动态路由引发的负载不平衡问题,提出TAOT拓扑感知最优传输方法,可实现1.43倍训练加速,平衡质量优异且通信成本降幅最高达74%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03485 2026-08-05 cs.CR 新提交 80%

SkillSentry: Adaptive Honey Worlds for Dynamic Safety Testing of Agent Skills

SkillSentry:用于智能体技能动态安全测试的自适应蜜罐世界

Nizhang Li, Zonghao Ying, Xiangfan Wu, Zonglei Jing, Xixun Lin, Hao Zhang, Wenxin Zhang, Jiaye Lin, Quanchen Zou, Xiangzheng Zhang

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 SkillSentry是基于自适应蜜罐世界的动态安全测试框架,可测试大语言模型智能体外部技能的条件性有害行为,在基准测试及规避场景下性能优于基线,代码公开。

详情

展开后加载摘要…

URL PDF HTML 收藏