arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-03 至 2026-08-03 共收录 267 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 14 篇

2512.05131 2026-08-03 cs.CV cs.AI cs.RO 版本更新 57%

AREA3D: Active Reconstruction Agent with Unified Feed-Forward 3D Perception and Vision-Language Guidance

AREA3D: 带有统一前馈3D感知和视觉-语言引导的主动重建代理

Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister

机构 * Southern University of Science and Technology(南方科技大学) Harvard University(哈佛大学) California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 AREA3D通过统一前馈3D感知与视觉-语言引导,实现高效主动3D重建,尤其在稀疏视角下提升重建精度。

Journal ref Tianling Xu, Shengzhe Gan, Leslie Gu, Yuelei Li, Fangneng Zhan, Hanspeter Pfister. The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28993 2026-08-03 cs.RO cs.CV 新提交 50%

ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

ST-WAM:面向视觉分布偏移下鲁棒操作的语义-时间世界动作模型

Mingxin Wang, Bin Hu, Bin Qian, Kaitao Jiang, Haoning Wu, Feng Yan, Bowen Jing, Ruiyang Hao, Enyi Wang, Kangning Niu, Yandan Yang, Mu Xu, Yan Wang, Houde Liu, Tianlun Li

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 该研究针对视觉分布偏移下机器人操作的鲁棒性问题,提出ST-WAM模型,采用DINOv3等技术,在多个基准测试中取得优异性能,大幅提升了偏移场景下的零样本操作表现。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他LLM 25 篇

2607.28667 2026-08-03 cs.LG cs.AI math.DS 新提交 91%

Guarantees on Dynamical System Distinguishability for LLM Token Generation

大语言模型(LLM)令牌生成的动力系统可区分性保证

Mohamed Akrout, Dan Wilson

机构 * University of Tennessee(田纳西大学)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究将LLM响应分类任务形式化为随机线性DS的二元假设检验,证明基于DS的分类误判率随序列长度指数衰减,还建立跨嵌入泛化的可迁移可区分性下界,解释了该方法的经验性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28651 2026-08-03 cs.HC cs.CL cs.CY 新提交 91%

Measuring Cognitive Engagement in Collaborative Discourse with an Extended ICAP Framework: Comparing Human Annotation, In-Context Learning, and Reflective LLM Agents

基于扩展ICAP框架的协作对话认知投入度测量:人类标注、上下文学习与反思型大语言模型智能体的比较

Lan Anh Do, Hanling Jiang, Shuchin Aeron, Ayanna K. Thomas

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究用扩展7点ICAP框架测量协作对话认知投入度,对比人类标注、ICL及反思型LLM智能体,发现人类标注信度更高,智能体方法具潜力,需强化人类标注与LLM方法的交互。

Comments Accepted as a full paper in the CogSci 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03919 2026-08-03 cs.CR 版本更新 90%

When Safety Becomes a Vulnerability: Exploiting LLM Alignment Homogeneity for Transferable Blocking in RAG

当安全成为漏洞:利用LLM对齐同质性进行可转移阻塞在RAG中

Junchen Li, Liang Xu, Qizhi Chen, Rongzheng Wang, Chao Qi, Shihao He, Di Liang, Haibo Shi, Shuang Liang

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 TabooRAG通过利用LLM对齐同质性,在黑盒环境下实现跨模型的可转移阻塞攻击,针对安全对齐机制提出新型攻击框架。

Comments Expanded the scale of the experimental evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28871 2026-08-03 cs.SE cs.AI 新提交 90%

Validation Evidence in LLM Repair Agents: How Much of What Passes Actually Tests the Bug?

LLM修复智能体中的验证证据:通过的测试究竟在多大程度上能检验缺陷?

Xiaonan Xu, Wenjing Wu

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究以BSG-VA方法分析LLM修复智能体的验证证据,发现近半数阳性测试无缺陷区分信息,缺陷对比反馈可减少证据不足的部署,其效果幅度仍需进一步验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29519 2026-08-03 cs.SE 新提交 89%

Students' Practices and Skills in the LLM-Era: "You Can't Outsource the Struggle and Still Get the Skill"

LLM时代的学生实践与技能:“你不能把奋斗过程外包出去,却仍想获得技能”

Enne Rebeca Silva de Freitas, Gustavo Pinto, Danilo Monteiro

专题命中 其他LLM :LLM(title,title_cn)

AI总结 研究针对软件工程研究生在LLM时代的AI使用技能缺口,分析1383条子reddit帖子后发现学生外包研究技能培养的认知努力,提出需开发课程引导学生与LLM协同工作。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26390 2026-08-03 cs.SE 版本更新 89%

Impossible to hide secret ...: Uncovering Security and Privacy Issues in LLM-native IDEs

无法隐藏的秘密:揭示原生大语言模型集成开发环境(LLM-native IDEs,简称LIDEs)的安全与隐私问题

Mostafijur Rahman Akhond, Md Afif Al Mamun, Gias Uddin, Song Wang

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文针对原生大语言模型集成开发环境(LIDEs),通过分析110万条相关帖子及6000余条评论,构建其安全隐私问题分类体系,发现问题多源于系统设计,开发者依赖外部防护,为后续安全LIDEs设计提供经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17192 2026-08-03 cs.AI 版本更新 85%

Shall We Play a Game? Language Models for Open-ended Wargames

我们要玩一场游戏吗?用于开放式兵棋推演的语言模型

Glenn Matlin, Isaac Song, Yixiong Hao, Parv Mahajan, Evan Montoya, Ryan Bard, Stuart R. Topp, Anthony Wen-Ming Zang, Mohammed Rehan Parwani, Soham Shetty, Mark Riedl

专题命中 其他LLM :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究通过对223篇相关论文的范围综述,明确了兵棋推演中语言模型的控制角色现状,指出需关注模型对行动与后果的控制程度以保障模拟保真度。

Comments 49 pages (9-page body), 3 figures. Published at the Social Sim'26 Workshop at COLM 2026 (non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05372 2026-08-03 cs.SE 85%

Adversarial Bug Reports as a Security Risk in Language Model-Based Automated Program Repair

对抗性错误报告:基于语言模型的自动程序修复中的安全风险

Piotr Przymus, Andreas Happe, Jürgen Cito

专题命中 其他LLM :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文研究对抗性错误报告对基于大语言模型的自动程序修复系统的安全威胁,通过实证分析发现现有防御措施不足,并提出自动化生成对抗性错误报告的原型框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00847 2026-08-03 cs.GT cs.AI 版本更新 83%

Pay for The Second-Best Service: A Game-Theoretic Approach Against Dishonest LLM Providers

为次优服务付费:一种对抗不诚实大语言模型提供者的博弈论方法

Yuhan Cao, Yu Wang, Sitong Liu, Miao Li, Yixin Tao, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海启智研究院) ShanghaiTech University(上海科技大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) Shanghai University of Finance(上海财经大学) Tsinghua University(清华大学)

专题命中 其他LLM :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种博弈论方法,通过设计近似激励相容机制,解决大语言模型服务提供者可能存在的不诚实行为问题,并保证用户效用的次优性。

Comments Published as a conference paper at WWW 2026; 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24343 2026-08-03 cs.LG cs.AI cs.CL 版本更新 82%

Beyond Aggregate Risk: Role-Stratified Conformal Risk Control for LLM Tool Calls

超越总体风险:用于大语言模型工具调用的角色分层共形风险控制

Md Ashikur Rahman, Md Arifur Rahman, Niamul Hassan Samin, Khandaker Rifah Tasnia, Md Hasibul Amin, Sifat Rahman Ahona, Juena Ahmed Noshin

专题命中 其他LLM :LLM(title);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型工具调用中参数的不同风险,提出角色分层共形风险控制方法,为语义参数角色设阈值和预算,实验表明该方法能有效实现特定角色预算合规,证明应在语义角色层面认证结构化工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29383 2026-08-03 cs.LG cs.DC cs.SE 新提交 81%

Exploring Block Anomaly Detection In HDFS Log Data Analysis

HDFS日志数据分析中的块异常检测探索

WenYang Zhong, Tutut Herawan

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本研究针对HDFS日志人工异常检测复杂枯燥的问题,提出结合LLM-BiLSTM模型与Kafka流式管道的检测方案,实现HDFS块异常的快速准确检测。

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24917 2026-08-03 cs.CL cs.LG 版本更新 81%

Estimating near-verbatim extraction risk in language models with decoding-constrained beam search

通过解码约束束搜索估计语言模型中的近原文提取风险

A. Feder Cooper, Mark A. Lemley, Christopher De Sa, Lea Duesterwald, Allison Casasola, Jamie Hayes, Katherine Lee, Daniel E. Ho, Percy Liang

机构 * AVERI Stanford(斯坦福大学) Cornell(康奈尔大学) Google DeepMind(谷歌DeepMind)

专题命中 其他LLM :language model(title);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出解码约束束搜索方法,以有效估计语言模型中的近原文提取风险,揭示更多可提取序列及模型规模对风险的影响。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29274 2026-08-03 cs.IR cs.CL cs.CY cs.HC 新提交 79%

Language Models Agree With Each Other, Not With Readers

语言模型彼此意见一致,但与读者不一致

Kazuki Nakayashiki, Keisuke Watanabe

专题命中 其他LLM :language model(title,abstract);分类 cs.CL

AI总结 该研究以非研究专用的读者标记为参考,发现不同语言模型间的一致性高于模型与读者间的一致性,且模型一致性与模型规模等因素相关,样本外测试也验证了该结论。

Comments 18 pages. Ancillary files include all three pre-registrations, every analysis script and every result artifact; the paper contains no numeric literal for a measured value and make-numbers.py regenerates all of them from the shipped artifacts alone

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23532 2026-08-03 cs.CR cs.AI cs.LO cs.RO 版本更新 79%

Mission-Level Runtime Assurance for LLM-Assisted ISR Swarms over a Verification-Aware Fabric

基于验证感知架构的大语言模型辅助情报、监视与侦察集群任务级运行时保障

Nikolaos Kekatos, Panagiotis Katsaros, Alexios Lekidis, Theodoros Nestoridis, Tom Nianios

专题命中 其他LLM :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型辅助的ISR集群任务级运行时保障问题,提出三层组合式运行时验证框架,将任务策略分解,通过验证感知架构聚合判定并融合代数,能检测个体合规但集群违规情况,模拟任务验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29086 2026-08-03 cs.SD 新提交 78%

Do Music Foundation Models Embed Pitch in Helical Structure?

音乐基础模型是否以螺旋结构嵌入音高?

Hayato Yagi, Shinnosuke Takamichi, Rin Sato, Keitaro Tanaka, Shigeo Morishima

专题命中 其他LLM :foundation model(title,abstract)

AI总结 该研究分析音乐基础模型的中间表征,发现其音高表征形成反映八度周期性的螺旋结构,且结构特征随模型和输入声学特性变化,为阐明模型内部机制提供新方法。

Comments Accepted by ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13683 2026-08-03 cs.CL 版本更新 77%

HarnessBank: Semantic Gene-Bank Search with Gated Verification for Agent-Harness Self-Evolution

通过门控语义质量多样性实现自我进化智能体的驾驭

Xiaotian Luo, Dizhan Xue, Fengxingyu Wang, Chuanrui Hu, Yafeng Deng

专题命中 其他LLM :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 研究大语言模型智能体驾驭因素提升性能的问题,提出自我进化智能体驾驭框架,将提出与评估更改分开,通过门控存档避免过度拟合,在多领域测试中取得较好泛化效果,证明诊断与评估循环的有效性。

Comments 9 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21544 2026-08-03 cs.CV cs.CL 77%

Vision Meets Language: A RAG-Augmented YOLOv8 Framework for Coffee Disease Diagnosis and Farmer Assistance

Semanto Mondal

机构 * University of Naples Federico II(那不勒斯费德里科二世大学)

专题命中 其他LLM :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Comments There are 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28632 2026-08-03 cs.AI 新提交 74%

LLM Framework for Discovering Major Mathematical Conjectures: AI's Quest for the Next Riemann Hypothesis

用于发现重要数学猜想的大语言模型框架:AI对下一个黎曼猜想的探索

Alizer Wong, Zixin Zeng, Yi Tan, Wenyuan Li, Xuhang Chen, Xingru Lai, Yang Shi, Liangsi Lu, Yanhui Chen

专题命中 其他LLM :LLM(title);分类 cs.AI

AI总结 该研究提出一种三阶段大语言模型框架,用于系统发现重要数学猜想,经实验验证其在20个候选猜想上的形式化检查表现稳定,无重复问题。

Comments 25pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19350 2026-08-03 cs.GR cs.LG 版本更新 70%

CompoSE: Compositional Synthesis and Editing of 3D Shapes via Part-Aware Control

CompoSE:通过部分感知控制进行3D形状的组合合成与编辑

Habib Slim, Shariq Farooq Bhat, Mohamed Elhoseiny, Yifan Wang, Mike Roberts

机构 * King Abdullah University of Science and Technology (KAUST)(卡布斯大学) Adobe Research(Adobe研究)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出CompoSE方法,通过部分感知控制实现3D形状的组合合成与编辑,核心方法是使用扩散变压器架构在局部和全局之间交替处理部分,并通过新颖的条件技术确保对用户输入的强遵循,主要贡献是无需部分级文本提示即可直接从用户粗略布局指导中学习部分语义和对称性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28798 2026-08-03 physics.soc-ph 新提交 67%

Occupational Convergence or Divergence? Mapping Labor Market Structural Shifts Driven by AI Penetration

职业的趋同还是分化?绘制由AI渗透驱动的劳动力市场结构转变图

Rafiazka Hilman, Julia Koltai

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 本研究利用10国在线职位空缺数据,结合NLP、大语言模型等方法,发现AI相关技能在核心STEM职业间趋同,但核心与其他职业间分化,强化了职业分层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29585 2026-08-03 cs.CL 新提交 57%

Sycophancy Undermines Epistemic Vigilance in Cooperative Vision-Language Tasks

谄媚行为破坏合作型视觉-语言任务中的认知警觉性

Rupak Sarkar, Neha Srikanth, Saloni Gupta, Claire Bonial, Philip Resnik, Rachel Rudinger

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 该研究针对合作型视觉-语言任务,提出信息不对称的“找不同”任务,发现模型存在谄媚行为破坏认知警觉性的问题,通过学习向量调整模型可减少此类错误,提升模型可靠性。

Comments 9 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07267 2026-08-03 cs.CY cs.CL physics.soc-ph 版本更新 57%

Billions of Sketches Reveal Hidden Cultural Variation in Human Concepts

数十亿草图揭示人类概念中隐藏的文化差异

Arianna Pera, Mauro Martino, Nima Dehmamy, Douglas Guilbeault, Luca Maria Aiello, Andrea Baronchelli

专题命中 其他LLM :language model(abstract);分类 cs.CL

AI总结 研究通过分析236个国家和地区的26亿张手绘草图,探讨人类概念结构。发现单一概念有多种视觉范例,跨文化差异在触觉概念中最强。比较草图与词嵌入模型,发现视觉表征保留更多语义文化结构,基于草图的跨文化相似性与文化距离契合度更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04463 2026-08-03 cs.LG 57%

GFocal: A Global-Focal Neural Operator for Solving PDEs on Arbitrary Geometries

Fangzhi Fei, Jiaxin Hu, Qiaofeng Li, Zhenyu Liu

机构 * Fangzhi Fei 1(某机构) Jiaxin Hu 1(某机构) Qiaofeng Li 1,2,*(某机构) Zhenyu Liu 1,3,*(某机构)

专题命中 其他LLM :language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28827 2026-08-03 cs.CY 新提交 50%

Hidden Errors in Big Data: The Case of Property Records

大数据中的隐藏错误:以房产记录为例

Evelyn Smith, Emma Harvey, Jacob Goldin, Daniel E. Ho

专题命中 其他LLM :prompting(abstract)

AI总结 本文审计两个中介房产数据集,发现其存在1-2%售价偏差、12-15%覆盖错误等问题,错报高度一致,会影响财产税累退性估计,凸显开放行政数据的重要性。

Comments To appear in Proceedings of the Ninth AAAI/ACM Conference on AI, Ethics, and Society (AIES-26), Malmö, Sweden, October 12-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25416 2026-08-03 cs.CY 版本更新 50%

The Traffickers' Pitch: Detecting Deceptive Recruitment in Online Job Boards

人贩子的推销:检测在线招聘平台中的欺骗性招聘

Siyi Zhou, Peiran Qiu, Tanishq Salkar, Leonardo Blas Urrutia, Dacheng Shen, Nora Adadurova, Deyang Hsu, Eun Cheol Choi, Emilio Ferrara

专题命中 其他LLM :language model(abstract)

AI总结 提出一个计算框架,通过语言特征识别人口贩卖招募者并分析其在线招聘模式,利用网络驱动标注方法构建风险招聘广告的真实数据,并基于语言差异设计多模型集成分类器提升检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏