arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-16 至 2026-07-16 共收录 237 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 17 篇

2607.13911 2026-07-16 cs.NE 新提交 85%

How to Guide LLM Generation: Dual-Surrogate Guided Search for Automated Heuristic Design

如何引导大语言模型生成:用于自动启发式设计的双代理引导搜索

Yuhan Wang, Chaoda Peng, Xingyu Wu, Sheng-Hao Wu, Zhi-Hui Zhan

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究如何在有限预算下引导大语言模型进行自动启发式设计,提出双代理引导搜索方法,通过两个互补代理评分及不确定性感知规则选择行动,在多样套件中表现出色,超越简单排名和固定偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06223 2026-07-16 cs.AI 版本更新 83%

From Reward-Hack Activations to Agentic Risk States: Context-Calibrated Mechanistic Monitoring in LLM Agents

从奖励黑客激活到智能体风险状态:LLM智能体中的上下文校准机制监控

Patrick Wilhelm, Odej Kao

机构 * University of Cambridge(剑桥大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究通过分析ReAct风格智能体在Gameable ALFWorld和WebShop环境中的奖励黑客行为,提出结合激活状态、熵和决策上下文的上下文校准监控方法,以更准确评估智能体风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08583 2026-07-16 cs.CL 版本更新 81%

Source or It Didn't Happen: A Multi-Agent Framework for Citation Hallucination Detection

来源或未发生:一种用于引用伪造检测的多智能体框架

Mingzhe Li, Zhiqiang Lin, Shiqing Ma

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) The Ohio State University(俄亥俄州立大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CiteTracer多智能体框架,通过12种分类体系检测引用伪造,利用PDF和BibTeX提取结构化引用,结合缓存查找、URL获取等方法验证,实现97.1%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-07-16 cs.CV 新提交 78%

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13395 2026-07-16 cs.LG 新提交 77%

Self-Improving is Often Sudden: Enlightenment-style Finetuning for Large-Scale Models

自我提升往往是突然的:大规模模型的顿悟式微调

Jing-Xiao Liao, Tianwei Zhang, Yu-Hao Jiang, Feifei Zhang, Hang-Cheng Dong, Feng-Lei Fan

机构 * School of Computer Science and Artificial Intelligence, Guangdong University of Education(广东第二师范学院计算机科学与人工智能学院) School of Instrumentation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学仪器科学与工程学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 研究大规模模型自主提升,提出顿悟式无训练后微调范式,通过修改关键模块捷径且不更新权重,针对大语言和视觉语言模型有不同实例化,实验证明有效解锁预训练网络潜力,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02911 2026-07-16 cs.CL 版本更新 77%

The Ghost Annotator: a Framework to Explore Human Label Variation in Content Moderation through Conformal Prediction

幽灵标注者:通过共形预测探索内容审核中人类标签变异的框架

Mirko Lai, Alessandra Urbinati, Simona Frenda, Fabiana Vernero, Marco Antonio Stranisci

机构 * Laboratory for the Modeling of Biological and Socio-technical Systems, Northeastern University(生物与社会技术系统建模实验室,东北大学) Heriot-Watt University(赫瑞-沃顿大学) aequa-tech Università del Piemonte Orientale(皮埃蒙特东方大学) Università degli Studi di Torino(托斯卡纳大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 提出结合共形预测与协同过滤式标注者表征的框架,通过幽灵预测度量和幽灵标注者表征量化模型预测与所有人类标注的分歧,并发现模型在标注者分歧时不确定性增加,但大型模型对无人类对齐文本更自信,且存在结构性人口统计偏差。

Comments The publishing of this preprint is contextual with the ACL ARR cycle system. After an encouraging review in January we revised and submit the paper on Arxiv. However, a new batch of reviewers raised additional issues that will lead to significant revisions of the experimental setting. Therefore, we decide to withdraw the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13978 2026-07-16 cs.CV cs.AI 新提交 70%

Music-to-Dance Generation via Atomic Movements

通过原子运动生成音乐驱动的舞蹈

Xinhao Cai, Yixuan Sun, Minghang Zheng, Qingchao Chen, Xin Jin, Song-chun Zhu, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) National Institute of Health Data Science, Peking University(北京大学健康数据科学研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Beijing Institute for General Artificial Intelligence(北京通用人工智能研究院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究音乐驱动的舞蹈生成问题,提出结构感知框架,将编排建模为原子运动序列,经数据分割、聚类及大语言模型处理得到原子运动注释,设计两阶段生成框架,提升舞蹈生成的结构连贯性、节奏对齐和自然度,增强可解释性与可控编辑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13899 2026-07-16 cs.AI 新提交 57%

AIMO Interpretability Challenge

AIMO可解释性挑战

Michal Štefánik, Philipp Mondorf, Andreas Waldis, Qianying Liu, Chuan Yang, Michal Spiegel, Josef Kuchař, Marek Kadlčík, Adam Vawda-Oomerjee, Chaoran Liu, Simon Frieder, Barbara Plank, Fazl Barez, Pontus Stenetorp

机构 * National Institute of Informatics(日本国立信息学研究所) Munich Center for Machine Learning / MaiNLP LMU(慕尼黑机器学习中心/慕尼黑大学语言与文学计算研究所) University of Tübingen(图宾根大学) Fuzhou University(福州大学) Masaryk University(马萨里克大学) University College London(伦敦大学学院) University of Oxford(牛津大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 提出AIMO可解释性挑战,基于前沿数学语言模型内部机制区分稳健与虚假推理。利用AIMO问题等资源,提供推理问题、模型访问及鲁棒性评估,助参与者开发识别稳健模型的方法,创建新基准和基线系统,连接可解释性与泛化研究。

Comments Accepted Competition at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13047 2026-07-16 cs.LG 新提交 57%

Targeted Recovery of Weight-Space Mechanisms From Neural Networks

从神经网络中定向恢复权重空间机制

Antoine Vigouroux, Lee Sharkey

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.LG

AI总结 研究提出定向参数分解(tPD)方法,通过引入高秩通用组件,从神经网络中仅识别处理特定感兴趣输入的组件,在玩具模型和Transformer语言模型上验证有效,能以低计算量提取子模型并对记忆序列进行手术式操作。

Comments Accepted at the Mechanistic Interpretability Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12752 2026-07-16 cs.CV cs.AI 版本更新 57%

Hallo4D: Multi-Modal Hallucination Mitigation for Consistent Spatio-Temporal Generation

Hallo4D:用于一致时空生成的多模态幻觉缓解

Hongbo Wang, Huaibo Huang, Jie Cao, Jin Liu, Haoyang Tong, Ran He

机构 * Institute of Automation, Chinese Academy of Science(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Shanghaitech University(上海科技大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 研究针对3D和4D内容生成中的时空幻觉问题,提出Hallo4D框架,利用多模态语言模型,通过生成-检测-校正范式及多种技术提升一致性,实验证明其在多样生成设置下优于基线,提供了可扩展通用的一致性感知内容生成方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12474 2026-07-16 cs.AI 版本更新 57%

From Observation to Insight: Mechanistic World Models and the Quest for Autonomous Discovery

从观察到洞察:机制世界模型与自主发现探索

Ingmar Posner, Anson Lei, Bernhard Schölkopf

机构 * MPI for Intelligent Systems & ELLIS Institute(马克斯·普朗克智能系统研究所及埃利斯研究所)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI

AI总结 本文探讨科学发现问题,提出机制世界模型这一新设计范式,将可重复使用机制置于核心,推导其计算能力、设计原则等,指出虽有不同研究方向捕捉该范式要素但缺统一框架,为推动AI走向自主科学发现提供基础和蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13192 2026-07-16 cs.CV 新提交 50%

Self-Supervised Visual Representation Learning: Pretrain-Finetuning or Joint Training?

自监督视觉表征学习:预训练-微调还是联合训练?

Nusrat Munia, Tyler Ward, Nishat Nayla, Matthew A. Massey, Abdullah-Al-Zubaer Imran

机构 * University of Kentucky(肯塔基大学) Kentucky Geological Survey(肯塔基地质调查局)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 研究自监督视觉表征学习中预训练-微调与联合训练两种范式,通过在多种任务及不同标记数据比例下评估性能,发现JT在低标记时提高效率且稳健,PFT在专业领域更可靠,为混合自监督半监督学习提供基准和指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12308 2026-07-16 cs.PL cs.SE 版本更新 50%

Mystra: Declarative Dynamic Taint Analysis via Shadow Virtual Machine

Mystra:通过影子虚拟机进行声明式动态污点分析

Zhuohao Zhang, Junkun Liu, Rui Yang, Yinzhi Cao, Ziyang Li

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 研究针对解释型语言的动态污点分析问题,核心方法是引入影子虚拟机并设计声明式污点规范语言Mystra,主要贡献是实现工具Shar,在准确性和性能上均有出色表现,如V8实例召回率高且零误报,运行时开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25753 2026-07-16 math.NA cs.CE cs.NA stat.CO 版本更新 50%

Quasi-Monte Carlo methods for uncertainty quantification of tumor growth modeled by a parametric semi-linear parabolic reaction-diffusion equation

用于参数半线性抛物型反应扩散方程肿瘤生长不确定性量化的小麦-蒙特卡洛方法

Alexander D. Gilbert, Frances Y. Kuo, Dirk Nuyens, Graham Pash, Ian H. Sloan, Karen E. Willcox

专题命中 知识编辑与模型理解 :prompting(abstract)

AI总结 本文提出利用准蒙特卡洛方法对参数半线性抛物型反应扩散方程建模的肿瘤生长进行不确定性量化,通过理论分析和数值实验验证了其在计算感兴趣量方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他LLM 13 篇

2603.22510 2026-07-16 cs.DL cs.AI cs.IR 版本更新 86%

Research Novelty in Information Systems Journals After ChatGPT: Differences Across Institutional Language Contexts

大型语言模型是否减少研究新颖性?来自信息系统期刊的证据

Ali Safari, Sahar Babaei

机构 * Department of Information Technology and Decision Sciences, University of North Texas(信息科技与决策科学系,北德克萨斯大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分析2020-2025年间44个信息系统期刊的13847篇文章,发现非英语主导国家的作者在ChatGPT发布后研究新颖性显著下降,贡献了关于LLM对学术多样性影响的见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18798 2026-07-16 cs.MM cs.AI 版本更新 83%

ELF: A Family of Encoder-Free ECG-Language Models

ELF:无编码器心电图语言模型家族

William Han, Tony Chen, Chaojing Duan, Xiaoyu Song, Yihang Yao, Yuzhe Yang, Michael A. Rosenberg, Emerson Liu, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) Allegheny Health Network(阿勒格尼医疗网络) University of California Los Angeles(加州大学洛杉矶分校) University of Colorado(科罗拉多大学) Allergy and Immunology(过敏与免疫学)

专题命中 其他LLM :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 提出三种无编码器架构的ECG语言模型ELF,简化架构和训练流程,在两个数据集上达到或超越现有最优模型。

Comments 34 pages, 12 figures; Accepted to MLHC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13149 2026-07-16 cs.CR 新提交 78%

Composable Trust for Language Models: A proven boundary and a measured defense

语言模型的可组合信任:一个经过验证的边界和一种可衡量的防御

Yakov Pyotr Shkolnikov

专题命中 其他LLM :language model(title,abstract)

AI总结 研究针对语言模型中不可信文本影响问题,开发基于来源可信度的信任模型,通过确定性管道和非模型监视器防御。经实验,钝化和级联提升真实泄漏防御率,自适应红队测试下边界成立,防御率稳定,还提高了事实归属率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09674 2026-07-16 cs.AI cs.CL 版本更新 73%

How LLMs Might Think

大型语言模型可能如何思考

Joseph Gottlieb, Ethan Kemp, Matthew Trager

机构 * Texas Tech University(德克萨斯理工大学) New York University(纽约大学) University of Pittsburgh(匹兹堡大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文挑战了LLMs不思考的观点,提出LLMs可能以非理性、联想式方式思考,其思维过程纯粹基于联想。

Journal ref Mind & Language (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13693 2026-07-16 cs.MA cs.AI cs.SI physics.soc-ph 新提交 70%

Social Simulations: from Agent-Based Modeling to Digital Twins

社会模拟:从基于主体的建模到数字孪生

Erica Cau, Andrea Failla, Valentina Pansanella, Giulio Rossetti

机构 * Department of Computer Science, University of Pisa(皮萨大学计算机科学系) ISTI-CNR(意大利国家研究委员会信息与系统研究所)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 探讨社会模拟从基于主体建模到数字孪生的演变,阐述了各阶段范式的方法论基础、应用等,强调从抽象模型到特定社会系统逼真计算表示的转变。

Comments Entry for Encyclopedia of Social Network Analysis and Mining

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24602 2026-07-16 cs.CV cs.AI 版本更新 70%

Correcting Visual Blur Induced by Attention Distraction to Reduce Hallucinations: Algorithm and Theory

纠正注意力分散引起的视觉模糊以减少幻觉:算法与理论

Quanjiang Li, Zhiming Liu, Wei Luo, Tingjin Luo, Chenping Hou

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文揭示多模态大语言模型中的物体幻觉与类人注意力分散现象相关,并提出一种无需额外训练的注意力聚焦方法(AFIP)通过跨头注意力增强和动态历史注意力强化来纠正视觉模糊,从而减少幻觉。

Journal ref ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28213 2026-07-16 cs.CL 版本更新 70%

\textit{Versteasch du mi?} Computational and Socio-Linguistic Perspectives on GenAI, LLMs, and Non-Standard Language

Versteasch du mi?:对生成式人工智能、LLMs和非标准语言的计算与社会语言学视角

Verena Platzgummer, John McCrae, Sina Ahmadi

机构 * University of Galway(戈尔韦大学) University of Zurich(苏黎世大学)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨生成式人工智能和LLMs对非标准语言的处理,分析其对语言标准化和数字语言鸿沟的影响,并提出民主和去殖民化的数字学习策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13443 2026-07-16 cs.CY cs.DC 新提交 67%

The Environmental Cost of Digital Sovereignty: Water, Energy, and Emissions Impacts of Sovereign AI Infrastructure in the Global South

数字主权的环境成本:全球南方主权人工智能基础设施的水、能源和排放影响

Muntaser Syed, Marius C. Silaghi, Sheikh Abujar, Sharun Akter Khushbu, Amal El Ahmad

专题命中 其他LLM :language model(abstract);small language model(abstract)

AI总结 研究全球南方主权人工智能基础设施的环境成本,通过对四个案例分析,模拟其水、能源消耗及碳排放,发现存在主权-可持续性困境,进而提出对环境负责的主权人工智能设计原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13319 2026-07-16 cs.RO cs.AI cs.LG 新提交 62%

Adapting Generalist Vehicle Models for High-Speed MPC Across Terrains

使通用车辆模型适应不同地形的高速模型预测控制

Rwik Rana, Jesse Quattrociocchi, Christian Ellis, Nathan Tsoi, Garrett Warnell, Joydeep Biswas

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 其他LLM :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究高速越野自主中通用车辆模型适应不同地形的问题,提出OptCar方法,通过历史条件动态适应模块,利用有限真实数据和合成展开微调通用模型,在多种实验中表现良好,提升了跨地形性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13930 2026-07-16 nucl-th astro-ph.HE physics.comp-ph 新提交 50%

NNStar: An end-to-end AI agent for nuclear matter and neutron star physics

NNStar:用于核物质和中子星物理的端到端人工智能代理

Yao Ma, Yong-Liang Ma, Jia-Ying Xiong

专题命中 其他LLM :LLM(abstract)

AI总结 研究针对核物质和中子星物理中约束致密物质状态方程需处理大量数据及高维耦合空间微调难的问题,提出NNStar这一端到端人工智能代理,可自动化工作流程,为相关观测分析提供新的AI驱动框架。

Comments 14 pages; comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11999 2026-07-16 cs.CY 版本更新 50%

Underwriting the Agent Economy: The Blueprint for an AI Insurance Stack

承保智能体经济:人工智能保险堆栈蓝图

Cristian Trout, Sanmi Koyejo, Sasha Romanosky, Giorgio Ripamonti, Lynn Thompson, Desiree Spain, Alex Taylor, Kevin Casey, Stephen Casper, Matthew Botvinick, Sean McGregor, Miles Brundage, A. Feder Cooper, Patricia Paskov, Adrien Ecoffet, Ben Bucknall, Kevin Wei, Markus Anderljung, Lukasz Szpruch, Bri Treece, Tom Zick, Gabriel Weil, Ugur Ozer, Kevin Kalinich, Jesus Gonzalez, Vitaly Baranov, Moran Koren, Guy Laban, Gil Arazi, Henri Winand, Derek Blum, Toby Clowes, Adam Kleinman, Anita Srinivasan, Tom Fehring, Rune Kvist, Rajiv Dattani

专题命中 其他LLM :foundation model(abstract)

AI总结 研究人工智能智能体经济下保险面临的风险及可保性问题,提出构建含八个组件的人工智能保险堆栈,通过行业协调实现限额承保,还探讨了前沿人工智能灾难性风险承保及所需工具,以助保险公司管理相关风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06256 2026-07-16 cs.RO 版本更新 50%

Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition

诊断智能体编排的视觉-语言-动作技能组合中的语义切换失败

Ke Rui, Yushen Zuo, Jiawei Wang, Haoran Jia, Jinming Ma, Weitao Zhou, Minglei Li

机构 * SimpleAI

专题命中 其他LLM :language model(abstract)

AI总结 研究智能体编排的视觉-语言-动作技能组合中的语义切换失败问题,通过智能体编排执行框架,调用基于π0.5的技能检查点,在两种初始状态分布下评估,发现单技能与长期任务成功率差距大,为未来技能库改进提供诊断依据。

Journal ref RSS SemRob Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10607 2026-07-16 cs.CV 版本更新 50%

Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation

跟踪并描述任何运动:通过轨迹条件生成实现开放词汇时空字幕

Bishoy Galoaa, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 其他LLM :language model(abstract)

AI总结 研究提出TCAM框架,无需文本查询和区域提示,通过字幕感知重采样器在点粒度结合跟踪与语言,用现有分割注释训练,能描述视频中运动、定位时间及轨迹,优于密集视频字幕基线,匹配相关方法,为运动驱动视频理解提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏