arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-30 至 2026-07-30 共收录 174 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 8 篇

2607.26178 2026-07-30 cs.CL 新提交 84%

DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues

DuplexGen:人机交替对话的自适应合成

Takyoung Kim, Kang-wook Kim, Sang Hoon Woo, Julia Hirschberg, Gunhee Kim, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Seoul National University(首尔大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 DuplexGen框架通过将LLM预测与少量槽级人类偏好标注校准,生成场景自适应交替发言对话,契合人类偏好的效果优于未校准方法,证明人类校准对交替发言合成场景特定性的关键作用。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26070 2026-07-30 cs.IR cs.AI 新提交 81%

SimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic Search

SimpleWikiSearch:用于智能体搜索的简洁离线维基百科环境

Guanming Xiong, Penghui Zhang

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SimpleWikiSearch是一套明确可运行的离线维基百科环境,用于智能体搜索的可复现评估,提供基线结果及对比闭源模型的子集,而非提出新智能体算法。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26346 2026-07-30 math.ST cs.SI stat.ME stat.ML stat.TH 新提交 78%

Toward a Unified Statistical Theory of Unsupervised Pretraining and Supervised Neural Knowledge Graph Learning

迈向无监督预训练与监督神经知识图谱学习的统一统计理论

Jifan Zhang, Miklos Racz, Suqi Liu

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本研究针对知识图谱学习中数据与理论问题,提出含无监督预训练与监督学习的两阶段框架,建立非渐近风险界,经合成与真实实验验证其有效性。

Comments 49 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26249 2026-07-30 cs.CL cs.CY cs.SD stat.AP 新提交 70%

A large-scale corpus of religious radio broadcast transcripts from webstream recordings in the United States

美国网络流录音的宗教广播文字转写大规模语料库

Samuel Bestvater, Athena Chapekis, Skyler Seets, Anna Lieb, Sono Shah, Aaron Smith

机构 * Pew Research Center(皮尤研究中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究构建了2025年7月美国宗教广播网络流录音的大规模文字转写语料库,可用于宗教传播、社会议题分析及语音处理等相关领域研究。

Comments Presented at IC2S2 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26196 2026-07-30 cs.CV 新提交 67%

Rad-JEPA 3D: Radiology Joint-Embedding Predictive Model for 3D Computed Tomography

Rad-JEPA 3D:用于三维计算机断层扫描的放射学联合嵌入预测模型

Quoc-Huy Trinh, Minh-Van Nguyen, Ulas Bagci

机构 * Northwestern University(西北大学) Technical University of Denmark(丹麦技术大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 Rad-JEPA 3D是用于3D CT的自监督联合嵌入预测框架,采用混合H-Mamba编码器与HSOR正则化,在12万次CT扫描预训练后,在器官识别、空间推理等任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26389 2026-07-30 cs.CL cs.AI 新提交 62%

Misalignment Has a Personality: A Big Five Account of Emergent Misalignment

错位具有人格特质:对涌现错位的大五人格解释

Hasibur Rahman, Smit Desai

机构 * Northeastern University(东北大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出用大五人格向量解释语言模型微调引发的错位,发现错位语料具特定人格特征,该向量可诊断安全现象且能捕捉单一方向无法识别的谄媚特质。

Comments The paper is currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26582 2026-07-30 cs.CV 新提交 50%

Level, Sharpness, and Corpus: Why Zero-Shot OOD Detector Rankings Do Not Transfer

水平、锐度与语料:为何零样本分布外检测器的排名无法迁移

Ignacio M. De la Jara, Cristian Rodriguez-Opazo, Stephen Gould, Damith Ranasinghe

专题命中 预训练与数据 :language model(abstract)

AI总结 本文通过审计证明零样本OOD检测器排名无法跨域迁移,提出CEG封装器,可降低检测器敏感性并提升GL-MCM与MCM的族平衡FPR95。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26365 2026-07-30 cs.IR 新提交 50%

Embedding Items at Scale: Comparing GNN-Based and ID-Based Item Embeddings in the Yandex Ecosystem

大规模物品嵌入:Yandex生态系统中基于GNN和基于ID的物品嵌入比较

Sergei Makeev, Artem Matveev, Vladimir Baikalov, Kirill Khrylchenko

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文通过案例研究,在Yandex的三个产品场景中对比了基于GNN的预训练物品嵌入与端到端可训练物品嵌入,发现训练数据有限时预训练有帮助,大规模数据集上则无显著益处。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 16 篇

2607.26286 2026-07-30 cs.CL 新提交 92%

Evaluating Prompt Scope and Demonstration Similarity in Local LLM Machine Translation

评估本地大语言模型(LLM)机器翻译中的提示范围与示例相似性

Mihael Arcan

机构 * Home Lab(家庭实验室)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文以9种欧盟语言为对象,对比3款本地LLM与专用MT基线,研究提示范围、示例选择对机器翻译的影响,发现专用MT系统仍最优,嵌入检索对强LLM效果较好,语族范围提示对强LLM可行但存在小型模型缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26062 2026-07-30 cs.CY cs.AI cs.CL 新提交 92%

Identifying Implicit Bias in LLM-based Chat AI Toward People with Intellectual Disabilities

识别基于大语言模型(LLM)的聊天人工智能对智力障碍人群的隐含偏见

Karly V. Coffey, Gloria L. Krahn, John P. Hanley, Jacob E. Neely

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对5款LLM聊天AI生成的25000个故事,分析发现其对智力障碍人群存在将其矮化、依赖化等负面隐含偏见,呼吁AI开发警惕此类偏见并加以缓解。

Journal ref Karly V. Coffey, Gloria L. Krahn, John P. Hanley, Jacob E. Neely, Identifying implicit bias in LLM-based chat AI toward people with intellectual disabilities, Disability and Health Journal, 2026, 102086, ISSN 1936-6574

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26326 2026-07-30 cs.CV 新提交 92%

Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models

视觉还是认知?多模态大语言模型的视觉上下文敏感性

Jiaang Li, Chengzu Li, Zhaochong An, Yifei Yuan, Xi Liu, Serge Belongie, Vésteinn Snæbjarnarson

机构 * University of Copenhagen(哥本哈根大学) University of Cambridge(剑桥大学) ETH Zürich(苏黎世联邦理工学院) Clemson University(克莱姆森大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn)

AI总结 该研究探究多模态大语言模型在视觉证据与先验冲突任务上的失效原因,引入WhatIfVis基准,发现其能编码视觉证据但难以控制对其的依赖,监督微调等方法可提升可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26594 2026-07-30 eess.SY cs.AI cs.SY 新提交 90%

A Physics-Informed Framework for PID Tuning of Chemical Processes Using Large Language Model Agents

基于大语言模型智能体的化工过程PID整定的物理信息框架

Zhoupeng Shou, Xiaodong Hong, Congjing Ren, Jingdai Wang, Yongrong Yang, Zuwei Liao

专题命中 指令微调 :language model(title,abstract);large language model(title);SFT(abstract,abstract_cn);small language model(abstract)

AI总结 本研究提出一种适用于大、小语言模型的PID整定框架,将工程师整定流程形式化,通过微调Qwen3-0.6B并在测试案例中取得优异整定成功率,提升了PID整定的可靠性与稳定裕度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26119 2026-07-30 cs.AI cs.CL 新提交 90%

Probing the Origins of Reasoning Performance: Representational Quality for Mathematical Problem-Solving in RL vs. SFT Fine-Tuned Models

探究推理性能的起源:强化学习(RL)与监督微调(SFT)模型在数学问题求解中的表征质量

Antyabha Rahman, Akshaj Gurugubelli, Omar Ankit, Kevin Zhu, Aishwarya Balwani

专题命中 指令微调 :SFT(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究探究RL与SFT微调模型数学推理性能差异的机制,发现RL模型的表征更具线性可分性、深层重要性更高,其token分配变异性或反映在线策略推理的分布。

Comments Second Workshop on XAI4Science, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26173 2026-07-30 cs.LG 新提交 90%

Shared SFT Lessons Across Alignment, Model Organisms, and Toy Models

对齐、模型有机体与玩具模型中的共享SFT经验教训

Anton de la Fuente, Arthur Conmy

专题命中 指令微调 :SFT(title,title_cn);分类 cs.LG

AI总结 本研究探讨对齐训练、模型有机体与玩具模型间SFT经验的三类迁移,发现跨领域迁移SFT经验可推动各领域发展,建议研究者借鉴域外技术。

Comments 31 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27083 2026-07-30 cs.LG cs.AI 新提交 88%

Scores Are Not Decisions: Cost-Aware Stopping for Tool Acquisition in LLM Agents

分数并非决策:大语言模型智能体工具获取的成本感知停止策略

Yicheng Feng, Yan Zhang, Yan Cheng, Wei Qi

专题命中 指令微调 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 针对LLM智能体工具获取的异构成本问题,提出CAM-DF及其轻量变体,通过训练停止决策的离线差距实现成本感知停止,在1343个任务上验证其优于基线,减少工具接触量的同时保持任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26780 2026-07-30 cs.CL 新提交 86%

Enhancing Generative Information Extraction with Two-step Validation: A Product Attribute Use Case

通过两步验证增强生成式信息抽取:产品属性用例

Yi-Sheng Hsu, Nermeen Abou Baker, Uwe Handmann

机构 * Computer Science Institute, Ruhr West University of Applied Sciences(鲁尔西应用科学大学计算机科学学院)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对数字产品护照领域标注数据稀缺问题,提出集成PLM模块的两步验证生成式信息抽取方法,可提升LLM对低显著性实体的抽取性能,中型模型表现接近大型模型,最小型开源模型效果有限,还开发了对应演示应用。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26922 2026-07-30 cs.LG 新提交 85%

Two Calls Beat Five Agents: Evaluating Multi-Agent Pipelines Against Self-Refinement for Local Language Models

两次调用胜过五个智能体:针对本地语言模型的多智能体流水线与自我优化的评估

Ashish Prajapati, Om Mohite

专题命中 指令微调 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.LG

AI总结 本研究对比多智能体流水线与自我优化方法,发现针对本地7B模型,两次调用自我优化在GSM8K表现更优且令牌用量低,经任务感知重设计后在HumanEval也能维持高准确率,简单方法优于多智能体架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26831 2026-07-30 cs.CL 新提交 85%

Language Models are not Equally Robust to Non-Canonical Tokenization across Languages

语言模型对跨语言非规范分词的鲁棒性存在差异

Poulami Ghosh, Preethi Jyothi

机构 * IIT Bombay(印度理工学院孟买分校)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究发现语言模型对非规范分词的鲁棒性因语言而异,Llama-3.1-8B等模型在高碎片化语言中性能下降,LoRA微调可有效缓解分词敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27146 2026-07-30 cs.SE cs.CL cs.LG 新提交 85%

MindForge: Teaching Small Language Models Whole-Life-Cycle Software Engineering via Source-Free Program Synthesis

MindForge:通过无源码程序合成教小型语言模型全生命周期软件工程

Yihao Chen, Shi Chang, Khaled Chawa, Feng Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

专题命中 指令微调 :language model(title);small language model(title);分类 cs.CL、cs.LG

AI总结 研究针对小型语言模型从零构建程序的挑战,提出MindForge构建全生命周期无源码训练环境,微调Qwen3.6-27B后在ProgramBench及7个软件工程基准上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26596 2026-07-30 cs.CV cs.AI 新提交 84%

Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution

解耦视觉处理:通过模态特定Transformer替换实现高效多模态适配

Mingkuan Feng, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 该研究针对多模态大语言模型视觉指令微调成本高的问题,提出解耦视觉处理框架,替换预训练大语言模型上层解码器为轻量Transformer块,仅训练该块即可在多个基准上实现竞争力性能,降低了计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26358 2026-07-30 cs.LG cs.AI cs.GT 新提交 81%

Post-Training at the Edge of Detectability: A Game-Theoretic Approach to Fine-Tuning

可检测边界处的后训练:一种用于微调的博弈论方法

Keegan Harris, Brian W. Lee, Ian Waudby-Smith, Philip Amortila, Nika Haghtalab, Michael I. Jordan

机构 * University of California, Berkeley(加州大学伯克利分校) Inria(法国国家信息与自动化研究所) École Normale Supérieure(巴黎高等师范学院)

专题命中 指令微调 :post-training(title);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出博弈论框架解决RL微调中KL正则化系数设置问题,将均衡系数归约为KL正则化RL目标,在Qwen3-8B等模型实验中实现良好奖励-保留权衡,可用于审计开源模型API提供商。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26893 2026-07-30 cs.IR 新提交 80%

Beyond Action Imitation: Learning a Decision-Aware User Simulator for Online Advertising

超越动作模仿:面向在线广告的决策感知用户模拟器学习

Zipeng Chen, Jiaer Zheng, Xiangyang Xu, Xinyu Lin, Zhaobin Wang, Zhaohui Liu, Qianjin Xiang, Xiaoyu Zhao, Zhuozhen Yu, Guangshuo Wang, Daxing Chen, Junwei Pan, Zhangbin Zhu, Chengguo Yin, Hao Chen, Tat-Seng Chua, Haijie Gu, Jie Jiang

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 针对现有用户模拟器仅基于单领域交互模仿动作的缺陷,本文提出决策感知用户模拟器DASH,通过上下文工程、蒸馏思考轨迹与定制规则奖励模型,在腾讯广告数据上验证了其多维度优势。

Comments 23 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26618 2026-07-30 cs.LG cs.CL 新提交 73%

FedWeave: Rethinking the Unit of Specialization in Heterogeneous Federated MoE-LoRA

FedWeave:重新思考异构联邦MoE-LoRA中的专业化单元

Donghang Duan, Xu Zheng, Lizong Zhang, Chong Mu, Meng Han

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 FedWeave针对异构联邦MoE-LoRA中客户端粒度专业化的局限,提出非对称聚合框架,分离专家聚合与路由优化,在异构多任务基准上优于强基线,实现高效联邦大模型适配。

Comments 14 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26928 2026-07-30 cs.CL 新提交 70%

Latent-IM: Latent Interaction Management for Speech LLMs

Latent-IM:面向语音大语言模型的潜在交互管理

Adar Avsian, Atahan Dokme, Tony Woo, Larry Heck

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对语音大语言模型提出Latent-IM框架,将对话动作控制分为选择与实现两个耦合问题,可提升对话动作准确率12.5个百分点,性能与微调相当。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 9 篇

2607.26515 2026-07-30 cs.LG cs.AI 新提交 91%

HiFloat4 Format for End-To-End Reinforcement Learning Post-Training of Large Language Models

用于大语言模型端到端强化学习后训练的HiFloat4格式

Hei Yi Mak, Shadan Golestan, Hoang Le, Mehran Taghian Jazi, Yunke Peng, Yaoyuan Wang, Yao Wang, Junsong Wang, Tianchi Hu, Fengchen He, Guipeng Hu, Tanzila Rahman, Anandharaju Durai Raju

机构 * Huawei(华为)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(title);language model(title);pretraining(abstract)

AI总结 本文提出首个端到端FP4 RL后训练方案,通过HiFloat4格式与Rollout-ResQ技术,将FP4 RL与BF16的准确率差距大幅缩小,使全量化FP4 RL接近全精度水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26981 2026-07-30 cs.CL 新提交 91%

OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment

OptimismBench:语言模型判断中的偏差预测与对齐效应

Seonglae Cho, Adriano Koshiyama

机构 * Holistic AI(整体人工智能公司) University College London(伦敦大学学院)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 本研究推出OptimismBench基准,检测到多数LLM存在乐观方向偏差,且对齐会使模型概率产生偏差,下游流程会默认继承该偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26094 2026-07-30 cs.LG cs.CL 新提交 87%

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback

用于人类反馈强化学习的元学习奖励塑形

Yunpeng Chu

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 MeRLa是元学习的任务感知奖励塑形框架,在RLHF训练前通过辅助任务元学习塑形函数,可提升LLaMA-3-8B在多基准上的对齐性能,降低训练不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26115 2026-07-30 cs.CR cs.AI cs.CL cs.LG 新提交 86%

GPT-Red: Automated Red Teaming via Self-Play at Scale

GPT-Red:基于大规模自博弈的自动化红队测试

Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal, Sam Toyer, Dylan Hunn, Stephanie Lin, Yuxin Wen, Xiangyu Qi, Christopher Wolff, Zizhao Wang, Milad Nasr, Sicheng Zhu, Chuan Guo, Juan Felipe Cerón Uribe, Kaiwen Wang, Aiden Low, Kai Xiao, Kai Chen

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出GPT-Red,一种基于大规模自博弈的自动化红队测试智能体,可发现新型提示注入攻击、攻破过往模型且泛化能力强,用于提升LLM鲁棒性并形成自我改进飞轮。

Comments 28 pages.13 main pages and 13 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27182 2026-07-30 cs.HC 新提交 83%

GraphQAG: A Knowledge-Graph-Guided Visual Analytics Framework for Question-Answer Pairs Generation

GraphQAG:一种用于问答对生成的知识图谱引导型可视分析框架

Yize Li, Ruiqi Yu, Tianya Pan, Ningxin Li, Songyue Li, Xiangyang Wu, Jinchang Li, Zhiguang Zhou

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究针对长文档知识碎片化的问题,提出GraphQAG知识图谱引导型可视分析框架,经评估可帮助用户优化问答对集合,提升问答对的全面性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26862 2026-07-30 cs.LG cs.AI 新提交 73%

ReCo: Reweighting GRPO Against Distributional Concentration

ReCo:针对分布集中问题的GRPO重加权方法

Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO过度关注高概率响应导致推理覆盖度下降的问题,提出ReCo重加权方法,在多个数学推理基准上提升了大k值下的Pass@k表现。

详情

展开后加载摘要…

URL PDF HTML 收藏