arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-22 至 2026-07-22 共收录 143 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12 篇

2607.18268 2026-07-22 cs.AI 新提交 92%

Fence: Specialized SLM Guardrails for LLM Applications

Fence:用于大语言模型应用的专用小型语言模型护栏

Kumud Lakara, Ruibo Shi, Fran Silavong

机构 * JPMorgan(摩根大通)

专题命中 预训练与数据 :LLM(title,abstract);SLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究使用闭源大语言模型的实际应用的安全措施问题,提出用在合成数据上训练的小型语言模型作专用护栏,引入受GAN启发的合成数据生成方法,实验证明该方法训练的护栏比基于提示的性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18927 2026-07-22 cs.AI 新提交 88%

OntoBook: Ontology-Grounded Synthetic Textbooks for Medical Encoder Pretraining

OntoBook:用于医学编码器预训练的基于本体的合成教科书

Rian Touchent, Éric de la Clergerie

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract,journal_ref);language model(abstract,journal_ref);LLM(abstract)

AI总结 研究提出OntoBook方法,将医学本体结构转为预训练信号,经随机游走、大语言模型重述等三阶段,用生成文本训练法语编码器,在多基准测试中有显著改进,强调目标对齐必要,还发布了相关教科书与模型检查点。

Journal ref Proceedings of Knowledge Graphs and Large Language Models Workshop, May 2026, Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18413 2026-07-22 cs.CL 新提交 88%

Convolution for Large Language Models

大语言模型中的卷积

Yuchuan Tian, Yingte Shu, Wei He, Shuo Zhang, Tianchen Zhao, Chao Xu, Xinghao Chen, Yunhe Wang, Hanting Chen, Yu Wang

机构 * Peking University(北京大学) Huawei Technologies(华为技术有限公司) Tsinghua University(清华大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究大语言模型中,轻量级深度卷积能否在不大幅增模型大小的情况下提供局部归纳偏差。通过实验发现特定位置应用卷积效果最佳,采用特定残差深度卷积设计,在多个模型和数据预算下提升了下游基准平均准确率,支持其作为自注意力补充建模短程交互。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19104 2026-07-22 cs.SE cs.AI 新提交 81%

SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

SciCodePile:用于具有挑战性的科学代码生成的128GB语料库和可执行基准测试

Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

机构 * Singapore Management University(新加坡管理大学) Nanjing University(南京大学) SUN YAT-SEN University(孙中山大学) Home Team Science & Technology Agency(家庭团队科技局)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 研究大型语言模型处理科学代码的能力,提出SciCodePile语料库及可执行基准测试,评估15个模型在三项任务上的表现,发现科学代码生成极具挑战,同时展示了该语料库在训练上的效用,代码和数据可获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18424 2026-07-22 cs.CY cs.CL 新提交 81%

Enabling Multilingual Privacy Policy Audits: Large-Scale Analysis of Spanish Mobile Apps

实现多语言隐私政策审计:对西班牙移动应用的大规模分析

Marcos Moran, David Rodriguez, Luka Nenadic, Norman Sadeh, Jose M. Del Alamo

机构 * ETH Zurich(苏黎世联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多语言环境下隐私政策审计,利用大语言模型构建跨语言分类器,通过对西班牙谷歌应用商店应用的大规模审计,发现公共部门与商业应用语言使用差异及声明与实际做法的差异,揭示仅英语审计掩盖透明度差距的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19198 2026-07-22 cond-mat.mtrl-sci cs.LG physics.comp-ph 新提交 81%

ATLAS: A Foundation Neural Sampler for Amorphous Materials

ATLAS:一种用于非晶材料的基础神经采样器

Mouyang Cheng, Denis Blessing, Botao Yu, Gerhard Neumann, Mingda Li, Carles Domingo-Enrich, Yuanqi Du

机构 * Microsoft Research New England(微软研究院新英格兰分部) Center for Computational Science and Engineering(计算科学与工程中心) MIT(麻省理工学院) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Department of Materials Science and Engineering(材料科学与工程系) Department of Computer Science and Engineering(计算机科学与工程系) OSU(俄亥俄州立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 研究针对非晶材料能量景观难采样问题,提出ATLAS神经采样器,由等变图神经网络参数化,能跨系统泛化,利用扩散过程时间反转估计热力学量。在多种系统中验证有效性,还通过预训练降低逆设计成本,结合大语言模型搜索高熵金属玻璃,确立其为基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19072 2026-07-22 cs.AI 新提交 79%

On the Effectiveness of Pretraining for Graph Combinatorial Optimization

关于图组合优化预训练的有效性

David Aguado, Daniel Fuertes, Carlos R. del-Blanco, Fernando Jaureguizar

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 研究图组合优化的预训练有效性,提出自监督预训练框架,利用图对比学习和几何增强,使模型学习不变表示与距离分布,实验表明该策略优于未预训练模型,混合策略在TSP1000上有显著提升。

Comments This work was accepted to be presented at the Graph Signal Processing Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18445 2026-07-22 cs.CR cs.AI 新提交 74%

ChainMark: Model-Free LLM Watermarking with Closed-Form Calibration

ChainMark:具有闭式校准的无模型大语言模型水印

Chengheng Li-Chen, Kyuhee Kim

专题命中 预训练与数据 :LLM(title);分类 cs.AI

AI总结 研究针对合成文本标记需求,提出ChainMark无模型大语言模型水印方法,通过特定方式划分词汇表状态并强制马尔可夫转移,检测器无需访问语言模型,推导相关闭式,证明鲁棒性阈值,在多模型和领域中优于其他方法,可恢复目标误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18358 2026-07-22 cs.CL cs.LG 新提交 73%

A Classifier That Teaches Itself: Self-Improving, Frozen-gate Training (SIFT) for Dynamic Document Classification

一种自学分类器:用于动态文档分类的自我改进冻结门训练(SIFT)

Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究针对企业文档分类难题,提出SIFT动态分类器服务,通过低成本管道、特定机制及判断反馈实现自我改进,解决标注和安全问题,介绍其架构、机制及部署示例,探讨边际标注成本趋零的经济性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18756 2026-07-22 cs.IR cs.CL 新提交 57%

RAGAL: A Frugal, Fully Local Retrieval-Augmented Assistant for Technical Support at a Government Agency

RAGAL:政府机构技术支持的节俭型全本地检索增强助手

Dan Musetoiu

机构 * IT Department, Agency for Financing Rural Investments (AFIR)(金融农村投资机构信息部)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 针对公共机构数据不能流出的限制,开发RAGAL检索增强助手。在特定语料库上验证,检索工程和微调效果好,记录单域微调问题及解决方法,还有两个发现和全嵌入器微调方法,最后介绍零流出下的替代评判方案并开源脚本。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19115 2026-07-22 cs.CV 新提交 50%

CR-Refiner: An Object-Centric Optimal Transport Reranker for Edit-Conditioned 3D Scene Retrieval

CR-Refiner:用于编辑条件3D场景检索的以对象为中心的最优传输重排器

Hao Wu, Jinjing Zhu, Nanyu Wu, Qianyi Cai, Heyi Lin, Hao Wang, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 预训练与数据 :LLM(abstract)

AI总结 研究编辑条件3D场景检索问题,提出CR-Refiner重排器,通过冻结语言模型解析编辑、不平衡最优传输问题评分候选对象、轴条件结构先验及语言模型验证器细化结果,在不同基础检索器上提升了硬子集检索指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18576 2026-07-22 cs.CV 新提交 50%

Text-conditioned Segmentation for Tomato Phenotyping via Procedural Synthetic Data

通过程序合成数据实现番茄表型的文本条件分割

Samy Mounir, Mikolaj Cieslak, Najmeddine Dhieb, Hakim Ghazzai, Jonathan Klein, Katja Froehlich, Soeren Pirk, Wojciech Palubicki, Gianluca Setti, Ahmed M. Eltawil, Dominik L. Michels

机构 * Computer, Electrical and Mathematical Sciences and Engineering Division, KAUST(计算机、电气与数学科学与工程系,沙特阿卜杜拉国王科技大学) Department of Computer Science, University of Calgary(卡尔加里大学计算机科学系) Department of Computer Science, Kiel University(基尔大学计算机科学系) Department of Artificial Intelligence, Adam Mickiewicz University(亚当·密茨凯维奇大学人工智能系) Department of Electronics and Telecommunications, Polytechnic University of Turin(都灵理工大学电子与电信系)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 研究针对温室作物表型分析中缺乏标注数据问题,提出结合合成数据生成与基础模型微调的框架,通过对商业樱桃番茄温室建模生成合成数据集,微调SAM 3,显著提升分割性能,还公开相关模型与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 12 篇

2607.18772 2026-07-22 cs.CL 新提交 91%

RF-Agent: A Practical Framework for Building Language Agents for RFIC Design

RF-Agent:用于构建射频集成电路设计语言代理的实用框架

Yueqi Xing, Houbo He, Jolie Wang, Erin Ni, Shikai Wang, Qiufeng Li, Weidong Cao, Taiyun Chi

机构 * Rice University(莱斯大学) The George Washington University(乔治·华盛顿大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language agent(title);LLM(abstract,comments);large language model(abstract)

AI总结 针对大语言模型在射频电路设计应用受限问题,提出RF-Agent框架,通过教科书驱动知识蒸馏创建数据集及基准,研究监督微调与检索增强生成策略,发现特定领域SFT对中小模型提升大,语义检索的RAG表现最佳,为相关工作提供基础。

Comments Accepted at ICLAD (IEEE International Conference on LLM-Aided Design), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18481 2026-07-22 cs.CL cs.IR 新提交 89%

Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning

搜索图-R1:使用强化学习训练大型语言模型以搜索知识图谱

Jia Ao Sun, Hao Yu, Fengran Mo, Zhan Su, Yuchen Hui, Bang Liu, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学) Mila – Québec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) Halmstad University College(哈尔姆斯塔德大学学院)

专题命中 指令微调 :large language model(title);language model(title);SFT(abstract,abstract_cn);LLM(abstract)

AI总结 研究针对知识图谱问答部署成本高的问题,提出搜索图-R1,通过监督微调与强化学习,将导航内化到8B模型。核心是用黄金SPARQL查询搭建教师遍历答案路径。该模型在多个数据集上超越前沿语言模型,推理无需辅助模块,训练无需语言模型评判,且训练阶段互补,可跨模型家族迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18960 2026-07-22 cs.LG cs.AI cs.CR 新提交 89%

SFGA: A Statistics-First Gating Architecture with Adjudicative Escalation for Trustworthy SFT Data Procurement

SFGA:一种用于可信SFT数据采购的具有裁决升级的统计优先门控架构

Arther Tian, Alex Ding, Simon Wu, Aaron Chan

机构 * DGrid AI(DGrid人工智能)

专题命中 指令微调 :SFT(title,title_cn);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究如何采购监督微调数据,提出统计优先门控架构SFGA,将采购视为成本感知路由问题,经实验在准确率、F1值和成本上取得良好平衡,还报告辩论路径负面诊断,为测量和校准构建合成基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18691 2026-07-22 cs.AI cs.CL 新提交 88%

Semantic Primes as Explanans for Emotion in Large Language Models

语义原素作为大语言模型中情感的解释因素

Frank Xing

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型中情感的解释问题,通过在四个指令微调的LLMs上实验,发现自然语义元语言的语义原素是可恢复的内部元素,能更有效控制情感,且与相应情感可互换,是比其他选项更好的情感解释因素。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18266 2026-07-22 cs.AI 新提交 88%

Structured Synthetic Reasoning Data for Arithmetic Fine-Tuning of Small Language Models

用于小型语言模型算术微调的结构化合成推理数据

Jake O'Grady, Effirul Ramlan

机构 * University of Galway(戈尔韦大学) School of Computer Science(计算机科学学院)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);分类 cs.AI

AI总结 研究小型语言模型多步算术推理困难问题,通过生成结构化合成推理数据并结合LoRA在消费硬件上微调Qwen3模型,提高了模型在GSM8K等基准测试上的准确率和迁移效果,证明低成本合成数据设计可改善小型语言模型算术适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18293 2026-07-22 cs.LG cs.CL 新提交 82%

One Student, Many Teachers: Multi-Task On-Policy Distillation via Soft-Prompt Privileged Context

一个学生,多个教师:通过软提示特权上下文进行多任务在线策略蒸馏

Yingzi Ma, Zichen Zhu, Ming Jiang, Chaowei Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究提出一种多任务在线策略蒸馏方法,教师与学生仅通过可学习软提示区分,在骨干冻结时训练特定任务教师。单任务变体训练参数少且效果好,多任务变体保持通用能力基准同时实现最佳总体平均水平。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18958 2026-07-22 cs.CV cs.AI 新提交 79%

Dual Adversarial Fine-tuning for Enhancing Robustness of Large Vision Language Model

用于增强大型视觉语言模型鲁棒性的对偶对抗微调

Sibo Wang, Jie Zhang, Shiguang Shan, Xilin Chen, Wen Gao

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

AI总结 针对大型视觉语言模型视觉输入易受攻击且现有防御方法缺乏通用性的问题,提出对偶对抗微调框架,通过联合优化视觉和语义监督信号增强模型鲁棒性,实验证明该方法在多任务对抗鲁棒性评估中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18283 2026-07-22 cs.LG cs.AI cs.CV 新提交 76%

FedCC: A Low-Resource Federated Adaptation of Foundation Models for Robust Corpus Callosum localization in Fetal Ultrasound Images

FedCC:用于胎儿超声图像中胼胝体稳健定位的基础模型低资源联邦适应

Alessandro Di Matteo, Sara Moccia, Giuseppe Rizzo, Gianpaolo Grisolia, Ricciarda Raffaelli, Lorenzo Vasciaveo, Francesco D'Antonio, Maria Chiara Fiorentino

机构 * unich(那不勒斯费德里克二世大学)

专题命中 指令微调 :foundation model(title);分类 cs.AI、cs.LG

AI总结 针对胎儿超声图像中胼胝体定位难题,提出FedCC框架,集成冻结的DINOv2主干与轻量级YOLO检测头,并引入LoRA模块。在多中心数据集上评估,该框架性能出色,减少了可训练参数与通信成本,迈向可临床部署的胎儿神经超声AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18718 2026-07-22 eess.AS 新提交 75%

Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering

DCASE 2026任务5总结:音频相关问答

Haolin He, Renhe Sun, Zheqi Dai, Xingjian Du, Chunyat Wu, Zining Liang, Zhengxi Liu, Jiahe Lei, Runbang Wang, Jiayi Zhou, Mingru Yang, Xiquan Li, Yun Chen, Xie Chen, Zhiyao Duan, Weiqiang Wang, Mark D. Plumbley, Jian Liu, Qiuqiang Kong

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 DCASE 2026任务5聚焦音频相关问答,用音频依赖过滤管道构建评估集。比赛分两轨道,众多团队参与。成均馆大学团队取得较好成绩,还分析了常见构建模块、测试方法及各系统普遍遗漏的项目。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18271 2026-07-22 cs.AI 新提交 70%

Using LLMs for Explainable, Data-Driven Insight Generation from Time Series

使用大语言模型从时间序列中生成可解释的、数据驱动的见解

Ria Mundhra, Gustavo Sato dos Santos, Michael Benedikt

机构 * University of Oxford(牛津大学) Vortexa

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对时间序列预测中解释生成难且易幻觉的问题,提出领域无关框架,含提取解释因素、基于证据生成解释及可扩展评估三组件,经案例研究验证,该框架能大规模实现有根据的解释生成,无需特定领域微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18570 2026-07-22 cs.CL cs.AI 新提交 62%

For What Reason? Interpreting Models' Encoding of Causation and Antithesis

出于什么原因?解释模型对因果关系和对立关系的编码

Abhidip Bhattacharyya, Shira Wein

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of South Florida(南佛罗里达大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究指令微调的Transformer模型对英语话语关系的编码,聚焦因果和对立关系。通过下一个token预测任务及可解释性技术,发现早期层在序列中间做预测,中层接近末尾确定决策,部分层有答案偏好,揭示话语推理的不对称表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19339 2026-07-22 cs.CV 新提交 50%

OmniReasoner: Thinking with Long Audio-Video via Native Tool Use

OmniReasoner:通过原生工具使用进行长音频-视频推理

Yu Chen, Caorui Li, Ziyu Xiong, Yidong Wang, Mingqi Gao, Shuman Liu, Biao Liu, Chunfeng Yang, Anxiang Zeng, Haibo Zhang, Chaofan Chen

专题命中 指令微调 :post-training(abstract)

AI总结 针对长音频-视频推理难题,OmniReasoner提出工具使用后训练框架,通过监督微调与强化学习让全模态语言模型学会调用放大工具,利用TimeAnchor保持时间参数一致性,借助时间增强数据引擎实现可训练,提升了答案准确性与时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 8 篇

2607.18258 2026-07-22 cs.AI 新提交 90%

S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF

S2T-RLHF:基于稳定偏好的强化学习从人类反馈中的分层信用分配

Wei Chen, Guanghui Zhu, Yafei Li, Limin Wang, Yihua Huang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)

专题命中 后训练与偏好优化 :RLHF(title,title_cn);分类 cs.AI

AI总结 研究基于偏好奖励模型的RLHF训练不稳定问题,提出分层信用分配的粒度感知原则,引入S2T-RLHF框架,先在句子间分配奖励,再在句内细化,无需重新训练模型,实验证明该方法提高了训练稳定性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18304 2026-07-22 cs.LG 新提交 85%

TD-DPO: Difference-Aware Preference Optimization for Mitigating Sycophancy in Clinical Autism Intervention Dialogue

TD-DPO:用于减轻临床自闭症干预对话中谄媚行为的差异感知偏好优化

Shuzhong Lai, Junhong Lai, Chenxi Li, Qing Zhou, Haifeng Li, Gang Pan, Lin Yao, Yueming Wang

机构 * Nanhu Brain-Computer Interface Institute(南湖脑机接口研究所) MOE Frontiers Science Center for Brain and Brain-Machine Integration, Zhejiang University(浙江大学脑与脑机融合教育部前沿科学中心) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Children’s Hospital Zhejiang University School of Medicine(浙江大学医学院附属儿童医院) State Key Laboratory of Brain-Machine Intelligence(脑机智能技术国家重点实验室) Department of Neurobiology, Affiliated Mental Health Center and Hangzhou Seventh People’s Hospital, Zhejiang University School of Medicine(浙江大学医学院附属精神卫生中心和杭州市第七人民医院神经生物学系)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对大语言模型在自闭症干预对话中的谄媚问题,提出最小编辑数据增强策略及令牌级差异直接偏好优化方法,通过加权差异令牌、降权共享令牌抑制背景漂移,经实验验证该方法能在减轻谄媚与保留干预能力间达较好平衡。

Comments commited to EMNLP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18476 2026-07-22 cs.CL cs.AI cs.LG 新提交 85%

Structured Output Collapses Answer Diversity Across 44 Language Models

结构化输出会削弱44种语言模型的答案多样性

Tapan Parikh

机构 * Cornell Tech(康奈尔理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究语言模型在特定格式要求下答案多样性变化,通过对44个模型进行31个类别提示实验,发现结构化输出使答案收敛、多样性降低,存在寄存器梯度,揭示了模型对不同格式的响应差异及对答案多样性的影响。

Comments 12 pages, 1 figure. Companion to the One-Word Census (arXiv:2607.12796). Code, data, and interactive explorer: https://github.com/tap2k/modelun/tree/main/studies/structured

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19243 2026-07-22 cs.CL cs.AI 新提交 82%

Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs

大语言模型中跨语言事实一致性的推理时引导

Alexander Manev

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);prompting(abstract)

AI总结 研究大语言模型跨语言事实不一致问题,评估零样本上下文引导、CAA、DPO四种干预策略,通过实验发现角色提示是最强干预方式,CAA对配置敏感,DPO适配器收益窄且可转移性低,表明跨语言不一致部分是选择问题,简单干预可能更优。

Comments 8 pages (21 in total), 2 figures, 4 tables. Original manuscript for a Guided Research project conducted at the Technical University of Munich, detailing the complete methodology, full data pipeline, and comprehensive experimental results. A related, condensed subset of this work was subsequently adapted and published at the StereACuLT 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19331 2026-07-22 cs.LG cs.AI 新提交 73%

ISO: An RLVR-Native Optimization Stack

ISO:一种原生 RLVR 的优化栈

Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David González-Martínez, Xiaoxia Wu, Yuandong Tian, Shiwei Liu, David Z. Pan, Zhangyang "Atlas" Wang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) UIUC(伊利诺伊大学香槟分校) Emory University(埃默里大学) Together AI(联合人工智能公司) Recursive Superintelligence Inc(递归超级智能公司) ELLIS Institute Tübingen(图宾根埃利斯研究所)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究 RLVR 中缺失的优化层,提出等谱优化(ISO)框架,包括离线的 ISO-Merger 和在线的 ISO-Optimizer。通过光谱继承,在推理和编码任务中,用更少训练步骤提高准确率,为 RLVR 优化层问题提供了具体解决方案。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19313 2026-07-22 cs.LG cs.AI 新提交 73%

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

脱离上下文的广义信赖域策略优化算法:利用特权信息学习解决难题

Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

机构 * Meta AI Columbia University(哥伦比亚大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究利用特权信息解决强化学习难题,提出脱离上下文的广义信赖域策略优化算法(OC - GRPO),通过引导展开和重要性校正目标避免训练不匹配,在标准数学推理基准上比普通GRPO有显著提升且成本低。

Comments 24 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏