arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-22 至 2026-07-22 共收录 251 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 23 篇

2607.18268 2026-07-22 cs.AI 新提交 92%

Fence: Specialized SLM Guardrails for LLM Applications

Fence:用于大语言模型应用的专用小型语言模型护栏

Kumud Lakara, Ruibo Shi, Fran Silavong

机构 * JPMorgan(摩根大通)

专题命中 预训练与数据 :LLM(title,abstract);SLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究使用闭源大语言模型的实际应用的安全措施问题,提出用在合成数据上训练的小型语言模型作专用护栏,引入受GAN启发的合成数据生成方法,实验证明该方法训练的护栏比基于提示的性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20128 2026-07-22 cs.SE cs.DC cs.LG 版本更新 90%

The Correctness Illusion in LLM-Generated GPU Kernels

LLM生成的GPU内核中的正确性错觉

Dipankar Sarkar

机构 * Arizona State University, USA(亚利桑那州立大学)

专题命中 预训练与数据 :LLM(title,title_cn);分类 cs.LG

AI总结 通过高精度CPU参考和操作模式感知的模糊测试,发现现有基准测试中基于固定形状的allclose检查无法检测LLM风格的转录错误,提出一种新协议并验证其有效性。

Comments 10 pages, 2 figures, LNCS format. Companion papers to follow on arXiv next week; IDs will be added in a v2 replace

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18927 2026-07-22 cs.AI 新提交 88%

OntoBook: Ontology-Grounded Synthetic Textbooks for Medical Encoder Pretraining

OntoBook:用于医学编码器预训练的基于本体的合成教科书

Rian Touchent, Éric de la Clergerie

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract,journal_ref);language model(abstract,journal_ref);LLM(abstract)

AI总结 研究提出OntoBook方法,将医学本体结构转为预训练信号,经随机游走、大语言模型重述等三阶段,用生成文本训练法语编码器,在多基准测试中有显著改进,强调目标对齐必要,还发布了相关教科书与模型检查点。

Journal ref Proceedings of Knowledge Graphs and Large Language Models Workshop, May 2026, Palma de Mallorca, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18413 2026-07-22 cs.CL 新提交 88%

Convolution for Large Language Models

大语言模型中的卷积

Yuchuan Tian, Yingte Shu, Wei He, Shuo Zhang, Tianchen Zhao, Chao Xu, Xinghao Chen, Yunhe Wang, Hanting Chen, Yu Wang

机构 * Peking University(北京大学) Huawei Technologies(华为技术有限公司) Tsinghua University(清华大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究大语言模型中,轻量级深度卷积能否在不大幅增模型大小的情况下提供局部归纳偏差。通过实验发现特定位置应用卷积效果最佳,采用特定残差深度卷积设计,在多个模型和数据预算下提升了下游基准平均准确率,支持其作为自注意力补充建模短程交互。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19104 2026-07-22 cs.SE cs.AI 新提交 81%

SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

SciCodePile:用于具有挑战性的科学代码生成的128GB语料库和可执行基准测试

Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

机构 * Singapore Management University(新加坡管理大学) Nanjing University(南京大学) SUN YAT-SEN University(孙中山大学) Home Team Science & Technology Agency(家庭团队科技局)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 研究大型语言模型处理科学代码的能力,提出SciCodePile语料库及可执行基准测试,评估15个模型在三项任务上的表现,发现科学代码生成极具挑战,同时展示了该语料库在训练上的效用,代码和数据可获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18424 2026-07-22 cs.CY cs.CL 新提交 81%

Enabling Multilingual Privacy Policy Audits: Large-Scale Analysis of Spanish Mobile Apps

实现多语言隐私政策审计:对西班牙移动应用的大规模分析

Marcos Moran, David Rodriguez, Luka Nenadic, Norman Sadeh, Jose M. Del Alamo

机构 * ETH Zurich(苏黎世联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多语言环境下隐私政策审计,利用大语言模型构建跨语言分类器,通过对西班牙谷歌应用商店应用的大规模审计,发现公共部门与商业应用语言使用差异及声明与实际做法的差异,揭示仅英语审计掩盖透明度差距的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19198 2026-07-22 cond-mat.mtrl-sci cs.LG physics.comp-ph 新提交 81%

ATLAS: A Foundation Neural Sampler for Amorphous Materials

ATLAS:一种用于非晶材料的基础神经采样器

Mouyang Cheng, Denis Blessing, Botao Yu, Gerhard Neumann, Mingda Li, Carles Domingo-Enrich, Yuanqi Du

机构 * Microsoft Research New England(微软研究院新英格兰分部) Center for Computational Science and Engineering(计算科学与工程中心) MIT(麻省理工学院) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Department of Materials Science and Engineering(材料科学与工程系) Department of Computer Science and Engineering(计算机科学与工程系) OSU(俄亥俄州立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 研究针对非晶材料能量景观难采样问题,提出ATLAS神经采样器,由等变图神经网络参数化,能跨系统泛化,利用扩散过程时间反转估计热力学量。在多种系统中验证有效性,还通过预训练降低逆设计成本,结合大语言模型搜索高熵金属玻璃,确立其为基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19072 2026-07-22 cs.AI 新提交 79%

On the Effectiveness of Pretraining for Graph Combinatorial Optimization

关于图组合优化预训练的有效性

David Aguado, Daniel Fuertes, Carlos R. del-Blanco, Fernando Jaureguizar

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 研究图组合优化的预训练有效性,提出自监督预训练框架,利用图对比学习和几何增强,使模型学习不变表示与距离分布,实验表明该策略优于未预训练模型,混合策略在TSP1000上有显著提升。

Comments This work was accepted to be presented at the Graph Signal Processing Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27039 2026-07-22 cs.CL 版本更新 79%

Length Value Model: Scalable Value Pretraining for Token-Level Length Modeling

长度值模型:用于令牌级长度建模的可扩展值预训练

Zhen Zhang, Changyi Yang, Zijie Xia, Zhen Yang, Chengzhi Liu, Zhaotiao Weng, Yepeng Liu, Haobo Chen, Jin Pan, Chenyang Zhao, Yuheng Bu, Alkesh Patel, Zhe Gan, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校) Carnegie Mellon University(卡内基梅隆大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) LMSYS Org(LMSYS组织) Apple Inc.(苹果公司)

专题命中 预训练与数据 :pretraining(title);prompting(abstract);分类 cs.CL

AI总结 本文提出Length Value Model,通过令牌级建模实现高效的长度预测,提升生成长度的准确性和效率,实验显示其在多个任务中优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15280 2026-07-22 cs.CV cs.AI 版本更新 79%

Why Do Vision Language Models Struggle To Recognize Human Emotions?

为什么视觉语言模型难以识别人类情绪?

Madhav Agarwal, Sotirios A. Tsaftaris, Laura Sevilla-Lara, Steven McDonagh

机构 * The University of Edinburgh, UK(爱丁堡大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.AI

AI总结 本文探讨视觉语言模型在识别人类情绪上的不足,指出面部表情识别任务的连续性和动态性导致模型存在连续性和时间信息处理的漏洞,提出改进采样策略和多阶段上下文增强方法以提升情绪识别能力。

Comments European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18445 2026-07-22 cs.CR cs.AI 新提交 74%

ChainMark: Model-Free LLM Watermarking with Closed-Form Calibration

ChainMark:具有闭式校准的无模型大语言模型水印

Chengheng Li-Chen, Kyuhee Kim

专题命中 预训练与数据 :LLM(title);分类 cs.AI

AI总结 研究针对合成文本标记需求,提出ChainMark无模型大语言模型水印方法,通过特定方式划分词汇表状态并强制马尔可夫转移,检测器无需访问语言模型,推导相关闭式,证明鲁棒性阈值,在多模型和领域中优于其他方法,可恢复目标误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18358 2026-07-22 cs.CL cs.LG 新提交 73%

A Classifier That Teaches Itself: Self-Improving, Frozen-gate Training (SIFT) for Dynamic Document Classification

一种自学分类器:用于动态文档分类的自我改进冻结门训练(SIFT)

Bogdan Raduta, Horia Velicu, Alexandru Preda, Serban Chiricescu

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究针对企业文档分类难题,提出SIFT动态分类器服务,通过低成本管道、特定机制及判断反馈实现自我改进,解决标注和安全问题,介绍其架构、机制及部署示例,探讨边际标注成本趋零的经济性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16952 2026-07-22 cs.LG cs.AI stat.AP stat.ME stat.ML 版本更新 73%

Phantoms and Disclosures: A Statistical Framework for Auditing Privacy in Synthetic Data

幻象与披露:合成数据审计的因果框架

Kareem Amin, Rudrajit Das, Alessandro Epasto, Adel Javanmard, Dennis Kraft, Mónica Ribero, Sergei Vassilvitskii

机构 * Google(谷歌) University of Southern California(南加州大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一个可定制的实证审计框架,通过区分真实披露与幻象披露,利用统计假设检验检测合成数据中的隐私泄露,无需模型访问或参考模型,提供比先前方法更紧的隐私泄露下界。

Comments 35 pages, 10 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16228 2026-07-22 cs.LG cs.MS 版本更新 70%

Operator-Aware Mixed-Precision Tolerance Calibration for Tensor Kernels

张量内核的算子感知混合精度容差校准

Dipankar Sarkar

机构 * Arizona State University(亚利桑那州立大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究张量内核正确性测试的容差校准问题,通过挖掘测试用例误差分布提出新容差,经实验,对特定错误变体校准容差提高了错误检测召回率,虽有少量误报增加,但整体提升了检测效果。

Comments 8 pages, 1 figure, LNCS format. Companion paper: arXiv:2606.20128 (P1)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07055 2026-07-22 cs.AI 版本更新 70%

Dr. Zero: Self-Evolving Search Agents without Training Data

零博士:无需训练数据的自我进化搜索智能体

Zhenrui Yue, Kartikeya Upasani, Xianjun Yang, Suyu Ge, Shaoliang Nie, Yuning Mao, Zhe Liu, Dong Wang

机构 * Meta Superintelligence Labs(Meta超级智能实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究在高质量数据难获取时智能体自我进化问题,提出零博士框架,通过自我进化反馈循环和HRPO方法,使搜索智能体无需训练数据自我进化,在问答基准测试中表现出色,证明可仅通过自我进化实现强大智能搜索和推理。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08716 2026-07-22 cs.CV 版本更新 67%

Great X: A Unified Multi-Modal Simulator Bridging the Sim2Real Gap for 6G

Great X:一种统一的多模态模拟器,弥合6G的模拟与现实差距

Yuan Gao, Kongwu Huang, Jun Jiang, Shiyi Mu, Shugong Xu

机构 * Shanghai University(上海大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 预训练与数据 :LLM(abstract);foundation model(abstract)

AI总结 针对6G无线研究中多模态数据集收集难题及现有模拟器不足,提出在虚幻引擎实现统一单引擎模拟器Great-X,集成光线追踪等技术,构建含大量同步样本的Great-MCD,实验显示其性能优于现有模拟器及测量数据基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06176 2026-07-22 cs.LG cs.AI physics.space-ph 版本更新 62%

A Self-Supervised Framework for Space Object Behaviour Characterisation

一种用于空间物体行为特征刻画的自监督框架

Ian Groves, Andrew Campbell, James Fernandes, Diego Ramírez Rodríguez, Paul Murray, Massimiliano Vasile, Victoria Nockles

机构 * Defence AI Research Centre, Defence & National Security, The Alan Turing Institute(国防人工智能研究中心,国防与国家安全,艾伦·图灵研究所) Department of Electronic and Electrical Engineering, University of Strathclyde(电子与电气工程系,斯特拉斯克莱德大学) GMV Aerospace Centre of Excellence, University of Strathclyde(航空航天卓越中心,斯特拉斯克莱德大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种自监督框架用于空间物体行为分析,通过预训练和微调实现异常检测、运动预测和合成数据生成,提升空间安全与可持续性。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18756 2026-07-22 cs.IR cs.CL 新提交 57%

RAGAL: A Frugal, Fully Local Retrieval-Augmented Assistant for Technical Support at a Government Agency

RAGAL:政府机构技术支持的节俭型全本地检索增强助手

Dan Musetoiu

机构 * IT Department, Agency for Financing Rural Investments (AFIR)(金融农村投资机构信息部)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 针对公共机构数据不能流出的限制,开发RAGAL检索增强助手。在特定语料库上验证,检索工程和微调效果好,记录单域微调问题及解决方法,还有两个发现和全嵌入器微调方法,最后介绍零流出下的替代评判方案并开源脚本。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08216 2026-07-22 eess.IV cs.CV cs.LG 版本更新 57%

Tumor-anchored deep feature random forests for out-of-distribution detection in lung cancer segmentation

基于肿瘤锚定的深度特征随机森林用于肺癌分割中的分布外检测

Aneesh Rangnekar, Harini Veeraraghavan

机构 * Memorial Sloan Kettering Cancer Center(纪念斯隆凯特林癌症中心)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出RF-Deep框架,利用深度特征提升CT扫描的分布外检测性能,通过少量标注数据改进分割管道的安全性。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026. Code available at: https://github.com/aneesh3108/RF-Deep

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19115 2026-07-22 cs.CV 新提交 50%

CR-Refiner: An Object-Centric Optimal Transport Reranker for Edit-Conditioned 3D Scene Retrieval

CR-Refiner:用于编辑条件3D场景检索的以对象为中心的最优传输重排器

Hao Wu, Jinjing Zhu, Nanyu Wu, Qianyi Cai, Heyi Lin, Hao Wang, Hui Xiong

机构 * Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 预训练与数据 :LLM(abstract)

AI总结 研究编辑条件3D场景检索问题,提出CR-Refiner重排器,通过冻结语言模型解析编辑、不平衡最优传输问题评分候选对象、轴条件结构先验及语言模型验证器细化结果,在不同基础检索器上提升了硬子集检索指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18576 2026-07-22 cs.CV 新提交 50%

Text-conditioned Segmentation for Tomato Phenotyping via Procedural Synthetic Data

通过程序合成数据实现番茄表型的文本条件分割

Samy Mounir, Mikolaj Cieslak, Najmeddine Dhieb, Hakim Ghazzai, Jonathan Klein, Katja Froehlich, Soeren Pirk, Wojciech Palubicki, Gianluca Setti, Ahmed M. Eltawil, Dominik L. Michels

机构 * Computer, Electrical and Mathematical Sciences and Engineering Division, KAUST(计算机、电气与数学科学与工程系,沙特阿卜杜拉国王科技大学) Department of Computer Science, University of Calgary(卡尔加里大学计算机科学系) Department of Computer Science, Kiel University(基尔大学计算机科学系) Department of Artificial Intelligence, Adam Mickiewicz University(亚当·密茨凯维奇大学人工智能系) Department of Electronics and Telecommunications, Polytechnic University of Turin(都灵理工大学电子与电信系)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 研究针对温室作物表型分析中缺乏标注数据问题,提出结合合成数据生成与基础模型微调的框架,通过对商业樱桃番茄温室建模生成合成数据集,微调SAM 3,显著提升分割性能,还公开相关模型与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16290 2026-07-22 cs.CV 版本更新 50%

Strength-Parity Ensembling with Parameter-Isolated Experts for Multi-Task Affect Recognition

基于参数隔离专家的强度-奇偶集成用于多任务情感识别

Tung Hung Bui, Hong Hai Nguyen, Van Thong Huynh

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究在特定规则下从单张无约束面部进行多任务情感识别问题,基于共享情感潜变量提出强度-奇偶规则,用参数隔离解决成员相关性及多样性问题,提升了系统整体验证分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25746 2026-07-22 cs.RO 版本更新 50%

TacRefineNet: Goal-Conditioned Tactile Grasp Refinement for Edge-Prominent Objects

TacRefineNet:用于边缘突出物体的目标条件触觉抓取优化

Shuaijun Wang, Haoran Zhou, Diyun Xiang, Yangwei You

机构 * Xiaomi Robotics(小米机器人)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究针对边缘突出物体抓取对齐难的问题,提出TacRefineNet框架,利用连体策略网络预测手腕姿态增量,经交叉组合训练,在模拟样本上训练后部署到实际五指手,实验表明其在可见物体抓取上有一定成功率及误差控制,还有长期扰动校正等特点。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 20 篇

2607.04733 2026-07-22 cs.CL cs.LG 版本更新 92%

LP-SFT: Local-Preserving Supervised Fine-Tuning via Multimodal Entropy Structure

LP-SFT:通过多模态熵结构进行局部保持监督微调

Yueyang Wang, Baolong Bi, Shuo Lu, Jingyuan Zhang, Jiajun Shi

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院)

专题命中 指令微调 :SFT(title,title_cn);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 研究监督微调中存在的问题,利用香农和雷尼熵分析揭示预训练模型的多模态熵结构,提出LP-SFT目标,在多领域实验中提升性能,平衡准确率和k准确率。

Comments 20 pages, 3 figures. Code is available at https://github.com/Wakaka161/LP-SFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03698 2026-07-22 cs.LG 版本更新 92%

Multi$^2$: Hierarchical Multi-Agent Decision-Making with LLM-Based Agents in Interactive Environments

Multi$^2$:基于LLM智能体在交互环境中的分层多智能体决策

Sangeun Park, Minhae Kwon

机构 * KAIST(韩国科学技术院)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出Multi$^2$分层多智能体决策框架,通过高层智能体(System 1)使用监督微调生成子目标,低层智能体(System 2)使用离线到在线强化学习执行原子动作,以缓解目标漂移并实现长期稳定控制。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18772 2026-07-22 cs.CL 新提交 91%

RF-Agent: A Practical Framework for Building Language Agents for RFIC Design

RF-Agent:用于构建射频集成电路设计语言代理的实用框架

Yueqi Xing, Houbo He, Jolie Wang, Erin Ni, Shikai Wang, Qiufeng Li, Weidong Cao, Taiyun Chi

机构 * Rice University(莱斯大学) The George Washington University(乔治·华盛顿大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language agent(title);LLM(abstract,comments);large language model(abstract)

AI总结 针对大语言模型在射频电路设计应用受限问题,提出RF-Agent框架,通过教科书驱动知识蒸馏创建数据集及基准,研究监督微调与检索增强生成策略,发现特定领域SFT对中小模型提升大,语义检索的RAG表现最佳,为相关工作提供基础。

Comments Accepted at ICLAD (IEEE International Conference on LLM-Aided Design), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23381 2026-07-22 cs.CL 版本更新 90%

Guard Vector: Beyond English LLM Guardrails with Task-Vector Composition and Streaming-Aware Prefix SFT

Guard Vector:通过任务向量合成和流感知前缀监督微调超越英语大语言模型护栏

Wonhyuk Lee, Youngchol Kim, Yunjin Park, Junhyung Moon, Dongyoung Jeong, Wanjin Park

专题命中 指令微调 :SFT(title,summary_cn);LLM(title);language model(abstract);分类 cs.CL

AI总结 研究提出Guard Vector安全任务向量,通过与目标语言模型合成及流感知方法调整得到TGM,能提升分类质量、实现语言扩展和模型可移植性,前缀SFT保持流环境下分类质量,单令牌输出设计提高效率,有助于构建更负责的AI生态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18481 2026-07-22 cs.CL cs.IR 新提交 89%

Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning

搜索图-R1:使用强化学习训练大型语言模型以搜索知识图谱

Jia Ao Sun, Hao Yu, Fengran Mo, Zhan Su, Yuchen Hui, Bang Liu, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学) Mila – Québec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) Halmstad University College(哈尔姆斯塔德大学学院)

专题命中 指令微调 :large language model(title);language model(title);SFT(abstract,abstract_cn);LLM(abstract)

AI总结 研究针对知识图谱问答部署成本高的问题,提出搜索图-R1,通过监督微调与强化学习,将导航内化到8B模型。核心是用黄金SPARQL查询搭建教师遍历答案路径。该模型在多个数据集上超越前沿语言模型,推理无需辅助模块,训练无需语言模型评判,且训练阶段互补,可跨模型家族迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18960 2026-07-22 cs.LG cs.AI cs.CR 新提交 89%

SFGA: A Statistics-First Gating Architecture with Adjudicative Escalation for Trustworthy SFT Data Procurement

SFGA:一种用于可信SFT数据采购的具有裁决升级的统计优先门控架构

Arther Tian, Alex Ding, Simon Wu, Aaron Chan

机构 * DGrid AI(DGrid人工智能)

专题命中 指令微调 :SFT(title,title_cn);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究如何采购监督微调数据,提出统计优先门控架构SFGA,将采购视为成本感知路由问题,经实验在准确率、F1值和成本上取得良好平衡,还报告辩论路径负面诊断,为测量和校准构建合成基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18691 2026-07-22 cs.AI cs.CL 新提交 88%

Semantic Primes as Explanans for Emotion in Large Language Models

语义原素作为大语言模型中情感的解释因素

Frank Xing

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型中情感的解释问题,通过在四个指令微调的LLMs上实验,发现自然语义元语言的语义原素是可恢复的内部元素,能更有效控制情感,且与相应情感可互换,是比其他选项更好的情感解释因素。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏