arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 917 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 917 篇

2607.28434 2026-07-31 cs.AI cs.CL 新提交 62%

Metaphor Tracer: A Theory-Informed Analysis of Hidden States

隐喻追踪器:基于理论指导的隐状态分析

Marc Heimann, Roxana Assadi Moghaddam, Olga Brovkina, Mark Pettifor, Lutz Goetzmann

机构 * Hermeneutic AI(诠释学人工智能公司)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出Metaphor Tracer工具,通过聚合器与区分器分析语言模型隐状态,验证其可追踪文本结构与隐喻迁移,为隐状态提供关系论解读。

Comments 39 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21595 2026-07-24 cs.CV cs.AI cs.LG 新提交 62%

3D-Aware VLMs with Implicit and Explicit Geometries

具有隐式和显式几何的3D感知视觉语言模型

Wenhao Li, Xueying Jiang, Quanhao Qian, Deli Zhao, Ran Xu, Shijian Lu, Gongjie Zhang

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴达摩院) HuPan Lab(湖畔实验室)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对多数2D视觉输入的VLM处理3D任务困难的问题,提出VLM-IE3D框架,通过引入隐式和显式几何令牌及3D感知适配器,融合几何表示与视觉线索,在多种3D任务中表现优异。

Comments Accepted by ECCV 2026, Open Sourced

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20460 2026-07-24 cs.CL cs.AI 新提交 62%

Instruct-FD: Can Your Full-Duplex Speech System Follow Turn-Taking Instructions?

Instruct-FD:你的全双工语音系统能遵循轮流发言指令吗?

Yuzhi Tang, Wentao Ma, Xiling Zhao, Ahmad Salimi, Sepehr Harfi Moridani, Dongming Shen, Jixuan Wang, Abdulrahman Abdulrazzag, Murdock Aubry, Yu-Hua Chen, Daniel Lee, Jaewon Lee, Jonah Mackey, Silin Meng, Nicholas Stranges, Chenxu Xiong, Hao Yu, Yi Zhu, Mu Li, Alex Smola

机构 * Boson AI(玻色子人工智能公司)

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究全双工语音系统在明确指令下的轮流发言行为,引入Instruct-FD基准,开发相关工具,通过对六个先进系统测试发现遵循指令的轮流管理有差距,为构建适应性全双工对话系统指明关键方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18570 2026-07-22 cs.CL cs.AI 新提交 62%

For What Reason? Interpreting Models' Encoding of Causation and Antithesis

出于什么原因?解释模型对因果关系和对立关系的编码

Abhidip Bhattacharyya, Shira Wein

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of South Florida(南佛罗里达大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究指令微调的Transformer模型对英语话语关系的编码,聚焦因果和对立关系。通过下一个token预测任务及可解释性技术,发现早期层在序列中间做预测,中层接近末尾确定决策,部分层有答案偏好,揭示话语推理的不对称表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17524 2026-07-21 cs.CL cs.LG 新提交 62%

Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift

分布转移下忠实生成的令牌级离策略学习

Zitong Huang, Gustavo Lucas Carvalho, Deqing Fu, Robin Jia

机构 * University of Southern California(南加州大学)

专题命中 指令微调 :post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究分布转移下忠实生成问题,提出令牌级离策略标注(TOPL)方法,通过训练模型区分响应中好坏令牌引导生成,在文档摘要等任务实验中实现强大分布外泛化,能有效转移到机器翻译,且学习信号关键,更新具可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11919 2026-07-15 cs.NE cs.AI cs.CV cs.LG 新提交 62%

Do You Remember? Toward Memory-Centric Multimodal AI

你还记得吗?迈向以记忆为中心的多模态人工智能

Xuguang Yu, Weigang Zheng, Minyue Yu

专题命中 指令微调 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究针对当前多模态语言模型缺乏重建性记忆的问题,提出DoYouRemember三阶段架构,通过VQ-VAE、LoRA微调语言模型和扩散解码器实现,经实验发现语言模型隐藏状态视觉信息少,还解决了共享记忆矩阵训练问题,统一相关发现于信息论框架。

Comments 43 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05968 2026-07-08 cs.CL cs.AI cs.IR 新提交 62%

InfluMatch: Frontier-Quality KOL Search at 4B-Model Cost

InfluMatch:以4B模型成本实现前沿质量的关键意见领袖搜索

Krittanon Kaewtawee, Petmongkon Pornpichitsuwan, Natchaya Temyingyong, Nutnicha Laplamoon, Wachiravit Modecrua, Krittin Pachtrachai, Touchapon Kraisingkorn

专题命中 指令微调 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究如何将关键意见领袖与泰国营销标准匹配,提出低成本三阶段级联InfluMatch,由小型开放权重模型构建,能以低得多的成本达到前沿模型效果,是可部署、可解释的KOL搜索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03763 2026-07-07 cs.LG cs.AI 新提交 62%

FedACT: Federated Adaptive Coordinate Trust Modulation for Robust Transformer Training under Data Heterogeneity

FedACT:数据异构下用于稳健Transformer训练的联邦自适应坐标信任调制

Shuai Li, Qinglin Wang, Ping Luo, Jiahuan Wang, Hongyang Hu, Haotian Mo, Yigui Feng, Ziang Liu, Qisong Xiao, Jie Liu, Tao Sun

机构 * NUDT(南京理工大学)

专题命中 指令微调 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究数据异构下联邦Transformer训练问题,提出FedACT方法,先形成全局校正自适应方向,再依坐标信任分数重分配更新幅度,实验表明其优于基线,能提升跨客户端方向一致性。

Comments 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00687 2026-07-02 cs.CV cs.AI cs.LG cs.PF 新提交 62%

LUMA: Benchmarking Segmentation via a Lightweight Universal Mask Adapter

LUMA: 通过轻量级通用掩码适配器进行分割基准测试

Tobias Christian Nauen, Anosh Billimoria, Federico Raue, Stanislav Frolov, Brian B. Moser, Andreas Dengel

机构 * RPTU University Kaiserslautern-Landau(凯泽斯劳滕-兰道大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))

专题命中 指令微调 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出轻量级通用掩码适配器(LUMA),一种与骨干无关的掩码Transformer头,通过廉价交叉注意力实现高精度分割,并基于此对20种骨干网络和11种预训练方案进行基准测试,发现高效token混合器未实现高效,预训练目标主导分割质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00634 2026-07-02 cs.LG cs.AI 新提交 62%

Loss Smoothing for Stable Adaptation Under Distribution Shift

损失平滑:分布偏移下的稳定自适应

Darshan Patil, Ekaterina Lobacheva, Razvan Pascanu, Sarath Chandar

机构 * Chandar Research Lab(Chandar 研究实验室) Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) Polytechnique Montréal(蒙特利尔理工学院) Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出损失平滑方法,通过在自适应初期插值源与目标训练目标,实现平滑过渡,保留有用特征,在多种分布偏移场景下提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00004 2026-07-02 cs.IR cs.AI cs.LG 新提交 62%

Why Advanced Encoders Lag on Sparse Retrieval? The Answer and an Approach to Bridging Vocabulary Gaps

为什么高级编码器在稀疏检索上落后?答案及弥合词汇鸿沟的方法

Zhichao Geng, Yang Yang

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 发现高级编码器在稀疏检索中落后于旧模型的原因是词汇鸿沟:现代分词器使用原始、区分大小写的词汇表导致语义单元冗余。提出词汇迁移框架,通过语义初始化和激活势校准解决该问题,在BEIR上取得SOTA性能。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27939 2026-06-29 cs.LG cs.AI q-bio.BM q-bio.GN 新提交 62%

Two-Stage Fine-Tuning for Protein Sequence Generation with Targeted Amino-Acid Composition

针对目标氨基酸组成的蛋白质序列生成的两阶段微调

Violeta Basten-Romero, Rubén Muñoz-Tafalla, Anna María Díaz-Rovira, Bertran Miquel-Oliver, Isaac Filella-Merce, Víctor Guallar

机构 * Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心) Nostrum Biodiscovery S.L.(Nostrum生物发现有限公司) ICREA

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出两阶段微调方法,先领域自适应微调,再强化学习迭代微调,以生成符合目标氨基酸组成且保持序列质量的蛋白质序列。

Comments 17 pages, 5 figures, ICML 2026 Workshop GenBio

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27793 2026-06-29 cs.CL cs.AI 新提交 62%

Position Bias Correction is Insufficient for One-Pass Attention Sorting

位置偏差校正不足以实现单遍注意力排序

Qiong Tang, Xiangkun Hu, Xiangyang Liu, Yiran Chen, Yunfan Shao

机构 * Analemma

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对长上下文语言模型的位置偏差问题,提出去偏单遍注意力排序方法,通过估计位置偏差曲线校正注意力分数,实验表明校正效果有限,无法替代迭代排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26987 2026-06-26 cs.CL cs.AI 新提交 62%

Where Do Models Find Happiness? Emotion Vectors in Open-Source LLMs

模型在哪里找到幸福?开源大语言模型中的情感向量

Sinie van der Ben, Raphaël Baur, Yannick Metz, Mennatallah El-Assady

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究在开源模型中复现情感向量,发现效价几何结构在层间分布存在差异,且唤醒度编码受语料影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26620 2026-06-26 cs.LG cs.AI 新提交 62%

Discovering Millions of Interpretable Features with Sparse Autoencoders

利用稀疏自编码器发现数百万可解释特征

XinYang He, Wei Wang, Bing Zhao, Xuan Ren, WenBo Li, WeiXu Qiao, Hu Wei, Lin Qu

机构 * AI DATA, Alibaba Group Holding Limited(阿里巴巴集团控股有限公司 AI DATA) Beijing Institute of Technology(北京理工大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Qwen3-Instruct SAE,在Qwen3指令微调模型系列上训练稀疏自编码器,通过激活级和模型级评估揭示稀疏性-保真度权衡,并展示其在拒绝行为引导中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26290 2026-06-26 cs.LG cs.AI 新提交 62%

SSM Adapters via Hankel Reduced-order Modeling: Injection Site Determines Task Suitability in Long-Context Fine-Tuning

通过Hankel降阶建模的SSM适配器:注入位置决定长上下文微调中的任务适用性

Omanshu Thapliyal

机构 * Hitachi America Ltd.(日立美洲有限公司)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Hankel降阶模型(HRM)适配器,一种基于SSM的残差模块,通过平衡截断初始化,在长上下文任务中优于LoRA,并支持FFT并行扫描。

Comments 14 pages, 12 figures, HiLD Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26112 2026-06-26 cs.CL cs.AI 新提交 62%

From Lexicon to AI: A Structured-Data Pipeline for Specialized Conversational Systems in Low-Resource Languages

从词汇到AI:低资源语言中专有对话系统的结构化数据流水线

Siddhant Hitesh Mantri, Dhara Gorasiya, Malhar Kulkarni, Pushpak Bhattacharya

机构 * NMIMS, Mumbai(NMIMS孟买分校) CFILT, IIT Bombay(印度理工学院孟买分校CFILT)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出利用专家编纂的词汇数据库(如印地语WordNet)生成指令对,微调12B参数语言模型,构建低资源语言专用对话系统,在教育任务中效果优于通用模型。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24119 2026-06-24 cs.LG cs.CL 新提交 62%

When Top-1 Fails: Calibrating LoRA Monitors for Masked Diffusion LMs

当Top-1失败时:为掩蔽扩散LM校准LoRA监控器

Lucky Verma, Pratik Yadav

机构 * Independent Researcher(独立研究员) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.LG

AI总结 针对离散扩散语言模型微调中top-1 argmax作为崩溃预警的零精度问题,提出使用最大LoRA梯度范数作为参数侧信号,在LLaDA族上实现0.68精度和0.79 F1分数,并建议每族DLM校准阈值。

Comments 14 pages, 3 figures. Code and result artifacts: https://github.com/lucky-verma/top1-fails-dlm-lora-monitors

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22272 2026-06-23 cs.CL cs.AI 新提交 62%

MixedPEFT: Combining Multiple PEFT Methods with Mixed Objectives for Unsupervised Domain Adaptation

MixedPEFT:结合混合目标的多参数高效微调方法用于无监督域适应

Mohammed Rawhani, Dervis Karaboga, Ozkan Ufuk Nalbantoglu, Alper Basturk, Bahriye Akay

机构 * Computer Engineering Department(计算机工程系) Erciyes University(埃里奇大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种结合自定义PEFT架构和混合目标训练的参数高效无监督域适应策略,在MNLI数据集上超越现有方法,仅使用7%可训练参数。

Comments 6 pages, 5 tables. Builds upon our preliminary work presented at UBMK 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21496 2026-06-23 cs.RO cs.AI cs.CV cs.LG 新提交 62%

Decoupling the Declarative from the Procedural in Vision-Language-Action Models

在视觉-语言-动作模型中解耦声明性知识与程序性知识

Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu, Oisin Mac Aodha, Alexandros Kouris

机构 * University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院) Samsung AI Center - Cambridge, UK(三星人工智能中心 - 英国剑桥)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有VLA模型无法解耦声明性与程序性知识导致零样本技能迁移脆弱的问题,提出w$^{2}$VLA模型,通过重构信息流实现模块化、可解释的知识解耦,显著提升对未见物体的零样本技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19317 2026-06-18 cs.LG cs.AI 新提交 62%

Explaining Attention with Program Synthesis

用程序合成解释注意力机制

Amiri Hayes, Belinda Z Li, Jacob Andreas

机构 * NJIT(新泽西理工学院) MIT(麻省理工学院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出用可执行程序近似深度网络组件行为的方法,针对Transformer注意力头,通过生成Python程序再现注意力模式,实现可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10929 2026-06-10 cs.LG cs.AI 新提交 62%

Recoverable but Not Stationary:Local Linear Structures in Weights and Activations

可恢复但不稳定:权重和激活中的局部线性结构

Irina Piontkovskaia, Sergey Nikolenko

机构 * St. Petersburg Department of the Steklov Institute of Mathematics(斯捷克洛夫数学研究所圣彼得堡分所) St. Petersburg State University(圣彼得堡国立大学)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 研究神经网络中线性结构的存在性与尺度,发现局部低秩任务梯度结构,但固定任务平面假设不成立;首次恢复更新形成轨迹前缀基,捕获大部分恢复位移;提出随机搜索理论解释高维随机参数搜索有效性,并验证参数扰动与激活引导的关系。

Comments 23 pages, 8 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09430 2026-06-09 cs.LG cs.AI 新提交 62%

LargeMonitor: Monitoring Online Task-Free Continual Learning via Large Pretrained Models

LargeMonitor: 通过大型预训练模型监控在线无任务持续学习

Mingqi Yuan, Xiaoquan Sun, Shihao Luo, Jiayu Chen

机构 * HKU(香港大学) Qicore Tech(启科科技)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出LargeMonitor框架,利用大型预训练模型(LVM和LMM)解耦检测与诊断,实现无任务持续学习中的零样本漂移检测和语义病因诊断,提升现有算法性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08051 2026-06-09 cs.AI cs.LG 新提交 62%

How Small Can You Go? LoRA Fine-Tuning 270M-8B Models for Merchant Information Extraction in Financial Transactions

你能做到多小?面向金融交易中商户信息抽取的 270M-8B 模型 LoRA 微调

Donghao Huang, Tomas Drietomsky, Benjamin Barrett, Zhaoxia Wang

机构 * Singapore Management University(新加坡管理大学) Mastercard(万事达卡) A*STAR Centre for Frontier AI Research(新加坡科技研究局前沿人工智能研究中心)

专题命中 指令微调 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 针对金融交易中从嘈杂银行字符串提取结构化商户信息的生产需求,系统评估 24 种模型变体,发现 Qwen 3.5 4B 在参数量减半下 F1 仅低 0.35 点,0.8B 模型匹配 2.5-4 倍大模型性能,且思维链微调提升有限。

Comments 9 pages, 5 figures, 5 tables. Submitted to the IEEE International Conference on Data Mining (ICDM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06519 2026-06-08 cs.AI cs.LG 新提交 62%

SafeGene: Reusable Adapters for Transferable Safety Alignment

SafeGene: 可重用的适配器实现可迁移的安全对齐

Yanghan Wang, Zhiqiang Kou, Fu Feng, Jing Wang, Xin Geng

机构 * Southeast University(东南大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 指令微调 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出SafeGene,一种可重用的安全适配器模块,通过从对齐-退化模型差异中提取安全表示,并利用数据感知层选择和少样本系数重校准,实现跨任务的安全恢复,在保持下游性能的同时降低有害响应率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16384 2026-08-18 cs.CV cs.LG 新提交 57%

Self-Routed Tensor Adapters for Parameter-Efficient Universal Visual Adaptation

用于参数高效通用视觉适配的自路由张量适配器

Suraj Yadav

机构 * Indraprastha Institute of Information Technology Delhi(因德拉普拉斯信息技术学院德里分校)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 提出自路由张量适配器(SRTA),无需外部门控网络即可实现样本特定适配,在多领域视觉分类基准上,以更少参数达到与MoE式PEFT基线相当或更优的平均准确率。

Comments Accepted at ECCV Workshop 2026 (Archival Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15037 2026-08-18 cs.SD cs.LG 新提交 57%

Prototype-Rectified Iterative Self-supervised Manifold Denoising under Severe Acoustic Shift

严重声学偏移下的原型修正迭代自监督流形去噪

Ashish Anand Shukla, Rini Smita Thakur, Aryan Das, Vinod K. Kurmi

机构 * Indian Institute of Science Education and Research(印度科学教育与研究学院) Vellore Institute of Technology(韦洛尔理工大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 针对严重声学噪声下音频-文本基础模型的失效问题,提出无训练无数据源的TTA框架PRISM,在UrbanSound8K数据集上取得显著性能提升,还解决了复音陷阱问题。

Comments Accepted as a full paper at ACM CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15900 2026-08-18 cond-mat.mtrl-sci cs.LG 新提交 57%

Crystal-structure design by agentic AI in a language of motifs

基于基元语言的智能体AI晶体结构设计

Dinh-Khiet Le, Minh-Quyet Ha, Hong-Phuc Vu-Dinh, Takashi Miyake, Hiori Kino, Hieu-Chi Dam

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 该研究提出智能体AI框架MatEvolve,以基元语言设计晶体,在贫稀土永磁体设计中发现新结构原型的频率是生成模型的三倍以上,可揭示结构-性能关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14312 2026-08-17 cs.CL 新提交 57%

Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL

Envs-FORGE:面向智能体强化学习的前沿优化、奖励驱动的环境合成方法

Xiaojun Wu, Cehao Yang, Honghao Liu, Xueyuan Lin, Zhichao Shi, Hao Zhou, Xuhui Jiang, Chengjin Xu, Jia Li, Jian Guo

机构 * IDEA Research(IDEA研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DataArcTech Ltd.(DataArcTech有限公司)

专题命中 指令微调 :prompting(abstract);分类 cs.CL

AI总结 Envs-FORGE是面向智能体RL的奖励驱动环境合成方法,通过MILP选动作生成训练环境,在多模型及数据集上显著提升Pass@1等指标。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13250 2026-08-14 cs.CY cs.AI 新提交 57%

Follow the Norm: Accounting for Fine-Tuning and Prompt Effects on Model Rationales

遵循规范:考量微调与提示对模型理由的影响

Long Hoang Nguyen, Brice Valentin Kok-Shun, Guangyu Du, Ali Sunyaev

专题命中 指令微调 :prompting(abstract);分类 cs.AI

AI总结 该研究将AI视为代理主体,通过对LLaMA-3.2-11B等三个模型开展实验,发现违反规范的微调会改变模型的理由风格,而系统提示可覆盖该行为,支持对齐的分布式观点,为可争议监督提供了相关依据。

Comments Extended version with appendix; final version to appear in the Proceedings of AAAI/ACM AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏