arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 885 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 885 篇

2608.03063 2026-08-05 cs.CL 新提交 89%

SeqLLM: Augmenting LLMs with Behavioral-Sequence Modeling for High-Stakes Decisions at WeChat Pay

SeqLLM:为高风险决策场景下的微信支付增强序列大语言模型(LLM)的行为序列建模能力

Guilin Li, Jiaxing Zhang, Matthias Hwai Yong Tan, Bo Wang, Weiran Huang

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SeqLLM是一种在保留LLM语言能力的同时增强其行为序列建模能力的框架,已部署于微信支付,在风险筛查等任务上性能显著优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18481 2026-07-22 cs.CL cs.IR 新提交 89%

Search-on-Graph-R1: Training Large Language Models to Search Knowledge Graphs with Reinforcement Learning

搜索图-R1:使用强化学习训练大型语言模型以搜索知识图谱

Jia Ao Sun, Hao Yu, Fengran Mo, Zhan Su, Yuchen Hui, Bang Liu, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学) Mila – Québec AI Institute(米拉-魁北克人工智能研究所) McGill University(麦吉尔大学) Halmstad University College(哈尔姆斯塔德大学学院)

专题命中 指令微调 :large language model(title);language model(title);SFT(abstract,abstract_cn);LLM(abstract)

AI总结 研究针对知识图谱问答部署成本高的问题,提出搜索图-R1,通过监督微调与强化学习,将导航内化到8B模型。核心是用黄金SPARQL查询搭建教师遍历答案路径。该模型在多个数据集上超越前沿语言模型,推理无需辅助模块,训练无需语言模型评判,且训练阶段互补,可跨模型家族迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02914 2026-07-07 cs.AI 新提交 89%

Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models

Oyster-II:大语言模型中用于建设性安全对齐的强化学习

Jiyang Guan, Yong Xie, Jun Chen, Jiexi Liu, Zipeng Ye, Defeng Li, Jiayu Shen, Jialing Tao, Hui Xue

机构 * Alibaba AAIG(阿里巴巴人工智能全球研究院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.AI

AI总结 研究大语言模型安全等问题,指出传统策略不足。基于Oyster-I范式,提出Oyster-II框架,采用强化学习结合零强化学习范式,在多基准测试中安全维度表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01764 2026-07-03 cs.AI 新提交 89%

Mastermind: Strategy-grounded Learning for Repository-Scale Vulnerability Reproduction

Mastermind: 基于策略学习的仓库级漏洞复现

Mingzhe Du, Luu Anh Tuan, Tianyi Wu, Renyang Liu, Zhijiang Guo, Dong Huang, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(summary_cn,abstract);分类 cs.AI

AI总结 提出Mastermind双循环框架,通过策略学习(SFT+GRPO)提升LLM代理在仓库级漏洞复现中的表现,在260个训练任务和200个测试任务上达到84.5%通过率,并成功迁移至不同执行器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01084 2026-07-02 cs.AI 新提交 89%

Can Agents Generalize to the Open World? Unveiling the Fragility of Static Training in Tool Use

智能体能否泛化到开放世界?揭示工具使用中静态训练的脆弱性

Song-Lin Lv, Weiming Wu, Rui Zhu, Zi-Jian Cheng, Lan-Zhe Guo

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM智能体在真实场景中因查询、工具集和交互动态变化而性能下降的问题,形式化定义了开放世界工具使用问题,构建了四层层次的环境偏移框架,并通过实验揭示了监督微调和强化学习训练智能体在面对开放环境偏移时的脆弱性,提出了扰动增强微调策略以提升鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30899 2026-07-01 cs.CR cs.AI 新提交 89%

Curvature-Guided Module Localization for Low-Rank Detoxification of Backdoored Large Language Models

曲率引导的模块定位用于后门大语言模型的低秩解毒

Arash Raftari, Mehrdad Mahdavi, Nathan Blackthorn, Andrew Arash Mahyari

机构 * AIVault Inc.(AIVault公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出一种基于激活修补和Fisher/K-FAC曲率分析的机制引导权重空间修复框架,定位并低秩修复后门大语言模型中最有影响力的模块,有效抑制触发条件恶意行为同时保持良性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08792 2026-06-09 cs.CL 新提交 89%

The Amplifying Mirror: Locating and Steering the Partisan Direction inside a Large Language Model

放大镜:定位和操控大语言模型内的党派方向

Wendy K. Tam

机构 * Vanderbilt University(范德比尔特大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 通过线性探针在Llama 3.1 8B Instruct模型的隐藏状态中定位党派政治身份方向,并利用稀疏自编码器分解为可解释特征,因果干预可系统性改变模型输出,证明党派偏见是可定位和操控的几何特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11715 2026-08-13 cs.CL cs.AI 新提交 89%

When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use

当API“说错”语言:重新审视多语言工具使用的后训练

Siddharth Chauhan, Thomas Butler, Abhishek Singhania, Pankaj Porwal, Honey Gupta

机构 * Amazon(亚马逊)

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对多语言API调用中存在的参数语言不匹配问题,研究发现监督微调可实现接近或优于复杂强化学习方法的性能,强化学习仅能提供渐进式改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18960 2026-07-22 cs.LG cs.AI cs.CR 新提交 89%

SFGA: A Statistics-First Gating Architecture with Adjudicative Escalation for Trustworthy SFT Data Procurement

SFGA:一种用于可信SFT数据采购的具有裁决升级的统计优先门控架构

Arther Tian, Alex Ding, Simon Wu, Aaron Chan

机构 * DGrid AI(DGrid人工智能)

专题命中 指令微调 :SFT(title,title_cn);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究如何采购监督微调数据,提出统计优先门控架构SFGA,将采购视为成本感知路由问题,经实验在准确率、F1值和成本上取得良好平衡,还报告辩论路径负面诊断,为测量和校准构建合成基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16074 2026-06-16 cs.CL cs.AI 新提交 89%

PVminerLLM2: Improving Structured Extraction of Patient Voice via Preference Optimization

PVminerLLM2:通过偏好优化改进患者声音的结构化提取

Samah Fodeh, Linhai Ma, Ganesh Puthiaraju, Srivani Talakokkul, Afshan Khan, Elyas Irankhah, Sreeraj Ramachandran, Ashley Hagaman, Sarah Lowe, Aimee Roundtree

机构 * Yale School of Medicine(耶鲁大学医学院) Yale School of Public Health(耶鲁大学公共卫生学院) Texas State University(德克萨斯州立大学)

专题命中 指令微调 :preference optimization(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出PVminerLLM2,通过偏好优化和令牌级门控稳定项、混淆感知偏好对构建等技术,解决监督微调难以处理的细粒度错误,在患者声音结构化提取任务上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12426 2026-06-12 cs.CY cs.CL cs.LG 新提交 89%

Two Wrongs, No Right: Auditing Social-Desirability Bias in LLM Annotators for Computational Social Science

两个错误,没有正确:审计计算社会科学中LLM标注者的社会期望偏差

Varun Kotte

机构 * Varun Kotte

专题命中 指令微调 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.LG

AI总结 研究审计了三个开源指令微调模型在TweetEval任务中的社会期望偏差,发现模型存在宽大、过度纠正和中性偏差,且提示干预无法纠正,聚合指标可能掩盖实质结论错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11912 2026-08-13 cs.CE 新提交 89%

Comparative Analysis of Low-Rank Adaptation in Large Language Models versus Dense Embedding Regression for Headline Click-Through Rate Prediction

用于标题点击率预测的大语言模型低秩适配(LoRA)与密集嵌入回归的对比分析

Samarth Sirsat, Anirudha Shinde, Amit Sethi, Aman Verma

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn)

AI总结 本研究将标题选择建模为赢家通吃分类任务,对比发现用于标题点击率预测的密集嵌入回归模型,性能优于经LoRA微调的0.6B规模生成式语言模型,凸显了嵌入回归模型在高吞吐量内容排序中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16580 2026-07-21 stat.AP cs.CE cs.SE 新提交 89%

Automating structural reliability analysis with a multi-agent large language model framework

使用多智能体大语言模型框架实现结构可靠性分析自动化

Jaehwan Jeon, Chang Hee Lee, Taeyong Kim

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究提出多智能体大语言模型框架,通过专门智能体处理结构可靠性分析流程,用QLoRA微调方法规划器,由确定性求解器计算结果,降低专业知识壁垒,保持计算可信度,实现结构可靠性分析自动化。

Comments 41 pages, 10 figures. Submitted to Automation in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13350 2026-07-16 physics.chem-ph 新提交 89%

How Well Can Frontier Large Language Models Generate Structures? High Quality Prediction of Molecular Geometries with Help from Fine-Tuning

前沿大语言模型在生成结构方面表现如何?通过微调实现分子几何结构的高质量预测

Joseph M. Cavanagh, Jonathan B. Arnold, Giovanni Battista Alteri, Andrew Gritsevskiy, Teresa Head-Gordon

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究探索大语言模型用于学习分子几何结构语言的微调方法,利用笛卡尔坐标或Z矩阵微调,能准确预测小分子平衡结构等,Z矩阵效果更好,且混入自然语言对微调可增强预测能力并保留预训练语言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28266 2026-06-29 cs.CV 新提交 89%

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

RSICCLLM:用于遥感图像变化描述的多模态大语言模型

Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) Great Bay University, Dongguan, China(东莞Great Bay大学,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院,中国) Dongguan Key Laboratory for Intelligence and Information Technology, Dongguan, China(东莞智能与信息科技重点实验室,中国)

专题命中 指令微调 :language model(title,abstract);large language model(title);post-training(abstract);preference optimization(abstract)

AI总结 提出首个针对遥感图像变化描述任务的大视觉语言模型后训练框架RSICCLLM,通过数据生成范式、差异感知微调和双负偏好优化,仅7B参数即超越更大规模模型。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26023 2026-07-29 cs.AI 新提交 89%

CHARM: A Multimodal Graph Foundation Model with Hierarchical Context Modeling for Zero-Shot Transfer

CHARM:一种用于零样本迁移的具有分层上下文建模的多模态图基础模型

Ankang Yang, Jitao Zhao, Di Jin, Yuxiao Huang, Dongxiao He

机构 * School of Computer Science and Technology, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部计算机科学与技术学院) Data Science Program, Columbian College of Arts and Sciences, The George Washington University(乔治华盛顿大学文理学院哥伦比亚艺术与科学学院数据科学项目)

专题命中 指令微调 :foundation model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究多模态图零样本迁移问题,提出CHARM模型,通过分层上下文建模,用图上下文替换原始节点,减少对目标域监督或适配的依赖,经实验验证该模型在零样本多模态图任务上有改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24064 2026-06-24 cs.AI 新提交 89%

Beyond Trajectory Imitation: Strategy-Guided Policy Optimization for LLM Reasoning

超越轨迹模仿:策略引导的策略优化用于大语言模型推理

Tianyuan Shi, Canbin Huang, Bei Li, Xin Chen, Xiaojun Quan, Jingang Wang, Qifan Wang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) Meituan, Inc., China(美团) Shenzhen Loop Area Institute, China(深圳环区研究所) Meta AI, USA(Meta AI)

专题命中 指令微调 :LLM(title,summary_cn);SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 提出策略引导的策略优化(SGPO),通过可重用策略蒸馏替代实例级轨迹模仿,利用前向KL散度和自适应加权提升LLM推理泛化能力,在数学基准上平均提升2.2分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12882 2026-06-12 cs.AI 新提交 89%

HarnessBridge: Learnable Bidirectional Controller for LLM Agent Harness

HarnessBridge: 用于LLM智能体框架的可学习双向控制器

Xiaoxuan Wang, Haixin Wang, Alexander Taylor, Jason Cong, Yizhou Sun, Wei Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 提出HarnessBridge,一种轻量级可学习框架控制器,通过双向投影参数化智能体-环境接口,减少令牌使用和轨迹长度,并泛化到更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11342 2026-08-13 cs.LG cs.CL 新提交 88%

Weightless Fine-Tuning: Personalizing LLMs via Logit-Space Transport

无权重微调:通过对数几率空间迁移实现大语言模型的个性化

Bohan Zhang, Anqi Ni, Yixin Wang, Paramveer S. Dhillon

机构 * University of Michigan(密歇根大学) University of Chicago(芝加哥大学)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.LG

AI总结 针对个性化场景下LLM微调成本过高的问题,提出无需权重更新的WFT方法,在LaMP基准上性能优于多数基线,仅用不到7%计算量接近SFT效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08164 2026-08-11 cs.CL cs.AI 新提交 88%

STEMMA: An Adversarial Multi-Agent Framework for Evaluating Self-Identity Consistency in LLMs

STEMMA:用于评估大语言模型(LLM)自我身份一致性的对抗性多智能体框架

Nuthakki Siva Gopala Krishna, Kanishka Jain

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对LLM自我身份一致性评估问题,提出对抗性多智能体框架STEMMA,结合手动设计的对抗性提示开展实验,发现多数LLM存在自我表征不一致的问题。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19604 2026-07-23 cs.CL cs.LG 新提交 88%

Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models

基于超网络的大语言模型知识注入的缩放定律

Nischay Dhankhar, Dos Baha, Abulhair Saparov

机构 * Nace AI(Nace人工智能公司) Purdue University(普渡大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型训练时知识注入问题,核心方法是用超网络生成LoRA适配器,主要贡献是发现超网络注入能力随规模变化规律,能可靠进行分布外泛化,为训练时适应提供新基础及缩放定律。

Comments Preprint, 22 pages, 14 figures. Dataset collection available at https://huggingface.co/collections/nace-ai/hypernetwork-datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18691 2026-07-22 cs.AI cs.CL 新提交 88%

Semantic Primes as Explanans for Emotion in Large Language Models

语义原素作为大语言模型中情感的解释因素

Frank Xing

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型中情感的解释问题,通过在四个指令微调的LLMs上实验,发现自然语义元语言的语义原素是可恢复的内部元素,能更有效控制情感,且与相应情感可互换,是比其他选项更好的情感解释因素。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26982 2026-06-26 cs.CL cs.AI 新提交 88%

Auditing Framing-Sensitive Behavioral Instability in Large Language Models for Mental Health Interactions

审计心理健康交互中大语言模型的框架敏感行为不稳定性

Abla Bedoui, Ashley L. Greene, Mohammed Cherkaoui

机构 * a School of computer science, digital engineering and AI, Long Island University, Brooklyn, NY, USA(a 计算科学与数字工程及人工智能学院,罗格斯大学,布鲁克林,纽约,美国) b Department of Psychology, Long Island University, Brooklyn, NY, USA(b 心理学系,罗格斯大学,布鲁克林,纽约,美国)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过控制匹配提示,调查大语言模型在不同上下文框架下的行为变异性,发现框架系统性改变解释响应倾向,且内部表征可解码,激活操控可部分调节行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26350 2026-06-26 cs.AI cs.LG 新提交 88%

OpenFinGym: A Verifiable Multi-Task Gym Environment for Evaluating Quant Agents

OpenFinGym: 一个可验证的多任务Gym环境,用于评估量化智能体

Kaicheng Zhang, Wen Ge, Lei Jiang, Weixin Yang, Jordan Langham-Lopez, Jialin Yu, Lukasz Szpruch, Hao Ni

机构 * University of Edinburgh(爱丁堡大学) University College London(伦敦大学学院) Alan Turing Institute(艾伦·图灵研究所) University of Oxford(牛津大学)

专题命中 指令微调 :LLM(summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出OpenFinGym统一环境,覆盖预测、市场生成、实时交易和欺诈检测等量化金融任务,支持自动化任务构建、容器化验证和延迟解析,以全面评估LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19528 2026-06-19 cs.LG cs.AI 新提交 88%

Techniques for Peak Memory Reduction for LoRA Fine-tuning of LLMs on Edge Devices

边缘设备上LLM LoRA微调峰值内存降低技术

Hassan Dbouk, Matthias Reisser, Prathamesh Mandke, Likhita Arun Navali, Christos Louizos

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对边缘设备上LLM LoRA微调的内存瓶颈,提出四种互补技术(量化、检查点、softmax近似、logits掩码),在Llama-3.2 3B和Qwen-2.5 3B上实现高达26倍和28倍的峰值内存降低。

Comments Hassan Dbouk and Matthias Reisser contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09907 2026-08-11 cs.CV 新提交 88%

DistMoE: Private-data Rehearsal-free Routing in Mixture-of-Experts for Distributed Instruction Tuning

DistMoE:用于分布式指令调优的混合专家模型中无需私有数据排练的路由机制

Mainak Singha, Niccolò Biondi, Elisa Ricci, Subhankar Roy

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Bergamo(贝加莫大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 针对多模态大语言模型分布式私有数据场景,提出DistMoE混合专家方法,通过公共锚定专家组合阶段实现无需排练的路由,在视觉-语言基准上取得灵活复用与适配的竞争力性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16872 2026-07-21 cs.CL cs.AI cs.LG 新提交 88%

Trace-Based On-Policy Distillation for Masked Diffusion Language Models

基于轨迹的策略蒸馏用于掩码扩散语言模型

Haolin Ren, Ziyang Huang, Chenhao Yuan, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);post-training(abstract);SFT(abstract)

AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06175 2026-07-08 cs.CL cs.AI cs.LG 新提交 88%

Improving LLM-Generated Process Model Quality Through Reinforcement Learning: The Role of Reward Function Design

通过强化学习提高大语言模型生成的过程模型质量:奖励函数设计的作用

Alexander Rombach, Chantale Lauer, Nijat Mehdiyev

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Saarland University(萨尔兰大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究探索基于强化学习的大语言模型生成过程模型时奖励函数设计,训练两个模型家族,发现强化学习可提质量,均等奖励加权效果好,设计选择与模型架构相互作用复杂,奖励构成是优化关键,结果适用于多维度质量评估的结构化生成任务。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23270 2026-06-23 cs.CV 新提交 88%

BoxCtrl: 3D-Aware Visual Prompting for Geometric Image Editing

BoxCtrl: 面向几何图像编辑的3D感知视觉提示

Feifei Wang, Shiyuan Yang, Xiaoyu Li, Jing Liao

机构 * City University of Hong Kong(香港城市大学) Tencent(腾讯)

专题命中 指令微调 :prompting(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出BoxCtrl框架,通过投影到2D的RGB 3D边界框作为视觉提示,结合监督微调与强化学习两阶段训练,实现精确的3D几何编辑(平移、旋转、缩放等),达到最先进性能。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12801 2026-06-12 cs.CY 新提交 88%

AiAWE: An Open-Source LLM Automated Writing Evaluation System Using LoRA-Adapted Instruction-Tuned Models

AiAWE: 一种使用LoRA适配指令微调模型的开源LLM自动写作评估系统

John Maurice Gayed

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出AiAWE开源自动写作评估系统,通过LoRA适配指令微调Gemma-3-27B模型,在TOEFL独立写作数据集上达到0.474 RMSE和90.56%一致率,优于更大模型和GPT-3.5基线。

Comments 21 pages with 7 tables and 1 figure and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏