arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 725 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 58 篇

2604.13627 2026-08-04 cs.LG cs.CL 版本更新 87%

(How) Learning Rates Regulate Catastrophic Overtraining

(如何) 学习率调节灾难性过训练

Mark Rofin, Aditya Varre, Nicolas Flammarion

机构 * EPFL(瑞士联邦理工学院)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);pretraining(abstract);post-training(abstract)

AI总结 研究通过隐式正则化分析学习率对微调中灾难性遗忘的影响,发现学习率大小影响模型收敛方向,并揭示学习率衰减加剧预训练模型尖锐性从而导致灾难性过训练。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01759 2026-08-04 cs.CR 新提交 87%

Benign Alone, Harmful Together: Exploiting Experience Composition in Self-Evolving LLM Agents

单独无害,联合有害:在自进化大语言模型智能体中利用经验组合

Bingyu Yan, Xiaoming Zhang, Chaozhuo Li, Ziyi Zhou, Yirui Qi, Litian Zhang

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出EvoBreak攻击,利用自进化LLM智能体的良性经验组合,结合BreakGym生成训练目标,在保持高无害性的同时优于现有攻击,揭示了新的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00078 2026-08-04 cs.CV 新提交 87%

Device-First Feedback: Toward Mobile-Native LLM-Driven Neural Architecture Search

设备优先反馈:面向移动端原生大语言模型驱动的神经网络架构搜索

Saif U Din, Muhammad Ahsan Hussain, Radu Timofte, Dmitry Ignatov

机构 * University of Würzburg(维尔茨堡大学) CAIDAS IFI

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出自动化移动端部署闭环流水线,针对CIFAR-10、CIFAR-100基准在三星平板验证,发现GPU微调无法保证移动端性能单调提升,需多数据集设备端测量。

Comments 11 pages, 4 figures, 4 tables. Code: https://github.com/ABrain-One/nn-gpt

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01425 2026-08-04 cs.MA cs.LG 新提交 86%

Training Small LLMs as Spatial Multi-Agent Policies

将小型大语言模型(LLM)训练为空间多智能体策略

Yi Mao, Andrew Perrault

专题命中 指令微调 :LLM(title_cn,summary_cn);分类 cs.LG

AI总结 该研究针对小型冻结LLM在空间合作博弈中表现不佳的问题,通过机械合成可行性守卫构建符号选项库,用PA-MAGRPO训练LoRA适配器,实现了小型LLM的有效多智能体策略,并揭示奖励与合作解耦,需结合行为评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00015 2026-08-04 cs.AI 新提交 86%

Optimization and Constraint Modeling using LLMs with a Retrieval Augmented Generation Process

结合检索增强生成流程的大语言模型优化与约束建模

Prateek Roy, Akash Singirikonda

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出结合检索增强生成的大语言模型优化建模方法,通过合成数据集与检索指导提升Qwen 3 30B Instruct的优化建模准确率,为低成本部署LLM优化工具提供可行方案。

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01635 2026-08-04 cs.CV 新提交 86%

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01835 2026-08-04 cs.AI 新提交 85%

Rewriting or Reweighting? A Geometric Account in Language Models

重写还是重加权?语言模型中的几何视角

Juntong Wang, Shengkun Yang, Xiyuan Wang, Muhan Zhang

专题命中 指令微调 :language model(title);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本研究提出行为流形分析方法,通过ACT与NOC空间的几何视角,发现监督微调重写语言模型行为几何、奖励优化重加权该几何的机制差异,为理解后训练目标提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20449 2026-08-04 cs.CL 版本更新 85%

LM-mixup: Text Data Augmentation via Language Model based Mixup

LM-mixup:基于语言模型的混合文本数据增强方法

Zhijie Deng, Zhouan Shen, Ling Li, Yao Zhou, Zhaowei Zhu, Yanji He, Wei Wang, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) BIAI, ZJUT & D5Data.ai(BIAI、ZJUT及D5Data.ai)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);instruction tuning(abstract);分类 cs.CL

AI总结 本文提出LM-Mixup方法,通过构建MIXTURE数据集并结合监督微调与GRPO强化学习,仅用3%的蒸馏数据即可高效增强低质量指令跟随数据,提升LLMs的指令微调效率与性能。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00181 2026-08-04 cs.SE cs.AI 新提交 84%

Cross-Benchmark Generalization in Long-Horizon Agents

长视野智能体的跨基准泛化

Sushant Mehta, Logan Ritchie, Liudas Panavas, Edwin Chen

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.AI

AI总结 本研究针对长视野智能体,通过两阶段SFT-再-RL流程后训练Qwen3.5-122B-A10B模型,在5项外部基准实现性能提升,证明长视野多工具后训练的工作方式可跨领域迁移。

Comments Accepted at the COLM 2026 Workshop on Agent Behavior. 11 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16637 2026-08-04 cs.AI 版本更新 84%

TopoTuner: Topological Finetuning of Large Language Models

TopoTuner:大语言模型的拓扑微调

Abdulkadir Erol, Yash Mahajan, Vepaul Hariprashad, Baha Rababah, Santu Karmaker, Cuneyt G. Akcora, Mubarak Shah

机构 * University of Central Florida(中佛罗里达大学) University of Manitoba(曼尼托巴大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.AI

AI总结 研究针对大语言模型微调成本高及LoRA不足的问题,提出TopoTuner框架,通过拓扑引导选择性冻结注意力投影矩阵,从源数据集学习可复用冻结配置文件,在多模型上效果优于LoRA且大幅减少训练时间和参数更新量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01899 2026-08-04 cs.CV cs.CL cs.LG 新提交 84%

SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

SpatioLM:面向视觉-语言模型的通用物理空间智能

Jing Wu, Jianhua Wu, Jiayi Guan, Jiahong Chen, Jinghui Lu, Hangjun Ye, Bingzhao Gao, Long Chen

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 SpatioLM是一种参数高效的视觉-语言模型,通过内置空间视觉模块和伪深度、相机监督提升空间智能,在VSI-Bench获71.6分,还可迁移至具身操纵任务,同时保留通用能力。

Comments 27 pages,13 figures,16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00335 2026-08-04 cs.AI cs.CL cs.LG 新提交 83%

RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning

RMSWeb:面向Web智能体强化学习的反思、失败模式挖掘与Salvage-DS

Chengbo Liu, Lifang Zhou, Ruijie Yan, Pei Tan, Ao Sun, Haojun Huang, Guichun Hua, Sining Wei, Yining Chen, Yingying He, Yutao Xie

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RMSWeb是针对Qwen3-VL-Instruct 8B和32B模型的Web智能体强化学习方案,通过三部分技术提升训练效率与性能,在多个Web基准数据集上较SFT取得显著提升,且8B模型获同规模开源模型最优Online-Mind2Web结果。

Comments 15 pages, 9 figures, and 6 tables. Includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01862 2026-08-04 cs.AI 新提交 83%

Wnuan: Staged Post-Training for Question Answering over Proprietary Enterprise Knowledge

Wnuan:针对专有企业知识的问答模型分阶段后训练方法

Xiaofeng Shi, Xiaosong Qiu, Wenxin Ma, Qian Kou, Yiming Pan, Longbin Yu, Ying Liu, Haiping Wang, Hua Zhou

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 指令微调 :post-training(title);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 Wnuan是针对专有企业知识的问答模型分阶段后训练方法,通过三阶段流程提升WnuanBench的可接受答案率,同时需控制通用能力的损耗。

Comments 22 pages, 10 figures. Includes Supplementary Appendices A--L. Xiaofeng Shi and Xiaosong Qiu contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21369 2026-08-04 cs.LG 版本更新 83%

Rethinking Federated Graph Foundation Models: A Graph-Language Alignment-based Approach

重新思考联邦图基础模型:基于图-语言对齐的方法

Yinlin Zhu, Di Wu, Xianzhi Zhang, Yuming Ai, Xunkai Li, Miao Hu, Guocong Quan

机构 * Sun Yat-sen University, Guangzhou, China(中山大学) Beijing Institute of Technology, Beijing, China(北京理工大学)

专题命中 指令微调 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 FedGALA通过图-语言对齐解决联邦图基础模型中的语义-结构正交性问题,提升多任务适应性与效率

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09842 2026-08-04 cs.LG cs.CL 版本更新 82%

From Direction to Magnitude: How Multimodal Instruction-Tuning Reorganizes the Geometric Encoding of Identity-Specifying Prompts in Transformer Hidden States

从方向到大小:多模态指令微调如何在Transformer隐藏状态中重新组织身份指定提示的几何编码

Jorge A. Castillo, Marco Torres Yévenes, Juan Carlos Lanas

机构 * Axis Dynamics SpA(轴动力公司)

专题命中 指令微调 :language model(abstract);post-training(abstract);SFT(abstract);RLHF(abstract)

AI总结 研究四种训练后模式的Transformer语言模型,通过五个几何指标比较三种提示条件,发现多模态指令微调会使身份编码从方向重组为大小,此重组特定于该模式,还定位了W_1作为方法贡献。

Comments 16 pages, 8 tables. Working draft v0.3. Uses Ollivier-Ricci curvature and edge-wise Wasserstein-1 as primary geometric statistic; four models (Gemma-4-E4B, Gemma-4-E4B-it, DeepSeek-R1-Distill-Qwen-7B, Qwen2.5-7B-Instruct)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01458 2026-08-04 cs.CL 新提交 81%

PALMs: Using Multi Construct-Grounded Rationales for Modeling Population Preferences in LLMs

PALMs:使用多构造基础理由对大语言模型中的群体偏好进行建模

Priyanka Dey, Brihi Joshi, Preyashi Poddar, Jieyu Zhao, Emilio Ferrara

机构 * University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所)

专题命中 指令微调 :language model(abstract,abstract_cn);large language model(abstract);prompting(abstract);分类 cs.CL

AI总结 该研究提出了群体对齐语言模型PALMs,通过结合心理与文化构造的理由进行偏好调优,在多维度评估中优于基准模型,且下游任务泛化能力强

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01324 2026-08-04 cs.AI 新提交 81%

G-ReAct: Graph-Guided Deep Search via Structure-State Co-Evolution

G-ReAct:基于结构-状态协同演化的图引导深度搜索

Shaoxiong Yang, Mengyuan Zhang, Shaojun Lin, Chao Li, Wei Liu, Kun Shao, Jian Luan

专题命中 指令微调 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出图引导深度搜索框架G-ReAct,通过结构-状态协同演化解决现有LLM深度搜索的上下文遗忘等问题,仅用少量轨迹微调即提升模型在BrowseComp-ZH、XBench上的准确率,且推理时可增强现有LLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01106 2026-08-04 cs.CV cs.AI 新提交 81%

SG-Layout: Structured Scene Graph-Guided Layout Generation with LLMs

SG-Layout:基于结构化场景图引导的大语言模型布局生成方法

Junsheng Wang, Chao Chen, Mengying Xie, Mingyan Li, Fuqiang Gu

机构 * Chongqing University(重庆大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 SG-Layout通过两阶段训练将结构化空间知识融入LLMs,在三类任务中提升了空间推理与几何一致性,尤其适配关系密集的复杂场景。

Comments 16 pages, 5 figures. Accepted at WAICA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11133 2026-08-04 cs.LG cs.CL 版本更新 81%

Just on Time: Token-Level Early Stopping for Diffusion Language Models

准时完成:扩散语言模型的标记级早期停止

Zakhar Kohut, Severyn Shykula, Mykola Vysotskyi, Serhii Dmytryshyn, Dmytro Khamula, Michal Zakrzewski, Damian Rynczak, Jacek Małecki, Taras Rumezhak, Volodymyr Karpiv

专题命中 指令微调 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种无需训练的标记级早期停止方法,通过动态确定标记收敛点,减少扩散步骤并提升生成效率。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02407 2026-08-04 cs.CR cs.AI 新提交 79%

Antares: Foundation Models for Agentic Vulnerability Localization

Antares:用于智能体漏洞定位的基础模型

Supriti Vijay, Aman Priyanshu, Didier Chapoteau, Arthur Goldblatt, Jianliang He, Kimia Majd, Fraser Burch, Baturay Saglam, Takahiro Matsumoto, Zhuoran Yang, Amin Karbasi

专题命中 指令微调 :foundation model(title);language model(abstract);分类 cs.AI

AI总结 该研究提出基于IBM Granite的Antares系列紧凑语言模型,经两阶段训练用于智能体漏洞定位,其30亿参数版本性能接近GPT-5.5且远超更大模型,推理高效低成本。

Comments 57 pages, 12 figures, technical report for antares

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01751 2026-08-04 cs.CV cs.AI 新提交 79%

SPECTRA: Band-Routed Embedding and Stage-Wise LoRA for Cross-Sensor Fine-Tuning of Geospatial Foundation Models

SPECTRA:用于地理空间基础模型跨传感器微调的波段路由嵌入与分阶段LoRA

Xingyan Li, Jordan A. Caraballo-Vega, Jie Gong, Mark L. Carroll, Jianwu Wang

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校) NASA Goddard Space Flight Center(美国国家航空航天局戈达德太空飞行中心)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出SPECTRA框架,通过波段路由嵌入(BRE)解决地理空间基础模型的光谱不匹配问题,利用分阶段可迁移性感知LoRA(ST-LoRA)降低微调成本,在多数据集上验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01290 2026-08-04 cs.LG cs.DC 新提交 79%

FedChronos: Federated Fine-Tuning of Time-Series Foundation Models for Privacy-Preserving Commodity Price Forecasting

FedChronos:用于隐私保护商品价格预测的时间序列基础模型联邦微调

Amit Sharma, Nitin Auluck, Akramul Azim

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 FedChronos是用于时间序列基础模型联邦微调的框架,结合LoRA与差分隐私,在非IID商品价格联邦预测中实现隐私与准确性互补,适配边缘部署

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00622 2026-08-04 cs.CL 新提交 79%

A Heuristic Perspective on Debiasing Language Models

语言模型去偏的启发式视角

Tian Lan, Yemin Wang, Chuancheng Shi, Xiangyu Wu, Zesheng Shi, Yuan Wang, Jiang Li, Guanglai Gao, Xiangdong Su

机构 * Inner Mongolia University(内蒙古大学) Xiamen University(厦门大学) University of Sydney(悉尼大学) Nanjing University of Science and Technology(南京理工大学) Harbin Institute of Technology(哈尔滨工业大学) Zhejiang University(浙江大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 该研究针对现有语言模型去偏方法的局限,提出HEIMAT启发式自动去偏框架,经实验验证其可在保留NLU性能的同时有效缓解不同文化下的模型偏见。

Comments 13 pages in total, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17883 2026-08-04 cs.LG cs.CV 版本更新 79%

EEG-FM-Compass: Progress, Benchmarking, and Future Directions for EEG Foundation Models

EEG基础模型:进展、基准测试与开放问题

Dingkun Liu, Yuheng Chen, Zhu Chen, Zhenyao Cui, Yaozhi Wen, Jiayu An, Jingwei Luo, Dongrui Wu

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 本文研究了EEG基础模型的进展、基准测试与开放问题,通过评估12个开源模型和专用基线,发现线性探测不足,专用模型仍具竞争力,且大模型不必然提升泛化性能。

Journal ref National Science Review, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01896 2026-08-04 cs.CV 新提交 78%

GeoCore-9B: Towards Geo-Aware Generative Foundation Models in Earth Observation

GeoCore-9B:面向地球观测的地理感知生成基础模型

Jeonghyeok Do, Munchurl Kim

专题命中 指令微调 :foundation model(title,abstract)

AI总结 本文针对现有EO生成模型的地理空间约束冲突问题,推出90亿参数的GeoCore-9B,采用Flow Matching的DiT与地理空间元数据条件生成,结合地理空间语义对齐损失,在多项EO任务上实现最优性能。

Comments Please visit our project page at https://kaist-viclab.github.io/GeoCore-9B_site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00107 2026-08-04 cs.SE 版本更新 75%

The Illusion of Safety: Multi-Tier Verification of AI vs. Human C++ Code

安全的假象:AI与人类C++代码的多层验证

Saif Mahmud, Fadul Sikder, Yuede Ji, Haotian Zhang, Yu Lei

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出VULBENCH-CPP基准,通过四层验证发现AI生成C++代码的运行时违规率约为人类代码的两倍,静态分析会因代码长度产生安全假象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01369 2026-08-04 cs.AI cs.MA 新提交 74%

CRAFTS: Collaborative Role-Adaptive Fine-Tuning of LLM Agents for Chemical Process Simulation

CRAFTS:面向化工过程仿真的大语言模型智能体协同角色自适应微调

Ziyun Zhang, Yuxin Lin, Eldin Wee Chuan Lim, Xinghao Ding

机构 * National University of Singapore(新加坡国立大学) Xiamen University(厦门大学)

专题命中 指令微调 :LLM(title);分类 cs.AI

AI总结 CRAFTS 模仿化工工程师分阶段工作流,将仿真任务分配给7个角色,微调3个关键角色,基于 OpenIDAES-450 数据集验证,在82个保留案例上完成91.5%的合约,取得多项F1高分,实现可靠自动化化工过程模型构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01318 2026-08-04 eess.SP cs.AI cs.LG 新提交 73%

Sheaf-theoretic Signal Processing on Graphs: Spectral Theory, Filtering, and Sampling

基于层论的图上信号处理:谱理论、滤波与采样

Gabriele D'Acunto, Leonardo Di Nino, Paolo Di Lorenzo, Sergio Barbarossa

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文开发了统一的层信号处理框架,将信号处理基本操作扩展到异构局部空间,提出层傅里叶变换等方法,在多类数据集上验证其性能优于经典图信号处理基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00382 2026-08-04 cs.AI cs.LG 版本更新 73%

Efficiency vs. Alignment: Investigating Safety and Fairness Risks in Parameter-Efficient Fine-Tuning of LLMs

效率与对齐:研究大语言模型参数高效微调中的安全与公平风险

Mina Taraghi, Yann Pequignot, Amin Nikanjam, Mohamed Amine Merzouk, Foutse Khomh

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究发现良性参数高效微调会改变大语言模型的安全与公平性,基于适配器的方法更安全,基础模型和PEFT类型会影响对齐偏移,需按类别审计安全与公平性。

Comments Revised version with expanded experiments, robustness analyses, and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02276 2026-08-04 cs.AI 新提交 70%

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

Harness-R1:从智能体失败轨迹中学习编辑可执行运行时管控程序

Shuai Shao, Kangning Zhang, Qingyao Li, Shijian Wang, Hao Wang, Wenxiang Jiao, Yuan Lu, Yi Guo, Weiwen Liu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Southeast University(东南大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Harness-R1是首个基于智能体失败轨迹学习编辑可执行运行时管控程序的方法,经WebShop等基准测试,可提升Qwen3.5-9B智能体成功率,为管控程序与智能体协同进化提供了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏