arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-30 至 2026-06-30 共收录 603 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 51 篇

2408.04556 2026-06-30 cs.CL cs.LG 88%

BA-LoRA: Bias-Alleviating Low-Rank Adaptation to Mitigate Catastrophic Inheritance in Large Language Models

BA-LoRA: 降低偏差的低秩适应以减轻大语言模型中的灾难性继承

Yupeng Chang, Yi Chang, Yuan Wu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出BA-LoRA,通过引入一致性、多样性及SVD项正则化,缓解低秩适应中的灾难性继承问题,提升模型鲁棒性和公平性。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29371 2026-06-30 stat.AP 88%

Semantic insurance pricing with large language models

基于大语言模型的语义保险定价

Christopher Blier-Wong, Derek Kusmenko

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 利用预训练大语言模型从保单的自然语言描述中提取嵌入特征,替代手工特征输入标准精算定价模型,在法国车险数据上验证了其在小样本下的优势,并讨论了微调与提示敏感性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29097 2026-06-30 cs.CV 88%

TrafficAlign: Aligning Large Language Models for Traffic Scenario Generation

TrafficAlign: 对齐大语言模型用于交通场景生成

Zhi Tu, Liangkun Niu, Tianyi Zhang

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 提出TrafficAlign框架,利用真实驾驶视频合成交通场景并对齐大语言模型,生成场景使自动驾驶模型碰撞率提升10.8%,微调后碰撞率降低36.1%。

Comments Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), June 2026, pp. 39744-39754

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28649 2026-06-30 cs.CR cs.AI cs.RO 87%

RIPA: Sensory-Vector Prompt Injection Attacks on LLM-Controlled ROS 2 Robots

RIPA: 针对LLM控制的ROS 2机器人的感官向量提示注入攻击

Nima Dorzhiev

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI

AI总结 提出RIPA,首个通过感官管道对ROS 2机器人进行多通道提示注入攻击的系统研究,发现模型脆弱性不随规模单调变化,并提出混合语义防火墙。

Comments 12 pages, 4 figures, 10 tables, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30266 2026-06-30 cs.LG cs.AI 86%

Towards Continual Motion-Language Agents: LoRA Variants for Incremental Motion Understanding and Generation

迈向连续运动-语言智能体:用于增量运动理解与生成的LoRA变体

Bertram Taetz, Hugo Albuquerque Cosme da Silva, Gabriele Bleser-Taetz

机构 * IT & Engineering International University of Applied Sciences(IT与工程国际应用科学大学)

专题命中 指令微调 :language agent(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对运动-语言智能体在连续任务中学习新运动概念时灾难性遗忘的问题,提出基于LoRA的混合专家架构,通过自编码器路由器选择任务特定专家,无需任务标签,在HumanML3D基准上实现双向任务近零遗忘并保持高质量。

Comments 16 pages, 1 figure, Accepted at the Conference on Lifelong Learning Agents (CoLLAs) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30258 2026-06-30 cs.LG cs.AI 84%

KnowsTFM: Knowledge-Informed Fine-Tuning of Small Tabular Foundation Models

KnowsTFM:知识引导的小型表格基础模型微调

Boshko Koloski, Xiangjian Jiang, Senja Pollak, Blaž Škrlj, Mateja Jamnik, Nikola Simidjievski

机构 * Jožef Stefan Institute and Postgraduate School(乔塞夫·斯蒂芬研究所和研究生学院) Department of Computer Science and Technology, University of Cambridge, UK(剑桥大学计算机科学与技术系) Télécom Paris, Institut Polytechnique de Paris, FR(巴黎电信学院,巴黎理工学院)

专题命中 指令微调 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对专业领域数据稀缺且分布偏移的问题,提出通过知识图谱结构先验和参数高效低秩更新微调小型表格基础模型,在专业任务上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28843 2026-06-30 cs.CL cs.AI 82%

The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning

良性多语言微调的安全影响异质性

Will Hawkins, Kaivalya Rawal, Jonathan Rystrøm, Stratis Tsirtsis, Zihao Fu, Greta Warren, Ryan Brown, Eoin Delaney, Sandra Wachter, Brent Mittelstadt, Chris Russell

专题命中 指令微调 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过多语言良性数据微调LLM,发现安全结果对微调语言和评估语言高度敏感,对抗性合规率在某些设置下增加四倍,且多语言安全漂移与通用能力指标脱钩,呈现异质性。

Comments 9 pages

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05852 2026-06-30 cs.CL cs.AI 82%

Can Fine-Tuning Erase Your Edits? On the Fragile Coexistence of Knowledge Editing and Adaptation

微调是否会抹去你的修改?关于知识编辑与适应脆弱共存的研究

Yinjie Cheng, Paul Youssef, Christin Seifert, Jörg Schlötterer, Zhixue Zhao

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究探讨了微调对知识编辑的影响,发现微调会显著降低编辑效果,且仅微调编辑层可有效去除编辑,同时保持下游性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30263 2026-06-30 cs.CR cs.AI 81%

Defending Against Harmful Supervision Hidden in Benign Samples

防御隐藏在良性样本中的有害监督

Bang An, Yibo Yang, Dandan Guo, Ebtisam Alshehri, Carlos Hinojosa, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(卡塔尔国王 Abdullah 科学与技术大学) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 指令微调 :SFT(summary_cn,abstract);分类 cs.AI

AI总结 针对有害监督嵌入良性训练样本的攻击,提出基于双重参考的SFT方法(DR-SFT),通过令牌级正则化缓解有害微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29792 2026-06-30 cs.CL 81%

Are Humans Evolved Instruction Followers? An Underlying Inductive Bias Enables Rapid Instructed Task Learning

人类是进化而来的指令遵循者吗?一种潜在的归纳偏置使得快速指令任务学习成为可能

Anjishnu Kumar

机构 * Amazon Alexa AI Seattle, USA(亚马逊Alexa AI西雅图美国)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出人类具有进化形成的指令遵循偏置,即一种归纳偏置,使得从语言快速泛化行为成为可能,并类比大语言模型的指令微调,呼吁跨学科研究。

Comments 4 pages, Position Paper, Published at Neurips 2025 Workshop on Interpreting Cognition in Deep Learning Models - https://neurips.cc/virtual/2025/loc/san-diego/129741

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29265 2026-06-30 cs.CL 81%

MIThinker: A Plug-and-Play Policy-Optimized Thinker For Motivational Interviewing Counseling

MIThinker:一种用于动机性访谈咨询的即插即用策略优化思考器

Yizhe Yang, Palakorn Achananuparp, Heyan Huang, Jing Jiang, Ee-Peng Lim

机构 * Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) Australian National University(澳大利亚国立大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出轻量级思考模型MIThinker,通过逆向工程从咨询师回应中生成治疗性思考,结合监督微调和强化学习训练,以显式对齐咨询策略,提升动机性访谈咨询效果,计算量降低一个数量级。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29130 2026-06-30 cs.CL 81%

DistilledGemma: Balanced Efficiency-Accuracy for Person-Place Relation Extraction from Multilingual Historical Articles

DistilledGemma:面向多语言历史文章的人物-地点关系提取的平衡效率与准确性

Youssef Aboelwafa, Ahmed Samir, Nagwa Elmakky, Marwan Torki

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出DistilledGemma系统,采用三阶段知识蒸馏管道,从26B教师模型蒸馏到2.3B学生模型,在HIPE-2026共享任务中实现高效准确的人物-地点关系提取,标准测试集排名第三,二进制测试集排名第二。

Comments The Conference and Labs of the Evaluation Forum (CLEF) 2026 - HIPE Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28479 2026-06-30 cs.CR cs.AI 81%

Decomposing Memorization Reduction in Privacy-Preserving Fine-Tuning of SLMs for CSIRTs

面向CSIRTs的隐私保护微调中记忆化减少的分解

Cristhian Kapelinski, Diego Kreutz

机构 * Federal University of Pampa(帕纳马联邦大学)

专题命中 指令微调 :language model(abstract);small language model(abstract);SLM(abstract_cn);prompting(abstract)

AI总结 本文首次实证研究DP SGD与HMAC伪匿名化在微调1B-3B小语言模型时的交互作用,发现匹配更新控制可解释66%-132%的记忆化减少,HMAC减少40%-61%的暴露,但模型性能不足以实际应用。

Comments 7 tables, 51 references. Accepted for publication at the 36th Brazilian Conference on Intelligent Systems (BRACIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29579 2026-06-30 cs.CV cs.AI cs.LG cs.MM 81%

ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models

ScAle: 注意力头缩放作为视觉语言模型中空间推理的最小适配器

Rahul Chowdhury, Timothy A Rupprecht, Xuan Shen, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc.(EmbodyX公司) Zhejiang University(浙江大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出ScAle,一种超轻量适配方法,通过学习少量标量系数调节冻结骨干网络中的注意力头和MLP激活,仅用1K可训练参数在空间推理任务上实现高达134.1%的相对精度提升。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16903 2026-06-30 cs.LG 79%

Freeze, Prompt, and Adapt: A Framework for Source-free Unsupervised GNN Prompting

冻结、提示与适应:一种无源无监督GNN提示框架

Peyman Baghershahi, Sourav Medya

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 指令微调 :prompting(title,abstract);分类 cs.LG

AI总结 本文提出UGPP新场景,无需标签和源数据,通过一致性正则化和伪标签训练提示函数,解决GNN无监督提示问题,实验证明优于有监督方法。

Comments Accepted to TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24844 2026-06-30 cs.AI cs.CL 79%

Geo-Expert: Towards Expert-Level Geological Reasoning via Parameter-Efficient Fine-Tuning

Geo-Expert: 通过参数高效微调实现专家级地质推理

Chenyou Guo, Zongqi Liu, Yizhou Zhang, Zhaorui Jiang, Ze Liu

机构 * Ocean University of China(中国海洋大学) Peking University(北京大学) Monash University(墨尔本大学)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Geo-Expert,通过参数高效微调(LoRA)在定制高质量指令数据集上微调小规模语言模型,在专门的地质推理基准Geo-Eval上,8B模型超越70B通用模型和GPT-4o,32B模型接近前沿推理模型。

Comments 11 pages, 1 figure, 3 tables. Accepted at ICML 2026 AI for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11351 2026-06-30 cs.AI cs.LG 79%

Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization

推动主动代理的帕累托前沿:行为代理优化

Yihang Yao, Zhepeng Cen, Haohong Lin, Shiqi Liu, Zuxin Liu, Jiacheng Zhu, Zhang-Wei Hong, Laixi Shi, Ding Zhao

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出行为代理优化框架,通过增强和规范回合间行为,提升信息获取能力并抑制低效交互,从而在任务性能与用户参与间取得平衡,优于现有主动代理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29256 2026-06-30 stat.ML cs.LG 77%

Generalization Analysis of Transformers in Distribution Regression

Transformer在分布回归中的泛化分析

Peilin Liu, Ding-Xuan Zhou

机构 * School of Mathematics and Statistics, University of Sydney(悉尼大学数学与统计学学院)

专题命中 指令微调 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出基于分布回归的Transformer学习框架,通过注意力算子实现分布到函数表示的无损压缩,并证明其在学习复杂结构泛函上优于CNN和全连接网络,最后给出泛化界并解释大模型技术原理。

Journal ref Neural Computation 37(2):260-293, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28436 2026-06-30 cs.SE cs.AI 77%

Dockerless: Environment-Free Program Verifier for Coding Agents

Dockerless: 面向编码智能体的无环境程序验证器

Wenhao Zeng, Yuling Shi, Xiaodong Gu, Chao Hu, Chaofan Wang, Yuhao Cui, Hongting Zhou, Mengnan Qi, Jianqiao Wangni, Zhaojian Yu, Shuzheng Gao, Kai Cai, Shilin He

专题命中 指令微调 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 提出Dockerless,一种无需执行代码即可验证补丁正确性的智能体验证器,通过智能体仓库探索收集证据判断补丁正确性,在验证基准上超越最强开源验证器14.3 AUC点,并实现完全无环境的训练后流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09038 2026-06-30 cs.AI 77%

SearchSkill: Teaching LLMs to Use Search Tools with Evolving Skill Banks

SearchSkill: 教授大语言模型使用搜索工具与演进技能库

Jinchao Hu, Meizhi Zhong, Kehai Chen, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区计算机科学与技术学院) TikTok Inc, Beijing(字节跳动北京公司)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 SearchSkill通过可重用的搜索技能显式规划查询,提升开放域问答中的检索效率和推理质量,改进了知识密集型问答基准的精确匹配表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30473 2026-06-30 cs.CL cs.AI cs.IR cs.LG econ.GN q-fin.EC 75%

Field Order Should Not Matter: Permutation-Invariant Embedding Model Fine-Tuning for Structured Metadata Retrieval

字段顺序不应重要:面向结构化元数据检索的置换不变嵌入模型微调

Aivin V. Solatorio, Olivier Dupriez, Rafael Macalaba

机构 * Development Data Group(发展数据分析组) Office of the Chief Statistician, World Bank Group(世界银行集团首席统计官办公室)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出置换不变微调(PI-FT)方法,通过随机字段顺序和丢弃消除位置偏差,使嵌入模型关注字段标签而非位置,在开发统计数据集上以极小性能代价消除顺序变化带来的检索质量下降。

Comments 26 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29171 2026-06-30 cs.LG cs.AI cs.CL 75%

Symbolic Mechanistic Data Attribution: Tracing Training Influence to Learned Behavioral Policies

符号机制数据归因:追踪训练对学习行为策略的影响

Reza Habibi, Darian Lee, Magy Seif El-Nasr

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出符号机制数据归因(SMDA)框架,通过稀疏自编码器特征拟合岭回归,分解微调样本对行为策略的影响,揭示安全行为中的系统性漏洞和特征间干扰。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29082 2026-06-30 cs.CL cs.LG 73%

Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks

进化微调:在371个优化任务中学习发现

Young-Jun Lee, Seungone Kim, Minki Kang, Alistair Cheong Liang Chuen, Zerui Chen, Seungho Han, Taehee Jung, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学) Carnegie Mellon University(卡内基梅隆大学) KAIST(韩国科学技术院) University of Cambridge(剑桥大学) Hanyang University(翰阳大学) Amazon(亚马逊)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出进化微调(EFT)方法,通过将进化搜索轨迹转化为监督信号,教会大语言模型跨任务迭代优化解决方案,在22个保留任务上平均提升10.22%。

Comments Project page: https://open-galapagos.github.io/evolution_finetuning/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30518 2026-06-30 cs.CL 70%

Regime-Aware Peer Specialization for Robust RAG under Heterogeneous Knowledge Conflicts

基于体制感知的同行专业化方法,用于在异构知识冲突下实现稳健的检索增强生成

Bo Wang, Heyan Huang, Yaolin Li, Yanghao Zhou, Jiahao Teng, Ziyi Yang, Ge Shi, Chong Feng

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院)

专题命中 指令微调 :language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出RAPS-DA框架,通过样本级三体制划分(接地、仲裁、抵抗)和token级双选择器,解决RAG中异构知识冲突问题,在固定模型规模下超越多种基线。

Comments Working in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29960 2026-06-30 cs.CL 70%

IHDec: Divergence-Steered Contrastive Decoding for Securing Multi-Turn Instruction Hierarchies

IHDec:面向多轮指令层级安全性的散度引导对比解码

Nicole Geumheon Liu, Haeun Jang, Yonghyun Jun, Hwanhee Lee

机构 * Chung-Ang University(Chung-Ang大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对多轮对话中指令层级失效问题,提出基于Jensen-Shannon散度的无训练对比解码方法IHDec,自动检测并抑制越级指令,优于训练基线且保持响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29901 2026-06-30 eess.AS cs.AI 70%

Semi-Supervised Sound Event Detection with Conditional Mixup and Embedding-Level Contrastive Loss

基于条件混合和嵌入级对比损失的半监督声音事件检测

Nian Shao, Xian Li, Xiaofei Li

专题命中 指令微调 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 提出条件混合策略与嵌入级对比损失,解决半监督声音事件检测中混合增强在伪标签学习和对比学习中的角色冲突,在DESED验证集上达到SOTA。

Comments 6 pages; accepted by SMC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28996 2026-06-30 cs.LG cond-mat.mtrl-sci 70%

On Surrogate Modeling of Static Response of AM Short-Fiber Thermoplastics Using Graph Neural Networks

基于图神经网络的增材制造短纤维热塑性塑料静态响应代理建模

Pharindra Pathak, Vipin Kumar, Trenton M. Ricks, Suhasini Gururaja, Siddhartha Srivastava

机构 * Graduate Student, Department of Aerospace Engineering, Auburn University, Auburn, AL(航空航天工程系研究生,阿伯丁大学,阿伯丁,AL) Sr. R&D Staff Member, Manufacturing Science Division, ORNL, Knoxville, TN(制造科学部高级研发人员,ORNL,克里夫兰,TN) Research Aerospace Engineer, Multiscale and Multiphysics Modeling Branch, NASA Glenn Research Center, Cleveland, OH(多尺度和多物理场建模分支研究航空航天工程师,NASA格伦研究中心,克里夫兰,OH) Professor, Department of Aerospace Engineering, Auburn University, Auburn, AL(航空航天工程系教授,阿伯丁大学,阿伯丁,AL) Assistant Professor, Department of Aerospace Engineering, Auburn University, Auburn, AL(航空航天工程系助理教授,阿伯丁大学,阿伯丁,AL)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 提出一种数据驱动代理框架,结合图神经网络和长短期记忆网络预测增材制造短纤维热塑性塑料的力学行为,计算成本降低两个数量级,R²≈0.98。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03143 2026-06-30 cs.CV cs.AI 70%

Edit in 2D, Verify in 3D: Reinforcement Learning for Multi-view Consistent Scene Editing

二维编辑,三维验证:强化学习用于多视角一致场景编辑

Jiyuan Wang, Chunyu Lin, Lei Sun, Zhi Cao, Yuyang Yin, Lang Nie, Zhenlong Yuan, Xiangxiang Chu, Yunchao Wei, Kang Liao, Guosheng Lin

专题命中 指令微调 :foundation model(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出RL3DEdit框架,利用强化学习优化多视角一致的3D场景编辑,通过VGGT模型生成的置信度图和姿态误差作为奖励信号,提升编辑质量与效率。

Comments Accepted by ECCV 2026, 32 pages, 10 figures, with Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30251 2026-06-30 cs.MA 67%

TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

TACO:面向智能体工具使用的工具增强信用优化

Mingkuan Feng, Jinyang Wu, Hao Gu, Fangrui Lv, Ruihan Jin, Chuyuan Zhang, Zhengqi Wen, Jianhua Tao

专题命中 指令微调 :SFT(abstract,abstract_cn)

AI总结 提出TACO方法,通过差分答案探针奖励和结果门控优势路由,为代码工具智能体提供无监督工具贡献信用分配,提升多模态问答准确性并减少冗余工具调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27273 2026-06-30 cs.SD 版本更新 67%

Few-Shot Synthetic Accented Speech for ASR Fine-Tuning: What Helps and When?

少样本合成方言语音用于ASR微调:什么有助于什么?

Yurii Halychanskyi, Nimet Beyza Bozdag, Mark Hasegawa-Johnson, Dilek Hakkani-Tür, Volodymyr Kindratenko

机构 * University of Washington(华盛顿大学)

专题命中 指令微调 :LLM(abstract,abstract_cn)

AI总结 研究比较了合成方言语音在ASR微调中的有效性,发现随机音素扰动比目标方言音素编辑更有效,且真实语音与合成语音混合可稳定低资源微调。

Comments Accepted as a contributed talk and poster at the ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏