arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11211 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 917 篇

2607.05752 2026-07-08 cs.CL cs.AI 新提交 73%

When Should LLMs Search? Counterfactual Supervision for Search Routing

大语言模型何时应进行搜索?搜索路由的反事实监督

Minho Kim

机构 * Minho Kim

专题命中 指令微调 :language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型搜索路由问题,通过比较无搜索和强制搜索结果构建预言机,以其为评估标准和学习信号,用监督微调及偏好优化训练策略,提升了Gemma E2B和Qwen3.5 - 4B的路由宏F1,减少特定模型路由失败并揭示相关瓶颈。

Comments 20 pages, 10 figures. Accepted at the FAGEN Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01849 2026-07-03 cs.LG cs.AI cs.SD 新提交 73%

Decomposer: Learning to Decompile Symbolic Music to Programs

Decomposer: 学习将符号音乐反编译为程序

Yewon Kim, Apurva Gandhi, David Chung, Graham Neubig, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :LLM(abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出Decomposer框架,通过两阶段方法(合成数据微调+强化学习优化)将符号音乐反编译为可读、可编辑的程序,在MIDI重建保真度和代码可读性上优于基线。

Comments Project page: https://yewon-kim.com/decomposer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31963 2026-07-01 cs.LG cs.CL stat.ML 新提交 73%

Signed-Permutation Coordinate Transport for RMSNorm Transformers

RMSNorm Transformer的有符号排列坐标传输

John Sweeney

机构 * Sideplane AI

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 针对RMSNorm模型,提出有符号排列坐标传输方法,解决排列对齐不完整问题,在跨运行坐标恢复、工具迁移和训练状态保持上显著优于纯排列方法。

Comments 31 pages, 2 figures, 26 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25450 2026-06-26 cs.LG cs.CL 新提交 73%

The Generalization Spectrum: A Chromatographic Approach to Evaluating Learning Algorithms

泛化谱:一种评估学习算法的色谱方法

Jinghan Zhang, Zerui Cheng, Shiqi Chen, Ge Zhang, Wenhao Huang, Jiashuo Liu, Junxian He, Tianle Cai

机构 * ByteDance Seed(字节跳动Seed) Hong Kong University of Science and Technology(香港科技大学) Princeton University(普林斯顿大学) University of Oxford(牛津大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出泛化谱框架,通过构建从精确回忆到跨语言实现转移等不同转移距离的测试变体,揭示算法从单个样本泛化到其他样本的程度,并应用于竞争编程任务评估不同学习范式。

Comments Accepted at ICML 2026. 30 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21097 2026-06-26 cs.CL cs.LG 新提交 73%

GRAG: Generic Response-Augmented Generation Framework for Personalized Conversational Systems

GRAG:面向个性化对话系统的通用响应增强生成框架

Junfeng Liu, Christopher T. Symons, Ranga Raju Vatsavai

机构 * North Carolina State University(北卡罗来纳州立大学) Lirio, Inc.(Lirio公司)

专题命中 指令微调 :LLM(abstract_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出GRAG框架,通过离线通用响应解耦内容基础与个性化,使小模型在资源受限环境中专注于个性化注入,性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25821 2026-06-25 cs.CL cs.AI 新提交 73%

SARA: Unlocking Multilingual Knowledge in Mixture-of-Experts via Semantically Anchored Routing Alignment

SARA: 通过语义锚定路由对齐解锁混合专家模型中的多语言知识

Tianyu Dong, Yangyang Liu, Jiang Zhou, Xinwei Wu, Xiaohu Zhao, Hao Wang, Heng Liu, Linlong Xu, Longyue Wang, Weihua Luo, Shaolin Zhu, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院TJUNLP实验室) Alibaba Group, China(阿里巴巴集团)

专题命中 指令微调 :LLM(abstract_cn);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 针对低资源语言在稀疏MoE架构中路由不一致的问题,提出SARA框架,利用对称JS散度约束对齐多语言输入与高资源语义锚点的路由分布,提升低资源语言性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24007 2026-06-24 cs.LG cs.AI 新提交 73%

Fast and Slow Variational Continual Learning

快慢变分持续学习

Subarnaduti Paul, Yohan Jung, Mohammad Emtiyaz Khan, Siddharth Swaroop, Thomas Möllenhoff, Martin Mundt

机构 * University of Bremen(不来梅大学) Jeonbuk National University(全北国立大学) TU Darmstadt(达姆施塔特工业大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Hessian Center for AI (hessian.AI)(黑森人工智能中心) University College London(伦敦大学学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出通过合并过去后验实现慢适应,在IVON优化器中无缝集成快慢更新,形成持续IVON(CoVON)优化器,在领域增量学习、持续预训练和大语言模型微调中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22361 2026-06-23 cs.CL cs.AI 新提交 73%

First-Token Broadcasters: Mechanistic Origins of Language Identity and Distributed Robustness in Transformers

首个令牌广播者:Transformer中语言身份与分布式鲁棒性的机制起源

Arjun Pillai, Christian Hoang, Anjelo Jann Laroza

机构 * Irvington High School(欧文顿高中) GenAI4E Mapua University(马普阿大学)

专题命中 指令微调 :language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 通过因果干预方法LIHA,发现Transformer中少量注意力头(如GPT-2的L6H1)持续关注首个令牌并广播语言信号,且消融后补偿呈现层级前馈模式;指令微调将语言身份电路重组至早期层。

Comments Under review at BlackboxNLP (EMNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17680 2026-06-17 cs.LG cs.CL 新提交 73%

EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning

EnvRL: 在智能体强化学习中从环境动力学中学习

Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出EnvRL框架,通过状态预测和逆动力学两个辅助目标,将环境动力学学习融入智能体强化学习,在长周期任务中显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13705 2026-06-15 cs.LG cs.AI 新提交 73%

Can Editing 1 Neuron Fix Repetition Loops in LLMs?

编辑1个神经元能修复LLM中的重复循环吗?

Aristotelis Lazaridis, Aman Sharma, Dylan Bates, Brian King, Vincent Lu, Jack FitzGerald

机构 * Edgerunner AI

专题命中 指令微调 :LLM(title_cn);分类 cs.AI、cs.LG

AI总结 本文发现Gemma 4模型在长事实列举任务中高达95%的概率陷入重复循环,通过逐层消融和逐神经元归因定位到少量MLP神经元,并用静态权重编辑(小至单个神经元符号反转)消除循环,但无法解决因知识缺失导致的“末日循环”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13680 2026-06-12 cs.CL cs.AI 新提交 73%

Learning to Reason by Analogy via Retrieval-Augmented Reinforcement Fine-Tuning

通过检索增强强化微调进行类比推理学习

Zilin Xiao, Qi Ma, Chun-cheng Jason Chen, Xintao Chen, Avinash Atreya, Hanjie Chen, Vicente Ordonez

机构 * Meta Superintelligence Labs(Meta超级智能实验室) Rice University(莱斯大学)

专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出RA-RFT框架,通过黄金相关性蒸馏训练检索器,并结合强化微调利用类比推理轨迹,提升数学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11182 2026-06-10 cs.LG cs.AI 新提交 73%

EEVEE: Towards Test-time Prompt Learning in the Real World for Self-Improving Agents

EEVEE:面向真实世界自改进智能体的测试时提示学习

Weixian Xu, Shilong Liu, Mengdi Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Princeton University(普林斯顿大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出首个多数据集测试时提示学习框架EEVEE,通过路由器与提示协同进化策略解决跨数据集干扰,在异构数据流下提升鲁棒性。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08063 2026-06-09 cs.CV cs.AI cs.CL 新提交 73%

Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?

Robust-U1: MLLMs能否自我恢复受损视觉内容以实现鲁棒理解?

Jiaqi Tang, Jianmin Chen, Youyang Zhai, Wei Wei, Runtao Liu, Mengjie Zhao, Xiangyu Wu, Qingfa Xiao, Qifeng Chen

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Robust-U1框架,通过监督微调、强化学习和多模态推理,使多模态大模型具备显式视觉自恢复能力,在真实和对抗性损坏下达到最先进鲁棒性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08016 2026-06-09 cs.CV cs.AI cs.CL 新提交 73%

IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment

IEA:通过三阶段多任务对齐的业余友好型对话式图像编辑代理

Zichen Zhu, Yuheng Sun, Mingxuan Zhu, Wenjie Ma, Situo Zhang, Zhexiang Wang, Ziyue Yang, Danyang Zhang, Kunyao Lan, Zihan Zhao, Dingye Liu, Siqi Xiang, Lu Chen, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institution(上海创新研究院) Huawei Technologies Ltd.(华为技术有限公司) Nanyang Technological University(南洋理工大学) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出IEA对话式图像编辑代理,通过三阶段多任务训练学习操作参数化工具,实现可解释编辑轨迹,在像素距离和ROUGE-L指标上优于基线,用户研究中指令跟随和感知质量表现最佳。

Comments [CVPR 2026 Findings] Our data and code are released at https://github.com/OpenDFM/Image_Edit_Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07963 2026-06-09 cs.AI cs.CL 新提交 73%

Shared Latent Structures Enable Unified Backdoor Detection and Mitigation in LLMs

共享潜在结构实现大语言模型中的统一后门检测与缓解

Omar Mahmoud, Aly M. Kassem, Thommen George Karimpanal, Buddhika Laknath Semage, Negar Rostamzadeh, Golnoosh Farnadi, Santu Rana

机构 * Deakin University(迪肯大学) Mila, Quebec AI Institute(魁北克人工智能研究所Mila)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 发现大语言模型中多种后门攻击共享潜在机制,通过稀疏自编码器检测因果特征,并提出双向激活操控和概念消融微调实现统一检测与缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06946 2026-06-08 cs.CL cs.AI 新提交 73%

Auditing Training Data in Domain-adapted LLMs: LoRA-MINT

领域自适应大语言模型中的训练数据审计:LoRA-MINT

Gonzalo Mancera, Daniel DeAlcala, Aythami Morales, Julian Fierrez, Ruben Tolosana, Francisco Jurado

机构 * University of Granada(格拉纳达大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出LoRA-MINT方法,通过成员推理测试审计LoRA微调的大语言模型训练数据,在四个模型和三个基准上达到0.77-0.92的精度,优于现有基线。

Comments IEEE Conf. on Computers, Software, and Applications (COMPSAC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05393 2026-08-07 cs.CV 新提交 71%

Adapting Vision Foundation Models with Cascaded Semantics

利用级联语义适配视觉基础模型

Xi Xiao, Xingjian Li, Cheng Han, Tianyang Wang, Lin Zhao, Yunbei Zhang, Guosheng Hu, Runmin Jiang, Xi Li, Xiao Wang, Min Xu

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Carnegie Mellon University(卡内基梅隆大学) University of Missouri–Kansas City(密苏里大学堪萨斯城分校) Northeastern University(东北大学) Tulane University(杜兰大学) University of Bristol(布里斯托大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 指令微调 :foundation model(title)

AI总结 该研究针对现有视觉提示调优(VPT)未利用先验知识的问题,提出向VPT注入两类语义先验的级联方案,在34个图像分类数据集上仅调优0.74%的ViT参数即实现优异下游适配效果。

Comments Accepted by Transactions on Machine Learning Research (TMLR), 2026. Project page: https://xixiaouab.github.io/Cascaded-Semantics/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23335 2026-07-28 cs.CV 新提交 71%

The Gate Always Closes: On Injecting Auxiliary Signals into Frozen Vision-Language Models

门总是关闭:关于向冻结的视觉语言模型注入辅助信号

Moshiur Farazi, Sameera Ramasinghe, Bekir Sait Ciftler, Mahbub Ahmed Turza, Shafin Rahman

机构 * University of Doha for Science and Technology(多哈科技大学) Pluralis Research(普卢拉利斯研究公司) North South University(南北大学)

专题命中 指令微调 :language model(title)

AI总结 研究视觉语言模型中辅助信号注入问题,发现优化器常使门控路径关闭。利用抑制现象,通过双曲视觉关系图的几何辅助损失正则化LoRA微调,实验表明该方法能保持关系准确率,还指出嵌入范数对齐及固定注入的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30870 2026-07-01 cond-mat.mtrl-sci 新提交 71%

Adaptive fine-tuning of foundation models for crystal structure prediction: Discovery of high-pressure phases in the CaFeNi system

基础模型的自适应微调用于晶体结构预测:CaFeNi体系中高压相的发现

N. M. Chtchelkatchev, M. V. Magnitskaya, R. E. Ryltsev

专题命中 指令微调 :foundation model(title)

AI总结 提出一种结合进化搜索与自适应数据选择及微调的自洽基础模型辅助晶体结构预测工作流,通过迭代选择代表性结构进行DFT标记,高效探索Ca-Fe-Ni三元体系,预测了高压下稳定的新化合物Ca6FeNi。

Comments 10 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26942 2026-06-26 cs.CV 新提交 71%

TraMP-LLaMA: Generative Interpretability with Decoupled Instruction Tuning for Facial Expression Quality Assessment

TraMP-LLaMA: 基于解耦指令微调的生成式可解释性用于面部表情质量评估

Shuchao Duan, Alan Whone, Hossein Rahmani, Jun Liu, Majid Mirmehdi

机构 * School of Computer Science University of Bristol(布里斯托大学计算机科学学院) Translational Health Sciences University of Bristol(布里斯托大学转化健康科学学院) School of Computing and Communications Lancaster University(兰卡斯特大学计算与通信学院)

专题命中 指令微调 :instruction tuning(title)

AI总结 提出TraMP-LLaMA多模态框架,融合外观和轨迹特征,采用解耦指令微调策略,联合预测严重度并生成结构化文本报告,在PFED5-plus数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26379 2026-06-26 cs.CV 新提交 71%

Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models

基于可微搜索的视觉基础模型层特定提示融合发现

Xi Xiao, Xingjian Li, Yunbei Zhang, Cheng Han, Tianming Liu, Tianyang Wang, Runmin Jiang, Jihun Hamm, Xiao Wang, Min Xu

机构 * UAB(阿拉巴马大学伯明翰分校) CMU(卡内基梅隆大学) Tulane(杜兰大学) UMKC(密苏里大学堪萨斯分校) UGA(佐治亚大学) ORNL(橡树岭国家实验室)

专题命中 指令微调 :foundation model(title)

AI总结 研究视觉提示微调中提示与图像令牌的融合方案,提出可微架构搜索方法联合优化可学习提示及其融合方式,在34个数据集上取得一致提升。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21854 2026-06-23 eess.AS cs.SD 新提交 71%

ESPnet3: Infrastructure for Scalable Speech and Audio Research in the Foundation Model Era

ESPnet3:基础模型时代可扩展语音与音频研究的基础设施

Masao Someki, Alexander Polok, Carlos Carvalho, Chyi-Jiunn Lin, Da-Hee Yang, Jiatong Shi, Jinchuan Tian, Nelson Enrique Yalta Soplin, Samuele Cornell, Siddhant Arora, Francisco Teixeira, Wei Wang, William Chen, Alberto Abad, Chenda Li, Shinji Watanabe, Wangyou Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Brno University of Technology(布拉格技术大学) Instituto Superior Técnico(技术高等研究院) Hanyang University(翰阳大学) Hitachi Astemo(日立阿美士多) Shanghai Jiao Tong University(上海交通大学)

专题命中 指令微调 :foundation model(title)

AI总结 提出ESPnet3框架,通过模块化系统架构、配置驱动的数据集组合和统一Python工作流,实现大规模语音音频研究的高效训练与扩展,显著降低工程开销。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18707 2026-06-18 cs.CV 新提交 71%

PEFT-MedSAM: Efficient Fine-Tuning of Medical Foundation Models for Explainable Skin Lesion Segmentation

PEFT-MedSAM:面向可解释皮肤病变分割的医学基础模型高效微调

Asad Channa, Abdullah Khan, Asghar Ali Chandio, Aamir Akbar, Shahzad Memon, Aqib Hussain, Ameer Hamza

机构 * Department of Computer Science, Quaid-e-Awam University of Engineering, Sciences & Technology(计算机科学系,卡迪尔-阿瓦姆工程、科学与技术大学) Department of Artificial Intelligence, Quaid-e-Awam University of Engineering, Sciences & Technology(人工智能系,卡迪尔-阿瓦姆工程、科学与技术大学) Department of Computer Science, Sindh Madressatul Islam University, City Campus, Karachi(计算机科学系, Sind 阿里斯坦伊斯兰大学,卡拉奇城校区) Department of Computer Science and Digital Technologies, School of Architecture, Computing and Engineering, University of East London(计算机科学与数字技术系,建筑、计算与工程学院,东伦敦大学)

专题命中 指令微调 :foundation model(title)

AI总结 提出参数高效微调方法PEFT-MedSAM,冻结预训练编码器仅训练轻量解码器,在ISIC 2018上达到0.9411 Dice系数,并通过Grad-CAM可解释性增强临床可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15215 2026-08-18 stat.ML cs.LG 新提交 70%

The Distributional View of Knowledge Distillation

知识蒸馏的分布视角

Gordei Verbii, Juho Lee

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出知识蒸馏的分布视角,将教师表示为多温度视角族,形式化设计空间并证明相关结果,在Pythia模型实验中得出三条经验规律,发现最佳KD损失取决于上限间隙Γ。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16622 2026-08-18 cs.CV cs.AI 新提交 70%

HarmTrace: Anchor-Calibrated Decoupled Optimization for Fine-Grained Target Identification in Harmful Memes

HarmTrace:用于恶意梗图细粒度目标识别的锚定校准解耦优化方法

Yujia Li, Yiqun Zhang, Zihan Cheng, Yijie Huang, Tenglong Ye, Zihan Wang, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对多模态恶意梗图检测中存在的目标识别错误问题,提出HarmTrace框架,结合实体感知微调与CTPO方法,在Qwen3-VL-8B上JRA提升至52.51%,还构建了Meme3W数据集与JRA指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15956 2026-08-18 cs.AI 新提交 70%

Navigation-Informed Embeddings: Dense-Retriever Adaptation from Agent Search Traces

导航启发式嵌入:基于智能体搜索轨迹的密集检索器适配

Shrey Shah, Levent Ozgur

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出 NIE 方法,利用智能体检索轨迹无需额外标注即可适配密集检索器,在基准任务上提升了 Recall@20、长路径性能及 nDCG@10 指标,提供轻量适配通道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15930 2026-08-18 cs.AI cs.CV 新提交 70%

UI-Mate: Advancing Open-Weight Foundation GUI Agents with In-Context Demonstrations

UI-Mate:利用上下文内演示推进开放权重基础图形用户界面智能体

Zihan Ding, Longxu Dou, Qi Gao, Xiangwu Guo, Shengchao Hu, Zilong Huang, Zihang Jiang, Lei Ke, Mengcheng Lan, Weixian Lei, Hanxuan Li, Honglin Li, Xiyun Li, Zaitang Li, Leowei Liang, Xin Luo, Haozhe Ma, Jiayi Mao, Zhoujie Pan, Can Qin, Tianyuan Qu, Weiqi Wang, Wenkai Wang, Yonglin Wang, Yuxin Wang, Chenxu Wu, Yingchen Yu, Chenyu Zhang, Yuhao Zheng

机构 * Tencent Hy Frontier Team(腾讯 Hy 前沿团队)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 UI-Mate是集成环境基训练栈与上下文内演示学习的GUI智能体,在多计算机使用基准上创开放权重SOTA,提升了长周期办公任务的执行可靠性

Comments UI-Mate Technical Report. Project page: https://ui-mate.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14152 2026-08-17 cs.AI 新提交 70%

Towards Efficient Multimodal and Multilingual Opinion Extraction for STI: A QLoRA-Based Fine-Tuning Approach

面向科技情报(STI)的高效多模态多语言观点抽取:一种基于QLoRA的微调方法

Sheng Hong, Xuanqi Wang, Jiacheng Wang, Yuwei Wang

机构 * Beihang University(北京航空航天大学) Nanchang University(南昌大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对科技情报观点抽取的噪声过滤与结构化输出问题,提出基于QLoRA微调的多模态框架,在2194样本数据集上实现多语言观点抽取性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13951 2026-08-17 cs.AI 新提交 70%

HELIX: Model-Harness Co-evolution for Recursive Self-Improvement

HELIX:用于递归自我改进的模型-控制器协同进化

Tianyu Fan, Chao Huang

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI

AI总结 HELIX是支持模型-控制器协同进化的可溯源框架,在代码修复任务中,其65个候选组合提升了4.0%任务覆盖率,生成438条学习记录,形成模型、控制器与数据的反馈系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13495 2026-08-14 cs.CV cs.LG 新提交 70%

TraVEL: Trajectory-Guided Video Embedding Learning for Driving-Video Retrieval

TraVEL:面向驾驶视频检索的轨迹引导视频嵌入学习

Yi-Chung Chen, Philip Jacobson, Tom Lampo, Yiren Lu, Jin Yao, David I. Inouye, Jing Gao, Danhua Guo, Burhan Yaman

机构 * Uber AV Labs(优步自动驾驶实验室) Purdue University(普渡大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出TraVEL框架,将通用多模态嵌入模型适配到驾驶视频检索,结合轨迹监督与Group Relative Policy Optimization,在nuReasoning基准上提升了不同规模模型的运动相关检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏