arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11585 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11585 篇

2603.10904 2026-03-12 cs.SD cs.AI cs.ET 86%

When Fine-Tuning Fails and when it Generalises: Role of Data Diversity and Mixed Training in LLM-based TTS

当微调失效且泛化时:数据多样性与混合训练在基于大语言模型的文本到语音系统中的作用

Anupam Purwar, Aditya Choudhary

机构 * Sprinklr AI

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LoRA微调在语音克隆任务中的有效性,发现其在语音质量和信噪比提升方面优于基模型,尤其在数据多样性支持下表现更佳。

Comments We finetune the Qwen 0.5B backbone in an LLM TTS with LoRA to raise MOS speaker similarity and SNR. It works best with diverse training audio with uniform data it can amplify noise so tune decoding and use GGUF quantization for low latency stable quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27675 2026-02-05 cs.SE cs.CR cs.LG 86%

On the Difficulty of Selecting Few-Shot Examples for Effective LLM-based Vulnerability Detection

在有效基于LLM的漏洞检测中选择少样本示例的难度

Md Abdul Hannan, Ronghao Ni, Chi Zhang, Limin Jia, Ravi Mangal, Corina S. Pasareanu

机构 * Colorado State University(科罗拉多州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在基于LLM的漏洞检测中选择少样本示例的两种标准,并发现不同编程语言对示例选择的响应不同。

Comments Workshop on LLM Assisted Security and Trust Exploration (LAST-X) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.04379 2025-07-25 cs.LG cond-mat.mtrl-sci 86%

Fine-Tuned Language Models Generate Stable Inorganic Materials as Text

Nate Gruver, Anuroop Sriram, Andrea Madotto, Andrew Gordon Wilson, C. Lawrence Zitnick, Zachary Ulissi

机构 * NYU(纽约大学) Meta FAIR

专题命中 指令微调 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.LG

Comments ICLR 2024. Code available at: https://github.com/facebookresearch/crystal-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07877 2025-05-14 cs.NI cs.AI 86%

Efficient Telecom Specific LLM: TSLAM-Mini with QLoRA and Digital Twin Data

Vignesh Ethiraj, Divya Vijay, Sidhanth Menon, Heblin Berscilla

机构 * NetoAI Solutions Ltd(NetoAI解决方案有限公司)

专题命中 指令微调 :LLM(title,abstract);language model(abstract,comments);large language model(abstract);分类 cs.AI

Comments Introducing TSLAM-Mini, a specialized language model for telecommunications, demonstrating the efficacy of QLoRA fine-tuning and digital twin-synthesized data for enhanced network intelligence. Model available on: https://huggingface.co/NetoAISolutions/TSLAM-Mini-2B

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.19619 2024-07-30 cs.AI cs.SE 86%

Enhancing Code Translation in Language Models with Few-Shot Learning via Retrieval-Augmented Generation

Manish Bhattarai, Javier E. Santos, Shawn Jones, Ayan Biswas, Boian Alexandrov, Daniel O'Malley

专题命中 指令微调 :language model(title,abstract);LLM(abstract,comments);large language model(abstract);分类 cs.AI

Comments LLM for code translation

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11690 2024-02-20 cs.CL cs.CV 86%

Vision-Flan: Scaling Human-Labeled Tasks in Visual Instruction Tuning

Zhiyang Xu, Chao Feng, Rulin Shao, Trevor Ashby, Ying Shen, Di Jin, Yu Cheng, Qifan Wang, Lifu Huang

专题命中 指令微调 :instruction tuning(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL

Comments 8 Pages, visual instruction tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26654 2026-08-19 cs.CL cs.AI cs.CY cs.LG 版本更新 86%

Constitutional Midtraining: Content Presence Drives Alignment Gains

宪法式中间训练:内容存在驱动对齐增益

Desiree Cho, Cameron Tice, Bernie Hogan, Hunar Batra, Puria Radmard, Jun Zhao, Nigel Shadbolt

机构 * University of Oxford(牛津大学) Institute for Ethics in AI, University of Oxford(牛津大学人工智能伦理研究所) Geodesic Research Oxford Internet Institute, University of Oxford(牛津大学互联网研究院)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出宪法式中间训练方法,在中间训练中插入基于原则价值观的内容,可提升模型对齐的泛化性与持久性,削弱SFT灌输的敲诈倾向且不造成能力损失,为以SFT为中心的流程提供低成本补充方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00280 2026-08-05 cs.OS cs.SE 版本更新 86%

Benchmarking LLMs on File System Design and Implementation

在文件系统设计与实现上对大语言模型(LLMs)进行基准测试:优势、不足与缺陷

Yuqi Xue, Daixuan Li, Jian Huang

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出针对文件系统特定任务的LLM基准框架phi-Bench,含505项六类任务,测试开源与专有LLMs,揭示模型效率、失败原因及缓解技术,将开源phi-Bench。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01635 2026-08-04 cs.CV 新提交 86%

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07829 2026-07-29 cs.CL cs.AI cs.LG 版本更新 86%

Building Large-Scale English-Romanian Literary Translation Resources with Open Models

构建大规模英语-罗马尼亚文学翻译资源的开放模型

Mihai Nadas, Laura Diosan, Andreea Tomescu, Andrei Piscoran

机构 * Babeș-Bolyai University(巴克斯-波耶_ai大学) KlusAI Labs(KlusAI实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出TF2框架,通过开放模型和大规模合成语料库构建英语-罗马尼亚文学翻译资源,实现高效、低成本的高质量翻译。

Comments 21 pages. Published version: Front. Artif. Intell. 9:1807431 (2026). Datasets and models released on Hugging Face

Journal ref Front. Artif. Intell. 9:1807431 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14926 2026-07-07 cs.CL cs.AI cs.LG 版本更新 86%

Parameter Efficient Multimodal Instruction Tuning for Romanian Vision Language Models

罗马尼亚视觉语言模型的参数高效多模态指令微调

George-Andrei Dima, Răzvan-Alexandru Smădu, Dumitru-Clementin Cercel

机构 * National University of Science and Technology(科学技术大学)

专题命中 指令微调 :language model(title);instruction tuning(title);分类 cs.CL、cs.AI、cs.LG

AI总结 针对罗马尼亚语这种低资源语言,通过翻译并扩展Flickr30K数据集,采用参数高效的LoRA方法微调开源视觉语言模型来降低多模态NLP资源差距,模型在视觉问答等任务中能力提升且语法错误减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31408 2026-07-01 cs.CR cs.OS 新提交 86%

EnclaveX: End-to-End Confidential AI with CPU/GPU TEEs

EnclaveX: 端到端机密AI与CPU/GPU TEE

Robert Schambach, Quoc Do Le, Sergei Arnautov, Christof Fetzer

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出结合CPU和GPU TEE的端到端工作流,通过Intel TDX和AMD SEV-SNP等机制保障AI/LLM应用的机密性和完整性,并评估了性能开销。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25987 2026-06-25 cs.CL cs.AI cs.LG 新提交 86%

Weave of Formal Thought

形式思维之织

Alexandre Bouayad

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出WoFT框架,结合完整语法约束解码与潜在变量微调,使语言模型生成语法有效代码并学习结构表示,在Python上降低14.3%交叉熵。

Comments Code is available at https://github.com/alexbouayad/formal

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23946 2026-06-23 cs.LG cs.AI cs.CL stat.ML 版本更新 86%

Explore-Execute Chain: Towards an Efficient Structured Reasoning Paradigm

探索-执行链:迈向高效的结构化推理范式

Kaisen Yang, Tinghe Zhang, Rushi Shah, Kaicheng Yang, Qinwei Ma, Dianbo Liu, Alex Lamb

机构 * Qizhi Institute(启智研究院) Dept. of Computer Science, Tsinghua University(清华大学计算机科学系) College of AI, Tsinghua University(清华大学人工智能学院) Engineering Department, National University of Singapore(新加坡国立大学工程系) Dept. of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) IIIS, Tsinghua University(清华大学人工智能研究院) College of Software, Northeastern University(东北大学软件学院)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出探索-执行链(E²C),将推理分为随机探索阶段(生成简洁高层计划)和确定性执行阶段(忠实执行计划),通过因果SFT和RL训练分离,在AIME'2024上以更少token超越思维树,并支持轻量领域适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18633 2026-06-18 cs.MA 新提交 86%

PersonalPlan: Planning Multi-Agent Systems for Personalized Programming Learning

PersonalPlan: 面向个性化编程学习的多智能体系统规划

Zhiyuan Wen, Jiannong Cao, Peng Gao, Haochen Shi, Wengpan Kuan, Bo Yuan, Xiuxiu Qi

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract,abstract_cn)

AI总结 提出PersonalPlan,一种两阶段多智能体规划器,通过分层SFT和奖励自适应GRPO生成可执行、个性化且具有教学支架的计划,在MAP-PPL数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16827 2026-06-16 cs.SE 新提交 86%

No Resource, No Benchmarks, No Problem? Evaluating and Improving LLMs for Code Generation in No-Resource Languages

无资源、无基准、无问题?评估和改进无资源语言的代码生成大语言模型

Alessandro Giagnorio, Alberto Martin-Lopez, Gabriele Bavota

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究无资源语言(LLM未见训练数据的语言)的代码生成问题,通过构建三个基准并实验提示技术、预训练和微调方法,提出权重差异迁移方法提升性能。

Comments Accepted for publication at IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16215 2026-06-16 cs.CL cs.AI cs.LG 新提交 86%

PACT: Privileged Trace Co-Training for Multi-Turn Tool-Use Agents

PACT: 多轮工具使用智能体的特权轨迹协同训练

Zhenbang Du, Jun Luo, Zhiwei Zheng, Xiangchi Yuan, Kejing Xia, Dachuan Shi, Qirui Jin, Qijia He, Shaofeng Zou, Yingbin Liang, Wenke Lee

机构 * Georgia Institute of Technology(佐治亚理工学院) Ohio State University(俄亥俄州立大学) University of Pennsylvania(宾夕法尼亚大学) Arizona State University(亚利桑那州立大学)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PACT框架,通过特权轨迹(专家轨迹)在训练时提供密集监督信号,结合轨迹条件RL和组件感知SFT损失,避免推理时依赖轨迹,显著提升多轮工具使用智能体的性能。

Comments Project page: https://zhenbangdu.github.io/pact-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15696 2026-06-16 cs.AI cs.CL cs.LG 新提交 86%

Do LLMs Reliably Identify Correct Information Units in Aphasic Discourse?

LLMs 能否可靠识别失语症语篇中的正确信息单元?

Jason M Pittman, Yesenia Medina-Santos, Anton Phillips, Brielle C. Stark

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究评估指令微调大语言模型在零样本和少样本提示下对失语症语篇进行词级正确信息单元分类的性能,发现少样本提示可提升效果但一致性仍不足。

Comments 5 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11854 2026-06-11 cs.LG cs.AI cs.CL 新提交 86%

Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training

使用ART微调多模态大语言模型:基于艺术的强化训练

Michal Chudoba, Sergey Alyaev, Petra Galuscakova, Tomasz Wiktorski

机构 * University of Stavanger(斯塔万格大学) NORCE Research(NORCE研究机构)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出ART方法,通过优化原始视觉输入将信息注入冻结的多模态大语言模型,实现软提示微调,无需修改计算图,在数学和工具使用基准上达到与LoRA相当的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09393 2026-06-09 cs.CV 新提交 86%

CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning

CapRL++:基于可验证奖励的统一强化学习用于密集图像和视频描述生成

Penghui Yang, Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Yibin Wang, Yujie Zhou, Jiazi Bu, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Microsoft(微软) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Alibaba Cloud(阿里云) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);language model(abstract);pretraining(abstract)

AI总结 提出CapRL++框架,利用可验证奖励的强化学习(RLVR)优化多模态描述生成,通过非视觉语言模型回答问题的准确性作为奖励,提升密集描述质量,在20多个基准上超越传统监督微调。

Comments 26 pages, 10 figures. Project page: https://github.com/InternLM/CapRL. arXiv admin note: text overlap with arXiv:2509.22647

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07246 2026-06-08 cs.AR 新提交 86%

MailoHLS: Multi-Adapter Structure-Aware Learning for Pareto-Driven HLS Pragma Optimization

MailoHLS: 面向帕累托驱动HLS编译指示优化的多适配器结构感知学习

Elena Vouvali, Dimosthenis Masouros, Aggelos Ferikoglou, Dimitrios Soudris, Sotirios Xydis

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出MailoHLS混合框架,结合LLM语义推理与GNN结构建模,通过交叉注意力、目标条件LoRA适配器和帕累托优化,实现HLS编译指示的联合优化,在延迟优化上最高提速12.42倍,并持续生成近帕累托最优设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02400 2026-06-03 eess.AS 86%

SoulX-Transcriber: A Robust End-to-End Framework for Multi-Speaker Speech Transcription

SoulX-Transcriber:一个鲁棒的多说话人语音转录端到端框架

Yuhang Dai, Haopeng Lin, Zhennan Lin, Jiale Qian, Jun Wu, Hanke Xie, Hao Meng, Hanlin Wen, Chuang Ding, Shunshun Yin, Ming Tao, Lei Xie, Xinsheng Wang

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出SoulX-Transcriber,一个基于LLM的统一多说话人转录系统,通过两阶段训练策略联合建模说话人日志和ASR,提升复杂场景下的说话人区分和转录鲁棒性。

Comments 10 pages, 4 figures, 3tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22190 2026-05-27 cs.LG cs.AI cs.CL 86%

GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL

GUI-Libra:训练原生GUI代理进行推理与行动——基于动作感知监督和部分可验证强化学习

Rui Yang, Qianhui Wu, Zhaoyang Wang, Hanyang Chen, Ke Yang, Hao Cheng, Huaxiu Yao, Baolin Peng, Huan Zhang, Jianfeng Gao, Tong Zhang

机构 * UIUC(伊利诺伊大学香槟分校) Microsoft(微软) UNC-Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出GUI-Libra训练方案,通过动作感知SFT和部分可验证RL中的KL正则化,解决GUI代理在长程导航任务中推理与定位冲突及部分可验证性问题,显著提升步骤准确率和任务完成率。

Comments 57 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22655 2026-05-22 cs.CR cs.SE 86%

Do Fine-Tuned LLMs Understand Vulnerabilities? An Investigation into the Semantic Trap

细调的大语言模型理解漏洞吗?对语义陷阱的调查

Feiyang Huang, Yuqiang Sun, Fan Zhang, Ziqi Yang, Han Liu, Yang Liu

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了细调的大语言模型是否真正理解漏洞的根本原因,发现了一种称为语义陷阱的现象,并提出了一种评估框架来检测这种现象。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11208 2026-05-19 cs.CV 86%

Hi-GaTA: Hierarchical Gated Temporal Aggregation Adapter for Surgical Video Report Generation

Hi-GaTA:用于外科视频报告生成的分层门控时间聚合适配器

Kedi Sun, Chaohui Dang, Yue Feng, James Glasbey, Theodoros N. Arvanitis, Le Zhang

机构 * School of Engineering, College of Engineering and Physical Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学工程学院) School of Computer Science, University of Birmingham, Birmingham, UK(英国伯明翰大学计算机科学学院) Department of Applied Health Sciences, University of Birmingham, Birmingham, UK(英国伯明翰大学应用健康科学系)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Hi-GaTA框架,通过时间聚合压缩长视频序列生成LLM兼容的视觉前缀令牌,结合预训练的外科专用视频编码器和LoRA微调,实现高质量外科报告生成。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01679 2026-05-18 cs.LG cs.AI cs.CL 86%

Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling

融合监督学习与强化学习微调的前缀采样

Zeyu Huang, Tianhao Cheng, Zihan Qiu, Zili Wang, Yinghui Xu, Edoardo M. Ponti, Ivan Titov

机构 * ILCC, University of Edinburgh(爱丁堡大学ILCC) Fudan University(复旦大学) Qwen Team, Alibaba Group(阿里集团Qwen团队) ILLC, University of Amsterdam(阿姆斯特丹大学ILLC)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Prefix-RFT方法,结合示范数据与探索学习,通过数学问题验证其有效性,超越了单独SFT和RFT以及混合策略方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11608 2026-05-13 cs.CL cs.AI cs.LG 86%

PRISM: A Geometric Risk Bound that Decomposes Drift into Scale, Shape, and Head

PRISM: 一种将漂移分解为尺度、形状和头部的几何风险界

Chieh-Yen Lin, Shao-Hua Sun

机构 * Appier AI Research(Appier人工智能研究院) National Taiwan University(国立台湾大学)

专题命中 指令微调 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PRISM通过分析LLM的线性输出头和近等距结构,推导出交叉熵风险差的闭式上界,将漂移分解为尺度不匹配、形状不匹配和头部分歧三个可测量轴,用于指导变体排序和缓解灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07132 2026-05-11 cs.HC 86%

From Standard English to Singlish: A Retrieval-Augmented Approach for Code-Switched Creole Generation in Large Language Models

从标准英语到新加坡英语:一种检索增强的方法用于大型语言模型中的克里奥尔生成

Foong Ming Lai, Yujin Tan, Han Meng, Yi-Chieh Lee

专题命中 指令微调 :large language model(title);language model(title);prompting(abstract)

AI总结 本文提出一种检索增强生成框架,通过外部化方言知识实现受控的克里奥尔语言生成,无需微调,通过稀疏词法替换指导生成,实验表明其在自然度和语义保留方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21479 2026-05-01 cs.CV 86%

Frozen LLMs as Map-Aware Spatio-Temporal Reasoners for Vehicle Trajectory Prediction

冻结的大语言模型作为具有地图意识的时空推理器用于车辆轨迹预测

Yanjiao Liu, Jiawei Liu, Xun Gong, Zifei Nie

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用冻结的大语言模型作为时空推理器,通过交通编码器提取轨迹特征并结合轻量CNN处理地图信息,评估LLM在动态交通代理行为和道路拓扑理解中的能力,提升轨迹预测的准确性与泛化性。

Comments Accepted for publication at IEEE Intelligent Vehicles Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07084 2026-04-21 cs.LG cs.AI cs.CL 86%

Countdown-Code: A Testbed for Studying The Emergence and Generalization of Reward Hacking in RLVR

Countdown-Code:研究RLVR中奖励黑客现象涌现与泛化的测试平台

Muhammad Khalifa, Zohaib Khan, Omer Tafveez, Hao Peng, Lu Wang

机构 * University of Michigan(密歇根大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Countdown-Code测试环境,通过分离代理奖励与真实奖励,研究LLM在监督微调中无意学习奖励黑客行为及其在强化学习中的泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏