arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-07 至 2026-04-07 共收录 396 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 34 篇

2604.04872 2026-04-07 cs.CL cs.LG 79%

Synthetic Sandbox for Training Machine Learning Engineering Agents

合成沙盒用于训练机器学习工程代理

Yuhang Zhou, Lizhu Zhang, Yifan Wu, Jiayi Liu, Xiangjun Fan, Zhuokai Zhao, Hong Yan

机构 * Meta AI

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SandMLE框架,通过生成多样化的合成机器学习工程环境,显著提升机器学习工程代理的训练效率,实现大规模在线策略学习,并在多个基准测试中取得显著性能提升。

Comments 28 pages, 9 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27139 2026-04-07 cs.CV 78%

The Geometry of Robustness: Optimizing Loss Landscape Curvature and Feature Manifold Alignment for Robust Finetuning of Vision-Language Models

鲁棒性几何:优化损失景观曲率和特征流形对齐以增强视觉-语言模型的鲁棒微调

Shivang Chopra, Shaunak Halbe, Chengyue Huang, Brisa Maneechotesuwan, Zsolt Kira

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出GRACE框架,通过联合调节参数空间曲率和特征空间不变性,提升视觉-语言模型在分布内准确率、分布外泛化和对抗鲁棒性之间的平衡,实验显示在ImageNet微调中ID准确率提升10.8%,对抗准确率提升13.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03388 2026-04-07 cs.LG stat.ML 77%

Scalable Variational Bayesian Fine-Tuning of LLMs via Orthogonalized Low-Rank Adapters

通过正交化低秩适配器实现大规模语言模型的可扩展变分贝叶斯微调

Haotian Xiang, Bingcong Li, Qin Lu

机构 * School of Electrical and Computer Engineering, University of Georgia(佐治亚大学电气与计算机工程学院) Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出PoLAR-VBLL框架,通过正交化低秩适配器与变分推断结合,实现大规模语言模型的可扩展贝叶斯微调,提升不确定性量化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03240 2026-04-07 cs.LG cs.AI cs.CL 75%

Scaling DPPs for RAG: Density Meets Diversity

在RAG中扩展DPPs:密度与多样性

Xun Sun, Baiheng Xie, Li Huang, Qiang Gao

机构 * Southwestern University of Finance and Economics(西南财经大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ScalDPP,通过轻量级P-Adapter整合DPPs,实现RAG中密度与多样性的联合优化,通过DML损失确保互补证据链的优先级,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04898 2026-04-07 cs.AI cs.CL cs.LG 67%

QED-Nano: Teaching a Tiny Model to Prove Hard Theorems

QED-Nano:用小型模型证明难题定理

LM-Provers, Yuxiao Qu, Amrith Setlur, Jasper Dekoninck, Edward Beeching, Jia Li, Ian Wu, Lewis Tunstall, Aviral Kumar

机构 * CMU(卡内基梅隆大学) Hugging Face ETH Zurich(苏黎世联邦理工学院) Project Numina

专题命中 指令微调 :SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出QED-Nano模型,通过三个阶段训练在数学竞赛证明任务中超越大模型,以较低成本实现高性能证明生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03113 2026-04-07 cs.SE 67%

PAFT: Preservation Aware Fine-Tuning for Minimal-Edit Program Repair

PAFT:面向最小编辑程序修复的保留意识微调

Boyang Yang, Zijian Cai, Shunfu Jin, Haoye Tian

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 PAFT通过保留意识微调方法,在Defects4J和HumanEval-Java上将pass@1提升65.6%,同时降低平均编辑距离32.6%,实现更小、更局部化的合理补丁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04411 2026-04-07 cs.CL cs.AI cs.CV 62%

Responses Fall Short of Understanding: Revealing the Gap between Internal Representations and Responses in Visual Document Understanding

响应未能揭示理解:揭示视觉文档理解中内部表征与响应之间的差距

Haruka Kawasaki, Ryota Tanaka, Kyosuke Nishida

机构 * Human Informatics Labs., NTT, Inc.(日本电信电话株式会社人类信息学实验室)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了视觉文档理解中内部表征与生成响应之间的差距,发现任务所需信息在中间层更线性编码,并通过微调中间层提升性能。

Comments Accepted to CVPR2026 workshop (MULA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06391 2026-04-07 cs.CL cs.AI 62%

HatePrototypes: Interpretable and Transferable Representations for Implicit and Explicit Hate Speech Detection

HatePrototypes: 用于隐性与显性仇恨言论检测的可解释且可迁移的表示

Irina Proskurina, Marc-Antoine Carpentier, Julien Velcin

机构 * Laboratoire Hubert Curien, UMR CNRS 5516(于贝尔·居里实验室,法国国家科学研究中心5516联合研究单位) Université Lumière Lyon 2(里昂第二大学) Université Claude Bernard Lyon 1(克洛德·贝尔纳里昂第一大学) ERIC, Lyon(里昂ERIC实验室) École Centrale de Lyon(里昂中央理工学院) LIRIS CNRS UMR 5205(LIRIS实验室,法国国家科学研究中心5205联合研究单位)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HatePrototypes,通过语言模型优化的类级向量表示,实现显性和隐性仇恨言论的跨任务迁移,无需重复微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01168 2026-04-07 cs.CL cs.LG 62%

S0 Tuning: Zero-Overhead Adaptation of Hybrid Recurrent-Attention Models

S0调优:混合循环-注意模型的零开销适应

Jack Young

机构 * Indiana University(印第安纳大学)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.LG

AI总结 S0调优通过零推理开销优化循环层状态矩阵,提升HumanEval性能10.8个百分点,且在多个任务中展示出显著的跨域迁移能力。

Comments 15 pages (10 main + 5 appendix), 3 figures, code at https://github.com/jackyoung27/s0-tuning

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12510 2026-04-07 cs.RO cs.AI cs.CL 62%

Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies

通过质量多样性提示生成实现视觉-语言-动作模型的红队测试以获得鲁棒的机器人策略

Siddharth Srikanth, Freddie Liang, Ya-Chuan Hsu, Varun Bhatt, Shihan Zhao, Henry Chen, Bryon Tjanaka, Minjune Hwang, Akanksha Saran, Daniel Seita, Aaquib Tabrez, Stefanos Nikolaidis

机构 * Thomas Lord Department of Computer Science, University of Southern California(南加州大学托马斯·洛德计算机科学系) Sony AI(索尼AI) Sibley School of Mechanical and Aerospace Engineering, Cornell University(康奈尔大学西布利机械与航空航天工程学院)

专题命中 指令微调 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Q-DIG方法,通过生成多样化且相关的语言指令来发现VLA模型的漏洞,提升机器人策略的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04448 2026-04-07 cs.LG cs.AI cs.CR 62%

RASA: Routing-Aware Safety Alignment for Mixture-of-Experts Models

RASA:面向混合专家模型的路由感知安全对齐

Jiacheng Liang, Yuhui Wang, Tanqiu Jiang, Ting Wang

机构 * Department of XXX, University of YYY(YYY大学XXX系) School of ZZZ, Institute of WWW(WWW学院ZZZ学院)

专题命中 指令微调 :language model(abstract);分类 cs.AI、cs.LG

AI总结 RASA通过针对性修复安全关键专家提升混合专家模型的安全性,有效防止路由绕过,实现高鲁棒性和跨攻击泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04839 2026-04-07 cs.CL 57%

MERIT: Multilingual Expert-Reward Informed Tuning for Chinese-Centric Low-Resource Machine Translation

MERIT: 多语言专家-奖励引导调优用于以中文为中心的低资源机器翻译

Zhixiang Lu, Chong Zhang, Chenyu Xue, Angelos Stefanidis, Chong Li, Jionglong Su, Zhengyong Jiang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 指令微调 :SFT(abstract);分类 cs.CL

AI总结 针对中文到低资源东南亚语言的机器翻译,MERIT框架通过语料预处理和奖励引导优化,显著提升了翻译质量,优于单纯模型扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03151 2026-04-07 cs.AI 57%

Enhancing Foundation VLM Robustness to Missing Modality: Scalable Diffusion for Bi-directional Feature Restoration

增强基础视觉语言模型对缺失模态的鲁棒性:可扩展的扩散用于双向特征恢复

Wei Dai, Haoyu Wang, Honghao Chang, Lijun He, Fan Li, Jian Sun, Haixia Bi

机构 * Department of Electronics Information \ 'an Jiaotong University Xi'an China School of Information Communications Engineering \ 'an Jiaotong University Xi'an China School of Mathematics Statistics \ 'an Jiaotong University Xi'an China Information \ 'an Jiaotong University Communications Engineering \ 'an Jiaotong University Statistics \ 'an Jiaotong University

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 本文提出一种通用缺失模态恢复策略,通过增强扩散模型实现双向特征对齐,提升视觉语言模型在模态缺失情况下的鲁棒性和可扩展性。

Comments 10 pages, 8 figures, 6 tables. Experiments and some details have been updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04701 2026-04-07 cs.CL 57%

XiYan-SQL: A Novel Multi-Generator Framework For Text-to-SQL

XiYan-SQL:一种新型多生成器框架用于文本到SQL

Yifu Liu, Yin Zhu, Yingqi Gao, Zhiling Luo, Xiaoxia Li, Xiaorong Shi, Yuntao Hong, Jinyang Gao, Yu Li, Bolin Ding, Jingren Zhou

机构 * Alibaba Cloud Computing Co., Ltd.(阿里云计算有限公司)

专题命中 指令微调 :LLM(abstract);分类 cs.CL

AI总结 本文提出XiYan-SQL框架,通过多生成器 ensemble 方法生成高质量SQL查询,并结合schema过滤和选择模型提升性能,实现在BIRD和Spider数据集上均取得SOTA结果。

Comments Published in IEEE TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01702 2026-04-07 cs.CL 57%

On the Role of Reasoning Patterns in the Generalization Discrepancy of Long Chain-of-Thought Supervised Fine-Tuning

在长链式思维监督微调中推理模式在泛化差异中的作用

Zhaoyi Li, Xiangyu Xi, Zhengyu Chen, Wei Wang, Gangwei Jiang, Ranran Shen, Linqi Song, Ying Wei, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) Meituan LongCat Team(美团龙猫团队) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 指令微调 :SFT(abstract);分类 cs.CL

AI总结 本文研究不同来源的长链式思维轨迹对模型泛化性能的影响,发现训练损失低并不一定带来更好的泛化能力,提出过滤频繁分支轨迹以提升SFT泛化性能。

Comments Under Review. version2: correct typos in Table 4 and add an ablation study (Table 5)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22783 2026-04-07 cs.IR cs.CV cs.LG cs.MM cs.SD 57%

Compact Hypercube Embeddings for Fast Text-based Wildlife Observation Retrieval

紧凑超立方体嵌入用于快速基于文本的野生动物观察检索

Ilyass Moummad, Marius Miron, David Robinson, Kawtar Zaher, Hervé Goëau, Olivier Pietquin, Pierre Bonnet, Emmanuel Chemla, Matthieu Geist, Alexis Joly

机构 * Inria, LIRMM, UM(法国国家信息与自动化研究所,蒙彼利埃计算机科学实验室,蒙彼利埃大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 本文提出紧凑超立方体嵌入框架,通过二进制表示实现高效文本检索,提升大规模野生动物图像和音频数据库的检索效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00721 2026-04-07 cs.CV cs.LG 57%

Common Inpainted Objects In-N-Out of Context

常见补全物体在上下文中的内-外场景

Tianze Yang, Tyson Jordan, Ruitong Sun, Ninghao Liu, Jin Sun

机构 * University of Georgia(佐治亚大学)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 COinCO数据集通过扩散补全技术生成97722张包含上下文一致和不一致场景的图像,用于研究上下文学习,支持细粒度上下文推理、基于上下文的物体预测和增强的假检测。

Comments The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04857 2026-04-07 cs.CV 50%

The Blind Spot of Adaptation: Quantifying and Mitigating Forgetting in Fine-tuned Driving Models

适应的盲区:量化和缓解在微调驾驶模型中的遗忘

Runhao Mao, Hanshi Wang, Yixiang Yang, Qianli Ma, Jingmeng Zhou, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab实验室)

专题命中 指令微调 :language model(abstract)

AI总结 本文首次系统研究驾驶模型中灾难性遗忘问题,提出Drive Expert Adapter框架,通过提示空间适应提升驾驶性能并保留通用能力。

Comments received by cvpr2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04183 2026-04-07 cs.CV 50%

Scale-Aware Vision-Language Adaptation for Extreme Far-Distance Video Person Re-identification

面向极端远距离视频人的规模感知视觉语言适应

Ashwat Rajbhandari, Bharatesh Chakravarthi

机构 * Arizona State University(亚利桑那州立大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出一种基于CLIP的视觉语言模型,通过升级视觉主干和引入选择性微调机制,提升远距离视频人重识别的鲁棒性,实验表明在DetReIDX基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04034 2026-04-07 astro-ph.SR 50%

Effects of Various Bipolar Approximations of Active Regions on Solar Surface Magnetic Field Simulations

不同双极近似方法对太阳表面磁场模拟的影响

Yukun Luo, Jie Jiang, Ruihui Wang

专题命中 指令微调 :SFT(abstract)

AI总结 本文研究了不同双极近似方法对太阳表面磁场模拟的影响,发现对称双极区域近似会系统性高估太阳活动极小期轴向偶极子强度,而形态不对称双极区域近似则与极性大小比密切相关。

Comments 11 pages, 6 figures, accepted for publication in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 12 篇

2604.04361 2026-04-07 cs.HC 91%

Developing Authentic Simulated Learners for Mathematics Teacher Learning: Insights from Three Approaches with Large Language Models

构建数学教师学习的真挚模拟学习者:基于三种方法与大语言模型的洞察

Jie Cao, Ha Nguyen, Selim Yavuz, Boran Yu, Shuguang Wang, Pavneet Kaur Bharaj, Dionne Cross Francis

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract);preference optimization(abstract)

AI总结 本文探讨三种方法提升模拟学生的真实性与教学效用,发现多代理和DPO方法能生成明确的解题策略解释,而微调模型虽生成真实回应但限制思维扩展。

Comments This paper has been accepted in AIED'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03671 2026-04-07 cs.IR 89%

User Simulator-Guided Multi-Turn Preference Optimization for Reasoning LLM-based Conversational Recommendation

基于用户模拟器的多轮偏好优化推理LLM对话推荐

Xingyuan Xiang, Xiangchen Pan, Wei Wei

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(title,abstract);SFT(abstract)

AI总结 本文提出SMTPO框架,通过多任务监督微调和强化学习优化多轮对话推荐,提升推荐准确性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04497 2026-04-07 cs.LG cs.AI cs.CL 88%

One Model for All: Multi-Objective Controllable Language Models

一个模型解决所有问题:多目标可控语言模型

Qiang He, Yucheng Yang, Tianyi Zhou, Meng Fang, Mykola Pechenizkiy, Setareh Maghsudi

机构 * Ruhr University Bochum(波鸿鲁尔大学) Eindhoven University of Technology(埃因霍温理工大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Liverpool(利物浦大学)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

AI总结 本文提出多目标控制(MOC),通过引入多目标优化原理训练单个语言模型,使其能根据用户偏好在帕累托前沿生成个性化输出,提升模型可控性、输出质量和泛化能力。

Comments Published in Transactions on Machine Learning Research (03/2026): https://openreview.net/forum?id=qAM5PmvFYY

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04261 2026-04-07 cs.LG cs.AI 84%

APPA: Adaptive Preference Pluralistic Alignment for Fair Federated RLHF of LLMs

APPA:自适应偏好多元对齐用于大语言模型公平联邦强化学习从人类反馈

Mahmoud Srewa, Tianyu Zhao, Salma Elmalaki

机构 * University of California, Irvine(加利福尼亚大学尔湾分校)

专题命中 后训练与偏好优化 :RLHF(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出APPA框架,通过动态调整群体奖励权重,提升联邦强化学习中多群体公平对齐效果,实验显示其在保持整体对齐性的同时,显著提升最差群体对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04855 2026-04-07 cs.LG 79%

The Role of Generator Access in Autoregressive Post-Training

生成器访问在自回归后训练中的作用

Amit Kiran Rege

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

AI总结 研究生成器访问对自回归后训练的限制,探讨学习者是否能返回已有前缀查询下一个词规则,分析不同控制方式对训练效果的影响。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03417 2026-04-07 cs.LG 77%

Beauty in the Eye of AI: Aligning LLMs and Vision Models with Human Aesthetics in Network Visualization

人工智能之眼中的美感:通过LLMs和视觉模型对网络可视化的人类美学对齐

Peng Zhang, Xuefeng Li, Xiaoqi Wang, Han-Wei Shen, Yifan Hu

机构 * Northeastern University(东北大学) Bosch AI Research(博世人工智能研究院) The Ohio State University(俄亥俄州立大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨利用LLMs和视觉模型作为人类判断的代理,通过用户研究收集人类偏好标签,提升网络可视化的人类美学对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22776 2026-04-07 cs.AI 70%

TSPO: Breaking the Double Homogenization Dilemma in Multi-turn Search Policy Optimization

TSPO:突破多轮搜索策略优化中的双重均质化困境

Shichao Ma, Zhiyuan Ma, Ming Yang, Xiaofan Li, Xing Wu, Jintao Du, Yu Cheng, Weiqiang Wang, Qiliang Liu, Zhengyang Zhou, Yang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tiansuan Lab, Ant Group Co., Ltd.(天算实验室,蚂蚁集团) Fudan University(复旦大学) East China Normal University(华东师范大学) Central South University(中南大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TSPO方法,通过引入首次出现潜在奖励机制,解决多轮搜索策略优化中的过程均质化和组内均质化问题,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04410 2026-04-07 cs.LG cs.AI cs.CL stat.ML 67%

Relative Density Ratio Optimization for Stable and Statistically Consistent Model Alignment

相对密度比优化用于稳定且统计一致的模型对齐

Hiroshi Takahashi, Tomoharu Iwata, Atsutoshi Kumagai, Sekitoshi Kanai, Masanori Yamada, Kosuke Nishida, Kazutoshi Shinoda

机构 * NTT, Inc.(日本电信电话株式会社) NTT DOCOMO, INC.(NTT DOCOMO公司)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种稳定且统计一致的模型对齐方法,通过相对密度比优化,改进了直接密度比优化的稳定性与收敛性。

Comments Code is available at https://github.com/takahashihiroshi/rdro

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11321 2026-04-07 cs.LG cs.AI cs.CL 67%

Hindsight-Anchored Policy Optimization: Turning Failure into Feedback in Sparse Reward Settings

回顾锚定策略优化:在稀疏奖励设置中将失败转化为反馈

Yuning Wu, Ke Wang, Devin Chen, Kai Wei

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HAPO策略优化方法,通过合成成功注入机制和 Thompson 采样启发的门控机制,解决稀疏奖励下策略优化的分布偏置问题,实现渐近一致性。

Comments Published as a conference paper ICLR 2026 CAO Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24936 2026-04-07 cs.CV cs.AI 57%

TIGFlow-GRPO: Trajectory Forecasting via Interaction-Aware Flow Matching and Reward-Guided Optimization

TIGFlow-GRPO:通过交互感知的流匹配和奖励引导优化进行轨迹预测

Xuepeng Jing, Wenhuan Lu, Hao Meng, Zhizhi Yu, Jianguo Wei

机构 * Tianjin University(天津大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出TIGFlow-GRPO,通过交互感知的流匹配和奖励引导优化,提升复杂环境下的轨迹预测准确性与稳定性,生成更符合社会规范和物理可行的轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏