MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning
MMDynOpt-Agent:基于强化学习的多模态大语言模型推理动态优化方法
专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract,abstract_cn)
AI总结 该研究针对多模态大语言模型推理效率不足的问题,提出MMDynOpt-Agent,通过强化学习将多模态推理动态优化建模为马尔可夫决策过程,结合多轮优化提示与多维度奖励机制,在15个公开数据集上性能优于基线方法。