arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18857 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18857 篇

2601.03416 2026-04-17 cs.CV 88%

GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models

GAMBIT:一种用于多模态大语言模型的游戏化突破框架

Xiangdong Hu, Yangyang Jiang, Qin Hu, Xiaojun Jia

机构 * Georgia State University(佐治亚州立大学) Shandong University(山东大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出GAMBIT框架,通过分解重组有害视觉语义并构建游戏化场景,使模型在探索和重建意图中主动完成突破,提升攻击成功率。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02709 2026-04-16 cs.CL cs.AI cs.LG cs.SE 88%

Evaluating the Formal Reasoning Capabilities of Large Language Models through Chomsky Hierarchy

通过乔姆斯基层级评估大语言模型的正式推理能力

Yihong Dong, Jianha Xiao, Xue Jiang, Xuyuan Guo, Zhiyuan Fan, Jiaru Qian, Kechi Zhang, Jia Li, Zhi Jin, Ge Li

机构 * Peking University(北京大学) Wuhan University(武汉大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ChomskyBench基准,通过乔姆斯基层级系统评估大语言模型的正式推理能力,揭示其在结构化语言处理中的性能分层及效率瓶颈。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07148 2026-04-14 eess.IV 88%

Q-Agent: Quality-Driven Chain-of-Thought Image Restoration Agent through Robust Multimodal Large Language Model

Q-Agent:通过鲁棒多模态大语言模型实现质量驱动的推理图像修复代理

Yingjie Zhou, Jiezhang Cao, Farong Wen, Zicheng Zhang, Yu Zhou, Yue Shi, Xiaohong Liu, Radu Timofte, Luc Van Gool, Guangtao Zhai

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出Q-Agent,通过Chain-of-Thought方法提升图像修复性能,结合鲁棒多模态大语言模型和客观图像质量评估,实现更高效的多退化处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06427 2026-04-09 cs.LG cs.AI cs.CL 88%

The Depth Ceiling: On the Limits of Large Language Models in Discovering Latent Planning

深度上限:大语言模型在发现潜在规划中的局限性

Yi Xu, Philipp Jettkant, Laura Ruis

机构 * University of Cambridge(剑桥大学) Imperial College London(帝国理工学院) MIT(麻省理工学院)

专题命中 推理与问题求解 :large language model(title);language model(title);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了大语言模型在无监督情况下发现多步规划策略的极限,发现模型在单次前向传递中能执行最多七步潜在规划,揭示了训练与测试时能力的差异。

Comments 10 pages, 3 figures, 1 table (30 pages, 9 figures, 10 tables including references and appendices)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01594 2026-04-08 cs.RO cs.CV 88%

MARS: Multi-Agent Robotic System with Multimodal Large Language Models for Assistive Intelligence

MARS:基于多模态大语言模型的多智能体机器人系统用于辅助智能

Renjun Gao

机构 * School of Computer Science and Engineering, Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院计算机科学与工程学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 MARS系统利用多模态大语言模型实现风险感知和个性化辅助,通过多智能体决策框架提升智能家庭机器人在动态环境中的表现。

Comments 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09575 2026-03-27 cs.RO 88%

Traffic Scene Generation from Natural Language Description for Autonomous Vehicles with Large Language Model

基于大语言模型的自然语言描述生成交通场景用于自动驾驶车辆

Bo-Kai Ruan, Hao-Tang Tsui, Yung-Hui Li, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Carnegie Mellon University(卡内基梅隆大学) AI Research Center, Hon Hai Research Institute(鸿海研究院人工智能研究中心)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出TTSG框架,通过自然语言生成可控交通场景,解决文本到空间布局、无预设位置场景构建及多智能体行为规划问题,实验表明其在安全关键场景中碰撞率低且提升驾驶 captioning 模型性能。

Comments Accepted by WAD@CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23265 2026-03-27 cs.CV 88%

SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models

SPR-128K:一种多模态大语言模型空间合理性推理的新基准

Zhiyuan Hu, Zheng Sun, Yi Wei, Long Yu

机构 * Tsinghua University(清华大学) Alibaba Health Information Technology Limited(阿里巴巴健康信息技术有限公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出SPR-128K数据集及DPA-GRPO方法,解决图像筛选中多模态大语言模型空间推理能力不足的问题,实验表明小型模型在该任务上优于主流模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21488 2026-03-24 cs.CV 88%

Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation

学习轨迹感知的多模态大语言模型用于视频推理分割

Jingnan Luo, Mingqi Gao, Jun Liu, Bin-Bin Gao, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出TrajSeg框架,通过双向文本轨迹对齐提升视频对象轨迹感知能力,采用帧级内容整合模块和统一掩码解码器实现端到端训练,实验表明其在视频推理分割任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16125 2026-03-17 cs.PL cs.SE 88%

LPO: Discovering Missed Peephole Optimizations with Large Language Models

LPO:利用大语言模型发现遗漏的窥视优化

Zhenyang Xu, Hongxu Xu, Yongqiang Tian, Xintong Zhou, Chengnian Sun

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出LPO框架,结合大语言模型与形式验证技术,发现此前遗漏的窥视优化,实验显示其在LLVM中发现大量有效优化。

Comments Accepted at ASPLOS 2026

Journal ref Proc. 31st ACM Intl. Conf. on Architectural Support for Programming Languages and Operating Systems (ASPLOS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01783 2026-03-03 cs.CV 88%

Harnessing Chain-of-Thought Reasoning in Multimodal Large Language Models for Face Anti-Spoofing

在多模态大语言模型中利用链式推理进行人脸反伪装

Honglu Zhang, Zhiqin Fang, Ningning Zhao, Saihui Hou, Long Ma, Renwang Pei, Zhaofeng He

机构 * Didi Chuxing(滴滴出行) Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Normal University(北京师范大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出FaceCoT数据集和CEPL策略,通过链式推理提升多模态大语言模型在人脸反伪装中的鲁棒性和性能。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18053 2026-02-17 cs.RO 88%

V2V-GoT: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models and Graph-of-Thoughts

V2V-GoT: 基于多模态大语言模型和思维图的车对车协同自动驾驶

Hsu-kuang Chiu, Ryo Hachiuma, Chien-Yi Wang, Yu-Chiang Frank Wang, Min-Hung Chen, Stephen F. Smith

机构 * NVIDIA Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出V2V-GoT框架,结合多模态大语言模型和图-思维方法,提升车对车协同自动驾驶的感知、预测和规划能力。

Comments Accepted by ICRA 2026 (IEEE International Conference on Robotics and Automation). Project: https://eddyhkchiu.github.io/v2vgot.github.io/ Code: https://github.com/eddyhkchiu/V2V-GoT Dataset: https://huggingface.co/datasets/eddyhkchiu/V2V-GoT-QA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10522 2026-02-12 cs.SE 88%

Consistency Meets Verification: Enhancing Test Generation Quality in Large Language Models Without Ground-Truth Solutions

一致性与验证:在没有真实解决方案的情况下提升大型语言模型的测试生成质量

Hamed Taherkhani, Alireza DaghighFarsoodeh, Mohammad Chowdhury, Hung Viet Pham, Hadi Hemmati

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 ConVerTest通过自我一致性、验证链和双执行协议,在无需真实解决方案的情况下提升大型语言模型的测试生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09638 2026-02-11 cs.CV 88%

VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model

VideoAfford: 通过多模态大语言模型实现人类-物体交互视频中的3D affordance grounding

Hanqing Wang, Mingyu Liu, Xiaoyu Chen, Chengwei MA, Yiming Zhong, Wenti Yin, Yuhao Liu, Zhiqing Cui, Jiahao Yuan, Lu Dai, Zhiyuan Ma, Hui Xiong

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 VideoAfford通过多模态大语言模型实现人类-物体交互视频中的3D affordance grounding,结合动态交互先验和空间感知损失函数,提升机器人操作的可操作区域识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06687 2026-02-09 cs.CR 88%

Evaluating and Enhancing the Vulnerability Reasoning Capabilities of Large Language Models

评估和增强大型语言模型的漏洞推理能力

Li Lu, Yanjie Zhao, Hongzhou Rao, Kechi Zhang, Haoyu Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 DAGVul通过建模漏洞推理为有向无环图生成任务,提升大型语言模型在漏洞检测中的推理能力,实验显示其推理F1分数平均提高18.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10829 2026-02-06 cs.CV 88%

LayoutCoT: Unleashing the Deep Reasoning Potential of Large Language Models for Layout Generation

LayoutCoT: 解锁大型语言模型在布局生成中的深度推理潜力

Hengyu Shi, Junhao Su, Tianyang Han, Junfeng Luo, Jialin Gao

机构 * Meituan(美团)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 LayoutCoT通过结合RAG和CoT技术,利用LLMs的推理能力实现无需训练的高质量布局生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16928 2026-02-06 cs.CR 88%

From Sands to Mansions: Towards Automated Cyberattack Emulation with Classical Planning and Large Language Models

从沙子到豪宅:迈向自动化网络攻击仿真的方法:经典规划与大语言模型

Lingzhi Wang, Zhenyuan Li, Yi Jiang, Zhengkai Wang, Xiangmin Shen, Wei Ruan, Yan Chen

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出Aurora系统,结合经典规划与大语言模型,实现自动化网络攻击仿真,生成大规模数据集并验证其在入侵检测系统中的有效性。

Comments This is the author-accepted version of a paper accepted at the Applied Cryptography and Network Security (ACNS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09981 2026-02-03 cs.CV 88%

DR$^2$Seg: Decomposed Two-Stage Rollouts for Efficient Reasoning Segmentation in Multimodal Large Language Models

DR$^2$Seg: 分解式两阶段 rollout 用于多模态大语言模型中的高效推理分割

Yulin He, Wei Chen, Zhikang Jian, Tianhang Guo, Wenjuan Zhou, Minglong Li, Shaowu Yang, Wenjing Yang

机构 * School of Computer, National University of Defense Technology, Changsha, China(计算机学院,国防科技大学,中国长沙)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 DR$^2$Seg通过分解式两阶段rollout策略提升多模态大语言模型中的推理效率和分割准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17997 2026-01-27 physics.app-ph 88%

Generative metamaterials based on large language models

基于大语言模型的生成超材料

Zhenyang Gao, Gengchen Zheng, Pengyuan Ren, Hongsong Wang, Kun Zhou, Minh-Son Pham, Yi Wu, Yu Zou, Chu Lun Alex Leung, Yuanyuan Tian, Yang Lu, Haowei Wang, Hongze Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 基于大语言模型开发生成超材料设计工具,实现快速高效的设计生成与诊断进化,推动高通量超材料发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06658 2026-01-22 cs.SI 88%

ComGPT: Detecting Local Community Structure with Large Language Models

ComGPT:利用大语言模型检测局部社区结构

Li Ni, Haowen Shen, Lin Mu, Yiwen Zhang, Wenjian Luo

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 ComGPT通过结合大语言模型与局部模块度算法,提升社区检测任务的性能,有效解决种子依赖和社区扩散问题。

Journal ref IEEE Transactions on Computational Social Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14052 2026-01-21 cs.CV 88%

Vision Also You Need: Navigating Out-of-Distribution Detection with Multimodal Large Language Model

视觉也需要:利用多模态大语言模型进行分布外检测导航

Haoran Xu, Yanlin Liu, Zizhao Tong, Jiaze Li, Kexue Fu, Yuyang Zhang, Longxiang Gao, Shuaiguang Li, Xingyu Li, Yanran Xu, Changwei Wang

机构 * Zhejiang University(浙江大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(教育部计算电力网络与信息安全重点实验室,山东计算机科学中心(国家超算中心济南中心),齐鲁工业大学(山东科学院)) Shandong Provincial Key Laboratory of Computing Power Internet and Service Computing, Shandong Fundamental Research Center for Computer Science(山东省计算电力互联网与服务计算重点实验室,山东省计算机科学基础研究中心) University of Electronic Science and Technology of China(电子科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) RWTH Aachen University(亚琛工业大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出MM-OOD方法,利用多模态大语言模型的推理能力,通过多轮对话增强分布外检测,提升近远OOD任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12274 2026-01-21 cs.SE 88%

Hybrid Concolic Testing with Large Language Models for Guided Path Exploration

基于大语言模型的混合协同测试用于引导路径探索

Mahdi Eslamimehr

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出一种结合大语言模型与协同执行的混合测试方法,通过引导路径探索提升程序状态空间探索效率和缺陷检测能力。

Comments 12 pages, 2 Figures, 2 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06911 2026-01-13 cs.CL cs.AI cs.LG 88%

Distributional Clarity: The Hidden Driver of RL-Friendliness in Large Language Models

分布清晰度:大型语言模型中RL友好性的隐藏驱动因素

Shaoning Sun, Mingzhu Cai, Huang He, Bingjin Chen, Siqi Bao, Yujiu Yang, Hua Wu, Haifeng Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Baidu Inc(百度公司)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示了大型语言模型中RL友好性的隐藏驱动因素——分布清晰度,通过量化Silhouette系数并提出Silhouette-aware Reweighting策略,提升了模型在数学基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00685 2026-01-05 physics.med-ph 88%

Human-like AI-based Auto-Field-in-Field Whole-Brain Radiotherapy Treatment Planning With Conversation Large Language Model Feedback

类人AI驱动的自动场内场全脑放疗治疗计划与对话大语言模型反馈

Adnan Jafar, An Qin, Gavin Atkins, Xiaoyu Hu, Yin Gao, Xun Jia

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);LLM(abstract)

AI总结 本研究提出基于深度学习和大语言模型的自动化全脑放疗计划制定方法,通过对话接口实现交互式优化,提升计划质量和效率。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18190 2025-12-29 cs.AI cs.CL cs.LG 88%

External Hippocampus: Topological Cognitive Maps for Guiding Large Language Model Reasoning

外部海马体:用于引导大语言模型推理的拓扑认知图

Jian Yan

机构 * School of Computer Science, Zunyi Normal University(计算机科学学院,遵义师范学院)

专题命中 推理与问题求解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出External Hippocampus框架,通过拓扑认知图引导大语言模型推理,解决多步推理中的认知死锁问题,提升推理效率和准确性。

Comments 12 pages, 7 figures. v3: replaces v2 (uploaded in error); updated to two-column format; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13143 2025-12-29 cs.CY 88%

Auditing Meta-Cognitive Hallucinations in Reasoning Large Language Models

审查推理大型语言模型中的元认知幻觉

Haolang Lu, Yilian Liu, Jingxin Xu, Guoshun Nan, Yuanlong Yu, Zhican Chen, Kun Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究通过审查推理链轨迹,揭示了大型语言模型在长推理过程中如何通过错误反思强化偏见,提出黑盒审查方法以更有效地检测和归因幻觉问题。

Comments Accepted by NeurIPS 2025 (37 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05195 2025-12-18 cs.CE 88%

Using Large Language Models for Solving Thermodynamic Problems

利用大语言模型解决热力学问题

Rebecca Loubet, Pascal Zittlau, Luisa Vollmer, Marco Hoffmann, Sophie Fellenz, Fabian Jirasek, Heike Leitte, Hans Hasse

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文研究了大语言模型在解决热力学问题中的能力,发现其在简单问题上表现良好,但在复杂问题上存在理解不足和推理能力有限的问题,需进一步整合领域知识。

Comments This document is the unedited Author's version of a Submitted Work to Computers and Chemical Engineering. 19 pages, 2 figures, SI available (15 pages)

Journal ref Comput. Chem. Eng. 204 (2026) 109333

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05853 2025-12-09 cs.CV 88%

VRSA: Jailbreaking Multimodal Large Language Models through Visual Reasoning Sequential Attack

通过视觉推理序列攻击对多模态大语言模型进行劫持

Shiji Zhao, Shukun Xiong, Yao Huang, Yan Jin, Zhenyu Wu, Jiyang Guan, Ranjie Duan, Jialing Tao, Hui Xue, Xingxing Wei

机构 * Alibaba Group(阿里巴巴集团) Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 VRSA通过视觉推理序列攻击方法,针对多模态大语言模型的视觉模态进行劫持,提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16054 2025-12-08 cs.CV 88%

Language-Instructed Reasoning for Group Activity Detection via Multimodal Large Language Model

基于多模态大语言模型的语言引导推理用于群体活动检测

Jihua Peng, Qianxiong Xu, Yichen Liu, Chenxi Liu, Cheng Long, Rui Zhao, Ziyue Li

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出LIR-GAD框架,通过多模态大语言模型实现群体活动检测,引入活动标记和群体标记以提升语义理解和分类性能。

Comments This work is being incorporated into a larger study

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07984 2025-12-01 cs.CV 88%

SAMChat: Introducing Chain of Thought Reasoning and GRPO to a Multimodal Small Language Model for Small Scale Remote Sensing

SAMChat:引入链式推理和GRPO以增强小规模遥感遥感小语言模型

Aybora Koksal, A. Aydin Alatan

机构 * Center for the Image Analysis (OGAM) and Department of Electrical and Electronics Engineering of Middle East Technical University (METU)(图像分析中心(OGAM)和中东部技术大学(METU)电子与电气工程系)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title);large language model(abstract)

AI总结 SAMChat通过引入链式推理和GRPO,专为遥感影像分析优化,实现了在开放描述和分类任务上的高精度表现。

Comments Accepted to Journal of Selected Topics in Applied Earth Observations and Remote Sensing (JSTARS) Special Issue on Foundation and Large Vision Models for Remote Sensing. Code and dataset are available at https://github.com/aybora/SAMChat

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17681 2025-11-25 cs.CV 88%

Vision-Motion-Reference Alignment for Referring Multi-Object Tracking via Multi-Modal Large Language Models

基于多模态大语言模型的视觉-运动-参考对齐的指称多目标跟踪

Weiyi Lv, Ning Zhang, Hanyang Sun, Haoran Jiang, Kai Zhao, Jing Xiao, Dan Zeng

机构 * Shanghai University(上海大学) PAII Inc.(PAII公司)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 VMRMOT通过多模态大语言模型实现视觉-运动-参考对齐,提升指称多目标跟踪的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏