arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2777 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2777 篇

2512.12630 2025-12-16 cs.HC cs.AI 57%

ORIBA: Exploring LLM-Driven Role-Play Chatbot as a Creativity Support Tool for Original Character Artists

ORIBA:探索基于大语言模型的对话机器人作为原创角色艺术家创造力支持工具

Yuqian Sun, Xingyu Li, Shunyu Yao, Noura Howell, Tristan Braud, Chang Hee Lee, Ali Asadipour

机构 * Computer Science Research Centre, Royal College of Art(皇家艺术学院计算机科学研究中心) Digital Media, School of Literature, Media, and Communication, Georgia Institute of Technology(佐治亚理工学院数字媒体系) Princeton University(普林斯顿大学) Digital Media, Georgia Institute of Technology(佐治亚理工学院数字媒体系) Division of Integrative Systems and Design, The Hong Kong University of Science and Technology(香港科学大学整合系统与设计 division) Industrial Design Department, College of Engineering, KAIST(韩国科学技术院工程学院工业设计系)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 ORIBA通过大语言模型支持原创角色艺术家的创意过程,平衡AI辅助与创意自主权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02580 2025-12-16 cs.CL 57%

From Imitation to Discrimination: Toward A Generalized Curriculum Advantage Mechanism Enhancing Cross-Domain Reasoning Tasks

从模仿到辨别:一种通用的课程优势机制,增强跨领域推理任务

Changpeng Yang, Jinyang Wu, Yuchen Liu, Shuai Zhang, Yang Li, Qiliang Liang, Hongzhen Wang, Shuai Nie, Jiaming Xu, Runyu Shi, Ying Huang, Guoquan Zhang

机构 * \equalcontrib(1号机构)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 CAPO是一种基于优势信号的自适应课程机制,通过引导模仿学习和引入负信号提升跨领域推理任务的泛化能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07410 2025-12-15 cs.CV 57%

InterAgent: Physics-based Multi-agent Command Execution via Diffusion on Interaction Graphs

InterAgent:基于物理的多智能体命令执行通过交互图上的扩散

Bin Li, Ruichi Zhang, Han Liang, Jingyan Zhang, Juze Zhang, Xin Chen, Lan Xu, Jingyi Yu, Jingya Wang

机构 * ShanghaiTech University(上海科技大学) University of Pennsylvania(宾夕法尼亚大学) ByteDance(字节跳动) Stanford University(斯坦福大学) InstAdapt

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV

AI总结 InterAgent通过交互图上的扩散模型实现了基于物理的多智能体协调控制,能够从文本提示中生成连贯且物理合理的多代理行为。

Comments Project page: https://binlee26.github.io/InterAgent-Page

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08511 2025-12-12 cs.CV 57%

Thinking with Images via Self-Calling Agent

通过自我调用代理进行图像思考

Wenxi Yang, Yuzhong Zhao, Fang Wan, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本文提出sCoT范式,通过自我调用代理实现无需多模态交错的高效视觉推理,实验显示其在HR-Bench 4K上性能提升达1.9%且训练效率提高75%。

Comments Code is available at https://github.com/YWenxi/think-with-images-through-self-calling

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00846 2025-12-12 cs.CV 57%

AFRAgent : An Adaptive Feature Renormalization Based High Resolution Aware GUI agent

AFRAgent:一种基于自适应特征归一化的高分辨率感知GUI代理

Neeraj Anand, Rishabh Jain, Sohan Patnaik, Balaji Krishnamurthy, Mausoom Sarkar

机构 * Media and Data Science Research, Adobe(Adobe媒体与数据科学研究所)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 AFRAgent通过自适应特征归一化技术,在保持高分辨率细节的同时,实现了更高效的GUI自动化性能,比现有模型小四分之一。

Comments Accepted at WACV 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09396 2025-12-11 cs.MA cs.AI 57%

GAIR: GUI Automation via Information-Joint Reasoning and Group Reflection

GAIR:通过信息联合推理和群体反思实现GUI自动化

Zishu Wei, Qixiang Ma, Xavier Hu, Yuhang Liu, Hui Zang, Yudong Zhao, Tao Wang, Shengyu Zhang, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 多模态Agent :MLLM(abstract);分类 cs.AI

AI总结 GAIR是一种基于MLLM的GUI自动化代理框架,通过信息联合推理和群体反思整合异质模型能力,提升GUI自动化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08769 2025-12-10 cs.AI 57%

A Practical Guide for Designing, Developing, and Deploying Production-Grade Agentic AI Workflows

生产级智能体AI工作流设计、开发与部署的实用指南

Eranga Bandara, Ross Gore, Peter Foytik, Sachin Shetty, Ravi Mukkamala, Abdul Rahman, Xueping Liang, Safdar H. Bouk, Amin Hass, Sachini Rajapakse, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University(旧 Dominion 大学) Florida International University(佛罗里达国际大学) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文提出了一套生产级智能体AI工作流的设计、开发和部署的最佳实践,涵盖架构设计、多智能体模式、模型上下文协议及环境感知部署策略,旨在提升系统的可靠性与可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02292 2025-12-09 cs.AI cs.LG 57%

FinWorld: An All-in-One Open-Source Platform for End-to-End Financial AI Research and Deployment

FinWorld: 一个全方位的开源平台,用于端到端的金融AI研究与部署

Wentao Zhang, Yilei Zhao, Chuqiao Zong, Xinrun Wang, Bo An

机构 * Nanyang Technological University Skywork AI(南洋理工大学Skywork AI) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 FinWorld是一个全方位的开源平台,提供端到端的金融AI研究与部署支持,通过整合异构金融数据和强化学习技术,提升可重复性和部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06373 2025-12-09 cs.CV 57%

VG-Refiner: Towards Tool-Refined Referring Grounded Reasoning via Agentic Reinforcement Learning

VG-Refiner: 通过代理强化学习实现工具精细化的指称 grounded 推理

Yuji Wang, Wenlong Liu, Jingxuan Niu, Haoji Zhang, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 VG-Refiner通过代理强化学习实现工具精细化的指称 grounded 推理,引入两阶段思考-重新思考机制和细化奖励,提升指称和推理接地任务的准确性和修正能力。

Comments The project page is [this url](https://github.com/VoyageWang/VG-Refiner)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04785 2025-12-05 cs.AI cs.CR 57%

ASTRIDE: A Security Threat Modeling Platform for Agentic-AI Applications

ASTRIDE:面向智能体AI应用的安全威胁建模平台

Eranga Bandara, Amin Hass, Ross Gore, Sachin Shetty, Ravi Mukkamala, Safdar H. Bouk, Xueping Liang, Ng Wee Keong, Kasun De Zoysa, Aruna Withanage, Nilaan Loganathan

机构 * Old Dominion University(老奥布里恩大学) Accenture Technology Labs(埃森哲技术实验室) Florida International University(佛罗里达国际大学) Nanyang Technological University(南洋理工大学) University of Colombo(科伦坡大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 ASTRIDE是首个专为AI智能体应用设计的自动化威胁建模平台,通过扩展STRIDE框架并结合微调的视觉语言模型与推理LLM,实现基于图的威胁建模自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02533 2025-12-03 cs.MM 57%

PopSim: Social Network Simulation for Social Media Popularity Prediction

PopSim: 基于社交网络的社交媒体流行度预测仿真

Yijun Liu, Wu Liu, Xiaoyan Gu, Allen He, Weiping Wang, Yongdong Zhang

专题命中 多模态Agent :multimodal(abstract);分类 cs.MM

AI总结 PopSim通过基于大语言模型的多智能体仿真,有效模拟UGC传播动态,提升社交媒体流行度预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01167 2025-12-03 cs.LG cs.AI cs.SY eess.SY 57%

A TinyML Reinforcement Learning Approach for Energy-Efficient Light Control in Low-Cost Greenhouse Systems

为低成本温室系统设计一种 TinyML 强化学习方法以实现节能照明控制

Mohamed Abdallah Salem, Manuel Cuevas Perez, Ahmed Harb Rabia

机构 * North Dakota State University(北达科他州立大学) Biosystems Engineering(生物系统工程)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种基于 TinyML 的强化学习方法,用于低成本温室系统的节能照明控制,通过 Q 学习算法实现动态亮度调节,有效稳定不同光照水平。

Comments Copyright 2025 IEEE. This is the author's version of the work that has been accepted for publication in Proceedings of the 5. Interdisciplinary Conference on Electrics and Computer (INTCEC 2025) 15-16 September 2025, Chicago-USA. The final version of record is available at: https://doi.org/10.1109/INTCEC65580.2025.11256135

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01369 2025-12-02 cs.CL 57%

MARSAD: A Multi-Functional Tool for Real-Time Social Media Analysis

MARSAD:一个多功能的实时社交媒体分析工具

Md. Rafiul Biswas, Firoj Alam, Wajdi Zaghouani

机构 * Hamad bin Khalifa University(哈马德·本·卡勒希大学) Qatar Computing Research Institute(卡塔尔计算研究所) Northwestern University in Qatar(卡塔尔西北大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CL

AI总结 MARSAD 是一个用于实时分析阿拉伯语社交媒体内容的多功能NLP平台,提供情感分析、宣传检测等核心功能,并支持数据抓取与可视化。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00076 2025-12-02 cs.RO cs.CV 57%

Arcadia: Toward a Full-Lifecycle Framework for Embodied Lifelong Learning

Arcadia:迈向一个完整的生命周期框架用于具身终身学习

Minghe Gao, Juncheng Li, Yuze Lin, Xuqi Liu, Jiaming Ji, Xiaoran Pan, Zihan Xu, Xian Li, Mingjie Li, Wei Ji, Rong Wei, Rui Tang, Qizhou Wang, Kai Shen, Jun Xiao, Qi Wu, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Unitree Tech(单位树科技) Peking University(北京大学) Nanjing University(南京大学) Manycore Tech(Manycore科技) Bytedance Seed(字节跳动种子) University of Adelaide(阿德莱德大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 Arcadia提出了一种闭环框架,通过紧密耦合四个阶段实现具身终身学习,支持持续改进和端到端泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22873 2025-12-01 cs.CV cs.IR 57%

CNN-Based Framework for Pedestrian Age and Gender Classification Using Far-View Surveillance in Mixed-Traffic Intersections

基于CNN的远视监控中混合交通交叉口行人年龄和性别分类框架

Shisir Shahriar Arif, Md. Muhtashim Shahrier, Nazmul Haque, Md Asif Raihan, Md. Hadiuzzaman

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 本研究提出基于CNN的远视监控框架,用于混合交通交叉口行人年龄和性别分类,无需面部识别或高分辨率图像,提供高效、低成本的行人人口统计数据监测解决方案。

Comments Accepted for poster presentation at the 105th Annual Meeting of the Transportation Research Board

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22737 2025-12-01 cs.AI cs.HC 57%

Agentic AI Framework for Individuals with Disabilities and Neurodivergence: A Multi-Agent System for Healthy Eating, Daily Routines, and Inclusive Well-Being

具有残疾和神经多样性个体的代理AI框架:一个用于健康饮食、日常习惯和包容性福祉的多代理系统

Salman Jan, Toqeer Ali Syed, Gohar Ali, Ali Akarma, Mohammad Riyaz Belgaum, Ahmad Ali

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出一种多代理系统,通过个性化营养、适应性调度、食品指导和生理监测等代理,为残疾和神经多样性个体提供健康饮食、日常习惯和包容性福祉的AI框架。

Comments Presented at International Conference on Business and Digital Technology, Bahrain, Springer Nature, 27 November 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22134 2025-12-01 cs.CV cs.RO 57%

DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action

DualVLA: 通过推理与行动部分解耦构建通用具身代理

Zhen Fang, Zhuoyang Liu, Jiaming Liu, Hao Chen, Yu Zeng, Shiting Huang, Zehui Chen, Lin Chen, Shanghang Zhang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知国家重点实验室,中国科学技术大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机学院) CUHK(香港大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 DualVLA通过推理与行动部分解耦,提升通用具身代理的行动与多模态理解平衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21042 2025-11-27 cs.CV 57%

LungNoduleAgent: A Collaborative Multi-Agent System for Precision Diagnosis of Lung Nodules

LungNoduleAgent: 一种用于肺结节精准诊断的协作多智能体系统

Cheng Yang, Hui Jin, Xinlei Yu, Zhipeng Wang, Yaoqun Liu, Fenglei Fan, Dajiang Lei, Gangyong Jia, Changmiao Wang, Ruiquan Ge

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 LungNoduleAgent通过协作多智能体系统提升肺结节诊断的精度与效率

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20766 2025-11-27 cs.AI 57%

OpenApps: Simulating Environment Variations to Measure UI-Agent Reliability

OpenApps: 通过模拟环境变化来衡量UI代理的可靠性

Karen Ullrich, Jingtong Su, Claudia Shi, Arjun Subramonian, Amir Bar, Ivan Evtimov, Nikolaos Tsilivis, Randall Balestriero, Julia Kempe, Mark Ibrahim

机构 * FAIR at Meta(Meta 的 FAIR 研究组) New York University(纽约大学) Brown University(布朗大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 OpenApps通过模拟不同应用程序变化来衡量UI代理的可靠性,发现任务成功率在不同环境中有显著波动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20351 2025-11-27 cs.CV 57%

Thinking in 360°: Humanoid Visual Search in the Wild

全方位思考:野外人形视觉搜索

Heyang Yu, Yinan Han, Xiangyu Zhang, Baiqiao Yin, Bowen Chang, Xiangyu Han, Xinhao Liu, Jing Zhang, Marco Pavone, Chen Feng, Saining Xie, Yiming Li

机构 * NYU(纽约大学) NVIDIA(英伟达) TU Darmstadt(图鲁姆大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 多模态Agent :MLLM(abstract);分类 cs.CV

AI总结 本文提出人形视觉搜索方法,通过人形代理在360°全景图像中搜索物体和路径,实验表明现有模型在复杂场景中表现不佳,但通过后训练技术显著提升了性能。

Comments Website: https://humanoid-vstar.github.io/ ; Code: https://github.com/humanoid-vstar/hstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07858 2025-11-27 cs.AI cs.LG 57%

Augur: Modeling Covariate Causal Associations in Time Series via Large Language Models

Augur:通过大型语言模型建模时间序列中的协变量因果关联

Zhiqing Cui, Binwu Wang, Qingxiang Liu, Yeqiang Wang, Zhengyang Zhou, Yuxuan Liang, Yang Wang

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 Augur通过大型语言模型建模时间序列中的协变量因果关联,提升预测准确性并实现透明的因果推理。

Comments 24 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20156 2025-11-26 cs.CV cs.RO 57%

Map-World: Masked Action planning and Path-Integral World Model for Autonomous Driving

Map-World: 遮蔽动作规划与路径积分世界模型用于自动驾驶

Bin Hu, Zijian Lu, Haicheng Liao, Chengran Yuan, Bin Rao, Yongkang Li, Guofa Li, Zhiyong Cui, Cheng-zhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) National University of Singapore(新加坡国立大学) Purdue University(普渡大学) Chongqing University(重庆大学) Beihang University(北航大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 MAP-World通过结合遮蔽动作规划和路径加权世界模型,实现了高效的多模式自动驾驶规划,无需强化学习即可达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04042 2025-11-26 cs.RO cs.AI 57%

An LLM-based Framework for Human-Swarm Teaming Cognition in Disaster Search and Rescue

基于大语言模型的灾难搜索救援中人-群智能协同认知框架

Kailun Ji, Xiaoyu Hu, Xinyu Zhang, Jun Chen

机构 * School of Electronics and Information, Northwestern Polytechnical University(电子工程学院,西北工业大学) Chongqing Institute for Brain and Intelligence, Guangyang Bay Laboratory(脑科学与智能研究院,广阳湾实验室)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的LLM-CRF系统,通过自然交互捕捉意图并实现任务规划,显著提升灾难救援任务效率与成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08367 2025-11-26 cs.CV 57%

Embodied Crowd Counting

具身人群计数

Runling Long, Yunlong Wang, Jia Wan, Xiang Deng, Xinting Zhu, Weili Guan, Antoni B. Chan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) City University of Hong Kong(香港城市大学)

专题命中 多模态Agent :MLLM(abstract);分类 cs.CV

AI总结 本文提出具身人群计数任务,通过构建大规模交互式模拟器和零样本导航方法,在复杂场景中实现高效人群计数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19430 2025-11-25 cs.CV 57%

Cook and Clean Together: Teaching Embodied Agents for Parallel Task Execution

烹饪与清洁同时进行:教授并行任务执行的具身智能体

Dingkang Liang, Cheng Zhang, Xiaopeng Xu, Jianzhong Ju, Zhenbo Luo, Xiang Bai

专题命中 多模态Agent :multi-modal(abstract);分类 cs.CV

AI总结 GRANT通过结合语言理解、3D定位和效率优化,实现并行任务调度,提升智能体在复杂环境中的任务执行效率。

Comments Accepted to AAAI 2026 (Oral). The code is available at \url{https://github.com/H-EmbodVis/GRANT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19033 2025-11-25 cs.CV 57%

ReEXplore: Improving MLLMs for Embodied Exploration with Contextualized Retrospective Experience Replay

ReEXplore: 通过上下文化回顾经验回放提升具身探索的MLLMs

Gengyuan Zhang, Mingcong Ding, Jingpei Wu, Ruotong Liao, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) TU Munich(慕尼黑技术大学)

专题命中 多模态Agent :MLLM(abstract);分类 cs.CV

AI总结 ReEXplore通过回顾经验回放和分层前沿选择,提升MLLMs在具身探索中的效率和性能。

Comments 8 main pages plus 13 pages Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15253 2025-11-25 cs.HC cs.AI 57%

PresentCoach: Dual-Agent Presentation Coaching through Exemplars and Interactive Feedback

PresentCoach: 通过典范和交互反馈的双智能体演示指导

Sirui Chen, Jinsong Zhou, Xinli Xu, Xiaoyu Yang, Litao Guo, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 PresentCoach通过双智能体系统,结合典范和交互反馈,提供高效的演示技能指导,提升学习者在教育和专业领域的表现能力。

Comments 13pages,6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21651 2025-11-24 cs.AI 57%

Can AI Perceive Physical Danger and Intervene?

AI能否感知物理危险并干预?

Abhishek Jindal, Dmitry Kalashnikov, R. Alex Hofer, Oscar Chang, Divya Garikapati, Anirudha Majumdar, Pierre Sermanet, Vikas Sindhwani

机构 * Google DeepMind Robotics(谷歌深Mind机器人技术)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种用于评估具身体验AI系统物理安全性的基准测试方法,通过生成逼真图像和视频来测试模型对安全风险的理解和干预能力,并开发了训练后范式以提升模型的安全推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23463 2025-11-24 cs.CV 57%

OpenDriveVLA: Towards End-to-end Autonomous Driving with Large Vision Language Action Model

OpenDriveVLA: 向端到端自动驾驶迈进的大型视觉语言动作模型

Xingcheng Zhou, Xuyuan Han, Feng Yang, Yunpu Ma, Volker Tresp, Alois Knoll

机构 * Technical University of Munich(慕尼黑技术大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 OpenDriveVLA基于开源大语言模型,通过多模态输入和分层视觉语言对齐,实现端到端自动驾驶中的高精度轨迹规划和驾驶任务回答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15456 2025-11-20 cs.AI q-fin.GN 57%

Know Your Intent: An Autonomous Multi-Perspective LLM Agent Framework for DeFi User Transaction Intent Mining

了解您的意图:一种自主多视角大语言模型代理框架用于DeFi用户交易意图挖掘

Qian'ang Mao, Yuxuan Zhang, Jiaman Chen, Wenjun Zhou, Jiaqi Yan

机构 * Nanjing University(南京大学) The University of Tennessee, Knoxville(田纳西大学)

专题命中 多模态Agent :multi-modal(abstract);分类 cs.AI

AI总结 本文提出TIM框架,通过多视角LLM代理系统挖掘DeFi用户交易意图,提升意图推断的准确性和可验证性。

Comments Written in 2025 Q1

详情

展开后加载摘要…

URL PDF HTML 收藏