arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-09 至 2026-04-09 共收录 49 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2604.07116 2026-04-09 cs.CL 71%

Yale-DM-Lab at ArchEHR-QA 2026: Deterministic Grounding and Multi-Pass Evidence Alignment for EHR Question Answering

耶鲁-DM实验室参加ArchEHR-QA 2026:用于电子病历问答的确定性接地和多轮证据对齐

Elyas Irankhah, Samah Fodeh

机构 * Yale University(耶鲁大学)

专题命中 视觉问答 :grounding(title)

AI总结 本文提出确定性接地和多轮证据对齐方法,用于电子病历问答任务,通过模型多样性与投票策略提升性能,实验结果显示对齐准确率受限于推理能力。

Comments 9 pages, 2 figures. System description for ArchEHR-QA 2026 shared task

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07274 2026-04-09 cs.CL cs.AI cs.LG 62%

A Systematic Study of Retrieval Pipeline Design for Retrieval-Augmented Medical Question Answering

检索增强医疗问答中检索流程设计的系统研究

Nusrat Sultana, Abdullah Muhammad Moosa, Kazi Afzalur Rahman, Sajal Chandra Banik

机构 * Department of Mechatronics & Industrial Engineering, Chittagong University of Engineering & Technology(吉大港工程与技术大学机电与工业工程系) Department of Mechanical Engineering, Chittagong University of Engineering & Technology(吉大港工程与技术大学机械工程系)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文系统评估了检索增强医疗问答的性能,发现检索增强显著提升了零样本医疗问答效果,最佳配置为密集检索加查询改写和重排序,准确率达60.49%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06376 2026-04-09 cs.CV 57%

MTA-Agent: An Open Recipe for Multimodal Deep Search Agents

MTA-Agent:多模态深度搜索代理的开放配方

Xiangyu Peng, Can Qin, An Yan, Xinyi Yang, Zeyuan Chen, Ran Xu, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce 人工智能研究院)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MTA-Agent,通过构建高质量多跳视觉-语言训练数据,实现多模态深度搜索代理,其在六个基准测试中达到54.63%的平均准确率,优于其他模型,同时降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 14 篇

2604.06725 2026-04-09 cs.CV 83%

Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning

通过主动3D场景探索增强MLLM空间理解以实现多视角推理

Jiahua Chen, Qihong Tang, Weinong Wang, Qi Fan

机构 * Tsinghua University(清华大学) Nanjing University(南京大学) Tencent(腾讯)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的框架,通过显式3D重建机制提升MLLM的空间理解能力,通过主动探索生成新视角,优于专门空间模型和通用MLLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01840 2026-04-09 cs.AI 79%

Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models

并非所有token都同等重要:基于感知的策略优化方法用于大型视觉-语言模型

Zekai Ye, Qiming Li, Xiaocheng Feng, Ruihan Chen, Ziming Li, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出基于感知的策略优化方法PGPO,通过动态调整token级别的优势,提升多模态推理的鲁棒性与稳定性,实验显示在多个基准上提升18.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06250 2026-04-09 cs.CV cs.AI 79%

DISSECT: Diagnosing Where Vision Ends and Language Priors Begin in Scientific VLMs

DISSECT:诊断视觉结束和语言先验开始的位置在科学视觉-语言模型中

Dikshant Kukreja, Kshitij Sah, Karan Goyal, Mukesh Mohania, Vikram Goyal

机构 * IIIT Delhi(德里印度理工学院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 DISSECT通过12000个问题诊断科学VLMs中视觉与语言先验的界限,揭示了视觉信息提取与下游推理之间的差距,发现开源模型在自身描述推理中表现更优,而闭源模型无此差距,表明跨模态能力的前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03647 2026-04-09 cs.CV cs.AI 73%

Stabilizing Unsupervised Self-Evolution of MLLMs via Continuous Softened Retracing reSampling

通过连续软化回溯重采样稳定多模态大语言模型的无监督自进化

Yunyao Yu, Zhengxian Wu, Zhuohong Chen, Hangrui Xu, Zirui Liao, Xiangwen Deng, Zhifang Liu, Senyuan Shi, Haoqian Wang

机构 * Tsinghua University(清华大学) Hefei University of Technology(合肥工业大学) University of Arizona(亚利桑那大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CSRS方法,通过回溯推理机制和软化频率奖励提升多模态大语言模型的无监督自进化稳定性,实验显示在MathVision等基准上表现优异。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06777 2026-04-09 cs.CV 70%

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization

行走与言说:通过多模态代理策略优化弥合图像推理与行动之间的差距

Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yuchen Zhou, Xiaobo Xia, Yuanyu Wan, Lijun Zhang, Tat-Seng Chua

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) AI Business, Alibaba Group(阿里巴巴集团智能计算研究院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, China(上海交通大学自动化与智能感知学院) School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能工程学院(深圳)) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) School of Software Technology, Zhejiang University, China(浙江大学软件学院) School of Computing, National University of Singapore, Singapore, Singapore(新加坡国立大学计算机学院)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出MAPO方法,通过强制生成视觉内容的显式文本描述,结合语义对齐与任务奖励,提升多模态推理能力,实验表明其在多个视觉推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06685 2026-04-09 cs.CL cs.AI 70%

ChemVLR: Prioritizing Reasoning in Perception for Chemical Vision-Language Understanding

ChemVLR:在化学视觉语言理解中优先考虑推理

Xuanle Zhao, Xinyuan Cai, Xiang Cheng, Xiuyi Chen, Bo Xu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 ChemVLR通过细化化学描述符识别,提升化学视觉语言模型的推理能力,实现更清晰的推理路径,实验显示其在分子和反应任务中达到SOTA性能。

Comments Accepted by ACL 2026 Findings, Preprint Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06347 2026-04-09 cs.CV 70%

Evidence-Based Actor-Verifier Reasoning for Echocardiographic Agents

基于证据的Actor-验证者推理用于超声波代理

Peng Huang, Yiming Wang, Yineng Chen, Liangqiao Gui, Hui Guo, Bo Peng, Shu Hu, Xi Wu, Tsao Connie, Hongtu Zhu, Balakrishnan Prabhakaran, Xin Wang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Southwest Jiaotong University(西南交通大学) Purdue University(普渡大学) Chengdu University of Information Technology(成都信息工程大学) Harvard Medical School(哈佛医学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉推理 :VLM(abstract);visual language model(abstract);分类 cs.CV

AI总结 本文提出EchoTrust框架,通过结构化中间表示和不同角色分析,提升超声波临床决策支持系统中推理的可靠性与可解释性。

Comments cvprw 2026(AIMS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02676 2026-04-09 cs.CV 70%

AdaptMMBench: Benchmarking Adaptive Multimodal Reasoning for Mode Selection and Reasoning Process

AdaptMMBench: 多模态适应推理的基准测试用于模式选择和推理过程

Xintong Zhang, Xiaowen Zhang, Jingrong Wu, Zhi Gao, Shilin Yan, Zhenxin Diao, Kunpeng Gao, Xuanyan Chen, Yuwei Wu, Yunde Jia, Qing Li

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出AdaptMMBench,通过五类领域评估多模态适应推理,利用MCC指标评估模式选择合理性,揭示适应模式选择与最终准确率的脱钩现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18100 2026-04-09 cs.CV 70%

Spatial-Conditioned Reasoning in Long-Egocentric Videos

长时自体视频中的空间条件推理

James Tribble, Hao Wang, Si-En Hong, Chaoyi Zhou, Ashish Bastola, Siyu Huang, Abolfazl Razi

机构 * Clemson University(克莱姆森大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文研究了在不修改模型架构的情况下,显式空间信号如何影响基于VLM的视频理解,通过引入Sanpo-D数据集和评估多个VLM在导航导向的空间查询上的表现,发现深度感知和空间化表示能提升安全关键任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08409 2026-04-09 cs.AI 57%

Faithful-First Reasoning, Planning, and Acting for Multimodal LLMs

多模态大语言模型中的忠实优先推理、规划与行动

Junxian Li, Xinyue Xu, Sai Ma, Di Zhang, Sichao Li

机构 * Shanghai Jiao Tong University(上海交通大学) The Hong Kong University of Science and Technology(香港科技大学) The Australian National University(澳大利亚国立大学) Fudan University(复旦大学) University of Sydney(悉尼大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出Faithful-First RPA框架,通过逐步监督提升多模态推理的忠实度,实验表明其在多个基准上提升了24%的感知忠实度,且不降低任务准确性。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21540 2026-04-09 cs.CR cs.CV 57%

PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking

PRISM:基于图像序列操作的程序化推理用于LVLM劫持

Quanchen Zou, Zonghao Ying, Moyang Chen, Wenzhuo Xu, Yisong Xiao, Yakai Li, Deyue Zhang, Dongdong Yang, Zhao Liu, Xiangzheng Zhang

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出PRISM框架,通过分解有害指令为多个无害视觉组件,利用模型推理过程生成有害输出,有效提升LVLM劫持成功率。

Comments This version is withdrawn to consolidate the submission under the corresponding author's primary account. The most recent and maintained version of this work can be found at arXiv:2603.09246

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07338 2026-04-09 cs.CV cs.CL cs.MM 57%

Appear2Meaning: A Cross-Cultural Benchmark for Structured Cultural Metadata Inference from Images

Appear2Meaning: 一个跨文化的结构化文化元数据图像推理基准

Yuechen Jiang, Enze Zhang, Md Mohsinul Kabir, Qianqian Xie, Stavroula Golfomitsou, Konstantinos Arvanitis, Sophia Ananiadou

机构 * University of Manchester(曼彻斯特大学) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Getty Conservation Institute(盖蒂保护研究所)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一个跨文化的结构化文化元数据图像推理基准,评估VLMs在文化元数据推断中的表现,发现模型在不同文化和元数据类型上存在显著性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11635 2026-04-09 cs.AI 57%

Do MLLMs Really Understand Space? A Mathematical Reasoning Evaluation

大规模语言模型真的能理解空间吗?一项数学推理评估

Shuo Lu, Jianjie Cheng, Yinuo Xu, Yongcan Yu, Lijun Sheng, Peijie Wang, Siru Jiang, Yongguan Hu, Run Ling, Yihua Shao, Ao Ma, Wei Feng, Lingxiao He, Meng Wang, Qianlong Xie, Xingxing Wang, Nicu Sebe, Ran He, Jian Liang

机构 * Meituan Inc.(美团) Northeastern University(东北大学) University of Trento(特伦托大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文通过MathSpatial数据集评估了大规模语言模型在数学空间推理上的能力,发现其在空间推理任务上表现不佳,提出该数据集有助于提升模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19640 2026-04-09 cs.CV 57%

Focus on What Really Matters in Low-Altitude Governance: A Management-Centric Multi-Modal Benchmark with Implicitly Coordinated Vision-Language Reasoning Framework

聚焦低空治理中真正重要的问题:一种以管理为中心的多模态基准与隐式协调的视觉-语言推理框架

Hao Chang, Zhihui Wang, Lingxiang Wu, Wei An, Boyang Li, Zaiping Lin, Weidong Sheng, Jinqiao Wang

机构 * National University of Defense Technology(国防科技大学) Zidong Taichu (Beijing) Technology Co., Ltd.(紫东太初(北京)科技有限公司) Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Wuhan AI Research(武汉人工智能研究院)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV

AI总结 本文提出GovLA-10K多模态基准和GovLA-Reasoner框架,通过功能显著目标和隐式协调的视觉-语言推理提升低空治理中的管理需求理解与执行能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 15 篇

2604.06849 2026-04-09 cs.CV 83%

Vision-Language Model-Guided Deep Unrolling Enables Personalized, Fast MRI

基于视觉-语言模型的深度展开实现个性化快速MRI

Fangmao Ju, Yuzhu He, Zhiwen Xue, Chunfeng Lian, Jianhua Ma

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出PASS框架,利用视觉-语言模型指导深度展开网络,实现任务导向的快速成像,通过动态个性化成像流程提升MRI图像质量及诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06824 2026-04-09 cs.CV 79%

Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning

生成、分析与优化:基于MLLM元推理的无训练声源定位

Subin Park, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学)

专题命中 视觉定位与Grounding :MLLM(title);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出无训练的声源定位框架,利用多模态大语言模型的推理能力,通过生成-分析-优化流程实现声源定位,实验表明在单源和多源基准上表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00643 2026-04-09 cs.CV 79%

Grounding Surgical Action Triplets with Instrument Instance Segmentation: A Dataset and Target-Aware Fusion Approach

通过仪器实例分割接地手术动作三元组:一个数据集和目标感知融合方法

Oluwatosin Alabi, Meng Wei, Charlie Budd, Tom Vercauteren, Miaojing Shi

机构 * Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出通过仪器实例分割接地手术动作三元组,引入CholecTriplet-Seg数据集和TargetFusionNet架构,提升手术场景中动作理解的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06711 2026-04-09 cs.CV cs.CL 77%

Specializing Large Models for Oracle Bone Script Interpretation via Component-Grounded Multimodal Knowledge Augmentation

通过组件导向的多模态知识增强专门化大型模型进行甲骨文解读

Jianing Zhang, Runan Li, Honglin Pang, Ding Xia, Zhou Zhu, Qian Zhang, Chuntao Li, Xi Yang

机构 * College of Software, Jilin University(吉林大学软件学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) School of Archaeology, Jilin University(吉林大学考古学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MoE, China(教育部知识驱动人机智能工程研究中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出一种基于组件的多模态知识增强框架,利用视觉语言模型和语言模型代理进行组件识别与语义推理,通过专家标注的OB-Radix数据集提升甲骨文解读的精度与细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06581 2026-04-09 cs.CV 70%

MedGRPO: Multi-Task Reinforcement Learning for Heterogeneous Medical Video Understanding

MedGRPO:异构医学视频理解的多任务强化学习

Yuhao Su, Anwesa Choudhuri, Zhongpai Gao, Benjamin Planche, Van Nguyen Nguyen, Meng Zheng, Yuhan Shen, Arun Innanje, Terrence Chen, Ehsan Elhamifar, Ziyan Wu

机构 * Northeastern University(东北大学) United Imaging Intelligence(联影智能)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出MedGRPO框架,通过跨数据集奖励归一化和医学LLM评判器提升医学视频理解的训练效果,建立基础基准和训练方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06285 2026-04-09 cs.CR cs.AI cs.CV 66%

Harnessing Hyperbolic Geometry for Harmful Prompt Detection and Sanitization

利用双曲几何进行有害提示检测与净化

Igor Maljkovic, Maria Rosaria Briglia, Iacopo Masi, Antonio Emanuele Cinà, Fabio Roli

机构 * University of Genoa(热那亚大学) Sapienza University of Rome(罗马大学) University of Cagliari(卡利亚里大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI;VLM(comments)

AI总结 本文提出HyPE和HyPS方法,利用双曲几何空间检测和净化有害提示,提升视觉语言模型的安全性与鲁棒性。

Comments Paper accepted at ICLR 2026. Webpage available at: https://hype-vlm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06770 2026-04-09 cs.CV cs.AI 62%

FlowExtract: Procedural Knowledge Extraction from Maintenance Flowcharts

FlowExtract:从维护流程图中提取过程知识

Guillermo Gil de Avalle, Laura Maruster, Eric Sloot, Christos Emmanouilidis

机构 * University of Groningen(格罗宁根大学) Philips Consumer Lifestyle B.V.(飞利浦消费生活方式有限公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FlowExtract,通过分离元素检测与连接性重建,利用YOLOv8和EasyOCR提取标准流程图节点,结合新边检测方法实现高精度连接提取,优于视觉语言模型基线,为可查询的过程知识表示提供实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13354 2026-04-09 cs.CV cs.LG 62%

AgriPath: A Systematic Exploration of Architectural Trade-offs for Crop Disease Classification

AgriPath:作物疾病分类架构权衡的系统探索

Hamza Mooraj, George Pantazopoulos, Alessandro Suglia

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文系统比较了CNN、对比视觉语言模型和生成式VLM在作物疾病分类中的表现,揭示了不同架构在不同场景下的性能差异,强调部署环境对架构选择的影响。

Comments 11 pages main text, 24 pages total including references and appendix. 6 figures, 14 tables. Code and dataset will be released upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22396 2026-04-09 cs.CV cs.AI 62%

Asking like Socrates: Socrates helps VLMs understand remote sensing images

像苏格拉底提问:苏格拉底帮助VLMs理解遥感图像

Run Shao, Ziyu Li, Zhaoyang Zhang, Linrui Xu, Xinran He, Hongyuan Yuan, Bolei He, Yongxing Dai, Yiming Yan, Yijun Chen, Wang Guo, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Baidu Inc.(百度公司) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RS-EoT方法,通过迭代视觉证据寻求机制和两阶段强化学习策略,解决遥感图像中伪推理问题,提升视觉证据基础的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06765 2026-04-09 cs.CL cs.AI 57%

TeamLLM: A Human-Like Team-Oriented Collaboration Framework for Multi-Step Contextualized Tasks

TeamLLM: 一种类人团队导向的多步骤上下文任务协作框架

Xiangyu Wang, Jin Wu, Haoran Shi, Wei Xia, Jiarui Yu, Chanjin Zheng

机构 * Department of Educational Psychology, East China Normal University(华东师范大学教育心理学系) Lab of Artificial Intelligence for Education, East China Normal University(华东师范大学教育人工智能实验室) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海教育人工智能研究院) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Cascadia Institute for Neurotechnology (CIN)(卡斯卡迪亚神经技术研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 TeamLLM通过引入四类团队角色和三阶段多LLM协作机制,提升多步骤上下文任务性能,提出CGPST基准测试集并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06696 2026-04-09 cs.AI 57%

AgentGate: A Lightweight Structured Routing Engine for the Internet of Agents

AgentGate: 一种轻量级的结构化路由引擎用于物联网代理

Yujun Cheng, Enfang Cui, Hao Qin, Zhiyuan Liang, Qi Xu

机构 * School of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能学院) China Telecom Research Institute(中国电信研究院) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出AgentGate,一种轻量级结构化路由引擎,用于在资源受限条件下高效且隐私友好的代理系统,通过分阶段决策和结构化接地提升路由效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06279 2026-04-09 physics.plasm-ph cs.AI 57%

Plasma GraphRAG: Physics-Grounded Parameter Selection for Gyrokinetic Simulations

等离子体图RAG:用于磁流体动力学模拟的物理基础参数选择

Ruichen Zhang, Feda AlMuhisen, Chenguang Wan, Zhisong Qu, Kunpeng Li, Youngwoo Cho, Kyungtak Lim, Virginie Grandgirard, Xavier Garbet

机构 * Nanyang Technological University(南洋理工大学) CEA, IRFM(法国原子能委员会,磁聚变研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Physical and Mathematical Sciences, Nanyang Technological University(南洋理工大学物理与数学科学学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Plasma GraphRAG,结合图检索增强生成与大语言模型,实现自动化、物理基础的参数范围识别,提升模拟可靠性并加速科学发现。

Comments 9 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09677 2026-04-09 cs.AI 57%

Logics-Parsing-Omni Technical Report

逻辑-解析-全能技术报告

Xin An, Jingyi Cai, Xiangyang Chen, Huayao Liu, Peiting Liu, Peng Wang, Bei Yang, Xiuwen Zhu, Yongfan Chen, Yan Gao, Yuan Gao, Baoyu Hou, Guangzheng Hu, Shuzhao Li, Weixu Qiao, Weidong Ren, Yanan Wang, Boyu Yang, Fan Yang, Jiangtao Zhang, Lixin Zhang, Lin Qu, Hu Wei, Xiaoxiao Xu, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Omni Parsing框架,通过三级层次结构实现多模态解析,整合整体检测、细粒度识别和多级解释,构建证据锚定机制以提升逻辑推理能力,释放Logics-Parsing-Omni模型并发布评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏