arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-24 至 2026-03-24 共收录 77 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 77 篇

2603.21301 2026-03-24 cs.CL cs.AI 91%

Enhancing reasoning accuracy in large language models during inference time

在推理过程中增强大语言模型的推理准确性

Vinay Sharma, Manish Jain

机构 * Firstsource

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究了提升大语言模型推理准确性的推理时技术,通过自一致性、双模型推理一致性和自反思三种策略,发现自一致性在核采样和受控温度下能显著提高准确性,适用于低风险领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08305 2026-03-24 cs.NI eess.SP 90%

MSADM: Large Language Model (LLM) Assisted End-to-End Network Health Management Based on Multi-Scale Semanticization

MSADM:基于多尺度语义化的大型语言模型(LLM)辅助端到端网络健康管理系统

Fengxiao Tang, Xiaonan Wang, Xun Yuan, Linfeng Luo, Ming Zhao, Tianchi Huang, Nei Kato

专题命中 推理与问题求解 :LLM(title,abstract);language model(title,abstract);large language model(title)

AI总结 本文提出基于多尺度语义化的LLM辅助端到端网络健康管理系统,通过多尺度数据缩放、语义规则树与注意力机制结合的异常检测模型,以及链式推理的大规模语言模型,提升异构网络的故障诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21854 2026-03-24 cs.AI 90%

Reasoning or Rhetoric? An Empirical Analysis of Moral Reasoning Explanations in Large Language Models

推理还是修辞?对大型语言模型中道德推理解释的实证分析

Aryan Kasat, Smriti Singh, Aman Chadha, Vinija Jain

机构 * TCS AI Practice(TCS人工智能实践) UT Austin(德克萨斯大学奥斯汀分校) Amazon GenAI(亚马逊生成人工智能) Google GenAI(谷歌生成人工智能)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究通过分析LSTM对道德困境的回应,探讨其是否具备道德发展阶段的真正进展,发现其表现出后常规推理,且存在道德解耦现象,揭示了对成熟道德推理的修辞模仿。

Comments 32 pages, 34 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03235 2026-03-24 cs.AI 89%

From Five Dimensions to Many: Large Language Models as Precise and Interpretable Psychological Profilers

从五维到更多:大型语言模型作为精确且可解释的心理档案师

Yi-Fei Liu, Yi-Long Lu, Di He, Hang Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文研究了大型语言模型能否通过少量量化输入建模人类心理特质的相关结构,发现其在零样本情况下能准确预测心理特质,揭示了LLM通过抽象和推理实现精确预测的机制。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21248 2026-03-24 cs.CL cs.IR 89%

Graph Fusion Across Languages using Large Language Models

跨语言图融合使用大型语言模型

Kaung Myat Kyaw, Khush Agarwal, Jonathan Chan

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出利用大型语言模型进行跨语言图融合框架,通过结构线性化和语义优先级解决多语言知识图谱融合问题,展示了LLM在跨语言知识整合中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21036 2026-03-24 cs.CL 89%

Left Behind: Cross-Lingual Transfer as a Bridge for Low-Resource Languages in Large Language Models

落后者:跨语言迁移作为低资源语言在大语言模型中的桥梁

Abdul-Salem Beibitkhan

机构 * North American University(北美大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究评估了大语言模型在低资源语言上的表现,发现英语与低资源语言之间存在13.8-16.7个百分点的性能差距,跨语言迁移对双语架构有帮助,但对英语主导模型无益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21447 2026-03-24 cs.CY 89%

Deliberative multi-agent large language models improve clinical reasoning in ophthalmology

协商式多智能体大语言模型提升眼科临床推理

Ehsan Misaghi, Sean T Berkowitz, Bing Yu Chen, Qingyu Chen, Renaud Duval, Pearse A Keane, Danny A Mammo, Ariel Yuhan Ong, Mertcan Sevgi, Sumit Sharma, Sunil K Srivastava, Yih Chung Tham, Fares Antaki

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究比较了多智能体协商系统与单一模型在眼科临床推理中的表现,发现协商系统在准确性和安全性上均优于单一模型,且能减少有害错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21488 2026-03-24 cs.CV 88%

Learning Trajectory-Aware Multimodal Large Language Models for Video Reasoning Segmentation

学习轨迹感知的多模态大语言模型用于视频推理分割

Jingnan Luo, Mingqi Gao, Jun Liu, Bin-Bin Gao, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) Tencent YouTu Lab(腾讯优图实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出TrajSeg框架,通过双向文本轨迹对齐提升视频对象轨迹感知能力,采用帧级内容整合模块和统一掩码解码器实现端到端训练,实验表明其在视频推理分割任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20224 2026-03-24 cs.CL 87%

Beyond Test-Time Compute Strategies: Advocating Energy-per-Token in LLM Inference

超越测试时计算策略:倡导语言模型推理中的能耗-token指标

Patrick Wilhelm, Thorsten Wittkopp, Odej Kao

机构 * Technische Universität Berlin(柏林技术大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文探讨了在小模型中测试时计算策略的能耗-准确率权衡,提出能耗-token指标和受控推理策略,以实现可持续的AI部署。

Journal ref EuroMLSys2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21523 2026-03-24 cs.RO cs.AI 85%

SafePilot: A Framework for Assuring LLM-enabled Cyber-Physical Systems

SafePilot: 一种确保基于大语言模型的嵌入式物理系统框架

Weizhe Xu, Mengyu Liu, Fanxin Kong

机构 * University of Notre Dame(诺克斯维尔大学) Washington State University(华盛顿州立大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SafePilot框架,通过层级神经符号方法确保基于大语言模型的嵌入式物理系统安全性,通过任务复杂度评估和分治策略,结合形式化验证提升任务规划可靠性。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23667 2026-03-24 cs.AI 85%

Formula-R1: Incentivizing LLM Reasoning over Complex Tables with Numerical Computation via Formula-Driven Reinforcement Learning

Formula-R1:通过公式驱动强化学习激励LLM对复杂表格进行数值计算的推理

Lang Cao, Jingxian Xu, Hanbing Liu, Jinyu Wang, Mengyu Zhou, Haoyu Dong, Shi Han, Dongmei Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nankai University(南开大学) Tsinghua University(清华大学) Shandong University(山东大学) Microsoft Research(微软研究院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Formula-R1,通过公式驱动强化学习框架提升LLM对复杂表格的推理能力,尤其在多步数值计算任务中表现优异,且优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01013 2026-03-24 cs.LG 85%

TimeXL: Explainable Multi-modal Time Series Prediction with LLM-in-the-Loop

TimeXL:基于LLM的多模态时间序列预测可解释方法

Yushan Jiang, Wenchao Yu, Geon Lee, Dongjin Song, Kijung Shin, Wei Cheng, Yanchi Liu, Haifeng Chen

机构 * School of Computing, University of Connecticut(大学计算机学院) Data Science & System Security Department, NEC Labs America(数据科学与系统安全部,NEC美国实验室) Kim Jaechul Graduate School of AI, KAIST(金 Jaechul人工智能研究生院,韩国科学技术院)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 TimeXL通过集成原型时间序列编码器与三个协作LLM,提升时间序列预测的准确性与可解释性,实验证明在四个真实数据集上AUC提升达8.9%。

Comments NeurIPS 2025 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20449 2026-03-24 cs.SE cs.AI 85%

Solver-Aided Verification of Policy Compliance in Tool-Augmented LLM Agents

辅助验证工具增强大语言模型代理的政策合规性

Cailin Winston, Claris Winston, René Just

机构 * University of Washington(华盛顿大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于SMT求解器的框架,用于确保工具增强大语言模型代理在工具使用上的政策合规性,通过将自然语言政策转化为形式逻辑约束,并在运行时检查工具调用以防止违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21861 2026-03-24 cs.LG 85%

SpecMol: A Spectroscopy-Grounded Foundation Model for Multi-Task Molecular Learning

SpecMol:一种基于光谱的多任务分子学习基础模型

Shuaike Shen, Jiaqing Xie, Zhuo Yang, Antong Zhang, Shuzhou Sun, Ben Gao, Tianfan Fu, Biqing Qi, Yuqiang Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Brown University(布朗大学) Nanjing University(南京大学)

专题命中 推理与问题求解 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SpecMol提出一种统一框架,整合光谱解释、分子表示学习和三维结构生成,通过SpecMol-Bench评估协议实现光谱驱动的结构解析和分子生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21720 2026-03-24 cs.CL cs.AI 85%

SemEval-2026 Task 12: Abductive Event Reasoning: Towards Real-World Event Causal Inference for Large Language Models

SemEval-2026任务12:归纳事件推理:面向大规模语言模型的现实事件因果推断

Pengfei Cao, Mingxuan Yang, Yubo Chen, Chenlong Zhang, Mingxuan Liu, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国)

专题命中 推理与问题求解 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出面向现实事件因果推断的归纳事件推理任务,通过多选基准测试解决分布式证据、间接背景因素和语义相关但非因果干扰等挑战,评估了122个参与者的518份提交结果。

Comments 9 pages, 3 figures, semeval 2026 task 12 description paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02249 2026-03-24 cs.CL cs.AI cs.LG 85%

Explore Briefly, Then Decide: Mitigating LLM Overthinking via Cumulative Entropy Regulation

briefly, Then Decide: 通过累积熵调节缓解LLM过度思考

Yi Bin, Tianyi Jiang, Yujuan Ding, Kainian Zhu, Fei Ma, Jingkuan Song, Yang Yang, Heng Tao Shen

机构 * Tongji University(同济大学) Hong Kong Polytechnic University(香港理工大学) Shanghai University of Electric and Power(上海电力大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy(广东省人工智能与数字经济实验室) University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TECA指标和

Comments Code: https://github.com/AusertDream/CumulativeEntropyRegulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22117 2026-03-24 cs.LG cs.AI 84%

On the Direction of RLVR Updates for LLM Reasoning: Identification and Exploitation

关于RLVR更新方向的LLM推理:识别与利用

Kexin Huang, Haoming Meng, Junkang Wu, Jinda Lu, Chiyu Ma, Ziqian Chen, Xue Wang, Bolin Ding, Jiancan Wu, Xiang Wang, Xiangnan He, Guoyin Wang, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨RLVR更新方向对LLM推理的影响,提出通过Δlogp识别关键更新,并应用于测试时插值和训练时重加权以提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20899 2026-03-24 cs.CL cs.AI 84%

Mitigating Shortcut Reasoning in Language Models: A Gradient-Aware Training Approach

缓解语言模型中的捷径推理:一种梯度感知的训练方法

Hongyu Cao, Kunpeng Liu, Dongjie Wang, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) University of Kansas(堪萨斯大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SART框架,通过梯度感知技术检测并缓解语言模型中的捷径推理,实验显示在受控推理基准上提升准确率和鲁棒性。

Comments 12 pages, 2 figures. Preprint. Experiments on synthetic reasoning benchmarks. Code available

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20730 2026-03-24 cs.IR cs.AI cs.CL cs.LG 83%

Do LLMs Understand Collaborative Signals? Diagnosis and Repair

大语言模型理解协作信号吗?诊断与修复

Shahrooz Pouryousef, Ali Montazeralghaem

机构 * Google(谷歌)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究大语言模型在推荐任务中处理协作信息的能力,通过检索增强生成方法提升其推理性能,实验表明在提供清晰信息时LLM优于传统矩阵分解模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15677 2026-03-24 cs.LG q-bio.QM 83%

CAMEL: An ECG Language Model for Forecasting Cardiac Events

CAMEL:一种用于预测心脏事件的ECG语言模型

Neelay Velingker, Alaia Solko-Breslin, Mayank Keoliya, Seewon Choi, Jiayi Xin, Anika Marathe, Alireza Oraii, Rajat Deo, Sameed Khatana, Rajeev Alur, Mayur Naik, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 CAMEL是首个能处理长信号的ECG语言模型,通过专门的编码器实现ECG与文本的跨理解,展示了在六个任务和九个数据集上的强大零样本性能,包括新提出的ECGForecastBench基准测试。

Comments 24 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06552 2026-03-24 cs.CL 83%

Flipping the Dialogue: Training and Evaluating User Language Models

翻转对话:训练和评估用户语言模型

Tarek Naous, Philippe Laban, Wei Xu, Jennifer Neville

机构 * Microsoft Research(微软研究院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出User LMs,通过多轮对话模拟人类用户,验证其在真实场景下优于传统模拟方法,提升评估准确性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21029 2026-03-24 cs.AI 81%

KLDrive: Fine-Grained 3D Scene Reasoning for Autonomous Driving based on Knowledge Graph

KLDrive: 基于知识图谱的细粒度3D场景推理用于自动驾驶

Ye Tian, Jingyi Zhang, Zihao Wang, Xiaoyuan Ren, Xiaofan Yu, Onat Gungor, Tajana Rosing

机构 * University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校) University of California Merced, Merced, California, USA(加州大学默塞德分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 KLDrive通过构建可靠场景知识图谱和LLM代理进行事实驱动推理,提升自动驾驶中的细粒度问答性能,实验表明其在NuScenes-QA和GVQA上均取得最佳准确率和SPICE分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11549 2026-03-24 cs.LG cs.AI 81%

Native Reasoning Models: Training Language Models to Reason on Unverifiable Data

原生推理模型:训练语言模型在不可验证数据上进行推理

Yuanfu Wang, Zhixuan Liu, Xiangtian Li, Chaochao Lu, Chao Yang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理与问题求解 :language model(title);SFT(abstract);分类 cs.AI、cs.LG

AI总结 本文提出NRT框架,通过让模型自行生成推理轨迹,无需专家示范,提升推理能力,实验证明其在复杂推理任务中表现优异,具有鲁棒性和可扩展性。

Comments Accepted at ICLR 2026. Code available at https://github.com/sharkwyf/native-reasoning-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01547 2026-03-24 cs.CV cs.AI cs.LG 81%

Vision-language models lag human performance on physical dynamics and intent reasoning

视觉-语言模型在物理动态和意图推理上仍逊于人类表现

Tianjun Gu, Jingyu Gong, Zhizhong Zhang, Yuan Xie, Lizhuang Ma, Xin Tan, Athanasios V

机构 * East China Normal University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) University of Agder(阿格德大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Teleo-Spatial Intelligence(TSI)以连接时空变化与目标导向结构,通过EscherVerse大规模开放世界资源评估,发现视觉-语言模型在开放世界中仍无法达到人类水平的意图推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07077 2026-03-24 cs.SD cs.AI 79%

CALM: Class-Conditional Sparse Attention Vectors for Large Audio-Language Models

CALM:用于大音频-语言模型的类条件稀疏注意力向量

Videet Mehta, Liming Wang, Hilde Kuehne, Rogerio Feris, James R. Glass, M. Jehanzeb Mirza

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Tuebingen AI Center(图宾根人工智能中心) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出CALM,一种用于小样本分类的类条件稀疏注意力向量方法,通过学习类依赖的重要性权重提升音频和音频视觉分类性能,实验显示在多个基准上优于传统投票方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20321 2026-03-24 q-bio.MN cs.AI cs.CL 79%

GIP-RAG: An Evidence-Grounded Retrieval-Augmented Framework for Interpretable Gene Interaction and Pathway Impact Analysis

GIP-RAG: 一种基于证据的检索增强框架用于可解释的基因互作和通路影响分析

Fujian Jia, Jiwen Gu, Cheng Lu, Dezhi Zhao, Mengjiang Huang, Yuanzhi Lu, Xin Liu, Kang Liu

机构 * Kanghua Juntai Biotech Co. Ltd.(康华联合生物科技有限公司) Department of Radiation Oncology, Cancer Treatment Center, The Second Affiliated Hospital of Hainan Medical University(海南医学院第二附属医院放疗科、肿瘤治疗中心) Department of Nutrition, University of California, Davis(加州大学戴维斯分校营养系) Department of Pathology, The First Affiliated Hospital of Jinan University(暨南大学第一附属医院病理科)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GIP-RAG结合生物知识图谱与大语言模型,通过检索增强生成方法解析基因互作及通路影响,提供可解释的多步推理和机制解释。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20262 2026-03-24 q-bio.BM cs.AI cs.LG 79%

Deciphering Scientific Reasoning Steps from Outcome Data for Molecule Optimization

从结果数据中解码科学推理步骤以优化分子

Zequn Liu, Kehan Wu, Shufang Xie, Zekun Guo, Wei Zhang, Tao Qin, Renhe Liu, Yingce Xia

机构 * Zhongguancun Academy(中关村学院) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院) Global Health Drug Discovery Institute(全球健康药物发现研究所)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DESRO框架,通过分析分子属性记录中的共享片段,利用LLM恢复分子优化的推理逻辑,并在15项任务中取得最高成功率,展示了从结果数据解码推理步骤的可行性。

Comments Work in progress, 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22091 2026-03-24 cs.CV 78%

P-Flow: Prompting Visual Effects Generation

P-Flow:提示视觉效果生成

Rui Zhao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 推理与问题求解 :prompting(title);language model(abstract)

AI总结 P-Flow通过测试时提示优化,基于参考视频与生成输出的视觉效果差异,迭代改进提示,实现高保真且多样化的动态视觉效果定制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00021 2026-03-24 cs.RO cs.CV 78%

Foundation Models for Trajectory Planning in Autonomous Driving: A Review of Progress and Open Challenges

自动驾驶轨迹规划中的基础模型:进展与开放挑战综述

Kemal Oksuz, Alexandru Buburuzan, Anthony Knittel, Yuhan Yao, Puneet K. Dokania

机构 * Five AI Ltd.(Five AI有限公司) Robert Bosch GmbH(罗伯特·博世有限公司) United Kingdom(英国)

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 本文综述了自动驾驶中基于基础模型的轨迹规划方法,分析了其架构设计、方法优势及局限性,并评估了37种最新方法的代码和数据集开放性。

Comments Accepted to TMLR (Survey Certification)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21778 2026-03-24 cs.CV 78%

Scene-VLM: Multimodal Video Scene Segmentation via Vision-Language Models

Scene-VLM:通过视觉-语言模型进行多模态视频场景分割

Nimrod Berman, Adam Botach, Emanuel Ben-Baruch, Shunit Haviv Hakimi, Asaf Gendler, Ilan Naiman, Erez Yosef, Igor Kviatkovsky

机构 * Ben-Gurion University(本·古里安大学) Amazon Prime Video(亚马逊Prime视频) Tel-Aviv University(特拉维夫大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出Scene-VLM,首个基于视觉-语言模型的视频场景分割框架,通过融合视觉与文本信息实现多模态推理,提升场景分割的准确性和可解释性。

Comments Accepted for publication at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏