arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 507 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 94 篇

2512.14944 2026-03-17 cs.CV 67%

PuzzleCraft: Exploration-Aware Curriculum Learning for Puzzle-Based RLVR in VLMs

PuzzleCraft: 为基于谜题的RLVR在VLMs中的探索感知课程学习

Ahmadreza Jeddi, Hakki Can Karaimer, Hue Nguyen, Zhongling Wang, Ke Zhao, Javad Rajabi, Ran Zhang, Raghav Goyal, Konstantinos G. Derpanis, Babak Taati, Radek Grzeszczuk

机构 * AI Center-Toronto(多伦多AI中心) Samsung Electronics(三星电子) University of Toronto(多伦多大学) Vector Institute(向量研究所) York University(约克大学)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract)

AI总结 PuzzleCraft通过轻量级谜题环境和探索信号优化课程学习,提升VLMs的视觉RLVR能力,增强推理一致性与下游表现。

Comments Project page: https://puzzlecraftgrpo.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03667 2026-03-17 cs.CV 67%

Colon-X: Advancing Intelligent Colonoscopy toward Clinical Reasoning

Colon-X:推动智能结肠镜向临床推理迈进

Ge-Peng Ji, Jingyi Liu, Deng-Ping Fan, Huazhu Fu, Nick Barnes

机构 * NKIARI & SLAI, Shenzhen Futian and VCIP, Nankai University, Tianjin, China(NKIARI与SLAI,深圳福田及VCIP,南开大学,天津,中国) Australian National University (ANU), Canberra, Australia(澳大利亚国立大学(ANU),堪培拉,澳大利亚) King Abdullah University of Science and Technology (KAUST), Thuwal, Saudi Arabia(国王阿卜杜勒·阿齐兹大学(KAUST),图瓦尔,沙特阿拉伯) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科学、技术和研究局(A*STAR),新加坡)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出Colon-X,构建了最全面的结肠镜多模态数据集ColonVQA,并开发了专为结肠镜设计的ColonR1模型,通过任务自适应奖励和梯度稳定策略优化,在数据稀缺条件下实现了56.61%的总体准确率,优于监督微调方法。

Comments Technical report (v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15364 2026-03-17 cs.AI cs.CL 62%

CRASH: Cognitive Reasoning Agent for Safety Hazards in Autonomous Driving

CRASH:面向自动驾驶安全隐患的认知推理代理

Erick Silva, Rehana Yasmin, Ali Shoker

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹科技大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CRASH,一种基于大语言模型的自动驾驶安全隐患分析工具,通过自动化处理事故报告,识别事故原因并评估自动驾驶系统对事故的影响,验证其在事故分析中的有效性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19554 2026-03-17 cs.LG cs.AI 62%

CARE What Fails: Contrastive Anchored-REflection for Verifiable Multimodal Reasoning

CARE:对比锚定反射用于可验证多模态推理

Yongxin Wang, Zhicheng Yang, Meng Cao, Mingfei Han, Haokun Lin, Yingying Zhu, Xiaojun Chang, Xiaodan Liang

专题命中 推理与问题求解 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 CARE通过对比锚定反射框架,将错误转化为监督信号,提升多模态推理的准确性和训练平滑度,在六个可验证视觉推理基准上提升4.6个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09944 2026-03-17 cs.AI cs.CV cs.LG eess.IV 62%

Echo-CoPilot: A Multiple-Perspective Agentic Framework for Reliable Echocardiography Interpretation

Echo-CoPilot:一种多视角代理框架,用于可靠的超声心动图解读

Moein Heidari, Ali Mehrabian, Mohammad Amin Roohi, Wenjin Chen, David J. Foran, Jasmine Grewal, Ilker Hacihaliloglu

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Echo-CoPilot框架,结合多视角工作流程与知识图谱引导的测量选择,通过三个独立的ReAct式代理处理超声心动图任务,提升解读准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07112 2026-03-17 cs.CL cs.AI 62%

More Agents Improve Math Problem Solving but Adversarial Robustness Gap Persists

更多代理提升数学问题解决能力但对抗鲁棒性差距依然存在

Khashayar Alavi, Zhastay Yeltay, Lucie Flek, Akbar Karimi

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了多个代理在数学问答中的表现,发现协作提升准确性但对抗鲁棒性差距持续存在,人类错误仍是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26255 2026-03-17 cs.AI cs.CV cs.LG cs.RO 62%

ExoPredicator: Learning Abstract Models of Dynamic Worlds for Robot Planning

ExoPredicator:为机器人规划学习动态世界的抽象模型

Yichao Liang, Dat Nguyen, Cambridge Yang, Tianyang Li, Joshua B. Tenenbaum, Carl Edward Rasmussen, Adrian Weller, Zenna Tavares, Tom Silver, Kevin Ellis

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ExoPredicator框架,通过联合学习符号状态表示和因果过程,解决长周期具身规划中的外源性过程建模问题,实现对复杂任务的泛化能力。

Comments ICLR 2026. The last two authors contributed equally in co-advising

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11052 2026-03-17 cs.DB cs.AI cs.CL cs.HC cs.IR 62%

GraphSeek: Next-Generation Graph Analytics with LLMs

GraphSeek: 基于LLM的下一代图分析

Maciej Besta, Łukasz Jarmocik, Orest Hrycyna, Shachar Klaiman, Konrad Mączka, Robert Gerstenberger, Jürgen Müller, Piotr Nyczyk, Hubert Niewiadomski, Torsten Hoefler

机构 * ETH Zurich(苏黎世联邦理工学院) IDEAS Research Institute(IDEAS研究机构) Cledar(Cledar公司) NCBJ Warszawa(华沙国家生物中心) BASF SE(巴斯夫股份有限公司)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GraphSeek框架,通过语义目录实现复杂多查询分析,提升图数据处理效率与效果,实现LLM推理与数据库级执行的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14523 2026-03-17 cs.CV cs.AI cs.RO 57%

VLA-Thinker: Boosting Vision-Language-Action Models through Thinking-with-Image Reasoning

VLA-Thinker: 通过图像推理增强视觉-语言-动作模型

Chaoyang Wang, Wenrui Bao, Sicheng Gao, Bingxin Xu, Yu Tian, Yogesh S. Rawat, Yunhao Ge, Yuzhang Shang

专题命中 推理与问题求解 :SFT(abstract);分类 cs.AI

AI总结 本文提出VLA-Thinker框架,通过动态可调用的推理动作提升视觉语言动作模型的能力,通过两阶段训练流程提升操控性能,在LIBERO和RoboTwin 2.0基准上取得显著成果。

Comments We introduce VLA-Thinker, the first VLA model capable of thinking-with-image reasoning, which models visual perception as a dynamically invocable reasoning action, enabling Multimodal Embodied Chain-of-Thought

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14006 2026-03-17 cs.CL 57%

Beyond Explicit Edges: Robust Reasoning over Noisy and Sparse Knowledge Graphs

超越显式边:在噪声和稀疏知识图谱上的鲁棒推理

Hang Gao, Dimitris N. Metaxas

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 本文提出INSES框架,通过LLM引导导航和嵌入相似性扩展,提升噪声和稀疏知识图谱的推理能力,在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11445 2026-03-17 cs.AI cs.MA 57%

Verified Multi-Agent Orchestration: A Plan-Execute-Verify-Replan Framework for Complex Query Resolution

验证多智能体协调:复杂查询解析的计划-执行-验证-重计划框架

Xing Zhang, Yanwei Cui, Guanghui Wang, Wei Qiu, Ziyuan Li, Fangwei Han, Yajing Huang, Hengzhi Qiu, Bing Zhu, Peiyang He

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出VMAO框架,通过验证驱动的迭代循环协调专用LLM代理,提升复杂查询解答的完整性和来源质量。

Comments ICLR 2026 Workshop on MALGAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06117 2026-03-17 cs.LG 57%

The Active Discoverer Framework: Towards Autonomous Physics Reasoning through Neuro-Symbolic LaTeX Synthesis

主动发现框架:通过神经符号LaTeX合成实现自主物理推理

Hyunjun Jeon

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

AI总结 本文提出主动发现框架,通过神经符号LaTeX合成实现自主物理推理,解决神经网络在大规模计算中的精度问题,并验证其在物理常数推导中的有效性。

Comments V4 Coming S00N :)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15509 2026-03-17 cs.AI cs.CV 57%

Chart-R1: Chain-of-Thought Supervision and Reinforcement for Advanced Chart Reasoner

Chart-R1: 链式推理监督与强化学习用于高级图表推理器

Lei Chen, Xuanle Zhao, Zhixiong Zeng, Jing Huang, Yufeng Zhong, Lin Ma

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出Chart-R1,通过链式推理监督和强化学习提升图表推理能力,通过程序化数据合成和两阶段训练策略,在图表领域取得显著性能提升。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13799 2026-03-17 cs.LG 57%

Node Role-Guided LLMs for Dynamic Graph Clustering

基于节点角色的动态图聚类LLM

Dongyuan Li, Ying Zhang, Yaozu Wu, Renhe Jiang

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

AI总结 本文提出DyG-RoLLM框架,通过可学习原型将连续图嵌入映射为离散语义概念,实现动态图聚类的可解释性与鲁棒性。

Comments The paper has been accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13433 2026-03-17 cs.RO cs.AI 57%

Spatially Grounded Long-Horizon Task Planning in the Wild

在真实环境中进行具有长时域的任务规划

Sehun Jung, HyunJee Song, Dong-Hee Kim, Reuben Tan, Jianfeng Gao, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) Microsoft Research(微软研究院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于空间的规划任务,引入了GroundedPlanBench基准,评估机器人在真实环境中的长时域动作规划能力,并通过V2GP框架提升空间接地规划性能。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02990 2026-03-17 cs.LG 57%

Learning to Repair Lean Proofs from Compiler Feedback

从编译器反馈中学习修复Lean证明

Evan Wang, Simon Chess, Daniel Lee, Siyuan Ge, Ajit Mallavarapu, Jarod Alper, Vasily Ilin

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 本文研究了将Lean证明修复作为监督学习问题,提出APRIL数据集,通过系统生成的证明错误与编译器诊断配对,提升修复准确性和反馈条件推理能力。

Comments 15 pages, 6 figures

Journal ref ICLR VerifAI Workshop, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14811 2026-03-17 cs.RO cs.CV 50%

Ego to World: Collaborative Spatial Reasoning in Embodied Systems via Reinforcement Learning

从自身视角到世界视角:通过强化学习实现具身系统的协作空间推理

Heng Zhou, Li Kang, Yiran Qin, Xiufeng Song, Ao Yu, Zilu Zhang, Haoming Song, Kaixin Xu, Yuchen Fan, Dongzhan Zhou, Xiaohong Liu, Ruimao Zhang, Philip Torr, Lei Bai, Zhenfei Yin

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出E2W基准和CoRL框架,通过结合链式推理监督微调与强化学习,解决多智能体系统中分布式视角下的空间推理问题,实现跨视角实体识别与任务执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14786 2026-03-17 cs.RO 50%

CORAL: COntextual Reasoning And Local Planning in A Hierarchical VLM Framework for Underwater Monitoring

CORAL:在分层视觉语言框架中实现上下文推理与局部规划用于水下监测

Zhenqi Wu, Yuanjie Lu, Xuesu Xiao, Xiaomin Lin

专题命中 推理与问题求解 :language model(abstract)

AI总结 CORAL框架通过分离高层语义推理与底层反应控制,提升水下监测的覆盖率和安全性,减少碰撞并降低对VLM的调用次数。

Comments Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14367 2026-03-17 cs.CV 50%

HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task

HomeGuard: 基于视觉-语言模型的具身安全防护系统用于识别家庭任务中的上下文风险

Xiaoya Lu, Yijin Zhou, Zeren Chen, Ruocheng Wang, Bingrui Sima, Enshen Zhou, Lu Sheng, Dongrui Liu, Jing Shao

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出HomeGuard系统,通过Context-Guided Chain-of-Thought机制,结合定制数据集和强化微调策略,提升家庭任务中风险识别精度,减少误判,同时为后续规划提供空间约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14117 2026-03-17 cs.CV 50%

Improving Visual Reasoning with Iterative Evidence Refinement

通过迭代证据细化提升视觉推理

Zeru Shi, Kai Mei, Yihao Quan, Dimitris N. Metaxas, Ruixiang Tang

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出SIEVE框架,利用模型内部信号直接支持图像 grounded 推理,通过强化学习指导视觉重访,提升多基准性能8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13788 2026-03-17 cs.RO 50%

ST-VLA: Enabling 4D-Aware Spatiotemporal Understanding for General Robot Manipulation

ST-VLA:为通用机器人操作实现4D感知的时空理解

You Wu, Zixuan Chen, Cunxu Ou, Wenxuan Wang, Wenbo Huang, Lin Cao, Yangtao Chen, Weichao Qiu, Xingyue Quan, Jieqi Shi, Jing Huo, Yang Gao

专题命中 推理与问题求解 :language model(abstract)

AI总结 ST-VLA通过统一的3D-4D表示连接感知与动作,利用ST-Human数据集训练时空视觉语言模型,提升复杂3D场景中的鲁棒性和泛化能力。

Comments 25 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13774 2026-03-17 cs.DB 50%

AgenticScholar: Agentic Data Management with Pipeline Orchestration for Scholarly Corpora

AgenticScholar: 基于管道编排的代理数据管理用于学术语料

Hai Lan, Tingting Wang, Zhifeng Bao, Guoliang Li, Daomin Ji, Ge Lee, Feng Luo, Zi Huang, Hailang Qiu, Gang Hua

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出AgenticScholar系统,整合结构化知识表示层、LLM中心混合查询规划层和统一执行层,实现多模态学术数据的端到端推理,有效提升学术数据管理的效率和可解释性。

Comments 54 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13759 2026-03-17 cs.CV 50%

QTrack: Query-Driven Reasoning for Multi-modal MOT

QTrack: 基于查询的多模态 MOT 推理

Tajamul Ashraf, Tavaheed Tariq, Sonia Yadav, Abrar Ul Riyaz, Wasif Tak, Moloud Abdar, Janibul Bashir

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出基于查询的多模态 MOT 推理方法,通过自然语言查询定位和跟踪特定目标,构建了 RMOT26 基准并提出 QTrack 模型,结合多模态推理与跟踪定位,提升语言引导的跟踪性能。

Comments Project Page: https://gaashlab.github.io/QTrack/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25548 2026-03-17 cs.RO 50%

Using VLM Reasoning to Constrain Task and Motion Planning

利用视觉语言模型推理来约束任务和运动规划

Muyang Yan, Miras Mengdibayev, Ardon Floros, Weihang Guo, Lydia E. Kavraki, Zachary Kingston

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) Department of Computer Science, Rice University(莱斯大学计算机科学系) Ken Kennedy Institute, Rice University(莱斯大学肯尼迪研究所)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出VIZ-COAST方法,利用大预训练视觉语言模型的空间推理能力,提前识别向下细化中的问题,减少规划时间并消除失败。

Comments 9 pages, 7 figures, 1 table. Submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 110 篇

2505.16643 2026-03-17 cs.CV cs.AI 90%

From Evaluation to Defense: Advancing Safety in Video Large Language Models

从评估到防御:推进视频大语言模型的安全性

Yiwei Sun, Peiqi Jiang, Chuanbin Liu, Luohao Lin, Zhiying Lu, Hongtao Xie

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

AI总结 本文提出VideoSafety-R1框架,通过创新方法提升视频大语言模型的安全性,实验显示其在多个安全数据集上取得显著提升。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10969 2026-03-17 cs.LG cs.CL cs.CR cs.SE 90%

TOSSS: a CVE-based Software Security Benchmark for Large Language Models

TOSSS: 基于CVE的软件安全基准用于大语言模型

Marc Damie, Murat Bilgehan Ertan, Domenico Essoussi, Angela Makhanu, Gaëtan Peter, Roos Wensveen

机构 * University of Twente(特文特大学) CWI Amsterdam(阿姆斯特丹信息与计算科学研究所) Erasmus University Rotterdam(埃因霍温大学 Rotterdam分校) Modat

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TOSSS基准,用于评估大语言模型在选择安全与易受攻击代码片段能力,通过CVE数据库提供可扩展框架,评估14种模型在C/C++和Java代码中的安全得分,范围0.48至0.89。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00691 2026-03-17 cs.CL cs.LG 90%

Labels Generated by Large Language Models Help Measure People's Empathy in Vitro

由大型语言模型生成的标签有助于在体外测量人们的共情能力

Md Rakibul Hasan, Yue Yao, Md Zakir Hossain, Aneesh Krishna, Imre Rudas, Shafin Rahman, Tom Gedeon

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了利用大型语言模型生成的标签提升主流模型监督训练的潜力,通过噪声标签校正和训练数据增强策略,提高了共情计算任务的准确性,并在公开数据集上取得了显著成果。

Comments This work has been submitted to the IEEE for possible publication

Journal ref IEEE Journal of Selected Topics in Signal Processing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13691 2026-03-17 cs.CL cs.AI 90%

QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models

QuarkMedBench: 一个基于现实场景的基准测试,用于评估大型语言模型

Yao Wu, Kangping Yin, Liang Dong, Zhenxin Ma, Shuting Xu, Xuehai Wang, Yuxuan Jiang, Tingting Yu, Yunqing Hong, Jiayi Liu, Rianzhe Huang, Shuxin Zhao, Haiping Hu, Wen Shang, Jian Xu, Guanjun Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 QuarkMedBench通过构建大规模医疗数据集和自动评分框架,评估LLM在真实医疗查询中的表现,揭示传统考试指标的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13305 2026-03-17 cs.LG cs.AI 90%

Evidence-based Distributional Alignment for Large Language Models

基于证据的分布对齐用于大语言模型

Viet-Thanh Pham, Lizhen Qu, Zhuang Li, Gholamreza Haffari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Evi-DA方法,通过检索世界价值观调查数据预测国家条件下的答案分布,提升大语言模型在领域和文化变化下的分布估计精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14313 2026-03-17 cs.CL 89%

Mind the Shift: Decoding Monetary Policy Stance from FOMC Statements with Large Language Models

注意偏移:利用大语言模型从FOMC声明中解码货币政策立场

Yixuan Tang, Yi Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出Delta-Consistent Scoring框架,通过联合建模绝对立场和会议间相对变化,无需标注即可从FOMC声明中解码货币政策立场,实现时间一致的立场轨迹,提升分类准确率并具有经济意义。

详情

展开后加载摘要…

URL PDF HTML 收藏