arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-05 至 2026-03-05 共收录 241 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 41 篇

2603.03942 2026-03-05 cs.RO 75%

Lightweight Visual Reasoning for Socially-Aware Robots

轻量级视觉推理用于社交感知机器人

Alessio Galatolo, Ronald Cumbal, Alexandros Rouchitsas, Katie Winkle, Didem Gürdür Broo, Ginevra Castellano

机构 * Department of Information Technology, Uppsala University(信息科技系,乌普萨拉大学)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出了一种轻量级视觉推理模块,用于提升社交感知机器人在复杂人机交互中的表现,通过闭环反馈机制增强机器人对动态人类行为的理解和响应能力。

Comments ICRA26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03827 2026-03-05 cs.MM 75%

Evolutionary Multimodal Reasoning via Hierarchical Semantic Representation for Intent Recognition

通过层次语义表示进行进化多模态推理以实现意图识别

Qianrui Zhou, Hua Xu, Yunjin Gu, Yifan Wang, Songze Li, Hanlei Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 HIER通过层次语义表示与进化推理提升多模态意图识别性能,实现更准确的意图推断。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03297 2026-03-05 cs.CL cs.AI cs.LG 75%

TTSR: Test-Time Self-Reflection for Continual Reasoning Improvement

TTSR: 测试时自我反思以提升持续推理能力

Haoyang He, Zihua Rong, Liangjie Zhao, Yunjia Zhao, Lan Yang, Honggang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Southwestern University of Finance and Economics(西南财经大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TTSR通过测试时自我反思机制,利用学生与教师角色交替,持续改进大语言模型的推理能力。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10625 2026-03-05 cs.AI cs.CL 73%

To Think or Not To Think, That is The Question for Large Reasoning Models in Theory of Mind Tasks

思考还是不思考,这是大型推理模型在心智理论任务中的问题

Nanxu Gong, Haotian Li, Sixun Dong, Jianxun Lian, Yanjie Fu, Xing Xie

机构 * Arizona State University, Tempe, Arizona, United States(亚利桑那州立大学) Microsoft Research Asia, Beijing, China(微软亚洲研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型推理模型在心智理论任务中的表现,发现其并不总优于非推理模型,且依赖选项匹配而非真实推理,提出干预方法以缓解问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15040 2026-03-05 cs.CV cs.CL cs.LG 73%

Composition-Grounded Data Synthesis for Visual Reasoning

基于组成性的数据合成用于视觉推理

Xinyi Gu, Jiayuan Mao, Zhang-Wei Hong, Zhuoran Yu, Pengyuan Li, Dhiraj Joshi, Rogerio Feris, Zexue He

机构 * MIT(麻省理工学院) UW-Madison(威斯康星大学麦迪逊分校) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 COGS通过分解种子问题并重新组合生成合成数据,提升MLLMs在图表和网页等人工图像领域的推理能力。

Comments ICLR2026 camera-ready version. Project page: https://cogsynthesis.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04244 2026-03-05 cs.SE cs.AI cs.HC 70%

FeedAIde: Guiding App Users to Submit Rich Feedback Reports by Asking Context-Aware Follow-Up Questions

FeedAIde: 通过提问情境感知的后续问题引导应用用户提交丰富的反馈报告

Ali Ebrahimi Pourasad, Meyssam Saghiri, Walid Maalej

机构 * University of Hamburg(汉堡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FeedAIde通过情境感知和生成式AI技术,帮助用户更高效地提交详细反馈报告,提升开发人员获取信息的价值。

Comments Accepted for publication at the 13th International Conference on Mobile Software Engineering and Systems (MOBILESoft) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04002 2026-03-05 cs.CV cs.AI 70%

Discriminative Perception via Anchored Description for Reasoning Segmentation

通过锚定描述实现的判别感知用于推理分割

Tao Yang, Qing Zhou, Yanliang Li, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DPAD方法,通过生成描述性标题来增强推理分割的判别能力,提升推理链的聚焦性和效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02504 2026-03-05 cs.AI 70%

NeuroProlog: Multi-Task Fine-Tuning for Neurosymbolic Mathematical Reasoning via the Cocktail Effect

NeuroProlog:通过鸡尾酒效应实现神经符号数学推理的多任务微调

Pratibha Zunjare, Michael Hsiao

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NeuroProlog通过鸡尾酒效应实现神经符号数学推理的多任务微调,提升数学推理准确率并改进程序修复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01896 2026-03-05 cs.SE cs.AI cs.PL 70%

Agentic Code Reasoning

代理代码推理

Shubham Ugare, Satish Chandra

机构 * Meta, USA(Meta公司)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出半形式推理方法,通过结构化提示提升代理在代码补丁验证、故障定位和问答任务中的准确性,实现无需执行的代码语义分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21782 2026-03-05 cs.AI 70%

Benchmarking MLLM-based Web Understanding: Reasoning, Robustness and Safety

基于MLLM的网页理解基准测试:推理、鲁棒性与安全性

Junliang Liu, Jingyu Xiao, Wenxin Tang, Zhixian Wang, Zipeng Xie, Wenxuan Wang, Minrui Zhang, Shuanghe Yu

机构 * Dalian Maritime University(大连海事大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学) Renmin University of China(中国人民大学) Wuhan University(武汉大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出WebRRSBench基准测试,评估多模态大语言模型在网页理解中的推理、鲁棒性和安全性能力,揭示模型在复杂交互任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03505 2026-03-05 cs.CV cs.AI 70%

PhyPrompt: RL-based Prompt Refinement for Physically Plausible Text-to-Video Generation

PhyPrompt:基于强化学习的物理合理文本到视频生成的提示优化

Shang Wu, Chenwei Xu, Zhuofan Xia, Weijian Li, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PhyPrompt通过强化学习优化提示,提升文本到视频生成的物理合理性,优于GPT-4o和DeepSeek-V3,实现更高效的物理常识和语义忠实度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17473 2026-03-05 cs.LG 70%

LeanTutor: Towards a Verified AI Mathematical Proof Tutor

LeanTutor:迈向一个可验证的AI数学证明辅导系统

Manooshree Patel, Rayna Bhattacharyya, Thomas Lu, Arnav Mehta, Niels Voss, Narges Norouzi, Gireeja Ranade

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 LeanTutor结合LLMs和定理证明器的优势,提供一个可验证的AI数学证明辅导系统,通过三个模块实现自动形式化、下一步生成和自然语言反馈。

Comments This work was intended as a replacement of arXiv:2506.08321 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08321 2026-03-05 cs.AI cs.HC cs.LO 70%

LeanTutor: Towards a Verified AI Mathematical Proof Tutor

LeanTutor: 向一个可验证的AI数学证明辅导系统迈进

Manooshree Patel, Rayna Bhattacharyya, Thomas Lu, Arnav Mehta, Niels Voss, Narges Norouzi, Gireeja Ranade

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LeanTutor结合LLMs和定理证明器,开发出可验证的AI数学证明辅导系统,通过三个模块提升学生学习效率。

Comments Comments: Previously this version appeared as arXiv:2601.17473 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04124 2026-03-05 cs.AI cond-mat.mtrl-sci cs.CL cs.LG 67%

BeamPERL: Parameter-Efficient RL with Verifiable Rewards Specializes Compact LLMs for Structured Beam Mechanics Reasoning

BeamPERL: 参数高效强化学习与可验证奖励用于结构梁力学推理

Tarjei Paule Hage, Markus J. Buehler

机构 * Department of Mechanical Engineering(机械工程系) Massachusetts Institute of Technology(麻省理工学院) Department of Civil and Environmental Engineering(土木与环境工程系) Schwarzman College of Computing(施瓦茨曼计算学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BeamPERL通过参数高效强化学习与可验证奖励,提升紧凑语言模型在结构梁力学推理中的能力,发现精确奖励无法保证可转移的物理推理,需结合结构化推理支架以实现稳健科学推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03667 2026-03-05 cs.NI 67%

ORION: Intent-Aware Orchestration in Open RAN for SLA-Driven Network Management

ORION:面向开放RAN的意图感知编排

Gabriela da Silva Machado, Gustavo Z. Bruno, Alexandre Huff, Jose Marcos Camara Brito, Cristiano B. Both

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 ORION通过整合大语言模型实现开放RAN的意图编排,提升网络管理的自动化与智能化水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03617 2026-03-05 cs.CV 67%

RAGTrack: Language-aware RGBT Tracking with Retrieval-Augmented Generation

RAGTrack: 基于检索增强生成的语言感知RGBT跟踪

Hao Li, Yuhao Wang, Wenning Hao, Pingping Zhang, Dong Wang, Huchuan Lu

机构 * College of Command and Control Engineering, Army Engineering University of PLA(中国人民解放军陆军工程大学指挥控制工程学院) School of Future Technology, Dalian University of Technology(大连理工大学未来技术学院) School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 RAGTrack通过引入语言指导的检索增强生成框架,解决RGBT跟踪中外观变化和模态间隙问题,实现稳健的目标定位。

Comments This work is accepted by CVPR2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02929 2026-03-05 cs.CV 67%

TRACE: Task-Adaptive Reasoning and Representation Learning for Universal Multimodal Retrieval

TRACE:面向通用多模态检索的任务自适应推理与表征学习

Xiangzhao Hao, Shijie Wang, Tianyu Yang, Tianyue Wang, Haiyun Guo, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 TRACE通过结合生成推理与判别表征学习,实现通用多模态检索中的任务自适应推理,提升检索准确率与推理效率,同时具备强零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19524 2026-03-05 cs.CV cs.MA 67%

VideoChat-M1: Collaborative Policy Planning for Video Understanding via Multi-Agent Reinforcement Learning

VideoChat-M1: 通过多智能体强化学习实现视频理解的协作策略规划

Boyu Chen, Zikang Wang, Zhengrong Yue, Kainan Yan, Chenyun Yu, Yi Huang, Zijun Liu, Yafei Wen, Xiaoxin Chen, Yang Liu, Peng Li, Yali Wang

机构 * Shenzhen Key Lab of Computer Vision and Pattern Recognition(深圳计算机视觉与模式识别重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) VIVO AI Lab(VIVO人工智能实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shenzhen Campus of Sun Yat-sen University(孙逸仙大学深圳校区) Shanghai Jiao Tong University(上海交通大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系,人工智能研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 VideoChat-M1通过多智能体强化学习实现视频理解的协作策略规划,显著提升复杂视频任务的性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19655 2026-03-05 cs.RO 67%

LaViRA: Language-Vision-Robot Actions Translation for Zero-Shot Vision Language Navigation in Continuous Environments

LaViRA: 语言-视觉-机器人动作翻译用于连续环境中的零样本视觉语言导航

Hongyu Ding, Ziming Xu, Yudong Fang, You Wu, Zixuan Chen, Jieqi Shi, Jing Huo, Yifan Zhang, Yang Gao

机构 * School of Computer Science, Nanjing University(南京大学计算机科学学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 LaViRA通过分解动作层次结构,利用多模态大语言模型的优势,实现连续环境中零样本视觉语言导航的高效导航与泛化能力。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11538 2026-03-05 cs.CV 67%

Reinforcing Video Reasoning Segmentation to Think Before It Segments

强化视频推理分割以在分割前思考

Sitong Gong, Lu Zhang, Yunzhi Zhuge, Xu Jia, Pingping Zhang, Huchuan Lu

专题命中 推理与问题求解 :language model(abstract);SFT(abstract)

AI总结 Veason-R1通过组相对策略优化和链式思维初始化,提升视频推理分割的结构化推理能力,实现更准确的时空定位和鲁棒性。

Comments 12 pages

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00225 2026-03-05 cs.SE 67%

Large-scale, Independent and Comprehensive study of the power of LLMs for test case generation

大规模、独立和全面的LLM生成测试用例能力研究

Wendkûuni C. Ouédraogo, Kader Kaboré, Yinghua Li, Haoye Tian, Anil Koyuncu, Jacques Klein, David Lo, Tegawendé F. Bissyandé

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract)

AI总结 本研究评估了LLM生成单元测试的可靠性与可维护性,发现基于推理的提示技术提升性能,但幻觉驱动的故障仍需混合方法解决。

Comments Accepted at Empirical Software Engineering (EMSE) journal on 3 March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04380 2026-03-05 cs.CV cs.CL 57%

TaxonRL: Reinforcement Learning with Intermediate Rewards for Interpretable Fine-Grained Visual Reasoning

TaxonRL: 用于可解释细粒度视觉推理的强化学习

Maximilian von Klinski, Maximilian Schall

机构 * Hasso Plattner Institute University of Potsdam(波茨坦大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 TaxonRL通过强化学习和中间奖励实现结构化层次推理,提升细粒度视觉分类的准确性和可解释性。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03983 2026-03-05 cs.CV cs.AI 57%

GeoSeg: Training-Free Reasoning-Driven Segmentation in Remote Sensing Imagery

GeoSeg: 无需训练的推理驱动遥感图像分割

Lifan Jiang, Yuhang Pei, oxi Wu, Yan Zhao, Tianrun Wu, Shulong Yu, Lihui Zhang, Deng Cai

机构 * State Key lab of CAD\&CG, Zhejiang University UniTTEC Co. Ltd. Wuchan Zhongda Chengtou (Ningbo) Holdings. Ltd.

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 GeoSeg通过结合大规模语言模型推理与精确定位,无需训练实现遥感图像分割的高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22235 2026-03-05 cs.AI 57%

Training High-Level Schedulers with Execution-Feedback Reinforcement Learning for Long-Horizon GUI Automation

通过执行反馈强化学习训练高阶调度器以实现长周期GUI自动化

Zehao Deng, Tianjie Ju, Zheng Wu, Zhuosheng Zhang, Gongshen Liu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出CES多代理框架,通过训练高阶调度器解决GUI代理在长周期任务中的责任耦合和状态管理问题,提升任务规划与执行效率。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03284 2026-03-05 cs.AI 57%

ToolVQA: A Dataset for Multi-step Reasoning VQA with External Tools

ToolVQA: 一个用于多步推理VQA的外部工具数据集

Shaofeng Yin, Ting Lei, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机科学技术研究院)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 ToolVQA是一个用于多步推理VQA的外部工具数据集,通过真实场景和复杂推理任务提升模型在现实工具使用中的泛化能力。

Comments Project page: https://fugtemypt123.github.io/ToolVQA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04265 2026-03-05 cs.CV 50%

ViterbiPlanNet: Injecting Procedural Knowledge via Differentiable Viterbi for Planning in Instructional Videos

ViterbiPlanNet: 通过可微Viterbi注入过程性知识以在教学视频中进行规划

Luigi Seminara, Davide Moltisanti, Antonino Furnari

机构 * University of Catania(卡塔尼亚大学) University of Bath(巴斯大学)

专题命中 推理与问题求解 :LLM(abstract)

AI总结 ViterbiPlanNet通过可微Viterbi层整合过程性知识,实现高效的教学视频规划,提升样本效率和鲁棒性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25191 2026-03-05 cs.RO 50%

SoraNav: Adaptive UAV Task-Centric Navigation via Zeroshot VLM Reasoning

SoraNav: 通过零样本VLM推理实现适应性无人机任务导向导航

Hongyu Song, Rishabh Dev Yadav, Cheng Guo, Wei Pan

机构 * Department of Computer Science, The University of Manchester(计算机科学系,曼彻斯特大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 SoraNav通过零样本VLM推理实现无人机任务导向导航,解决空间-语义差距问题,提升导航成功率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03406 2026-03-05 cs.SE 50%

Review Beats Planning: Dual-Model Interaction Patterns for Code Synthesis

Review Beats Planning: 双模型交互模式用于代码合成

Jan Miller

专题命中 推理与问题求解 :language model(abstract)

AI总结 通过双模型交互模式提升代码生成性能,审查优于规划,增强规范质量可进一步提高效果。

Comments 10 pages, 5 figures, 4 tables. Code and results: https://github.com/miller-itsec/review-beats-planning

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 59 篇

2603.03846 2026-03-05 cs.CL 89%

Benchmarking Motivational Interviewing Competence of Large Language Models

对大型语言模型动机访谈能力的评估

Aishwariya Jha, Prakrithi Shivaprakash, Lekhansh Shukla, Animesh Mukherjee, Prabhat Chand, Pratima Murthy

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文评估了大型语言模型在真实世界临床转录中的动机访谈能力,发现LLM在MITI框架下表现良好,甚至在复杂反思和问题比率上优于人类专家。

Comments 17 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16852 2026-03-05 cs.CL 89%

Meenz bleibt Meenz, but Large Language Models Do Not Speak Its Dialect

梅恩语仍为梅恩语,但大语言模型并不说它的方言

Minh Duc Bui, Manuel Mager, Peter Herbert Kann, Katharina von der Wense

机构 * Johannes Gutenberg University Mainz, Germany(莱茵河畔摩泽尔大学) Marburg University, Germany(马堡大学) University of Colorado Boulder, USA(科罗拉多大学波德分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究首次探讨梅恩语的NLP应用,发现大语言模型在生成方言词汇定义和生成方面表现不佳,需更多资源和研究支持。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏