arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2310.14338 2024-02-13 cs.CL cs.AI 73%

From Chaos to Clarity: Claim Normalization to Empower Fact-Checking

Megha Sundriyal, Tanmoy Chakraborty, Preslav Nakov

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Accepted at Findings EMNLP2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16541 2024-01-31 cs.CL cs.AI 73%

GuReT: Distinguishing Guilt and Regret related Text

Sabur Butt, Fazlourrahman Balouchzahi, Abdul Gafar Manuel Meque, Maaz Amjad, Hector G. Ceballos Cancino, Grigori Sidorov, Alexander Gelbukh

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.10614 2023-11-20 cs.CL cs.AI 73%

A Self-enhancement Approach for Domain-specific Chatbot Training via Knowledge Mining and Digest

Ruohong Zhang, Luyu Gao, Chen Zheng, Zhen Fan, Guokun Lai, Zheng Zhang, Fangzhou Ai, Yiming Yang, Hongxia Yang

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15421 2023-11-01 cs.CL cs.AI 73%

FANToM: A Benchmark for Stress-testing Machine Theory of Mind in Interactions

Hyunwoo Kim, Melanie Sclar, Xuhui Zhou, Ronan Le Bras, Gunhee Kim, Yejin Choi, Maarten Sap

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2023. Code and dataset can be found here: https://hyunw.kim/fantom

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15074 2023-10-24 cs.CL cs.AI 73%

Have LLMs Advanced Enough? A Challenging Problem Solving Benchmark For Large Language Models

Daman Arora, Himanshu Gaurav Singh, Mausam

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.03051 2023-10-06 cs.CL cs.AI 73%

How FaR Are Large Language Models From Agents with Theory-of-Mind?

Pei Zhou, Aman Madaan, Srividya Pranavi Potharaju, Aditya Gupta, Kevin R. McKee, Ari Holtzman, Jay Pujara, Xiang Ren, Swaroop Mishra, Aida Nematzadeh, Shyam Upadhyay, Manaal Faruqui

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Preprint, 18 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11224 2023-09-12 cs.AI cs.CL 73%

Evaluating Large Language Models on Graphs: Performance Insights and Comparative Analysis

Chang Liu, Bo Wu

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02206 2023-08-24 cs.LG cs.CL 73%

Domain Specific Question Answering Over Knowledge Graphs Using Logical Programming and Large Language Models

Navid Madani, Rohini K. Srihari, Kenneth Joseph

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04738 2023-07-11 cs.RO cs.AI cs.LG 73%

RoCo: Dialectic Multi-Robot Collaboration with Large Language Models

Zhao Mandi, Shreeya Jain, Shuran Song

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05425 2023-06-09 cs.CV cs.AI cs.CL cs.HC 73%

MIMIC-IT: Multi-Modal In-Context Instruction Tuning

Bo Li, Yuanhan Zhang, Liangyu Chen, Jinghao Wang, Fanyi Pu, Jingkang Yang, Chunyuan Li, Ziwei Liu

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

Comments Project page: https://otter-ntu.github.io/ Dataset & code: https://github.com/Luodian/otter Initial release, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.11416 2022-12-08 cs.LG cs.CL 73%

Scaling Instruction-Finetuned Language Models

Hyung Won Chung, Le Hou, Shayne Longpre, Barret Zoph, Yi Tay, William Fedus, Yunxuan Li, Xuezhi Wang, Mostafa Dehghani, Siddhartha Brahma, Albert Webson, Shixiang Shane Gu, Zhuyun Dai, Mirac Suzgun, Xinyun Chen, Aakanksha Chowdhery, Alex Castro-Ros, Marie Pellat, Kevin Robinson, Dasha Valter, Sharan Narang, Gaurav Mishra, Adams Yu, Vincent Zhao, Yanping Huang, Andrew Dai, Hongkun Yu, Slav Petrov, Ed H. Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V. Le, Jason Wei

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG

Comments Public checkpoints: https://huggingface.co/docs/transformers/model_doc/flan-t5

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18905 2025-11-12 cs.AI 72%

How Far are VLMs from Visual Spatial Intelligence? A Benchmark-Driven Perspective

Songsong Yu, Yuxin Chen, Hao Ju, Lianjie Jia, Fuxi Zhang, Shaofei Huang, Yuhan Wu, Rundi Cui, Binghao Ran, Zaibin Zhang, Zhedong Zheng, Zhipeng Zhang, Yifan Wang, Lin Song, Lijun Wang, Yanwei Li, Ying Shan, Huchuan Lu

机构 * ARC Lab, Tencent PCG(腾讯PCG部门ARC实验室) Shanghai Jiao Tong University(上海交通大学) University of Macau(澳门大学) Dalian University of Technology(大连理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract,comments);planning(abstract);分类 cs.AI

Comments a comprehensive visual spatial reasoning evaluation tool, 25 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07850 2026-08-05 physics.comp-ph math-ph math.MP 版本更新 71%

PDE-Agents: An LLM-Orchestrated Multi-Agent Framework for Automated Finite Element Simulations with Knowledge Graph-Augmented Reasoning

PDE-Agents: 一种基于知识图谱增强推理的LLM编排多智能体框架,用于自动化有限元模拟

Sayan Adhikari, Gulshan Noorsumar, Øyvind Jensen

专题命中 推理评测 :reasoning(title)

AI总结 提出PDE-Agents多智能体系统,通过LLM编排实现偏微分方程/有限元模拟全流程自动化,采用GraphRAG知识图谱增强,在50个任务消融实验中KG Smart模式达100%成功率,并验证了二阶空间收敛性。

Comments 19 pages, 9 figures, 10 tables, 1 algorithm. Code and evaluation artifacts: https://github.com/MatPro-IFE/pde-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25789 2026-07-29 cs.CV 新提交 71%

Towards Faithful Sentimental Image Captioning via Evidence-Aware Multi-Agent Reasoning

通过证据感知多智能体推理实现忠实的情感图像字幕生成

Tiecheng Cai, Zexian Yang, Chao Chen, Shanshan Lin, Xiangwen Liao

专题命中 推理评测 :reasoning(title)

AI总结 研究情感图像字幕生成中平衡情感表达与视觉保真度的问题,提出SEA-Cap系统,通过情感证据挖掘器提取线索,利用多智能体协作工作流程,依视觉证据审核完善字幕,有效减轻幻觉并达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24424 2026-07-28 cs.CV 新提交 71%

MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning

MAViE:用于细粒度视觉感知和高效多模态推理的多尺度自适应视觉编码器

Shaofei Lei

专题命中 推理评测 :reasoning(title)

AI总结 研究针对视觉语言模型问题,提出多尺度自适应视觉编码器MAViE,通过融合多层特征、进行令牌路由及引入相关策略,在统一框架下实验,减少视觉令牌数量,提升多任务分数并降低处理时间,还给出模型设计与评估协议。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22715 2026-07-28 cs.CV cs.MM 新提交 71%

Child-Oriented AIGC Video Risk Reviewing: A Benchmark and Knowledge-Supported Iterative Reasoning Framework

面向儿童的AIGC视频风险审查:一个基准和知识支持的迭代推理框架

Lewen Mi, Manyi Li, Yuling Sun, Yufan Zhang, Yuxin Shi, Yulong Bian, Xiangxian Li, Juan Liu

机构 * Shandong University(山东大学) Fudan University(复旦大学) Beijing Jiaotong University(北京交通大学)

专题命中 推理评测 :reasoning(title)

AI总结 研究面向儿童的AIGC视频审查问题,构建CAVSR基准和分层风险分类法,提出结合多智能体协作与知识经验的QVRS-E框架,实验证明该方法能增强儿童相关风险审查,产生更可靠报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04623 2026-07-07 cs.SE cs.DC 新提交 71%

Can LLMs Really Recover Microservice Failures? A Recovery-Aware Evaluation of Diagnosis-to-Action Reasoning

大语言模型真的能恢复微服务故障吗?对诊断到行动推理的恢复感知评估

Jiaxing Qi, Zhongzhi Luan, Hongyu Zhang, Shaohan Huang, Carol Fung, Yongxin Tong, Hailong Yang, Depei Qian

专题命中 推理评测 :reasoning(title)

AI总结 研究大语言模型在云原生微服务系统中恢复故障的能力,提出R2Act框架,定义相关内容并实例化为基准数据集,评估多种方法,发现恢复失败多因难以将诊断证据转化为有效恢复行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17262 2026-05-19 cs.CV 71%

EgoIntrospect: An Egocentric Dataset and Benchmark for User-Centric Internal State Reasoning

EgoIntrospect: 一个用于用户中心内部状态推理的注视数据集和基准

Zeyu Wang, Chang Liu, Eduardus Tjitrahardja, Yuntao Wang, Borislav Pavlov, Fangfei Gou, Jose Manuel Davila, Dai Shi, Ran Xu, Yue Pan, Jiayi Tan, Shuting Chang, Qi Wang, Jinzhao Li, Jiacheng Hua, Yifei Huang, Jingwei Sun, Yu Zhang, Liuxin Zhang, Guocai Yao, Jia Jia, Yin Li, Qianying Wang, Yuanchun Shi, Miao Liu

机构 * Tsinghua University(清华大学) Tongji University(同济大学) Renmin University of China(中国人民大学) The University of Tokyo(东京大学) Lenovo Group(联想集团) Peking University(北京大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 推理评测 :reasoning(title)

AI总结 本文提出EgoIntrospect数据集,用于研究用户中心内部状态推理,通过自注释揭示用户与AI助手的交互意图,评估多模态大语言模型在从注视观察中推理用户内部状态的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08965 2026-05-12 cs.CV 71%

Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning

大语言模型能否进行视觉说服推理?评估推理的有效性与忠实性

Naeun Lee, Hyunjong Kim, Sunghwan Choi, Injin Kong, Yohan Jo

机构 * Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(title)

AI总结 本文研究大语言模型在视觉说服推理中的有效性与忠实性,提出通过多样化的教师生成推理进行监督微调以提升预测性能,并引入三维忠实性评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17741 2026-03-17 cs.CV 71%

Reasoning to Attend: Try to Understand How <SEG> Token Works

推理以关注:尝试理解<SEG>标记的作用

Rui Qian, Xin Yin, Dejing Dou

专题命中 推理评测 :reasoning(title)

AI总结 本文研究了<SEG>标记在多模态模型中的作用,通过可视化相似性图揭示其在图像-文本对中的语义相似性贡献,并提出READ方法提升模型的推理能力。

Comments This work has been accepted to CVPR 2025, please refer to https://github.com/rui-qian/READ

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21015 2026-02-25 cs.CV 71%

From Perception to Action: An Interactive Benchmark for Vision Reasoning

从感知到行动:一个交互式基准测试用于视觉推理

Yuhao Wu, Maojia Song, Yihuai Lan, Lei Wang, Zhiqiang Hu, Yao Xiao, Heng Zhou, Weihua Zheng, Dylan Raharja, Soujanya Poria, Roy Ka-Wei Lee

机构 * Singapore University of Technology(新加坡科技设计大学) Singapore Management University (SMU), Singapore(新加坡管理学院) Nanyang Technological University (NTU), Singapore(南洋理工大学) University of Science(科学大学)

专题命中 推理评测 :reasoning(title)

AI总结 CHAIN基准测试通过交互式3D物理驱动环境,评估模型在动态环境中理解、规划和执行基于物理约束的结构化动作序列的能力。

Comments Work in processing. Website: https://social-ai-studio.github.io/CHAIN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11730 2026-02-13 cs.CV 71%

STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning

STVG-R1: 通过强化学习激励视频中实例级推理与 grounding

Xiaowen Zhang, Zhi Gao, Licheng Jiao, Lingling Li, Qing Li

机构 * Xidian University(西电大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Beijing Institute of Technology(北京理工大学)

专题命中 推理评测 :reasoning(title)

AI总结 STVG-R1通过强化学习框架提升视频中实例级推理与 grounding 的准确性,实现显著的性能提升和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00325 2026-02-03 eess.SY cs.RO cs.SY 71%

Motion Planning with Metric Temporal Logic Using Reachability Analysis and Hybrid Zonotopes

使用可达性分析和混合容积集进行基于度量时序逻辑的运动规划

Andrew F. Thompson, Joshua A. Robbins, Jonah J. Glunt, Sean B. Brennan, Herschel C. Pangborn

专题命中 推理评测 :planning(title)

AI总结 本文提出了一种基于可达性分析和混合容积集的运动规划方法,用于满足时间依赖任务需求,展示了其在处理动态环境和多智能体协调方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18882 2026-01-14 cs.CY 71%

Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach

大语言模型中的个性化安全:一个基准和基于规划的代理方法

Yuchen Wu, Edward Sun, Kaijie Zhu, Jianxun Lian, Jose Hernandez-Orallo, Aylin Caliskan, Jindong Wang

专题命中 推理评测 :planning(title)

AI总结 本文提出个性化安全框架PENGUIN和RAISE,通过获取用户背景信息提升LLM的安全性,实验显示安全评分提升达31.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09092 2025-12-11 cs.CV 71%

Explaining the Unseen: Multimodal Vision-Language Reasoning for Situational Awareness in Underground Mining Disasters

解释未见的:多模态视觉-语言推理用于地下矿难中的情境感知

Mizanur Rahman Jewel, Mohamed Elmahallawy, Sanjay Madria, Samuel Frimpong

机构 * Missouri University of Science and Technology(密苏里科学与技术大学) Washington State University(华盛顿州立大学)

专题命中 推理评测 :reasoning(title)

AI总结 本文提出MDSE框架,通过多模态视觉-语言推理提升地下矿难情境感知能力,实现更准确的描述生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04221 2025-12-11 cs.CV 71%

MoReGen: Multi-Agent Motion-Reasoning Engine for Code-based Text-to-Video Synthesis

MoReGen:基于代码领域的文本到视频合成多智能体运动-推理引擎

Xiangyu Bai, He Liang, Bishoy Galoaa, Utsav Nandi, Shayda Moezzi, Yuhang He, Sarah Ostadabbas

机构 * Northeastern University(东北大学) University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(title)

AI总结 MoReGen通过整合多智能体大语言模型、物理模拟器和渲染器,实现了基于代码领域的文本到视频合成,强调物理精度和运动一致性,为生成符合物理原理的视频提供了一种新的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15917 2025-09-12 cs.SE 71%

Towards Test Generation from Task Description for Mobile Testing with Multi-modal Reasoning

Hieu Huynh, Hai Phung, Hao Pham, Tien N. Nguyen, Vu Nguyen

专题命中 推理评测 :reasoning(title)

Comments Change the method and experimentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15028 2025-07-22 cs.CV 71%

Towards Video Thinking Test: A Holistic Benchmark for Advanced Video Reasoning and Understanding

Yuanhan Zhang, Yunice Chew, Yuhao Dong, Aria Leo, Bo Hu, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 推理评测 :reasoning(title)

Comments ICCV 2025; Project page: https://zhangyuanhan-ai.github.io/video-tt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24164 2025-07-08 cs.MM 71%

SVLA: A Unified Speech-Vision-Language Assistant with Multimodal Reasoning and Speech Generation

Ngoc Dung Huynh, Mohamed Reda Bouadjenek, Imran Razzak, Hakim Hacid, Sunil Aryal

专题命中 推理评测 :reasoning(title)

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18665 2025-06-24 cs.CV 71%

Boosting Virtual Agent Learning and Reasoning: A Step-Wise, Multi-Dimensional, and Generalist Reward Model with Benchmark

Bingchen Miao, Yang Wu, Minghe Gao, Qifan Yu, Wendong Bu, Wenqiao Zhang, Yunfei Li, Siliang Tang, Tat-Seng Chua, Juncheng Li

机构 * Zhejiang University, Hangzhou, China(浙江大学) National University of Singapore, Kent Ridge, Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title)

Comments Home page is available at https://dcd-ant-similar.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏