arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10440 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10440 篇

2405.02794 2024-06-06 cs.RO 78%

Octopi: Object Property Reasoning with Large Tactile-Language Models

Samson Yu, Kelvin Lin, Anxing Xiao, Jiafei Duan, Harold Soh

专题命中 推理评测 :reasoning(title,abstract)

Comments Accepted at Robotics: Science and Systems (R:SS 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.11435 2024-06-04 cs.CV 78%

Momentor: Advancing Video Large Language Model with Fine-Grained Temporal Reasoning

Long Qian, Juncheng Li, Yu Wu, Yaobo Ye, Hao Fei, Tat-Seng Chua, Yueting Zhuang, Siliang Tang

专题命中 推理评测 :reasoning(title,abstract)

Comments Accepted by ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.20834 2024-06-03 cs.CV 78%

Retrieval Meets Reasoning: Even High-school Textbook Knowledge Benefits Multimodal Reasoning

Cheng Tan, Jingxuan Wei, Linzhuang Sun, Zhangyang Gao, Siyuan Li, Bihui Yu, Ruifeng Guo, Stan Z. Li

专题命中 推理评测 :reasoning(title,abstract)

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03690 2024-05-10 cs.CV 78%

How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs

Muhammad Uzair Khattak, Muhammad Ferjad Naeem, Jameel Hassan, Muzammal Naseer, Federico Tombari, Fahad Shahbaz Khan, Salman Khan

专题命中 推理评测 :reasoning(title,abstract)

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.00692 2024-05-02 cs.CV 78%

LISA: Reasoning Segmentation via Large Language Model

Xin Lai, Zhuotao Tian, Yukang Chen, Yanwei Li, Yuhui Yuan, Shu Liu, Jiaya Jia

专题命中 推理评测 :reasoning(title,abstract)

Comments Code, models, and data are available at https://github.com/dvlab-research/LISA

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10507 2024-03-18 cs.SE 78%

Demystifying Faulty Code with LLM: Step-by-Step Reasoning for Explainable Fault Localization

Ratnadira Widyasari, Jia Wei Ang, Truong Giang Nguyen, Neil Sharma, David Lo

专题命中 推理评测 :reasoning(title,abstract)

Comments To be appeared at 2024 IEEE International Conference on Software Analysis, Evolution and Reengineering (SANER)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09962 2024-03-18 cs.CV 78%

ViTCN: Vision Transformer Contrastive Network For Reasoning

Bo Song, Yuanhao Xu, Yichao Wu

专题命中 推理评测 :reasoning(title,abstract)

Comments 5 pages, 2 figures , in proceeding of 5th International Seminar on Artificial Intelligence, Networking and Information Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.11775 2024-01-24 cs.CV 78%

Collaborative Position Reasoning Network for Referring Image Segmentation

Jianjian Cao, Beiya Dai, Yulin Li, Xiameng Qin, Jingdong Wang

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17448 2024-01-01 cs.CV 78%

Tracking with Human-Intent Reasoning

Jiawen Zhu, Zhi-Qi Cheng, Jun-Yan He, Chenyang Li, Bin Luo, Huchuan Lu, Yifeng Geng, Xuansong Xie

专题命中 推理评测 :reasoning(title,abstract)

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.07132 2023-12-13 cs.CV cs.MM 78%

Image Content Generation with Causal Reasoning

Xiaochuan Li, Baoyu Fan, Runze Zhang, Liang Jin, Di Wang, Zhenhua Guo, Yaqian Zhao, Rengang Li

专题命中 推理评测 :reasoning(title,abstract)

Comments Accepted by the 38th Annual AAAI Conference on Artificial Intelligence (AAAI 2024) in December 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02433 2023-12-06 cs.CV 78%

Lenna: Language Enhanced Reasoning Detection Assistant

Fei Wei, Xinyu Zhang, Ailing Zhang, Bo Zhang, Xiangxiang Chu

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16744 2023-11-03 cs.RO 78%

Demo2Code: From Summarizing Demonstrations to Synthesizing Code via Extended Chain-of-Thought

Huaxiaoyue Wang, Gonzalo Gonzalez-Pumariega, Yash Sharma, Sanjiban Choudhury

专题命中 推理评测 :chain-of-thought(title,abstract)

Comments 10 pages (not including references and appendix), 14 figures (7 in main paper, 7 in appendix); (v3) camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.00899 2023-11-03 cs.RO 78%

RoboVQA: Multimodal Long-Horizon Reasoning for Robotics

Pierre Sermanet, Tianli Ding, Jeffrey Zhao, Fei Xia, Debidatta Dwibedi, Keerthana Gopalakrishnan, Christine Chan, Gabriel Dulac-Arnold, Sharath Maddineni, Nikhil J Joshi, Pete Florence, Wei Han, Robert Baruch, Yao Lu, Suvir Mirchandani, Peng Xu, Pannag Sanketi, Karol Hausman, Izhak Shafran, Brian Ichter, Yuan Cao

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.13473 2023-10-23 cs.CV 78%

Benchmarking Sequential Visual Input Reasoning and Prediction in Multimodal Large Language Models

Mingwei Zhu, Leigang Sha, Yu Shu, Kangjia Zhao, Tiancheng Zhao, Jianwei Yin

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.06548 2023-03-14 cs.CV eess.IV 78%

CoT-MISR:Marrying Convolution and Transformer for Multi-Image Super-Resolution

Mingming Xiu, Yang Nie, Qing Song, Chun Liu

专题命中 推理评测 :CoT(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.02635 2023-03-07 cs.CV cs.MM 78%

VTQA: Visual Text Question Answering via Entity Alignment and Cross-Media Reasoning

Kang Chen, Xiangqian Wu

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02117 2023-02-21 cs.CV 78%

Learning to Agree on Vision Attention for Visual Commonsense Reasoning

Zhenyang Li, Yangyang Guo, Kejie Wang, Fan Liu, Liqiang Nie, Mohan Kankanhalli

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.03510 2023-01-10 cs.CV 78%

Parallel Reasoning Network for Human-Object Interaction Detection

Huan Peng, Fenggang Liu, Yangguang Li, Bin Huang, Jing Shao, Nong Sang, Changxin Gao

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.10057 2022-11-15 cs.CV 78%

Precondition and Effect Reasoning for Action Recognition

Yoo Hongsang, Li Haopeng, Ke Qiuhong, Liu Liangchen, Zhang Rui

专题命中 推理评测 :reasoning(title,abstract)

Comments The paper is under consideration at Computer Vision and Image Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05818 2022-08-12 cs.MM 78%

HERO: HiErarchical spatio-tempoRal reasOning with Contrastive Action Correspondence for End-to-End Video Object Grounding

Mengze Li, Tianbao Wang, Haoyu Zhang, Shengyu Zhang, Zhou Zhao, Wenqiao Zhang, Jiaxu Miao, Shiliang Pu, Fei Wu

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.14040 2022-03-29 cs.CV 78%

Visual Abductive Reasoning

Chen Liang, Wenguan Wang, Tianfei Zhou, Yi Yang

专题命中 推理评测 :reasoning(title,abstract)

Comments CVPR2022; Code, data: https://github.com/leonnnop/VAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.00238 2021-10-04 cs.RO cs.CV 78%

Improving Object Permanence using Agent Actions and Reasoning

Ying Siu Liang, Chen Zhang, Dongkyu Choi, Kenneth Kwok

专题命中 推理评测 :reasoning(title,abstract)

Comments 2021 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2021)

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.03656 2021-04-09 cs.CV 78%

How Transferable are Reasoning Patterns in VQA?

Corentin Kervadec, Theo Jaunet, Grigory Antipov, Moez Baccouche, Romain Vuillemot, Christian Wolf

专题命中 推理评测 :reasoning(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.09144 2021-01-27 cs.CV 78%

Transformer Reasoning Network for Image-Text Matching and Retrieval

Nicola Messina, Fabrizio Falchi, Andrea Esuli, Giuseppe Amato

专题命中 推理评测 :reasoning(title,abstract)

Comments Presented at ICPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13034 2026-07-15 cs.AI cs.CL cs.SE cs.SY eess.SY 新提交 77%

Do AI Agents Know When a Task Is Simple? Toward Complexity-Aware Reasoning and Execution

人工智能代理知道任务何时简单吗?迈向复杂性感知推理与执行

Junjie Yin, Xinyu Feng

专题命中 推理评测 :reasoning(title,comments);分类 cs.CL、cs.AI

AI总结 研究探讨LLM代理缺乏任务感知执行范围估计能力,提出E3方法,在MSE-Bench基准测试及真实模型工具中验证,该方法能在保证成功率时大幅降低成本,推动迈向工程基础人工智能,还发布了框架和基准。

Comments 27 pages, 8 figures, 8 tables. Code and benchmark: https://github.com/eejyin/Do-AI-Agents-Know-When-a-Task-Is-Simple-Toward-Complexity-Aware-Reasoning-and-Execution

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08856 2026-08-11 cs.SE cs.AI 版本更新 77%

LAUDE: LLM-Assisted Unit Test Generation and Debugging of Hardware DEsigns

LAUDE: 基于LLM的硬件设计单元测试生成与调试

Deeksha Nandal, Riccardo Revalor, Soham Dan, Debjit Pal

机构 * Dept. of Electrical and Computer Engineering, University of Illinois Chicago(伊利诺伊大学芝加哥分校电子与计算机工程系) Microsoft(微软公司)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 LAUDE利用大语言模型能力,实现硬件设计的单元测试生成与调试,有效检测和修复设计中的错误。

Comments 11 Pages, 9 Figures, 9 Tables Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00932 2026-08-04 cs.CL 新提交 77%

Gaokerena: A Small Persian Medical Language Model Family

Gaokerena:一个小型波斯语医疗语言模型家族

Mehrdad Ghassabi, Hamidreza Baradaran Kashani, Pedram Rostami, Sadra Hakim, Zahra Kazemi, Audrina Ebrahimi

机构 * University of Isfahan(伊斯法罕大学) University of Tehran(德黑兰大学) University of Windsor(温莎大学) Alzahra University(阿勒扎哈拉大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 推理评测 :chain-of-thought(abstract,abstract_cn);reasoning(abstract);分类 cs.CL

AI总结 针对波斯语医疗语言模型研究不足的问题,该研究推出Gaokerena家族,包含Gaokerena-V和Gaokerena-R两款模型,在医疗问答基准上取得性能提升,还配备不确定性头,为本地化数字医疗提供基础但仍需完善。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24596 2026-06-24 cs.CL 新提交 77%

To Compare, or Not to Compare: On Methodological Practices in Evaluating Social Bias

比较还是不比较:论评估社会偏见的方法论实践

Federico Marcuzzi, Xuefei Ning, Roy Schwartz, Iryna Gurevych

机构 * Tsinghua University(清华大学) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(普适知识处理实验室(UKP Lab),计算机科学系,达姆施塔特工业大学及国家应用网络安全研究中心ATHENE)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 提出统一框架标准化异构基准,揭示孤立评估与强制比较设置间的系统性范式差距,发现比较设置会催化潜在歧视,且链式思维推理加剧偏见,规模越大偏见越强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18988 2026-06-18 cs.AI 新提交 77%

ThinkDeception: A Progressive Reinforcement Learning Framework for Interpretable Multimodal Deception Detection

ThinkDeception: 一种用于可解释多模态欺骗检测的渐进式强化学习框架

Jinhao Song, Shan Liang, Yiqun Yue, Zhuhuayang Zhang, Tianqi Gao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 提出ThinkDeception框架,将多模态大语言模型引入欺骗检测,通过逐步推理和视觉-音频一致性组相对策略优化(VAC-GRPO)实现可解释的认知推理,在主流基准上达到新SOTA。

Comments 10pages,4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14113 2026-06-15 cs.SE cs.CL 新提交 77%

Simulating Students' Java Programming Errors with Large Language Models

用大型语言模型模拟学生的Java编程错误

Ali Keramati, Jie Cao, Iman Mohammadi, Mark Warschauer, Yang Shi

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 探索用LLM模拟学生编程错误,评估五种模型在多样性和对齐性上的表现,发现Claude Sonnet 4平衡最佳,且合成错误与真实错误难以区分。

详情

展开后加载摘要…

URL PDF HTML 收藏