arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2604.20190 2026-04-23 cs.CV cs.LG 70%

WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring

WildFireVQA: 一种大规模的辐射热视觉问答基准用于空中 wildfire 监测

Mobin Habibpour, Niloufar Alipour Talemi, John Spodnik, Camren J. Khoury, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出WildFireVQA基准,整合RGB影像与辐射热数据,包含6097个样本及207298个问题,评估多模态推理能力,揭示RGB和检索增强热上下文在 wildfire 监测中的表现差异。

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR-W 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16021 2026-04-21 cs.SE cs.AI 70%

Neurosymbolic Repo-level Code Localization

神经符号层面的代码定位

Xiufeng Xu, Xiufeng Wu, Zejun Zhang, Yi Li

机构 * Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出KA-LCL问题,引入KA-LogicQuery基准测试,展示现有方法在无命名提示下的性能下降,提出LogicLoc框架结合LLM和Datalog实现精确代码定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12676 2026-04-21 cs.CV cs.AI 70%

BridgeEQA: Virtual Embodied Agents for Real Bridge Inspections

BridgeEQA:用于真实桥梁检查的虚拟具身代理

Subin Varghese, Joshua Gao, Asad Ur Rahman, Vedhus Hoskere

机构 * University of Houston(德克萨斯大学休斯顿分校)

专题命中 推理评测 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出BridgeEQA基准,通过200个真实桥梁场景和2200个开放词汇问题对,评估具身记忆问答能力,引入Image Citation Relevance指标,并提出EMVR模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15690 2026-04-21 cs.AI stat.AP 70%

From Passive Metric to Active Signal: The Evolving Role of Uncertainty Quantification in Large Language Models

从被动度量到主动信号:不确定性量化在大语言模型中的演变角色

Jiaxin Zhang, Wendi Cui, Zhuohang Li, Lifu Huang, Bradley Malin, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce AI研究院) Intuit(Intuit公司) Vanderbilt University(范德比大学) University of California, Davis(加州大学戴维斯分校) Vanderbilt University Medical Center(范德比大学医学中心)

专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文探讨大语言模型中不确定性量化从被动诊断指标到主动控制信号的演变,分析其在高级推理、自主代理和强化学习中的应用及贡献。

Comments This paper has been accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14410 2026-04-21 cs.AI 70%

ORThought: Benchmarking and Automating Logistics Optimization Modeling

ORThought: 物流优化建模的基准测试与自动化

Beinuo Yang, Qishen Zhou, Junyi Li, Chenxing Su, Panagiotis Angeloudis, Simon Hu

机构 * ZJU-UIUC Institute, Zhejiang University(浙江大学浙大-伊利诺伊大学联合学院) School of Transportation, Jilin University(吉林大学交通运输学院) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究所) Department of Civil and Environmental Engineering, Imperial College London(伦敦帝国理工学院土木与环境工程系)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出ORThought框架,通过引入专家级建模原理,解决物流优化建模中的基准不足、多智能体框架不稳定及评估深度不足等问题,实验证明其在复杂约束下表现优异。

Comments The paper has been accepted by Artificial Intelligence for Transportation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15385 2026-04-20 cs.SE cs.LG 70%

Prompt-Driven Code Summarization: A Systematic Literature Review

基于提示的代码摘要:系统文献综述

Afia Farjana, Zaiyu Cheng, Antonio Mastropaolo

机构 * William & Mary(威廉玛丽学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文综述了基于提示的代码摘要方法,分析了不同提示策略的有效性及评估挑战,旨在为未来研究和实际应用提供指导。

Comments 42 pages, 9 figures, 10 tables. Systematic Literature Review. This work is currently under review at ACM TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10916 2026-04-20 cs.CV cs.AI 70%

ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding

ReXSonoVQA:面向以过程为中心的超声理解的视频问答基准

Xucheng Wang, Xiaoman Zhang, Sung Eun Kim, Ankit Pal, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 ReXSonoVQA是一个包含514个视频片段和514个问题的视频问答基准,旨在评估动作-目标推理、artifact解决与优化及过程上下文与规划能力,测试VLMs在动态过程理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14829 2026-04-17 cs.AI 70%

Beyond Literal Summarization: Redefining Hallucination for Medical SOAP Note Evaluation

超越字面总结:重新定义医疗SOAP笔记评估中的幻觉

Bhavik Vachhani, Kush Shrisvastava, Pranshu Nema, Sai Chiranthan

机构 * Augnito Research(Augnito研究)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出通过校准提示和基于医学本体的检索,重新定义医疗SOAP笔记评估中的幻觉,发现传统评估方法高估了幻觉率,影响模型评估。

Comments 12 pages, 2 figures,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13804 2026-04-16 cs.LG 70%

Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning

角色超越言语:通过强化学习利用角色扮演评估音频大语言模型

Dongjie Fu, Fangming Feng, Xize Cheng, Linjun Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 本文提出RoleJudge框架,通过多模态评估系统评估语音与角色的一致性,引入RoleChat数据集并采用多阶段训练和标准对齐强化学习,验证了多维评估框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13041 2026-04-16 cs.DB cs.AI 70%

TableNet A Large-Scale Table Dataset with LLM-Powered Autonomous

TableNet:一个大规模表格数据集与LLM驱动的自主系统

Ruilin Zhang, Kai Yang

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 TableNet通过LLM驱动的自主系统生成和识别表格,解决大规模高质量表格数据集的不足,提升表格结构识别的效率与精度。

Comments The 40th Annual AAAI Conference on Artificial Intelligence Bridge Program on Logic & AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05795 2026-04-15 cs.CL 70%

Measuring What Matters!! Assessing Therapeutic Principles in Mental-Health Conversation

衡量重要性!!评估心理健康对话中的治疗原则

Abdullah Mazhar, Het Riteshkumar Shah, Aseem Srivastava, Smriti Joshi, Md Shad Akhtar

机构 * IIIT Delhi(印度德里理工学院) MBZUAI(马尔科姆·比尔人工智能研究所) Wysa

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出CARE框架,通过多阶段方法评估AI生成的治疗回应是否符合临床标准,实验显示其在F-1分数上优于基线模型,展示了结构化推理和上下文建模的重要性。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11120 2026-04-15 cs.AI 70%

Persona Non Grata: Single-Method Safety Evaluation Is Incomplete for Persona-Imbued LLMs

不受欢迎的人:针对具有人格特征的LLM,单一方法的安全性评估是不完整的

Wenkai Li, Fan Yang, Shaunak A. Mehta, Koichi Onoue

机构 * Carnegie Mellon University(卡内基梅隆大学) Fujitsu Research of America Inc.(富士通美国研究公司)

专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文指出,针对具有人格特征的LLM,仅通过提示进行的安全性评估不完整,因为提示和激活引导暴露了不同的、依赖于架构的漏洞特征。研究显示,激活引导的漏洞无法通过提示侧排名预测,且在不同架构模型中表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10971 2026-04-14 cs.CV cs.AI 70%

MMR-AD: A Large-Scale Multimodal Dataset for Benchmarking General Anomaly Detection with Multimodal Large Language Models

MMR-AD:一个大规模多模态数据集,用于基于多模态大语言模型的通用异常检测基准测试

Xincheng Yao, Zefeng Qian, Chao Shi, Jiayang Song, Chongyang Zhang

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出MMR-AD数据集,用于评估多模态大语言模型在通用异常检测中的性能,揭示当前SOTA模型与工业需求的差距,并提出基于推理的Anomaly-R1模型,实现了异常检测与定位的显著提升。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08715 2026-04-14 cs.AR cs.CL 70%

VeriInteresting: An Empirical Study of Model Prompt Interactions in Verilog Code Generation

VeriInteresting:关于Verilog代码生成中模型提示交互的实证研究

Luca Collini, Andrew Hennesee, Patrick Yubeaton, Siddharth Garg, Ramesh Karri

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过实证研究探讨了在Verilog代码生成中模型推理、专业化和提示工程策略的交互影响,评估了多种大小模型在不同提示设计下的表现,揭示了模型类别对结构化提示和优化的响应模式。

Comments Submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22832 2026-04-13 cs.CV cs.AI 70%

Listener-Rewarded Thinking in VLMs for Image Preferences

图像偏好中的VLMs思考奖励

Alexander Gambashidze, Li Pengyi, Matvey Skripkin, Andrey Galichin, Anton Gusarov, Konstantin Sobolev, Andrey Kuznetsov, Ivan Oseledets

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出一种增强GRPO框架,通过引入独立的监听器模型来校准推理过程,提升图像偏好任务中的准确性和泛化能力。

Comments part of a different work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07017 2026-04-09 cs.AI 70%

A-MBER: Affective Memory Benchmark for Emotion Recognition

A-MBER:情绪识别的情感记忆基准

Deliang Wen, Ke Sun, Yu Wang

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 A-MBER通过评估模型利用多会话交互历史解读用户当前情绪的能力,提出了一种新的情感记忆基准,支持判断、检索和解释任务,并测试模型在不同条件下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08258 2026-04-09 cs.AI 70%

Diagnosing and Mitigating Sycophancy and Skepticism in LLM Causal Judgment

诊断和缓解大语言模型因果判断中的阿谀和怀疑

Edward Y. Chang

机构 * Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出CAUSALT3基准测试,通过三个轴评估分解性能,识别并缓解因果判断中的阿谀和怀疑陷阱,通过Regulated Causal Anchoring方法改进推理控制。

Comments 19 pages, 3 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05775 2026-04-08 cs.CL q-bio.GN 70%

PhageBench: Can LLMs Understand Raw Bacteriophage Genomes?

PhageBench: LLMs能否理解原始噬菌体基因组?

Yusen Hou, Weicai Long, Haitao Hu, Houcheng Su, Junning Feng, Yanlin Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 PhageBench通过模拟生物信息学专家流程,评估LLM对噬菌体基因组的理解能力,发现通用模型在噬菌体contig识别和宿主预测上表现优异,但在复杂推理任务中存在明显局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00185 2026-04-08 cond-mat.mtrl-sci cs.AI 70%

QUASAR: A Universal Autonomous System for Atomistic Simulation and a Benchmark of Its Capabilities

QUASAR:一个通用的自主系统用于原子模拟及其能力的基准测试

Fengxu Yang, Jack D. Evans

机构 * School of Physics, Chemistry and Earth Sciences, Adelaide University(阿德莱德大学物理、化学与地球科学学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 QUASAR通过整合多种原子模拟方法,实现自主的多尺度工作流,展示了其在材料筛选和新型材料评估中的应用潜力。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02834 2026-04-06 cs.AI 70%

ESL-Bench: An Event-Driven Synthetic Longitudinal Benchmark for Health Agents

ESL-Bench: 一个基于事件的合成纵向基准用于健康代理

Chao Li, Cailiang Liu, Ang Gao, Kexin Deng, Shu Zhang, Langping Xu, Xiaotong Shi, Xionghao Ding, Jian Pei, Xun Jiang

机构 * Shanda Group(盛大集团)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 ESL-Bench通过合成100个用户数据,涵盖健康档案、多阶段叙事计划、日常设备测量、定期检查记录和事件日志,评估健康代理在多源轨迹推理中的性能,发现数据库代理在比较和解释任务中显著优于记忆增强RAG基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01988 2026-04-03 cs.AI 70%

SenseMath: Do LLMs Have Number Sense? Evaluating Shortcut Use, Judgment, and Generation

SenseMath: 大语言模型有数感吗?评估快捷方式的使用、判断和生成

Haomin Zhuang, Xiangqi Wang, Yili Shen, Ying Cheng, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究通过SenseMath基准测试评估大语言模型在数值推理中的结构敏感性,发现模型在提示下能有效使用快捷方式,但在标准提示下仅在少数情况下应用,且无法生成有效问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21454 2026-04-02 cs.CL 70%

Cross-Context Verification: Hierarchical Detection of Benchmark Contamination through Session-Isolated Analysis

跨上下文验证:通过会话隔离分析进行层次化基准污染检测

Tae-Eun Song

机构 * Daejeon Jungang Cheonggua Co., Ltd.(大田中央青果有限公司)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.CL

AI总结 本文提出跨上下文验证方法,通过多会话分析检测基准污染,发现污染二元性及信息限制机制,验证了结构复杂性非关键。

Comments 11 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29878 2026-04-01 cs.IR cs.AI cs.DC 70%

Performance Evaluation of LLMs in Automated RDF Knowledge Graph Generation

对LLMs在自动RDF知识图谱生成中的性能评估

Ioana Ramona Martin, Tudor Cioara, Ionut Anghel, Gabriel Arcas

机构 * Distributed Systems Research Laboratory, Computer Science Department, Technical University of Cluj-Napoca(克卢日-纳波卡技术大学计算机科学系分布式系统研究实验室)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文评估了多种LLM架构和提示策略在自动RDF提取中的性能,通过控制框架和两个处理半结构化日志数据的管道,分析了Few-Shot学习在生成RDF三元组中的有效性,并揭示了不同LLM架构的局限性。

Comments submitted to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29281 2026-04-01 cs.CV cs.AI cs.RO 70%

PRISM: A Multi-View Multi-Capability Retail Video Dataset for Embodied Vision-Language Models

PRISM:一个多视角多能力零售视频数据集用于具身视觉-语言模型

Amirreza Rouhi, Parikshit Sakurikar, Satya Sai Reddy, Narsimha Menga, Anirudh Govil, Sri Harsha Chittajallu, Rajat Aggarwal, Anoop Namboodiri, Sashi Reddi

机构 * DreamVu

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 PRISM是首个针对真实世界零售环境的多视角多能力视频数据集,通过领域特定的SFT训练提升具身视觉-语言模型的感知能力与空间理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23660 2026-03-26 cs.AI 70%

GTO Wizard Benchmark

GTO Wizard 评估基准

Marc-Antoine Provost, Nejc Ilenic, Christopher Solinas, Philippe Beardsell

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出GTO Wizard基准,用于评估HUNL算法,通过与GTO Wizard AI对比,发现现有模型在推理和规划方面仍有较大提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11404 2026-03-24 cs.CV cs.AI 70%

Patho-R1: A Multimodal Reinforcement Learning-Based Pathology Expert Reasoner

Patho-R1: 基于多模态强化学习的病理专家推理器

Wenchuan Zhang, Penghao Zhang, Jingru Guo, Tao Cheng, Jie Chen, Shuwan Zhang, Zhang Zhang, Yuhao Yi, Hong Bu

机构 * Department of Pathology, West China Hospital, Sichuan University(四川大学华西医院病理科部门) Institute of Clinical Pathology, West China Hospital, Sichuan University(四川大学华西医院临床病理科研究所) University of Toronto(多伦多大学) Business School, Sichuan University(四川大学商学院) Department of Pathology, Shengjing Hospital of China Medical University(中国医科大学盛京医院病理科部门)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出Patho-R1,通过构建高质量推理导向数据集,结合三阶段训练流程提升病理推理能力,实现跨模态任务的鲁棒性能。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(33): 28418-28426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20225 2026-03-24 cs.CY cs.AI 70%

The Arrival of AGI? When Expert Personas Exceed Expert Benchmarks

AGI的来临?专家人设是否超越专家基准?

Drake Mullens, Stella Shen

机构 * Tarleton State University(塔尔顿州立大学) University of Texas at Tyler(德克萨斯大学泰勒分校)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 研究探讨专家人设是否能提升语言模型性能,发现其效果受多种机制限制,通过控制实验揭示了人设在特定任务中的表现及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20866 2026-03-19 cs.CR cs.AI 70%

AVIATOR: Towards AI-Agentic Vulnerability Injection Workflow for High-Fidelity, Large-Scale Code Security Dataset

AVIATOR:面向高保真、大规模代码安全数据集的AI代理漏洞注入流程

Amine Lbath, Massih-Reza Amini, Aurelien Delaitre, Vadim Okun

机构 * National Institute of Standards and Technology, Software and Systems Division(美国国家标准与技术研究院软件与系统 division) Université Grenoble Alpes, CNRS, LIG(格勒诺布尔阿尔卑斯大学,法国国家科学研究中心,LIG实验室)

专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出AVIATOR,首个AI代理漏洞注入框架,通过协调AI代理、工具分析和迭代自我纠正,生成高保真漏洞数据,提升漏洞检测模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05591 2026-03-19 cs.AI 70%

MLlm-DR: Towards Explainable Depression Recognition with MultiModal Large Language Models

MLlm-DR: 向多模态大语言模型的可解释性抑郁识别迈进

Wei Zhang, Juan Chen, En Zhu, Wenhong Cheng, YunPeng Li, Yanbo J. Wang

机构 * National University of Defense Technology(国防科技大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Mental Health Center, Shanghai Jiao Tong University School of Medicine(上海精神卫生中心,上海交通大学医学院) Nanjing Industria Tenebris Information Technology Co., Ltd.(南京Industria Tenebris信息技术有限公司) National University of Uzbekistan named after Mirzo Ulugbek(乌兹别克斯坦Mirzo Ulugbek命名的国立大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 本文提出MLlm-DR模型,通过多模态大语言模型实现可解释的抑郁识别,结合小型LLM和轻量级查询模块,提升诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13856 2026-03-18 cs.LG cs.CV 70%

OrigamiBench: An Interactive Environment to Synthesize Flat-Foldable Origamis

OrigamiBench: 一个用于合成可折叠折纸的交互环境

Naaisha Agarwal, Yihan Wu, Yichang Jian, Yikuan Hu, Nishad Mansoor, Mohan Li, Yifei Peng, Wang-Zhou Dai, Yao-Xiang Ding, Emanuele Sansone

机构 * Independent Researcher(独立研究者) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与计算机图形学国家重点实验室) Computer Science Northeastern University(东北大学计算机科学系) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) CSAIL / ESAT MIT / KU Leuven(MIT / KU Leuven)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 OrigamiBench通过交互式环境测试模型在折叠策略中的因果推理能力,发现单纯扩大模型规模无法有效生成多步骤折叠策略,表明视觉与语言表征仍需加强整合。

详情

展开后加载摘要…

URL PDF HTML 收藏