arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-01 至 2026-05-01 共收录 91 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 20 篇

2604.27410 2026-05-01 cs.IR cs.CL 57%

From Unstructured to Structured: LLM-Guided Attribute Graphs for Entity Search and Ranking

从无序到有序:LLM引导的属性图用于实体搜索与排序

Yilun Zhu, Nikhita Vedula, Shervin Malmasi

机构 * Amazon.com, Inc.(亚马逊公司)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出结合LLM驱动的属性图构建与图感知LLM排序的两阶段方法,通过结构化属性提取和图构建提升电商中实体搜索的精度与效率,实验显示在零样本场景下平均精度提升超5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27354 2026-05-01 cs.AI 57%

CoAX: Cognitive-Oriented Attribution eXplanation User Model of Human Understanding of AI Explanations

CoAX:面向认知的归因解释用户模型:人类对AI解释的理解

Louth Bin Rawshan, Zhuoyu Wang, Brian Y. Lim

机构 * National University of Singapore(新加坡国立大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过认知建模分析不同XAI方法在结构化数据推理中的策略,发现模型能更准确拟合人类决策,为改进AI解释的可理解性提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27311 2026-05-01 cs.SE cs.AI 57%

Pragmos: A Process Agentic Modeling System

Pragmos:一个过程代理建模系统

Pedro-Aarón Hernández-Ávalos, Luciano García-Bañuelos

机构 * Tecnologico de Monterrey(墨西哥技术学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Pragmos系统,通过人机协作的交互流程,利用LLM与领域专家共同构建可解释的过程模型,解决复杂过程建模问题。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27267 2026-05-01 cs.CR cs.AI cs.RO 57%

From Prompt to Physical Actuation: Holistic Threat Modeling of LLM-Enabled Robotic Systems

从提示到物理执行:LLM赋能机器人系统的整体威胁建模

Neha Nagaraja, Hayretdin Bahsi, Carlo R. da Cunha

机构 * School of Informatics, Computing, and Cyber Systems, Northern Arizona University(信息学、计算与网络系统学院,北亚利桑那大学) Department of Software Science, Tallinn University of Technology(软件科学系,塔林技术大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出基于数据流图的LLM赋能机器人系统威胁分析方法,揭示了传统威胁、对抗威胁和对话威胁在感知-规划-执行流程中的交互与传播,首次完整分析了三个威胁类别在全系统中的跨边界攻击链。

Comments Submitted to 23rd Annual International Conference on Privacy, Security, and Trust (PST2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27221 2026-05-01 cs.AI 57%

Web2BigTable: A Bi-Level Multi-Agent LLM System for Internet-Scale Information Search and Extraction

Web2BigTable: 一种用于互联网级信息搜索与提取的双层多智能体大语言模型系统

Yuxuan Huang, Yihang Chen, Zhiyuan He, Yuxiang Chen, Ka Yiu Lee, Huichi Zhou, Weilin Luo, Meng Fang, Jun Wang

机构 * University of Liverpool(利物浦大学) Huawei Noah’s Ark Lab(华为诺亚实验室) University College London(伦敦大学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Web2BigTable通过双层架构实现互联网级信息搜索与提取,结合任务分解与并行执行,提升深度推理和结构化聚合能力,达到新的性能标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20933 2026-05-01 cs.CV cs.AI 57%

Focal Modulation and Bidirectional Feature Fusion Network for Medical Image Segmentation

焦点调制与双向特征融合网络用于医学图像分割

Moin Safdar, Shahzaib Iqbal, Mubeen Ghafoor, Tariq M. Khan, Imran Razzak, Thantrira Porntaveetus, Hamid Alinejad-Rokny

机构 * Department of Computing, Abasyn University Islamabad Campus (AUIC)(阿巴斯扬大学伊斯兰堡校区计算机系) School of Computer Science and Informatics, De Montfort University(德蒙福特大学计算机科学与信息学学院) Naif Arab University for Security Sciences(纳夫阿拉伯安全科学大学) School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) Center of Excellence in Precision Medicine and Digital Health, Chulalongkorn University(朱拉隆功大学精准医学与数字健康卓越中心) School of Biomedical Engineering, UNSW Sydney(新南威尔士大学悉尼分校生物医学工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出FM-BFF-Net,结合卷积与Transformer,通过焦点调制注意力机制和双向特征融合模块提升医学图像分割的边界精度与鲁棒性,实验表明其在多项指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08332 2026-05-01 cs.AI 57%

ORFS-agent: Tool-Using Agents for Chip Design Optimization

ORFS-agent:用于芯片设计优化的工具使用代理

Amur Ghose, Andrew B. Kahng, Sayak Kundu, Zhiang Wang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ORFS-agent,一种基于大语言模型的迭代优化代理,用于自动化开放式硬件设计流程中的参数调优,通过改进资源效率和设计指标,在六个基准测试中提升了性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25186 2026-05-01 cs.CV cs.CE cs.MM 50%

FCMBench-Video: Benchmarking Document Video Intelligence

FCMBench-Video:文档视频智能基准测试

Runze Cui, Fangxin Shang, Yehui Yang, Qing Yang, Yanwu Xu, Tao Chen

机构 * AI Lab, Qifu Technology(启赋科技AI实验室) College of Future Information Technology, Fudan University(复旦大学未来信息学院) School of Future Technology, South China University of Technology(华南理工大学未来技术学院) Pazhou Lab(琶洲实验室)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出FCMBench-Video基准测试,用于评估文档视频理解中的文档感知、时间定位和证据推理能力,通过真实场景数据验证系统性能,揭示不同任务的敏感性和能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 7 篇

2604.27850 2026-05-01 cs.CL 79%

Reasoning over Object Descriptions Improves Coreference Resolution in Task-Based Dialogue Systems

基于物体描述的推理提高了基于任务的对话系统中的指代消解

Oier Ijurco, Oier Lopez de Lacalle

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种单模态测试时推理方法,通过详细物体元数据和对话历史推理提升指代消解,实验表明在SIMMC 2.1数据集上效果显著,且在少样本设置下能有效泛化到新场景和物体。

Comments To be published in LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13559 2026-05-01 cs.AI 70%

OpAgent: Operator Agent for Web Navigation

OpAgent:网页导航的运算代理

Yuyu Guo, Wenjie Yang, Siyuan Yang, Ziyang Liu, Cheng Chen, Yuan Wei, Yun Hu, Yang Huang, Guoliang Hao, Dongsheng Yuan, Jianming Wang, Xin Chen, Hang Yu, Lei Lei, Peng Di

机构 * Ant Group(蚂蚁集团)

专题命中 视觉空间推理 :planning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出OpAgent,通过在线强化学习优化网页导航策略,结合层级多任务微调和混合奖励机制,实现71.6%的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17435 2026-05-01 cs.RO 67%

ImagineNav++: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination

ImagineNav++: 通过场景想象促使视觉语言模型作为具身导航器

Teng Wang, Xinxin Zhao, Wenzhe Cai, Changyin Sun

机构 * School of Automation, Southeast University(东南大学自动化学院)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出ImagineNav++,通过场景想象将视觉语言模型用于无地图导航,利用想象模块生成高探索潜力的视点,并通过选择性聚焦记忆机制实现空间一致性,实验表明其在无地图导航中表现优异。

Comments 17 pages, 10 figures. arXiv admin note: text overlap with arXiv:2410.09874

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22228 2026-05-01 cs.CV cs.AI cs.CL 62%

Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation

迷失在空间中?视觉-语言模型在相对相机姿态估计中挣扎

Ken Deng, Yifu Qiu, Yoni Kasten, Shay B. Cohen, Yftah Ziser

机构 * University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) NVIDIA Research(NVIDIA研究) University of Groningen(格罗宁根大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究视觉-语言模型在相对相机姿态估计中的表现,发现其在多视角空间推理中存在显著不足,尽管人类和专用几何方法表现良好,但VLMs仍处于初级水平,揭示了跨视角对应和投影相机运动理解等关键能力缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28196 2026-05-01 cs.CV 50%

HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation

HERMES++:迈向统一的驾驶世界模型用于3D场景理解和生成

Xin Zhou, Dingkang Liang, Xiwu Chen, Feiyang Tan, Dingyuan Zhang, Hengshuang Zhao, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Mach Drive University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出HERMES++,一种统一的驾驶世界模型,整合3D场景理解和未来几何预测。通过BEV表示、LLM增强世界查询和当前到未来链接等设计,提升驾驶场景的生成与理解能力。

Comments Extended version of ICCV 25 paper HERMES, Code: https://github.com/H-EmbodVis/HERMESV2, Project page: https://h-embodvis.github.io/HERMESV2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27620 2026-05-01 cs.CV 50%

SpaAct: Spatially-Activated Transition Learning with Curriculum Adaptation for Vision-Language Navigation

SpaAct:基于课程适应的空间激活转换学习用于视觉语言导航

Pengna Li, Kangyi Wu, Shaoqing Xu, Fang Li, Hanbing Li, Lin Zhao, Kailin Lyu, Long Chen, Zhi-Xin Yang, Nanning Zheng

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(人机混合增强智能国家重点实验室) National Engineering Research Center for Visual Information and Applications(视觉信息与应用国家工程研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究所) The State Key Laboratory of Internet of Things for Smart City(智能城市物联网国家重点实验室) Centre for Artificial Intelligence and Robotics(人工智能与机器人中心) University of Macau(澳门大学) Xiaomi EV(小i EV) School of Automation(自动化学院) Beijing Institute of Technology(北京理工大学) Institute of Automation(自动化研究所) Chinese Academy of Sciences(中国科学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SpaAct通过引入空间激活任务和课程适应方法,提升视觉语言导航中动态空间感知能力,实现更高效的导航性能。

Comments Submmited to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21479 2026-05-01 cs.CV 50%

Frozen LLMs as Map-Aware Spatio-Temporal Reasoners for Vehicle Trajectory Prediction

冻结的大语言模型作为具有地图意识的时空推理器用于车辆轨迹预测

Yanjiao Liu, Jiawei Liu, Xun Gong, Zifei Nie

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出利用冻结的大语言模型作为时空推理器,通过交通编码器提取轨迹特征并结合轻量CNN处理地图信息,评估LLM在动态交通代理行为和道路拓扑理解中的能力,提升轨迹预测的准确性与泛化性。

Comments Accepted for publication at IEEE Intelligent Vehicles Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 7 篇

2604.26954 2026-05-01 cs.CY cs.AI 79%

The Impact of LLM Self-Consistency and Reasoning Effort on Automated Scoring Accuracy and Cost

大型语言模型自我一致性与推理努力对自动化评分准确性和成本的影响

Scott Frohn

机构 * Khan Academy(可汗学院)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 研究探讨了LLM自我一致性和推理努力对自动化评分准确性和成本的影响,发现策略性模型选择和推理设置比集成更有效,且推理努力与评分准确性呈正相关。

Comments 14 pages, 10 tables, 2 figures. Presented at the 2026 National Council on Measurement in Education (NCME) Annual Meeting, April 11, 2026, Los Angeles, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12272 2026-05-01 cs.LG cs.AI cs.CL 67%

Learning to Reason at the Frontier of Learnability

在可学习性前沿的学习推理

Thomas Foster, Anya Sims, Johannes Forkel, Mattie Fellows, Jakob Foerster

机构 * DeepSeek-R1 Tulu OpenAI

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过可学习性采样方法优化大语言模型强化学习阶段,提升训练效率和效果,针对高变异性问题进行课程学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21016 2026-05-01 cs.CL cs.AI cs.LG 67%

Mitigating Selection Bias in Large Language Models via Permutation-Aware GRPO

通过排列感知GRPO缓解大语言模型中的选择偏差

Jinquan Zheng, Jia Yuan, Jiacheng Yao, Chenyang Gu, Pujun Zheng, Guoxiu He

机构 * School of Economics and Management, East China Normal University(东华大学经济管理学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出PA-GRPO方法,通过强制排列一致的语义推理来缓解大语言模型中的选择偏差,实验显示其在七个基准测试中表现优异,有效减少偏差同时保持高性能。

Comments Accepted to ACL 2026 Main Conference. 19 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27233 2026-05-01 cs.AI cs.LG cs.MA 62%

Reinforced Agent: Inference-Time Feedback for Tool-Calling Agents

强化代理:推理时间的工具调用反馈

Anh Ta, Junjie Zhu, Shahin Shayandeh

机构 * Apple(苹果公司)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出在推理时引入反馈机制,通过分离执行与审查任务,提升工具调用代理的实时纠错能力,并通过帮助性与危害性指标评估审查模型效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27955 2026-05-01 cs.AI cs.CV 57%

GUI Agents with Reinforcement Learning: Toward Digital Inhabitants

具有强化学习的图形用户界面代理:迈向数字居民

Junan Hu, Jian Liu, Jingxiang Lai, Jiarui Hu, Yiwei Sheng, Shuang Chen, Jian Li, Dazhao Du, Song Guo

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University(香港大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了强化学习与GUI代理的结合,提出分类体系及趋势分析,旨在指导下一代鲁棒GUI自动化及基础设施发展。

Comments Project Page: https://github.com/Steve2457/Awesome-RL-GUI-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19606 2026-05-01 cs.AI cs.MA 57%

AblateCell: A Reproduce-then-Ablate Agent for Virtual Cell Repositories

AblateCell: 一个用于虚拟细胞库的可重现后消去代理

Xue Xia, Chengkai Yao, Mingyu Tsoi, Xinjie Mao, Wenxuan Huang, Jiaqi Wei, Hao Wu, Cheng Tan, Lang Yu, Yuejin Yang, Mengdi Liu, Siqi Sun, Zhangyang Gao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of California San Diego(加州大学圣地亚哥分校) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 AblateCell通过可重现后消去方法解决AI虚拟细胞性能归因问题,实现高准确度的代码库验证与属性归因。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26974 2026-05-01 cs.CR cs.ET 50%

C8s: A Confidential Kubernetes Architecture

C8s:一种保密的Kubernetes架构

Amean Asad, Patrick McClurg, João Andrade

专题命中 测试时计算 :verifier(abstract)

AI总结 C8s为Kubernetes提供加密保密性,完整性和可验证性保障,利用硬件可信执行环境实现可信边界,使数据所有者、计算提供者和终端用户获得传统部署无法实现的保障。

Comments 47 pages, 21 figures. Whitepaper from Confidential.ai

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 6 篇

2604.28043 2026-05-01 cs.AI 79%

Collaborative Agent Reasoning Engineering (CARE): A Three-Party Design Methodology for Systematically Engineering AI Agents with Subject Matter Experts, Developers, and Helper Agents

协同智能体推理工程(CARE):一种三方设计方法论,用于系统性地工程化AI智能体,涉及领域专家、开发者和辅助智能体

Rahul Ramachandran, Nidhi Jha, Muthukumaran Ramasubramanian

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 CARE提出一种系统化方法论,通过可重用的artifacts和阶段化流程,结合领域专家、开发者和辅助智能体,提升AI智能体的开发效率和复杂查询性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19044 2026-05-01 cs.CL 79%

MoRI: Learning Motivation-Grounded Reasoning for Scientific Ideation in Large Language Models

MoRI: 在大语言模型中学习基于动机的推理以进行科学构想

Chenyang Gu, Jiahao Cheng, Meicong Zhang, Pujun Zheng, Jinquan Zheng, Guoxiu He

机构 * School of Economics and Management, East China Normal University(东华大学经济管理学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 MoRI通过强化学习奖励机制提升大语言模型在科学构想中的推理能力,优于现有方法,在新颖性、技术严谨性和可行性方面表现突出。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07408 2026-05-01 cs.AI cs.MA 79%

Progressive Multi-Agent Reasoning for Biological Perturbation Prediction

逐步多智能体推理用于生物扰动预测

Hyomin Kim, Sang-Yeon Hwang, Jaechang Lim, Yinhua Piao, Yunhak Oh, Woo Youn Kim, Chanyoung Park, Sungsoo Ahn, Junhyeok Jeon

机构 * KAIST(韩国国立科学技术院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出LINCSQA基准和PBio-Agent框架,通过整合难度感知任务序列与迭代知识细化,提升复杂化学扰动下基因调控预测的准确性与解释性。

Comments 17 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27934 2026-05-01 cs.AI cs.CL 62%

MM-StanceDet: Retrieval-Augmented Multi-modal Multi-agent Stance Detection

MM-StanceDet:基于检索的多模态多智能体立场检测

Weihai Lu, Zhejun Zhao, Yanshu Li, Huan He

机构 * Peking University(北京大学) Baidu Inc(百度公司) Brown University(布朗大学) Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MM-StanceDet框架,通过整合检索增强、多模态分析代理、辩论阶段和自我反思,解决多模态立场检测中的上下文 grounding、跨模态解释模糊和单次推理脆弱问题,实验表明其在五个数据集上优于现有方法。

Comments Accepted on ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11653 2026-05-01 cs.IR cs.AI cs.LG 62%

GroupRank: A Groupwise Paradigm for Effective and Efficient Passage Reranking with LLMs

GroupRank: 一种用于基于LLM的高效有效段落重排序的组内方法

Meixiu Long, Duolin Sun, Dan Yang, Yihan Jiao, Lei Liu, Jiahai Wang, BinBin Hu, Yue Shen, Jie Feng, Zhehao Tan, Junjie Wang, Lianzhen Zhong, Jian Wang, Peng Wei, Jinjie Gu

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Ant Group(蚂蚁集团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GroupRank提出一种组内方法平衡灵活性和上下文感知,通过合成数据融合局部点状信号与全局列表排名,提升重排序效果和效率,实验显示在BRIGHT上达到65.2 NDCG@10,且推理速度提升6.4倍。

Comments Accepted by ACL-Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00376 2026-05-01 cs.SE cs.AI 57%

In Line with Context: Repository-Level Code Generation via Context Inlining

与上下文一致:通过上下文内联实现仓库级代码生成

Chao Hu, Wenhao Zeng, Yuling Shi, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出InlineCoder框架,通过内联未完成函数到调用图中,将仓库理解转化为更易处理的函数级编码任务,提升仓库级代码生成能力。

Comments Accepted to FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 24 篇

2506.02515 2026-05-01 cs.CL cs.AI cs.LG 89%

FinChain: A Symbolic Benchmark for Verifiable Chain-of-Thought Financial Reasoning

FinChain:可验证链式思维金融推理的符号基准

Zhuohan Xie, Daniil Orel, Rushil Thareja, Dhruv Sahnan, Hachem Madmoun, Fan Zhang, Debopriyo Banerjee, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Jinyan Su, Aaryamonvikram Singh, Rui Xing, Rania Elbadry, Chen Xu, Haonan Li, Fajri Koto, Ivan Koychev, Tanmoy Chakraborty, Yuxia Wang, Salem Lahlou, Veselin Stoyanov, Sophia Ananiadou, Preslav Nakov

机构 * MBZUAI Syllogia The University of Tokyo(东京大学) The Fin AI(Fin AI) Cornell University(康奈尔大学) The University of Melbourne(墨尔本大学) IIT Delhi(德里理工学院) The University of Manchester(曼彻斯特大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FinChain通过符号模板和可执行代码实现可验证的金融链式推理,评估26种LLM发现其在符号金融推理中存在明显缺陷,领域适应和数学增强的微调模型能显著缩小差距。

Comments 24 pages, includes 12 figures and 9 tables; introduces the FinChain benchmark and ChainEval metric

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26288 2026-05-01 cs.CV cs.AI 88%

CheXthought: A global multimodal dataset of clinical chain-of-thought reasoning and visual attention for chest X-ray interpretation

CheXthought:一个包含临床推理链和视觉注意力的全球多模态数据集,用于胸部X光解读

Sonali Sharma, Jin Long, George Shih, Sarah Eid, Christian Bluethgen, Francine L. Jacobson, Emily B. Tsai, Global Radiology Consortium, Ahmed M. Alaa, Curtis P. Langlotz

机构 * Center for Artificial Intelligence in Medicine and Imaging(医学与影像人工智能中心) Department of Radiology(放射科) Department of Pediatrics(儿科) Department of Radiology, Weill Cornell Medicine(韦氏 Cornell 医学院放射科) Department of Radiology, Brigham and Women’s Hospital(布里奇妇产科医院放射科) University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Department of Biomedical Data Science(生物医学数据科学部)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI

AI总结 CheXthought数据集通过501名放射科医生的50312例多读X光片,提供了103592条推理链和6609082条同步视觉注意力标注,展示了临床推理模式,并在事实准确性、空间定位、病理分类、视觉忠实度、时间推理和不确定性沟通等方面提升了视觉语言模型性能。

Comments 51 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏