arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10428 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10428 篇

2603.04222 2026-03-05 cs.RO cs.AI 79%

PRAM-R: A Perception-Reasoning-Action-Memory Framework with LLM-Guided Modality Routing for Adaptive Autonomous Driving

PRAM-R:一种具有LLM引导模态路由的感知-推理-行动-记忆框架,用于自适应自动驾驶

Yi Zhang, Xian Zhang, Saisi Zhao, Yinglei Song, Chengdong Wu, Nenad Petrovic, Alois Knoll

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PRAM-R通过LLM引导的模态路由和分层记忆模块,实现高效自适应的多模态感知,提升自动驾驶的稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03983 2026-03-05 cs.CV cs.AI 79%

GeoSeg: Training-Free Reasoning-Driven Segmentation in Remote Sensing Imagery

GeoSeg: 无需训练的推理驱动遥感图像分割

Lifan Jiang, Yuhang Pei, oxi Wu, Yan Zhao, Tianrun Wu, Shulong Yu, Lihui Zhang, Deng Cai

机构 * State Key lab of CAD\&CG, Zhejiang University UniTTEC Co. Ltd. Wuchan Zhongda Chengtou (Ningbo) Holdings. Ltd.

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GeoSeg通过结合大规模语言模型推理与精确定位,无需训练实现遥感图像分割的高效解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03825 2026-03-05 cs.CV cs.AI 79%

From Narrow to Panoramic Vision: Attention-Guided Cold-Start Reshapes Multimodal Reasoning

从窄视场到全景视觉:基于注意力的冷启动重塑多模态推理

Ruilin Luo, Chufan Shi, Yizhen Zhang, Cheng Yang, Songtao Jiang, Tongkun Guan, Ruizhe Chen, Ruihang Chu, Peng Wang, Mingkun Yang, Yujiu Yang, Junyang Lin, Zhibo Yang

机构 * Tsinghua University(清华大学) University of South California(南加州大学) Qwen Team, Alibaba Group(通义实验室,阿里巴巴集团) University of California San Diego(南加州大学圣地亚哥分校) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出AVAR框架,通过视觉锚定与注意力引导提升多模态推理性能,实现7%的平均提升。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07181 2026-03-05 cs.RO cs.AI cs.CV 79%

TIGeR: Tool-Integrated Geometric Reasoning in Vision-Language Models for Robotics

TIGeR: 视觉-语言模型中集成工具的几何推理

Yi Han, Enshen Zhou, Shanyu Rong, Jingkun An, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

机构 * Beihang University(北洋大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机科学学院多媒体信息处理国家重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 TIGeR通过集成工具实现视觉-语言模型的几何推理,提升机器人操作的精确度。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03590 2026-03-05 cs.MA cs.AI 79%

Social Norm Reasoning in Multimodal Language Models: An Evaluation

多模态语言模型中的社会规范推理:一项评估

Oishik Chowdhury, Anushka Debnath, Bastin Tony Roy Savarimuthu

机构 * School of Computing, University of Otago, New Zealand(奥塔哥大学计算机学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文评估了多模态大语言模型在社会规范推理中的能力,发现GPT-4o在文本和图像模态中表现最佳,但所有模型在处理复杂规范时仍有困难。

Comments to be published in ICAART 2026 post proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19373 2026-03-04 cs.CR cs.AI 79%

Doxing via the Lens: Revealing Location-related Privacy Leakage on Multi-modal Large Reasoning Models

通过镜头进行Doxing:揭示多模态大推理模型中的位置相关隐私泄露

Weidi Luo, Tianyu Lu, Qiming Zhang, Xiaogeng Liu, Bin Hu, Yue Zhao, Jieyu Zhao, Song Gao, Patrick McDaniel, Zhen Xiang, Chaowei Xiao

机构 * University of Georgia(佐治亚大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) John Hopkins University(约翰·霍普金斯大学) University of Southern California(南加州大学) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了多模态大推理模型中的位置隐私泄露问题,提出DoxBench和GeoMiner框架,揭示模型在推断地理位置信息上的能力及隐私风险。

Comments Camera-ready version. Accepted as a poster at the 14th International Conference on Learning Representations (ICLR 2026). For official ICLR page, see https://iclr.cc/virtual/2026/poster/10006914

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02663 2026-03-04 cs.CL cs.CV 79%

Evaluating Cross-Modal Reasoning Ability and Problem Characteristics with Multimodal Item Response Theory

利用多模态项目反应理论评估跨模态推理能力与问题特征

Shunki Uebayashi, Kento Masui, Kyohei Atarashi, Han Bao, Hisashi Kashima, Naoto Inoue, Mayu Otani, Koh Takeuchi

机构 * Kyoto University(京都大学) CyberAgent The Institute of Statistical Mathematics(统计数学研究所) Tohoku University(东北大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 M3IRT通过分解模型能力和项目难度,提供了一种评估多模态推理能力的框架,有效提升基准测试的可靠性和质量。

Comments 24pages, 20 figures, accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02239 2026-03-04 cs.AI cs.SE 79%

Engineering Reasoning and Instruction (ERI) Benchmark: A Large Taxonomy-driven Dataset for Foundation Models and Agents

工程推理与指令(ERI)基准:一个大规模的基于分类体系的数据集用于基础模型和代理

MZ Naser, Ahmad Bani Awwad, Zoie McCreery, Radwa Eissa, Ahmad Naser, Gianluca Cusatis, Andrew Metcalf, Kapil Madathil, Jamal Abdalla, Venkatesh Kodur, Mohammad Reza Saeb

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ERI基准通过大规模分类数据集评估工程能力,揭示LLM在不同难度问题上的性能差异,并采用收敛验证协议降低幻觉风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19791 2026-03-03 cs.CL cs.IR 79%

ToolDreamer: Instilling LLM Reasoning Into Tool Retrievers

ToolDreamer: 将大语言模型推理能力注入工具检索器

Saptarshi Sengupta, Zhengyu Zhou, Jun Araki, Xingbo Wang, Bingqing Wang, Suhang Wang, Zhe Feng

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Bosch Research North America(博世北美研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 ToolDreamer通过合成工具描述来改进工具检索,提升稀疏和密集检索器性能,减少LLM上下文窗口压力。

Comments Accepted to EACL 2026 (main/oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01580 2026-03-03 cs.CL 79%

Markovian ODE-guided scoring can assess the quality of offline reasoning traces in language models

马尔可夫ODE引导的评分可以评估语言模型离线推理轨迹的质量

Arghodeep Nandi, Ojasva Saxena, Tanmoy Chakraborty

机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi(电子工程系,印度理工学院德里) Indian Institute of Technology Delhi(印度理工学院德里) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(人工智能学院,印度理工学院德里)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MarODE通过马尔可夫模型和常微分方程评估语言模型推理轨迹质量,有效提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01106 2026-03-03 cs.AI 79%

DIVA-GRPO: Enhancing Multimodal Reasoning through Difficulty-Adaptive Variant Advantage

DIVA-GRPO:通过难度自适应变体优势增强多模态推理

Haowen Gao, Zhenyu Zhang, Liang Pang, Fangda Guo, Hongjian Dou, Guannan Lv, Shaoguo Liu, Tingting Gao, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) Kuaishou Technology, Beijing, China(快手科技,北京,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DIVA-GRPO通过难度自适应变体优势方法提升多模态推理能力,解决GRPO在困难问题上的奖励稀疏性和优势消失问题,提升训练稳定性与推理性能。

Comments Accepted to ICLR 2026. Code and models are available at https://github.com/Siaaaaaa1/DIVA-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03906 2026-03-03 cs.AI 79%

Toward Clinically Explainable AI for Medical Diagnosis: A Foundation Model with Human-Compatible Reasoning via Reinforcement Learning

迈向临床可解释的AI:通过强化学习实现人友好的推理基础模型

Qika Lin, Yifan Zhu, Bin Pu, Ling Huang, Haoran Luo, Jingying Ma, Feng Wu, Kai He, Jiaxing Xu, Zhen Peng, Tianzhe Zhao, Fangzhi Xu, Jian Zhang, Zhonghong Ou, Erik Cambria, Swapnil Mishra, Mengling Feng

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DeepMedix-R1通过强化学习实现临床可解释的AI,生成透明推理过程,优于现有模型,提升医学诊断的可解释性和实用性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02404 2026-03-03 cs.CL 79%

AnesSuite: A Comprehensive Benchmark and Dataset Suite for Anesthesiology Reasoning in LLMs

AnesSuite: 一个用于LLM麻醉推理的全面基准和数据集套件

Xiang Feng, Wentao Jiang, Zengmao Wang, Yong Luo, Pingbo Xu, Baosheng Yu, Hua Jin, Jing Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院、多媒体软件国家工程研究中心和多媒体与网络通信工程湖北省重点实验室、武汉大学) Department of Anesthesiology, Zhejiang Cancer Hospital, China(麻醉科、浙江省癌症医院) Institute of Medicine, Chinese Academy of Sciences, Hangzhou, Zhejiang, China(医学研究所、中国科学院、杭州、浙江) Lee Kong Chian School of Medicine, Nanyang Technological University, Singapore(李光耀医学院、南洋理工大学、新加坡) Centre of AI in Medicine, Nanyang Technological University, Singapore(医学人工智能中心、南洋理工大学、新加坡) Department of Anesthesiology, First People’s Hospital of Yunnan Province, China(麻醉科、云南第一人民医院) Kunming University of Science and Technology, China(昆明理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 AnesSuite为LLM麻醉推理提供首个全面基准和数据集,开发Morpheus模型在麻醉领域实现显著性能提升。

Comments Accepted in ICLR 2026; 47 pages, 12 figures, 26 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00686 2026-03-03 cs.CL 79%

RAVEL: Reasoning Agents for Validating and Evaluating LLM Text Synthesis

RAVEL: 用于验证和评估大语言模型文本合成的推理代理

Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Bosi Wen, Yidong Wang, Lin Fan, Yilin Zhou, Zikang Wang, Wenbo Yu, Lindong Wu, Hongning Wang, Minlie Huang

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 RAVEL通过引入智能体框架和C3EBench基准,评估LLM在文本合成中的推理能力,发现推理能力比生成能力更重要。

Comments 35 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15332 2026-03-03 cs.LG 79%

Directional Reasoning Trajectory Change (DRTC): Identifying Critical Trace Segments in Reasoning Models

方向性推理轨迹变化(DRTC):在推理模型中识别关键轨迹段

Waldemar Chang

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 DRTC通过过程因果方法识别推理模型中的关键轨迹段,揭示特定上下文元素如何引导推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00206 2026-03-03 cs.CV cs.AI 79%

TACIT Benchmark: A Programmatic Visual Reasoning Benchmark for Generative and Discriminative Models

TACIT基准:一个生成和判别模型的程序化视觉推理基准

Daniel Nobrega Medeiros

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 TACIT基准提出一个程序化视觉推理测试,包含10个任务和6个领域,通过生成和判别双轨评估模型在空间导航、抽象模式完成等任务中的推理能力。

Comments 10 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04506 2026-03-02 cs.CL 79%

Modeling Clinical Uncertainty in Radiology Reports: from Explicit Uncertainty Markers to Implicit Reasoning Pathways

在放射学报告中建模临床不确定性:从显式不确定性标记到隐式推理路径

Paloma Rabaey, Jong Hak Moon, Jung-Oh Lee, Min Gwan Kim, Hangyul Yoon, Thomas Demeester, Edward Choi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出Lunguage++基准,通过显式和隐式不确定性建模方法,提升放射学报告中不确定性分析的准确性和应用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23199 2026-02-27 cs.AI 79%

SC-Arena: A Natural Language Benchmark for Single-Cell Reasoning with Knowledge-Augmented Evaluation

SC-Arena: 一种用于具有知识增强评估的单细胞推理的自然语言基准

Jiahao Zhao, Feng Jiang, Shaowei Qin, Zhonghui Zhang, Junhao Liu, Guibing Guo, Hamid Alinejad-Rokny, Min Yang

机构 * Software College, Northeastern University(东北大学软件学院) Shenzhen University of Advanced Technology(深圳大学先进技术学院) Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) University of California, Irvine(加州大学 Irvine 分校) School of Biomedical Engineering, UNSW Sydney(悉尼大学生物医学工程学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SC-Arena通过知识增强评估框架,为单细胞生物学中的LLM提供统一且可解释的评估方法,提升生物正确性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17072 2026-02-27 cs.CL 79%

BankMathBench: A Benchmark for Numerical Reasoning in Banking Scenarios

BankMathBench: 一个用于银行场景数值推理的基准测试

Yunseung Lee, Subin Kim, Youngjun Kwak, Jaegul Choo

机构 * KakaoBank Corp.(Kakao银行公司) Korea Advanced Institute of Science(韩国先进科学研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 BankMathBench是一个专门针对银行场景的数值推理基准测试,通过多难度层级的任务设计提升LLMs在金融计算中的准确性和推理能力。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21779 2026-02-26 cs.CV cs.AI 79%

Beyond Static Artifacts: A Forensic Benchmark for Video Deepfake Reasoning in Vision Language Models

超越静态伪影:一种用于视觉语言模型中视频深度伪造推理的取证基准

Zheyuan Gu, Qingsong Zhao, Yusong Wang, Zhaohong Huang, Xinqi Li, Cheng Yuan, Jiaowei Shao, Chi Zhang, Xuelong Li

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(人工智能研究院,中国电信(TeleAI)) Peking University(北京大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出FAQ基准,通过多选任务提升视觉语言模型对视频深度伪造的时间推理能力,并通过实验验证其有效性。

Comments 16 pages, 9 figures. Submitted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21706 2026-02-26 cs.CV cs.AI 79%

SurGo-R1: Benchmarking and Modeling Contextual Reasoning for Operative Zone in Surgical Video

SurGo-R1:手术视频中操作区的上下文推理基准测试与建模

Guanyi Qin, Xiaozhen Wang, Zhu Zhuo, Chang Han Low, Yuancan Xiao, Yibing Fu, Haofeng Liu, Kai Wang, Chunjiang Li, Yueming Jin

机构 * National University of Singapore, Singapore(新加坡国立大学) Southern Medical University, China(南方医科大学) Guangzhou Research Translation and Innovation Institute, National University of Singapore, China(广州研究翻译与创新研究院,新加坡国立大学,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SurGo-R1通过RLHF优化的多阶段架构,在手术视频中实现了高精度的操作区识别,显著优于通用视觉-语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21650 2026-02-26 cs.SI cs.AI 79%

PPCR-IM: A System for Multi-layer DAG-based Public Policy Consequence Reasoning and Social Indicator Mapping

PPCR-IM:一个多层DAG基础的公共政策后果推理与社会指标映射系统

Zichen Song, Weijia Li

机构 * Lanzhou University(兰州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PPCR-IM通过多层DAG推理和指标映射,实现公共政策后果的结构化分析与社会影响评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07667 2026-02-26 cs.AI 79%

1-2-3 Check: Enhancing Contextual Privacy in LLM via Multi-Agent Reasoning

1-2-3 Check: 通过多智能体推理增强LLM的上下文隐私

Wenkai Li, Liwen Sun, Zhenxiang Guan, Xuhui Zhou, Maarten Sap

机构 * Language Technologies Institute Carnegie Mellon University(语言技术研究所卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 通过多智能体推理,有效减少LLM中的私有信息泄露,提升上下文隐私保护效果。

Comments Accepted at the International Association for AI Safety and Ethics AI (IASEAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20878 2026-02-25 cs.AI 79%

Diagnosing Causal Reasoning in Vision-Language Models via Structured Relevance Graphs

通过结构化相关性图诊断视觉-语言模型中的因果推理

Dhita Putri Pratama, Soyeon Caren Han, Yihao Ding

机构 * University of Melbourne(墨尔本大学) The University of Western Australia(西澳大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ViLCaR基准,通过结构化相关性图评估视觉-语言模型的因果推理能力,发现其局限性源于结构指导不足而非推理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19914 2026-02-24 cs.AI 79%

Watson & Holmes: A Naturalistic Benchmark for Comparing Human and LLM Reasoning

沃森与霍尔姆斯:一种自然情境下比较人类和大语言模型推理能力的基准

Thatchawin Leelawat, Lewis D Griffin

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出沃森与霍尔姆斯桌游作为自然情境下比较人类与大语言模型推理能力的基准,展示AI模型性能随时间显著提升,特别是在解决复杂案件时的推理能力进步。

Comments 51 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17052 2026-02-24 cs.AI 79%

ViLBias: Detecting and Reasoning about Bias in Multimodal Content

ViLBias:检测和推理解多模态内容中的偏见

Shaina Raza, Caesar Saleh, Azib Farooq, Emrul Hasan, Franklin Ogidi, Haad Zahid, Maximus Powers, Marcelo Lotif, Anam Zahid, Karanpal Sekhon, Veronica Chatrath, Roya Javedi, Vahid Reza Khazaie, Zhenyu Yu

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ViLBias通过多模态基准检测新闻中的偏见,利用LLM和VLMs提升推理准确率和忠实度,参数高效方法能恢复大部分微调性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18459 2026-02-24 cs.CY cs.AI 79%

From Bias Mitigation to Bias Negotiation: Governing Identity and Sociocultural Reasoning in Generative AI

从偏见缓解到偏见协商:在生成式AI中治理身份与社会文化推理

Zackary Okun Dunivin, Bingyi Han, John Bollenbocher

机构 * Institute for Social Science, University of Stuttgart(斯图加特大学社会科学研究所) Department of Computer Science, Saarland University(萨尔兰大学计算机科学系) Department of Linguistics, University of Texas Austin TX USA(德克萨斯大学语言学系) Department of Linguistics, University of Texas(德克萨斯大学语言学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出偏见协商作为生成式AI治理身份与社会文化推理的新框架,通过实证研究探讨其在缓解偏见和提升社会公正中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17592 2026-02-23 astro-ph.IM cs.LG 79%

AstroMLab 4: Benchmark-Topping Performance in Astronomy Q&A with a 70B-Parameter Domain-Specialized Reasoning Model

AstroMLab 4: 在天文学问答中通过700亿参数领域专用模型实现基准顶级性能

Tijmen de Haan, Yuan-Sen Ting, Tirthankar Ghosal, Tuan Dung Nguyen, Alberto Accomazzi, Emily Herron, Vanessa Lama, Rui Pan, Azton Wells, Nesar Ramachandra

机构 * Institute of Particle Nuclear Studies (IPNS), High Energy Accelerator Research Organization (KEK), Tsukuba, Ibaraki 305-0801, Japan International Center for Quantum-field Measurement Systems for Studies of the Universe Particles (QUP-WPI), High Energy Accelerator Research Organization (KEK), Tsukuba, Ibaraki 305-0801, Japan Department of Astronomy, The Ohio State University, Columbus, OH, USA Center for Cosmology AstroParticle Physics (CCAPP), The Ohio State University, Columbus, OH, USA National Center for Computational Sciences, Oak Ridge National Laboratory, Oak Ridge, TN, USA Department of Computer Information Science, University of Pennsylvania, Philadelphia, PA, USA Center for Astrophysics, Harvard \& Smithsonian, Cambridge, MA, USA Siebel School of Computing Data Science, University of Illinois at Urbana-Champaign, Urbana-Champaign, IL, USA Computational Science Division, Argonne National Laboratory, Lemont, IL, USA

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 AstroSage-Llama-3.1-70B通过700亿参数领域专用模型在天文学问答中实现顶级性能,优于GPT-5.2等通用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17183 2026-02-20 cs.SE cs.AI 79%

Robustness and Reasoning Fidelity of Large Language Models in Long-Context Code Question Answering

大语言模型在长上下文代码问答中的鲁棒性与推理可信度

Kishan Maharaj, Nandakishore Menon, Ashita Saxena, Srikanth Tamilselvam

机构 * IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究评估了大语言模型在长上下文代码问答中的鲁棒性和推理可信度,通过不同设置测试发现模型在面对干扰信息时表现脆弱,揭示了现有评估的局限性。

Comments 11 pages, 4 Figures, 5 Tables, Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14160 2026-02-17 cs.AI 79%

Process-Supervised Multi-Agent Reinforcement Learning for Reliable Clinical Reasoning

过程监督多智能体强化学习用于可靠的临床推理

Chaeeun Lee, T. Michael Yates, Pasquale Minervini, T. Ian Simpson

机构 * School of Informatics, University of Edinburgh, UK(信息学院,爱丁堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种过程监督的多智能体强化学习框架,用于提升基因-疾病有效性校准的临床推理准确性与过程忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏