arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2603.02222 2026-03-04 cs.LG cs.AI 62%

MedCalc-Bench Doesn't Measure What You Think: A Benchmark Audit and the Case for Open-Book Evaluation

MedCalc-Bench 并未衡量你所想的:一项基准审计与开放书考试的案例

Artus Krohn-Grimberghe

机构 * MedCalc

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MedCalc-Bench的基准审计揭示其主要衡量公式记忆和算术精度,而非临床推理,通过开放书提示显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02041 2026-03-03 cs.CL cs.AI 62%

EstLLM: Enhancing Estonian Capabilities in Multilingual LLMs via Continued Pretraining and Post-Training

EstLLM:通过持续预训练和后训练增强多语言大语言模型中的爱沙尼亚能力

Aleksei Dorkin, Taido Purason, Emil Kalbaliyev, Hele-Andra Kuulmets, Marii Ojastu, Mark Fišel, Tanel Alumäe, Eleri Aedmaa, Krister Kruusmaa, Kairit Sirts

机构 * Institute of Computer Science, University of Tartu(塔尔图大学计算机科学研究院) Department of Software Science, Tallinn University of Technology(塔林技术大学软件科学系) Institute of the Estonian Language, Tallinn, Estonia(爱沙尼亚语言研究院) School of Humanities, Tallinn University(塔林大学人文学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EstLLM通过持续预训练和后训练提升多语言大语言模型中爱沙尼亚的能力,增强语言和推理表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01990 2026-03-03 cs.AI cs.CL cs.CV 62%

According to Me: Long-Term Personalized Referential Memory QA

根据我:长期个性化参照记忆问答

Jingbiao Mei, Jinghong Chen, Guangyu Yang, Xinyu Hou, Margaret Li, Bill Byrne

机构 * Department of Engineering, University of Cambridge, United Kingdom(剑桥大学工程系) Department of Physics, University of Cambridge, United Kingdom(剑桥大学物理系) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ATM-Bench,首个多模态多来源个性化参照记忆问答基准,并提出Schema-Guided Memory方法提升记忆推理性能

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01710 2026-03-03 cs.CL cs.IR cs.LG 62%

Legal RAG Bench: an end-to-end benchmark for legal RAG

法律RAG基准:法律RAG的端到端评估基准

Abdur-Rahman Butler, Umar Butler

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 Legal RAG Bench通过评估法律RAG系统端到端性能,发现信息检索是性能的主要驱动因素,Kanon 2嵌入器显著提升了正确性和基础性。

Comments 13 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01343 2026-03-03 cs.CL cs.AI 62%

PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology

PanCanBench: 用于评估大型语言模型在胰腺肿瘤学中的综合基准

Yimin Zhao, Sheela R. Damle, Simone E. Dekker, Scott Geng, Karly Williams Silva, Jesse J Hubbard, Manuel F Fernandez, Fatima Zelada-Arenas, Alejandra Alvarez, Brianne Flores, Alexis Rodriguez, Stephen Salerno, Carrie Wright, Zihao Wang, Pang Wei Koh, Jeffrey T. Leek

机构 * Department of Biostatistics, University of Washington(华盛顿大学生物统计学系) Clinical Research Division, Fred Hutch Cancer Center(Fred Hutch癌症中心临床研究部) Division of Hematology and Oncology, Department of Medicine, University of Washington(华盛顿大学医学系血液学与肿瘤学分会) Allen Institute for AI(Allen人工智能研究所) Department of Computer Science and Engineering, University of Washington(华盛顿大学计算机科学与工程系) Public Health Sciences, Biostatistics, Fred Hutchinson Cancer Center(Fred Hutchinson癌症中心公共卫生科学与生物统计学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PanCanBench通过评估22种LLM在胰腺肿瘤学问题上的表现,揭示了模型在事实准确性、临床完整性和网络搜索整合方面的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13648 2026-03-03 cs.CL cs.AI 62%

SimpleToM: Exposing the Gap between Explicit ToM Inference and Implicit ToM Application in LLMs

SimpleToM:揭示LLM中显式ToM推理与隐式ToM应用之间的差距

Yuling Gu, Oyvind Tafjord, Hyunwoo Kim, Jared Moore, Ronan Le Bras, Peter Clark, Yejin Choi

机构 * Allen Institute for AI(艾伦人工智能研究所) NVIDIA(英伟达) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SimpleToM通过多层级ToM推理和日常场景测试,揭示LLM在显式心理状态推理与隐式应用之间的能力差距。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05228 2026-03-02 cs.LG cs.AI 62%

CMT-Benchmark: A Benchmark for Condensed Matter Theory Built by Expert Researchers

CMT-Benchmark:由专家研究人员构建的凝聚态理论基准

Haining Pan, James V. Roggeveen, Erez Berg, Juan Carrasquilla, Debanjan Chowdhury, Surya Ganguli, Federico Ghimenti, Juraj Hasik, Henry Hunt, Hong-Chen Jiang, Mason Kamb, Ying-Jer Kao, Ehsan Khatami, Michael J. Lawler, Di Luo, Titus Neupert, Xiaoliang Qi, Michael P. Brenner, Eun-Ah Kim

机构 * Rutgers University(罗格斯大学) Harvard University(哈佛大学) Weizmann Institute of Science(魏茨曼科学研究所) ETH Zürich(苏黎世联邦理工学院) Cornell University(康奈尔大学) Stanford University(斯坦福大学) University of Zürich(苏黎世大学) Stanford Institute for Materials and Energy Sciences(斯坦福材料与能源科学研究所) SLAC National Accelerator Laboratory(斯坦福直线加速器实验室) University of California, Los Angeles(加州大学洛杉矶分校) National Taiwan University(台湾大学) San José State University(圣何塞州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CMT-Benchmark通过专家设计的50个凝聚态理论问题评估LLM在物理推理能力上的不足,揭示当前模型在复杂科学问题上的局限性。

Comments CMT-Benchmark dataset is available at https://huggingface.co/datasets/JVRoggeveen/cmt_benchmark. CMT-Benchmark was referenced in the Gemini 3 Deep Think (February 2026) release at https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-deep-think/

Journal ref International Conference on Learning Representations (ICLR) main conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15715 2026-02-26 cs.CL cs.AI 62%

RebuttalAgent: Strategic Persuasion in Academic Rebuttal via Theory of Mind

反驳代理:通过心理理论实现学术反驳的战略说服

Zhitao He, Zongwei Lyu, Yi R Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 RebuttalAgent通过心理理论框架实现学术反驳的战略说服,利用训练数据和强化学习提升反驳效果,显著优于现有模型。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21420 2026-02-26 cs.LG cs.AI 62%

Overconfident Errors Need Stronger Correction: Asymmetric Confidence Penalties for Reinforcement Learning

过度自信的错误需要更强的纠正:强化学习中的非对称置信度惩罚

Yuanda Xu, Hejian Sang, Zhengze Zhou, Ran He, Zhipeng Wang

机构 * LinkedIn Corporation(领英公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出非对称置信度感知错误惩罚(ACE)以解决强化学习中过度自信错误的问题,通过动态调节负优势提升模型推理能力与生成多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19922 2026-02-26 cs.CL cs.AI 62%

HEART: A Unified Benchmark for Assessing Humans and LLMs in Emotional Support Dialogue

HEART:一个评估人类和大语言模型在情感支持对话中能力的统一基准

Laya Iyer, Kriti Aggarwal, Sanmi Koyejo, Gail Heyman, Desmond C. Ong, Subhabrata Mukherjee

机构 * Stanford University(斯坦福大学) University of California, San Diego(加州大学圣地亚哥分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 HEART通过多轮情感支持对话评估人类与大语言模型的能力差异,揭示两者在共情、一致性等维度上的表现及趋同趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19139 2026-02-26 cs.AI cs.CL 62%

A Multi-faceted Analysis of Cognitive Abilities: Evaluating Prompt Methods with Large Language Models on the CONSORT Checklist

对认知能力的多维度分析:利用大型语言模型在CONSORT清单上评估提示方法

Sohyeon Jeon, Hyung-Chul Lee

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过比较通用和领域专用LLM在三种提示策略下的表现,揭示了其在评估临床试验报告时存在显著的校准错误和过度自信问题,强调了改进校准和提示工程的重要性。

Comments We have decided to withdraw this manuscript because we believe it requires further revision and substantial improvement before it is suitable for dissemination to the academic community

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20164 2026-02-25 cs.CL cs.LG 62%

Benchmarking Distilled Language Models: Performance and Efficiency in Resource-Constrained Settings

评估压缩语言模型:在资源受限环境中的性能与效率

Sachin Gopal Wani, Eric Page, Ajay Dholakia, David Ellison

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过对比蒸馏模型与原始模型,验证了蒸馏在资源受限环境下提升性能与效率的优越性。

Comments 16 pages, 5 figures, accepted at the the 2025 TPCTC Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20162 2026-02-25 cs.CL cs.AI 62%

Talking to Yourself: Defying Forgetting in Large Language Models

与自己对话:在大型语言模型中克服遗忘

Yutao Sun, Mingshuai Chen, Tiancheng Zhao, Phillip Miao, Zilun Zhang, Haozhan Shen, Ruizhe Zhu, Jianwei Yin

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院) Om AI Research(奥姆人工智能研究) Stanford University(斯坦福大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SA-SFT方法,通过让LLM生成自我对话来缓解微调过程中的灾难性遗忘,提升领域性能并优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22620 2026-02-25 cs.CR cs.AI cs.LG 62%

Breaking Agent Backbones: Evaluating the Security of Backbone LLMs in AI Agents

打破代理骨干:评估AI代理中骨干LLM的安全性

Julia Bazinska, Max Mathys, Francesco Casucci, Mateo Rojas-Carulla, Xander Davies, Alexandra Souly, Niklas Pfister

机构 * Lakera AI ETH Zürich(苏黎世联邦理工学院) UK AI Security Institute(英国人工智能安全研究所) OATML, University of Oxford(OATML,牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出威胁快照框架,用于评估AI代理中LLM骨干的安全性,通过构建$b^3$基准测试揭示LLM安全性的关键影响因素。

Comments Julia Bazinska and Max Mathys contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19467 2026-02-24 cs.CY cs.AI cs.CL 62%

Can Large Language Models Replace Human Coders? Introducing ContentBench

大语言模型能取代人类程序员吗?引入ContentBench

Michael Haman

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过ContentBench基准测试,评估低成本大语言模型在解释性编程任务中的表现,揭示其在高精度任务中的优势及在讽刺处理上的局限性。

Comments Project website: https://contentbench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18998 2026-02-24 cs.AI cs.CL 62%

Benchmark Test-Time Scaling of General LLM Agents

通用大语言模型代理的基准测试时间扩展

Xiaochuan Li, Ryan Ming, Pranav Setlur, Abhijay Paladugu, Andy Tang, Hao Kang, Shuai Shao, Rong Jin, Chenyan Xiong

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Meta

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究提出General AgentBench基准测试,用于评估通用大语言模型代理在多个技能和工具上的表现,发现顺序和并行扩展方法在实际应用中均存在性能限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27246 2026-02-24 cs.CL cs.AI cs.IR 62%

Beyond a Million Tokens: Benchmarking and Enhancing Long-Term Memory in LLMs

超越一百万词:评估和增强LLM长期记忆的基准测试

Mohammad Tavakoli, Alireza Salemi, Carrie Ye, Mohamed Abdalla, Hamed Zamani, J Ross Mitchell

机构 * University of Alberta(阿尔伯塔大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LIGHT框架,通过增强LLM的三种记忆系统,提升其在长对话任务中的表现,实验显示平均提升3.5%-12.69%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17860 2026-02-24 cs.CL cs.AI 62%

Dialogue is Better Than Monologue: Instructing Medical LLMs via Strategical Conversations

对话优于独白:通过战略对话指导医学LLM

Zijie Liu, Xinyu Zhao, Jie Peng, Zhuangdi Zhu, Qingyu Chen, Kaidi Xu, Xia Hu, Tianlong Chen

机构 * UNC at Chapel Hill(北卡罗来纳大学教堂山分校) University of Science and Technology of China(中国科学技术大学) George Mason University(乔治·马歇尔大学) Yale University(耶鲁大学) City University of Hong Kong(香港城市大学) Rice University(得克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过战略对话指导医学LLM,提升多轮推理和嘈杂环境下的准确率

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17672 2026-02-23 cs.HC cs.AI cs.CL cs.CR cs.CY 62%

Assessing LLM Response Quality in the Context of Technology-Facilitated Abuse

评估在技术辅助虐待情境下的LLM响应质量

Vijay Prakash, Majed Almansoori, Donghan Hu, Rahul Chatterjee, Danny Yuxing Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了四种LLM在技术辅助虐待情境下的响应质量,揭示其在支持幸存者方面的有效性和局限性,并提出改进建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15854 2026-02-23 cs.CL cs.AI 62%

Decoupling Strategy and Execution in Task-Focused Dialogue via Goal-Oriented Preference Optimization

通过目标导向的偏好优化实现任务导向对话中的解耦策略与执行

Jingyi Xu, Xingyu Ren, Zhoupeng Shou, Yumeng Zhang, Zhiqiang You

机构 * School of Information Engineering, China Jiliang University, Hangzhou, China(信息工程学院,中国浙江大学,杭州,中国) College of Chemical and Biological Engineering, Zhejiang University, Hangzhou, China(化学与生物工程学院,浙江大学,杭州,中国)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GOPO框架,通过解耦策略规划与响应生成,提升任务导向对话系统的长周期任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17311 2026-02-23 cs.CL cs.AI 62%

FLUKE: A Linguistically-Driven and Task-Agnostic Framework for Robustness Evaluation

FLUKE:一种基于语言驱动且任务无关的鲁棒性评估框架

Yulia Otmakhova, Hung Thinh Truong, Rahmad Mahendra, Zenan Zhai, Rongxin Zhu, Daniel Beck, Jey Han Lau

机构 * The University of Melbourne(墨尔本大学) Oracle(Oracle公司) Universitas Indonesia(印度尼西亚大学) RMIT University(皇家墨尔本理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 FLUKE通过系统性语言变化评估模型鲁棒性,揭示任务依赖性、模型脆弱性和语言特征使用与鲁棒性无关的结论。

Comments Accepted to EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12026 2026-02-20 cs.AI cs.CV cs.LG 62%

Bongard-RWR+: Real-World Representations of Fine-Grained Concepts in Bongard Problems

Bongard-RWR+: Bongard问题中细粒度概念的现实世界表示

Szymon Pawlonka, Mikołaj Małkiński, Jacek Mańdziuk

机构 * Warsaw University of Technology(华沙技术大学) AGH University of Krakow(克拉科夫AGH大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Bongard-RWR+数据集,通过视觉语言模型生成现实世界图像,评估VLMs在细粒度概念识别中的局限性。

Comments Accepted to The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15867 2026-02-19 cs.CL cs.AI 62%

Playing With AI: How Do State-Of-The-Art Large Language Models Perform in the 1977 Text-Based Adventure Game Zork?

玩转AI:当前最先进的大语言模型在1977年文本冒险游戏Zork中的表现如何?

Berry Gerrits

机构 * University of Twente(特文特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了当前最先进的大语言模型在1977年文本冒险游戏Zork中的表现,发现其在问题解决和推理能力上存在显著局限。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15862 2026-02-19 cs.CL cs.AI 62%

Enhancing Action and Ingredient Modeling for Semantically Grounded Recipe Generation

增强语义 grounded 的动作和成分建模以实现语义 grounded 的食谱生成

Guoshan Liu, Bin Zhu, Yian Li, Jingjing Chen, Chong-Wah Ngo, Yu-Gang Jiang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出语义 grounded 的框架,通过两阶段流程结合监督微调和强化微调,提升食谱生成的语义准确性与成分预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15801 2026-02-19 cs.CL cs.AI 62%

VerifyBench: Benchmarking Reference-based Reward Systems for Large Language Models

VerifyBench: 大型语言模型参考式奖励系统的基准测试

Yuchen Yan, Jin Jiang, Zhenbang Ren, Yijun Li, Xudong Cai, Yang Liu, Xin Xu, Mengdi Zhang, Jian Shao, Yongliang Shen, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Meituan Group(美团集团) Peking University(北京大学) University of Electronic Science and Technology of China(电子科技大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 VerifyBench通过设计专门的基准测试评估基于参考的奖励系统,揭示现有验证器在复杂任务中的不足,推动推理模型训练的改进。

Comments ICLR 2026: https://openreview.net/forum?id=JfsjGmuFxz Project Page: https://zju-real.github.io/VerifyBench Dataset: https://huggingface.co/datasets/ZJU-REAL/VerifyBench Code: https://github.com/ZJU-REAL/VerifyBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15812 2026-02-18 cs.AI cs.CL 62%

ErrorMap and ErrorAtlas: Charting the Failure Landscape of Large Language Models

误差图与误差图谱:大型语言模型失败景观的绘制

Shir Ashury-Tahan, Yifan Mai, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen

机构 * IBM Research(IBM研究院) Stanford University(斯坦福大学) MIT(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ErrorMap和ErrorAtlas通过分析LLM失败原因,揭示模型弱点,为模型改进和评估提供更深入的洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15139 2026-02-18 cs.CL cs.AI cs.CV 62%

CGRA-DeBERTa Concept Guided Residual Augmentation Transformer for Theologically Islamic Understanding

CGRA-DeBERTa概念引导残差增强变换器用于神学伊斯兰理解

Tahir Hussain, Saddam Hussain Khan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CGRA-DeBERTa通过概念引导残差增强变换器提升神学伊斯兰文本问答的准确性和效率。

Comments 24 Pages, 9 Tables, 7 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07587 2026-02-18 cs.AI cs.CL 62%

Beyond Fact Retrieval: Episodic Memory for RAG with Generative Semantic Workspaces

超越事实检索:具有生成语义工作区的RAG episodic记忆

Shreyas Rajesh, Pavan Holur, Chenda Duan, David Chong, Vwani Roychowdhury

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 GSW通过生成语义工作区提升LLM的长上下文推理能力,实现更高效的记忆管理与时空连贯性。

Comments AAAI 2026 Oral, code available at: https://github.com/roychowdhuryresearch/gsw-memory

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14989 2026-02-17 cs.CV cs.AI cs.LG 62%

ThermEval: A Structured Benchmark for Evaluation of Vision-Language Models on Thermal Imagery

ThermEval: 一种用于评估视觉语言模型在热成像上的性能的结构化基准

Ayush Shrivastava, Kirtan Gangani, Laksh Jain, Mayank Goel, Nipun Batra

机构 * Indian Institute of Technology, Gandhinagar, India(印度理工学院加尔各答分校) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ThermEval通过结构化基准评估视觉语言模型在热成像上的性能,揭示其在温度推理和颜色映射转换上的不足,推动热视觉语言模型的发展。

Comments 8 Pages with 2 figures of main content. 2 pages of References. 10 pages of appendix with 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14158 2026-02-17 cs.CL cs.AI cs.MA 62%

A Multi-Agent Framework for Medical AI: Leveraging Fine-Tuned GPT, LLaMA, and DeepSeek R1 for Evidence-Based and Bias-Aware Clinical Query Processing

面向医疗AI的多智能体框架:利用微调的GPT、LLaMA和DeepSeek R1进行基于证据和偏见意识的临床查询处理

Naeimeh Nourmohammadi, Md Meem Hossain, The Anh Han, Safina Showkat Ara, Zia Ush Shamszaman

机构 * Department of Computing Games, Teesside University, Middlesbrough, United Kingdom Centre for Digital Innovation, Teesside University, Middlesbrough, United Kingdom Faculty of Business \& Technology, University of Sunderland, Sunderland, United Kingdom

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多智能体框架,利用微调的GPT、LLaMA和DeepSeek R1,结合证据检索和偏见检查,提升医疗问答的可靠性与准确性。

Comments 27 pages, 14 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏