arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2602.14002 2026-02-17 cs.CL cs.AI 62%

The Sufficiency-Conciseness Trade-off in LLM Self-Explanation from an Information Bottleneck Perspective

在信息瓶颈视角下,大型语言模型自我解释的充分性与简洁性权衡

Ali Zahedzadeh, Behnam Bahrak

机构 * Tehran Institute for Advanced Studies, Khatam University, Tehran, Iran(泰赫兰高级研究学院,卡坦大学,泰赫兰,伊朗)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文从信息瓶颈视角探讨了大型语言模型自我解释中充分性与简洁性之间的权衡,通过实验表明简洁解释在保持准确性的同时能显著减少长度,但过度压缩会损害性能。

Comments LREC 2026 submission; focuses on LLM self-explanation, interpretability, and information bottleneck analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13650 2026-02-17 cs.CV cs.AI cs.CL 62%

KorMedMCQA-V: A Multimodal Benchmark for Evaluating Vision-Language Models on the Korean Medical Licensing Examination

KorMedMCQA-V: 一种用于评估视觉语言模型在韩国医学资格考试中多模态多项选择问答能力的基准测试

Byungjin Choi, Seongsu Bae, Sunjun Kweon, Edward Choi

机构 * Ajou University School of Medicine(阿乔大学医学院) KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 KorMedMCQA-V是一个用于评估视觉语言模型在韩国医学资格考试中多模态多项选择问答能力的基准测试,展示了不同模型在医疗领域中的表现差异。

Comments 17 pages, 2 figures, 6 tables. (Includes appendix.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13272 2026-02-17 cs.AI cs.LG 62%

TemporalBench: A Benchmark for Evaluating LLM-Based Agents on Contextual and Event-Informed Time Series Tasks

TemporalBench: 一个用于评估基于LLM的智能体在上下文和事件驱动的时间序列任务中的基准

Muyan Weng, Defu Cao, Wei Yang, Yashaswi Sharma, Yan Liu

机构 * University of Southern California(美国南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TemporalBench是一个多领域基准,用于评估基于LLM的智能体在上下文和事件驱动的时间序列任务中的时序推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12522 2026-02-17 cs.SE cs.AI cs.IR cs.LG cs.MA 62%

Improved Bug Localization with AI Agents Leveraging Hypothesis and Dynamic Cognition

改进的AI代理在利用假设和动态认知进行Bug定位中的应用

Asif Mohammed Samir, Mohammad Masudur Rahman

机构 * Dalhousie University(达尔豪西大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CogniGent技术,利用AI代理进行因果推理和动态认知调试,提升bug定位的准确性和效率。

Comments 13 pages, 7 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12892 2026-02-16 cs.CV cs.AI cs.CL 62%

RADAR: Revealing Asymmetric Development of Abilities in MLLM Pre-training

RADAR: 揭示多模态大语言模型预训练中能力的非对称发展

Yunshuang Nie, Bingqian Lin, Minzhe Niu, Kun Xiang, Jianhua Han, Guowei Huang, Xingyue Quan, Hang Xu, Bokui Chen, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Peng Cheng Laboratory(鹏城实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东大数据分析与处理重点实验室) Tsinghua Shenzhen International Graduate School(清华大学深圳国际 Graduate School) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Yinwang Intelligent Technology Co., Ltd.(亿纬智能科技有限公司) Huawei’s 2012 Lab(华为2012实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RADAR提出了一种高效的以能力为中心的评估框架,用于揭示多模态大语言模型预训练中感知和推理能力的非对称发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15052 2026-02-16 cs.CL cs.AI 62%

SGM: Safety Glasses for Multimodal Large Language Models via Neuron-Level Detoxification

SGM: 通过神经层面的净化为多模态大语言模型提供安全眼镜

Hongbo Wang, MaungMaung AprilPyone, Isao Echizen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SGM通过神经层面的净化技术,有效降低多模态大语言模型的毒性,同时保持生成流畅性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10664 2026-02-13 cs.CL cs.AI 62%

Evaluating Modern Large Language Models on Low-Resource and Morphologically Rich Languages:A Cross-Lingual Benchmark Across Cantonese, Japanese, and Turkish

评估现代大语言模型在低资源和形态丰富的语言上的表现:跨语言基准测试在粤语、日语和土耳其语之间

Chengxuan Xia, Qianye Wu, Hongbin Guan, Sixuan Tian, Yilun Hao, Xiaoyu Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了七种先进LLMs在粤语、日语和土耳其语上的表现,发现专有模型在多语言任务中表现优异,但文化理解和形态泛化仍有不足。

Comments This paper requires XeLaTeX for proper Unicode rendering of Japanese and Cantonese text

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14182 2026-02-13 cs.CL cs.LG 62%

LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs

LabSafety Bench: 对科学实验室中AI安全问题的LLM基准测试

Yujun Zhou, Jingdong Yang, Yue Huang, Kehan Guo, Zoe Emory, Bikram Ghosh, Amita Bedar, Sujay Shekar, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Werner Geyer, Nuno Moniz, Nitesh V Chawla, Xiangliang Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 LabSafety Bench通过评估LLMs和VLMs在实验室安全问题上的表现,揭示了当前模型在危险识别和风险评估方面的不足,强调了对AI安全评估框架的迫切需求。

Comments Published at Nature Machine Intelligence

Journal ref Nat Mach Intell 8, 20-31 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11700 2026-02-13 cs.LG cs.AI 62%

TabSieve: Explicit In-Table Evidence Selection for Tabular Prediction

TabSieve: 表格内证据选择用于表格预测

Yongyao Wang, Ziqi Miao, Lu Yang, Haonan Jia, Wenting Yan, Chen Qian, Lijun Li

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TabSieve通过显式选择表格内证据提升预测性能,采用强化学习优化证据选择与预测正确性,实验显示在分类和回归任务中均取得显著提升。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10081 2026-02-13 cs.CL cs.AI 62%

Anagent For Enhancing Scientific Table & Figure Analysis

一个增强科学表格及图表分析的代理

Xuehang Guo, Zhiyong Lu, Tom Hope, Qingyun Wang

机构 * College of William \& Mary The Allen Institute for AI (AI2)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Anagent通过多代理框架提升科学表格及图表分析的准确性和效率,实现显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10886 2026-02-12 cs.CL cs.AI cs.CE 62%

The CLEF-2026 FinMMEval Lab: Multilingual and Multimodal Evaluation of Financial AI Systems

CLEF-2026金融多语言多模态评估实验室:金融AI系统的多语言多模态评估框架

Zhuohan Xie, Rania Elbadry, Fan Zhang, Georgi Georgiev, Xueqing Peng, Lingfei Qian, Jimin Huang, Dimitar Dimitrov, Vanshikaa Jani, Yuyang Dai, Jiahui Geng, Yuxia Wang, Ivan Koychev, Veselin Stoyanov, Preslav Nakov

机构 * MBZUAI The University of Tokyo(东京大学) The Fin AI(Fin AI) University of Arizona(亚利桑那大学) INSAIT

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CLEF-2026金融多语言多模态评估实验室提出首个多语言多模态金融AI评估框架,涵盖金融理解、推理和决策三个任务,旨在推动全球包容的金融AI发展。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16503 2026-02-12 cs.CL cs.AI 62%

MRAG: Benchmarking Retrieval-Augmented Generation for Bio-medicine

MRAG:生物医学领域检索增强生成的基准测试

Liz Li, Wei Zhu

机构 * DataSelect AI University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MRAG基准测试通过构建医学领域语料库和工具包,评估RAG在生物医学任务中的有效性,揭示RAG在提升LLM可靠性及性能影响因素方面的贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23050 2026-02-12 cs.LG cs.AI 62%

Understanding Language Prior of LVLMs by Contrasting Chain-of-Embedding

通过对比嵌入链理解LVLMs的语言先验

Lin Long, Changdae Oh, Seongheon Park, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 通过对比嵌入链分析,揭示LVLMs中视觉信息整合的关键层及影响响应生成的强度量化方法。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17512 2026-02-12 cs.AI cs.CL 62%

Is Your LLM Really Mastering the Concept? A Multi-Agent Benchmark

你的大语言模型真的掌握了概念吗?一个多智能体基准

Shuhang Xu, Weijian Deng, Yixuan Zhou, Fangwei Zhong

机构 * Beijing Normal University(北京师范大学) Australian National University(澳大利亚国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CK-Arena,通过多智能体社交推理游戏评估大语言模型的概念理解能力,揭示模型在概念掌握上的差异性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07642 2026-02-10 cs.AI cs.LG 62%

Efficient Table Retrieval and Understanding with Multimodal Large Language Models

基于多模态大语言模型的高效表格检索与理解

Zhuoyan Xu, Haoyang Fang, Boran Han, Bonan Min, Bernie Wang, Cuixiong Hu, Shuai Zhang

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) AWS(亚马逊网络服务)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TabRAG通过多模态大语言模型实现高效表格检索与理解,显著提升检索召回率和答案准确率。

Comments Published at EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07422 2026-02-10 cs.CR cs.AI cs.CL 62%

Secure Code Generation via Online Reinforcement Learning with Vulnerability Reward Model

通过在线强化学习与漏洞奖励模型实现安全代码生成

Tianyi Wu, Mingzhe Du, Yue Liu, Chengran Yang, Terry Yue Zhuo, Jiaheng Zhang, See-Kiong Ng

机构 * National University of Singapore(国立新加坡大学) Singapore Management University(新加坡管理学院) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SecCoderX通过在线强化学习与漏洞奖励模型提升代码安全性,实现功能与安全性的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08487 2026-02-10 cs.CL cs.AI 62%

Beyond Bias Scores: Unmasking Vacuous Neutrality in Small Language Models

超越偏见分数:揭示小型语言模型中的空洞中性

Sumanth Manduru, Carlotta Domeniconi

机构 * George Mason University(乔治·马歇尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出空洞中性框架,评估小型语言模型的公平性与鲁棒性,揭示其在不同社会偏见类别中的隐藏漏洞。

Comments Accepted at EACL 2026 Student Research Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03444 2026-02-10 cs.CL cs.AI 62%

Taxation Perspectives from Large Language Models: A Case Study on Additional Tax Penalties

大语言模型的税收视角:关于附加税收罚金的案例研究

Eunkyung Choi, Youngjin Suh, Siun Lee, Hongseok Oh, Juheon Kang, Won Hur, Hun Park, Wonseok Hwang

机构 * University of Seoul(首尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型在税收领域的能力,通过PLAT基准测试发现其在复杂法律推理任务中表现有限。

Comments 9 pages

Journal ref EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06975 2026-02-10 cs.CL cs.AI 62%

BiomechAgent: AI-Assisted Biomechanical Analysis Through Code-Generating Agents

BiomechAgent: 通过代码生成代理实现AI辅助的生物力学分析

R. James Cotton, Thomas Leonard

机构 * Shirley Ryan AbilityLab Northwestern University(Shirley Ryan AbilityLab 北卡罗来纳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 BiomechAgent通过自然语言和代码生成技术,使无标记运动捕捉数据的生物力学分析更易被非编程用户使用,提升临床应用的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13707 2026-02-09 cs.AI cs.CL 62%

OpenDeception: Learning Deception and Trust in Human-AI Interaction via Multi-Agent Simulation

OpenDeception: 通过多智能体模拟学习人类-人工智能交互中的欺骗与信任

Yichen Wu, Qianqian Gao, Xudong Pan, Geng Hong, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 OpenDeception通过多智能体模拟评估人类-人工智能交互中的欺骗与信任风险,利用场景基准、意图网络和信任网络,识别高风险对话并提前预警。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08010 2026-02-09 cs.CL cs.AI 62%

ExpressivityBench: Can LLMs Communicate Implicitly?

ExpressivityBench: LLMs能否隐式沟通?

Joshua Tint, Som Sagar, Aditya Taparia, Kelly Raines, Bimsara Pathiraja, Caleb Liu, Ransalu Senanayake

机构 * Amazon(亚马逊公司) Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ExpressivityBench通过信息理论模型评估LLM隐式沟通能力,发现其在情感表达上表现良好,但在社会语言学信号上不如人类。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06008 2026-02-06 cs.AI cs.LG 62%

AgenticPay: A Multi-Agent LLM Negotiation System for Buyer-Seller Transactions

AgenticPay: 一种基于多智能体LLM的买方卖方交易谈判系统

Xianyang Liu, Shangding Gu, Dawn Song

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AgenticPay是一种基于多智能体LLM的买方卖方交易谈判系统,通过自然语言驱动的多轮谈判解决市场交易问题,评估智能体在经济互动中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05874 2026-02-06 cs.CL cs.AI 62%

xList-Hate: A Checklist-Based Framework for Interpretable and Generalizable Hate Speech Detection

xList-Hate: 一个基于检查表的框架用于可解释且可推广的仇恨言论检测

Adrián Girón, Pablo Miralles, Javier Huertas-Tato, Sergio D'Antonio, David Camacho

机构 * Universidad Politécnica de Madrid(马德里理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 xList-Hate通过基于检查表的诊断框架,提升仇恨言论检测的可解释性和跨领域鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05515 2026-02-06 cs.AI cs.CL 62%

A Unified Multimodal Framework for Dataset Construction and Model-Based Diagnosis of Ameloblastoma

一种统一的多模态框架用于数据集构建和基于模型的ameloblastoma诊断

Ajo Babu George, Anna Mariam John, Athul Anoop, Balu Bhasuran

机构 * DiceMed School of Sciences (SOS), Indira Gandhi National Open University(印度甘地国家开放大学科学学院) School of Information, Florida State University(佛罗里达州立大学信息学院)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种统一的多模态框架,用于构建ameloblastoma数据集并开发基于模型的诊断方法,通过多模态深度学习模型提高分类和手术规划的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04944 2026-02-06 eess.IV cs.AI cs.LG 62%

Smart Diagnosis and Early Intervention in PCOS: A Deep Learning Approach to Women's Reproductive Health

PCOS的智能诊断与早期干预:一种深度学习方法用于女性生殖健康

Shayan Abrar, Samura Rahman, Ishrat Jahan Momo, Mahjabin Tasnim Samiha, B. M. Shahria Alam, Mohammad Tahmid Noor, Nishat Tasnim Niloy

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于深度学习的PCOS卵巢超声图像分类系统,利用迁移学习和增强策略实现高准确率的自动诊断,提升医疗图像分析的透明度和实用性。

Comments 6 pages, 12 figures. This is the author's accepted manuscript of a paper accepted for publication in the Proceedings of the 16th International IEEE Conference on Computing, Communication and Networking Technologies (ICCCNT 2025). The final published version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04197 2026-02-05 cs.CL cs.AI 62%

From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents

从有益到有毒的主动性:诊断LLM代理的行为不一致

Xinyue Wang, Yuanhe Zhang, Zhengshuo Gong, Haoran Gao, Fanyu Meng, Zhenhong Zhou, Li Sun, Yang Liu, Sen Su

机构 * Beijing University of Posts(北京邮电大学) China Mobile Research Institute(中国移动研究院) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM代理在权衡有益与无害时产生的有毒主动性行为,提出了一种基于双模型互动的评估框架,并通过实验揭示了该现象的普遍性及两种主要趋势。

Comments 9 pages (excluding appendices), 6 figures. Code is available at https://github.com/wxyoio-0715/Toxic-Proactivity

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11655 2026-02-05 cs.CL cs.AI 62%

Explainable Sentiment Analysis with DeepSeek-R1: Performance, Efficiency, and Few-Shot Learning

基于DeepSeek-R1的可解释情感分析:性能、效率与少样本学习

Donghao Huang, Zhaoxia Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于DeepSeek-R1的可解释情感分析方法,展示了其在性能、效率和少样本学习方面的优势,证明其在情感分析任务中的高效与可解释性。

Comments 10 pages, with 2 figures and 6 tables, accepted for publication in an IEEE Intelligent Systems journal

Journal ref IEEE Intelligent Systems, vol. 40, no. 6, pp. 52-63, Nov.-Dec. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03633 2026-02-04 cs.CL cs.AI cs.DB 62%

BIRDTurk: Adaptation of the BIRD Text-to-SQL Dataset to Turkish

BIRDTurk: BIRD文本到SQL数据集对土耳其语的适应

Burak Aktaş, Mehmet Can Baytekin, Süha Kağan Köse, Ömer İlbilgi, Elif Özge Yılmaz, Çağrı Toraman, Bilge Kaan Görür

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 BIRDTurk是首个将BIRD文本到SQL基准适应到土耳其语的数据集,通过受控翻译流程保持SQL逻辑结构,评估了代理推理和监督微调在土耳其语中的表现,揭示了语言差异对性能的影响。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07020 2026-02-04 cs.CL cs.AI 62%

TurkBench: A Benchmark for Evaluating Turkish Large Language Models

TurkBench:评估土耳其大型语言模型的基准测试

Çağrı Toraman, Ahmet Kaan Sever, Ayse Aysu Cengiz, Elif Ecem Arslan, Görkem Sevinç, Mete Mert Birdal, Yusuf Faruk Güldemir, Ali Buğra Kanburoğlu, Sezen Felekoğlu, Osman Gürlek, Sarp Kantar, Birsen Şahin Kütük, Büşra Tufan, Elif Genç, Serkan Coşkun, Gupse Ekin Demir, Muhammed Emin Arayıcı, Olgun Dursun, Onur Gungor, Susan Üsküdarlı, Abdullah Topraksoy, Esra Darıcı

机构 * Computer Sci. Dpt., Bilkent Uni.(计算机科学系,比尔肯特大学) Mathematics Dpt., Middle East Technical University(数学系,中东部技术大学) Turkcell AI(Turkcell人工智能) Sociology Dpt., Hacettepe University(社会学系,哈恰塔尔佩大学) Computer Engineering Dpt., Bogazici University(计算机工程系,博资基大学) Linguistics Dpt., Istanbul University(语言学系,伊斯坦布尔大学) Turkish Lang. Dpt., Middle East Technical University(土耳其语言系,中东部技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 TurkBench是一个用于评估土耳其大型语言模型能力的综合基准测试,包含21个子任务和6大类别,旨在帮助研究人员改进模型性能。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02386 2026-02-03 cs.AI cs.IR cs.LG 62%

Trust by Design: Skill Profiles for Transparent, Cost-Aware LLM Routing

信任由设计:基于技能配置的透明、成本感知的LLM路由

Mika Okamoto, Ansel Kaplan Erol, Glenn Matlin

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 BELLA框架通过基于技能的可解释方法,为LLM路由提供透明、成本感知的最优模型选择方案,帮助从业者在性能与成本间做出合理权衡。

Comments Appeared at MLSys YPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏