arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-27 至 2026-02-27 共收录 213 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 22 篇

2504.01445 2026-02-27 cs.AI 77%

Compositional-ARC: Assessing Systematic Generalization in Abstract Spatial Reasoning

Compositional-ARC: 评估抽象空间推理中的系统泛化能力

Philipp Mondorf, Shijia Zhou, Monica Riedler, Barbara Plank

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过元学习方法在抽象空间推理领域实现系统泛化,展示了一个小型模型在组合变换任务上的优越表现。

Comments ICLR 2026, 37 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22296 2026-02-27 cs.LG cs.AI 73%

UpSkill: Mutual Information Skill Learning for Structured Response Diversity in LLMs

UpSkill: 为大语言模型的结构化响应多样性进行互信息技能学习

Devan Shah, Owen Yang, Daniel Yang, Chongyi Zheng, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 UpSkill通过互信息技能学习提升大语言模型在结构化响应多样性中的表现,提高pass@k准确性而不影响pass@1。

Comments First two authors equal contribution. 29 pages total (11 pages main text), 10 figures, 10 tables. Project website: https://dshah.io/upskill/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22808 2026-02-27 cs.AI 70%

MiroFlow: Towards High-Performance and Robust Open-Source Agent Framework for General Deep Research Tasks

MiroFlow:面向通用深度研究任务的高性能和鲁棒开源代理框架

Shiqian Su, Sen Xing, Xuan Dong, Muyan Zhong, Bin Wang, Xizhou Zhu, Yuntao Chen, Wenhai Wang, Yue Deng, Pengxiang Zhu, Ziyuan Liu, Tiantong Li, Jiaheng Yu, Zhe Chen, Lidong Bing, Jifeng Dai

机构 * Tsinghua University(清华大学) MiroMind AI National University of Singapore(新加坡国立大学) Nanjing University(南京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MiroFlow是一种面向通用深度研究任务的高性能开源代理框架,通过灵活的工作流编排和深度推理模式提升性能和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17072 2026-02-27 cs.CL 70%

BankMathBench: A Benchmark for Numerical Reasoning in Banking Scenarios

BankMathBench: 一个用于银行场景数值推理的基准测试

Yunseung Lee, Subin Kim, Youngjun Kwak, Jaegul Choo

机构 * KakaoBank Corp.(Kakao银行公司) Korea Advanced Institute of Science(韩国先进科学研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 BankMathBench是一个专门针对银行场景的数值推理基准测试,通过多难度层级的任务设计提升LLMs在金融计算中的准确性和推理能力。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22624 2026-02-27 cs.CV cs.AI 70%

Instruction-based Image Editing with Planning, Reasoning, and Generation

基于指令的图像编辑与规划、推理和生成

Liya Ji, Chenyang Qi, Qifeng Chen

机构 * HKUST(香港科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种多模态模型,通过链式思考规划、编辑区域推理和编辑,提升基于指令的图像编辑能力,以应对更复杂的真实场景。

Comments 10 pages, 7 figures

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision, 2025, Page 17506--17515

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22278 2026-02-27 cs.IR cs.LG 70%

RETLLM: Training and Data-Free MLLMs for Multimodal Information Retrieval

RETLLM: 无需训练和数据的多模态信息检索中的大规模语言模型训练

Dawei Su, Dongsheng Wang

机构 * College of Computer Science Software Engineering \ University, Shenzhen, China

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 RetLLM通过无需训练和数据的框架,利用MLLMs的多模态推理能力提升多模态信息检索性能。

Comments 5 pages, 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18582 2026-02-27 cs.CL 70%

Parallel Continuous Chain-of-Thought with Jacobi Iteration

并行连续链式思维与雅可比迭代

Haoyi Wu, Zhihao Teng, Kewei Tu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PCCoT,通过雅可比迭代提升连续链式思维的训练和推理效率,实现更快的训练速度和更稳定的性能。

Comments Accepted to EMNLP 2025 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21743 2026-02-27 cs.CV 67%

Enhancing Multi-Modal LLMs Reasoning via Difficulty-Aware Group Normalization

通过难度感知分组归一化增强多模态大语言模型推理

Jinghan Li, Junfeng Fang, Jinda Lu, Yuan Wang, Xiaoyan Guo, Tianyu Zhang, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出难度感知分组归一化方法,通过感知复杂度和推理不确定性表征样本,提升多模态大语言模型的推理稳定性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23351 2026-02-27 cs.CL cs.CV 57%

Scale Can't Overcome Pragmatics: The Impact of Reporting Bias on Vision-Language Reasoning

规模无法克服语用学:报告偏差对视觉-语言推理的影响

Amita Kamath, Jack Hessel, Khyathi Chandu, Jena D. Hwang, Kai-Wei Chang, Ranjay Krishna

机构 * University of Washington(华盛顿大学) University of California, Los Angeles(加州大学洛杉矶分校) Samaya AI(Samaya人工智能) Mistral AI(Mistral人工智能) Allen Institute for AI(人工智能研究所)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文指出视觉-语言模型在推理能力上的不足源于训练数据中的报告偏差,通过实验表明单纯扩大数据规模无法提升推理技能,但专门收集隐含信息的注释能有效改善模型表现。

Comments TACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22260 2026-02-27 cs.LG cs.NE 57%

Code World Models for Parameter Control in Evolutionary Algorithms

用于进化算法参数控制的代码世界模型

Camilo Chacón Sartori, Guillem Rodríguez Corominas

机构 * ICN2 -- Catalan Institute of Nanoscience Nanotechnology, Barcelona, Spain Artificial Intelligence Research Institute (IIIA-CSIC), Barcelona, Spain Universitat Polit\` e cnica de Catalunya (UPC), Barcelona, Spain

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

AI总结 本文提出利用代码世界模型进行进化算法参数控制,通过模拟器实现高效突变强度选择,在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18897 2026-02-27 cs.CV 50%

Thinking Beyond Labels: Vocabulary-Free Fine-Grained Recognition using Reasoning-Augmented LMMs

超越标签:基于推理增强的LMMs的无词汇细粒度识别

Dmitry Demidov, Zaigham Zaheer, Zongyan Han, Omkar Thawakar, Rao Anwer

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 FiNDR通过推理增强的LMMs实现无词汇细粒度识别,提出三步流程生成候选标签、过滤排名并构建轻量级分类器,取得显著性能提升。

Journal ref CVPR 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 45 篇

2512.06660 2026-02-27 cs.CR cs.AI 91%

Towards Small Language Models for Security Query Generation in SOC Workflows

面向SOC工作流中安全查询生成的小语言模型

Saleha Muzammil, Rahul Reddy, Vishal Kamalakrishnan, Hadi Ahmadi, Wajih Ul Hassan

机构 * University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract);SLM(abstract)

AI总结 本文提出一个三调节框架,利用小型语言模型实现高效、低成本的安全查询生成,实验表明其在语法和语义准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17287 2026-02-27 cs.AI 89%

LLM4AD: A Platform for Algorithm Design with Large Language Model

LLM4AD:基于大语言模型的算法设计平台

Fei Liu, Rui Zhang, Zhuoliang Xie, Rui Sun, Kai Li, Qinglong Hu, Ping Guo, Xi Lin, Xialiang Tong, Mingxuan Yuan, Zhenkun Wang, Zhichao Lu, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学) Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 LLM4AD是一个基于大语言模型的统一平台,旨在通过模块化框架支持多领域算法设计,并提供全面的资源和评估工具促进相关研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22500 2026-02-27 cs.AI 89%

Mapping the Landscape of Artificial Intelligence in Life Cycle Assessment Using Large Language Models

利用大语言模型映射人工智能在生命周期评估中的景观

Anastasija Mensikova, Donna M. Rizzo, Kathryn Hinkelman

机构 * University of Vermont(佛蒙特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究利用大语言模型对人工智能在生命周期评估中的应用进行综合分析,揭示了AI技术在LCA中的发展趋势和未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06939 2026-02-27 cs.SE 89%

FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks

FeedbackEval: 一个用于评估大型语言模型在反馈驱动的代码修复任务中的基准

Dekun Dai, MingWei Liu, Anji Li, Jialun Cao, Yanlin Wang, Chong Wang, Xin Peng, Zibin Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 FeedbackEval通过系统性基准评估LLMs在反馈驱动的代码修复任务中的表现,揭示了不同反馈类型和提示结构对修复效果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22790 2026-02-27 cs.CL cs.AI 88%

Natural Language Declarative Prompting (NLD-P): A Modular Governance Method for Prompt Design Under Model Drift

自然语言声明式提示(NLD-P):一种模块化治理方法,用于在模型漂移下的提示设计

Hyunwoo Kim, Hanau Yi, Jaehee Bae, Yumin Kim

机构 * ddai Inc.(ddai公司)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出NLD-P作为模块化治理方法,通过自然语言声明式提示解决模型漂移下的提示设计问题,提供可解释的控制框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22523 2026-02-27 cs.AI cs.CL q-bio.NC 88%

Cognitive Models and AI Algorithms Provide Templates for Designing Language Agents

认知模型和AI算法为设计语言代理提供模板

Ryan Liu, Dilip Arumugam, Cedegao E. Zhang, Sean Escola, Xaq Pitkow, Thomas L. Griffiths

机构 * Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) Zuckerman Mind Brain Behavior Institute(祖克曼心智大脑行为研究所) Department of Psychiatry, Columbia University(哥伦比亚大学精神医学系) Neuroscience Institute(神经科学研究所) Department of Machine Learning, Carnegie Mellon University(卡内基梅隆大学机器学习系) Department of Psychology, Princeton University(普林斯顿大学心理学系)

专题命中 评测与基准 :language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用认知模型和AI算法设计语言代理的模板,旨在开发更有效且可解释的语言代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22724 2026-02-27 cs.CR cs.AI 85%

AgentSentry: Mitigating Indirect Prompt Injection in LLM Agents via Temporal Causal Diagnostics and Context Purification

AgentSentry: 通过时间因果诊断和上下文净化缓解LLM代理中的间接提示注入

Tian Zhang, Yiwei Xu, Juan Wang, Keyan Guo, Xiaoyang Xu, Bowen Xiao, Quanlong Guan, Jinlin Fan, Jiawei Liu, Zhiquan Liu, Hongxin Hu

机构 * Key Laboratory of Aerospace Information Security and Trusted Computing, Ministry of Education, School of Cyber Science and Engineering, Wuhan University(航空信息安全与可信计算重点实验室、教育部、网络安全科学与工程学院、武汉大学) Department of Computer Science and Engineering, University at Buffalo, SUNY(计算机科学与工程系、布法罗大学、纽约州立大学) Department of Computer Science, College of Information Science and Technology, Jinan University(计算机科学系、信息科学与技术学院、济南大学) College of Cyber Security, Jinan University(网络安全学院、济南大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentSentry通过时间因果诊断和上下文净化缓解LLM代理中的间接提示注入,有效消除攻击并保持实用性。

Comments 23 pages, 8 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08254 2026-02-27 cs.SE cs.AI 85%

Toward Automated Validation of Language Model Synthesized Test Cases using Semantic Entropy

迈向利用语义熵自动验证语言模型合成测试用例

Hamed Taherkhani, Jiho Shin, Muhammad Ammar Tahir, Md Rakib Hossain Misu, Vineet Sunil Gattani, Hadi Hemmati

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出VALTEST框架,利用语义熵自动验证LLM生成的测试用例,提升测试有效性与代码生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22299 2026-02-27 cs.MM cs.AI cs.CL cs.LG 85%

Decoding the Hook: A Multimodal LLM Framework for Analyzing the Hooking Period of Video Ads

解码钩子:一种多模态大语言模型框架用于分析视频广告的钩子阶段

Kunpeng Zhang, Poppy Zhang, Shawndra Hill, Amel Awadelkarim

机构 * University of Marland, College Park(马里兰大学 College Park分校) Meta Platforms, Inc.(Meta平台公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出一种多模态大语言模型框架,用于分析视频广告的钩子阶段,通过多策略采样和主题提炼提升广告初期效果分析的准确性与实用性。

Comments 11 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08491 2026-02-27 cs.CL 83%

A Third Paradigm for LLM Evaluation: Dialogue Game-Based Evaluation using clembench

大语言模型评估的第三种范式:基于对话游戏的评估方法clembench

David Schlangen, Sherzod Hakimov, Chalamalasetti Kranti, Jonathan Jordan, Philipp Sadler

机构 * Computational Linguistics, University of Potsdam(计算语言学,波恩大学) DFKI (German Research Center for AI)(德意志人工智能研究中心)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 clembench提出了一种基于对话游戏的评估方法,结合了传统评估方法的优点,提供可控、可重复的多轮交互测试,用于大语言模型的评估。

Comments All code required to run the benchmark, as well as extensive documentation, is available at https://github.com/clembench/clembench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22661 2026-02-27 cs.CL cs.AI cs.LG 82%

dLLM: Simple Diffusion Language Modeling

dLLM:简单的扩散语言建模

Zhanhui Zhou, Lingjie Chen, Hanghang Tong, Dawn Song

机构 * UC Berkeley(伯克利大学) UIUC(伊利诺伊大学香槟分校)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 dLLM提供了一个统一的开源框架,用于标准化和灵活扩展扩散语言建模的核心组件,同时提供可重现的食谱以加速小型DLMs的研究与开发。

Comments Code available at: https://github.com/ZHZisZZ/dllm

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25726 2026-02-27 cs.CL cs.AI 81%

The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

工具十项全能:评估语言代理在多样化、真实和长周期任务执行中的基准测试

Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xingyao Wang, Xiang Yue, Shuyan Zhou, Graham Neubig, Junxian He

专题命中 评测与基准 :language agent(title,abstract);分类 cs.CL、cs.AI

AI总结 工具十项全能提出了一种新的语言代理基准测试,通过多样化的真实任务和工具评估代理在复杂长周期任务中的表现。

Comments ICLR 2026, Website: https://toolathlon.xyz/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22678 2026-02-27 cs.CV cs.AI 79%

ViCLIP-OT: The First Foundation Vision-Language Model for Vietnamese Image-Text Retrieval with Optimal Transport

ViCLIP-OT:首个面向越南语图像-文本检索的视觉-语言基础模型,结合最优传输

Quoc-Khang Tran, Minh-Thien Nguyen, Nguyen-Khang Pham

机构 * Can Tho University(金兰大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 ViCLIP-OT通过整合CLIP对比学习与SIGROT损失,提升越南语图像-文本检索性能,实现域内和零样本设置下的显著改进。

Comments Preprint submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22246 2026-02-27 cs.CR cs.LG 79%

Self-Purification Mitigates Backdoors in Multimodal Diffusion Language Models

自净化缓解多模态扩散语言模型中的后门

Guangnian Wan, Qi Li, Gongfan Fang, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 DiSP通过在推理过程中选择性屏蔽视觉标记,有效去除多模态扩散语言模型中的后门,无需额外模型或干净数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19680 2026-02-27 cs.HC cs.AI 79%

PolicyPad: Collaborative Prototyping of LLM Policies

PolicyPad: LLM策略协同原型设计

K. J. Kevin Feng, Tzu-Sheng Kuo, Quan Ze Chen, Inyoung Cheong, Kenneth Holstein, Amy X. Zhang

机构 * University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 PolicyPad通过结合用户体验原型设计方法,为LLM策略协作设计提供交互式支持,提升政策制定的协作效率与反馈质量。

Comments CHI 2026 paper. Supplementary materials: https://docs.google.com/document/d/1jBmKXusoWmCHfwpmNhSTJtbwZ5fwVWLNppKeqqd_-pY/edit?usp=sharing

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08781 2026-02-27 cs.AI cs.CL 79%

Evaluating the Evaluator: Measuring LLMs' Adherence to Task Evaluation Instructions

评估评估者:衡量LLMs对任务评估指令的遵守情况

Bhuvanashree Murugadoss, Christian Poelitz, Ian Drosos, Vu Le, Nick McKenna, Carina Suzana Negreanu, Chris Parnin, Advait Sarkar

专题命中 评测与基准 :LLM(abstract);RLHF(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLMs在任务评估中的表现,发现提示对评估结果影响有限,困惑度有时比提示更符合人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16800 2026-02-27 cs.CR cs.AI cs.LG 79%

Large-scale online deanonymization with LLMs

大规模在线去匿名化与LLMs

Simon Lermen, Daniel Paleka, Joshua Swanson, Michael Aerni, Nicholas Carlini, Florian Tramèr

机构 * MATS ETH Zurich(苏黎世联邦理工学院) Anthropic

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 利用LLMs实现大规模在线去匿名化,通过提取身份特征、语义嵌入搜索和推理验证,显著提升召回率和精度,挑战现有隐私保护机制。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22764 2026-02-27 cs.SE 78%

Evaluating and Improving Automated Repository-Level Rust Issue Resolution with LLM-based Agents

评估和改进基于LLM代理的仓库级Rust问题解决

Jiahong Xiang, Wenxiao He, Xihua Wang, Hongliang Tian, Yuqun Zhang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本研究提出RUSTFORGER,通过集成自动化测试环境与动态跟踪策略,有效提升Rust问题解决效率,解决率达28.6%。

Comments Accepted to the 48th International Conference on Software Engineering (ICSE 2026)

Journal ref 2026 IEEE/ACM 48th International Conference on Software Engineering (ICSE '26), April 12--18, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23199 2026-02-27 cs.AI 77%

SC-Arena: A Natural Language Benchmark for Single-Cell Reasoning with Knowledge-Augmented Evaluation

SC-Arena: 一种用于具有知识增强评估的单细胞推理的自然语言基准

Jiahao Zhao, Feng Jiang, Shaowei Qin, Zhonghui Zhang, Junhao Liu, Guibing Guo, Hamid Alinejad-Rokny, Min Yang

机构 * Software College, Northeastern University(东北大学软件学院) Shenzhen University of Advanced Technology(深圳大学先进技术学院) Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) University of California, Irvine(加州大学 Irvine 分校) School of Biomedical Engineering, UNSW Sydney(悉尼大学生物医学工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 SC-Arena通过知识增强评估框架,为单细胞生物学中的LLM提供统一且可解释的评估方法,提升生物正确性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏