arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-03 至 2026-03-03 共收录 599 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 110 篇

2506.18110 2026-03-03 cs.LG cs.AI 62%

RL for Reasoning by Adaptively Revealing Rationales

通过自适应揭示理由进行强化学习

Mohammad Hossein Amani, Aryo Lotfi, Nicolas Mario Baldwin, Samy Bengio, Mehrdad Farajtabar, Emmanuel Abbe, Robert West

专题命中 推理与问题求解 :SFT(abstract);分类 cs.AI、cs.LG

AI总结 AdaBack通过自适应揭示部分推理步骤,有效解决长序列依赖任务,超越传统SFT和RL的局限。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18116 2026-03-03 cs.LG cs.CL 62%

NFT: Bridging Supervised Learning and Reinforcement Learning in Math Reasoning

NFT:在数学推理中连接监督学习与强化学习

Huayu Chen, Kaiwen Zheng, Qinsheng Zhang, Ganqu Cui, Lifan Yuan, Yin Cui, Haotian Ye, Tsung-Yi Lin, Ming-Yu Liu, Jun Zhu, Haoxiang Wang

机构 * Tsinghua(清华大学) NVIDIA UIUC(伊利诺伊大学香槟分校) Stanford(斯坦福大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 NFT通过监督学习方法实现LLM自主改进,无需外部教师,在数学推理任务中超越传统RL算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10045 2026-03-03 cs.RO cs.AI cs.LG 62%

Neuro-Symbolic Skill Discovery for Conditional Multi-Level Planning

神经符号技能发现用于条件多级规划

Hakan Aktas, Yigit Yildirim, Ahmet Firat Gamsiz, Deniz Bilge Akkoc, Erhan Oztop, Emre Ugur

机构 * Department of Computer Science and Technology The University of Cambridge(计算机科学与技术系 剑桥大学) Department of Computer Engineering Bogazici University(计算机工程系 boazici大学) SISREC Osaka University(Osaka大学SISREC)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种神经符号学习架构,通过少量演示获取可推广的高级符号技能,并在多级规划中实现复杂任务的执行。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00578 2026-03-03 cs.AI cs.CL 62%

Draft-Thinking: Learning Efficient Reasoning in Long Chain-of-Thought LLMs

草稿式推理:在长链式推理LLM中学习高效推理

Jie Cao, Tianwei Lin, Zhenxuan Fan, Bo Yuan, Ziyuan Zhao, Rolan Yan, Wenqiao Zhang, Siliang Tang

机构 * Zhejiang University(浙江大学) Tencent(腾讯)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 Draft-Thinking通过草稿式推理结构和渐进式课程学习,在长链式推理LLM中实现高效推理,显著降低推理预算并保持性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02555 2026-03-03 cs.LG cs.AI 62%

Learning to Explore with Parameter-Space Noise: A Deep Dive into Parameter-Space Noise for Reinforcement Learning with Verifiable Rewards

通过参数空间噪声学习探索:深入研究可验证奖励的强化学习

Bizhe Bai, Xinyue Wang, Peng Ye, Tao Chen

机构 * Shanghai Innovation Institute, Shanghai, China(上海创新研究院) College of Future Information Technology, Fudan University, Shanghai, China(未来信息科技学院,复旦大学) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室) The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 通过参数空间噪声提升探索能力,PSN-GRPO在多个基准中提升推理能力并超越传统探索方法。

Comments 17 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01425 2026-03-03 cs.CL cs.IR 57%

LaSER: Internalizing Explicit Reasoning into Latent Space for Dense Retrieval

LaSER: 将显式推理内化到潜在空间以实现密集检索

Jiajie Jin, Yanzhao Zhang, Mingxin Li, Dingkun Long, Pengjun Xie, Yutao Zhu, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高陵人工智能学院) Tongyi Lab, Alibaba Group(阿里集团通义实验室)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 LaSER通过将显式推理内化到潜在空间,提升密集检索性能,结合推理深度与推理效率。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01190 2026-03-03 cs.CL 57%

Reasoning or Rationalization? The Role of Justifications in Masked Diffusion Models for Fact Verification

推理还是合理化?在事实验证中的掩码扩散模型中合理化的作用

Jacob Devasier

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 研究发现,掩码扩散模型在事实验证中,早期结论易受合理化过程影响,导致准确性下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01170 2026-03-03 cs.CR cs.AI 57%

ATLAS: AI-Assisted Threat-to-Assertion Learning for System-on-Chip Security Verification

ATLAS:基于人工智能的威胁到断言学习用于片上系统安全验证

Ishraq Tashdid, Kimia Tasnia, Alexander Garcia, Jonathan Valamehr, Sazadur Rahman

机构 * Department of Electrical and Computer Engineering, University of Central Florida(电子与计算机工程系,中央佛罗里达大学) Intel Corporation(英特尔公司)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 ATLAS通过结合人工智能和形式验证技术,实现了基于漏洞知识的自动化SoC安全验证,提高了安全设计的可靠性。

Comments Accepted at the 63rd Design Automation Conference (DAC 2026), Long Beach, CA, USA (July, 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00476 2026-03-03 cs.CR cs.AI 57%

Atomicity for Agents: Exposing, Exploiting, and Mitigating TOCTOU Vulnerabilities in Browser-Use Agents

代理的原子性:揭示、利用和缓解浏览器使用代理中的TOCTOU漏洞

Linxi Jiang, Zhijie Liu, Haotian Luo, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文研究了浏览器使用代理中的TOCTOU漏洞,通过实证研究揭示其普遍存在性,并提出基于预执行验证的轻量级缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00306 2026-03-03 cs.LG 57%

When does Chain-of-Thought Help: A Markovian Perspective

当链式思维帮助何时:马尔可夫视角

Zihan Wang, Yijun Dong, Qi Lei

机构 * New York University(纽约大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.LG

AI总结 本文从马尔可夫视角分析了链式思维在不同任务中的有效性,揭示了转移对齐性是决定CoT效果的关键因素,并通过合成基准验证了理论预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15332 2026-03-03 cs.LG 57%

Directional Reasoning Trajectory Change (DRTC): Identifying Critical Trace Segments in Reasoning Models

方向性推理轨迹变化(DRTC):在推理模型中识别关键轨迹段

Waldemar Chang

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 DRTC通过过程因果方法识别推理模型中的关键轨迹段,揭示特定上下文元素如何引导推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11909 2026-03-03 cs.SD cs.LG 57%

Echo: Towards Advanced Audio Comprehension via Audio-Interleaved Reasoning

Echo:通过音频交错推理实现高级音频理解

Daiqing Wu, Xuan Zhang, Dongbao Yang, Jiashu Yao, Longfei Chen, Qingsong Liu, Sicheng Zhao, Can Ma, Yangyang Kang, Yu Zhou

机构 * IIE, Chinese Academy of Sciences(中国科学院信息工程研究所) Zhejiang University(浙江大学) ByteDance China(字节跳动中国) VCIP & TMCC & DISSec, College of Computer Science, Nankai University(VCIP与TMCC与DISSec,南开大学计算机学院) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 Echo通过音频交错推理方法,提升音频理解能力,在基准测试中表现出色。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06292 2026-03-03 cs.CV cs.AI 57%

ChainMPQ: Interleaved Text-Image Reasoning Chains for Mitigating Relation Hallucinations

ChainMPQ: 交错文本图像推理链用于缓解关系幻觉

Yike Wu, Yiwei Wang, Yujun Cai

机构 * University of Queensland(昆士兰大学) University of California, Merced(加州大学梅尔德分校) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 ChainMPQ通过交错文本和图像推理链,利用积累的记忆减少大型视觉语言模型的关系幻觉,提升关系推理能力。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25390 2026-03-03 cs.CV cs.AI 57%

SpinBench: Perspective and Rotation as a Lens on Spatial Reasoning in VLMs

SpinBench:通过视角与旋转透视视角在视觉语言模型中的空间推理

Yuyou Zhang, Radu Corcodel, Chiori Hori, Anoop Cherian, Ding Zhao

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 SpinBench通过视角与旋转视角评估视觉语言模型的空间推理能力,揭示其在视角转换任务中的系统性弱点及改进潜力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24378 2026-03-03 cs.AI 57%

ACPBench Hard: Unrestrained Reasoning about Action, Change, and Planning

ACPBench Hard: 关于行动、变化和规划的无约束推理

Harsha Kokel, Michael Katz, Kavitha Srinivas, Shirin Sohrabi

机构 * IBM Research San Jose(IBM桑 Jose 研究所) IBM Thomas J. Watson Research Center(IBM 托马斯·J·沃森研究中心)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 ACPBench Hard通过开放性问题测试模型在行动、变化和规划上的推理能力,发现现有模型在复杂任务上表现有限。

Comments Accepted at Proceedings of the Fourteenth International Conference on Learning Representations (ICLR 2026), see https://openreview.net/forum?id=WIXohR7mEo

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04201 2026-03-03 cs.CV 50%

SToLa: Self-Adaptive Touch-Language Framework with Tactile Commonsense Reasoning in Open-Ended Scenarios

SToLa:具有触觉常识推理的自适应触觉-语言框架在开放性场景中

Ning Cheng, Jinan Xu, Jialing Chen, Bin Fang, Wenjuan Han

专题命中 推理与问题求解 :language model(abstract)

AI总结 SToLa通过专家混合架构实现触觉与语言模态的自适应统一,解决开放性场景中触觉常识推理的挑战,提升多模态推理性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09285 2026-03-03 cs.CV 50%

Spotlight on Token Perception for Multimodal Reinforcement Learning

多模态强化学习中的token感知聚焦

Siyuan Huang, Xiaoye Qu, Yafu Li, Yun Luo, Zefeng He, Daizong Liu, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Wuhan University(武汉大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出VPPO算法,通过token感知优化提升多模态强化学习的视觉推理能力。

Comments Accepted by ICLR 2026, project page: https://github.com/huaixuheqing/VPPO-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00926 2026-03-03 cs.RO 50%

DAM-VLA: A Dynamic Action Model-Based Vision-Language-Action Framework for Robot Manipulation

DAM-VLA:一种基于动态动作模型的视觉-语言-动作框架,用于机器人操作

Xiongfeng Peng, Jiaqian Yu, Dingzhe Li, Yixiang Jin, Lu Xu, Yamin Mao, Chao Zhang, Weiming Li, Sujin Jang, Dongwook Lee, Daehyun Ji

机构 * Advanced Research Lab, Samsung R&D Institute China-Beijing (SRCB)(三星研发中心中国北京先进研究实验室) Samsung AI Center, DS Division(三星人工智能中心,DS部门) Hanyang University ERICA(翰洋大学ERICA)

专题命中 推理与问题求解 :language model(abstract)

AI总结 DAM-VLA提出了一种基于动态动作模型的视觉-语言-动作框架,通过整合视觉语言模型与扩散动作模型,提升机器人在复杂任务中的操作精度和适应性。

Comments Accepted to ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00913 2026-03-03 cs.RO 50%

Minimalist Compliance Control

极简合规控制

Haochen Shi, Songbo Hu, Yifan Hou, Weizhuo Wang, Karen Liu, Shuran Song

专题命中 推理与问题求解 :language model(abstract)

AI总结 极简合规控制通过仅使用电机电流或电压信号实现无需力传感器的合规控制,适用于多种机器人和规划方法。

Comments Project website: https://minimalist-compliance-control.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17371 2026-03-03 cs.SE 50%

GraphCue for SDN Configuration Code Synthesis

基于图的SDN配置代码合成

Haomin Qi, Fengfei Yu, Chengbo Huang

专题命中 推理与问题求解 :prompting(abstract)

AI总结 GraphCue通过拓扑感知检索和约束条件生成,实现了SDN配置代码合成的高通过率和高效验证。

Comments 2 pages, 2 figures

Journal ref IEEE Consumer Communications & Networking Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 124 篇

2603.01343 2026-03-03 cs.CL cs.AI 90%

PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology

PanCanBench: 用于评估大型语言模型在胰腺肿瘤学中的综合基准

Yimin Zhao, Sheela R. Damle, Simone E. Dekker, Scott Geng, Karly Williams Silva, Jesse J Hubbard, Manuel F Fernandez, Fatima Zelada-Arenas, Alejandra Alvarez, Brianne Flores, Alexis Rodriguez, Stephen Salerno, Carrie Wright, Zihao Wang, Pang Wei Koh, Jeffrey T. Leek

机构 * Department of Biostatistics, University of Washington(华盛顿大学生物统计学系) Clinical Research Division, Fred Hutch Cancer Center(Fred Hutch癌症中心临床研究部) Division of Hematology and Oncology, Department of Medicine, University of Washington(华盛顿大学医学系血液学与肿瘤学分会) Allen Institute for AI(Allen人工智能研究所) Department of Computer Science and Engineering, University of Washington(华盛顿大学计算机科学与工程系) Public Health Sciences, Biostatistics, Fred Hutchinson Cancer Center(Fred Hutchinson癌症中心公共卫生科学与生物统计学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 PanCanBench通过评估22种LLM在胰腺肿瘤学问题上的表现,揭示了模型在事实准确性、临床完整性和网络搜索整合方面的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01952 2026-03-03 cs.AI 89%

LiveCultureBench: a Multi-Agent, Multi-Cultural Benchmark for Large Language Models in Dynamic Social Simulations

LiveCultureBench: 一种多智能体、多文化的大型语言模型动态社会模拟基准

Viet-Thanh Pham, Lizhen Qu, Thuy-Trang Vu, Gholamreza Haffari, Dinh Phung

机构 * Department of Data Science & AI, Monash University(数据科学与人工智能系,墨尔本大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 LiveCultureBench通过模拟动态社会环境,评估大型语言模型在文化规范遵守与任务完成之间的平衡,研究其跨文化鲁棒性和评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02045 2026-03-03 cs.CL 89%

Harnessing Temporal Databases for Systematic Evaluation of Factual Time-Sensitive Question-Answering in Large Language Models

利用时间数据库对大语言模型中的事实时间敏感问答进行系统评估

Soyeon Kim, Jindong Wang, Xing Xie, Steven Euijong Whang

机构 * KAIST(韩国科学技术院) William & Mary(威廉与玛丽学院) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 TDBench通过时间数据库技术系统构建TSQA对,引入时间准确性指标,实现大语言模型时间敏感问答的可扩展和全面评估。

Comments Published in Proceedings of the 14th International Conference on Learning Representations (ICLR), 2026. Code and data are publicly available at: https://github.com/ssoy0701/tdbench.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07644 2026-03-03 cs.AI 89%

SymGPT: Auditing Smart Contracts via Combining Symbolic Execution with Large Language Models

SymGPT:通过结合符号执行与大语言模型审计智能合约

Shihao Xia, Mengting He, Shuai Shao, Tingting Yu, Yiying Zhang, Nobuko Yoshida, Linhai Song

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Connecticut(康涅狄格大学) University of California San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学) SKLP, Institute of Computing Technology, Chinese Academy of Sciences(SKLP,计算技术研究所,中国科学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 SymGPT结合符号执行与大语言模型,自动检测智能合约的ERC规则违规,识别出大量潜在安全漏洞。

Comments 34 pages. arXiv admin note: text overlap with arXiv:2404.04306

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06361 2026-03-03 q-fin.TR cs.CL 89%

Large Language Model Agent in Financial Trading: A Survey

金融交易中的大语言模型代理:综述

Han Ding, Yinheng Li, Junhao Wang, Hang Chen, Doudou Guo, Yunbai Zhang

机构 * Columbia University(哥伦比亚大学) New York University(纽约大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述了利用大语言模型作为代理进行金融交易的研究,探讨了代理架构、数据输入、回测表现及面临的挑战,并展望了未来研究方向。

Journal ref International Conference on Computers in Management and Business 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01519 2026-03-03 cs.CL eess.AS 89%

Chain of Correction for Full-text Speech Recognition with Large Language Models

基于大语言模型的全文语音识别纠错链

Zhiyuan Tang, Dong Wang, Zhikai Zhou, Yong Liu, Shen Huang, Shidong Shang

机构 * Tencent Ethereal Audio Lab, Tencent, China Center for Speech Language Technologies, BNRist, Tsinghua University, China

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出纠错链(CoC)方法,利用大语言模型逐段纠正全文语音识别错误,通过多轮对话和上下文引导提升纠错效果,实验表明其在纠错性能上优于现有系统。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00028 2026-03-03 cs.CL 89%

EPPCMinerBen: A Novel Benchmark for Evaluating Large Language Models on Electronic Patient-Provider Communication via the Patient Portal

EPPCMinerBen:一种用于通过患者门户评估大语言模型在电子患者-提供者沟通中的新基准

Samah Fodeh, Yan Wang, Linhai Ma, Srivani Talakokkul, Jordan M. Alpert, Sarah Schellhorn

机构 * Department of Emergency Medicine, Yale School of Medicine(耶鲁医学院急诊医学部) Cleveland Clinic Lerner College of Medicine of Case Western Reserve University, Cleveland Clinic(克利夫兰医学中心Lerner学院(凯斯西储大学)) Medical Oncology, Yale School of Medicine(耶鲁医学院肿瘤学部)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 EPPCMinerBen是一个用于评估大语言模型在电子患者-提供者沟通中表现的新基准,通过患者门户数据验证了大型模型在证据提取和分类任务中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01341 2026-03-03 cs.SI 89%

Structural Hallucination in Large Language Models: A Network-Based Evaluation of Knowledge Organization and Citation Integrity

大语言模型中的结构幻觉:基于网络的对知识组织与引用完整性的评估

Moses Boudourides

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于网络的结构幻觉压力测试,评估大语言模型在知识组织与引用完整性方面的表现,发现其在不同领域存在显著的结构偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02185 2026-03-03 cs.CV cs.AI cs.CL cs.LG 89%

Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models

视觉-深度研究基准:重新思考多模态大语言模型的视觉和文本搜索

Yu Zeng, Wenxuan Huang, Zhen Fang, Shuang Chen, Yufan Shen, Yishuo Cai, Xiaoman Wang, Zhenfei Yin, Lin Chen, Zehui Chen, Shiting Huang, Yiming Zhao, Xu Tang, Yao Hu, Philip Torr, Wanli Ouyang, Shaosheng Cao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Vision-DeepResearch基准,通过精心设计的问题评估多模态大语言模型的视觉与文本搜索能力,并引入多轮裁剪搜索流程提升实际检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00051 2026-03-03 cs.DL cs.AI cs.LG 88%

LitBench: A Graph-Centric Large Language Model Benchmarking Tool For Literature Tasks

LitBench: 一种面向文献任务的图中心大型语言模型基准评估工具

Andreas Varvarigos, Ali Maatouk, Jiasheng Zhang, Ngoc Bui, Jialin Chen, Leandros Tassiulas, Rex Ying

机构 * Yale University(耶鲁大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 LitBench是一种用于评估领域特定文献任务的大型语言模型基准工具,通过生成领域特定的文献子图和任务集,提升模型在文献相关任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏