arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-28 至 2026-04-28 共收录 519 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 113 篇

2604.24158 2026-04-28 cs.AI 90%

Multi-Dimensional Evaluation of Sustainable City Trips with LLM-as-a-Judge and Human-in-the-Loop

多维评估可持续城市旅行的LLM-as-Judge与人机协同

Ashmi Banerjee, Adithi Satish, Wolfgang Wörndl, Yashar Deldjoo

机构 * Technical University of Munich(慕尼黑技术大学) Polytechnic University of Bari(巴里理工学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出多维评估可持续城市旅行推荐的框架,通过LLM-as-Judge和人类协同校准,解决传统指标忽略利益相关者目标的问题,揭示模型偏差与维度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12311 2026-04-28 cs.SE cs.AI cs.HC 90%

Is Vibe Coding the Future? An Empirical Assessment of LLM Generated Codes for Construction Safety

vibe编码是未来吗?对LLM生成代码用于建设安全的实证评估

S M Jamil Uddin

机构 * Department of Construction Management, Colorado State University(科罗拉多州立大学建设管理系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究评估了450个由三个前沿模型生成的Python脚本在建设安全中的可靠性、软件架构和领域特定安全精度,发现用户角色与数据幻觉存在显著关系,且存在高达45%的静默故障率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13360 2026-04-28 cs.CL cs.SE 90%

What Prompts Don't Say: Understanding and Managing Underspecification in LLM Prompts

提示中未言明的内容:理解并管理LLM提示中的不充分性

Chenyang Yang, Yike Shi, Qianou Ma, Michael Xieyang Liu, Christian Kästner, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文探讨了LLM提示中的不充分性问题,指出默认推断的稳定性差且易退化,提出要求意识的提示优化机制和系统性的主动发现与监控流程以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17170 2026-04-28 cs.IR 89%

When LLM Judges Inflate Scores: Exploring Overrating in Relevance Assessment

当大语言模型评分膨胀时:探索相关性评估中的过度评分

Chuting Yu, Hang Li, Guido Zuccon, Joel Mackenzie, Teerapong Leelanupab

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究揭示LLM在相关性评估中存在系统性高估问题,指出模型对不满足信息需求的文本给出高分,且易受文本长度和表层词汇影响,强调需谨慎评估LLM在相关性评估中的应用。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18803 2026-04-28 cs.CV cs.AI 89%

LLM-as-Judge Framework for Evaluating Tone-Induced Hallucination in Vision-Language Models

用于评估视觉-语言模型中语气诱导幻觉的LLM-as-Judge框架

Zhiyuan Jiang, Weihao Hong, Xinlei Guan, Tejaswi Dhandu, Miles Q. Li, Meng Xu, Kuan Huang, Umamaheswara Rao Tida, Bingyu Shen, Daehan Kwak, Boyang Li

机构 * Kean University(凯恩大学) North Dakota State University(北达科他州立大学) McGill University(麦吉尔大学) University of Notre Dame(圣母大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(title,abstract);分类 cs.AI

AI总结 本文提出Ghost-100基准,通过结构化提示强度框架评估不同模型在提示压力下的表现,发现H-Rate和H-Score在模型家族间显著分化,且某些模型对语气敏感度非单调。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22764 2026-04-28 cs.CY cs.AI cs.IR 89%

Implicit Humanization in Everyday LLM Moral Judgments

日常LLM道德判断中的隐性人性化

Hoda Ayad, Tanu Mitra

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 研究探讨了日常LLM在道德判断中隐性人性化倾向的影响,通过分析四个主流LLM的响应,发现其强化了隐性人性化假设,可能加剧过度依赖或信任风险,呼吁未来研究需考虑用户侧隐性人性化并设计解决方案。

Comments 6 pages, 3 figures, Published in CHIIR '26

Journal ref Proceedings of the 2026 Conference on Human Information Interaction and Retrieval (CHIIR '26), pages 497-502, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16378 2026-04-28 cs.CL cs.AI cs.SD 88%

Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs

听译:将语音模态整合到LLMs中的有效性

Sara Papi, Javier Garcia Gilabert, Zachary Hopton, Vilém Zouhar, Carlos Escolano, Gerard I. Gállego, Jorge Iranzo-Sánchez, Ahrii Kim, Dominik Macháček, Patricia Schmidtova, Maike Züfle

机构 * Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会) Barcelona Supercomputing Center(巴塞罗那超级计算中心) University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学) Universitat Politècnica de València(瓦伦西亚理工大学) Soongsil University(顺天大学) Charles University(查尔斯大学) KIT(卡尔斯鲁厄理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文评估了将语音模态整合到LLMs中的有效性,发现级联系统总体更可靠,但最新SpeechLLMs在某些情况下可匹配或超越级联系统,而SFM表现较差,强调整合LLM的重要性。

Comments Project available at https://github.com/sarapapi/hearing2translate | Accepted at TACL, this version is a pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22884 2026-04-28 cs.CV cs.AI 88%

Can Multimodal Large Language Models Truly Understand Small Objects?

多模态大语言模型真的能理解小物体吗?

Fujun Han, Junan Chen, Xintong Zhu, Jingqi Ye, Xuanjie Mao, Tao Chen, Peng Ye

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出SOUBench基准,评估现有多模态大语言模型对小物体的理解能力,发现其能力有限,并通过SOU-Train数据集提升模型表现。

Comments Under Peer Review (26 pages, 9 figures, 6 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22871 2026-04-28 cs.CR cs.AI cs.MA 88%

AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

AutoRISE:面向大语言模型的代理驱动策略进化

Tanmay Gautam, Alireza Bahramali, Sandeep Atluri

机构 * Responsible AI, Microsoft(微软责任人工智能)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出AutoRISE,通过代理编辑攻击策略并评估,实现攻击策略的进化,提升了对抗成功率。

Comments 36 pages, 6 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08618 2026-04-28 eess.AS cs.CV cs.SD 88%

VAPO: End-to-end Slide-Enhanced Speech Recognition with Omni-modal Large Language Models

VAPO:基于多模态大语言模型的端到端幻灯片增强语音识别

Rui Hu, Delai Qiu, Yining Wang, Shengping Liu, Jitao Sang

机构 * Beijing Key Laboratory of Traffic Data Mining and Embodied Intelligence(北京交通数据挖掘与具身智能重点实验室) Unisound AI Technology Co., Ltd.(Unisound人工智能技术有限公司) State Key Laboratory of AI Safety, Beijing(人工智能安全国家重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 VAPO通过多目标强化学习优化多模态大语言模型,解决视觉干扰问题,提升幻灯片增强语音识别的准确率和领域专用实体识别性能。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16637 2026-04-28 cs.CL cs.AI cs.LG 88%

SSR-Zero: Simple Self-Rewarding Reinforcement Learning for Machine Translation

SSR-Zero:用于机器翻译的简单自我奖励强化学习

Wenjie Yang, Mao Zheng, Mingyang Song, Zheng Li, Sitong Wang

机构 * Tencent Hunyuan(腾讯文元) Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SSR-Zero框架,通过自评奖励实现无参考、在线训练,优于现有MT特定LLM和通用LLM,在英中翻译任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23361 2026-04-28 cs.SE cs.AI cs.LG 87%

An Empirical Evaluation of Locally Deployed LLMs for Bug Detection in Python Code

对本地部署LLM在Python代码中检测bug的实证评估

Jelena Ilić Vulićević

机构 * Independent Researcher Master of Electrical(独立研究者 电气工程硕士)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了本地部署的LLaMA 3.2和Mistral在Python bug检测中的性能,发现其准确率在43%-45%之间,但难以精确定位修复。

Comments 8 pages, 5 figures. Code available at https://github.com/insajder/llm-bug-detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22971 2026-04-28 cs.CY cs.AI cs.MA 87%

Peer Identity Bias in Multi-Agent LLM Evaluation: An Empirical Study Using the TRUST Democratic Discourse Analysis Pipeline

多智能体大语言模型评估中的同伴身份偏差:使用TRUST民主话语分析流水线的实证研究

Juergen Dietrich

机构 * TRUST Project(TRUST项目)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过TRUST民主话语分析流水线评估多智能体大语言模型的同伴身份偏差,发现单一通道匿名化几乎无偏差,而完整流水线匿名化揭示了同质化集合体放大身份驱动的阿谀行为,异质化生产配置则相反。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23424 2026-04-28 cs.LG cs.CL 87%

Evolve: A Persistent Knowledge Lifecycle for Small Language Models

Evolve:为小型语言模型设计的持久知识生命周期

Dikran Hovagimian

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.CL、cs.LG

AI总结 Evolve通过持久知识库与小型模型结合,提升准确率并降低教师模型调用成本,采用语义连贯的段落存储方式,实现知识的自动合并与刷新,有效提升任务性能。

Comments 35 pages, 1 figure. Code and evaluation data: https://gitlab.com/dikran.hovagimian/evolve

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24621 2026-04-28 cs.SE 87%

Evaluation of LLM-Based Software Engineering Tools: Practices, Challenges, and Future Directions

评估基于大语言模型的软件工程工具:实践、挑战与未来方向

Utku Boran Torun, Veli Karakaya, Ali Babar, Eray Tüzün

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了基于大语言模型的软件工程工具的评估问题,分析了现有评估方法的局限性,并提出了未来研究方向以提升评估的可靠性与可扩展性。

Comments Accepted to EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04802 2026-04-28 cs.CL 86%

Mind the Gap: Evaluating Model- and Agentic-Level Vulnerabilities in LLMs with Action Graphs

注意差距:通过动作图评估LLM在模型和代理层面的漏洞

Ilham Wicaksono, Zekun Wu, Rahul Patel, Theo King, Adriano Koshiyama, Philip Treleaven

机构 * Holistic AI University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过动作图评估LLM在模型和代理层面的漏洞,揭示了代理层面特有的风险,并展示了通过动作图改进提示能有效降低代理 jailbreak 成功率。

Comments ICLR 2026 Agents in the Wild (Spotlight & Oral); ICLR 2026 AFAA; OpenAI Red-Teaming Challenge Winner (2025); NeurIPS 2025 LLMEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16419 2026-04-28 cs.SE cs.LG 86%

Can LLMs Find Bugs in Code? An Evaluation from Beginner Errors to Security Vulnerabilities in Python and C++

LLMs能否发现代码中的错误?对Python和C++中初级错误到安全漏洞的评估

Akshay Mhatre, Noujoud Nader, Patrick Diehl, Deepti Gupta

机构 * 1 Dept. of Computer Information Systems, Texas A\&M University - Central Texas, TX, 76549 USA. 2 LSU Center for Computation \& Technology, Louisiana State University, Baton Rouge, LA, 70803 USA. 3 Department of Physics Astronomy, Louisiana State University, Baton Rouge, LA, 70803 USA. 4 Applied Computer Science (CCS-7), Los Alamos National Laboratory, Los Alamos, NM 87545 USA.

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了三个主流LLM在检测Python和C++中基础错误、经典安全漏洞及生产级bug的有效性,发现其在语法和语义问题上表现良好,但在复杂安全漏洞和大规模代码中性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23009 2026-04-28 cs.CL 86%

Chinese-SkillSpan: A Span-Level Dataset for ESCO-Aligned Competency Extraction from Chinese Job Ads

Chinese-SkillSpan: 一个用于从中文招聘广告中提取与ESCO对齐的胜任力的跨度级数据集

Guojing Li, Zichuan Fu, Junyi Li, Wenxia Zhou, Xinyang Wu, Jinning Yang, Jingtong Gao, Feng Huang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Renmin University of China(中国人民大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出首个中文JobSkillNER数据集Chinese-SkillSpan,采用LLM赋能的宏微协作标注流程,涵盖知识、技能、横向能力及语言能力四个维度,支持有效模型训练与评估。

Comments 18 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11772 2026-04-28 cs.LG 86%

LAMP: Extracting Local Decision Surfaces From Large Language Models

LAMP:从大型语言模型中提取局部决策表面

Ryan Chen, Youngmin Ko, Zeyu Zhang, Catherine Cho, Sunny Chung, Mauro Giuffré, Dennis L. Shung, Bradly C. Stadie

机构 * Department of Statistics and Data Science, Northwestern University(西北大学统计与数据科学系) Section of Digestive Diseases, Department of Medicine, Yale School of Medicine(耶鲁医学院消化疾病科) Department of Biomedical Informatics and Data Science, Yale School of Medicine(耶鲁医学院生物医学信息学与数据科学系) Division of Gastroenterology and Hepatology, Department of Medicine, Mayo Clinic(梅奥诊所消化内科与肝病科)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.LG

AI总结 LAMP通过局部线性替代方法揭示语言模型决策表面,验证其解释与人类判断的一致性,并在多个任务中展示其对模型行为的审计能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03525 2026-04-28 cs.CL cs.AI eess.AS 86%

Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies

基于语音的认知筛查:大型语言模型适应策略的系统评估

Fatemeh Taherinezhad, Mohamad Javad Momeni Nezhad, Sepehr Karimi, Sina Rashidi, Ali Zolnour, Maryam Dadkhah, Yasaman Haghbin, Hossein AzadMaleki, Maryam Zolnoori

机构 * Columbia University Irving Medical Center(哥伦比亚大学伊文思医疗中心) School of Nursing, Columbia University(哥伦比亚大学护理学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文系统评估了大型语言模型在痴呆症检测中的适应策略,发现上下文学习、推理增强提示和参数高效微调等方法对模型性能有显著影响,展示了适配模型在语音筛查中的有效性。

Journal ref https://ai.jmir.org/2026/1/e82608

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22775 2026-04-28 cs.HC 86%

Cognitive Alignment Deciphered: A Self-Developed Scenario-Based Prompt Scale Coupled with Representational Similarity Analysis and Social Network Analysis for Unraveling Bias Mechanisms Across Humans and LLMs

认知对齐解码:一种自研的基于场景的提示量表结合表征相似性分析和社会网络分析,用于揭示人类和大语言模型中的偏见机制

Chengrui Zhou

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于场景的CBAS量表,结合RSA和SNA分析,揭示人类和LLM的偏见机制,通过干预提升LLM响应准确率,建立可复现的认知对齐研究流程。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12134 2026-04-28 cs.AI cs.HC 85%

Value Alignment Tax: Measuring Value Trade-offs in LLM Alignment

价值对齐税:在大语言模型对齐中测量价值权衡

Jiajun Chen, Hua Shen

机构 * Center for Data Science, NYU Shanghai(纽约大学上海分校数据科学中心)

专题命中 评测与基准 :LLM(title,abstract_cn);preference optimization(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出VAT框架,用于测量对齐干预如何影响价值系统,揭示目标值与非目标值之间的系统性权衡,通过实验数据展示对齐过程中的潜在风险。

Comments Preprint. Under review. 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13006 2026-04-28 cs.CL cs.AI 85%

One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness

距离崩溃仅一步之遥:指令调制帮助性的脆弱性

Erfan Baghaei Potraghloo, Seyedarmin Azizi, Souvik Kundu, Massoud Pedram

机构 * University of Southern California(南加州大学) Intel AI(英特尔人工智能)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 研究探讨了指令调制大语言模型在简单约束下的帮助性稳定性,发现其在词汇约束下响应质量显著下降,揭示了指令调制对表面模板的依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24690 2026-04-28 cs.CL 84%

Can LLMs Act as Historians? Evaluating Historical Research Capabilities of LLMs via the Chinese Imperial Examination

LLMs能否成为历史学家?通过中国科举制度评估LLMs的历史研究能力

Lirong Gao, Zeqing Wang, Yuyan Cai, Jiayi Deng, Yanmei Gu, Yiming Zhang, Jia Zhou, Yanfei Zhang, Junbo Zhao

机构 * State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ProHist-Bench基准,基于中国科举制度评估LLMs的历史研究能力,揭示其在复杂历史问题上的不足,旨在推动领域特定推理LLM的发展。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23844 2026-04-28 cs.CL 84%

Translate or Simplify First: An Analysis of Cross-lingual Text Simplification in English and French

先翻译还是先简化:对英法双语文本简化进行的分析

Ido Dahan, Omer Toledano, Roey J. Gafter, Sharon Pardo, Oren Tsur, Hila Zahavi, Elior Sulem

机构 * Faculty of Computer and Information Science, Institute for Applied AI Research(计算机与信息科学系,应用人工智能研究所) Department of Hebrew Language and Sociolinguistics(希伯来语言与社会语言学系) Department of Politics and Government(政治与政府系) The Simone Veil Research Centre for Contemporary European Studies(当代欧洲研究西蒙·维尔研究中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了英语和法语间跨语言文本简化的方法,通过不同提示策略评估其效果,发现翻译后简化方法在简洁性上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15957 2026-04-28 eess.AS cs.AI cs.CL cs.SD 84%

Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey

面向大音频-语言模型的全面评估:一项全面的调查

Chih-Kai Yang, Neo S. Ho, Hung-yi Lee

机构 * National Taiwan University(台湾大学) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立清华大学人工智能研究中心(NTU AI-CoRE))

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对大音频-语言模型的评估进行全面调查,提出系统化的分类体系,从四个维度探讨其性能,揭示挑战与未来方向,为领域提供指导。

Comments EMNLP 2025 (Main). Project Website: https://github.com/ckyang1124/LALM-Evaluation-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23667 2026-04-28 cs.SE 83%

Automated Classification of Human Code Review Comments with Large Language Models

基于大语言模型的人类代码审查评论自动分类

Semih Çağlar, Şükrü Eren Gökırmak, Eray Tüzün

专题命中 评测与基准 :large language model(title);language model(title)

AI总结 本文提出一种自动分类系统,针对代码审查评论中的具体问题类别进行分类,通过九类标签体系和手动标注数据,评估了不同模型在零样本和单样本分类中的表现。

Comments Accepted at the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24679 2026-04-28 cs.CV cs.LG 83%

Benchmarking Pathology Foundation Models for Breast Cancer Survival Prediction

对乳腺癌生存预测的病理基础模型进行基准测试

Fredrik K. Gustafsson, Constance Boissin, Johan Vallon-Christersson, David A. Clifton, Mattias Rantalainen

机构 * Department of Medical Epidemiology and Biostatistics, Karolinska Institutet(卡罗林斯卡研究所医学流行病学与生物统计学系) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Division of Oncology, Department of Clinical Sciences Lund, Lund University(卢德大学临床科学系肿瘤学系) Oxford Suzhou Centre for Advanced Research, University of Oxford(牛津大学苏州先进研究中心)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文通过标准化流程评估了多种病理基础模型在乳腺癌生存预测中的性能,发现H-optimus-1表现最佳,且第二代模型优于第一代,但多数模型性能差异较小,紧凑模型H0-mini在参数较少的情况下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23088 2026-04-28 cs.SE cs.AI cs.CL cs.PL 82%

Code Broker: A Multi-Agent System for Automated Code Quality Assessment

Code Broker:一个用于自动化代码质量评估的多智能体系统

Samer Attrah

机构 * Independent researcher(独立研究者) California, USA(美国加州)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 Code Broker通过多智能体架构对Python代码进行分析并生成质量评估报告,结合LLM推理与静态分析工具,提升代码审查的效率与准确性。

Comments 8 pages, 1 figure, 2 tables, 28 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14952 2026-04-28 cs.CL cs.AI 82%

CorpusQA: A 10 Million Token Benchmark for Corpus-Level Analysis and Reasoning

CorpusQA:一个1000万词的语料库分析与推理基准

Zhiyuan Lu, Chenliang Li, Yingcheng Shi, Weizhou Shen, Ming Yan, Fei Huang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CorpusQA提出一个1000万词的基准,解决大规模语料库推理问题,通过合成数据框架生成复杂查询,验证长文本推理能力,发现先进架构对全局信息整合的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏