arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-31 至 2026-03-31 共收录 405 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 107 篇

2603.27360 2026-03-31 cs.AI 77%

Defend: Automated Rebuttals for Peer Review with Minimal Author Guidance

Defend:用于同行评审的自动化反驳与最小作者指导

Jyotsana Khatri, Manasi Patwardhan

机构 * TCS Research(塔塔咨询服务研究实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DEFEND工具,通过作者引导的结构化推理生成反驳,提升事实准确性与反驳力度,对比三种方法显示其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17542 2026-03-31 cs.CL cs.CY 77%

Using LLMs for Knowledge Component-level Correctness Labeling in Open-ended Coding Problems

利用LLMs在开放性编程问题中进行知识组件级正确性标注

Zhangqi Duan, Arnav Kankaria, Dhruv Kartik, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出利用大语言模型直接标注开放性编程问题中知识组件的正确性,通过引入时间上下文感知的代码-知识组件映射机制,提升学习曲线拟合度和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04156 2026-03-31 cs.CL 77%

A Dataset for Addressing Patient's Information Needs related to Clinical Course of Hospitalization

一个用于应对住院临床过程患者信息需求的数据集

Sarvesh Soni, Dina Demner-Fushman

机构 * Division of Intramural Research National Library of Medicine, National Institutes of Health(美国国立卫生研究院国家医学图书馆院内研究部)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出ArchEHR-QA数据集,通过专家标注的住院病例,评估AI生成回答的事实性和相关性,发现答案优先提示策略在三个模型中表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26673 2026-03-31 cs.CY cs.AI 77%

Can AI be a Teaching Partner? Evaluating ChatGPT, Gemini, and DeepSeek across Three Teaching Strategies

AI能否成为教学伙伴?评估ChatGPT、Gemini和DeepSeek在三种教学策略中的表现

Talita de Paula Cypriano de Souza, Shruti Mehta, Matheus Arataque Uema, Luciano Bernardes de Paula, Seiji Isotani

机构 * Federal Institute of São Paulo (IFSP)(圣保罗联邦学院) Graduate School of Education of University of Pennsylvania (UPENN)(宾夕法尼亚大学教育研究生院) Institute of Mathematics and Computer Sciences of University of São Paulo (USP)(圣保罗大学数学与计算机科学研究所) Nucleus of Excellence in Social Technologies (NEES) of Federal University of Alagoas (UFAL)(阿拉戈斯联邦大学社会技术卓越中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了ChatGPT、Gemini和DeepSeek在示例、解释与类比及苏格拉底方法三种教学策略中的表现,发现模型在前两种策略中表现相似,但在苏格拉底方法中表现差异显著,ChatGPT和Gemini得分较高,而DeepSeek得分较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27067 2026-03-31 cs.CR cs.SE 75%

Detecting Protracted Vulnerabilities in Open Source Projects

检测开源项目中的长期漏洞

Arjun Sridharkumar, Sara Al Hajj Ibrahim, Jiayuan Zhou, Yuliang Wang, Safwat Hassan, Ahmed E. Hassan, Shurui Zhou

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文研究了长期未解决的漏洞(PCVEs),提出DeeptraVul方法,通过整合开发 artifacts 和代码信号,提高对长期漏洞的检测率,达到90%的覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27451 2026-03-31 cs.CL cs.AI 73%

Multi-Agent Dialectical Refinement for Enhanced Argument Classification

多智能体辩证细化用于增强论证分类

Jakub Bąba, Jarosław A. Chudziak

机构 * Faculty of Electronics

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MAD-ACC框架,通过多智能体辩论解决论证分类不确定性,实现85.7%的宏F1分数,无需领域特定训练,提供可解释的辩论记录。

Comments Accepted for publication in the proceedings of ACIIDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13197 2026-03-31 cond-mat.mtrl-sci cs.AI 70%

The Rise of Generative AI for Metal-Organic Framework Design and Synthesis

生成式AI在金属有机框架设计与合成中的崛起

Chenru Duan, Aditya Nandy, Shyam Chand Pal, Xin Yang, Wenhao Gao, Yuanqi Du, Hendrik Kraß, Yeonghun Kang, Varinia Bernales, Zuyang Ye, Tristan Pyle, Ray Yang, Zeqi Gu, Philippe Schwaller, Shengqian Ma, Shijing Sun, Alán Aspuru-Guzik, Seyed Mohamad Moosavi, Robert Wexler, Zhiling Zheng

机构 * Deep Principle, Inc.(Deep Principle公司) University of California, Los Angeles(加州大学洛杉矶分校) Washington University(华盛顿大学) Institute of Materials Science & Engineering, Washington University(华盛顿大学材料科学与工程研究所) Massachusetts Institute of Technology(麻省理工学院) Cornell University(康奈尔大学) University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所) Acceleration Consortium, University of Toronto(多伦多大学加速联盟) University of Washington(华盛顿大学) University of North Texas(北德克萨斯大学) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Canadian Institute for Advanced Research(加拿大高等研究院) NVIDIA(英伟达)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 生成式AI推动金属有机框架设计方法革新,通过自主提出并合成新型多孔结构,结合高通量计算筛选和自动化实验,形成加速发现闭环流程,提升清洁空气和能源应用材料性能。

Comments 10 pages, 5 figures

Journal ref Matter (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27838 2026-03-31 cs.CL 70%

ProText: A benchmark dataset for measuring (mis)gendering in long-form texts

ProText:一个用于衡量(误)性别化的长文本数据集

Hadas Kotek, Margit Bowler, Patrick Sonnenberg, Yu'an Yang

机构 * Apple(苹果公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ProText数据集通过三种维度评估长文本中的性别化与误性别化,利用先进大语言模型探讨文本转换中的性别偏见问题,揭示系统性性别偏见。

Comments 13 pages, 10 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01187 2026-03-31 cs.CL cs.CY 70%

Surfacing Subtle Stereotypes: A Multilingual, Debate-Oriented Evaluation of Modern LLMs

揭示微妙的刻板印象:一种多语言、辩论导向的现代大语言模型评估

Muhammed Saeed, Muhammad Abdul-mageed, Shady Shehata

机构 * The University of British Columbia(不列颠哥伦比亚大学) University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出多语言辩论基准测试,揭示生成模型中叙事偏见。通过8400个跨语言辩论提示,评估模型对敏感领域刻板印象的再现,发现所有模型均存在偏见,且低资源语言中偏见更严重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01448 2026-03-31 cs.LG cs.MM 70%

OpenAVS: Training-Free Open-Vocabulary Audio Visual Segmentation with Foundational Models

OpenAVS: 基于基础模型的无训练开放词汇音频视觉分割

Shengkai Chen, Yifang Yin, Jinming Cao, Shili Xiang, Zhenguang Liu, Roger Zimmermann

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract);foundation model(abstract);分类 cs.LG

AI总结 OpenAVS通过文本作为代理,首次实现音频与视觉模态对齐,利用基础模型直接推断掩码,提升开放词汇音频视觉分割的泛化能力。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27768 2026-03-31 cs.CL 70%

TailNLG: A Multilingual Benchmark Addressing Verbalization of Long-Tail Entities

TailNLG:一种针对长尾实体 verbalization 的多语言基准

Lia Draetta, Michael Oliverio, Virginia Ramón-Ferrer, Pier Felice Balestrucci, Flaviana Corallo, Carlos Badenes-Olmedo, Alessandro Mazzei, Marco Antonio Stranisci, Rossana Damiano

机构 * University of Turin(都灵大学) Universidad Politécnica de Madrid(马德里理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TailNLG基准,评估大型语言模型在长尾实体上的表现,揭示其存在偏见,强调需更可靠的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27646 2026-03-31 cs.CL hep-lat hep-ph physics.comp-ph physics.optics 70%

PRBench: End-to-end Paper Reproduction in Physics Research

PRBench: 物理研究中的端到端论文复现

Shi Qiu, Junyi Deng, Yiwei Deng, Haoran Dong, Jieyu Fu, Mao Li, Zeyu Li, Zhaolong Zhang, Huiwen Zheng, Leidong Bao, Anqi Lv, Zihan Mo, Yadi Niu, Yiyang Peng, Yu Tian, Yili Wang, Ziyu Wang, Zi-Yu Wang, Jiashen Wei, Liuheng Wu, Aoran Xue, Leyi Yang, Guanglu Yuan, Xiarui Zhan, Jingjun Zhang, Zifan Zheng, Pengfei Liu, Linrui Zhen, Kaiyang Li, Qichang Li, Ziheng Zhou, Guo-En Nian, Yunwei Xiao, Qing-Hong Cao, Linjie Dai, Xu Feng, Peng Gao, Ying Gu, Chang Liu, Jia Liu, Ming-xing Luo, Yan-Qing Ma, Liang-You Peng, Huichao Song, Shufeng Wang, Chenxu Wang, Tao Wang, Yi-Nan Wang, Chengyin Wu, Pengwei Zhao, Hua Xing Zhu

机构 * School of Physics, Peking University(北京大学物理学院) Beijing Computational Science Research Center(北京计算科学研究中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PRBench通过30个物理领域专家任务评估AI在复现科学论文中的能力,发现现有模型在数据准确性和代码正确性上表现不佳,揭示了系统性失败模式。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08847 2026-03-31 cs.AI cs.MA 70%

What Is Your Agent's GPA? A Framework for Evaluating Agent Goal-Plan-Action Alignment

你的代理的GPA是多少?一个评估代理目标-计划-行动对齐的框架

Allison Sihan Jia, Daniel Huang, Nikhil Vytla, Seung Won Wilson Yoo, Nirvika Choudhury, Shayak Sen, John C. Mitchell, Anupam Datta

机构 * BASIS Independent Silicon Valley Upper School(BASIS独立硅谷高中) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出Agent GPA框架,通过评估代理目标、计划和行动的对齐性,验证其在多代理、单代理和企业数据代理中的有效性,展示了高误差覆盖和调试定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28766 2026-03-31 cs.CV 67%

HandX: Scaling Bimanual Motion and Interaction Generation

HandX:扩展双臂运动和交互生成

Zimu Zhang, Yucheng Zhang, Xiyan Xu, Ziyin Wang, Sirui Xu, Kai Zhou, Bing Zhou, Chuan Guo, Jian Wang, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Specs Inc.(Specs公司) Snap Inc.(Snap公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出HandX,通过整合数据、标注和评估,解决双臂运动生成中精细指节动态和协作的不足,验证了大模型在生成高质量双臂运动中的有效性。

Comments CVPR 2026. Project Page: https://handx-project.github.io. Code: https://github.com/handx-project/HandX

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28309 2026-03-31 cs.CR 67%

VulnScout-C: A Lightweight Transformer for C Code Vulnerability Detection

VulnScout-C:一种轻量级的Transformer用于C代码漏洞检测

Aymen Lassoued, Nacef Mbarek, Bechir Dardouri, Bassem Ouni, Qing Li, Fakhri Karray

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出VulnScout-C,一种轻量级Transformer模型,用于C代码漏洞检测,同时构建了VulnScout数据集,实验表明其在检测性能上优于现有方法,且具有更低的推理成本。

Comments Submitted to IEEE Transactions on Dependable and Secure Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24037 2026-03-31 cs.CV 67%

A$^3$: Towards Advertising Aesthetic Assessment

A$^3$:迈向广告审美评估

Kaiyuan Ji, Yixuan Gao, Lu Sun, Yushuo Zheng, Zijian Chen, Jianbo Zhang, Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(上海交通大学图像通信与网络工程研究所) School of Information and Electronic Engineering, East China Normal University(华东师范大学信息与电子工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出A$^3$框架,通过理论驱动的A$^3$-Law、大规模标注数据集A$^3$-Dataset、多模态大语言模型A$^3$-Align及基准A$^3$-Bench,解决广告审美评估中主观性、缺乏标准等问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03462 2026-03-31 cs.SE 67%

Toward Functional and Non-Functional Evaluation of Application-Level Code Generation

迈向应用级代码生成的功能性和非功能性评估

Ruwei Pan, Yakun Zhang, Qingyuan Liang, Yueheng Zhu, Chao Liu, Lu Zhang, Hongyu Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出RAL-Bench基准,评估应用级代码生成的功能性和非功能性质量,发现功能正确性仍是瓶颈,非功能性质量也需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27059 2026-03-31 cs.CV 67%

Towards Intrinsic-Aware Monocular 3D Object Detection

面向内在感知的单目三维物体检测

Zhihao Zhang, Abhinav Kumar, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出MonoIA框架,通过语言引导表示建模和适应相机内在变化,实现鲁棒的三维物体检测,实验表明在KITTI等基准上取得新突破。

Comments This paper is accepted by CVPR 2026

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12533 2026-03-31 cs.CV 67%

Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering

你看到我指向的是什么?基于手势的 egocentric 视频问答

Yura Choi, Roy Miles, Rolandos Alexandros Potamias, Ismail Elezi, Jiankang Deng, Stefanos Zafeiriou

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出 EgoPointVQA 数据集和基准,结合 Hand Intent Tokens 提升手势引导的 egocentric 问答性能,HINT-14B 在多个任务上超越现有最佳模型。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24862 2026-03-31 cs.CV 67%

ViStoryBench: Comprehensive Benchmark Suite for Story Visualization

ViStoryBench:故事可视化全面评估基准套件

Cailin Zhuang, Ailin Huang, Yaoqi Hu, Jingwei Wu, Wei Cheng, Jiaqi Liao, Hongyuan Wang, Xinyao Liao, Weiwei Cai, Hengyuan Xu, Xuanyang Zhang, Xianfang Zeng, Zhewei Huang, Gang Yu, Chi Zhang

机构 * ShanghaiTech University(上海科技大学) StepFun AIGC Research(AIGC研究院) AGI Lab, Westlake University(西湖大学AGI实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出ViStoryBench,一个全面评估故事可视化模型的基准套件,通过多维度指标评估叙事结构、视觉风格和角色设定,结合人类验证确保一致性与真实性,推动视觉叙事技术发展。

Comments Accepted by CVPR 2026. 44 Pages, Project Page: https://vistorybench.github.io, Code: https://github.com/vistorybench/vistorybench, Dataset: https://huggingface.co/datasets/ViStoryBench/ViStoryBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13580 2026-03-31 cs.CV cs.HC 67%

AltChart: Enhancing VLM-based Chart Summarization Through Multi-Pretext Tasks

AltChart: 通过多预训练任务增强基于视觉语言模型的图表摘要

Omar Moured, Jiaming Zhang, M. Saquib Sarfraz, Rainer Stiefelhagen

专题命中 评测与基准 :language model(abstract);pretraining(abstract)

AI总结 本文提出AltChart数据集和方法,通过多预训练任务提升VLM在图表摘要中的表现,评估四种主流模型的可访问性。

Comments Concerns about reproducibility of the train results and dataset availability

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28662 2026-03-31 cs.LG cs.AI 62%

AMIGO: Agentic Multi-Image Grounding Oracle Benchmark

AMIGO:代理多图像接地 oracle 评估基准

Min Wang, Ata Mahjoubfar

机构 * Target Corporation(塔吉特公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 AMIGO 评估基准通过长周期交互检测隐藏目标,要求模型在严格协议下通过属性问题逐步识别目标,强调不确定性下的问题选择、约束跟踪和细粒度区分能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17396 2026-03-31 cs.CV cs.AI cs.CL 62%

RadImageNet-VQA: A Large-Scale CT and MRI Dataset for Radiologic Visual Question Answering

RadImageNet-VQA:一个大规模的CT和MRI数据集用于放射学视觉问答

Léo Butsanets, Charles Corbière, Julien Khlaut, Pierre Manceron, Corentin Dancette

机构 * Raidium Université de Paris Cité, Hôpital Européen Georges Pompidou, AP-HP(巴黎西岱大学,乔治·蓬皮杜欧洲医院,AP-HP) Department of Vascular and Oncological Interventional Radiology, INSERM(血管与肿瘤介入放射学系,法国国家健康与医学研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RadImageNet-VQA数据集,包含750万张图像和750万个问题-答案对,涵盖异常检测、解剖识别和病理识别三大任务,验证了视觉语言模型在细粒度病理识别上的局限性。

Comments Preprint, 33 pages, 15 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26829 2026-03-31 cs.LG cs.AI 62%

Squish and Release: Exposing Hidden Hallucinations by Making Them Surface as Safety Signals

挤压与释放:通过使其显现为安全信号来暴露隐藏的幻觉

Nathaniel Oh, Paul Attie

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Squish and Release框架,通过激活空间修补技术揭示模型在对话压力下隐藏的幻觉问题,通过实验验证了检测模块和核心架构的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04241 2026-03-31 cs.CL 61%

Tokenization and Morphological Fidelity in Uralic NLP: A Cross-Lingual Evaluation

词化与乌拉尔语NLP中的形态保真度:跨语言评估

Nuo Xu, Ahrii Kim

机构 * University of Eastern Finland(东芬兰大学) AI-Bio Convergence Research Institute(人工智能-生物融合研究所) Soongsil University(崇实大学)

专题命中 评测与基准 :language model(abstract,journal_ref);分类 cs.CL

AI总结 本文通过比较三种子词方法在六个乌拉尔语中的表现,发现OBPE在形态对齐和标注准确性上优于传统方法,尤其在拉丁字母语中表现突出。

Journal ref Proceedings of the Second Workshop on Language Models for Low-Resource Languages (LoResLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28063 2026-03-31 cs.AI cs.GT 57%

Reward Hacking as Equilibrium under Finite Evaluation

奖励黑客行为作为有限评估下的均衡

Jiacheng Wang, Jinbin Huang

专题命中 评测与基准 :RLHF(abstract);分类 cs.AI

AI总结 本文基于五个公理证明优化AI代理在未被评估系统覆盖的质量维度上会系统性地减少努力,揭示奖励黑客行为为结构性均衡而非可修复错误,并提出可计算的扭曲指数预测黑客行为。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27877 2026-03-31 cs.CL cs.SD 57%

HumMusQA: A Human-written Music Understanding QA Benchmark Dataset

HumMusQA:一个人类撰写的音乐理解问答基准数据集

Benno Weck, Pablo Puentes, Andrea Poltronieri, Satyajeet Prabhu, Dmitry Bogdanov

机构 * Universitat Pompeu Fabra(庞培法布拉大学) Universitat Autònoma de Barcelona(巴塞罗那自治大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出HumMusQA数据集,通过专家手工构建320个问题,评估大型音频-语言模型对音乐的理解能力,并测试其对单模态捷径的鲁棒性。

Comments Dataset available at https://doi.org/10.5281/zenodo.18462523

Journal ref Proceedings of the 4th Workshop on NLP for Music and Audio (NLP4MusA 2026), pages 58-67, Rabat, Morocco. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25240 2026-03-31 q-bio.QM cs.AI q-bio.GN 57%

Lingshu-Cell: A generative cellular world model for transcriptome modeling toward virtual cells

Lingshu-Cell: 一个生成性细胞世界模型用于转录组建模以实现虚拟细胞

Han Zhang, Guo-Hua Yuan, Chaohao Yuan, Tingyang Xu, Tian Bian, Hong Cheng, Wenbing Huang, Deli Zhao, Yu Rong

机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 Lingshu-Cell通过生成式模型学习转录组状态分布,支持在扰动下进行条件模拟,能够准确复现转录组分布和细胞亚型比例,展现复杂细胞异质性的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15355 2026-03-31 cs.CL 57%

HEAD-QA v2: Expanding a Healthcare Benchmark for Reasoning

HEAD-QA v2:扩展医疗基准以进行推理

Alexis Correa-Guillén, Carlos Gómez-Rodríguez, David Vilares

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 HEAD-QA v2扩展了医疗推理数据集,包含12000个西班牙专业考试问题,评估多种LLM性能,发现模型规模和推理能力是主要影响因素。

Comments LREC 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15090 2026-03-31 cs.DB cs.AI cs.CV 57%

SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning

SciEGQA:一个用于科学证据基础问题回答与推理的数据集

Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The University of Hong Kong(香港大学) Baidu Inc.(百度公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 SciEGQA数据集通过精细标注和大规模自动构建,提升视觉语言模型在科学文档中的证据定位与推理能力。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏