arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-21 至 2026-04-21 共收录 63 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 63 篇

2604.17988 2026-04-21 cs.CL 92%

Employing General-Purpose and Biomedical Large Language Models with Advanced Prompt Engineering for Pharmacoepidemiologic Study Design

利用通用和生物医药大语言模型与先进提示工程进行药事流行病学研究设计

Xinyao Zhang, Nicole Sonne Heckmann, Manuela Del Castillo Suero, Francesco Paolo Speca, Maurizio Sessa

机构 * Department of Drug Design and Pharmacology, University of Copenhagen(哥本哈根大学药物设计与药理学系)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract,abstract_cn)

AI总结 本文比较通用和生物医药大语言模型在药事流行病学研究设计中的表现,发现通用模型在相关性和逻辑性上表现更优,但提示策略对模型性能影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16425 2026-04-21 cs.DB cs.LG 92%

Method for Aggregating Unstructured Data Using Large Language Models

利用大语言模型聚合非结构化数据的方法

Vsevolod Lazebnyi, Natalia Tereshkina, Maria Shabarina, Dmitriy Fedorov

机构 * ITMO University(ITMO大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出一种利用大语言模型自动收集和聚合来自不同网页源的非结构化数据的方法,通过混合网页爬虫、非关系型数据库存储及LLM智能提取,解决现有技术在网页结构变化时的不稳定性及动态内容加载问题。

Comments 10 pages, 4 figures. Preprint. Accepted for ICMLC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16413 2026-04-21 cs.CY cs.AI 92%

What Is Actually Being Annotated? Inter-Prompt Reliability as a Measurement Problem in LLM-Based Social Science Labeling

什么是真正被标注的?在基于LLM的社会科学标注中,提示间可靠性作为测量问题

Jingyuan Liu

机构 * Boston University(波士顿大学)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Inter-Prompt Reliability框架,评估LLM在不同提示下的输出稳定性,发现标注存在显著随机性,多数投票能提高可重复性。

Comments 21 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16213 2026-04-21 cs.CV cs.AI cs.CL 91%

M4CXR: Exploring Multi-task Potentials of Multi-modal Large Language Models for Chest X-ray Interpretation

M4CXR:探索多任务潜力的多模态大语言模型在胸部X光解读中的应用

Jonggwon Park, Soobum Kim, Byungmu Yoon, Jihun Hyun, Kyoyun Choi

机构 * DEEPNOID Inc.(DEEPNOID公司)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出M4CXR,一种多模态大语言模型,通过链式推理策略提升胸部X光报告生成的临床准确性,并在视觉问答和视觉 grounding 任务中表现出色。

Journal ref IEEE Transactions on Neural Networks and Learning Systems, vol. 36, no. 10, pp. 17841-17855, Oct. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18200 2026-04-21 cs.IR 91%

Multi-LLM Token Filtering and Routing for Sequential Recommendation

多LLM令牌过滤与路由用于序列推荐

Wuhan Chen, Min Gao, Xin Xia, Zongwei Wang, Wentao Li, Shane Culpepper

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出MLTFR框架,通过多LLM令牌空间整合提升序列推荐性能,无需文本输入或模型修改,实验显示优于现有方法。

Comments 11 pages,3 figs

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17234 2026-04-21 cs.SE 91%

From Language to Action: Enhancing LLM Task Efficiency with Task-Aware MCP Server Recommendation

从语言到行动:通过任务感知的MCP服务器推荐提升LLM任务效率

Shiyu He, Zhiman Chen, Yuqi Zhao, Neng Zhang, Ran Mo, Yutao Ma

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出任务感知的MCP服务器推荐框架,通过构建任务-工具关联数据集和改进的推荐模型,提升LLM在实际开发任务中的效率和准确性。

Comments 44 pages, 12 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17543 2026-04-21 cs.CL 91%

PoliLegalLM: A Technical Report on a Large Language Model for Political and Legal Affairs

PoliLegalLM:政治与法律领域大型语言模型的技术报告

Yuting Huang, Yinghao Hu, Qian Xiao, Wenlin Zhong, Yiquan Wu, Taishi Zhou, Moke Chen, Changlong Sun, Kun Kuang, Fei Wu

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Zhejiang University(浙江大学) Zhejiang Zhengfa Xinxi Guanli Zhongxin(浙江正法信息警务中心)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);pretraining(abstract)

AI总结 本文提出PoliLegalLM,通过统一训练框架提升法律知识和推理能力,针对法律领域挑战实现高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17316 2026-04-21 cs.CL cs.AI 91%

Calibrated? Not for Everyone: How Sexual Orientation and Religious Markers Distort LLM Accuracy and Confidence in Medical QA

校准?并非人人适用:性取向和宗教标志如何扭曲LLM在医疗问答中的准确性和置信度

Alberto Testoni, Iacer Calixto

机构 * Department of Medical Informatics, Amsterdam University Medical Center, University of Amsterdam, Amsterdam, The Netherlands(阿姆斯特丹大学医学信息学系,阿姆斯特丹大学医学中心,阿姆斯特丹,荷兰) Amsterdam Public Health, Methodology, Amsterdam, The Netherlands(阿姆斯特丹公共卫生,方法学,阿姆斯特丹,荷兰)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了患者的社会描述(性取向和宗教归属)如何扭曲LLM的不确定性信号和准确性,发现身份标志导致校准危机,影响置信度信号的可靠性,对医疗部署构成风险。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21248 2026-04-21 cs.CL cs.AI cs.CE 91%

ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition

ResearchBench: 通过基于灵感的任务分解对LLM在科学发现中的基准测试

Yujie Liu, Zonglin Yang, Tong Xie, Jinjie Ni, Ben Gao, Yuqiang Li, Shixiang Tang, Wanli Ouyang, Erik Cambria, Dongzhan Zhou

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出ResearchBench,首个评估LLM在科学发现子任务中的基准,包含灵感检索、假设生成和排序,通过自动化框架提取跨12学科论文的关键信息,验证其准确性,并展示LLM在非分布任务中表现优异。

Comments Accepted by ACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15951 2026-04-21 cs.AI 90%

Integrating Graphs, Large Language Models, and Agents: Reasoning and Retrieval

图、大语言模型与代理的整合:推理与检索

Hamed Jelodar, Samita Bai, Mohammad Meymani, Parisa Hamedi, Roozbeh Razavi-Far, Ali Ghorbani

机构 * Canadian Institute for Cybersecurity, Faculty of Computer Science, University of New Brunswick(加拿大网络安全研究所,计算机科学学院,新不伦瑞克大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文综述了图与大语言模型整合的设计选择,分类了基于用途、图模态和整合策略的方法,探讨了不同领域中的适用场景和优缺点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17738 2026-04-21 cs.CL 90%

Mira-Embeddings-V1: Domain-Adapted Semantic Reranking for Recruitment via LLM-Synthesized Data

Mira-Embeddings-V1:基于LLM合成数据的领域适应语义重排序用于招聘

Zhaohua Liang, Zhilin Wang, Renjie Cao, Yining Zhang

机构 * OpenJobs AI

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出Mira-Embeddings-V1,通过LLM合成数据重塑嵌入空间并纠正边界混淆,提升招聘领域召回率和精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16317 2026-04-21 cs.IR cs.AI 90%

Paper2Data: Large-Scale LLM Extraction and Metadata Structuring of Global Urban Data from Scientific Literature

Paper2Data: 大规模LLM提取和全球城市数据元数据结构化从科学文献

Runwen You, Tong Xia, Jingzhi Wang, Jiankun Zhang, Tengyao Tu, Jinghua Piao, Yi Chang, Yong Li

机构 * Jilin University(吉林大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Paper2Data方法,通过大规模LLM驱动管道自动提取科学文献中的城市数据集并结构化元数据,构建了UrbanDataMiner平台,实现了全球城市数据的发现与系统化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08491 2026-04-21 cs.HC 89%

Figures as Interfaces: Toward LLM-Native Artifacts for Scientific Discovery

图表作为接口:迈向面向大语言模型的科学发现原生图件

Yifang Wang, Rui Sheng, Erzhuo Shao, Yifan Qian, Haotian Li, Nan Cao, Dashun Wang

专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出LLM原生图件概念,通过融合语言-视觉接口,实现数据驱动的可解释图件,提升科学发现的可重复性和透明性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11886 2026-04-21 cs.CL 89%

Faithfulness vs. Safety: Evaluating LLM Behavior Under Counterfactual Medical Evidence

忠实性与安全性:在反事实医学证据下评估LLM行为

Kaijie Mo, Siddhartha Venkatayogi, Chantal Shaib, Ramez Kouzy, Wei Xu, Byron C. Wallace, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Northeastern University(东北大学) MD Anderson Cancer Center(MD安德森癌症中心) Georgia Institute of Technology(佐治亚理工学院)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.CL

AI总结 本文研究了在反事实医学证据下LLM的行为,构建了MedCounterFact数据集,发现模型在面对危险或不合理证据时仍提供自信回答,表明模型可能过度强调忠实性而忽视安全性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16522 2026-04-21 cs.CL cs.AI 88%

Large Language Models Are Still Misled by Simple Bias Ensembles

大语言模型仍易受简单偏见集合的误导

Zhouhao Sun, Zhiyuan Kan, Xiao Ding, Li Du, Bibo Cai, Yang Zhao, Bing Qin, Ting Liu

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心) Harbin Institute of Technology(哈尔滨工业大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究指出,尽管大语言模型对单一偏见的鲁棒性提升,但多个偏见的组合仍显著影响其性能,提出多偏见基准测试以评估模型在复杂偏见下的表现,发现现有模型和去偏方法效果不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17051 2026-04-21 cs.CL cs.AI 88%

Efficient Task Adaptation in Large Language Models via Selective Parameter Optimization

通过选择性参数优化实现大语言模型中的高效任务适应

Weijie Wan, Jiangjiang Zhao

机构 * Shortest Path Technology(最短路径技术) China Mobile Communications Group Co.,Ltd(中国移动通信集团有限公司)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种参数重要性评估方法,将参数分为核心和非核心参数,在微调时固定核心参数仅优化非核心参数,提升模型在科学、医疗和物理任务中的适应性和泛化能力。

Comments IJCNN Full Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07549 2026-04-21 cs.CL cs.AI 88%

EMSDialog: Synthetic Multi-person Emergency Medical Service Dialogue Generation from Electronic Patient Care Reports via Multi-LLM Agents

EMSDialog: 通过多LLM代理从电子患者护理报告生成合成多人紧急医疗服务体系对话

Xueren Ge, Sahil Murtaza, Anthony Cortez, Homa Alemzadeh

机构 * School of Engineering and Applied Sciences, University of Virginia(弗吉尼亚大学工程与应用科学学院) School of Medicine, University of Virginia(弗吉尼亚大学医学院)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出基于ePCR的多代理生成流程,生成4414个合成多说话者EMS对话数据集,提升EMS对话诊断预测的准确性、及时性和稳定性。

Comments Accepted by ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24562 2026-04-21 cs.LG 87%

Scaling Recurrence-aware Foundation Models for Clinical Records via Next-Visit Prediction

通过下一步预测扩展临床记录的复发意识基础模型

Haresh Rengaraj Rajamohan, Xiang Gao, Weicheng Zhu, Shih-Lun Huang, Long Chen, Gabe Schulman, Huizhen Jin, Shengduo Li, Yixuan Wang, Huidi Yang, Kyunghyun Cho, Cem M. Deniz, Narges Razavian

机构 * Center for Data Science(数据科学中心) New York University(纽约大学) Department of Radiology(放射科) NYU Grossman School of Medicine(NYU Grossman医学院) Center for Biomedical Imaging(生物医学成像中心) Department of Population Health(人群健康部)

专题命中 领域大模型 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出RAVEN模型,通过复发意识的下一步预测策略,改进序列EHR数据生成,解决重复事件对性能指标的干扰问题,并展示模型在不同数据规模下的扩展行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04740 2026-04-21 cs.CL cs.AI 87%

StealthGraph: Exposing Domain-Specific Risks in LLMs through Knowledge-Graph-Guided Harmful Prompt Generation

StealthGraph:通过知识图谱引导的有害提示生成暴露领域特定风险

Huawei Zheng, Xinqi Jiang, Sen Yang, Shouling Ji, Yingcai Wu, Dazhen Deng

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出StealthGraph框架,通过知识图谱生成领域相关的隐式有害提示,解决领域知识转化为约束和提升提示隐式的挑战,推动LLM安全研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20435 2026-04-21 cs.AI 86%

Deep reflective reasoning in interdependence constrained structured data extraction from clinical notes for digital health

在临床笔记中进行深度反思推理以提取受相互依赖约束的结构化数据用于数字健康

Jingwei Huang, Kuroush Nezafati, Zhikai Chi, Ruichen Rong, Colin Treager, Tingyi Wanyan, Yueshuang Xu, Xiaowei Zhan, Patrick Leavey, Guanghua Xiao, Wenqi Shi, Yang Xie

机构 * Quantitative Biomedical Research Center, Department of Health Data Science and Biostatistics, Peter O'Donnell School of Public Health, University of Texas Southwestern Medical Center(定量生物医学研究中心,健康数据科学与生物统计学系,彼得·奥·多尼尔公共卫生学院,德克萨斯西南医学中心)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出深度反思推理方法,通过迭代自我批评和修订,提升LLM在临床笔记中提取结构化数据的可靠性,尤其在肿瘤学应用中显著提高了各类变量的准确率和F1分数。

Comments 12 figures and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16723 2026-04-21 cs.AI cs.LG 86%

Debate as Reward: A Multi-Agent Reward System for Scientific Ideation via RL Post-Training

辩论作为奖励:一种用于科学构想的多智能体奖励系统通过RL后训练

Moein Salimi, Babak Hosseini Mohtasham, Amin Aghakasiri, Mahdi Naieni, Amir Hossein Qeysarbeigi, Mohammad Masih Shalchian Nazer, Zahra Azar, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

机构 * Sharif University of Technology(谢里夫理工学院) University of Tehran(德黑兰大学)

专题命中 领域大模型 :post-training(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种多智能体奖励系统,通过RL后训练提升科学构想的质量,解决奖励黑客问题,实验显示其在新颖性、可行性和有效性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12261 2026-04-21 cs.CL cs.AI 85%

Infherno: End-to-end Agent-based FHIR Resource Synthesis from Free-form Clinical Notes

Infherno:从非结构化临床笔记到端到端的FHIR资源合成

Johann Frei, Nils Feldhus, Lisa Raithel, Roland Roller, Alexander Meyer, Frank Kramer

机构 * IT-Infrastructure for Translational Medical Research(转化医学研究信息基础设施) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所) Technische Universität Berlin(柏林技术大学) German Research Center for Artificial Intelligence (DFKI), Berlin(德国人工智能研究中心(DFKI),柏林) IKIM, Charité - Universitätsmedizin Berlin(IKIM,柏林夏里特大学医学中心)

专题命中 领域大模型 :LLM(summary_cn,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Infherno框架,利用LLM代理、代码执行和医疗术语数据库工具,解决从非结构化临床笔记到FHIR资源的端到端合成问题,实现与人类基线的竞争力。

Comments EACL 2026 System Demonstrations | Code: https://github.com/j-frei/Infherno | Demo: https://infherno.misit-augsburg.de

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26475 2026-04-21 cs.LG cs.AI eess.SP math.RT 84%

Foundation Model for Cardiac Time Series via Masked Latent Attention

通过掩码潜在注意力的心脏时间序列基础模型

Moritz Vandenhirtz, Samuel Ruipérez-Campillo, Simon Böhi, Sonia Laguna, Irene Cannistraci, Andrea Agostini, Ece Ozkan, Thomas M. Sutter, Julia E. Vogt

机构 * Department of Computer Science, ETH Zurich, Switzerland(苏黎世联邦理工学院计算机科学系,瑞士) Department of Biomedical Engineering, University of Basel, Switzerland(巴塞尔大学生物医学工程系,瑞士)

专题命中 领域大模型 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LAMAE基础模型,通过自监督预训练学习跨导联连接机制,提升ECG表示质量和迁移能力,在预测ICD-10编码上优于独立导联掩码模型和对齐基线。

Comments First two authors are co-first. Last two authors are co-senior

Journal ref ICLR 2026: Workshop on Foundation Models for Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17114 2026-04-21 cs.CL 84%

The Provenance Gap in Clinical AI: Evidence-Traceable Temporal Knowledge Graphs for Rare Disease Reasoning

临床AI中的溯源差距:用于罕见疾病推理的证据可追溯时间知识图谱

Md Shamim Ahmed, Maja Dusanic, Moritz Nikolai Kirschner, Elisabeth Nyoungui, Jana Zschüntzsch, Lukas Galke Poech, Richard Röttger

机构 * Department of Mathematics and Computer Science, University of Southern Denmark(丹麦南方大学数学与计算机科学系) Universitätsmedizin Göttingen(哥廷根大学医学中心)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出HEG-TKG系统,通过时间知识图谱提升临床推理的证据可追溯性,实现100%证据可验证性,同时保证安全性和完整性。

Comments 32 pages, 9 figures, 7 tables. Will submit to npj Digital Medicine. Supplementary materials included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23987 2026-04-21 cs.LG 84%

Can we generate portable representations for clinical time series data using LLMs?

能否利用LLMs为临床时间序列数据生成可移植的表示?

Zongliang Ji, Yifei Sun, Andre Amaral, Anna Goldenberg, Rahul G. Krishnan

机构 * University of Toronto, Canada(加拿大多伦多大学) Sunnybrook Health Sciences Centre, Canada(加拿大阳光医疗科学中心) Vector Institute, Canada(加拿大向量研究所)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文研究了利用LLMs生成可移植患者表示的方法,通过将不规则ICU时间序列转换为自然语言摘要,再嵌入固定长度向量,实现跨医院的预测任务,展示了其在多个临床任务中的竞争力和可移植性。

Comments Accepted to the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18418 2026-04-21 cs.CV 83%

MedProbeBench: Systematic Benchmarking at Deep Evidence Integration for Expert-level Medical Guideline

MedProbeBench: 在深度证据整合中的系统性基准测试用于专家级医疗指南

Jiyao Liu, Jianghan Shen, Sida Song, Tianbin Li, Xiaojia Liu, Rongbin Li, Ziyan Huang, Jiashi Lin, Junzhi Ning, Changkai Ji, Siqi Luo, Wenjie Li, Chenglong Ma, Ming Hu, Jing Xiong, Jin Ye, Bin Fu, Ningsheng Xu, Yirong Chen, Lei Jin, Hong Chen, Junjun He

机构 * Fudan University(复旦大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Hong Kong(香港大学)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出MedProbeBench,首个利用高质量临床指南作为专家级参考的基准,通过1200+任务自适应评估标准和5130+原子性声明验证,评估17种LLM和深度研究代理在证据整合和指南生成中的能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17795 2026-04-21 cs.CL cs.AI cs.LG cs.MA cs.SE 83%

What Makes AI Research Replicable? Executable Knowledge Graphs as Scientific Knowledge Representations

什么使AI研究可重复?可执行知识图谱作为科学知识表示

Yujie Luo, Zhuoyun Yu, Xuehai Wang, Yuqi Zhu, Ningyu Zhang, Lanning Wei, Lun Du, Da Zheng, Huajun Chen

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出可执行知识图谱(xKG),通过整合文献中的代码片段和技术洞察,提升AI研究的可重复性,实验显示其在PaperBench上性能提升显著。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19897 2026-04-21 cs.AI cs.CL cs.CV cs.HC 82%

ScienceBoard: Evaluating Multimodal Autonomous Agents in Realistic Scientific Workflows

ScienceBoard: 评估多模态自主代理在真实科学工作流中的表现

Qiushi Sun, Zhoumianze Liu, Chang Ma, Zichen Ding, Fangzhi Xu, Zhangyue Yin, Haiteng Zhao, Zhenyu Wu, Kanzhi Cheng, Zhaoyang Liu, Jianing Wang, Qintong Li, Xiangru Tang, Tianbao Xie, Xiachong Feng, Xiang Li, Ben Kao, Wenhai Wang, Biqing Qi, Lingpeng Kong, Zhiyong Wu

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Peking University(北京大学) Nanjing University(南京大学) East China Normal University(华东师范大学) Yale University(耶鲁大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ScienceBoard通过真实多领域环境和169个高质量任务评估多模态自主代理在科学工作流中的能力,发现现有代理在复杂任务中仅达到15%的成功率,揭示了改进设计原则的必要性。

Comments ICLR 2026 Camera Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17153 2026-04-21 cs.CL cs.AI 82%

From Legal Text to Executable Decision Models: Evaluating Structured Representations for Legal Decision Model Generation

从法律文本到可执行决策模型:评估结构化表示在法律决策模型生成中的应用

David Graus

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文研究通过结构化表示提升基于LLM的法律决策模型生成效果,发现输入约束显著提升模型相似度,且结构相似性与结果等价性互补。

Comments 10 pages, 3 figures, accepted to ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18373 2026-04-21 econ.GN cs.AI q-fin.EC q-fin.GN 81%

Dissecting AI Trading: Behavioral Finance and Market Bubbles

解析人工智能交易:行为金融与市场泡沫

Shumiao Ouyang, Pengfei Sui

机构 * Saïd Business School, University of Oxford(牛津大学said商学院) School of Management and Economics, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)管理学院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究AI代理在实验资产市场中的预期形成与交易行为,发现AI代理表现出经典行为模式,并通过分析其推理文本展示针对性提示干预对市场泡沫的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏