arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12581 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 12581 篇

2606.01869 2026-06-09 cs.AI 版本更新 84%

WorldCoder-Bench: Benchmarking Physically Grounded 3D World Synthesis

WorldCoder-Bench:物理接地3D世界合成基准

Shuo Lu, Yinuo Xu, Kecheng Yu, Siru Jiang, Yongcan Yu, Yubin Wang, Haitao Yang, Yuxiang Zhang, Bin Wang, Ran He, Jian Liang

机构 * NLPR & MAIS, CASIA(中国科学院自动化研究所与模式识别国家重点实验室) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出WorldCoder-Bench基准,通过StateProbe协议评估LLM生成Three.js 3D世界的物理正确性和交互可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06469 2026-06-09 cs.CL 版本更新 84%

ClinicalBench: Can LLMs Beat Traditional ML Models in Clinical Prediction?

ClinicalBench: 大型语言模型能在临床预测中击败传统机器学习模型吗?

Canyu Chen, Jian Yu, Shan Chen, Che Liu, Zhongwei Wan, Shuang Zhou, Yuan Luo, Rui Zhang, Danielle Bitterman, Fei Wang, Kai Shu

机构 * Department of Computer Science Northwestern University Evanston USA(计算机科学系西北大学艾文斯顿美国) Department of Computer Science University of Texas at Austin Austin USA(计算机科学系德克萨斯大学奥斯汀美国) Boston Children's Hospital, Harvard Medical School Boston USA(波士顿儿童医院哈佛医学院波士顿美国) Department of Computer Science Imperial College London London UK(计算机科学系伦敦帝国学院伦敦英国) Department of Computer Science Ohio State University Columbus USA(计算机科学系俄亥俄州立大学哥伦布美国) Massachusetts General Hospital, Harvard Medical School Boston USA(麻省总医院哈佛医学院波士顿美国) Department of Preventive Medicine, Feinberg School of Medicine Northwestern University Chicago USA(预防医学系费因伯格医学院西北大学芝加哥美国) Division of Computational Health Sciences, Department of Surgery University of Minnesota Minneapolis USA(计算健康科学部外科部明尼苏达大学明尼阿波利斯美国) Department of Population Health Sciences, Weill Cornell Medicine Cornell University New York USA(流行病学与公共卫生系韦尔·科恩医学中心康奈尔大学纽约美国) Department of Computer Science Emory University Atlanta USA(计算机科学系埃默里大学亚特兰大美国) Northwestern University(西北大学) University of Texas at Austin(德克萨斯大学奥斯汀) Boston Children's Hospital, Harvard Medical School(波士顿儿童医院哈佛医学院) Imperial College London(伦敦帝国学院) Ohio State University(俄亥俄州立大学) Massachusetts General Hospital, Harvard Medical School(麻省总医院哈佛医学院) University of Minnesota(明尼苏达大学) Cornell University(康奈尔大学) Emory University(埃默里大学)

专题命中 领域大模型 :LLM(summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 构建ClinicalBench基准,通过三个临床预测任务比较14个通用和8个医学LLM与11个传统ML模型,发现LLM在临床预测上仍无法超越传统ML模型。

Comments Accepted to Proceedings of KDD 2026. The first two authors contributed equally. 12 pages for main paper, 62 pages including appendix. Project website: https://clinicalbench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25522 2026-06-08 cs.AI 版本更新 84%

Understanding Generative Recommendation with Semantic IDs from a Model-scaling View

从模型扩展视角理解基于语义ID的生成式推荐

Jingzhe Liu, Liam Collins, Jiliang Tang, Tong Zhao, Neil Shah, Clark Mingxuan Ju

机构 * Michigan State University(密歇根州立大学) Snap Inc.(Snap公司)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 揭示基于语义ID的生成式推荐在模型扩展时存在性能瓶颈,发现直接使用大语言模型作为推荐器具有更好的扩展性,性能提升可达20%。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04911 2026-06-04 cs.CV cs.CL 84%

BreastGPT: A Multimodal Large Language Model for the Full Spectrum of Breast Cancer Clinical Routine

BreastGPT: 面向乳腺癌临床全流程的多模态大语言模型

Yang Liu, Jiajin Zhang, Danyang Tu, Yaojun Hu, Jiao Qu, Jiuyu Zhang, Yu Shi, Wei Fang, Shi Gu, Ling Zhang, Yingda Xia

机构 * DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院) Zhejiang University(浙江大学) Hupan Lab(华潘实验室) West China Hospital(西京医院) China Medical University(中国医科大学)

专题命中 领域大模型 :large language model(title);language model(title);分类 cs.CL

AI总结 提出BreastGPT多模态大语言模型,通过构建工作流对齐的指令语料库BreastStage和双分支视觉编码器,实现乳腺癌筛查、诊断和治疗规划全流程的多模态推理,在BreastStage-Bench上取得75.66%封闭式准确率和89.92%开放式得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30961 2026-06-01 cs.CL 84%

EvoGens: A Population-Based Heuristic Search Framework for Scientific Idea Generation

EvoGens:一种基于种群的启发式搜索框架用于科学思想生成

Xu Li, Hanzhe Tu, Xinyi Li, Kuncheng Zhao, Xun Han, Zhonghui Liu

机构 * Southwest Petroleum University(西南石油大学) Sichuan Police College(四川警察学院)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有LLM方法生成科学思想时语义趋同、多样性和新颖性不足的问题,提出EvoGens框架,通过进化搜索(变异、交叉、选择)增强思想探索,显著提升新颖性和多样性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27066 2026-05-27 cs.CL cs.IR 84%

Large Language Model-Powered Query-Driven Event Timeline Summarization in Industrial Search

工业搜索中基于大语言模型的查询驱动事件时间线摘要

Mingyue Wang, Xingyu Xie, Hang Yang, Li Gao, Lixin Su, Ge Chen, Dawei Yin, Daiting Shi

机构 * Baidu Inc.(百度公司)

专题命中 领域大模型 :large language model(title);language model(title);分类 cs.CL

AI总结 提出QDET系统,通过多任务微调和强化学习实现查询驱动的事件时间线摘要,在百度搜索中显著提升用户参与度。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26926 2026-05-27 cs.AI 84%

From Norms to Indicators (N2I-RAG): An Agentic Retrieval-Augmented Generation Framework for Legal Indicator Computation

从规范到指标 (N2I-RAG): 一种用于法律指标计算的智能检索增强生成框架

Youssef Al Mouatamid, Marie Bonnin, Jihad Zahir

机构 * LISI Laboratory(LISI实验室) Cadi Ayyad University(卡迪·阿亚德大学) Univ Brest(布列塔尼大学) IRD, Univ Brest, CNRS, Ifremer, LEMAR(IRD、布列塔尼大学、CNRS、Ifremer、LEMAR)

专题命中 领域大模型 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 提出N2I-RAG框架,通过自适应检索、基于LLM的智能体和验证机制,实现从法律文本到指标的透明、可追溯的自动计算,在法国海洋环境法语料库上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24546 2026-05-26 cs.AI cs.IR 84%

Beyond Control-Flow: Integrating the Resource Perspective into Multi-Collaborative Process Modeling from Text

超越控制流:将资源视角融入基于文本的多协作流程建模

Anton Antonov, Humam Kourani, Alessandro Berti, Gyunam Park

机构 * Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息科技研究所) RWTH Aachen University(亚琛工业大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出一种资源感知的生成流程,从自然语言描述中自动生成包含组织(泳池)和角色(泳道)的BPMN 2.0协作图,同时保持控制流质量并增加少量运行时开销。

Comments Submitted to EDOC 2026, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21776 2026-05-22 cs.CL 84%

PromptNCE: Pointwise Mutual Information Predictions Using Only LLMs and Contrastive Estimation Prompts

PromptNCE:仅使用LLM和对比估计提示进行点互信息预测

Juliette Woodrow, Chris Piech

机构 * Department of Computer Science Stanford University(计算机科学系 斯坦福大学)

专题命中 领域大模型 :LLM(title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出PromptNCE方法,通过将条件概率估计转化为对比任务,并引入显式的OTHER类别来恢复真实的条件概率,从而在低数据情况下实现零样本点互信息估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09724 2026-05-21 cs.SE cs.AI 84%

InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation

InteractScience: 交互式科学演示代码生成的程序化与视觉导向评估

Qiaosheng Chen, Yang Liu, Lei Li, Kai Chen, Qipeng Guo, Gong Cheng, Fei Yuan

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,中国南京) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,中国上海) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学,美国匹兹堡)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出InteractScience基准,用于评估大语言模型在生成交互式科学演示代码时结合科学知识与前端交互能力的综合表现,通过程序化测试和视觉测试相结合的方法,评估30种开源和闭源LLM的表现,揭示了在整合领域知识与交互前端编码方面的持续不足。

Comments 27 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12012 2026-05-19 cs.AI 84%

LegalCheck: Retrieval- and Context-Augmented Generation for Drafting Municipal Legal Advice Letters

LegalCheck: 基于检索和上下文增强的生成方法用于起草市政法律建议信

Virgill van der Meer, Julien Rossi

机构 * Municipality of Amsterdam(阿姆斯特丹市) University of Amsterdam(阿姆斯特丹大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出LegalCheck系统,通过检索增强生成(RAG)和上下文增强生成(CAG)技术,自动起草市政法律回应信,提高法律部门在人员短缺、案件量增加和合规压力下的工作效率,确保法律一致性和准确性。

Comments Accepted at ICAIL 2026 as Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14754 2026-05-15 cs.AI 84%

XDomainBench: Diagnosing Reasoning Collapse in High-Dimensional Scientific Knowledge Composition

XDomainBench:诊断高维科学知识组合中的推理崩溃

Gong Zhiren, Tiantong Wu, Jiaming Zhang, Fuyao Zhang, Che Wang, Yurong Hao, Yikun Hou, Foo Ping, Yilei Zhao, Fei Huang, Chau Yuen, Wei Yang Bryan Lim

机构 * Alibaba Group, China(阿里巴巴集团,中国)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 XDomainBench通过系统压力测试科学推理,揭示LLM在跨学科知识组合中的推理崩溃问题,发现领域组合导致直接难度增加和轨迹模式引发的误差累积是根本原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16659 2026-05-15 cs.AI econ.GN q-fin.EC 84%

LLMs learn scientific taste from institutional traces across the social sciences

大语言模型通过社会科学研究中的机构痕迹学习科学品味

Ziqin Gong, Ning Li, Huaikang Zhou

机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本文探讨机构痕迹作为训练信号,帮助AI在低可验证性领域进行评估判断,通过八个社会科学学科的四层研究提案基准测试,验证了微调LLM在不同领域的准确率,最高达85.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26969 2026-05-14 cs.IR cs.AI 84%

AgenticRecTune: Multi-Agent with Self-Evolving Skillhub for Recommendation System Optimization

AgenticRecTune: 多智能体与自演化技能 hub 用于推荐系统优化

Xidong Wu, Yue Zhuan, Ruoqiao Wei, Hangxin Chen, Di Bai, Jintao Liu, Xinyi Wang, Xue Wang, Luoshu Wang, Xinwu Cheng

机构 * Google(谷歌)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AgenticRecTune框架,通过五个智能体实现端到端配置优化,利用LLM进行最优配置空间探索,结合自演化Skillhub提升推荐系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00074 2026-05-04 cs.CY cs.AI 84%

Adoption and Use of LLMs at an Academic Medical Center

学术医疗中心中大语言模型的采用与使用

Nigam H. Shah, Nerissa Ambers, Abby Pandya, Timothy Keyes, Juan M. Banda, Srikar Nallan, Carlene Lugtu, Artem A. Trotsyuk, Suhana Bedi, Alyssa Unell, Miguel Fuentes, Francois Grolleau, Sneha S. Jain, Jonathan Chen, Devdutta Dash, Danton Char, Aditya Sharma, Duncan McElfresh, Patrick Scully, Vishanthan Kumar, Clancy Dennis, Connor OBrien, Satchi Mouniswamy, Elvis Jones, Krishna Jasti, Gunavathi Mannika Lakshmanan, Sree Ram Akula, Varun Kumar Singh, Ramesh Rajmanickam, Sudhir Sinha, Vicky Zhou, Xu Wang, Bilal Mawji, Joshua Ge, Wencheng Li, Travis Lyons, Jarrod Helzer, Vikas Kakkar, Ramesh Powar, Darren Batara, Cheryl Cordova, William Frederick, Olivia Tang, Phoebe Morgan, April S. Liang, Stephen P. Ma, Shivam Vedak, Dong-han Yao, Akshay Swaminathan, Mehr Kashyap, Brian Ng, Jamie Hellman, Nikesh Kotecha, Christopher Sharp, Gretchen Brown, Christian Lindmark, Anurang Revri, Michael A. Pfeffer

机构 * Stanford Medicine, Technology and Digital Solutions(斯坦福医学院技术与数字解决方案)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ChatEHR系统,通过整合患者多年医疗记录,实现LLM在临床文档中的自动化与交互应用,提升医疗效率与数据准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27820 2026-04-24 cs.CL 84%

Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning

通过反事实多智能体推理提升临床诊断

Zhiwen You, Xi Chen, Aniket Vashishtha, Simo Du, Gabriel Erion-Barner, Hongyuan Mei, Hao Peng, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Jacobi Medical Center, Albert Einstein College of Medicine(雅各布医疗中心,阿尔伯特·爱因斯坦学院) Department of Emergency Medicine, Beth Israel Deaconess Medical Center(贝斯以色列医疗中心急诊科) Leaning machines(Leanings machines)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种基于反事实推理的多智能体诊断框架,通过反事实案例编辑和反事实概率差距方法,提升诊断准确性与可解释性,尤其在复杂和模糊病例中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17114 2026-04-21 cs.CL 84%

The Provenance Gap in Clinical AI: Evidence-Traceable Temporal Knowledge Graphs for Rare Disease Reasoning

临床AI中的溯源差距:用于罕见疾病推理的证据可追溯时间知识图谱

Md Shamim Ahmed, Maja Dusanic, Moritz Nikolai Kirschner, Elisabeth Nyoungui, Jana Zschüntzsch, Lukas Galke Poech, Richard Röttger

机构 * Department of Mathematics and Computer Science, University of Southern Denmark(丹麦南方大学数学与计算机科学系) Universitätsmedizin Göttingen(哥廷根大学医学中心)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出HEG-TKG系统,通过时间知识图谱提升临床推理的证据可追溯性,实现100%证据可验证性,同时保证安全性和完整性。

Comments 32 pages, 9 figures, 7 tables. Will submit to npj Digital Medicine. Supplementary materials included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23987 2026-04-21 cs.LG 84%

Can we generate portable representations for clinical time series data using LLMs?

能否利用LLMs为临床时间序列数据生成可移植的表示?

Zongliang Ji, Yifei Sun, Andre Amaral, Anna Goldenberg, Rahul G. Krishnan

机构 * University of Toronto, Canada(加拿大多伦多大学) Sunnybrook Health Sciences Centre, Canada(加拿大阳光医疗科学中心) Vector Institute, Canada(加拿大向量研究所)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文研究了利用LLMs生成可移植患者表示的方法,通过将不规则ICU时间序列转换为自然语言摘要,再嵌入固定长度向量,实现跨医院的预测任务,展示了其在多个临床任务中的竞争力和可移植性。

Comments Accepted to the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14576 2026-04-17 cs.AI 84%

Enhancing Mental Health Counseling Support in Bangladesh using Culturally-Grounded Knowledge

在孟加拉国增强心理健康咨询支持:基于文化根基的知识

Md Arid Hasan, Azhagu Meena SP, Aditya Khan, Abu Md Akteruzzaman Bhuiyan, Helal Uddin Ahmed, Joysree Debi, Farig Sadeque, Annie En-Shiun Lee, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) mPower Social Enterprises Ltd(mPower社会企业有限公司) National Institute of Mental Health(心理健康国家研究所) Sajida Foundation(萨吉达基金会) BRAC University(BRAC大学)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨如何通过系统整合临床验证的知识提升LLM在心理健康咨询中的表现,比较了检索增强生成与知识图谱方法,证明结构化专业知识能提升咨询相关性与实用性。

Comments submitted to CLPsych 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12308 2026-04-15 cs.CL 84%

ContextLens: Modeling Imperfect Privacy and Safety Context for Legal Compliance

ContextLens:建模不完美隐私和安全上下文以满足法律合规

Haoran Li, Yulin Chen, Huihao Jing, Wenbin Hu, Tsz Ho Li, Chanhou Lou, Hong Ting Tsang, Sirui Han, Yangqiu Song

机构 * Beihang University(北京航空航天大学) HKUST(香港科技大学) National University of Singapore(新加坡国立大学) Faculty of Law, University of Macau(澳门大学法学院)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ContextLens框架,利用LLM建模法律领域上下文,识别已知和未知因素以提升合规评估,实验表明其能有效提升LLM合规性评估性能。

Comments Accepted by ACL 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12739 2026-03-24 cs.CL 84%

Edu-Values: Towards Evaluating the Chinese Education Values of Large Language Models

Edu-Values:面向评估大型语言模型的中国教育价值观

Peiyi Zhang, Yazhou Zhang, Bo Wang, Lu Rong, Prayag Tiwari, Jing Qin

专题命中 领域大模型 :large language model(title);language model(title);分类 cs.CL

AI总结 本文提出Edu-Values基准,评估大型语言模型的中国教育价值观,包含七个核心价值,通过1418道题测试,发现中文LLM在教育文化差异下表现更优,且利用Edu-Values构建外部知识库可提升对齐效果。

Comments The authors are withdrawing this paper to make substantial revisions and improvements before future submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02593 2026-03-10 cs.CL cs.MA cs.NE cs.SD eess.AS 84%

Spoken Conversational Agents with Large Language Models

基于大语言模型的语音对话代理

Chao-Han Huck Yang, Andreas Stolcke, Larry Heck

机构 * NVIDIA Research(NVIDIA研究)

专题命中 领域大模型 :large language model(title);language model(title);分类 cs.CL

AI总结 本文探讨了如何通过大语言模型构建语音对话代理,涵盖从级联到端到端系统的路径,以及跨模态对齐和联合训练等关键技术,同时讨论了隐私、安全和评估中的开放问题。

Comments Accepted to EMNLP 2025 Tutorial

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21281 2026-03-05 cs.AI 84%

RLJP: Legal Judgment Prediction via First-Order Logic Rule-enhanced with Large Language Models

通过一阶逻辑规则增强的大语言模型进行法律判决预测

Yue Zhang, Zhiliang Tian, Shicheng Zhou, Haiyang Wang, Wenqing Hou, Yuying Liu, Xuechen Zhao, Minlie Huang, Ye Wang, Bin Zhou

机构 * College of Computer Science and Technology, National University of Defense and Technology(国防科技大学计算机科学与技术学院) College of Electronic Engineering, National University of Defense Technology(国防科技大学电子工程学院) School of Data and Computer Science, Shandong Women’s University(山东女子大学数据与计算机科学学院) Institute for Artificial Intelligence, Tsinghua University(清华大学人工智能研究院)

专题命中 领域大模型 :large language model(title);language model(title);分类 cs.AI

AI总结 本文提出基于一阶逻辑和对比学习的规则增强方法,通过三阶段流程提升法律判决预测的适应性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18060 2026-02-19 cs.CL 84%

Benchmarking Large Language Models on Answering and Explaining Challenging Medical Questions

在回答和解释具有挑战性的医疗问题上评估大型语言模型

Hanjie Chen, Zhouxiang Fang, Yash Singla, Mark Dredze

机构 * Rice University(里士满大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 领域大模型 :large language model(title);language model(title);分类 cs.CL

AI总结 本文提出两个新数据集用于评估大型语言模型在回答和解释具有挑战性的医疗问题上的能力,并通过实验展示了这些数据集的难度及模型表现。

Comments NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15951 2026-02-19 astro-ph.CO cs.LG 84%

MadEvolve: Evolutionary Optimization of Cosmological Algorithms with Large Language Models

MadEvolve:利用大语言模型进行宇宙学算法的进化优化

Tianyi Li, Shihui Zang, Moritz Münchmeyer

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 领域大模型 :large language model(title);language model(title);分类 cs.LG

AI总结 MadEvolve利用大语言模型优化宇宙学算法,通过进化方法提升计算性能并公开相关任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10740 2026-02-12 cs.CL 84%

Reinforced Curriculum Pre-Alignment for Domain-Adaptive VLMs

强化课程预对齐用于领域自适应视觉-语言模型

Yuming Yan, Shuo Yang, Kai Tang, Sihong Chen, Yang Zhang, Ke Xu, Dan Hu, Qun Yu, Pengfei Hu, Edith C. H. Ngai

机构 * Tencent(腾讯)

专题命中 领域大模型 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 本文提出RCPA方法,通过课程意识的渐进调节机制,在领域自适应中平衡领域知识获取与通用能力保持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01479 2026-02-03 cs.CL 84%

Ebisu: Benchmarking Large Language Models in Japanese Finance

Ebisu:日本金融领域大语言模型基准测试

Xueqing Peng, Ruoyu Xiang, Fan Zhang, Mingzi Song, Mingyang Jiang, Yan Wang, Lingfei Qian, Taiki Hara, Yuqing Guo, Jimin Huang, Junichi Tsujii, Sophia Ananiadou

专题命中 领域大模型 :large language model(title);language model(title);分类 cs.CL

AI总结 Ebisu通过两个专家标注任务评估日本金融语言理解,揭示了现有LLMs在处理隐含承诺和嵌套金融术语时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24314 2026-01-21 cs.CL 84%

QianfanHuijin Technical Report: A Novel Multi-Stage Training Paradigm for Finance Industrial LLMs

千帆辉金技术报告:面向金融工业大模型的新型多阶段训练范式

Shupeng Li, Weipeng Lu, Linyun Liu, Chen Lin, Shaofei Li, Zhendong Tan, Hanjun Zhong, Yucheng Zeng, Chenghao Zhu, Mengyue Liu, Daxiang Dong, Jianmin Wu, Yunting Xiao, Annan Li, Danyu Liu, Jingnan Zhang, Licen Liu, Dawei Yin, Dou Shen

机构 * Qianfan Team Baidu AI Cloud(百度AI云团队)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 千帆辉金提出一种面向金融工业大模型的新型多阶段训练范式,通过持续预训练和细粒度后训练流程提升模型的金融推理与代理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13246 2026-01-19 cs.CL cs.CY 84%

When People are Floods: Analyzing Dehumanizing Metaphors in Immigration Discourse with Large Language Models

当人们是洪水:利用大型语言模型分析移民话语中的去人性化隐喻

Julia Mendelsohn, Ceren Budak

机构 * University of Maryland(马里兰大学) University of Michigan(密歇根大学)

专题命中 领域大模型 :large language model(title);language model(title);分类 cs.CL

AI总结 本文利用大型语言模型分析移民话语中的去人性化隐喻,探讨隐喻、政治意识形态与用户参与之间的关系。

Comments To appear at ACL 2025. Please cite ACL version when proceedings are available

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (2025) 8079-8103

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03436 2026-01-08 astro-ph.IM cs.AI 84%

MARVEL: A Multi Agent-based Research Validator and Enabler using Large Language Models

MARVEL:基于大语言模型的多智能体研究验证器与促进器

Nikhil Mukund, Yifang Luo, Fan Zhang, Lisa Barsotti, Erik Katsavounidis

机构 * MIT Kavli Institute for Astrophysics and Space Research and LIGO Laboratory(麻省理工学院凯斯利天文与空间研究所及LIGO实验室) Massachusetts Institute of Technology(麻省理工学院) State Key Laboratory of Ocean Sensing & Ocean College(海洋传感国家重点实验室) Zhejiang University(浙江大学) NSF AI Institute for Artificial Intelligence and Fundamental Interactions (IAIFI)(国家科学基金会人工智能与基本相互作用研究所) Cambridge, MA, USA(美国马萨诸塞州剑桥市)

专题命中 领域大模型 :large language model(title);language model(title);分类 cs.AI

AI总结 MARVEL通过结合快速查询路径和深度搜索模式,为科学领域提供可部署的验证器,其在探测器操作内容上显著优于GPT-4o基线。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏