arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 61 篇

2605.17979 2026-05-19 econ.EM 92%

Comment on Scientific production in the era of large language models

对大语言模型时代科研产出的评论

Thomas Renault, Antonin Bergeaud, Clément Bosquet

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 该研究探讨了在采用大语言模型(LLMs)后研究人员预印本产出是否增加,指出采用时间判定规则与产出存在机械关联,并通过模拟展示了即使没有真实LLM采用信息,事件研究仍可能显示积极的后事件动态。

Comments Comment on arXiv:2601.13187 [10.1126/science.adw3000]

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14506 2026-05-19 cs.CY cs.CL 92%

Compounding Disadvantage: Auditing Intersectional Bias in LLM-Generated Explanations Across Indian and American STEM Education

叠加劣势:在印度和美国STEM教育中对LLM生成解释中的交叉偏见进行审计

Amogh Gupta, Niharika Patil, Sourojit Ghosh, SnehalKumar, S Gaikwad

机构 * Society-Centered AI Lab(以社会为中心的人工智能实验室) University of Washington(华盛顿大学)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在不同文化背景下对边缘化学生群体的系统性歧视,通过审计四个LLM模型发现,多重维度的边缘化导致成绩差距扩大,偏见在精英机构中持续存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16407 2026-05-19 cs.LO cs.CL cs.CR cs.PL 92%

Proof-Carrying Certificates for LLM Pipelines: A Trust-Boundary Architecture

为LLM流水线提供证明携带证书:一种信任边界架构

George Koomullil

机构 * Ascendr, Inc.(Ascendr公司)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种验证大型语言模型周围确定性结构计算的框架,扩展了Lean 4信任边界架构至现代LLM流水线的通用接口。核心贡献包括三个证书家族和两个操作符,用于高风险部署中的专利检索、金融监管等场景。

Comments 83 pages, 1 figure, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16347 2026-05-19 cs.LG 92%

HPC-LLM: Practical Domain Adaptation and Retrieval-Augmented Generation for HPC Support

HPC-LLM: 实用领域适应与检索增强生成用于HPC支持

Nourin Shahin, Izzat Alsmadi

机构 * Texas A&M University(德克萨斯大学)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出HPC-LLM,通过检索增强和领域适应支持HPC工作流,利用QLoRA实现轻量级领域适应,实验表明其在低资源下性能接近大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01839 2026-05-19 cs.MA 91%

Beyond Static Responses: Multi-Agent LLM Systems as a New Paradigm for Social Science Research

超越静态响应:多智能体LLM系统作为社会科学研究的新范式

Jennifer Haase, Sebastian Pokutta

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文探讨了LLM系统从静态工具向完全智能体系统转变的潜力,提出了一种结构化框架来理解LLM智能体在社会科学研究中的多样化应用,从简单的数据处理器到复杂的多智能体系统,能够模拟涌现的社会动态,并指出在技术边界、方法论和伦理责任方面面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16377 2026-05-19 cs.DL cs.AI cs.LG 91%

CheckSupport: A Local LLM-Powered Tool for Automated Manuscript Submission Checklist Selection and Completion

CheckSupport:一种基于本地LLM的自动化手稿提交检查清单选择与完成工具

Satvik Tripathi, Don Enwerem, Kevin Song, Kristian Quevada, Jacinta Arnold, Tessa S. Cook

机构 * Department of Radiology, Perelman School of Medicine at University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学学院放射科) Department of Computer Science, Drexel University(德雷塞尔大学计算机科学系) Department of Computer and Information Science, School of Engineering and Applied Science, University of Pennsylvania(宾夕法尼亚大学工程与应用科学学院计算机与信息科学系) Department of Radiology, Cooper University Hospital(科珀大学医院放射科) University of California Davis Graduate School of Management(加州大学戴维斯分校管理研究生院)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出CheckSupport,利用本地LLM自动化选择和完成检查清单,提升科研报告的透明度和可重复性。系统通过分阶段提示策略实现高准确率,运行在CPU上,每篇手稿耗时12.5秒,准确率达90%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16307 2026-05-19 cs.LG cond-mat.mtrl-sci cs.AI physics.chem-ph 91%

Perovskite-R1: a domain-specialized large language model for intelligent discovery of precursor additives and experimental design

钙钛矿-R1:一个专门领域的大型语言模型,用于智能发现前驱体添加剂和实验设计

Xin-De Wang, Zhi-Rui Chen, Peng-Jie Guo, Ze-Feng Gao, Cheng Mu, Zhong-Yi Lu

机构 * School of Physics, Renmin University of China(中国人民大学物理学院) School of Chemistry and Life Resource, Renmin University of China(中国人民大学化学与生命资源学院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究提出Perovskite-R1,一个专门用于发现钙钛矿太阳能电池前驱体添加剂和实验设计的大型语言模型,通过系统挖掘和整理1232篇高质量科学文献,并整合33269种候选材料,构建了领域特定的指令微调数据集,从而提升材料发现的效率。

Comments 24 pages; 5 figures

Journal ref Communications Materials 7, 86 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12253 2026-05-19 cs.AI 90%

A Scoping Review of Large Language Model-Based Pedagogical Agents

基于大语言模型的教育代理的综述

Shan Li, Juan Zheng

机构 * Department of Education and Human Services, College of Education, Lehigh University(教育与人类服务学院,教育学院,莱维大学) Department of Community and Global Health, College of Health, Lehigh University(社区与全球健康学院,健康学院,莱维大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文综述了大语言模型在教育环境中的应用,探讨了教育代理的设计维度、发展趋势及研究空白,为未来研究提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18630 2026-05-19 cs.AI physics.comp-ph 89%

SCICONVBENCH: Benchmarking LLMs on Multi-Turn Clarification for Task Formulation in Computational Science

SCICONVBENCH: 评估LLM在计算科学任务公式化中的多轮澄清能力

Nithin Somasekharan, Youssef Hassan, Shiyao Lin, Gihan Panapitiya, Patrick Emami, Anurag Acharya, Sameera Horawalavithana, Shaowu Pan

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) University of Texas at Arlington(德克萨斯大学阿灵顿分校) Pacific Northwest National Laboratory(太平洋西北国家实验室) National Renewable Energy Laboratory(国家可再生能源实验室)

专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出SCICONVBENCH基准,用于评估LLM在计算科学任务公式化中的多轮澄清能力,重点在于获取缺失信息和解决请求中的矛盾,通过结构化任务本体和基于标准的评估框架,系统测量LLM在澄清行为、对话基础性和最终规格忠实度三个维度上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18025 2026-05-19 cs.AI 89%

TeleCom-Bench: How Far Are Large Language Models from Industrial Telecommunication Applications?

TeleCom-Bench: 大型语言模型在工业电信应用中还有多远?

Jieting Xiao, Yun Lin, Huizhen Qiu, Rui Ma, Chen Zhong, Dongyang Xu, Xiao Long, Chaoyu Zhang, Qiaobo Hao, Ding Zou, Zhiguo Yang, Yanqin Gao, Fang Tan

机构 * ZTE Corporation(中兴通讯)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 本文提出TeleCom-Bench,一个包含12个评估集和22678个精选样本的全面基准,旨在评估大型语言模型在电信领域的综合能力,揭示其在工业流程中的执行能力缺口。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08439 2026-05-19 cs.CL 89%

Can Language Models Identify Side Effects of Breast Cancer Radiation Treatments?

语言模型能否识别乳腺癌放射治疗的副作用?

Natalie Seah, Danielle S. Bitterman, Daphna Spiegel, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) Mass General Brigham Dana-Farber Cancer Institute Harvard Medical School(麻省总医院达纳-法伯癌症研究所哈佛医学院)

专题命中 领域大模型 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);prompting(abstract)

AI总结 本研究探讨了语言模型在识别乳腺癌放射治疗副作用中的能力,通过评估多种语言模型在不同提示下的表现,揭示了其在精度、召回率及罕见长期副作用识别上的局限性,并提出了改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17228 2026-05-19 cs.CL 88%

Artificial Intolerance: Stigmatizing Language in Clinical Documentation Skews Large Language Model Decision-Making

人工不耐受:临床文档中的污名化语言扭曲大型语言模型决策

Jen-tse Huang, Didi Zhou, Faith Kamau, Amy Oh, Anne R. Links, Mark Dredze, Mary Catherine Beach, Somnath Saha

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型在处理包含污名化语言的临床文档时是否继承并传播人类偏见,发现所有模型在决策上都存在显著偏见,且对语言框架敏感,需加强算法防护以确保公平性和鲁棒性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18738 2026-05-19 cs.AI 87%

What Does the AI Doctor Value? Auditing Pluralism in the Clinical Ethics of Language Models

人工智能医生重视什么?审查语言模型临床伦理中的多元主义

Payal Chandak, Victoria Alkin, David Wu, Maya Dagan, Taposh Dutta Roy, Maria Clara Saad Menezes, Ayush Noori, Nirali Somia, John S. Brownstein, Ran Balicer, Rebecca W. Brendel, Noa Dagan, Isaac S. Kohane, Gabriel A. Brat

专题命中 领域大模型 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 本文研究了大型语言模型在医疗建议中带来的伦理价值观,提出了一种审计框架来评估医疗AI中的价值多元主义,揭示了模型在决策中对患者自主权的潜在忽视,并强调了多模型协同的重要性。

Comments Code and data available upon request via https://hvp.global/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14634 2026-05-19 cs.HC cs.AI 87%

Human-LLM Compound System for Scientific Ideation through Facet Recombination and Novelty Evaluation

基于领域重构与新颖性评估的人机协同科学构想系统

Marissa Radensky, Simra Shahid, Raymond Fok, Pao Siangliulue, Tom Hope, Daniel S. Weld

机构 * University of Washington(华盛顿大学) Microsoft(微软) Allen Institute for AI(人工智能研究院)

专题命中 领域大模型 :LLM(title,summary_cn);分类 cs.AI

AI总结 Scideator通过领域重构与新颖性评估模块,帮助用户在科学构想中生成更具创造性的想法,实验显示其在想法探索和表达性方面优于传统LLM方法。

Comments Updated based on most recent submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18410 2026-05-19 cs.DL 87%

From Node2Vec to GPT-based GraphRAG: scientific impact prediction across graph and language models

从Node2Vec到基于GPT的GraphRAG:跨图神经网络和语言模型的科学影响预测

Adilson Vital, Filipi N. Silva, Diego R. Amancio

专题命中 领域大模型 :LLM(summary_cn,abstract);language model(title)

AI总结 本文提出了一种基于图和语言模型的科学影响预测方法,通过比较图基和LLM基方法,发现文本信号和结构信号互补,但检索增强必须谨慎评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17926 2026-05-19 cs.SE 87%

LLM-Based Static Verification of Code Against Natural-Language Requirements: An Industrial Experience Report

基于大语言模型的代码对自然语言要求的静态验证:一项工业经验报告

Zhi Quan Zhou, Dave Towey, Tsong Yueh Chen

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于大语言模型的两阶段工作流,用于在智能汽车网络安全案例中验证代码是否符合自然语言要求,通过引入结构化中间表示减少幻觉和输出变异,提升静态分析的准确性与解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17075 2026-05-19 cs.CR 86%

A Red Teaming Framework for Evaluating Robustness of AI-enabled Security Orchestration, Automation, and Response Systems

一种用于评估AI增强的安全编排、自动化和响应系统鲁棒性的红队框架

Ayan Javeed Shaikh, Nathaniel D. Bastian, Ankit Shah

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种结合大语言模型和强化学习的自主红队框架,用于评估企业网络中自主防御系统的鲁棒性,展示了单一LLM代理在多阶段攻击中的不足以及领域特定安全模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14215 2026-05-19 cs.IR cs.AI 85%

PriHA: A RAG-Enhanced LLM Framework for Primary Healthcare Assistant in Hong Kong

PriHA:一种增强型大语言模型框架,用于香港初级医疗服务助手

Richard Wai Cheung Chan, Shanru Lin, Ya-nan Ma, Hao Chen, Liangjun Jiang, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) Haikou Affiliated Hospital of Central South University Xiangya School of Medicine(中南大学湘雅医学院海口附属医院) Sun Yat-Sen University Cancer Center(中山大学肿瘤中心)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PriHA框架,通过检索增强生成技术解决香港初级医疗服务中指南碎片化问题,提升信息访问准确性与清晰度。

Comments Accepted to PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01092 2026-05-19 cs.AI cs.LG 85%

The Alien Space of Science: Sampling Coherent but Cognitively Unavailable Research Directions

科学的异类空间:采样连贯但认知不可用的研究方向

Alejandro H. Artiles, Martin Weiss, Levin Brinkmann, Iyad Rahwan, Bernhard Schölkopf, Christopher Pal, Hugo Larochelle, Anirudh Goyal, Nasim Rahaman

机构 * Max Planck Institute for Human Development(马克斯·普朗克人类发展研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Polytechnique Montreal(蒙特利尔理工学院) CIFAR AI Chair(CIFAR人工智能主席) Mila – Quebec AI Institute(魁北克人工智能研究所) Tiptree Systems(Tiptree系统)

专题命中 领域大模型 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种框架,通过分解论文为概念单元并学习两个互补模型,采样出连贯但认知不可用的研究方向,扩展了LLM生成的潜在词汇库。

Comments 10 main pages, 42 appendix pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12012 2026-05-19 cs.AI 84%

LegalCheck: Retrieval- and Context-Augmented Generation for Drafting Municipal Legal Advice Letters

LegalCheck: 基于检索和上下文增强的生成方法用于起草市政法律建议信

Virgill van der Meer, Julien Rossi

机构 * Municipality of Amsterdam(阿姆斯特丹市) University of Amsterdam(阿姆斯特丹大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出LegalCheck系统,通过检索增强生成(RAG)和上下文增强生成(CAG)技术,自动起草市政法律回应信,提高法律部门在人员短缺、案件量增加和合规压力下的工作效率,确保法律一致性和准确性。

Comments Accepted at ICAIL 2026 as Short Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21035 2026-05-19 cs.AI cs.LG cs.MA q-bio.GN 82%

GenoMAS: A Multi-Agent Framework for Scientific Discovery via Code-Driven Gene Expression Analysis

GenoMAS:通过代码驱动的基因表达分析进行科学发现的多智能体框架

Haoyang Liu, Yijiang Li, Haohan Wang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出GenoMAS多智能体框架,通过类型消息传递协议协调六个专门的LLM代理,以实现基因表达数据的高效处理和科学发现,其在数据预处理和基因识别任务上均优于现有方法。

Comments 51 pages (14 pages for the main text, 10 pages for references, and 27 pages for the appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19953 2026-05-19 cs.CV 82%

Supervise Less, See More: Training-free Nuclear Instance Segmentation with Prototype-Guided Prompting

少监督,多观察:基于原型引导的提示方法实现无训练核实例分割

Wen Zhang, Qin Ren, Wenjing Liu, Haibin Ling, Chenyu You

机构 * Stony Brook University(石溪大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 领域大模型 :prompting(title,abstract);foundation model(abstract)

AI总结 本文提出SPROUT框架,通过组织学先验知识构建滑片特定参考原型,利用部分最优传输方案指导特征对齐,使SAM模型无需训练即可实现精准核分割。

Comments ICML 2026; 44 pages, 25 figures, 26 tables; Code at https://github.com/Y-Research-SBU/SPROUT

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17976 2026-05-19 cs.AI math.OC 81%

Unleashing LLMs in Bayesian Optimization: Preference-Guided Framework for Scientific Discovery

释放大语言模型于贝叶斯优化:用于科学发现的偏好引导框架

Xinzhe Yuan, Zhuo Chen, Jianshu Zhang, Huan Xiong, Nanyang Ye, Yuqiang Li, Qinying Gu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型的贝叶斯优化框架LGBO,通过在优化循环中持续整合大语言模型的语义推理,提高了科学发现中的优化效率和收敛速度。

Comments Published as a conference paper at ICLR 2026. 10 pages main paper, 21 pages appendix, 26 figures

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04070 2026-05-19 cs.CL 81%

T-FIX: Text-Based Explanations with Features Interpretable to eXperts

T-FIX:基于文本的可解释性方法,具备可解释的专家特征

Shreya Havaldar, Weiqiu You, Chaehyeon Kim, Anton Xue, Helen Jin, Marco Gatti, Bhuvnesh Jain, Helen Qu, Amin Madani, Daniel A. Hashimoto, Gary E. Weissman, Rajat Deo, Sameed Khatana, Lyle Ungar, Eric Wong

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Computer Science, University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Department of Physics and Astronomy, University of Pennsylvania(宾夕法尼亚大学物理与天文学系) Flatiron Institute(Flatiron研究所) Department of Surgery, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院外科系) Division of Pulmonary, Allergy, and Critical Care, Perelman School of Medicine, University of Pennsylvania(宾夕菲亚大学佩雷尔曼医学院呼吸、过敏与危重医学科) Division of Cardiovascular Medicine, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院心血管医学科) Department of Surgery, University of Toronto(多伦多大学外科系) University Health Network(大学健康网络)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出T-FIX框架,用于评估LLM生成的解释是否符合专家的推理方式,通过七个科学任务和三个领域进行验证,实现了自动且可定制的专家对齐评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23986 2026-05-19 cs.AI 81%

TusoAI: Agentic Optimization for Scientific Methods

TusoAI: 科学方法的代理优化

Alistair Turcan, Kexin Huang, Lei Li, Martin Jinye Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Phylo

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TusoAI通过整合领域知识和迭代优化,提升科学任务中计算方法的性能,优于现有专家方法和科学AI代理,在单细胞RNA测序数据去噪和卫星地球监测等任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16605 2026-05-19 cs.HC cs.AI 81%

PromptDecipher: Supporting AI Tutor Authoring Through Editable Simulated Interactions

PromptDecipher:通过可编辑的模拟交互支持AI辅导作者

Miina Koyama, Ruiwei Xiao, John Stamper

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 领域大模型 :prompting(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PromptDecipher通过直接纠正交互重构作者流程,帮助教师成为学习设计师和QA工程师,提升AI辅导作者的质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25723 2026-05-19 cs.CL cs.AI 81%

Natural-Language Agent Harnesses

自然语言代理Harness

Linyue Pan, Lexiao Zou, Shuo Guo, Jingchen Ni, Hai-Tao Zheng

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 领域大模型 :language agent(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出自然语言代理Harness(NLAH)作为一种可执行的自然语言对象,用于描述任务运行的Harness策略,并引入Intelligent Harness Runtime(IHR)作为共享运行时,能够将这些文档解释为代理调用、交接、状态更新、验证门和成果合同。实验表明,NLAH在编码、终端使用和计算机使用基准测试中表现与代码和提示实现相当,同时暴露了更短的静态Harness策略。

Comments revise paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23978 2026-05-19 cs.LG cs.CL cs.CY cs.SI 81%

LLM Agents Are the Antidote to Walled Gardens

大语言模型代理是封闭生态系统的解药

Samuele Marro, Philip Torr

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Institute for Decentralized AI(去中心化人工智能研究所)

专题命中 领域大模型 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过大语言模型代理实现通用互操作性,打破封闭平台垄断,促进数据端到端迁移,同时探讨其带来的安全与法律挑战。

Comments Published at the ICML 2026 Position Paper track

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04083 2026-05-19 cs.HC cs.GR 80%

VOICE: Visual Oracle for Interaction, Conversation, and Explanation

VOICE:交互、对话和解释的视觉 oracle

Donggang Jia, Alexandra Irger, Lonni Besancon, Ondrej Strnad, Deng Luo, Johanna Bjorklund, Anders Ynnerman, Ivan Viola

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出VOICE,一种将大语言模型的对话能力与交互式探索可视化相结合的科学传播新方法,通过多机器人系统实现任务分配、指令提取和内容生成,结合文本到可视化方法和自然语言交互,实现实时3D模型导航和操控,并在分子可视化领域验证其有效性。

Journal ref IEEE Transactions on Visualization and Computer Graphics 31(10):8828-8845, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07900 2026-05-19 cs.AI 79%

EveryQuery: Zero-Shot Clinical Prediction via Task-Conditioned Pretraining over Electronic Health Records

EveryQuery: 通过电子健康记录上的任务条件预训练实现零样本临床预测

Payal Chandak, Gregory Kondas, Liat Antwarg Friedman, Isaac Kohane, Matthew McDermott

机构 * Harvard-MIT HST(哈佛-麻省理工学院HST) Columbia University(哥伦比亚大学) Harvard Medical School(哈佛医学院)

专题命中 领域大模型 :pretraining(title);foundation model(abstract);分类 cs.AI

AI总结 本文提出EveryQuery,一种通过任务条件预训练实现零样本临床预测的电子健康记录基础模型,通过直接估计未来窗口内结果发生的可能性,而非生成未来事件,从而在多个预测任务中优于自回归基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏