arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31907 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31907 篇

2608.07920 2026-08-11 cs.CV 新提交 90%

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification

伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)

AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07881 2026-08-11 cs.AI cs.CL cs.IT cs.LG math.IT 新提交 90%

GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering

GRACE:用于可扩展混合数据聚类的大语言模型(LLM)基础语义度量空间

Zihua Yang, Zhencheng Xie, Junyang Chen, Liang Xie, Yiqun Zhang, Mengke Li, Yang Lu

机构 * Guangdong University of Technology(广东工业大学) Tsinghua University(清华大学) Peking University(北京大学) Shenzhen University(深圳大学) Xiamen University(厦门大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对混合数据聚类中语义丰富度与可扩展性的矛盾,提出GRACE框架,通过多视角LLM查询实现一次性语义嵌入,兼顾可扩展性与聚类性能,优于11种对比方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03565 2026-08-05 cs.IR 版本更新 90%

Skill Is Not Document: Query-Conditioned Compatibility for LLM Agent Skill Routing

技能不是文档:面向LLM智能体技能路由的查询条件基准与两阶段检索器

Zifei Wang, Wei Wen, Qiang Ji, Keyu Chen, Ruizhi Qiao, Xing Sun

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM智能体技能路由中技能兼容性被忽视的问题,提出Reject-as-Resource Retriever (R3)框架,构建双语基准R3-Skill,并设计两阶段检索系统(R3-Embedding + R3-Reranker)显式建模技能兼容性,显著提升检索效果。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18790 2026-08-05 cs.CR 版本更新 90%

RoguePrompt: Dual-Layer Ciphering for Self-Reconstruction to Circumvent LLM Moderation

RoguePrompt: 双层加密用于自我重建以规避LLM审核

Benyamin Tafreshian

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 RoguePrompt通过双层加密技术实现自我重建,有效规避LLM审核并诱导模型执行禁止指令。

Comments This submission has been withdrawn because it has been superseded by a substantially revised and expanded version, available as arXiv:2607.27373. Please refer to and cite the newer version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15082 2026-08-04 eess.AS 版本更新 90%

From Who Said What to Who They Are: Modular Training-free Identity-Aware LLM Refinement of Speaker Diarization

从谁说了什么到他们是谁:用于说话人 diarization 的无训练模块化身份感知大语言模型优化

Yu-Wen Chen, William Ho, Maxim Topaz, Julia Hirschberg, Zoran Kostic

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对现有 SD+ASR 框架缺乏灵活性与真实说话人身份的问题,提出无训练模块化流水线,结合 SD、ASR 与 LLM 优化低置信度标签,在患者-临床医生数据集上实现 29.7% 相对误差降低,提供完整身份检测流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22952 2026-07-24 cs.SE 版本更新 90%

Sifting the Noise: A Comparative Study of LLM Agents in Vulnerability False Positive Filtering

筛选噪声:LLM代理在漏洞假阳性过滤中的比较研究

Yunpeng Xiong, Ting Zhang

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract)

AI总结 本文比较了三种先进的LLM代理框架在漏洞假阳性过滤中的性能,展示了LLM代理在减少SAST噪声方面的有效性,但指出其效果依赖于模型和漏洞类型,且存在计算成本差异。

Comments To appear in Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04788 2026-07-21 cs.CY 版本更新 90%

From Sycophancy to Deception: A Unified Taxonomy for LLM Spontaneous Misalignment

从幻觉到谋略:一种统一的分类法和基准分析用于LLM欺骗

Jerick Shi, Terry Jingcheng Zhang, Zhijing Jin, Vincent Conitzer

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出统一的LLM欺骗分类法,揭示现有基准在欺骗机制覆盖不足的问题,并为开发者和监管者提供改进建议。

Comments Accepted to ICLR Agents in the Wild: Safety, Security, and Beyond Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02507 2026-07-03 cs.AI cs.CL cs.LG cs.MA 新提交 90%

What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates

当无人注视时LLM智能体在说什么:多智能体辩论中的社会结构与潜在目标涌现

Arman Ghaffarizadeh, Danyal Mohaddes, Aliakbar Izadkhah, Shahriar Noroozizadeh

机构 * Independent Researcher(独立研究员) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出双通道辩论框架,研究社会结构(角色、受众、关系)如何导致LLM智能体在公开与私下(OTR)表达中产生系统性分歧,揭示潜在目标的涌现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20661 2026-06-23 cs.AI cs.CL cs.LG 新提交 90%

From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents

从知道到行动:基准测试LLM代理的自我意识能力

Yifan Li, Shengbin Yue, Boyu Feng, Jinhu Qi, Bo Ke, Zixing Song, Hongru Wang, Zhongyu Wei, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Tencent(腾讯) University of Bristol(布里斯托大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出KAPRO框架和KAware数据集,通过解耦元认知判断与自主执行,评估LLM代理的自我意识能力,发现其与任务成功强相关但在内部能力场景中下降,开源模型易过度使用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16183 2026-06-16 cs.LG cs.AI cs.CL 新提交 90%

LLM-Powered Virtual Population for Demand Simulation and Pricing

基于LLM的虚拟人群用于需求模拟与定价

Chengpiao Huang, Kaizheng Wang

机构 * Columbia University(哥伦比亚大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种LLM驱动的虚拟人群模型,通过混合客户画像和LLM评估购买概率,生成需求分布,支持风险感知定价,在H&M数据集上表现最优。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15136 2026-06-16 cs.PF 新提交 90%

LLMs have Visualization Literacy: Now What? Experiments Exploring LLM Visualization Evaluation Capabilities

LLMs 具备可视化素养:现在呢?探索 LLM 可视化评估能力的实验

Christian Seto, Jacqueline Nguyen, Jiayi Hong, Ross Maciejewski

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 通过实验评估最新 LLM 在可视化素养、指令遵循和图形完整性方面的能力,发现其可视化素养超越人类,但在指令遵循和识别误导性可视化方面仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19011 2026-06-16 cs.CR cs.AI cs.CL cs.LG 版本更新 90%

Do You Really Need a GPU to Guard Your LLM? CPU-Class Classifiers and Multi-Stage Pipelines for Safety Enforcement at Scale

你真的需要GPU来保护你的LLM吗?用于大规模安全执行的CPU级分类器与多阶段流水线

Vasudev Majhi, Dhruv Gupta, Advait Singh, Matthew Barker, Dhruv Kumar

机构 * BITS Pilani(比斯帕利尼大学) Trustwise(Trustwise公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究CPU级分类器(如SVM、梯度提升树)在LLM输入安全检测中的性能,发现其与GPU模型互补,并设计三阶段流水线GuardChain,在80%的分布内查询中达到近峰值精度,降低部署成本。

Comments Under Review. 25 pages, 5 figures, 38 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14199 2026-06-15 cs.CL cs.AI cs.LG 新提交 90%

OdysSim: Building Foundation Models for Human Behavior Simulation

OdysSim: 构建人类行为模拟的基础模型

Xuhui Zhou, Weiwei Sun, Weihua Du, Jiarui Liu, Haojia Sun, Qianou Ma, Tongshuang Wu, Yiming Yang, Maarten Sap

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学语言技术研究所)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出OdysSim,通过SOUL分类法统一62个数据集和23个基准任务,采用混合训练、任务特定强化学习和专家蒸馏,构建8B参数行为基础模型OSim,在多数任务上超越前沿模型,并实现更类人输出和零样本迁移。

Comments 34 pages. Code: https://github.com/sunnweiwei/OdysSim ; Models and data: https://huggingface.co/collections/cmu-lti/odyssim

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06210 2026-06-09 cs.CL cs.AI cs.CY cs.LG 版本更新 90%

Distributional Open-Ended Evaluation of LLM Cultural Value Alignment Based on Value Codebook

基于价值码本的LLM文化价值对齐的分布式开放式评估

Jaehyeok Lee, Xiaoyuan Yi, Jing Yao, Hyunjin Hwang, Roy Ka-Wei Lee, Xing Xie, JinYeong Bak

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DOVE框架,通过率失真变分优化构建价值码本,利用不平衡最优传输度量分布对齐,解决LLM文化价值评估中的构造-组成-上下文挑战。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05308 2026-06-05 cs.LG cs.AI cs.CL cs.IR stat.AP 90%

Statistically Reliable LLM-Based Ranking Evaluation via Prediction-Powered Inference

基于预测驱动推断的统计可靠LLM排序评估

Abhishek Divekar

机构 * Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PRECISE框架,将预测驱动推断扩展到排序评估指标,通过结合少量人工标注和大量LLM判断实现无偏估计,并在ESCI基准和实际系统中验证了有效性。

Comments Accepted at ACL 2026 - GEM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22891 2026-06-03 cs.LG cs.AI cs.CL 90%

Quantifying and Mitigating Self-Preference Bias of LLM Judges

量化与缓解LLM评判者的自我偏好偏差

Jinming Yang, Zheng Hu, Chuxian Qiu, Zhenyu Deng, Xinshan Jiao, Tao Zhou

机构 * CompleX Lab, School of Computer Science and Engineering, University of Electronic Science and Technology of China, Chengdu, China(复杂实验室、计算机科学与工程学院、电子科技大学、成都、中国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出自动化框架量化LLM自我偏好偏差,并通过认知负荷分解的多维评估策略平均降低31.5%的偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18102 2026-06-02 cs.LG cs.AI cs.CL stat.ME 90%

CapBencher: Give Your LLM Benchmark a Built-in Alarm for Test-Set Overfitting

CapBencher: 为您的LLM基准测试内置测试集过拟合警报

Takashi Ishida, Thanawat Lodkaew, Ikko Yamane

机构 * National Institute of Advanced Industrial Science and Technology, Japan(日本国家先进工业科学与技术研究院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CapBencher方法,通过向答案注入随机性(准备多个逻辑正确但仅一个作为解)来降低贝叶斯准确率,从而在公开基准测试时防止测试集过拟合并检测泄露或作弊。

Comments ICML 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28999 2026-05-29 cs.CR cs.AI cs.CL cs.LG 90%

Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening

测量基于LLM的简历筛选中真实世界的提示注入攻击

Mohan Zhang, Yuqi Jia, Zhen Tan, Steven Jiang, Neil Zhenqiang Gong, Tianlong Chen, Dawn Song

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Duke University(杜克大学) Arizona State University(亚利桑那州立大学) hireEZ University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究首次系统性地分析了基于LLM的简历筛选应用中的提示注入攻击,通过设计专用检测器对约20万份真实简历进行测量,发现约1%的简历包含隐藏的提示注入,且近年来其流行度显著增加。

Comments Published in USENIX Security Symposium 2026; Code and artifacts are available at https://github.com/UNITES-Lab/resume-injection-measurement

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25955 2026-05-26 cs.CL cs.AI cs.LG 90%

QUIET: A Multi-Blank Cascaded Story Cloze Benchmark for LLM Creative Generation Capability

QUIET: 面向LLM创意生成能力的多空白级联故事完形填空基准

Bo Zou, Chao Xu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出QUIET基准,通过多空白级联故事完形填空和基于信息论的自动评分协议,客观评估大语言模型的创意生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23273 2026-05-25 cs.MA 90%

Self-Refining Topology Optimization via an LLM-Based Multi-Agent Framework

基于LLM多智能体框架的自优化拓扑优化

Hyunjee Park, Hayoung Chung

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)

AI总结 提出TopOptAgents多智能体系统,通过LLM协作与迭代自优化循环,自动化拓扑优化的决策与设计过程,尤其对文献覆盖不足的问题类效果显著。

Comments 28 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22855 2026-05-25 cs.GT cs.AI cs.CL cs.LG 90%

PrefBench: Evaluating Zero-Shot LLM Agents in Hidden-Preference Personalized Pricing Negotiations

PrefBench:评估隐藏偏好个性化定价谈判中的零样本LLM智能体

Yingjie Lei

机构 * University of Aberdeen(阿伯丁大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PrefBench基准,通过隐藏偏好模拟评估零样本LLM智能体在个性化定价谈判中的利润表现,发现LLM虽能达成高交易率但利润远低于简单启发式方法。

Comments 24 pages, 3 figures, 5 tables. Code is available at https://github.com/ChaosTheProducer/PrefBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22087 2026-05-22 cs.SE cs.CR 90%

Automated Repair of TEE Partitioning Issues via DSL-Guided and LLM-Assisted Patching

通过DSL引导和LLM辅助的修补自动修复TEE分区问题

Chengyan Ma, Jieke Shi, Ruidong Han, Ye Liu, Feng Li, Yuqing Niu, David Lo

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出TEERepair框架,通过DSL编码修补规则和LLM推理代码语义,自动修复TEE应用中的分区问题,实现87.6%的修复成功率。

Comments Accepted by the ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21569 2026-05-22 cs.HC 90%

When Support Escalates Distress: Regulation and Escalation in LLM Responses to Venting and Advice-Seeking

当支持加剧压力:在LLM对倾诉和寻求建议的回应中的调节与加剧

Vivienne Bihe Chi, Adithya V Ganesan, Ryan L Boyd, Lyle Ungar, Sharath Chandra Guntuku

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究探讨了大型语言模型在不同求助风格(倾诉与寻求建议)下对压力的调节与加剧作用,通过分析Reddit帖子发现LLM回应中调节和加剧是独立的维度,且不同角色设定(默认、朋友、治疗师)对调节和加剧的影响不同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10323 2026-05-12 cs.IR 90%

Every Preference Has Its Strength: Injecting Ordinal Semantics into LLM-Based Recommenders

每种偏好都有其强度:将序数语义注入基于LLM的推荐系统

Jiwon Jeong, Donghee Han, Sungrae Hong, Woosung Kang, Mun Yong Yi

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出OSA框架,通过建模用户反馈来显式整合偏好强度,保留序数语义以提升推荐系统性能。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09360 2026-05-12 cs.LG cs.AI cs.CL cs.SE 90%

Your Simulation Runs but Solves the Wrong Physics: PDE-Grounded Intent Verification for LLM-Generated Multiphysics Simulation Code

你的模拟运行但解错了物理:基于PDE的意图验证用于LLM生成的多物理场模拟代码

Zhenghan Song, Yulong Liu, Cheng Wan, Chenjun Li, Lingfu Liu, Yunyi Li, Congcong Yuan

机构 * Cornell University(康奈尔大学) Columbia University(哥伦比亚大学) Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于PDE的意图验证方法,用于检查LLM生成的多物理场模拟代码是否符合预期物理,通过确定性重构和比较PDE结构提升代码的意图保真度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07395 2026-05-11 cs.LG cs.AI cs.CL 90%

Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts

多LLM路由中的不可解上限:评估 artifacts 的实证研究

Saloni Garg, Amit Sagtani

机构 * Independent Researcher(独立研究者) San Francisco State University(圣弗朗西斯科州立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过206000个查询-模型对研究多级LLM路由,发现大量不可解问题源于评估 artifacts,如判断偏差、截断和格式不匹配,并提出改进方法以减少不可解性。

Comments 12 pages, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06486 2026-05-08 cs.CR 90%

Autonomous Adversary: Red-Teaming in the age of LLM

自主对抗者:在LLM时代进行红队测试

Mohammad Mamun, Mohamed Gaber, Scott Buffett, Sherif Saad

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)

AI总结 本文探讨了语言模型代理在红队操作中的应用,通过MITRE ATT&CK框架分析其与核心进攻功能的交集,并评估LLM代理在治理和现实评估中的优缺点。研究通过两个横向移动场景对比三种操作模式,发现专家定义的行动计划任务完成率最高,但所有模式均存在频繁失败问题。

Comments Accepted at ACISP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22417 2026-04-27 cs.CY 90%

Trust as a Situated User State in Social LLM-Based Chatbots: A Longitudinal Study of Snapchat's My AI

信任作为社交LLM聊天机器人中的情境用户状态:对Snapchat My AI的纵向研究

Annie Landerberg, Kari Flatmo, Alan Said

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨了用户在社交LLM聊天机器人中信任的形成机制,发现信任受感知能力、对话行为、人类相似性、透明度、隐私担忧及主机平台信任等因素影响,强调信任是动态变化的交互过程。

Comments Accepted to 34th ACM International Conference on User Modeling, Adaptation and Personalization (UMAP'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18835 2026-04-22 cs.CL cs.AI cs.LG 90%

Semantic Needles in Document Haystacks: Sensitivity Testing of LLM-as-a-Judge Similarity Scoring

语义针在文档 haystack 中:LLM-as-a-Judge 的相似性评分敏感性测试

Sinan G. Aksoy, Alexandra A. Sabrio, Erik VonKaenel, Lee Burke

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) Washington University in St. Louis(华盛顿大学圣路易斯分校) Humana Inc.(Humana公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一个可扩展的多因素实验框架,系统探讨LLM对文档配对中细微语义变化的敏感性。通过针在 haystack 中的类比,测试不同扰动类型、上下文类型、针位置和文档长度对五种LLM相似性评分的影响,揭示LLM在文档内位置偏倚、上下文相关性对评分的影响及模型间的评分分布差异。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15588 2026-04-20 cs.CL cs.AI cs.HC cs.LG 90%

"Excuse me, may I say something..." CoLabScience, A Proactive AI Assistant for Biomedical Discovery and LLM-Expert Collaborations

请问,我可以发言吗... CoLabScience,一种用于生物医学发现和LLM专家协作的主动AI助手

Yang Wu, Jinhong Yu, Jingwei Xiong, Zhimin Tao, Xiaozhong Liu

机构 * Worcester Polytechnic Institute(沃斯特理工大学) University of California, Davis(加州大学戴维斯分校) Jiangsu University(江苏大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoLabScience,一种主动AI助手,通过及时的上下文感知干预提升生物医学领域AI与人类专家的协作效率,PULI框架在流式科学讨论中实现精准干预,实验表明其在干预精度和协作任务实用性上优于现有基线。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏