arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-29 至 2026-05-29 共收录 43 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 43 篇

2605.29170 2026-05-29 cs.CL cs.AI 92%

UA-Legal-Bench: A Benchmark for Evaluating Large Language Models on Ukrainian Legal Reasoning

UA-Legal-Bench:评估大语言模型在乌克兰法律推理上的基准

Volodymyr Ovcharov

机构 * SecondLayer

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 针对法律NLP基准以英语为中心的问题,构建了基于乌克兰法院判决的五个任务基准,评估11个LLM,发现少样本提示效果因任务而异,且在不平衡任务中准确率具有误导性。

Comments 13 pages, 5 figures, 4 tables. Data: https://huggingface.co/datasets/overthelex/ua-legal-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29966 2026-05-29 cs.AI 92%

Compass: Navigating Global Marine Lead Data Integration through Expert-Guided LLM Agent

Compass: 通过专家引导的LLM代理导航全球海洋铅数据整合

Yiming Liu, Bin Lu, Meng Jin, Ziyuan Sang, Shuo Jiang, Lei Zhou, Xinbing Wang, Chenghu Zhou, Jing Zhang

机构 * School of Information Science Electronic Engineering,\ Jiao Tong University Shanghai China School of Artificial Intelligence,\ Jiao Tong University Shanghai China State Key Laboratory of Estuarine Coastal Research,\ China Normal University Shanghai China School of Oceanography,\ Jiao Tong University Shanghai China Institute of Geographical Science Natural Resources Research,\ Academy of Sciences Beijing China Electronic Engineering,\ Jiao Tong University School of Artificial Intelligence,\ Jiao Tong University Coastal Research,\ China Normal University School of Oceanography,\ Jiao Tong University Natural Resources Research,\ Academy of Sciences

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对海洋铅数据分散于非结构化论文中的问题,提出专家引导的LLM代理框架Compass,结合知识树分解任务,从23万篇论文中提取3751条铅记录,构建最大海洋铅数据库,准确率达92%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29322 2026-05-29 cs.IR 91%

ACE: Anisotropy-Controllable Embedding for LLM-enhanced Sequential Recommendation

ACE: 面向LLM增强序列推荐的可控各向异性嵌入

Dongcheol Lee, Hye-young Kim, Jongwuk Lee

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM生成嵌入的强各向异性问题,提出ACE方法,通过线性自编码器结合L2正则化与重构损失控制嵌入分布,平衡几何均匀性与语义保持,在序列推荐中提升性能。

Comments Accepted by SIGIR 2026. 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27377 2026-05-29 cs.CL cs.AI cs.IR 90%

Enhancing LLM Medical Coding with Structured External Knowledge

利用结构化外部知识增强LLM医学编码

Yidong Gan, David D. Nguyen, Yang Lin, Peter Zhong, Thanh Vu, Long Duong, Yuan-Fang Li

机构 * Oracle Health and AI(Oracle健康与AI)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出RAG-Coding方法,通过将ICD表格列表编码为知识图谱并提炼指南摘要,无需训练即可增强LLM的医学编码能力,在MDACE和MDACE-2025数据集上显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30144 2026-05-29 cs.AI cs.MA 90%

AgentSchool: An LLM-Powered Multi-Agent Simulation for Education

AgentSchool:基于LLM的多智能体教育模拟系统

Yulei Ye, Wenhao Li, Zhong Wen, Yunshu Huang, Yichen Hu, Zifan Wei, Yige Wang, Xinyu Xie, Haoxuan Yang, Yanjun Huang, Ruijia Li, Hong Qian, Yu Song, Bo Jiang, Bingdong Li, Lijun Li, Bo Zhang, Pinlong Cai, Xingcheng Xu, Shuangye Chen, Xia Hu, Liang He, Aimin Zhou, Jingjing Qu, Jing Shao, Xiangfeng Wang

机构 * Shanghai Institute of AI for Education(上海人工智能教育研究院) School of Computer Science and Technology(计算机科学与技术学院) East China Normal University(东华大学) School of Design(设计学院) Faculty of Education(教育学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 提出AgentSchool,一种LLM驱动的多智能体模拟器,通过可成长的学生智能体(带知识图谱、思维工作流和错误概念)与自适应教师智能体(基于最近发展区)模拟学习过程,支持多尺度模拟,实验验证了其生成差异化掌握轨迹和符合课堂社会理论的行为模式。

Comments 39 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28897 2026-05-29 cs.AI cs.MA 90%

Review Arcade: On the Human Alignment and Gameability of LLM Reviews

Review Arcade: 关于LLM评审的人类对齐与可博弈性

Hans Ole Hatzel, Sebastian Steindl, Jan Strich

机构 * Language Technology Group, University of Hamburg, Germany(汉堡大学语言技术小组) Hub of Computing and Data Science (HCDS), University of Hamburg, Germany(汉堡大学计算与数据科学中心) OTH Amberg-Weiden, Germany(阿姆伯-魏登工业大学)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 通过实验评估LLM生成论文评审与人类评审的对齐程度,并发现作者可根据LLM评审迭代修改论文以提升评分(最多35%的论文显著提高),揭示了LLM评审的可博弈性。

Comments Under Review EMNLP 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30258 2026-05-29 cs.MA 89%

EASE Configuration Facilitates A Reproducible Science of LLM Social Simulations

EASE配置促进LLM社会模拟的可重复科学

Sneheel Sarangi, Maximilian Puelma Touzel, Aurélien Bück-Kaeffer, Zachary Yang, Jean-François Godbout, Reihaneh Rabbany

专题命中 领域大模型 :LLM(title,title_cn)

AI总结 提出EASE模块化框架(环境、智能体、模拟引擎、评估指标)并构建SiliSocS开源沙盒,通过三个案例研究验证其在高可配置、可重复的LLM社会模拟中的效用。

Comments 22 pages, 5 figures, under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29141 2026-05-29 cs.IR cs.AI 89%

Toward User Preference Alignment in LLM Recommendation via Explicit Context Feedback

通过显式上下文反馈实现LLM推荐中的用户偏好对齐

Weizhi Zhang, Wooseong Yang, Yuxin Cui, Zhaohui Guo, Hins Hu, Liangwei Yang, Henry Peng Zou, Qifei Wang, Hanqing Zeng, Jiayi Liu, Yinglong Xia, Philip S. Yu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Meta

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文主张在基于大语言模型的推荐系统中优先利用显式上下文反馈(如评论文本)来对齐用户偏好,提升推荐的个性化和可解释性。

Comments Published in CogMI 2025. https://ieeexplore.ieee.org/abstract/document/11417068

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28866 2026-05-29 cs.LG cs.AI 88%

Continuity and Ordinality Matter: Constraining Time Series Tokens for Effective Time Series Analysis with Large Language Models

连续性与序数性至关重要:利用大语言模型进行有效时间序列分析的时间序列令牌约束

Musheng Li, Ziying Zhang, Cheng jin, Yuantao Gu

机构 * Department of Electronic Engineering(电子工程系)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对令牌化时间序列大语言模型忽略连续性和序数性的问题,提出COM策略,通过几何约束初始化与训练阶段,提升模型在多个时间序列分析基准上的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17670 2026-05-29 cs.PL cs.AI 88%

Grammar-Aware Literate Generative Mathematical Programming with Compiler-in-the-Loop

语法感知的 literate 生成式数学编程与编译器在环

Roberto Rossi, Steven D. Prestwich

机构 * Business School, University of Edinburgh(爱丁堡大学商学院) Insight Centre for Data Analytics, University College Cork(科克大学数据分析研究所)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出 SyntAGM 系统,通过迭代生成-编译-评估-修正循环,利用编译器反馈和 LLM 对齐判断,生成可读的代数建模语言优化模型,实现成本与质量的更优权衡。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29184 2026-05-29 cs.LG cs.AI 88%

Influence-Guided Symbolic Regression: Scientific Discovery via LLM-Driven Equation Search with Granular Feedback

影响引导的符号回归:基于大语言模型与细粒度反馈的方程搜索科学发现

Evgeny S. Saveliev, Samuel Holt, Nabeel Seedat, David L. Bentley, Jim Weatherall, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学) Thomson Reuters Foundational Research(汤姆森·路透基础研究) U. Colorado, Anschutz Medical Campus(科罗拉多大学安舒茨医疗校区)

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出影响引导符号回归(IGSR)方法,利用大语言模型生成候选函数并通过细粒度影响分数进行剪枝,结合蒙特卡洛树搜索高效探索组合空间,在多个基准和真实生物数据中发现新关系。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25297 2026-05-29 cs.CL cs.AI cs.LG 88%

Eureka: Intelligent Feature Engineering for Enterprise AI Cloud Resource Demand Prediction

Eureka:面向企业AI云资源需求预测的智能特征工程

Hangxuan Li, Renjun Jia, Xuezhang Wu, Yunjie Qian, Zeqi Zheng, Xianling Zhang

机构 * Alibaba Cloud Computing Co. Ltd, Hangzhou, China(阿里云计算有限公司,杭州,中国) School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机学院,上海,中国) School of Computer Science and Technology, Tongji University, Shanghai, China(同济大学计算机科学与技术学院,上海,中国) Independent Researcher, United States(独立研究员,美国)

专题命中 领域大模型 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Eureka框架,将特征工程视为智能体代码生成问题,通过专家代理、LLM特征工厂和自演化对齐引擎三阶段,自动生成可执行特征代码,在医疗、金融、社交等7个公开基准及阿里云GPU资源需求预测中显著提升性能。

Comments accepted at NeurIPS 2025 Workshop, DASFAA 2026 (International Conference on Database Systems for Advanced Applications)

Journal ref Database Systems for Advanced Applications (DASFAA 2026), Lecture Notes in Computer Science, vol. 16540, pp. 528-540, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29847 2026-05-29 cs.CL 86%

EvoRubric: Self-Evolving Rubric-Driven RL for Open-Ended Generation

EvoRubric: 用于开放生成的自我进化评分标准驱动强化学习

Xin Guan, Xiaomeng Hu, Shen Huang, Zhenyi Wang, Bo Zhang, Zijian Li, Pengjun Xie, Bo Liu, Jiuxin Cao

机构 * Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出EvoRubric,一种单策略共进化强化学习框架,通过动态交替生成响应和评分标准,并引入多层验证机制,解决开放生成任务中缺乏明确奖励的问题,在医学、写作和科学领域超越传统静态和外部LLM驱动方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28838 2026-05-29 cs.CL cs.AI 86%

Specialty-Specific Medical Language Model for Immune-Mediated Diseases

免疫介导疾病的专科医学语言模型

Veysel Kocaman, Gursev Pirge, Yigit Gul, Ace Vo, Zhenya Nargizyan, David Talby

机构 * John Snow Labs Inc.(约翰·斯诺实验室公司)

专题命中 领域大模型 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 针对免疫介导和传染病领域,通过专家标注数据集和临床领域嵌入的Transformer模型,提出专科NER模型,F1达0.89,优于基线和零样本方法。

Comments 15 pages, 5 figures. Funded in part by NIAID/NIH under contract 75N93024C00010

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30105 2026-05-29 cs.SE 86%

EvoRepair: Enhancing Vulnerability Repair Agents Through Experience-Based Self-Evolution

EvoRepair: 通过基于经验的自我进化增强漏洞修复智能体

Haichuan Hu, Guoqing Xie, Quanjun Zhang, Jiawei Liu, Shengcheng Yu, Chunrong Fang, Zhenyu Chen, Liang Xiao

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出EvoRepair框架,通过循环学习-修复过程积累和复用漏洞修复经验,在多个基准上显著提升LLM的自动漏洞修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14150 2026-05-29 cs.AI cs.LG cs.NE 85%

CodeEvolve: an open source evolutionary coding agent for algorithmic discovery and optimization

CodeEvolve:用于算法发现和优化的开源进化编码智能体

Henrique Assumpção, Diego Ferreira, Leandro Campos, Fabricio Murai

机构 * Inter Science - Inter&Co Federal University of Minas Gerais(联邦大学伯南迪斯) Worcester Polytechnic Institute(沃思彻斯特理工大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出CodeEvolve开源框架,结合大语言模型与岛屿进化搜索,通过灵感交叉、元提示和深度细化,在AlphaEvolve基准上匹配或超越5/9问题,并在匹配条件下优于OpenEvolve和ShinkaEvolve,以更低成本超越前沿闭源集成。

Comments 21 pages, 16 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29368 2026-05-29 cs.CL cs.AI 85%

SURGENT: A Surgical Multi-Agent Assistance System Across the Perioperative Workflow

SURGENT: 一种跨围手术期工作流程的手术多智能体辅助系统

Dongsheng Shi, Yue Li, Xin Yi, Yongyi Cui, Huawei Feng, Linlin Wang

机构 * East China Normal University(华东师范大学) City University of Hong Kong(香港城市大学)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SURGENT手术多智能体辅助系统,结合思维树规划器、多科室协作智能体和检索增强推理,通过新型记忆设计管理长期患者病史和短期工作摘要,在五项围手术期任务中优于基线LLM和现有医疗多智能体框架。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29209 2026-05-29 eess.AS 85%

The WER Trap: Shattering the Illusion of Unified Tokens in Speech Language Models

WER陷阱:打破语音语言模型中统一令牌的幻觉

Xiangyu Zhang, Yuxin Li, Haoyang Zhang, Shiqi Han, Hexin Liu, Qiquan Zhang, Beena Ahmed, Julien Epps

专题命中 领域大模型 :language model(title,abstract);SLM(abstract,abstract_cn)

AI总结 本文通过动态压缩分词器提取纯语义令牌,揭示了低WER令牌无法保留声学合成所需的连续语音轨迹,从而打破统一令牌的幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29210 2026-05-29 cs.CR 83%

SAMD: A Tool for Identifying False Data Injection Scenarios in AI/ML-enabled Medical Devices

SAMD:一种识别AI/ML医疗设备中虚假数据注入场景的工具

Mohammadreza Hallajiyan, Xueren Ge, Athish Pranav Dharmalingam, Gargi Mitra, Shahrear Iqbal, Homa Alemzadeh, Karthik Pattabiraman

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出SAMD工具,基于STPA-Sec和LLM自动化识别AI/ML医疗设备设计阶段的虚假数据注入漏洞与攻击场景,在五个FDA批准设备上验证了高精度与效率。

Comments 10 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29786 2026-05-29 cs.AI 81%

Croissant Tasks: A Metadata Format for Reproducible Machine Learning Evaluations

Croissant Tasks:一种用于可重复机器学习评估的元数据格式

Omar Benjelloun, Leonardo Martins Bianco, Isabelle Guyon, Thanh Gia Hieu Khuong, Jonathan Lebensold, Sebastian Lobentanzer, Luis Oala, Benedictus Kent Rachmat, Ihsan Ullah, Peyman Vahidi, Joaquin Vanschoren

机构 * Google DeepMind(谷歌DeepMind) ChaLearn Université Paris-Saclay(巴黎-萨克雷大学) Jetty Mila, Quebec AI Institute(魁北克AI研究所) Inst. of Computational Biology, Helmholtz Munich(海德堡慕尼黑计算生物学研究所) German Center for Diabetes Research(德国糖尿病研究中心) School of CIT, TUM(技术大学 CIT 学校) Helmholtz AI(海德堡人工智能研究所) Brickroad Eindhoven Univ. of Technology(埃因霍温技术大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出Croissant Tasks元数据格式,通过声明式规范解耦任务问题与解决方案,结合自动化LLM管道实现概念可重复性,使自主代理能从零生成可复现的评估流水线。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10332 2026-05-29 cs.CY cs.AI 81%

Agent4Edu: Generating Learner Response Data by Generative Agents for Intelligent Education Systems

Agent4Edu:通过生成式智能体为智能教育系统生成学习者响应数据

Weibo Gao, Qi Liu, Linan Yue, Fangzhou Yao, Rui Lv, Zheng Zhang, Hao Wang, Zhenya Huang

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence(人工智能研究院) Hefei Comprehensive National Science Center(合肥综合性国家科学中心)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出Agent4Edu,一种利用大语言模型构建生成式智能体模拟学习者行为,以解决智能教育系统中离线指标与在线性能差异的问题,并支持个性化学习算法评估与优化。

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28843 2026-05-29 cs.DL cs.CY cs.LG 81%

The Biosecurity Blind Spot: Systematic Dual-use Detection in Open Science Infrastructure

生物安全盲点:开放科学基础设施中的系统性双重用途检测

Vasudha Sharma, Chakresh Kumar Singh, Jayesh Choudhari, Dharmit Nakrani

机构 * LophiLabs

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究通过混合词法过滤和大语言模型评估,系统分析了bioRxiv预印本中双重用途研究关注内容,揭示了开放获取摘要中普遍存在的潜在风险,并提出了结合元数据监控与开放科学原则的治理框架。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28864 2026-05-29 cs.AI cs.CL 81%

The Cognitive Categorical Transformer: Category-Theoretic Inductive Biases for Language Modeling

认知范畴变换器:用于语言建模的范畴论归纳偏置

Al Kari

机构 * Manceps Inc.(Manceps公司)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出认知范畴变换器(CCT),通过引入基于范畴论和认知科学的组件,在WikiText-103上以306M参数实现21.27验证困惑度,相比GPT-2 Small基线降低2.92 PPL(12%相对提升),并通过消融实验证实单纯复形消息传递贡献了84%的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29744 2026-05-29 cs.AI cs.CL cs.LG cs.MA 80%

Why Specialist Models Still Matter: A Heterogeneous Multi-Agent Paradigm for Medical Artificial Intelligence

为什么专家模型仍然重要:面向医学人工智能的异构多智能体范式

Yanan Wang, Shuaicong Hu, Jian Liu, Guohui Zhou, Aiguo Wang, Cuiwei Yang

机构 * Fudan University(复旦大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HetMedAgent异构多智能体框架,通过冲突感知证据融合、不确定性驱动的临床医生干预触发和自适应阈值校准,实现通用大语言模型与领域专家模型的协同,在三个临床决策任务中验证了专家模型在模态特定分析中的不可替代价值。

Comments Accepted at ICML 2026. 12 pages main text, 16 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29859 2026-05-29 eess.AS cs.CL 79%

MELD: Mel-Spectrogram-Based Speech Language Modeling with Discrete Latent Variables

MELD: 基于梅尔频谱的离散潜变量语音语言建模

Sung-Lin Yeh, Wei Zhou, Gil Keren, Duc Le, Zhong Meng, Hao Tang, Jay Mahadeokar, Ozlem Kalinli, Alexandre Mourachko

机构 * University of Edinburgh(爱丁堡大学) Google DeepMind(谷歌DeepMind) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL

AI总结 提出一种在梅尔频谱上联合优化编码器和语音语言模型的离散潜变量模型,在零样本文本转语音和语音转文本任务上优于基于编解码器和其他梅尔频谱基线,并缓解了自回归建模中的长时间静音和单词遗漏问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21979 2026-05-29 cs.CV cs.AI 79%

Benchmarking and Mitigating Sycophancy in Medical Vision Language Models

医疗视觉语言模型中的谄媚行为基准测试与缓解

Juangui Xu, Zikun Guo, Jingwei Lv, Hongbin Lin, Shu Yang, Jun Wen, Di Wang, Lijie Hu

机构 * MBZUAI Saarland University(萨尔兰大学) HKUST(GZ)(香港科技大学(广州)) KAUST(卡塔尔大学)

专题命中 领域大模型 :language model(title,abstract);分类 cs.AI

AI总结 针对医疗视觉语言模型中的谄媚问题,提出分层医疗视觉问答基准和VIPER策略,通过过滤非证据社会线索减少谄媚,提升模型鲁棒性。

Comments 19figures, 61pages. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28874 2026-05-29 cs.CL 79%

From Data to Insights: Exploring Program-of-Thoughts Prompting for Chart Summarization

从数据到洞察:探索程序化思维提示在图表摘要中的应用

Yutong Qu, Wei Zhang

机构 * Adelaide University(阿德莱德大学)

专题命中 领域大模型 :prompting(title);language model(abstract);分类 cs.CL

AI总结 本文提出一种零样本学习方法,通过Python程序作为中介,利用程序化思维策略驱动轻量级视觉语言模型进行图表摘要,并引入图表到字典的辅助任务以提高灵活性和性能。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14113 2026-05-29 cs.CV cs.AI cs.LG cs.MA 79%

ProtoMedAgent: Multimodal Clinical Interpretability via Privacy-Aware Agentic Workflows

ProtoMedAgent: 通过隐私感知的智能体工作流实现多模态临床可解释性

Alvaro Lopez Pellicer, Plamen Angelov, Marwan Bukhari, Yi Li, Eduardo Soares, Jemma Kerns

机构 * School of Computing and Communications(计算与通信学校) Lancaster University(兰卡斯特大学) Lancaster Medical School(兰卡斯特医学院) PUC-Rio(里约热内卢联邦大学) Puc-Behring Institute for AI(人工智能皮克林研究所)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出ProtoMedAgent框架,通过神经符号瓶颈和反射性Scribe-Critic循环约束生成过程,解决原型网络在临床报告中的语义结构缺失和检索谄媚问题,并引入k-匿名和ℓ-多样性隐私门控。

Comments CVR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30284 2026-05-29 cs.AI 77%

ProjectionBench: Evaluating Scientific Hypothesis Generation in LLMs Under Progressive Information Disclosure

ProjectionBench: 在渐进信息揭示下评估大语言模型的科学假设生成

A. J. Lew, Y. Cao, M. J. Buehler

机构 * Unreasonable Labs

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ProjectionBench框架,通过渐进式信息揭示评估大语言模型在科学发现中的创新性和推理能力,实验表明GPT-5.4在最小上下文下仍保持0.7 F1分数与真实结论对齐。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29889 2026-05-29 cs.CL cs.AI 76%

Internal Representation, Not Clinical Knowledge: Where Apparent LLM Triage Failures Originate

内部表示,而非临床知识:明显的大语言模型分诊失败源于何处

David Fraile Navarro, Berardino Como, Jialei Sheng, Soundariya Ananthan, Shlomo Berkovsky

机构 * Macquarie University(麦考瑞大学) Politecnico di Bari(巴里理工大学) NSW Health(新南威尔士州卫生部) Independent Researcher(独立研究者)

专题命中 领域大模型 :LLM(title);分类 cs.CL、cs.AI

AI总结 本研究通过稀疏自编码器特征分析,发现大语言模型在分诊任务中表现不佳源于输出格式限制,而非临床知识表示缺陷。

Comments 9 pages main text, 27 pages total including appendices; 7 figures, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏