arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-11 至 2026-06-11 共收录 344 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 67 篇

2606.09174 2026-06-11 cs.HC 版本更新 67%

Demonstrating chart-plot: Closing the Last Mile of Academic Chart Generation

展示chart-plot:弥合学术图表生成的最后一英里

Yinghao Tang, Yupeng Xie, Yingchaojie Feng, Jiale Lao, Tingfeng Lan, Wei Chen

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 提出chart-plot系统,通过风格感知代码生成、部署感知渲染循环和结构化编辑层,解决学术图表从代码到发表的质量差距问题。

Comments 7 pages, 6 figures. Submitted to the VLDB ADS 2026 Workshop: The Joint Workshop on Agentic Data Systems and Data-Centric AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06057 2026-06-11 cs.DC cs.MS 版本更新 67%

FalconGEMM: Surpassing Hardware Peaks with Lower-Complexity Matrix Multiplication

FalconGEMM:通过低复杂度矩阵乘法超越硬件极限

Honglin Zhu, Jiaping Cao, Jiang Shao, Siyuan Feng, Qian Qiu, Peng Chen, Xu Zhang, Yixian Zhou, Man Lung Yiu, Guang Ji, Minwen Deng, Jintao Meng, Wenxi Zhu

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 FalconGEMM通过自动化部署优化低复杂度矩阵乘法算法,实现DL性能提升,在GPU和CPU上均超越传统GEMM库和AlphaTensor等竞品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11556 2026-06-11 cs.CR cs.AI cs.LG 新提交 62%

Privacy-Preserving Federated Autoencoder for ECG Anomaly Detection on Edge Devices

面向边缘设备上心电图异常检测的隐私保护联邦自编码器

Kaan Arda Akyol, Jakub Kacper Szeląg, Aydin Abadi, Maha Alghamdi, Ghadah Albalawi, Ghouse Ibrahim Kaleelullah, Hilal Tutus, Sarah Al Subaiei, Shardul Kapse, Syed Mohammed Raheeb, Mujeeb Ahmed, Rehmat Ullah

机构 * Google Research, New York, NY(谷歌研究,纽约,纽约州) University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学) University of Melbourne(墨尔本大学) University of Sydney(悉尼大学)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出一种结合联邦学习、差分隐私和INT8量化的端到端系统,在PTB-XL数据集上实现无监督12导联ECG异常检测,满足隐私、实时性和非IID数据要求。

Comments 9 pages, 4 figures, 6 tables. Preprint prepared in IEEE conference format. Submitted to: FLTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11473 2026-06-11 cs.LG cs.AI stat.ML 新提交 62%

CRUMB: Efficient Prior Fitted Network Inference via Distributionally Matched Context Batching

CRUMB: 通过分布匹配上下文批处理实现高效先验拟合网络推理

Jamie Heredge, Mattia J. Villani, Pranav Deshpande, Akshay Seshadri, Niraj Kumar

机构 * Global Technology Applied Research, JPMorganChase(摩根大通全球技术应用研究)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出CRUMB方法,通过聚类查询、最小化最大均值差异选择训练子集、再执行精确推理,在不重新训练的情况下加速先验拟合网络推理,在51个数据集上优于同类方法。

Comments 26 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11203 2026-06-11 cs.CL cs.LG 新提交 62%

LatticeBridge: Rare-Event Sequential Inference for Faithful Structured Sequence Synthesis

LatticeBridge: 用于忠实结构化序列合成的罕见事件序列推理

Faruk Alpay, Bugra Kilictas

机构 * Bahcesehir University(巴切塞希尔大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 针对结构化序列生成中约束满足的罕见事件问题,提出LatticeBridge方法,结合前缀语言模型、实例编译表面自动机和扭曲序列蒙特卡洛解码器,在多个基准上显著提升锚点满足率和覆盖率。

Comments 19 pages. Code and benchmark files available at https://github.com/farukalpay/latticebridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11198 2026-06-11 cs.CL cs.AI 新提交 62%

The Structural Attention Tax: How Retrieval Format Hijacks In-Context Learning Independent of Content

结构注意力税:检索格式如何劫持上下文学习而与内容无关

Yuqi Zhang, Di Zhang

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 效率与部署 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究发现知识图谱三元组因其格式结构比自然语言吸引2-3倍注意力,压缩演示注意力达42%,并提出了分解注意力为语义与结构成分的框架及缓解策略。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11500 2026-06-11 eess.IV cs.CE cs.IT cs.LG math.IT q-bio.NC 新提交 57%

FlexiBrain: Resolution-Agnostic Voxel-Level Encoding for Native fMRI

FlexiBrain: 面向原生fMRI的分辨率无关体素级编码

Mo Wang, Wenhao Ye, Junfeng Xia, Minghao Xu, Hongkai Wen, Quanying Liu

机构 * Southern University of Science and Technology(南方科技大学) University of Warwick(沃里克大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 提出FlexiBrain,一种基于Mamba-JEPA的分辨率无关体素级编码框架,通过动态补丁调整直接处理原生fMRI数据,避免破坏性空间标准化,在五个下游任务中性能提升达12个百分点,并显著降低预处理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00995 2026-06-11 cs.AI 版本更新 57%

Subliminal Learning Is Steering Vector Distillation

潜意识学习是引导向量蒸馏

Camila Blank, Agam Bhatia, Senthooran Rajamanoharan, Arthur Conmy, Neel Nanda

机构 * Stanford University(斯坦福大学)

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 本文发现潜意识学习通过单个引导向量实现,并证明这是引导向量蒸馏的特例,解释了非语义数据如何传递语义特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20241 2026-06-11 cs.LG cs.DC 版本更新 57%

Energy Use of AI Inference, Efficiency Pathways, and Test-Time Scaling

AI推断的能耗:效率路径与测试时计算

Felipe Oviedo, Fiodar Kazhamiaka, Esha Choukse, Allen Kim, Amy Luers, Melanie Nakagawa, Ricardo Bianchini, Juan M. Lavista Ferres

机构 * Microsoft(微软)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.LG

AI总结 本文提出基于令牌吞吐量的底层方法,估算大规模大语言模型的每查询能耗,揭示测试时扩展场景下的能耗变化及效率提升潜力。

Comments A preprint version with DOI is available at Zenodo: https://doi.org/10.5281/zenodo.17188770

Journal ref Joule (2026) 102430

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12396 2026-06-11 cs.CV cs.RO 新提交 50%

VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving

VLGA:用于自动驾驶的视觉-语言-几何-动作模型

Jin Yao, Dhruva Dixith Kurra, Tom Lampo, Zezhou Cheng, Danhua Guo, Burhan Yaman

机构 * Uber AV Labs(Uber自动驾驶实验室) University of Virginia(弗吉尼亚大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 提出VLGA模型,通过引入几何作为第四模态,利用逐像素点图回归损失监督,实现密集3D世界重建,在nuScenes和Bench2Drive上达到SOTA。

Comments Project page: https://yaojin17.github.io/VLGA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11913 2026-06-11 cs.CV 新提交 50%

From Content to Knowledge: Lightning Fast Long-Video Understanding with Neural Knowledge Representations

从内容到知识:基于神经知识表示的闪电般快速长视频理解

Yuchen Guan, Xiao Li, Zongyu Guo, Xiaoyi Zhang, Xiulian Peng, Chun Yuan, Yan Lu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :language model(abstract)

AI总结 提出将长视频编码为神经知识表示(NKR),通过智能体知识蒸馏(AKD)自动合成描述和问答对,将视频知识嵌入VLM骨干网络的少量权重中,实现轻量级、可复用的视频理解,推理时无需重新加载视频,大幅降低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11846 2026-06-11 cs.CV 新提交 50%

SheafStain: Sheaf-Theoretic Schrödinger Bridge for Spatially and Biologically Coherent Virtual Staining

SheafStain:用于空间和生物学一致虚拟染色的层论薛定谔桥

Hyeongyeol Lim, Hongjun Yoon, Eunjin Jang, Daeky Jeong, Won June Cho, Hwamin Lee

机构 * Department of Medical Informatics, College of Medicine, Korea University(高丽大学医学院医学信息学系) DEEPNOID Inc.(DEEPNOID公司)

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对虚拟染色中补丁推理导致的空间不连续和上下文污染问题,提出SheafStain方法,将视觉基础模型特征重新解释为层状截面,结合薛定谔桥框架实现空间和生物学一致的虚拟染色,在HER2等指标上优于六种现有方法。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11572 2026-06-11 cs.CV 新提交 50%

FreqKD: Frequency-Decoupled Cross-Modal Knowledge Distillation for Infrared Object Detection

FreqKD: 面向红外目标检测的频率解耦跨模态知识蒸馏

Keval Thaker, Venkatraman Narayanan, Abdalmalek Aburaddaha, Samir A. Rawashdeh

机构 * University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)

专题命中 效率与部署 :foundation model(abstract)

AI总结 针对RGB与红外图像模态差异,提出频率解耦蒸馏框架FreqKD,对低频和高频成分分别施加严格MSE和松弛log-MSE损失,在KAIST数据集上提升DINOv2基线2.4 mAP50。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13631 2026-06-11 stat.CO 版本更新 50%

ProjGuard: Safety Monitoring for Computer-Use Agents via Low-Dimensional Projections

ProjGuard:通过低维投影实现计算机使用代理的安全监控

Kebin Contreras, Carlos Hinojosa, Jorge Bacca, Bernard Ghanem

专题命中 效率与部署 :language model(abstract)

AI总结 ProjGuard通过行为轨迹监控实现计算机使用代理的安全防护,利用轻量级风险信号提前预警潜在危险,结合辅助视觉语言模型进行针对性修正,提升任务完成率并降低安全风险。

Comments The manuscript was submitted under an inappropriate category. In addition, substantial updates and improvements are currently being made to the document. To avoid confusion and ensure that readers access the most accurate version of the work, we request withdrawal of the current manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21413 2026-06-11 cs.DB 版本更新 50%

RUBICON: Agentic AI for Messy Enterprise Data

RUBICON: 面向混乱企业数据的代理型人工智能

Fabian Wenz, Felix Treutwein, Kai Arenja, Çagatay Demiralp, Michael Stonebraker

专题命中 效率与部署 :LLM(abstract)

AI总结 针对企业数据异构、访问受限的特点,提出RUBICON系统,采用结构化查询接口和以表为中心的集成层,替代纯文本大语言模型管线,在基准测试中实现100%端到端准确率,并显著降低延迟和成本。

Comments 4 pages, 1 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 25 篇

2606.11204 2026-06-11 cs.CL cs.IR 新提交 92%

Benchmarking Large Language Models for Safety Data Extraction

大型语言模型在安全数据提取中的基准测试

Jonas Grill, Thomas Bayer, Sören Berlinger

机构 * SAP SE(SAP公司) Institute for Digital Transformation, Ravensburg-Weingarten University(拉文斯堡-魏恩加滕大学数字化转型研究所)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 针对安全数据表(SDS)的异构格式,本研究基准测试了四种大型语言模型(LLM)在文本与多模态处理下的提取性能,发现文本结合思维链提示的Gemini 1.5 Pro准确率最高(84%),但均未达到90%的可靠部署阈值。

Comments 18 pages, 8 figures, submitted to Applied Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11210 2026-06-11 cs.CL cs.AI cs.MM 新提交 92%

T2MM: An LLM Supported Architecture For Inquiry-Based Modeling

T2MM:一种支持基于探究建模的LLM架构

John Kos, Rudra Singh, Ashok Goel

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出T2MM架构,利用LLM在生态建模软件VERA中生成交互式模型,优于全代码生成基线。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11356 2026-06-11 physics.ao-ph cs.DC cs.SE physics.comp-ph 新提交 92%

An Ocean Model Ported by a Large Language Model: Experience and Lessons from FESOM2 (Fortran to C to C++/Kokkos)

大型语言模型移植海洋模型:FESOM2(Fortran到C再到C++/Kokkos)的经验与教训

Nikolay V. Koldunov, Suvarchal K. Cheedela, Sergey Danilov, Dmitry Sidorenko, Sebastian Beyer, Thomas Jung

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文展示利用LLM将FESOM2海洋模型从Fortran移植到C再到C++/Kokkos,通过两阶段翻译、严格字面转换和逐级验证,在数周内保持物理准确性并实现GPU加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16152 2026-06-11 cs.DL cs.AI cs.CL cs.LG 版本更新 91%

Mapping Scientific Literature with Large Language Models and Topic Modeling

利用大语言模型和主题建模绘制科学文献图谱

Mason Smetana, Lev Khazanovich

机构 * Department of Civil and Environmental Engineering(土木与环境工程系) University of Pittsburgh(匹兹堡大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出基于大语言模型的两阶段分类框架,通过主题建模分析PNAS工程类文献,生成语义可解释主题并揭示跨主题关联,性能优于传统方法。

Comments 35 pages, 10 figures. Accepted for publication in Scientometrics. Final version available via DOI

Journal ref Scientometrics (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11482 2026-06-11 cs.SI cs.CL 新提交 90%

Building Social World Models with Large Language Models

用大型语言模型构建社会世界模型

Haofei Yu, Yining Zhao, Guanyu Lin, Jiaxuan You

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);foundation model(abstract)

AI总结 提出社会世界模型(SWM)框架,利用LLM从社会数据中挖掘时间模式,学习社会信念的状态转移函数,无需人工标注或普查数据,在预测市场基准上超越时序基础模型。

Comments 9 pages. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11703 2026-06-11 cs.NE cs.LG 90%

Data-Driven Discovery of Interpretable Kalman Filter Variants through Large Language Models and Genetic Programming

基于大数据驱动的可解释卡尔曼滤波变种发现:通过大规模语言模型和遗传编程

Vasileios Saketos, Sebastian Kaltenbach, Sergey Litvinov, Petros Koumoutsakos

机构 * University of Reading(reading大学) University of Cambridge(剑桥大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文探讨通过遗传编程和大规模语言模型自动发现卡尔曼滤波变种的可能性,展示框架在不同条件下发现最优解及可解释替代方案的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11640 2026-06-11 cs.LG cs.AI 新提交 90%

TAROT: Task-Adaptive Refinement of LLM-prior Graphs for Few-shot Tabular Learning

TAROT: 面向小样本表格学习的任务自适应LLM先验图精炼

Ruxue Shi, Yili Wang, Mengnan Du, Hangting Ye, Yi Chang, Xin Wang

机构 * Jilin University(吉林大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 提出TAROT框架,通过构建并精炼任务自适应语义图,利用LLM先验和GNN编码特征语义关系,提升小样本表格学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10120 2026-06-11 cs.IR cs.AI cs.HC 版本更新 90%

MetaPlate: Counterfactual-Guided RAG-LLM Tool for Personalized Food Recommendation and Hyperglycemia Prevention

MetaPlate: 反事实引导的RAG-LLM工具用于个性化食物推荐和高血糖预防

Asiful Arefeen, Carol Johnston, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 提出MetaPlate框架,结合反事实解释、机器学习预测和RAG-LLM,生成个性化膳食建议以预防餐后高血糖,经注册营养师评估证明其可行性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02600 2026-06-11 cs.CL 版本更新 87%

BioMamba: Domain-Adaptive Biomedical Language Models

BioMamba: 领域自适应的生物医学语言模型

Ling Yue, Mingzhi Zhu, Sixue Xing, Yunning Cao, Yanbo Wang, Shimin Shan, Jinfei Liu, Vijil Chenthamarakshan, Shaowu Pan, Payel Das, Tianfan Fu

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) Jiaxing New Jies Thermal Power Co. Ltd.(嘉兴新捷热电有限公司) North University of China(北方大学) Zhejiang University(浙江大学) IBM Research(IBM研究院) Nanjing University(南京大学)

专题命中 领域大模型 :language model(title,abstract);SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 提出基于Mamba2的领域自适应预训练方法BioMamba,在PubMed、C4和Wikipedia混合数据上持续训练,显著降低生物医学困惑度并保持通用语言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12169 2026-06-11 cs.CV cs.AI cs.CL cs.LG 新提交 87%

OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models

OpenMedReason: 医学视觉语言模型的科学推理监督

Negin Baghbanzadeh, Pritam Sarkar, Michael Colacci, Abeer Badawi, Adibvafa Fallahpour, Arash Afkanpour, Leonid Sigal, Ali Etemad, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学) Unity Health Toronto / St. Michael’s Hospital(多伦多联合健康/圣迈克尔医院) University Health Network(大学健康网络) Arc Institute(弧研究所) Queen's University(女王大学)

专题命中 领域大模型 :language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OpenMedReason,一个包含约45万图像-问题-答案实例的大规模开放医学推理语料库,其推理轨迹主要来自生物医学科学文章,并配套基准OpenMedReason-Bench进行细粒度评估,在监督微调和强化对齐中有效提升模型性能。

Comments 42 pages, 9 figures, 24 tables. Dataset and code: https://huggingface.co/datasets/neginb/OpenMedReason

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11215 2026-06-11 cs.CY cs.AI 新提交 86%

The Environmental Cost of LLMs in AIED: Reporting and Practices

AIED中LLMs的环境成本:报告与实践

Sabrina C. Eimler, Lukas Erle, Daniel Flood, Aditi Haiman, Luca Häckert, André Helgert, Lachlan McGinness, Büsra Yapici

机构 * Institute of Computer Science and Institute of Positive Computing, Ruhr West University of Applied Sciences(计算机科学研究所和积极计算研究所,鲁尔-韦斯特应用科学大学) Centre for Computational Science and Mathematical Modelling, Coventry University(计算科学与数学建模中心,科文特里大学) Carnegie Mellon University(卡内基梅隆大学) Australian National University and CSIRO(澳大利亚国立大学和CSIRO)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对AIED社区缺乏LLM计算与环境成本标准化报告的问题,提出开源方法测量并报告碳排放,包括本地和云端硬件,以及未知参数的前沿LLM计算开销公式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01157 2026-06-11 cs.CL cs.CR cs.SD 版本更新 85%

Where Do Backdoors Live? A Component-Level Analysis of Backdoor Propagation in Speech Language Models

后门藏身何处?语音语言模型中后门传播的组件级分析

Alexandrine Fortier, Thomas Thebaud, Jesús Villalba, Najim Dehak, Patrick Cardinal, Peter West

机构 * University of British Columbia(不列颠哥伦比亚大学) École de technologie supérieure(高等技术学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 领域大模型 :language model(title,abstract);SLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过后门攻击视角,对语音语言模型进行组件级分析,揭示后门在不同组件中的传播机制,发现后门持久性高度依赖目标组件,且中毒样本与良性样本在共享嵌入中不可直接分离。

Comments Interspeech 2026 (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12250 2026-06-11 cs.CL 新提交 84%

Reassessing High-Performing LLMs on Polish Medical Exams: True Competence or Bias-Driven Performance?

重新评估高性能大语言模型在波兰医学考试中的表现:真实能力还是偏差驱动?

Antoni Lasik, Jakub Pokrywka, Łukasz Grzybowski, Jeremi Ignacy Kaczmarek, Gabriela Korzańska, Janusz Świeczkowski-Feiz, Oskar Pastuszek, Paulina Hoffman, Jakub Tomasz Dąbrowski, Wojciech Kusa

机构 * NASK National Research Institute(NASK国家研究所) Adam Mickiewicz University(亚当·密茨凯维奇大学) ARAAI Poland(ARAAI波兰) Poznań University of Medical Sciences(波兹南医科大学) Centre of Postgraduate Medical Education, Poland(波兰研究生医学教育中心) T. Marciniak Lower Silesian Specialist Hospital(T. 马尔奇尼亚克下西里西亚专科医院) Medical University of Warsaw(华沙医科大学)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过引入扩展和更具挑战性的波兰医学考试基准,减少MCQA伪影,发现标准MCQA分数高估了LLM的真实临床能力,最佳模型在更难的设置下分数下降28.4和31个百分点。

Comments 26 pages total with references and appendix, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20819 2026-06-11 physics.chem-ph 版本更新 83%

DynaMate2: runtime registration of expert-defined tools for agentic scientific workflow automation

DynaMate2:使代理AI民主化,用于专家设计的定制工作流

Orlando A. Mendible-Barreto, Ajay Vallabh, Ubaldo M. Córdova-Figueroa, Yamil J. Colón

专题命中 领域大模型 :LLM(summary_cn,abstract);foundation model(abstract)

AI总结 本文提出DynaMate2,一种分层代理框架和开源模板,旨在降低研究人员将现有专家定义的Python函数转换为AI可调用工具的门槛,通过让LLM负责任务路由和工具选择,而非生成科学代码,从而实现自动化科学工作流的民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11456 2026-06-11 cs.CL cs.AI cs.CY 新提交 82%

AI Coding Agents in Social Science: Methodologically Diverse, Empirically Consistent, Interpretively Vulnerable

社会科学中的AI编码智能体:方法多样,经验一致,解释脆弱

Meysam Alizadeh, Fabrizio Gilardi, Mohsen Mosleh, Enkelejda Kasneci

机构 * University of Oxford(牛津大学) University of Zurich(苏黎世大学) Technical University of Munich(慕尼黑工业大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 研究LLM智能体在科学分析中的方法多样性与解释脆弱性,通过20次独立实验发现智能体在设计层匹配或超越人类多样性,但在裁决层易受提示影响,偏差源于解释而非估计。

详情

展开后加载摘要…

URL PDF HTML 收藏