arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 778 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 71 篇

2606.13020 2026-06-23 cs.AI 新提交 84%

SciR: A Controllable Benchmark for Scientific Reasoning in LLMs

SciR: 面向LLM科学推理的可控基准

Pierre Beckmann, Marco Valentino, Andre Freitas

机构 * Idiap Research Institute(Idiap研究 institute) EPFL(瑞士联邦理工学院) School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) University of Manchester(曼彻斯特大学) National Biomarker Centre, CRUK Manchester Institute(国家生物标志物中心,CRUK曼彻斯特研究所)

专题命中 领域大模型 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 提出SciR基准,通过形式对象生成可验证的多范式科学推理任务,并控制信息提取和推理难度两个维度,揭示LLM在科学推理中的弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23243 2026-06-23 cs.LG cs.SD 新提交 83%

Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio

从分散的医疗音频中解锁音频-语言模型的上下文学习

Ran Piao, Tsai-Ning Wang, Martijn den Dekker, Linda Moonen, Hareld Kemps, Yuan Lu, Aaqib Saeed

机构 * Eindhoven University of Technology(埃因霍温理工大学) Erasmus MC(伊拉斯姆斯医学中心) Rijnstate Hospital(莱茵州医院)

专题命中 领域大模型 :language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 提出联邦自上下文学习(FSC)框架,通过无监督聚类构建伪标签片段,结合渐进式三阶段流水线,在联邦医院客户端实现少样本临床音频诊断,准确率达71.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20713 2026-06-23 cs.AI 新提交 83%

FairTutor: Equity-Aware Pedagogical LLM Routing for Budget-Constrained AI Tutoring

FairTutor: 预算受限AI辅导中的公平感知教学LLM路由

Qingyang Xu

机构 * Independent researcher, Shanghai, China(独立研究者,上海,中国)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 提出FairTutor框架,通过教学驱动的多智能体编排实现成本效益AI辅导,在降低71.6%服务成本的同时达到97.1%的优质教学质量,并引入AIED优势差距指标衡量公平性。

Comments AI for Education Day at SIGKDD 2026, 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16653 2026-06-23 cs.AI 版本更新 83%

Agent Skill Framework: Perspectives on the Potential of Small to Medium Language Models in Industrial Environments

Agent技能框架:中小型语言模型在工业环境中的潜力视角

Yangjie Xu, Lujun Li, Lama Sleem, Niccolo Gentile, Yewei Song, Yiqun Wang, Siming Ji, Wenbo Wu, Radu State

机构 * University of Luxembourg(卢森堡大学) Foyer S.A.(Foyer公司) Princeton University(普林斯顿大学) Université Paris-Saclay(巴黎萨克雷大学)

专题命中 领域大模型 :language model(title,abstract);SLM(abstract);分类 cs.AI

AI总结 研究在资源受限的工业场景中,中小型开源语言模型(270M-80B)使用Agent技能的效果,发现30B-80B模型受益显著,而小型模型技能选择困难,思考变体提升有限且增加GPU开销。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15315 2026-06-23 cs.CV stat.ML 82%

Training-Free Zero-Shot Anomaly Detection in 3D Brain MRI with 2D Foundation Models

无需训练的3D脑部MRI中零样本异常检测

Tai Le-Gia, Jaehyun Ahn

机构 * Department of Mathematics, Chungnam National University(Chungnam国立大学数学系)

专题命中 领域大模型 :foundation model(title,abstract);language model(abstract)

AI总结 本文提出无需训练的3D脑部MRI零样本异常检测框架,通过聚合多轴切片的2D基础模型生成局部体积标记,恢复立方空间上下文并直接整合距离基异常检测流程,提供高效的3D表示。

Comments Accepted for MIDL 2026

Journal ref Tai Le Gia, Jaehyun Ahn Proceedings of The 9th International Conference on Medical Imaging with Deep Learning, PMLR 315:3069-3088, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22101 2026-06-23 cs.LG cs.CV 新提交 81%

OphthaDT: Generative Digital Twins for Forecasting Visual Acuity Trajectories in Ophthalmology

OphthaDT:用于眼科视力轨迹预测的生成式数字孪生

Pietro Belligoli, Nikita Makarov, Sayedali Shetab Boushehri, Fabian Schmich, Raul Rodriguez-Esteban, Michael Menden

机构 * Computational Sciences Center of Excellence, Roche, Penzberg, Germany(计算科学卓越中心,罗氏,彭茨贝格,德国) Computational Health Center, Helmholtz Munich, Munich, Germany(计算健康中心,亥姆霍兹慕尼黑,慕尼黑,德国) Department of Biology, Ludwig Maximilian University of Munich, Munich, Germany(生物学系,路德维希-马克西米利安-慕尼黑大学,慕尼黑,德国) Computational Sciences Center of Excellence, Roche, Basel, Switzerland(计算科学卓越中心,罗氏,巴塞尔,瑞士) Department of Biochemistry and Pharmacology, Bio21 Molecular Science and Biotechnology Institute, The University of Melbourne, Parkville, Australia(生物化学与药理学系,Bio21分子科学与生物技术研究所,墨尔本大学,帕克维尔,澳大利亚) Technical University of Munich, Munich, Germany(慕尼黑工业大学,慕尼黑,德国)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 提出基于LLM的数字孪生OphthaDT,通过序列化纵向患者历史预测最佳矫正视力,在nAMD和DME数据集上分别降低MAE 6.0%和2.6-6.9%,尤其擅长处理高变异性轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21977 2026-06-23 cs.CY cs.AI cs.HC 新提交 81%

Old Fictions, New Skins: Evaluating the Manipulative Capabilities of LLMs in Healthcare

旧小说,新皮肤:评估LLM在医疗保健中的操纵能力

Gathoni Ireri, Roger D. Odipo

机构 * ILINA Program(ILINA项目) Haki AI

专题命中 领域大模型 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过随机实验发现,ChatGPT 5.2和DeepSeek V3.2在肯尼亚参与者中能显著操纵其治疗决策,成功率从44.0%升至59.5%,凸显非洲医疗AI中防范操纵的必要性。

Comments 28 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20776 2026-06-23 cs.SE cs.AI cs.NE 新提交 81%

Formally Verified Code Synthesis for Structured Data Translation in a Medical Internet of Things

医疗物联网中结构化数据翻译的形式化验证代码合成

Colin Samplawski, Adam D. Cobb

机构 * Computer Science Laboratory, SRI International(SRI国际计算机科学实验室)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出一种基于LLM的进化代码合成系统,集成形式化验证步骤,用于医疗物联网中结构化数据翻译,确保生成代码满足预定义需求,并以脉搏血氧仪集成案例展示其低开销生成正确翻译的能力。

Comments Spotlight Paper at the Workshop on Structured Data for Health at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20756 2026-06-23 physics.chem-ph cs.AI cs.LG 新提交 81%

A large-scale foundation model enables simulation-to-real adaptation for nuclear magnetic resonance-based molecular structure analysis

大规模基础模型实现基于核磁共振的分子结构分析的仿真到真实适应

Chen Yang, Zheng Fang, Hanyu Sun, Fanjie Xu, Hongxin Xiang, Hanyu Gao, Xiangxiang Zeng, Yuqiang Li, Xiaojian Wang, Jun Xia

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Peking Union Medical College(北京友谊医院) Chinese Academy of Medical Sciences(中国医学科学院) Xiamen University(厦门大学) Hunan University(湖南大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出大规模NMR基础模型UltraNMR,通过1.58亿对模拟谱预训练,学习可泛化谱表示,在多个实验NMR任务上取得最先进性能,并实现结构感知检索和真实天然产物结构解析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21389 2026-06-23 cs.CR 新提交 80%

From Production SIEM to Reusable Cybersecurity Artifacts

从生产SIEM到可复用的网络安全工件

Sidnei Barbieri, Leonardo Vaz de Meneses, Ágney Lopes Roth Ferraz, Wagner Comin Sonaglio, Lourenço Alves Pereira Júnior

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种从生产金融安全运营中心提取、匿名化、结构化并验证SIEM数据的方法,生成可复用的研究工件,并通过训练和测量实验验证其隐私-效用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23243 2026-06-23 cs.CR cs.AI 版本更新 79%

Are Frontier LLMs Ready for Cybersecurity? Evidence for Vertical Foundation Models from Dual-Mode Vulnerability Benchmarks

前沿大语言模型是否已为网络安全做好准备?来自双模式漏洞基准测试的垂直基础模型证据

Vivek Dahiya, Sunny Nehra, Vipul Dholariya, Bhavik Shangari, Chandra Khatri

机构 * super-intel.ai(超级智能人工智能公司)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.AI

AI总结 通过白盒函数级漏洞检测和黑盒Web应用安全测试双模式基准测试,评估前沿大语言模型在网络安全任务中的表现,发现其存在高误报率、低覆盖率等问题,而领域专用模型通过结构化方法显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20906 2026-06-23 cs.LG 版本更新 79%

Turning Tabular Foundation Models into Graph Foundation Models

将表格基础模型转化为图基础模型

Dmitry Eremeev, Gleb Bazhenov, Oleg Platonov, Artem Babenko, Liudmila Prokhorenkova

机构 * HSE University(俄罗斯高等经济大学) Yandex Research(Yandex研究院)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG

AI总结 提出G2T-FM框架,通过增强节点特征和结构嵌入,利用表格基础模型处理图节点任务,在上下文学习和微调中均优于现有图基础模型和GNN。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21605 2026-06-23 cs.CV 新提交 78%

$μ$Match: Foundation Models for Semi-supervised Learning and Domain Adaptation in EM

$\mu$Match:电子显微镜中半监督学习和领域适应的基础模型

Marei Freitag, Olesia Korchevaia, Luca Freckmann, Anwai Archit, Constantin Pape

机构 * Life and Medical Sciences Institute (LIMES), University of Bonn, Germany(波恩大学生命与医学科学研究所(LIMES)) Institute of Computer Science, Georg-August-University Göttingen, Germany(哥廷根大学计算机科学研究所)

专题命中 领域大模型 :foundation model(title,abstract)

AI总结 提出μMatch框架,利用基础模型(SAM、SAM2、μSAM、DINOv2/v3)和师生方法,在电子显微镜分割任务(线粒体、细胞核、神经突)中实现半监督学习和领域适应,显著减少标注需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18123 2026-06-23 cs.CV 新提交 78%

Predicting Immune Biomarkers with MultiModal Mixture-of-Expert Pathology Foundation Models Empowers Precision Oncology

使用多模态混合专家病理基础模型预测免疫生物标志物,赋能精准肿瘤学

Tianyu Liu, Ziqing Wang, Zhaokang Liang, Tong Ding, Peter Humphrey, Lorraine Colón-Cartagena, Emily Ling-Lin Pai, Kenneth Tou En Chang, Mohamed Kahila, Jonathan Chong Kai Liew, Tinglin Huang, Rex Ying, Kaize Ding, Faisal Mahmood, Wengong Jin

机构 * Program of Computational Biology and Bioinforamtics, Yale University(耶鲁大学计算生物学与生物信息学项目) Broad Institute of MIT and Harvard(麻省理工学院与哈佛大学博德研究所) Department of Statistics and Data Science, Northwestern University(西北大学统计与数据科学系) Department of Computer Science, Northeastern University(东北大学计算机科学系) Department of Computer Science, Harvard University(哈佛大学计算机科学系) Department of Pathology, Yale University(耶鲁大学病理学系) Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(宾夕法尼亚大学医院解剖病理学与检验医学系) Department of Pathology and Laboratory Medicine, University of California, San Francisco(加州大学旧金山分校病理学与检验医学系) Department of Pathology and Laboratory Medicine, KK Women’s and Children’s Hospital(竹脚妇幼医院病理学与检验医学系) Department of Biostatistics, Epidemiology and Informatics, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院生物统计学、流行病学与信息学系)

专题命中 领域大模型 :foundation model(title,abstract)

AI总结 提出MixTIME多模态基础模型,采用混合专家架构整合不同模态的病理基础模型,从HE全切片图像预测多重免疫荧光蛋白表达,在17个蛋白标记物上达到最优性能,并增强空间域识别、生存预测等下游任务。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23165 2026-06-23 cs.IR cs.CL 新提交 77%

The Language Blind Spot: How Query Language and Brand Recognition Tier Shape AI-Constructed Brand Reputation Across Twelve European Languages

语言盲点:查询语言与品牌识别层级如何塑造跨十二种欧洲语言的AI构建品牌声誉

Dmitrij Żatuchin

机构 * Estonian Entrepreneurship University of Applied Sciences (EUAS)(爱沙尼亚应用科学创业大学)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过查询三种大语言模型对66个品牌在12种语言中的表现,发现AI构建的品牌声誉存在语言依赖性,且查询语言对本地品牌的推荐影响远大于对全球品牌的影响,表明仅用英语监测存在语言盲点。

Comments 17 pages, 3 figures. Data and analysis code on Zenodo, https://doi.org/10.5281/zenodo.20794390

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20663 2026-06-23 cs.AI cs.CL cs.LG 新提交 75%

DrugBench: Evaluating AI Control Protocols for Medication Harm Mitigation

DrugBench:评估用于减轻药物危害的AI控制协议

Guido Freire, Agustín Martínez-Suñé, Viviana Cotik

机构 * Universidad de Buenos Aires, Facultad de Ciencias Exactas y Naturales, Departamento de Computación(布宜诺斯艾利斯大学,精确与自然科学学院,计算机系) AI Safety Argentina (AISAR)(阿根廷人工智能安全组织 (AISAR)) Department of Computer Science, University of Oxford(牛津大学计算机科学系) CONICET-Universidad de Buenos Aires, Instituto de Ciencias de la Computación (ICC)(阿根廷国家科学与技术研究理事会-布宜诺斯艾利斯大学,计算机科学研究所 (ICC))

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DrugBench基准,结合医疗对话与FDA标签,评估AI控制协议在减轻药物交互、禁忌症等四类危害中的有效性,并引入基于严重性的监控方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20573 2026-06-23 cs.NI cs.MA 新提交 75%

AONA: A Comprehensive Architecture and Workflow Design for Global Agentic Collaboration

AONA:全球智能体协作的综合架构与工作流设计

Jinliang Xu, Runkai Zhu, Bingqi Li, Fanjie Nie, Jin Li, Jiagui Xie

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对现有互联网缺乏语义感知和去中心化信任机制的问题,提出AONA覆盖网络架构,通过四层逻辑蓝图和分布式节点基础设施,实现跨协议、跨平台的智能体互操作。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23608 2026-06-23 cs.AI cs.LG cs.SE stat.AP 新提交 73%

Causal Discovery in the Era of Agents

智能体时代的因果发现

Yujia Zheng, Vishal Verma, Mantej Gill, Haoyue Dai, Peter Spirtes, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出智能体应辅助因果发现流程而非提供因果结论,通过causal-learn+平台实现数据驱动、算法支撑的因果发现,避免语言模型不可靠性转化为因果证据。

Comments Platform is available at causallearn.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23607 2026-06-23 cs.LG cs.AI 新提交 73%

Scaling Linear Mode Connectivity and Merging to Billion Parameter Pretrained Transformers

缩放线性模式连通性与合并至十亿参数预训练Transformer

Tianyi Li, Zhiqiang Shen

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 领域大模型 :LLM(abstract_cn);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种可扩展框架,通过参数化权重变换和双向优化实现十亿参数预训练Transformer的线性模式连通性与合并,显著降低插值障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16378 2026-06-23 cs.CL cs.LG 版本更新 73%

Reciprocal Co-Training (RCT): Coupling Gradient-Based and Non-Differentiable Models via Reinforcement Learning

互惠协同训练(RCT):通过强化学习耦合基于梯度和非可微模型

Yunshuo Tian, Akayou Kitessa, Tanuja Chitnis, Yijun Zhao

机构 * Department of Computer and Information Science, Fordham University(福特汉姆大学计算机与信息科学系) Department of Neurology, Mass General Brigham(麻省总医院神经科)

专题命中 领域大模型 :LLM(abstract_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出互惠协同训练框架,通过强化学习耦合大语言模型与随机森林分类器,实现双向适应,提升医疗数据集上两种模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13514 2026-06-23 cs.CL cs.AI 版本更新 73%

ProMed: Shapley Information Gain Guided Reinforcement Learning for Proactive Medical LLMs

ProMed:基于Shapley信息增益引导的强化学习用于主动式医疗大语言模型

Hongxin Ding, Baixiang Huang, Yue Fang, Weibin Liao, Xinke Jiang, Jinyang Zhang, Yinghao Zhu, Zheng Li, Liantao Ma, Junfeng Zhao, Yasha Wang

机构 * National Engineering Research Center of Software Engineering, Peking University, China(软件工程国家工程研究中心,北京大学,中国) School of Computer Science, Peking University, Beijing, China(北京大学计算机学院,北京,中国) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Peking University Information Technology Institute, Tianjin Binhai, China(北京大学信息技术研究所,天津滨海,中国) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ProMed框架,通过Shapley信息增益奖励引导强化学习,使医疗大语言模型从被动回答转向主动提问,在部分信息医疗基准上平均提升6.29%。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22906 2026-06-23 cs.SE cs.AI 新提交 70%

From Fragments to Paths: Task-Level Context Recovery for Large Industrial Codebases

从片段到路径:大型工业代码库的任务级上下文恢复

Jiawei He, Weisong Sun, Mengyu Shi, Jie Jia, Tong Bian, Xikai Yang, Dong Sun

机构 * AMAP, Alibaba Group(阿里集团AMAP) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) University of Cambridge(剑桥大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DeepDiscovery方法,通过两阶段定位-推理框架在预算约束下恢复任务级上下文,显著提升大型工业代码库的文件检索和下游软件工程任务性能。

Comments 12 pages, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22342 2026-06-23 cs.CL 新提交 70%

How Does Research Evolve? Tracing Cross-Domain Trajectories in NLP, ML, and CV with Claim-Grounded Typed Citations

研究如何演化?基于主张的类型化引文追踪 NLP、ML 和 CV 中的跨领域轨迹

Abdul Muntakim, Md Abdullah Al Hafiz Khan, Sadid Hasan, Yong Pei

机构 * Kennesaw State University(肯尼索州立大学) Microsoft(微软)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出 SciTraj 语料库,通过构建类型化引文图(6种关系、32k论文、573k边)追踪 NLP/ML/CV 领域的研究演化,支持跨领域轨迹分析和链接预测基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21963 2026-06-23 cs.AI cs.SE 新提交 70%

Holmes: Multimodal Agentic Diagnosis for Mixed-Language Mobile Crashes at Industrial Scale

Holmes: 工业级混合语言移动崩溃的多模态智能诊断

Jia Li, Wenyuan Ma, Ting Peng, Haibin Zheng, Yuetang Deng

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent Inc.(腾讯公司)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出多智能体系统Holmes,通过多模态运行时信号合成重构崩溃上下文,采用层次化检索-探索-推理架构,在70M行代码中实现87.6%函数级定位准确率,将平均排查时间降低98%至约77秒。

Comments Accepted at FSE'26 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21359 2026-06-23 cs.CL 新提交 70%

Finetuning with Scientific Data Increases Hallucinations: A Multi-domain Factuality Evaluation of LLMs

使用科学数据微调会增加幻觉:LLMs的多领域事实性评估

Raia Abu Ahmad, Nikolas Rauscher, Ekaterina Borisova, Fabio Barth, Georg Rehm, Sebastian Möller

机构 * Deutsches Forschungszentrum für Künstliche Intelligenz GmbH(德国人工智能研究中心 GmbH) Technische Universität Berlin(柏林技术大学) Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SciFactCheck基准和模块化评估框架,发现科学微调模型在所有幻觉类型和科学领域上事实可靠性下降,且内部更不自信但语言更武断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21168 2026-06-23 cs.CL 新提交 70%

Dementia-Agents: A Multi-Modal Multi-Agent System for Dementia Staging and Phenotyping

Dementia-Agents:用于痴呆分期和表型分析的多模态多智能体系统

Yaling Shen, Maja Christensen, Yiwen Jiang, Jenna Dennison, David Darby, Amy Brodtmann, Zongyuan Ge

机构 * Monash University(莫纳什大学) Eastern Health(东部健康) Lived Experience Advisor(生活经验顾问)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Dementia-Agents多智能体框架,通过数据翻译、专家预测和协调聚合三步流程,在真实临床队列中实现优于单一MLLM和先前多智能体系统的痴呆综合征级分期与表型分析。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20978 2026-06-23 cs.AI cs.HC 新提交 70%

How Should Agents Read Demonstrations? Hierarchical Structure Beats Flat Action Logs

智能体应如何阅读演示?层级结构优于扁平动作日志

Honjar Xing, Jefferson Lin, Henry Lieberman

机构 * MIT Computer Science and Artificial Intelligence Laboratory (CSAIL)(麻省理工学院计算机科学与人工智能实验室(CSAIL))

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出将演示中的动作序列组织为带标签的层级子目标,在85个Web自动化任务中,层级结构将模糊描述任务的通过率从76.7%提升至90.7%,而扁平结构改进不显著,消融实验表明子目标分组是唯一驱动因素。

Comments Accepted at the 5th Deep Learning for Code (DL4C) Workshop, ICML 2026. 8 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20910 2026-06-23 cs.CR cs.AI 新提交 70%

Whose Agent Are You? Multi-Layer Fingerprinting and Attribution of Autonomous Web Agents

你是谁的代理?自主网络代理的多层指纹识别与归因

Dayeon Kang, Hyejun Jeong, Jade Sheffey, Pubali Datta, Amir Houmansadr

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对AI网络代理的隐私与安全挑战,提出基于网络层和浏览器交互行为的多层指纹识别方法,通过决策树分类器实现97%准确率的代理识别与归因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13405 2026-06-23 cs.AI cs.MA 新提交 70%

Neuro-Symbolic Agents for Regulated Process Automation: Challenges and Research Agenda

用于受规管流程自动化的神经符号代理:挑战与研究议程

Alexander Rombach, Chantale Lauer, Nijat Mehdiyev

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Saarland University(萨尔大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出将领域内符号结构(法规、流程模型、合规约束)作为代理核心架构组件,实现合规性内置(compliance-by-construction)以补充护栏监控,并列出神经符号研究挑战。

Comments Accepted as a poster in NILA Workshop @ IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19836 2026-06-23 cs.CL physics.ed-ph 版本更新 70%

A Framework for Deductive Semantic Content Analysis at Scale in Science Education Using Text Embeddings

使用文本嵌入进行科学教育中大规模演绎语义内容分析的框架

Jonas Timmann Mjaaland, Markus Fleten Kreutzer, Halvor Tyseng, Rebeckah K. Fussell, Gina Passante, N. G. Holmes, Anders Malthe-Sørenssen, Tor Ole B. Odden

机构 * Center for Interdisciplinary Education, University of Oslo(interdisciplinary Education 中心,奥斯陆大学) Laboratory of Atomic and Solid State Physics, Cornell University(原子与固体物理实验室,康奈尔大学) Department of Physics, California State University Fullerton(物理系,弗里蒙特加州州立大学) Center for Computing in Science Education, University of Oslo(科学教育计算中心,奥斯陆大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于文本嵌入的分类框架DeSCA,仅需少量示例即可实现大规模开放题编码,与人类编码者高度一致,并支持编码一致性审计。

Comments 47 pages plus supplementary information, 5 figures. Version 2 has been lightly edited and formatted to fit better with the field of science education research, including updating the title and adding a brief literature review of NLP methods applied to textual datasets in science education. Results are unchanged since original version

详情

展开后加载摘要…

URL PDF HTML 收藏