arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32006 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32006 篇

2511.19877 2025-12-12 cs.MM cs.CV cs.LG eess.AS 89%

It Hears, It Sees too: Multi-Modal LLM for Depression Detection By Integrating Visual Understanding into Audio Language Models

它能听,也能看 too:通过将视觉理解整合到音频语言模型中构建多模态大语言模型以检测抑郁症

Xiangyu Zhao, Yaling Shen, Yiwen Jiang, Zimu Wang, Jiahe Liu, Maxmartwell H Cheng, Guilherme C Oliveira, Robert Desimone, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(墨尔本大学) Massachusetts Institute of Technology(麻省理工学院) The University of Melbourne(墨尔本大学)

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文提出了一种多模态大语言模型框架,通过整合视觉理解到音频语言模型中,提升抑郁症检测的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09552 2025-12-11 cs.CL 89%

Systematic Framework of Application Methods for Large Language Models in Language Sciences

大型语言模型在语言科学中应用方法的系统框架

Kun Sun, Rong Wang

机构 * Tongji University, China(同济大学) University of Tübingen, Germany(图宾根大学) Institute of Natural Language Processing, University of Stuttgart, Germany(斯图加特大学自然语言处理研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出两个系统框架,指导LLMs在语言科学中的战略应用,通过方法选择和多阶段研究流程提升研究的可重复性和科学性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08936 2025-12-11 cs.HC cs.AI cs.CY 89%

A Principle-based Framework for the Development and Evaluation of Large Language Models for Health and Wellness

基于原则的大型语言模型在健康与健身领域开发与评估框架

Brent Winslow, Jacqueline Shreibati, Javier Perez, Hao-Wei Su, Nichole Young-Lin, Nova Hammerquist, Daniel McDuff, Jason Guss, Jenny Vafeiadou, Nick Cain, Alex Lin, Erik Schenck, Shiva Rajagopal, Jia-Ru Chung, Anusha Venkatakrishnan, Amy Armento Lee, Maryam Karimzadehgan, Qingyou Meng, Rythm Agarwal, Aravind Natarajan, Tracy Giest

机构 * Google Research(谷歌研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出基于原则的框架,用于系统评估LLM在健康与健身领域的应用,通过迭代开发生命周期整合综合评估技术,提升系统安全性和用户反馈的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25643 2025-12-10 cs.AI 89%

SOCK: A Benchmark for Measuring Self-Replication in Large Language Models

SOCK:一种衡量大语言模型自我复制能力的基准

Justin Chavarria, Rohan Raizada, Justin White, Eyad Alhetairshi

机构 * Albion College(阿尔比恩学院) Hunter College(亨特学院) University of Arizona(亚利桑那大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 SOCK提出了一种评估大语言模型自我复制能力的基准,旨在建立标准并减少多代理系统中的潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18274 2025-12-09 cs.HC cs.AI 89%

Clinician-Directed Large Language Model Software Generation for Therapeutic Interventions in Physical Rehabilitation

面向物理康复治疗的临床指导大型语言模型软件生成

Edward Kim, Yuri Cho, Jose Eduardo E. Lima, Julie Muccini, Jenelle Jindal, Alison Scheid, Erik Nelson, Seong Hyun Park, Yuchen Zeng, Alton Sturgis, Caesar Li, Jackie Dai, Sun Min Kim, Yash Prakash, Liwen Sun, Isabella Hu, Hongxuan Wu, Daniel He, Wiktor Rajca, Cathra Halabi, Maarten Lansberg, Bjoern Hartmann, Sanjit A. Seshia

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大型语言模型生成临床指导的康复软件,通过个性化设计提升康复干预效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04759 2025-12-05 cs.CL 89%

Challenging the Abilities of Large Language Models in Italian: a Community Initiative

挑战大型语言模型在意大利语中的能力:一项社区倡议

Malvina Nissim, Danilo Croce, Viviana Patti, Pierpaolo Basile, Giuseppe Attanasio, Elio Musacchio, Matteo Rinaldi, Federico Borazio, Maria Francis, Jacopo Gili, Daniel Scalena, Begoña Altuna, Ekhi Azurmendi, Valerio Basile, Luisa Bentivogli, Arianna Bisazza, Marianna Bolognesi, Dominique Brunato, Tommaso Caselli, Silvia Casola, Maria Cassese, Mauro Cettolo, Claudia Collacciani, Leonardo De Cosmo, Maria Pia Di Buono, Andrea Esuli, Julen Etxaniz, Chiara Ferrando, Alessia Fidelangeli, Simona Frenda, Achille Fusco, Marco Gaido, Andrea Galassi, Federico Galli, Luca Giordano, Mattia Goffetti, Itziar Gonzalez-Dios, Lorenzo Gregori, Giulia Grundler, Sandro Iannaccone, Chunyang Jiang, Moreno La Quatra, Francesca Lagioia, Soda Marem Lo, Marco Madeddu, Bernardo Magnini, Raffaele Manna, Fabio Mercorio, Paola Merlo, Arianna Muti, Vivi Nastase, Matteo Negri, Dario Onorati, Elena Palmieri, Sara Papi, Lucia Passaro, Giulia Pensa, Andrea Piergentili, Daniele Potertì, Giovanni Puccetti, Federico Ranaldi, Leonardo Ranaldi, Andrea Amelio Ravelli, Martina Rosola, Elena Sofia Ruzzetti, Giuseppe Samo, Andrea Santilli, Piera Santin, Gabriele Sarti, Giovanni Sartor, Beatrice Savoldi, Antonio Serino, Andrea Seveso, Lucia Siciliani, Paolo Torroni, Rossella Varvara, Andrea Zaninello, Asya Zanollo, Fabio Massimo Zanzotto, Kamyar Zeinalipour, Andrea Zugarini

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 CALAMITA是一项针对意大利语的社区驱动基准测试项目,通过多样化任务和统一评估流程,系统评估大型语言模型的能力,为其他语言提供评估范例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07004 2025-12-04 cs.CR cs.AI 89%

Casper: Prompt Sanitization for Protecting User Privacy in Web-Based Large Language Models

Casper:用于保护Web基于大语言模型用户隐私的提示净化

Chun Jie Chong, Chenxi Hou, Zhihao Yao, Seyed Mohammadjavad Seyed Talebi

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Casper通过浏览器扩展在用户设备上运行,利用规则过滤、机器学习和本地LLM技术,有效过滤用户输入中的敏感信息,保护隐私。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02977 2025-12-04 cs.SE cs.AI 89%

Large Language Model-Based Agents for Software Engineering: A Survey

基于大型语言模型的软件工程代理:一项综述

Junwei Liu, Kaixin Wang, Yixuan Chen, Xin Peng, Zhenpeng Chen, Lingming Zhang, Yiling Lou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了基于大型语言模型的软件工程代理,分析了其应用、挑战及未来方向。

Comments Accepted by TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02816 2025-12-03 cs.CL 89%

A benchmark dataset for evaluating Syndrome Differentiation and Treatment in large language models

用于评估大型语言模型中辨证论治的基准数据集

Kunning Li, Jianbin Guo, Zhaoyang Shang, Yiqing Liu, Hongmin Du, Lingling Liu, Yuping Zhao, Lifeng Dong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出TCM-BEST4SDT基准,用于评估大型语言模型在中医辨证论治中的能力,包含四个任务并提供三种评估机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07226 2025-12-03 cs.RO cs.AI 89%

Large Language Models for Robotics: A Survey

大语言模型在机器人中的应用:综述

Fanlong Zeng, Wensheng Gan, Zezheng Huai, Lichao Sun, Hechang Chen, Yongheng Wang, Ning Liu, Philip S. Yu

机构 * School of Intelligent Systems Science and Engineering(智能系统科学与工程学院) Jinan University(济南大学) School of Artificial Intelligence(人工智能学院) Jilin University(吉林大学) Shanghai Innovation Institute(上海创新研究院) Lehigh University(莱文斯顿大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了大语言模型在机器人领域的应用,探讨了其在机器人控制、感知、决策和规划等方面的影响与挑战。

Comments Preprint. 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01255 2025-12-02 cs.CR cs.CL cs.SE 89%

Large Language Models Cannot Reliably Detect Vulnerabilities in JavaScript: The First Systematic Benchmark and Evaluation

大语言模型无法可靠地检测JavaScript中的漏洞:首个系统性基准和评估

Qingyuan Fei, Xin Liu, Song Li, Shujiang Wu, Jianwei Hou, Ping Chen, Zifeng Kang

机构 * Lanzhou University(兰州大学) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Technology Support Center of the Cyberspace Administration of China(国家互联网信息办公室技术支撑中心) Fudan University(复旦大学) Beijing University of Posts(北京邮电大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文首次提出FORGEJS框架,构建首个系统性JavaScript漏洞检测基准ARENAJS,并揭示LLM在漏洞检测中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18649 2025-12-02 cs.CL 89%

Evaluating Large Language Models on the 2026 Korean CSAT Mathematics Exam: Measuring Mathematical Ability in a Zero-Data-Leakage Setting

评估大型语言模型在2026年韩国CSAT数学考试中的表现:在零数据泄漏环境下测量数学能力

Goun Pyeon, Inbum Heo, Jeesu Jung, Taewook Hwang, Hyuk Namgoong, Hyein Seo, Yerim Han, Eunbin Kim, Hyeonseok Kang, Sangkeun Jung

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究评估了24种LLM在2026年韩国CSAT数学考试中的表现,发现文本输入优于图像输入,GPT-5系列模型在特定配置下达到满分,同时揭示了微积分领域表现最差,且高难度问题对模型性能影响显著。

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21510 2025-12-02 cs.MA cs.AI 89%

Tool-RoCo: An Agent-as-Tool Self-organization Large Language Model Benchmark in Multi-robot Cooperation

Tool-RoCo: 一种基于机器人协作的大型语言模型自组织评估基准

Ke Zhang, Xiaoning Zhao, Ce Zheng, Jiahong Ning, Dandan Zhu, Wenqi Zhang, Chen Sun, Toshiharu Sugawara

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 Tool-RoCo提出了一种评估大型语言模型在多机器人协作中自主性和协作能力的基准,通过四种不同自主性范式和三个任务测试工具使用效果。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21758 2025-12-01 cs.CR cs.AI cs.CY 89%

A Longitudinal Measurement of Privacy Policy Evolution for Large Language Models

大型语言模型隐私政策演变的纵向测量

Zhen Tao, Shidong Pan, Zhenchang Xing, Emily Black, Talia Gillis, Chunyang Chen

机构 * Technical University of Munich(慕尼黑技术大学) Columbia University(哥伦比亚大学) New York University(纽约大学) CSIRO’s Data61(CSIRO的数据61)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文首次对全球主流LLM提供者的隐私政策进行了纵向研究,揭示了隐私政策的演变趋势、内容特征及地区差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21568 2025-11-27 cs.CL 89%

RoParQ: Paraphrase-Aware Alignment of Large Language Models Towards Robustness to Paraphrased Questions

RoParQ:面向抗 paraphrased 问题的大型语言模型对齐

Minjoon Choi

机构 * Seoul National University(首尔国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);SFT(abstract);分类 cs.CL

AI总结 RoParQ 通过引入 XParaCon 指标和基于推理的 SFT 策略,提升 LLM 在 paraphrased 问题上的鲁棒性与一致性。

Comments 12 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09474 2025-11-27 cs.SE cs.AI cs.OS 89%

MigGPT: Harnessing Large Language Models for Automated Migration of Out-of-Tree Linux Kernel Patches Across Versions

MigGPT:利用大语言模型实现跨版本的Linux内核非官方补丁自动化迁移

Pucheng Dang, Di Huang, Dong Li, Kang Chen, Yuanbo Wen, Qi Guo, Xing Hu

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 MigGPT通过新颖的代码指纹结构和三个精心设计的模块,提高非官方内核补丁迁移的准确性和效率,平均完成率达74.07。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19749 2025-11-26 cs.AI 89%

Scaling Item-to-Standard Alignment with Large Language Models: Accuracy, Limits, and Solutions

基于大语言模型的项目-标准对齐扩展:准确性、限制与解决方案

Farzan Karimi-Malekabadi, Pooya Razavi, Sonya Powers

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究探讨了大语言模型在提升项目-标准对齐效率方面的应用,通过实验发现LLMs在识别不一致项目和筛选候选技能方面表现优异,结合过滤策略可显著减少人工工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11979 2025-11-26 cs.CL cs.MA 89%

Value-Based Large Language Model Agent Simulation for Mutual Evaluation of Trust and Interpersonal Closeness

基于价值的大型语言模型代理模拟用于信任和人际亲密的相互评估

Yuki Sakamoto, Takahisa Uchida, Hiroshi Ishiguro

机构 * The University of Osaka, Graduate School of Engineering Science(大阪大学工学科学研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究通过模拟LLM代理,探讨价值相似性对信任和人际亲密的影响,验证了人工社会中价值观对关系建立的作用。

Journal ref Scientific Reports volume 15, Article number: 41653 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.17432 2025-11-26 cs.CV cs.CL 89%

Video Understanding with Large Language Models: A Survey

利用大语言模型进行视频理解:综述

Yolo Y. Tang, Jing Bi, Siting Xu, Luchuan Song, Susan Liang, Teng Wang, Daoan Zhang, Jie An, Jingyang Lin, Rongyi Zhu, Ali Vosoughi, Chao Huang, Zeliang Zhang, Pinxin Liu, Mingqian Feng, Feng Zheng, Jianguo Zhang, Ping Luo, Jiebo Luo, Chenliang Xu

机构 * University of Rochester(罗切斯特大学) The University of Hong Kong(香港大学) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述了利用大语言模型进行视频理解的最新进展,探讨了Vid-LLMs的分类、功能及应用场景,并指出了未来研究方向。

Comments Accepted to IEEE Transactions on Circuits and Systems for Video Technology (TCSVT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09093 2025-11-26 cs.LG stat.ML 89%

Scaling Up Active Testing to Large Language Models

向大型语言模型扩展主动测试

Gabrielle Berrada, Jannik Kossen, Freddie Bickford Smith, Muhammed Razzak, Yarin Gal, Tom Rainforth

机构 * OATML, Department of Computer Science, University of Oxford(OATML,计算机科学系,牛津大学) Department of Statistics, University of Oxford(统计系,牛津大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出通过上下文学习低成本构建替代模型,实现对大型语言模型的高效主动测试,提升评估准确性并引入误差估计器。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18891 2025-11-25 cs.CL 89%

Reproducibility Study of Large Language Model Bayesian Optimization

大型语言模型贝叶斯优化的可重复性研究

Adam Rychert, Gasper Spagnolo, Evgenii Posashkov

机构 * UL FRI Data Science(UL FRI数据科学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本研究验证了LLAMBO框架在更换语言模型backbone时的鲁棒性,并展示了其在Llama 3.1 70B上的有效性。

Comments 7 pages, 8 figures. Reproducibility study of the LLAMBO framework (ICLR 2024). Code: https://github.com/spagnoloG/llambo-reproducibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18597 2025-11-25 cs.CL 89%

Toward Trustworthy Difficulty Assessments: Large Language Models as Judges in Programming and Synthetic Tasks

迈向可信的难度评估:大型语言模型作为编程和合成任务的裁判

H. M. Shadman Tabib, Jaber Ahmed Deedar

机构 * Department of Computer Science, Bangladesh University of Engineering and Technology(计算机科学系,孟加拉国工程与技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在评估编程问题难度时的可靠性,发现LightGBM在准确性上显著优于GPT-4o,揭示了模型在处理数字约束方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15687 2025-11-25 cs.AI 89%

A Comprehensive Evaluation of Large Language Models on Mental Illnesses

对大语言模型在心理健康领域应用的全面评估

Abdelrahman Hanafi, Mohammed Saad, Noureldin Zahran, Radwa J. Hanafy, Mohammed E. Fouda

机构 * Compumacy for Artificial Intelligence solutions(人工智能解决方案公司) Department of Behavioural Health- Saint Elizabeths Hospital(行为健康部门-圣伊丽莎白医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究评估了33个大语言模型在心理健康任务中的表现,发现GPT-4和Llama 3在障碍检测中表现优异,同时提示工程对提升模型性能至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18221 2025-11-25 cs.CY cs.AI cs.HC 89%

Enhancing Large Language Models for Automated Homework Assessment in Undergraduate Circuit Analysis

增强大型语言模型以用于大学电路分析课程的自动作业评估

Liangliang Chen, Huiru Xie, Zhihao Qin, Yiming Guo, Jacqueline Rohde, Ying Zhang

机构 * School of Electrical Computer Engineering, Georgia Institute of Technology, Atlanta, USA Corresponding Author. E-mail

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究通过多步骤提示和数据增强技术提升GPT-4o在电路分析作业评估中的准确性,使其正确响应率提高至97.70%。

Comments Accepted to 2025 Frontiers in Education (FIE) Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18177 2025-11-25 cs.CL 89%

Rethinking Retrieval: From Traditional Retrieval Augmented Generation to Agentic and Non-Vector Reasoning Systems in the Financial Domain for Large Language Models

重新思考检索:从传统检索增强生成到金融领域大语言模型中的代理和非向量推理系统

Elias Lumer, Matt Melich, Olivia Zino, Elena Kim, Sara Dieter, Pradeep Honaganahalli Basavaraju, Vamse Kumar Subbiah, James A. Burke, Roberto Hernandez

机构 * PricewaterhouseCoopers U.S.(普华永道美国公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出基于向量的代理RAG方法,在金融问答中优于非向量方法,通过交叉编码器重排序和小到大块检索显著提升检索精度和回答质量,但需权衡成本性能。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16654 2025-11-25 cs.CL 89%

Comparison of Text-Based and Image-Based Retrieval in Multimodal Retrieval Augmented Generation Large Language Model Systems

多模态检索增强生成大语言模型系统中基于文本和基于图像的检索比较

Elias Lumer, Alex Cardenas, Matt Melich, Myles Mason, Sara Dieter, Vamse Kumar Subbiah, Pradeep Honaganahalli Basavaraju, Roberto Hernandez

机构 * PricewaterhouseCoopers U.S.(普华永道美国公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文比较了多模态RAG系统中基于文本和基于图像的检索方法,发现直接多模态嵌入检索在性能和准确性上优于基于LLM总结的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02744 2025-11-25 cs.AI 89%

Large Language Model-based Data Science Agent: A Survey

基于大型语言模型的数据科学代理:综述

Ke Chen, Peiran Wang, Yaoning Yu, Xianyang Zhan, Haohan Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文综述了基于LLM的数据科学代理,从代理设计和数据科学流程两个角度探讨其关键原则与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16707 2025-11-24 cs.SE cs.AI 89%

Large language models for automated PRISMA 2020 adherence checking

基于大型语言模型的自动PRISMA 2020合规性检查

Yuki Kataoka, Ryuhei So, Masahiro Banno, Yasushi Tsujimoto, Tomohiro Takayama, Yosuke Yamagishi, Takahiro Tsuge, Norio Yamamoto, Chiaki Suda, Toshi A. Furukawa

机构 * Center for Postgraduate Clinical Training and Career Development, Nagoya University Hospital(名古屋大学医院研究生临床培训与职业发展中心) Center for Medical Education, Graduate School of Medicine, Nagoya University(名古屋大学医学研究生院医学教育中心) Scientific Research Works Peer Support Group (SRWS-PSG)(科学研究作品同伴支持组) Department of Internal Medicine, Kyoto Min-iren Asukai Hospital(京都Min-iren Asukai医院内科学部) Department of Healthcare Epidemiology, Kyoto University Graduate School of Medicine / School of Public Health(京都大学医学研究院/公共卫生学院卫生流行病学部) Department of International and Community Oral Health, Tohoku University Graduate School of Dentistry(东京东医齿学研究院国际与社区口腔健康部) Department of Psychiatry, Okayama Psychiatric Medical Center(冈山精神医学中心精神病学部) CureApp, Inc.(CureApp公司) Department of Psychiatry, Seichiryo Hospital(Seichiryo医院精神病学部) Oku medical clinic(Oku医疗诊所) Department of Health Promotion and Human Behavior, Kyoto University Graduate School of Medicine / School of Public Health(京都大学医学研究院/公共卫生学院健康促进与人类行为部) Kyoto University Hospital(京都大学医院) Division of Radiology and Biomedical Engineering, Graduate School of Medicine, The University of Tokyo(东京大学医学研究生院放射学与生物医学工程部) Department of Rehabilitation, Kurashiki Medical Centre(Kurashiki医疗中心康复部) Department of Epidemiology, Graduate School of Medicine, Dentistry, and Pharmaceutical Sciences, Okayama University(冈山大学医学、牙科和药学研究生院流行病学部)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出利用大型语言模型自动检查PRISMA 2020合规性,通过结构化检查清单显著提升评估准确率,但需人类专家验证以确保编辑决策的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15059 2025-11-20 cs.CV cs.CL 89%

Evaluating Multimodal Large Language Models on Vertically Written Japanese Text

Keito Sasagawa, Shuhei Kurita, Daisuke Kawahara

机构 * Waseda University(早稻田大学) NII(日本国立信息机构) NII LLMC Tokyo, Japan(日本国立信息机构LLMC东京)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 17pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14101 2025-11-19 cs.AI 89%

APD-Agents: A Large Language Model-Driven Multi-Agents Collaborative Framework for Automated Page Design

Xinpeng Chen, Xiaofeng Han, Kaihao Zhang, Guochao Ren, Yujie Wang, Wenhao Cao, Yang Zhou, Jianfeng Lu, Zhenbo Song

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) Huatai Securities Co., Ltd.(华泰证券有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏