arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-26 至 2026-03-26 共收录 60 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 60 篇

2603.23611 2026-03-26 cs.SE cs.AI cs.CL cs.LG 90%

LLMORPH: Automated Metamorphic Testing of Large Language Models

LLMORPH:大型语言模型的自动化形变测试

Steven Cho, Stefano Ruberto, Valerio Terragni

机构 * University of Auckland(奥克兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LLMORPH通过形变测试技术自动检测大型语言模型输出不一致问题,无需人工标注数据,适用于多种NLP任务和模型评估。

Comments Accepted for publication in the 40th IEEE/ACM International Conference on Automated Software Engineering (ASE 2025). This arXiv version is the authors' accepted manuscript. DOI: 10.1109/ASE63991.2025.00385 Code: github.com/steven-b-cho/llmorph

Journal ref 40th IEEE/ACM International Conference on Automated Software Engineering (ASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23529 2026-03-26 cs.CL cs.AI 90%

Konkani LLM: Multi-Script Instruction Tuning and Evaluation for a Low-Resource Indian Language

科尼语LLM:为低资源印度语言的多脚本指令微调与评估

Reuben Chagas Fernandes, Gaurang S. Patkar

机构 * Don Bosco College Of Engineering(东邦工程学院)

专题命中 评测与基准 :LLM(title,abstract);instruction tuning(title);large language model(abstract);language model(abstract)

AI总结 本文提出Konkani-Instruct-100k数据集,通过Gemini 3生成,开发了优化区域特色的科尼语LLM,并构建多脚本评估基准,提升低资源语言在机器翻译中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21910 2026-03-26 cs.CL cs.AI 90%

AutoSCORE: Enhancing Automated Scoring with Multi-Agent Large Language Models via Structured Component Recognition

AutoSCORE: 通过结构化组件识别提升多智能体大语言模型的自动评分

Yun Wang, Zhaojun Ding, Xuansheng Wu, Siyue Sun, Ninghao Liu, Xiaoming Zhai

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 AutoSCORE通过多智能体大语言模型和结构化组件识别提升自动评分的准确性与可解释性,在多个基准数据集上表现出色,尤其在复杂评分标准下效果显著。

Comments 9 pages, 2 figures

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(48), 40898-40906, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24484 2026-03-26 cs.CV 89%

Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models

视频-only ToM:增强多模态大语言模型的理论思维

Siqi Liu, Xinyang Li, Bochao Zou, Junbao Zhuo, Huimin Ma, Jiansheng Chen

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出VisionToM框架,通过视觉干预增强多模态大语言模型的理论思维能力,改进模型在多模态任务中的推理和问答性能。

Comments 20 pages, 7 figures, accepted at CVPR 2026, project page: see https://founce.github.io/VisionToM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01754 2026-03-26 cs.CL cs.AI cs.LG 89%

Evaluation of Large Language Models via Coupled Token Generation

通过耦合标记生成评估大语言模型

Nina Corvelo Benz, Stratis Tsirtsis, Eleni Straitouri, Ivi Chatzi, Ander Artola Velasco, Suhas Thejaswi, Manuel Gomez-Rodriguez

机构 * Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所) Hasso Plattner Institute(哈索·platzer研究所) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Aalto University(阿尔托大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过耦合自回归生成评估大语言模型,发现其在基准数据集和人机对比中产生不同排名,表明生成过程中的随机性可能影响评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23506 2026-03-26 cs.CL cs.AI 88%

Leveraging Computerized Adaptive Testing for Cost-effective Evaluation of Large Language Models in Medical Benchmarking

利用计算自适应测试对大型语言模型进行成本效益的医学基准评估

Tianpeng Zheng, Zhehan Jiang, Jiayi Liu, Shicong Feng

机构 * Institute of Medical Education, Health Science Center, Peking University(北京大学医学教育研究院、健康科学中心) School of Public Health, Peking University(北京大学公共卫生学院) Peking University Health Science Center-Chaoxing Joint Laboratory for Digital and Smart Medical(北京大学健康科学中心-超星数字与智能医疗联合实验室) Graduate School of Education, Peking University(北京大学教育学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于项目反应理论的计算自适应测试框架,用于高效评估大型语言模型在标准化医学知识中的表现,通过模拟和实证研究验证了其在成本效益和评估效率上的优势。

Comments 37 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12764 2026-03-26 cs.LG cs.DM 88%

GraphOmni: A Comprehensive and Extensible Benchmark Framework for Large Language Models on Graph-theoretic Tasks

GraphOmni: 一种全面且可扩展的大型语言模型在图论任务上的基准框架

Hao Xu, Xiangru Jian, Xinjian Zhao, Wei Pang, Chao Zhang, Suyuchen Wang, Qixin Zhang, Zhengyuan Dong, Joao Monteiro, Bang Liu, Qiuzhuang Sun, Tianshu Yu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Waterloo(滑铁卢大学) Université de Montréal / Mila - Quebec AI Institute(蒙特利尔大学 / 加拿大魁北克人工智能研究所) City University of Hong Kong(香港城市大学) Autodesk(Autodesk公司) Singapore Management University(新加坡国立大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 本文提出GraphOmni基准框架,用于评估大型语言模型在图论任务上的推理能力,通过系统评估发现不同维度对模型性能有显著影响,且先进模型仍有提升空间。

Comments Published at ICLR 2026. Project Page: https://gai-community.github.io/Graph-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24359 2026-03-26 cs.SE cs.HC 88%

Gendered Prompting and LLM Code Review: How Gender Cues in the Prompt Shape Code Quality and Evaluation

性别化提示与大语言模型代码审查:提示中的性别线索如何影响代码质量和评估

Lynn Janzen, Üveys Eroglu, Dorothea Kolossa, Pia Knöferle, Sebastian Möller, Vera Schmitt, Veronika Solopova

专题命中 评测与基准 :LLM(title,abstract);prompting(title,abstract)

AI总结 研究探讨性别化提示对代码生成和审查的影响,发现性别线索在代码质量上影响有限,但对代码审查存在系统性偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24389 2026-03-26 cs.CL cs.AI cs.CY 87%

When AI Meets Early Childhood Education: Large Language Models as Assessment Teammates in Chinese Preschools

当人工智能遇见早期教育:大型语言模型作为中国幼儿园的评估伙伴

Xingming Li, Runke Huang, Yanan Bao, Yuye Jin, Yuru Jiao, Qingyong Hu

机构 * National University of Defense Technology(国防科技大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Oxford(牛津大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨AI如何通过提取结构化质量指标,提升中国幼儿园教师与儿童互动评估的可扩展性,提出TEPE-TCI-370h数据集和Interaction2Eval框架,实现88%的评估一致性,并验证AI在提升评估效率和促进教育公平中的潜力。

Comments Accepted to AIED 2026, Project page: https://qingyonghu.github.io/Interaction2Eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23523 2026-03-26 cs.CL cs.RO 86%

Do 3D Large Language Models Really Understand 3D Spatial Relationships?

三维大语言模型真的能理解三维空间关系吗?

Xianzheng Ma, Tao Sun, Shuai Chen, Yash Bhalgat, Jindong Gu, Angel X Chang, Iro Armeni, Iro Laina, Songyou Peng, Victor Adrian Prisacariu

机构 * VGG(视觉信息组) University of Oxford(牛津大学) Stanford University(斯坦福大学) Simon Fraser University(西蒙弗雷泽大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本文挑战了3D-LLM对三维空间关系的理解能力,提出Real-3DQA基准测试,发现现有模型在去除简单线索后表现不佳,并提出3D重加权训练目标以提升空间推理能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23613 2026-03-26 cs.SE cs.AI 85%

LLMLOOP: Improving LLM-Generated Code and Tests through Automated Iterative Feedback Loops

LLMLOOP: 通过自动化迭代反馈循环改进大语言模型生成的代码和测试

Ravin Ravi, Dylan Bradshaw, Stefano Ruberto, Gunel Jahangirova, Valerio Terragni

机构 * King's College London(伦敦国王学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LLMLOOP通过自动化迭代反馈循环提升大语言模型生成的代码和测试质量,通过五种循环解决编译错误、静态分析问题、测试失败和测试质量改进,验证了其在HUMANEVAL-X基准上的有效性。

Comments Accepted for publication in IEEE International Conference on Software Maintenance and Evolution (ICSME 2025). This arXiv version is the authors' accepted manuscript. DOI: 10.1109/ICSME64153.2025.00109 Code: github.com/ravinravi03/LLMLOOP

Journal ref IEEE International Conference on Software Maintenance and Evolution (ICSME 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23633 2026-03-26 cs.SE 85%

Detect--Repair--Verify for LLM-Generated Code: A Multi-Language, Multi-Granularity Empirical Study

检测-修复-验证LLM生成的代码:多语言、多粒度实证研究

Cheng Cheng

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过检测-修复-验证工作流评估LLM生成代码的安全性,发现多阶段修复能提升安全性和正确性,但修复可靠性依赖于修复范围和测试基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23580 2026-03-26 cs.LG 83%

MetaKube: An Experience-Aware LLM Framework for Kubernetes Failure Diagnosis

MetaKube:一种面向Kubernetes故障诊断的经验感知大语言模型框架

Wei Sun, Ting Wang, Xinran Tian, Wanshun Lan, Xuhan Feng, Haoyue Li, Fangxin Wang

机构 * School of Science(科学学院) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Future Network of Intelligence Institute(深圳未来网络智能研究院) China Mobile Communications Group Guangdong Co., Ltd.(中国移动通信集团广东有限公司)

专题命中 评测与基准 :LLM(title,abstract);post-training(abstract);分类 cs.LG

AI总结 MetaKube通过三个创新提出经验感知的大语言模型框架,提升Kubernetes故障诊断效率与准确性,实现从Qwen3-8B到接近GPT-4.1的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23701 2026-03-26 cs.CL cs.AI 82%

The Diminishing Returns of Early-Exit Decoding in Modern LLMs

现代大语言模型中早期退出解码的边际效益

Rui Wei, Rui Du, Hanfei Yu, Devesh Tiwari, Jian Li, Zhaozhuo Xu, Hao Wang

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Northeastern University(东北大学) Stony Brook University(石溪大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究现代大语言模型中早期退出解码的有效性,分析中间表示演变,并提出衡量模型内在适合性的指标,发现新模型代际中早期退出效果递减,密集变换器比专家混合和状态空间模型更适合早期退出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23576 2026-03-26 stat.AP cs.AI cs.LG 81%

Wafer-Level Etch Spatial Profiling for Process Monitoring from Time-Series with Time-LLM

晶圆级蚀刻空间成像用于时间序列的工艺监控

Hyunwoo Kim, Munyoung Lee, Seung Hyub Jeon, Kyu Sung Lee

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于时间-大语言模型的空间回归模型,直接从多通道在线工艺时间序列预测晶圆级蚀刻深度分布,验证了LLM重编程在晶圆空间监控中的可行性。

Comments Submitted to AVSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23510 2026-03-26 cs.CL cs.AI 81%

Visuospatial Perspective Taking in Multimodal Language Models

多模态语言模型中的视觉空间视角转换

Jonathan Prunty, Seraphina Zhang, Patrick Quinn, Jianxun Lian, Xing Xie, Lucy Cheke

机构 * University of Cambridge(剑桥大学) Department of Psychology(心理学系) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究评估多模态语言模型在视觉空间视角转换任务中的表现,发现其在需抑制自身视角以采用他人视角的层面2视角转换中存在显著缺陷,揭示了当前模型在协作场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24132 2026-03-26 cs.CL cs.AI cs.LG 80%

MedAidDialog: A Multilingual Multi-Turn Medical Dialogue Dataset for Accessible Healthcare

MedAidDialog: 一个多语言多轮医疗对话数据集用于可及性医疗

Shubham Kumar Nigam, Suparnojit Sarkar, Piyush Patel

机构 * University of Birmingham(布里斯托尔大学) Heritage Institute of Technology(遗产理工学院) Madan Mohan Malaviya University of Technology(马丹·莫汉·马尔维亚理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MedAidDialog数据集,用于模拟真实医患对话,通过生成合成对话扩展MDDial数据集,并开发MedAidLM模型以实现多轮对话和诊断推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23539 2026-03-26 cs.AI cs.CL cs.LG nlin.AO 80%

PLDR-LLMs Reason At Self-Organized Criticality

PLDR-LLMs 在自组织临界性中进行推理

Burc Gokden

机构 * Fromthesky Research Labs LLC(Fromthesky研究实验室 LLC)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PLDR-LLMs 在自组织临界状态下展现出推理能力,其推理输出与二级相变特征相似,通过全局统计参数量化推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11304 2026-03-26 cs.IR cs.AI cs.CR 79%

CryptoAnalystBench: Failures in Multi-Tool Long-Form LLM Analysis

CryptoAnalystBench: 多工具长文本LLM分析中的失败

Anushri Eswaran, Oleg Golev, Darshan Tank, Sidhant Rahi, Himanshu Tyagi

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出CryptoAnalystBench,通过198个加密和DeFi查询评估多工具LLM在复杂输入中的表现,揭示七类高阶错误类型,并提供评估框架和缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21037 2026-03-26 cs.LG 79%

When Brain Foundation Model Meets Cauchy-Schwarz Divergence: A New Framework for Cross-Subject Motor Imagery Decoding

当脑基础模型遇见柯西-施瓦茨散度:一种跨受体运动想象解码的新框架

Jinzhou Wu, Baoping Tang, Qikang Li, Yi Wang, Cheng Li, Shujian Yu

机构 * State Key Laboratory of Mechanical Transmission, College of Mechanical and Vehicle Engineering, Chongqing University(机械传动国家重点实验室,重庆大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出一种新的多源域适应框架,利用预训练的脑基础模型进行动态源受体选择,并结合柯西-施瓦茨散度实现特征和决策层面对齐,以提高跨受体运动想象解码的准确率。

Comments This work has been submitted to Elsevier for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16501 2026-03-26 cs.AI 79%

Learning To Guide Human Decision Makers With Vision-Language Models

通过视觉-语言模型引导人类决策者

Debodeep Banerjee, Stefano Teso, Burcu Sayin, Andrea Passerini

机构 * DI, University of Pisa(比萨大学DI) DISI, University of Trento(特伦托大学DISI) CIMEC, University of Trento(特伦托大学CIMEC) Rajib Pal Bankura Sammilani Medical College(拉吉布·帕尔班克尔医学学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出LTG框架,通过视觉-语言模型生成可解释的决策指导,使人类负责最终决策,提升高风险场景下的决策质量与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23848 2026-03-26 cs.CL cs.CY 79%

BeliefShift: Benchmarking Temporal Belief Consistency and Opinion Drift in LLM Agents

BeliefShift:评估LLM代理中时间信念一致性和意见漂移的基准测试

Praveen Kumar Myakala, Manan Agrawal, Rahul Manche

机构 * Independent AI Researcher(独立AI研究员) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 BeliefShift提出一个长期基准测试,评估多会话LLM交互中的信念动态,涵盖时间信念一致性、矛盾检测和证据驱动修正三个赛道,通过2400个标注交互轨迹验证模型在零样本和RAG设置下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24578 2026-03-26 cs.CV eess.IV 78%

Vision-Language Models vs Human: Perceptual Image Quality Assessment

视觉-语言模型与人类:感知图像质量评估

Imran Mehmood, Imad Ali Shah, Ming Ronnier Luo, Brian Deegan

机构 * School of Engineering, University of Galway(Galway大学工程学院) State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(浙江大学极端光信息获取国家重点实验室)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文研究视觉语言模型是否能近似人类对图像质量的感知判断,通过对比心理物理数据,发现模型在颜色丰富度上表现优异,但在对比度上表现较差,且模型一致性与人类对齐性存在矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23925 2026-03-26 cs.CV 78%

DP^2-VL: Private Photo Dataset Protection by Data Poisoning for Vision-Language Models

DP^2-VL: 通过数据污染保护隐私照片的视觉语言模型隐私威胁模型

Hongyi Miao, Jun Jia, Xincheng Wang, Qianli Ma, Wei Sun, Wangqiu Zhou, Dandan Zhu, Yewen Cao, Zhi Liu, Guangtao Zhai

机构 * Shandong University(山东大学) Shanghai Jiao Tong University(上海交通大学) Donghua University(东华大学) Shanghai Normal University(上海师范大学) East China Normal University(华东师范大学) Hefei University of Technology(合肥工业大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出DP2-VL框架,通过数据污染保护隐私照片,分析视觉语言模型在身份关联泄露中的脆弱性,并展示其在不同保护比例下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23481 2026-03-26 cs.CL 77%

IDP Accelerator: Agentic Document Intelligence from Extraction to Compliance Validation

IDP加速器:从提取到合规验证的智能文档智能

Md Mofijul Islam, Md Sirajus Salekin, Joe King, Priyashree Roy, Vamsi Thilak Gudi, Spencer Romo, Akhil Nooney, David Kaleko, Boyi Xie, Bob Strahan, Diego A. Socolinsky

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出IDP加速器框架,通过DocSplit、可配置提取模块、代理分析模块和规则验证模块实现端到端文档智能,展示在医疗行业达到98%准确率和77%成本降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23972 2026-03-26 cs.CL cs.IR 77%

Grounding Arabic LLMs in the Doha Historical Dictionary: Retrieval-Augmented Understanding of Quran and Hadith

以多哈历史词典为基础 grounding Arabic LLMs:检索增强的古兰经和圣训理解

Somaya Eltanbouly, Samer Rashwani

机构 * College of Islamic Studies, Hamad bin Khalifa University(哈马德·本·哈利法大学伊斯兰学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于多哈历史词典的检索增强生成框架,提升阿拉伯语LLM对历史宗教文本的理解能力,实验表明在Fanar和ALLaM模型上准确率超过85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23660 2026-03-26 cs.AI 77%

GTO Wizard Benchmark

GTO Wizard 评估基准

Marc-Antoine Provost, Nejc Ilenic, Christopher Solinas, Philippe Beardsell

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GTO Wizard基准,用于评估HUNL算法,通过与GTO Wizard AI对比,发现现有模型在推理和规划方面仍有较大提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21494 2026-03-26 cs.CL cs.MA 77%

Agentic Automation of BT-RADS Scoring: End-to-End Multi-Agent System for Standardized Brain Tumor Follow-up Assessment

脑肿瘤报告与数据系统自动化:端到端多智能体系统用于标准化脑肿瘤随访评估

Mohamed Sobhi Jabal, Jikai Zhang, Dominic LaBella, Jessica L. Houk, Dylan Zhang, Jeffrey D. Rudie, Kirti Magudia, Maciej A. Mazurowski, Evan Calabrese

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种端到端多智能体系统,结合大语言模型和卷积神经网络,用于自动化脑肿瘤BT-RADS评分,提高了与专家标准的一致性和准确性。

Comments 17 pages, 5 figures, 4 tables, 2 supplementary figures, 3 supplementary tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13119 2026-03-26 cs.CV cs.AI 77%

Geometry-Guided Camera Motion Understanding in VideoLLMs

基于几何的视频LLMs中相机运动理解

Haoan Feng, Sri Harsha Musunuri, Guan-Ming Su

机构 * University of Maryland, College Park(马里兰大学College Park分校) Dolby Laboratories Inc.(杜比实验室)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出通过基准测试、诊断和注入框架,解决视频LLMs中相机运动表示不足的问题,通过CameraMotionDataset和CameraMotionVQA基准,提升模型对相机运动的识别能力。

Comments 10 pages, 7 figures, supplementary included CVPR2026 PVUW

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06615 2026-03-26 cs.SE 75%

Fixturize: Bridging the Fixture Gap in Test Generation

Fixturize:弥合测试生成中的Fixture缺口

Chengyi Wang, Pengyu Xue, Zhen Yang, Xiapu Luo, Yuxuan Zhang, Xiran Lyu, Yifei Pei, Zonghan Jia, Yichen Sun, Linhao Wu, Kunwu Zheng

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Fixturize通过主动识别依赖fixture的函数并迭代生成fixture,提升自动化测试套件质量,显著提高测试通过率和覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏