arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-18 至 2026-03-18 共收录 285 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 61 篇

2406.07714 2026-03-18 cs.CR cs.AI cs.SE 89%

LLAMAFUZZ: Large Language Model Enhanced Greybox Fuzzing

LLAMAFUZZ:大语言模型增强的灰盒模糊测试

Hongxiang Zhang, Yuyang Rong, Yifeng He, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出LLAMAFUZZ,利用大语言模型生成有效输入,提升灰盒模糊测试对结构化数据的处理能力,实验表明其在发现漏洞方面表现优异。

Comments The 7th ACM/IEEE International Conference on Automation of Software Test (AST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16197 2026-03-18 cs.AI cs.CL 88%

Are Large Language Models Truly Smarter Than Humans?

大语言模型真的比人类更聪明吗?

Eshwar Reddy M, Sourav Karmakar

机构 * Applied AI Scientist, Health Vectors(应用人工智能科学家,健康向量) Senior AI Scientist, Intuit India(高级人工智能科学家,Intuit印度)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过三个实验评估六种前沿大语言模型的评估数据污染问题,发现STEM领域污染率最高,且部分模型存在记忆偏差。

Comments 15 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06533 2026-03-18 cs.AI cs.CL 88%

LogicSkills: A Structured Benchmark for Formal Reasoning in Large Language Models

LogicSkills: 一个用于大语言模型形式推理的结构化基准

Brian Rabern, Philipp Mondorf, Barbara Plank

机构 * Niche, Inc.(Niche公司) Oregon State University – Cascades(俄勒冈州立大学-卡斯卡德分校) MaiNLP Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogicSkills基准,评估大语言模型在形式符号化、反例构造和有效性评估三项核心逻辑技能中的表现,揭示高任务准确率可能掩盖核心技能弱点。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16406 2026-03-18 cs.CL cs.AI 86%

Who Benchmarks the Benchmarks? A Case Study of LLM Evaluation in Icelandic

谁评估评估标准?冰岛语LLM评估的案例研究

Finnur Ágúst Ingimundarson, Steinunn Rut Friðriksdóttir, Bjarki Ármannsson, Iris Edda Nowenstein, Steinþór Steingrímsson

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了冰岛语LLM评估现状,指出问题并呼吁改进低/中资源语言的评估方法。研究发现未验证的合成或机器翻译数据导致测试样例严重缺陷,影响结果有效性。

Comments Accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09037 2026-03-18 cs.AI cs.CL 86%

A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems

大语言模型推理前沿的综述:推理扩展、学习推理与代理系统

Zixuan Ke, Fangkai Jiao, Yifei Ming, Xuan-Phi Nguyen, Austin Xu, Do Xuan Long, Minzhi Li, Chengwei Qin, Peifeng Wang, Silvio Savarese, Caiming Xiong, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI研究) National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) A*STAR, Singapore(新加坡A*STAR)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型推理的前沿方法,从推理阶段和架构两个维度分类,探讨了推理扩展到学习推理及代理系统的发展趋势,涵盖监督微调、强化学习等算法及代理工作流设计。

Comments 72 pages, 6 figures. Accepted to TMLR, with Survey Certification award

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16113 2026-03-18 cs.CV cs.AI 85%

PathGLS: Evaluating Pathology Vision-Language Models without Ground Truth through Multi-Dimensional Consistency

PathGLS: 通过多维一致性评估病理视觉-语言模型无需真实数据

Minbing Chen, Zhu Meng, Fei Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出PathGLS,一种无需真实数据的病理VLM评估框架,从 grounding、logic 和 stability 三个维度评估模型性能,通过实验验证其在多个数据集上的优越性,显著优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11408 2026-03-18 q-fin.ST cs.CL 85%

Beyond Polarity: Multi-Dimensional LLM Sentiment Signals for WTI Crude Oil Futures Return Prediction

超越极性:多维LLM情感信号用于WTI原油期货收益率预测

Dehao Dai, Ding Ma, Dou Liu, Kerui Geng, Yiqing Wang

机构 * University of California San Diego(加州大学圣迭戈分校) Georgia Institute of Technology(佐治亚理工学院) New York University(纽约大学) Tulane University(路易斯安那州立大学) Southern Methodist University(南方 Methodist 大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究多维情感信号对WTI原油期货收益率预测的提升作用,利用GPT-4o等模型提取五种情感维度,发现结合GPT-4o和FinBERT可获得最佳预测效果,证明情感信号超越单纯极性具有预测价值。

Comments 28 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13898 2026-03-18 cs.CL 85%

Attribution Quality in AI-Generated Content:Benchmarking Style Embeddings and LLM Judges

AI生成内容中的归因质量:基准测试风格嵌入与LLM裁判

Misam Abbas

机构 * IEEE International Conference on Data Mining Workshops(IEEE国际数据挖掘会议研讨会)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过Human AI Parallel Corpus评估风格嵌入与LLM裁判在AI生成内容归因中的表现,发现LLM裁判在小说和学术写作中表现更优,而嵌入在口语和剧本对话中更占优势,强调归因问题的多维性。

Comments Accepted for publication at the 2025 IEEE ICDM Workshop on "Grounding Documents with Reasoning, Agents, Retrieval, and Attribution". This is author submitted version. Not yet published

Journal ref Proc. IEEE Int. Conf. Data Mining Workshops (ICDMW), pp. 1713-1720, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16155 2026-03-18 cs.DB cs.SE 85%

Dialect-Agnostic SQL Parsing via LLM-Based Segmentation

基于LLM的方言无关SQL解析

Junwen An, Kabilan Mahathevan, Manuel Rigger

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SQLFlex框架,结合语法解析与LLM分段技术,提升对多种SQL方言的解析能力,在SQL检查和测试用例缩减中均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16759 2026-03-18 cs.CL cs.AI 84%

TurnWise: The Gap between Single- and Multi-turn Language Model Capabilities

TurnWise: 单轮与多轮语言模型能力之间的差距

Victoria Graf, Valentina Pyatkin, Nouha Dziri, Nathan Lambert, Hannaneh Hajishirzi

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 评测与基准 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TurnWiseEval基准测试和TurnWiseData数据生成流程,通过对比单轮与多轮对话能力,验证多轮训练对提升多轮对话性能的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16781 2026-03-18 cs.CV cs.AI 83%

IOSVLM: A 3D Vision-Language Model for Unified Dental Diagnosis from Intraoral Scans

IOSVLM:一种用于从牙科内窥扫描进行统一牙科诊断的3D视觉-语言模型

Huimin Xiong, Zijie Meng, Tianxiang Hu, Chenyi Zhou, Yang Feng, Zuozhu Liu

机构 * ZJU-UIUC Institute, Zhejiang University, Haining, 314400, China(浙大浙ICU研究所,浙江大学,海宁,314400,中国) Stomatology Hospital, School of Stomatology, Zhejiang University School of Medicine, Hangzhou, 310058, China(口腔医院,口腔医学院,浙江大学医学院,杭州,310058,中国) Angelalign Research Institute, Angel Align Inc., Shanghai, 200011, China(天使对齐研究院,天使对齐公司,上海,200011,中国)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出IOSVLM,一种端到端的3D视觉-语言模型,利用点云表示内窥扫描,并结合大规模多源数据集,提升牙科诊断和生成式视觉问答的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16052 2026-03-18 cs.AI 83%

A Context Alignment Pre-processor for Enhancing the Coherence of Human-LLM Dialog

一种增强人与大语言模型对话连贯性的上下文对齐预处理模块

Ding Wei

机构 * College of Architecture, Nanjing Tech University(南京工业大学建筑学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出C.A.P.预处理框架,通过语义扩展、时间加权上下文检索和对齐验证,解决长对话中的上下文错位问题,提升对话连贯性与协作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15909 2026-03-18 cs.AI cs.CL cs.HC 82%

Prompt Engineering for Scale Development in Generative Psychometrics

生成心理测量学中生成规模发展的提示工程

Lara Lee Russell-Lasalandra, Hudson Golino

机构 * University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了提示工程策略如何影响大语言模型生成的人格评估题目质量,发现自适应提示设计在提升结构效度和保留题目池大小方面表现最佳,且其效益随模型能力增强而提升。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15164 2026-03-18 cs.CL cs.AI cs.LG 82%

HindSight: Evaluating LLM-Generated Research Ideas via Future Impact

HindSight: 通过未来影响评估大语言模型生成的研究想法

Bo Jiang

机构 * Temple University(特拉华大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HindSight框架,通过匹配生成想法与真实未来出版物,评估研究想法的质量,揭示LLM生成想法与实际研究影响的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15939 2026-03-18 cs.LG cs.AI 81%

Data-Local Autonomous LLM-Guided Neural Architecture Search for Multiclass Multimodal Time-Series Classification

数据本地自主LLM引导的神经架构搜索用于多类多模态时间序列分类

Emil Hardarson, Luka Biedebach, Ómar Bessi Ómarsson, Teitur Hrólfsson, Anna Sigridur Islind, María Óskarsdóttir

机构 * University of Southampton(南安普顿大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种数据本地的LLM引导神经架构搜索框架,用于多类多模态时间序列分类,通过轻量级融合MLP和专家架构联合搜索提升模型性能,减少人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15857 2026-03-18 cs.AI cs.LG cs.RO 81%

Regularized Latent Dynamics Prediction is a Strong Baseline For Behavioral Foundation Models

正则化潜在动态预测是行为基础模型的强基线

Pranaya Jajoo, Harshit Sikchi, Siddhant Agarwal, Amy Zhang, Scott Niekum, Martha White

机构 * Department of Computing Science, University of Alberta, Canada(阿尔伯塔大学计算机科学系) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔机器智能研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair) The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨零样本强化学习中复杂表征学习目标的必要性,提出正则化潜在动态预测方法,通过正则化保持特征多样性,优于现有方法,并在低覆盖场景中表现优异。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16848 2026-03-18 cs.CL 79%

Mediocrity is the key for LLM as a Judge Anchor Selection

中庸是LLM作为判断锚点选择的关键

Shachar Don-Yehiya, Asaf Yehudai, Leshem Choshen, Omri Abend

机构 * The Hebrew University of Jerusalem(海法大学) IBM Research(IBM研究院) MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文研究了LLM作为判断锚点选择对结果可靠性的影响,发现选择不当的锚点会显著降低与人类排名的相关性,并提出可操作的推荐方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16581 2026-03-18 cs.AI 79%

V-DyKnow: A Dynamic Benchmark for Time-Sensitive Knowledge in Vision Language Models

V-DyKnow:面向视觉语言模型的时间敏感知识动态基准

Seyed Mahed Mousavi, Christian Moiola, Massimo Rizzoli, Simone Alghisi, Giuseppe Riccardi

机构 * Signals and Interactive Systems Lab, University of Trento(信号与交互系统实验室,特伦托大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出V-DyKnow基准,评估视觉语言模型对时间敏感事实知识的处理能力,分析模型响应可靠性、知识更新方法有效性及过时预测原因,揭示当前VLM在多模态时间敏感知识获取与更新中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16537 2026-03-18 cs.AI cs.HC cs.RO 79%

Designing for Disagreement: Front-End Guardrails for Assistance Allocation in LLM-Enabled Robots

为分歧设计:LLM赋能机器人中的前端护栏用于辅助分配

Carmen Ng

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一种前端模式,通过限制优先级选择、保持交互相关性及提供可争议路径,解决LLM赋能机器人在多用户辅助分配中的分歧问题。

Comments Accepted at the Proceedings of the CHI 2026 Workshop: Ethics at the Front-End

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10249 2026-03-18 cs.SE cs.AI cs.HC 79%

DUCTILE: Agentic LLM Orchestration of Engineering Analysis in Product Development Practice

DUCTILE:工程分析中产品开发实践的代理LLM协调

Alejandro Pradas-Gomez, Arindam Brahma, Ola Isaksson

机构 * Product Development Division, Department of Mechanical Engineering, Chalmers University of Technology, Gothenburg, Sweden(产品开发部门,机械工程系,楚姆勒斯技术大学,哥德堡,瑞典) GKN Aerospace Engine Systems, Trollhättan, Sweden(GKN航空发动机系统,特罗尔哈塔纳,瑞典)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 DUCTILE通过代理LLM协调工程分析任务,分离自适应协调与确定性执行,解决工具接口变化导致的自动化失效问题,验证了其在航空制造中的有效性。

Comments 22 pages, including supplemental material. 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23252 2026-03-18 cs.LG 79%

NanoFlux: Adversarial Dual-LLM Evaluation and Distillation For Multi-Domain Reasoning

NanoFlux:对抗性双语言模型评估与蒸馏用于多领域推理

Raviteja Anantha, Soheil Hor, Teodor Nicola Antoniu, Layne C. Price

机构 * Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 NanoFlux通过对抗性生成训练数据提升大语言模型推理能力,其生成数据在数学、科学和医学领域均优于传统微调方法,且计算成本降低3-14倍。

Comments Preprint version 3; Updated References

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15799 2026-03-18 cs.AI 79%

Prose2Policy (P2P): A Practical LLM Pipeline for Translating Natural-Language Access Policies into Executable Rego

Prose2Policy (P2P): 一个实用的LLM管道,用于将自然语言访问策略翻译成可执行的Rego

Vatsal Gupta, Darshan Sreenivasamurthy

机构 * Apple(苹果公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 Prose2Policy通过自然语言访问控制策略转化为可执行Rego代码,实现政策检测、组件提取、模式验证等全流程,提升部署可靠性和审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13713 2026-03-18 cs.CL 79%

On Theoretically-Driven LLM Agents for Multi-Dimensional Discourse Analysis

关于理论驱动的LLM代理在多维话语分析中的应用

Maciej Uberna, Michał Wawer, Jarosław A. Chudziak, Marcin Koszowy

机构 * Laboratory of The New Ethos, Warsaw University of Technology, Poland(新伦理实验室,华沙理工大学,波兰) Faculty of Electronics and Information Technology, Warsaw University of Technology, Poland(电子与信息技术学院,华沙理工大学,波兰)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出一种多代理框架,通过引入显式理论知识提升话语分析中改写策略的识别能力,实验表明理论增强的LLM代理在检测强化和泛化等任务上表现显著优于基线模型,宏F1分数提升近30%。

Comments 8 pages, 4 figures, 3 tables. This is the accepted version of the paper presented at the 18th International Conference on Agents and Artificial Intelligence (ICAART 2026), Marbella, Spain

Journal ref Proceedings of the 18th International Conference on Agents and Artificial Intelligence (ICAART 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16124 2026-03-18 cs.SE cs.AI cs.CL 79%

SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding

SWE-QA-Pro:一个代表性的基准和可扩展的训练配方用于仓库级代码理解

Songcheng Cai, Zhiheng Lyu, Yuansheng Ni, Xiangchao Chen, Baichuan Zhou, Shenzhe Zhu, Yi Lu, Haozhe Wang, Chi Ruan, Benjamin Schneider, Weixu Zhang, Xiang Li, Andy Zheng, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) The Hong Kong University of Science and Technology(香港科学与技术大学) McGill University & MILA(麦吉尔大学及MILA) Verdent AI, Inc.(Verdent AI公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SWE-QA-Pro基准,通过多样化的长尾仓库和可执行环境构建,验证了代理工作流在代码理解任务中的优势,并提出可扩展的合成数据管道和两阶段训练方法,使小型模型在复杂行为学习中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03378 2026-03-18 cs.LG cs.AI 79%

AOI: Turning Failed Trajectories into Training Signals for Autonomous Cloud Diagnosis

AOI: 将失败轨迹转化为自主云诊断的训练信号

Pei Yang, Wanyi Chen, Asuka Yuxi Zheng, Xueqian Li, Xiang Li, Haoqin Tu, Jie Xiao, Yifan Pang, Dongdong Zhang, Fuqiang Li, Alfred Long, Lynn Ai, Eric Yang, Bill Shi

机构 * Gradient Soochow University(苏州大学) UC Santa Cruz Georgia Institute of Technology(佐治亚理工学院) University College London(伦敦大学学院) WeJoy ByteDance(字节跳动)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 AOI通过结构化轨迹学习框架,在安全约束下实现自动化操作,结合可训练诊断系统、读写分离执行架构和失败轨迹闭环演进器,提升云诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22223 2026-03-18 cs.LG cs.AI cs.CR cs.NI 79%

ReGAIN: Retrieval-Grounded AI Framework for Network Traffic Analysis

ReGAIN:基于检索的网络流量分析人工智能框架

Shaghayegh Shajarian, Kennedy Marsh, James Benson, Sajad Khorsandroo, Mahmoud Abdelsalam

机构 * Computer Science(计算机科学) North Carolina A\&T State University(北卡罗来纳A&T州立大学) Institute for Cyber Security(网络安全研究所) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ReGAIN结合流量摘要、检索增强生成和大语言模型推理,实现透明准确的网络流量分析,通过多阶段框架提升安全性和性能,验证结果显示其在不同攻击类型中准确率高达95.95%-98.82%。

Comments Accepted to ICNC 2026. This is the accepted author manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23135 2026-03-18 cs.LG cs.AI cs.LO cs.PL cs.SE 79%

VERINA: Benchmarking Verifiable Code Generation

VERINA:可验证代码生成基准测试

Zhe Ye, Zhengxu Yan, Jingxuan He, Timothe Kasriel, Kaiyu Yang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Meta FAIR

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VERINA基准测试,用于全面评估代码、规范及证明生成能力,揭示LLM在可验证代码生成中的挑战,特别是证明生成的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16614 2026-03-18 cs.HC 78%

CoEmpaTeam: Enhancing Cognitive Empathy using LLM-based Avatars and Dynamic Role Play in Virtual Reality

CoEmpaTeam:利用基于LLM的虚拟角色和动态角色扮演增强认知共情

Dehui Kong, Martin Feick, Shi Liu, Alexander Maedche

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出CoEmpaTeam系统,通过VR环境中的LLM驱动虚拟角色和动态角色扮演,提升用户认知共情能力,并通过实验验证其在现实生活中有效转移。

Comments Accepted to appear in the Proceedings of the ACM CHI Conference on Human Factors in Computing Systems (CHI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15892 2026-03-18 cs.IR cs.CL 77%

Temporal Fact Conflicts in LLMs: Reproducibility Insights from Unifying DYNAMICQA and MULAN

LLMs中的时间事实冲突:从统一DYNAMICQA和MULAN得出的可重复性见解

Ritajit Dey, Iadh Ounis, Graham McDonald, Yashar Moshfeghi

机构 * University of Glasgow(格拉斯哥大学) University of Strathclyde(斯特拉斯克莱德大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过复现DYNAMICQA和MULAN的实验,揭示了时间事实冲突的解决依赖于数据集设计和模型规模,发现不同方法框架下的结果差异显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06183 2026-03-18 cs.CL cs.AI cs.CV 76%

CRIMSON: A Clinically-Grounded LLM-Based Metric for Generative Radiology Report Evaluation

CRIMSON:一种基于临床的LLM评估指标用于生成放射学报告评估

Mohammed Baharoon, Thibault Heintz, Siavash Raissi, Mahmoud Alabbad, Mona Alhammad, Hassan AlOmaish, Sung Eun Kim, Oishi Banerjee, Pranav Rajpurkar

机构 * Department of Biomedical Informatics, Harvard Medical School(生物医学信息学系,哈佛医学院) Department of Radiation Oncology, Mass General Brigham(放射肿瘤科,麻省总医院与布里奇沃特医院) King Fahad Hospital, Al-Ahsa Health Cluster, Al Hofuf, Saudi Arabia(国王法赫德医院,阿尔阿萨卫生集群,阿尔霍夫,沙特阿拉伯) Ras-Tanura General Hospital, Ministry of Health, Eastern Province, Saudi Arabia(拉斯-坦纳医院,卫生部,东部省,沙特阿拉伯) Department of Medical Imaging, King Abdulaziz Medical City, Ministry of National Guard, Riyadh, Saudi Arabia(医学影像科,国王阿卜杜勒-阿齐兹医疗城,国民卫队部,利雅得,沙特阿拉伯)

专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI

AI总结 CRIMSON是一种基于临床的LLM评估指标,用于评估生成的放射学报告,通过考虑诊断正确性、上下文相关性和患者安全,提供更全面的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏