arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-26 至 2026-05-26 共收录 663 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 104 篇

2605.24287 2026-05-26 cs.SI 67%

Humans Cannot Detect AI-Generated Media But Communities May -- For Now: Collaborative AI Detection in r/RealOrAI on Reddit

人类无法检测AI生成的媒体,但社区可能可以——目前:Reddit上r/RealOrAI中的协作AI检测

Tuğrulcan Elmas

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 通过分析Reddit社区r/RealOrAI一年的活动,研究人类协作检测AI生成媒体的行为,发现社区检测准确率达72%但存在系统性假阳性偏差,且感知特征主导推理,而来源验证虽少但通过聚合被放大4.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25198 2026-05-26 cs.LG cs.AI 62%

Hide to Guide: Learning via Semantic Masking

隐藏以引导:通过语义掩码学习

Ruitao Liu, Qinghao Hu, Alex Hu, Yecheng Wu, Shang Yang, Luke J. Huang, Zhuoyang Zhang, Han Cai, Song Han

机构 * MIT(麻省理工学院) NVIDIA(英伟达)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出语义掩码专家策略优化(SMEPO),通过掩码专家轨迹中与奖励相关的语义片段,将困难问题转化为填空过程,提升强化学习在推理密集型任务中的探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24989 2026-05-26 cs.LG cs.AI cs.IR 62%

Selective Test-Time Compute Scaling for Click-Through Rate Prediction via Uncertainty-Triggered Feature Path Exploration

基于不确定性触发的特征路径探索的点击率预测选择性测试时计算扩展

Moyu Zhang, Yun Chen, Yujun Jin, Jinxin Hu, Yu Zhang, Xiaoyi Zeng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 针对点击率预测中训练数据稀疏导致的不确定性,提出无需训练、模型无关的UTTSI框架,通过双信号估计器区分认知不确定性和偶然模糊性,对不确定实例进行自适应特征过滤和随机特征路径探索,在保持最坏延迟不变的情况下实现平均约2.8倍基础模型开销,实验和在线A/B测试均取得显著提升。

Comments 12 pages, 4 Figures, 3 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24286 2026-05-26 cs.LG cs.CL 62%

Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning

忠实性作为信息流:评估与训练忠实的链式思维推理

Jinghan Jia, Joe Benton, Eric Easley

机构 * Dept. CSE, Michigan State University(密歇根州立大学计算机科学系) Anthropic

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 通过信息流视角提出基于充分性、完整性和必要性的框架,结合熵、掩码KL和梯度诊断评估链式思维忠实性,并引入更新时干预(如注意力掩码、反向梯度掩码等)训练更忠实的推理模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25620 2026-05-26 cs.AI 57%

Back to Parsimonious Latents: Learning Task-Centric World Models from Visual Foundations

回归简约潜在变量:从视觉基础学习以任务为中心的世界模型

Minghao Fu, Fan Feng, Nicklas Hansen, Biwei Huang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI

AI总结 提出TC-WM框架,通过将预训练视觉嵌入线性投影为紧凑潜在状态、对比学习对齐子空间并重建嵌入,将基础模型特征转化为任务充分的世界表示,实现更好的世界建模质量和控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25443 2026-05-26 cs.CL 57%

Harmony in Diversity: Multi-domain Contrastive Policy Optimization for Large Reasoning Models

多样性中的和谐:面向大型推理模型的多域对比策略优化

Zongji Yu, Wenshui Luo, Yiliu Sun, Hao Fang, Runmin Cong, Chaochao Lu, Chen Gong

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Shandong University(山东大学)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL

AI总结 提出多域对比策略优化(MCPO),通过对比学习促进跨域知识迁移并减少干扰,提升大型推理模型在多域场景下的推理能力。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14249 2026-05-26 cs.CL 57%

Which Reasoning Trajectories Teach Students to Reason Better? A Simple Metric of Informative Alignment

哪种推理轨迹能更好地教会学生推理?一个信息对齐的简单度量

Yuming Yang, Mingyoung Lai, Wanxu Zhao, Xiaoran Fan, Zhiheng Xi, Mingqi Wu, Chiyue Huang, Jun Zhao, Haijun Lv, Jian Tong, Yunhua Zhou, Yicheng Zou, Qipeng Guo, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) University of Toronto(多伦多大学) University of Sydney(悉尼大学)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL

AI总结 提出Rank-Surprisal Ratio (RSR)度量,通过结合对齐性和信息性评估推理轨迹对学生模型的适用性,在轨迹选择和教师选择中显著优于现有方法。

Comments Accepted to ACL 2026 (Main Conference). 31 pages. Project page: https://github.com/UmeanNever/RankSurprisalRatio

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24998 2026-05-26 cs.CL 57%

Better, Faster: Harnessing Self-Improvement in Large Reasoning Models

更好、更快:利用大型推理模型的自我改进

Qihuang Zhong, Liang Ding, Juhua Liu, Bo Du, Leszek Rutkowski, Dacheng Tao

机构 * Nanyang Technological University, Singapore(新加坡南洋理工大学) Alibaba Group, China(中国阿里巴巴集团) School of Computer Science, Wuhan University, China(武汉大学计算机学院) AGH University of Science and Technology, Poland(波兰AGH科学与技术大学)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.CL

AI总结 针对自我改进训练中数据不平衡和过度思考问题,提出HSIR方法,通过验证后退出采样和内在多样性评分提升推理性能与效率。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25524 2026-05-26 cs.CV 50%

ProSR: Process-Shaped Spatial Reasoning for Reliable Chain-of-Thought in VLMs

ProSR: 面向可靠思维链的过程塑造空间推理方法

Jiangyang Li, Cong Wan, Changjie Wu, Songlin Dong, Lingjun Zhang, Linzhe Shi, Xu Wang, Zhiheng Ma, Hang Zhang, Mu Xu, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团Amap) Tsinghua University(清华大学) Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 针对视觉语言模型在空间推理中存在的虚假基础与尾部不稳定性问题,提出ProSR框架,通过反事实不变性惩罚和尾部漂移惩罚优化推理过程,提升答案准确率及轨迹稳定性与视觉依赖性。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25409 2026-05-26 cs.CV 50%

MTLLFM: Multimodal-Temporal Laughter Localization: UR-FUNNY-Temporal and SMILE-Temporal Benchmarks with an Adaptive Multimodal Fusion Model

MTLLFM: 多模态时间笑声定位——UR-FUNNY-Temporal和SMILE-Temporal基准数据集与自适应多模态融合模型

Eyal Hanania, Nadav Kirsch, Daniel Arkushin, Jonathan Benvenisti, Amos Bercovich, Elie Zemmour, Sahar Froim

机构 * WSC-Sports(WSC-体育)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 针对现有方法无法精确捕捉短暂笑声事件时间边界的问题,本文提出两个完全标注的时间笑声数据集(UR-FUNNY-Temporal和SMILE-Temporal)和一个轻量级弱监督框架,通过固定HuBERT和MAE编码器结合时间softmax池化与自适应模态门控,实现从片段级标签到帧级时间定位,在体育广播数据上达到99% F1和68.1%定位精度,并将下游笑声推理CIDEr提升227%。

Comments Accepted to the Workshop on Affective & Behavior Analysis in-the-wild, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25326 2026-05-26 cs.CV 50%

Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation

感知-然后-规划:以布局为策略的单目3D场景布局估计

Junwei Zhou, Yu-Wing Tai

机构 * Department of Computer Science(计算机科学系) Dartmouth College(达特茅斯学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出Perceive-then-Plan框架,通过视觉语言模型将单目3D布局估计转化为感知与迭代规划问题,以布局为策略(LaP)学习动作序列逐步优化场景假设,生成更物理一致且与观测对齐的3D布局。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24674 2026-05-26 cs.CV 50%

Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing

推理对齐:扩散Transformer在视频编辑中的隐式推理

Yan Li, Lin Liu, Xiaopeng Zhang, Qi Tian

机构 * The Hongkong University of Science and Technology(香港科技大学) Huawei Inc.(华为公司)

专题命中 推理与问题求解 :LLM(abstract)

AI总结 针对指令式视频编辑中条件信号未分化及交叉注意力监督不足的问题,提出RVEDiT框架,通过粒度路由令牌条件和参考锚定注意力对齐实现粗到细编辑与内部推理正则化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24098 2026-05-26 cs.CV 50%

D2-V2X: Depth-Driven Cooperative V2X Reasoning for Autonomous Driving

D2-V2X: 面向自动驾驶的深度驱动协同V2X推理

Kevin Richard, Alphin Varghese, Colin Pham, David Oh, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 针对单车辆视觉语言模型受传感器遮挡限制的问题,提出D2-V2X基准和基线模型,通过融合3D LiDAR特征与VLM潜空间,利用链式思维推理实现遮挡目标识别和空间估计,在识别遮挡危险和降低空间估计误差上取得显著提升。

Comments Accepted to the DriveX Workshop at CVPR 2026 (Non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 142 篇

2603.11583 2026-05-26 cs.CL cs.AI 95%

UtilityMax Prompting: A Formal Framework for Multi-Objective Large Language Model Tasks

UtilityMax Prompting:多目标大语言模型任务的形式化框架

Ofir Marom

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :prompting(title,title_cn);LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 提出UtilityMax Prompting框架,用影响图和期望效用最大化将多目标LLM任务形式化,在MovieLens 1M数据集上相比自然语言基线提升了精度和NDCG。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24298 2026-05-26 cs.CR cs.AI cs.LG 94%

An Empirical Evaluation of LLM-Generated Code Security Across Prompting Methods

LLM生成代码安全性的提示方法实证评估

Mohammed Kharma, Ahmed Sabbah, Mohammad Alkhanafseh, Mohammad Hammoudeh, David Mohaisen

机构 * Department of Computer Science, Birzeit University(计算机科学系,巴勒斯坦比泽大学) King Fahd University of Petroleum and Minerals(国王法赫德石油和矿物大学) University of Central Florida(中央佛罗里达大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 通过跨5个LLM和4种编程语言的实证评估,提出弱点感知零样本链式思考(WA-0CoT)提示策略,发现提示方法虽影响弱点类别分布,但无法显著降低漏洞频率或密度。

Comments 40 pages, 22 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25998 2026-05-26 cs.LG 92%

Causal methods for LLM development and evaluation

因果方法在LLM开发与评估中的应用

Dennis Frauen, Marie Brockschmidt, Konstantin Hess, Haorui Ma, Yuchen Ma, Abdurahman Maarouf, Maresa Schröder, Jonas Schweisthal, Yuxin Wang, Athiya Deviyani, Sonali Parbhoo, Rahul G. Krishnan, Stefan Feuerriegel

机构 * Imperial College London(帝国理工学院伦敦分校) University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出因果方法可解决LLM开发与评估中的关键因果问题,并系统梳理其在预训练、对齐、路由等环节的应用机会。

Comments Published in KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23970 2026-05-26 cs.CL 92%

Faithful or Fabricated? A Causal Framework for Rationalization Bias in LLM Judges

忠实还是捏造?LLM 评判中合理化偏差的因果框架

Riya Tapwal, Abhishek Kumar, Carsten Maple

机构 * School of Computing and Electrical Engineering(计算与电子工程学院) Indian Institute of Technology (IIT) Mandi(印度理工学院(IIT)曼迪) London U.K.(伦敦英国) Warwick Manufacturing Group U.K.(沃里克制造集团英国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出因果框架研究 LLM 评判者对非证据线索的依赖,通过线索干预和锚定度量揭示其合理化偏差,并验证证据锁定策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24981 2026-05-26 cs.CL cs.LG 92%

Large Language Model Selection with Limited Annotations

有限标注下的大语言模型选择

Yavuz Durmazkeser, Patrik Okanovic, Andreas Kirsch, Torsten Hoefler, Nezihe Merve Gürel

机构 * TU Delft(代尔夫特理工大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出SELECT-LLM框架,通过基于期望信息增益的查询选择规则,在有限标注下高效识别最佳大语言模型,显著降低标注成本。

Comments 33 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24765 2026-05-26 cs.CR cs.LG 92%

CyberMaskQA: A Privacy-Aware Benchmark for Evaluating Large Language Models in Cybersecurity Question Answering

CyberMaskQA: 一个用于评估大语言模型在网络安全问答中隐私意识的基准

Matilda Gaddi, Jin Noh, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系) University of California, San Diego (UCSD)(加州大学圣地亚哥分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 针对现有基准缺乏隐私保护评估的问题,提出CyberMaskQA基准,通过结合人工场景与LLM语义扩展生成带隐私标签的数据集,以评估模型在网络安全问答中的推理与隐私保护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23008 2026-05-26 cs.AI 92%

From Prompt Optimization to Multi-Dimensional Credibility Evaluation: Enhancing Trustworthiness of Chinese LLM-Generated Liver MRI Reports -- with Preliminary Extension to Lung Cancer

从提示优化到多维可信度评估:增强中文LLM生成的肝脏MRI报告的可信度——初步扩展至肺癌

Qiuli Wang, Xinhuang Sun, Yonglin Chen, Jie Cheng, Yongxu Liu, Xingpeng Zhang, Xiaoming Li, Wei Chen

机构 * Yu-Yue Pathology Research Center, Jinfeng Laboratory, Chongqing, China(渝粤病理研究所,金风实验室,重庆,中国) T Magnetic Resonance Imaging Translational Medical Center, Department of Radiology, Southwest Hospital, Army Medical University, Chongqing, China(7T磁共振成像转化医学中心,放射科,西南医院,中国人民解放军军医大学,重庆,中国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出多维可信度评估(MDCA)框架,并指导机构特定提示优化,以增强LLM生成的肝脏MRI报告的可信度,初步扩展至肺癌。

Comments 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24137 2026-05-26 cs.SE cs.AI 92%

Empirical Analysis and Detection of Hallucinations in LLM-Generated Bug Report Summaries

LLM生成的错误报告摘要中幻觉的经验分析与检测

Hinduja Nirujan, Shreyas Patil, Abdallah Ayoub, Ahmad Abdel Latif, Gouri Ginde

机构 * Electrical and Software Engineering(电气与软件工程学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究从章节感知角度经验性地调查了LLM生成的错误报告摘要中的幻觉,提出了联合预测幻觉内容、识别受影响章节和分类幻觉类型的检测方法,并在BugsRepo数据集上取得了良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24069 2026-05-26 cs.CR cs.AI 92%

When the Manual Lies: A Realistic Benchmark to Evaluate MCP Poisoning Attacks for LLM Agents

当手册撒谎:评估LLM智能体MCP投毒攻击的现实基准

Shi Liu, Xuehai Tang, Xikang Yang, Liang Lin, Biyu Zhou, Wenjie Xiao, Wantao Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM智能体通过模型上下文协议(MCP)集成外部工具时面临的工具描述投毒(TDP)攻击,提出MCP-TDP安全基准,包含32个真实测试用例,评估8种主流LLM发现严重漏洞,并提出反应性自我纠正防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23949 2026-05-26 cs.MA cs.AI 92%

SODE: Analyzing Social Dynamics in LLM Agents

SODE:分析LLM智能体中的社会动态

Inseo Jung, Yoonseok Oh, Kyungryul Back, Jinkyu Kim, Jungbeom Lee

机构 * Department of Computer Science, Korea University(韩国大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SODE框架,通过直接互惠、间接互惠和群体动态三个进化维度评估LLM智能体的社会行为,发现指令调优模型存在被动顺从问题,推理模型则因短视优化破坏长期合作,并展示长期框架可激发推理模型的互惠能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11167 2026-05-26 cs.LG cs.CL 91%

SURGE: On the Potential of Large Language Models as General-Purpose Surrogate Code Executors

SURGE: 大型语言模型作为通用代理代码执行器的潜力

Bohan Lyu, Siqiao Huang, Zichen Liang

机构 * Department of Computer Science and Technology, Tsinghua(清华大学计算机科学与技术系) Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua(清华大学交叉信息研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出SURGE基准,包含1160个问题覆盖8个关键方面,通过评估21个开源和专有LLM,研究其作为代码执行预测代理模型的可行性、扩展律、数据效率和预测准确性。

Journal ref Proceedings of The 2025 Conference on Empirical Methods in Natural Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25273 2026-05-26 cs.CY 91%

LLM-as-a-Judge in Healthcare: A Scoping Analysis of Applications, Methods, and Human Alignment

LLM-as-a-Judge 在医疗保健中的应用:应用、方法和人类一致性的范围分析

Lingyao Li, Deyi Li, Chen Chen, Renkai Ma, Runlong Yu, Mingquan Lin, Rui Yin, Lizhou Fan, Cathy Shyr, Siyuan Ma, Mei Liu, Steven Bethard

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过PRISMA指导的系统综述,分析了LLM-as-a-Judge在医疗保健中的应用场景、技术配置和与人类专家判断的一致性,发现其在临床决策支持、自然语言处理等领域有广泛应用,但可靠性因任务而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13510 2026-05-26 cs.CY 91%

Safe-Child-LLM: A Developmental Benchmark for Evaluating LLM Safety in Child-LLM Interactions

Safe-Child-LLM:评估儿童与LLM交互安全性的发展基准

Junfeng Jiao, Saleh Afroogh, Kevin Chen, Abhejay Murali, David Atkinson, Amit Dhurandhar

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出Safe-Child-LLM基准,通过200个对抗性提示和伦理拒绝量表,系统评估LLM在儿童(7-12岁)和青少年(13-17岁)交互中的安全性,发现主流模型存在严重安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26100 2026-05-26 cs.SE cs.AI 91%

Beyond Summaries: Structure-Aware Labeling of Code Changes with Large Language Models

超越摘要:基于结构感知的代码变更标注与大型语言模型

Bar Weiss, Antonio Abu-Nassar, Adi Sosnovich, Karen Yorav

机构 * Viterbi Faculty of Electrical and Computer Engineering(电气与计算机工程学院) IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 提出两阶段流水线,利用大型语言模型对代码补丁中的变更进行基于分类的标注,捕获结构关系和语义属性,以提升代码审查效率。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25440 2026-05-26 cs.CL cs.AI cs.MA 91%

A Multi-Agent LLM Framework for Rating the Quality of Surgical Feedback

用于评估手术反馈质量的多智能体LLM框架

Rafal Kocielnik, J. Everett Knudsen, Steven Y. Cen, Jasmine Lin, Cherine H. Yang, Atharva Deo, Ujjwal Pasupulety, Peter Wager, Anima Anandkumar, Andrew J. Hung

机构 * Computing + Mathematical Sciences, California Institute of Technology(加州理工学院计算与数学科学系) Department of Urology, Cedars-Sinai(塞斯医疗中心泌尿科) Keck School of Medicine, University of Southern California(美国南加州大学凯克医学院)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出一个两阶段LLM框架,通过多智能体提示和手术领域知识注入发现可解释的反馈质量标准,并利用LLM作为评判者自动评分,在预测反馈有效性上优于先前方法。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24755 2026-05-26 cs.AI cs.CL 91%

Automated Detection and Classification of Delusion-related Content in Naturalistic Audio Diaries Using Multi-Agent Language Models

使用多智能体语言模型自动检测和分类自然音频日记中的妄想相关内容

Feng Chen, Justin Tauscher, Changye Li, Meliha Yetisgen, Alex Cohen, Adam Kuczynski, Angelina Pei-Tzu Tsai, Benjamin Buck, Dror Ben-Zeev, Trevor Cohen

机构 * Department of Biomedical Informatics and Medical Education, University of Washington, Seattle, WA, USA(生物医学信息学与医学教育系,华盛顿大学,西雅图,华盛顿州,美国) Department of Psychiatry and Behavioral Sciences, University of Washington, Seattle, WA, USA(精神病学与行为科学系,华盛顿大学,西雅图,华盛顿州,美国) Department of Psychology, Louisiana State University, Baton Rouge, LA, USA(心理学系,路易斯安那州立大学,巴吞鲁日,路易斯安那州,美国) Department of Psychiatry, University of North Carolina at Chapel Hill, Chapel Hill, NC, USA(精神病学系,北卡罗来纳大学教堂山分校,教堂山,北卡罗来纳州,美国)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);foundation model(abstract)

AI总结 提出一种多智能体LLM流水线,从自然音频日记中自动检测和分类妄想信念、情感和行为反应,通过多数投票实现稳健性能。

Comments Accepted by CLPych 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25955 2026-05-26 cs.CL cs.AI cs.LG 90%

QUIET: A Multi-Blank Cascaded Story Cloze Benchmark for LLM Creative Generation Capability

QUIET: 面向LLM创意生成能力的多空白级联故事完形填空基准

Bo Zou, Chao Xu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出QUIET基准,通过多空白级联故事完形填空和基于信息论的自动评分协议,客观评估大语言模型的创意生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏