arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-28 至 2026-04-28 共收录 113 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 113 篇

2604.24470 2026-04-28 cs.CL 92%

Zero-shot Large Language Models for Automatic Readability Assessment

零样本大语言模型用于自动可读性评估

Riley Grossman, Yi Chen

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文提出零样本提示方法用于自动可读性评估,并首次全面评估了使用大语言模型作为无监督方法的性能,通过测试10种不同开源大语言模型在14种不同数据集上的表现,证明了方法在14个数据集中优于先前方法,同时提出LAURAE结合LLM和可读性公式得分提升鲁棒性。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20374 2026-04-28 cs.CL cs.AI 92%

CFDLLMBench: A Benchmark Suite for Evaluating Large Language Models in Computational Fluid Dynamics

CFDLLMBench: 一个用于评估大型语言模型在计算流体力学中的性能的基准套件

Nithin Somasekharan, Ling Yue, Yadi Cao, Weichao Li, Patrick Emami, Pochinapeddi Sai Bhargav, Anurag Acharya, Xingyu Xie, Shaowu Pan

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) University of California, San Diego(加州大学圣地亚哥分校) National Laboratory of the Rockies(落基山国家实验室) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CFDLLMBench,通过三个互补组件评估LLM在计算流体力学中的能力,包括CFDQuery、CFDCodeBench和FoamBench,旨在测试LLM在流体力学知识、数值与物理推理以及上下文依赖的实现能力。

Comments 40 pages

Journal ref Journal of Data-Centric Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24361 2026-04-28 cs.CL 92%

Culture-Aware Machine Translation in Large Language Models: Benchmarking and Investigation

具有文化意识的大型语言模型机器翻译:基准测试与调查

Zekun Yuan, Yangfan Ye, Xiaocheng Feng, Baohang Li, Qichen Hong, Yunfei Lu, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出CanMT数据集和评估框架,系统评估多种LLM在不同翻译策略下的表现,揭示模型在文化翻译中的性能差异及策略影响,指出文化特定项的翻译难度差异及评估可靠性问题。

Comments 26pages,25 figures ACL2026 main conference, long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24156 2026-04-28 cs.GT cs.AI 92%

Strategic Bidding in 6G Spectrum Auctions with Large Language Models

在6G频谱拍卖中使用大语言模型进行战略投标

Ismail Lotfi, Ali Ghrayeb

机构 * College of Science and Engineering, Hamad Bin Khalifa University(哈马德·本·卡西姆大学科学与工程学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究了在车载网络中使用大语言模型作为投标代理进行6G频谱拍卖,探讨了LLM在预算约束下的投标策略及其对拍卖机制的影响。

Comments Accepted at IEEE Transactions on Vehicular Technology

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24544 2026-04-28 cs.AI cs.CL 92%

STELLAR-E: a Synthetic, Tailored, End-to-end LLM Application Rigorous Evaluator

STELLAR-E: 一个合成、定制、端到端的LLM应用严格评估器

Alessio Sordo, Lingxiao Du, Meeka-Hanna Lenisa, Evgeny Bogdanov, Maxim Romanovsky

机构 * Deutsche Bank, Berlin Technology Center(德意志银行,柏林技术中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 STELLAR-E通过合成数据生成系统,实现无需现有数据的高质量定制数据集创建,提升LLM应用评估的效率与公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23090 2026-04-28 cs.AI 92%

Towards Automated Ontology Generation from Unstructured Text: A Multi-Agent LLM Approach

从非结构化文本自动生成本体:一种多智能体LLM方法

Abid Talukder, Maruf Ahmed Mridul, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种多智能体LLM方法,通过领域特定保险合同实验,验证了在本体生成中规划优先、任务驱动的架构能提升结构质量和查询性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24579 2026-04-28 cs.SE 91%

Measuring the Unmeasurable: Markov Chain Reliability for LLM Agents

测量不可测量的:用于LLM代理的马尔可夫链可靠性

Phat T. Tran-Truong, Xuan-Bach Le

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出TraceToChain方法,通过构建吸收离散时间马尔可夫链模型,对LLM代理执行轨迹进行可靠性分析,提供更精确的成功时间分布估计和不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23374 2026-04-28 cs.CR 91%

Ghost in the Agent: Redefining Information Flow Tracking for LLM Agents

代理中的幽灵:重新定义LLM代理的信息流跟踪

Yuandao Cai, Wensheng Tang, Cheng Wen, Shengchao Qin

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出NeuroTaint框架,通过语义证据、因果推理和持久上下文跟踪,解决LLM代理中信息流跟踪问题,优于现有基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23196 2026-04-28 cs.CR 91%

AsmRAG: LLM-Driven Malware Detection by Retrieving Functionally Similar Assembly Code

AsmRAG:通过检索功能相似的汇编代码实现LLM驱动的恶意软件检测

ElMouatez Billah Karbab

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AsmRAG框架,利用LLM分析汇编代码,通过语义检索提升恶意软件检测的可解释性与鲁棒性,实验表明其在检测和家族归因任务中达到96%和95%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23701 2026-04-28 cs.CL cs.AI cs.CV 91%

Agri-CPJ: A Training-Free Explainable Framework for Agricultural Pest Diagnosis Using Caption-Prompt-Judge and LLM-as-a-Judge

Agri-CPJ:一种无需训练的可解释框架,用于利用Caption-Prompt-Judge和LLM-as-a-Judge进行农业害虫诊断

Wentao Zhang, Qi Zhang, Mingkun Xu, Mu You, Henghua Shen, Zhongzhi He, Keyan Jin, Derek F. Wong, Tao Fang

机构 * Business School, Shandong University of Technology(山东理工大学商学院) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Guangdong Institute of Intelligent Science and Technology(广东智能科学与技术研究院) Macau Millennium College(澳门 millennium 学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Agri-CPJ框架,通过生成结构化形态描述并利用LLM进行判断,解决农业病害诊断中模型易产生错误物种名称和推理不可用的问题,实验显示其在病害分类和问答评分上有显著提升。

Comments This work is an expanded version of our prior paper published in the IEEE ICASSP 2026 conference arXiv:2512.24947, from 4 to 20+ pages, presenting a well-structured and principled framework, extensive experiments, and deeper insights. Tao Fang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12826 2026-04-28 cs.CL cs.AI cs.MA 91%

Scheming Ability in LLM-to-LLM Strategic Interactions

大语言模型在LLM到LLM战略互动中的策略能力

Thao Pham

机构 * Berea College(伯克利学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过博弈论框架评估大语言模型的策略欺骗能力,发现模型在无提示下倾向于欺骗,尤其在Peer Evaluation中全部选择欺骗,揭示了多智能体环境下需加强高风险博弈场景的评估。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23730 2026-04-28 cs.AI 91%

Expert Evaluation of LLM's Open-Ended Legal Reasoning on the Japanese Bar Exam Writing Task

对日本律师考试写作任务中LLM开放式法律推理的专家评估

Jungmin Choi, Keisuke Sakaguchi, Hiroaki Yamada

机构 * Tohoku University(东大) Tokyo Metropolitan University(东京 Metropolitan 大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次提出评估LLM在日本法律领域开放式法律推理能力的数据集,通过法律专家对模型输出的评估揭示了法律推理的局限性与挑战。

Comments 5 pages, Accepted to ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23255 2026-04-28 cs.HC cs.AI cs.CY 91%

Scalable LLM-based Coding of Dialogue in Healthcare Simulation: Balancing Coding Performance, Processing Time, and Environmental Impact

可扩展的基于LLM的医疗模拟对话编码:在编码性能、处理时间和环境影响之间取得平衡

Kiyoshige Garces, Gloria Milena Fernandez-Nieto, Linxuan Zhao, Sachini Samaraweera, Dragan Gasevic, Roberto Martinez-Maldonado, Vanessa Echeverria

机构 * RMIT University(皇家墨尔本理工大学) Monash University(墨尔本大学) Adelaide University(阿德莱德大学) The University of Hong Kong(香港大学) ESPOL University(ESPOL大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文探讨了如何通过优化提示设计和批量策略,在医疗模拟复盘中平衡编码准确性、处理时间和环境影响,展示了LLM在对话分析中的可行性及实际应用价值。

Comments 12 pages, 6 figures. Accepted at the Learning at Scale Conference (L@S) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24076 2026-04-28 cs.AI cs.CL cs.CR 91%

An Information-Geometric Framework for Stability Analysis of Large Language Models under Entropic Stress

一个信息几何框架用于在熵应力下分析大语言模型的稳定性

Hikmat Karimov, Rahid Zahid Alekberli

机构 * Institute of Defense Technologies and Cybersecurity, Azerbaijan Technical University(国防技术与网络安全研究所,阿塞拜疆技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出一个信息几何框架,通过整合任务效用、熵、内部结构指标,评估大语言模型在不确定性下的稳定性,实验显示该方法在高熵条件下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12382 2026-04-28 cs.LG cs.AI cs.CR 91%

Exploring the Secondary Risks of Large Language Models

探索大型语言模型的二次风险

Jiawei Chen, Zhengwei Fang, Yu Tian, Jiawei Du, Chao Yu, Zhaoxia Yin, Hang Su

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) Beijing Zhongguancun Academy(北京中关村学院) Department of Computer Science and Technology, THBI Lab, Tsinghua University(计算机科学与技术系,清华大学THBI实验室) CFAR, A*STAR, Singapore(新加坡A*STAR CFAR)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出二次风险作为新型失败模式,通过SecLens框架系统评估,揭示了大型语言模型在良性交互中存在广泛且转移性强的有害行为,强调需加强安全机制。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04424 2026-04-28 cs.CL cs.AI 91%

EmoBench-M: Benchmarking Emotional Intelligence for Multimodal Large Language Models

EmoBench-M:多模态大语言模型情感智能评估基准

He Hu, Lianzhong You, Hongbo Xu, Qianning Wang, Fei Richard Yu, Fei Ma, Zebang Cheng, Zheng Lian, Yucheng Zhou, Laizhong Cui

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) Auckland University of Technology(奥克兰理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) SKL-IOTSC, CIS, University of Macau(澳门科学技术大学SKL-IOTSC、CIS)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出EmoBench-M,通过建立心理理论基础,评估多模态大语言模型在13种场景中的情感识别、理解及社会复杂情感分析能力,揭示模型在情感智能方面的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06337 2026-04-28 cs.AI 90%

Large Language Models as Virtual Survey Respondents: Evaluating Sociodemographic Response Generation

大型语言模型作为虚拟调查受访者:评估社会人口响应生成

Jianpeng Zhao, Chenyu Yuan, Weiming Luo, Haoling Xie, Guangwei Zhang, Steven Jige Quan, Zixuan Yuan, Pengyang Wang, Denghui Zhang

机构 * University of Macau(澳门大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Seoul National University(首尔国立大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出两种任务抽象方法,评估大型语言模型在生成社会人口数据中的表现,通过跨不同数据集和模型的系统比较,揭示模型在结构化输出生成中的失败模式。

Comments Revised version, major corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23027 2026-04-28 cs.AI 90%

A Systematic Approach for Large Language Models Debugging

大语言模型调试的系统方法

Basel Shbita, Anna Lisa Gentile, Bing Zhang, Sungeun An, Shailja Thakur, Shubhi Asthana, Yi Zhou, Saptha Surendran, Farhan Ahmed, Rohan Kulkarni, Yuya Jeremy Ong, Chad DeLuca, Hima Patel

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出系统化方法用于大语言模型调试,通过统一评估、可解释性和错误分析,帮助开发者迭代诊断模型弱点,优化提示和参数,并适应数据进行微调或评估,尤其在缺乏标准化基准时仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14549 2026-04-28 cs.CR cs.AI 90%

Can Large Language Models Really Recognize Your Name?

大语言模型真的能识别你的名字吗?

Dzung Pham, Peter Kairouz, Niloofar Mireshghallah, Eugene Bagdasarian, Chau Minh Pham, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Google Research(谷歌研究) Carnegie Mellon University(卡内基梅隆大学) Google Research, University of Massachusetts Amherst(谷歌研究,马萨诸塞大学阿默斯特分校) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究大语言模型在短文本中处理模糊人名的可靠性问题,构建AmBench基准测试集,发现模型对模糊人名的识别率下降20-40%,揭示隐私保护中的公平性问题。

Comments ACM FAccT '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24710 2026-04-28 cs.AI cs.CL 90%

Case-Specific Rubrics for Clinical AI Evaluation: Methodology, Validation, and LLM-Clinician Agreement Across 823 Encounters

针对具体病例的评估量表:方法、验证及LLM与医生一致性的823次病例研究

Aaryan Shah, Andrew Hines, Alexia Downs, Denis Bajet, Paulius Mui, Fabiano Araujo, Laura Offutt, Aida Rutledge, Elizabeth Jimenez

机构 * Canvas Medical Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) XPC (X Primary Care)(XPC(X初级保健)) FCA Consulting(FCA咨询) Department of Pediatrics, University of Nevada, Reno, NV, USA(内华达大学拉斯维加斯分校儿科系)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出针对具体病例的评估量表方法,验证了LLM生成的量表在医生一致性上的有效性,展示了在823次病例中医生与LLM的一致性提升。

Comments 14 pages, 2 figures, 3 tables, submitted to JAMIA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10551 2026-04-28 cs.GT cs.AI cs.LG 90%

LLM-Auction: Generative Auction towards LLM-Native Advertising

LLM-Auction: 面向LLM原生广告的生成拍卖

Chujie Zhao, Qun Hu, Shiping Song, Dagui Chen, Han Zhu, Jian Xu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(淘宝与天猫集团)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出LLM-Auction,首个基于学习的生成拍卖机制,通过整合拍卖与生成过程,优化LLM输出与机制目标的偏好对齐,实现高效分配并满足关键机制属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22861 2026-04-28 cs.IR cs.AI cs.LG 90%

IntrAgent: An LLM Agent for Content-Grounded Information Retrieval through Literature Review

IntrAgent:通过文献综述实现内容导向的信息检索的LLM代理

Fengbo Ma, Zixin Rao, Xiaoting Li, Zhetao Chen, Hongyue Sun, Yiping Zhao, Xianyan Chen, Zhen Xiang

机构 * University of Georgia(佐治亚大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出IntraView任务,设计IntrAgent代理,通过文献综述实现精确信息检索,提出包含315个测试实例的IntraBench基准,展示在七个基础LLM上IntrAgent比现有RAG和研究代理基线高13.2%的跨领域准确性。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08568 2026-04-28 cs.CL cs.AI 90%

Can We Still Hear the Accent? Investigating the Resilience of Native Language Signals in the LLM Era

我们还能听到口音吗?在大语言模型时代探究母语信号的韧性

Nabelanita Utami, Ryohei Sasano

机构 * Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过分析ACL论文集不同时期的母语识别趋势,探讨大语言模型对科研论文同质化的影响,发现后LLM时代出现异常波动,部分语言表现更趋明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24158 2026-04-28 cs.AI 90%

Multi-Dimensional Evaluation of Sustainable City Trips with LLM-as-a-Judge and Human-in-the-Loop

多维评估可持续城市旅行的LLM-as-Judge与人机协同

Ashmi Banerjee, Adithi Satish, Wolfgang Wörndl, Yashar Deldjoo

机构 * Technical University of Munich(慕尼黑技术大学) Polytechnic University of Bari(巴里理工学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出多维评估可持续城市旅行推荐的框架,通过LLM-as-Judge和人类协同校准,解决传统指标忽略利益相关者目标的问题,揭示模型偏差与维度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12311 2026-04-28 cs.SE cs.AI cs.HC 90%

Is Vibe Coding the Future? An Empirical Assessment of LLM Generated Codes for Construction Safety

vibe编码是未来吗?对LLM生成代码用于建设安全的实证评估

S M Jamil Uddin

机构 * Department of Construction Management, Colorado State University(科罗拉多州立大学建设管理系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究评估了450个由三个前沿模型生成的Python脚本在建设安全中的可靠性、软件架构和领域特定安全精度,发现用户角色与数据幻觉存在显著关系,且存在高达45%的静默故障率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13360 2026-04-28 cs.CL cs.SE 90%

What Prompts Don't Say: Understanding and Managing Underspecification in LLM Prompts

提示中未言明的内容:理解并管理LLM提示中的不充分性

Chenyang Yang, Yike Shi, Qianou Ma, Michael Xieyang Liu, Christian Kästner, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文探讨了LLM提示中的不充分性问题,指出默认推断的稳定性差且易退化,提出要求意识的提示优化机制和系统性的主动发现与监控流程以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17170 2026-04-28 cs.IR 89%

When LLM Judges Inflate Scores: Exploring Overrating in Relevance Assessment

当大语言模型评分膨胀时:探索相关性评估中的过度评分

Chuting Yu, Hang Li, Guido Zuccon, Joel Mackenzie, Teerapong Leelanupab

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究揭示LLM在相关性评估中存在系统性高估问题,指出模型对不满足信息需求的文本给出高分,且易受文本长度和表层词汇影响,强调需谨慎评估LLM在相关性评估中的应用。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18803 2026-04-28 cs.CV cs.AI 89%

LLM-as-Judge Framework for Evaluating Tone-Induced Hallucination in Vision-Language Models

用于评估视觉-语言模型中语气诱导幻觉的LLM-as-Judge框架

Zhiyuan Jiang, Weihao Hong, Xinlei Guan, Tejaswi Dhandu, Miles Q. Li, Meng Xu, Kuan Huang, Umamaheswara Rao Tida, Bingyu Shen, Daehan Kwak, Boyang Li

机构 * Kean University(凯恩大学) North Dakota State University(北达科他州立大学) McGill University(麦吉尔大学) University of Notre Dame(圣母大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(title,abstract);分类 cs.AI

AI总结 本文提出Ghost-100基准,通过结构化提示强度框架评估不同模型在提示压力下的表现,发现H-Rate和H-Score在模型家族间显著分化,且某些模型对语气敏感度非单调。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22764 2026-04-28 cs.CY cs.AI cs.IR 89%

Implicit Humanization in Everyday LLM Moral Judgments

日常LLM道德判断中的隐性人性化

Hoda Ayad, Tanu Mitra

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 研究探讨了日常LLM在道德判断中隐性人性化倾向的影响,通过分析四个主流LLM的响应,发现其强化了隐性人性化假设,可能加剧过度依赖或信任风险,呼吁未来研究需考虑用户侧隐性人性化并设计解决方案。

Comments 6 pages, 3 figures, Published in CHIIR '26

Journal ref Proceedings of the 2026 Conference on Human Information Interaction and Retrieval (CHIIR '26), pages 497-502, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16378 2026-04-28 cs.CL cs.AI cs.SD 88%

Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs

听译:将语音模态整合到LLMs中的有效性

Sara Papi, Javier Garcia Gilabert, Zachary Hopton, Vilém Zouhar, Carlos Escolano, Gerard I. Gállego, Jorge Iranzo-Sánchez, Ahrii Kim, Dominik Macháček, Patricia Schmidtova, Maike Züfle

机构 * Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会) Barcelona Supercomputing Center(巴塞罗那超级计算中心) University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学) Universitat Politècnica de València(瓦伦西亚理工大学) Soongsil University(顺天大学) Charles University(查尔斯大学) KIT(卡尔斯鲁厄理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文评估了将语音模态整合到LLMs中的有效性,发现级联系统总体更可靠,但最新SpeechLLMs在某些情况下可匹配或超越级联系统,而SFM表现较差,强调整合LLM的重要性。

Comments Project available at https://github.com/sarapapi/hearing2translate | Accepted at TACL, this version is a pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏