arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-21 至 2026-04-21 共收录 803 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 186 篇

2604.17770 2026-04-21 cs.LG 94%

LLM-AUG: Robust Wireless Data Augmentation with In-Context Learning in Large Language Models

LLM-AUG: 基于大语言模型上下文学习的鲁棒无线数据增强

Pranshav Gajjar, Manan Tiwari, Sayanta Seth, Vijay K. Shah

机构 * NextG Wireless Lab, North Carolina State University, NC(NextG无线实验室,北卡罗来纳州立大学,NC)

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文提出LLM-AUG框架,利用大语言模型的上下文学习生成合成样本,提升无线通信任务在低样本下的性能,实验显示其在干扰分类任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17172 2026-04-21 cs.CL cs.AI cs.CY cs.LG 92%

Who Gets Which Message? Auditing Demographic Bias in LLM-Generated Targeted Text

谁会得到哪条信息?对LLM生成定向文本中人口偏见的审计

Tunazzina Islam

机构 * Department of Computer Science(计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统分析了LLM在人口条件定向信息生成中的行为,发现性别和年龄差异在不同模型中表现显著,且上下文提示放大了这些偏见,强调需建立偏见意识生成流程和透明审计框架。

Comments Accepted at Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026). Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16493 2026-04-21 cs.DB cs.AI cs.CL cs.LG 92%

NL2SQLBench: A Modular Benchmarking Framework for LLM-Enabled NL2SQL Solutions

NL2SQLBench: 一个模块化评估和基准测试框架,用于LLM驱动的NL2SQL解决方案

Shizheng Hou, Wenqi Pei, Nuo Chen, Quang-Trung Ta, Peng Lu, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出NL2SQLBench框架,用于评估LLM驱动的NL2SQL方法,通过三个核心模块分析现有策略并提出新指标,评估十种开源方法,揭示现有方法的准确性和效率问题,为未来创新提供指导。

Comments The paper is accepted by VLDB 2026

Journal ref PVLDB, 19(5): 1001 - 1015, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05523 2026-04-21 cs.AI 92%

Market-Bench: Benchmarking Large Language Models on Economic and Trade Competition

Market-Bench: 在经济与贸易竞争中评估大语言模型

Yushuo Zheng, Huiyu Duan, Zicheng Zhang, Yucheng Zhu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出Market-Bench,通过经济贸易竞争评估大语言模型在经济相关任务中的能力,发现LLM在竞争中表现差异显著,只有少数能持续获利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16560 2026-04-21 cs.SE cs.AI cs.ET 92%

SpecPylot: Python Specification Generation using Large Language Models

SpecPylot:利用大语言模型进行Python规范生成

Ragib Shahariar Ayon, Shibbir Ahmed

机构 * Texas State University(德克萨斯州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 SpecPylot利用大语言模型生成Python程序的可执行规范,通过交叉hair符号执行验证,生成合同并支持覆盖率驱动的pytest stubs,但受限于符号探索的界限和LLM行为差异。

Comments Accepted in 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (FSE Companion 26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18234 2026-04-21 cs.IR cs.AI 92%

Evaluating Multi-Hop Reasoning in RAG Systems: A Comparison of LLM-Based Retriever Evaluation Strategies

评估基于检索增强生成系统的多跳推理:LLM检索评估策略的比较

Lorenz Brehme, Thomas Ströhle, Ruth Breu

机构 * Universität Innsbruck(因斯布鲁克大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过对比三种LLM评估策略,提出上下文感知检索评估(CARE),证明其在提升RAG系统多跳推理能力方面效果显著,尤其在参数多和上下文长的模型中表现更优。

Comments 15 Pages, Accepted for publication at the SynIRgy Workshop, ECIR 2026 (48th European Conference on Information Retrieval)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17817 2026-04-21 cs.HC cs.AI cs.MA 92%

Do LLMs Need to See Everything? A Benchmark and Study of Failures in LLM-driven Smartphone Automation using Screentext vs. Screenshots

LLM是否需要看到一切?基于Screentext与截图的LLM驱动智能手机自动化失败性基准与研究

Shiquan Zhang, Tianyi Zhang, Le Fang, Simon D'Alfonso, Hong Jia, Vassilis Kostakos

机构 * University of Melbourne(墨尔本大学) School of Computer Science(计算机科学学院) University of Auckland(奥克兰大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过DailyDroid基准测试,探讨LLM驱动的智能手机自动化在文本与截图输入下的性能差异,揭示UI可访问性、输入模态及LLM应用设计中的关键问题。

Comments 29 pages. This study was conducted around May, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10286 2026-04-21 cs.SI cs.AI 92%

Characterizing LLM-driven Social Network: The Chirper.ai Case

刻画由LLM驱动的社会网络:Chirper.ai案例

Yiming Zhu, Yupeng He, Ehsan-Ul Haq, Gareth Tyson, Pan Hui

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过对比Chirper.ai和Mastodon的社会网络结构,分析LLM代理与人类用户在发帖行为、恶意内容及网络结构上的差异,为负责任的AI通信系统发展提供启示。

Comments Accepted to CSCW 2026, camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16790 2026-04-21 cs.SE cs.AI 92%

Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering

循环中的偏见:用于软件工程的LLM作为评判者的审计

Zixiao Zhao, Amirreza Esmaeili, Fatemeh Fard

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LLM作为评判者在代码评估中的偏见问题,通过测量优先的方法分析了代码生成、修复和测试生成任务中的评判制度,并发现提示偏见显著影响评判结果,甚至改变任务结论和模型排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17750 2026-04-21 cs.CR cs.PL 91%

SDLLMFuzz: Dynamic-static LLM-assisted greybox fuzzing for structured input programs

SDLLMFuzz: 动-静态LLM辅助灰盒模糊测试用于结构化输入程序

Yihao Zou, Tianming Zheng, Futai Zou, Yue Wu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SDLLMFuzz框架,结合LLM生成结构化输入并利用静态崩溃分析,通过动态-静态反馈机制提升模糊测试效率,实验表明其在漏洞发现和时间效率上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17699 2026-04-21 cs.SE 91%

SelfHeal: Empirical Fix Pattern Analysis and Bug Repair in LLM Agents

SelfHeal:LLM代理中故障修复模式的实证分析与故障修复

Niful Islam, Muhammad Anas Raza, Mohammad Wardat

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究LLM代理中的故障修复模式,提出首个基准数据集AgentDefect,并设计SelfHeal多智能体系统,利用ReAct代理结合内部和外部知识实现高效故障修复。

Comments Accepted at EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17093 2026-04-21 cs.CR 91%

HarmChip: Evaluating Hardware Security Centric LLM Safety via Jailbreak Benchmarking

HarmChip:通过禁用基准测试评估以硬件安全为中心的LLM安全

Zeng Wang, Minghao Shao, Weimin Fu, Prithwish Basu Roy, Xiaolong Guo, Ramesh Karri, Muhammad Shafique, Johann Knechtel, Ozgur Sinanoglu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HarmChip基准测试,评估LLM在硬件安全领域的禁用脆弱性,涵盖16个领域、120种威胁和360个提示,揭示了先进LLM在安全查询与伪装攻击间的矛盾表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17053 2026-04-21 cs.CL 91%

Jailbreaking Large Language Models with Morality Attacks

通过道德攻击 jailbreak 大型语言模型

Ying Su, Mingen Zheng, Weili Diao, Haoran Li

机构 * South China University of Technology(南方科技大学) HKUST(香港科技大学) Beihang University(北航大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文通过道德攻击研究大型语言模型的内部道德价值观,构建了包含10300个实例的道德数据集,提出了四种对抗攻击方法,揭示了LLM和防护模型在道德感知攻击中的关键漏洞。

Comments 27 pages, 6 figures, 18 tables. Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07458 2026-04-21 cs.CL cs.AI cs.LG cs.SE 91%

REFLEX: Reference-Free Evaluation of Log Summarization via Large Language Model Judgment

REFLEX:基于大语言模型判断的无参考日志摘要评估

Priyanka Mudgal

机构 * Portland State University(波特兰州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 REFLEX通过大语言模型评估日志摘要质量,无需参考摘要或人工标注,提供稳定且细粒度的评估结果,优于传统指标。

Comments Accepted at IEEE-ICETISI 2025 Code is available at: https://github.com/prmudgal/Reflex

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17966 2026-04-21 cs.AI 91%

TPS-CalcBench: A Benchmark and Diagnostic Evaluation Framework for LLM Analytical Calculation Competence in Hypersonic Thermal Protection System Engineering

TPS-CalcBench: 一种用于高超音速热防护系统工程中LLM分析计算能力的基准和诊断评估框架

Jinglai Zheng, Chuhan Qiao, Haiming Huang

机构 * School of Civil Engineering, Beijing Jiaotong University, Beijing 100044, China(北京交通大学土木工程学院)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文提出TPS-CalcBench,首个针对高超音速气动学和高温气体动力学中闭式解析计算的诊断基准,通过领域导向任务分类、双轨评估和人类-AI数据管道,建立安全关键工程LLM部署评估的完整诊断-评估-干预框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17178 2026-04-21 cs.CL 91%

Cognitive Policy-Driven LLM for Diagnosis and Intervention of Cognitive Distortions in Emotional Support Conversation

认知驱动的LLM用于情绪支持对话中认知扭曲的诊断与干预

Lin Zhong, Renjin Zhu, Shujuan Ma, Jinhao Cui, Lingzhi Wang, Hao Chen, Qing Liao

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) City University of Macau, Macao SAR, China(澳门城市大学) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CogBiasESC数据集和CoPoLLM框架,用于提升LLM在情绪支持对话中识别和干预认知扭曲的能力,实验显示其在诊断准确性和安全性方面优于现有方法。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16542 2026-04-21 cs.CR cs.CL 91%

TWGuard: A Case Study of LLM Safety Guardrails for Localized Linguistic Contexts

TWGuard:LLM安全护栏在本地化语言环境中的案例研究

Hua-Rong Chu, Kuan-Chun Wang, Yao-Te Huang

机构 * Chunghwa Telecom Laboratories(中华电信实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出通过定制数据集优化语言环境特定的LLM安全护栏模型,以解决语言和文化差异导致的性能与实际效果差距问题,TWGuard在F1指标上提升显著,并在误报率上表现优异。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18031 2026-04-21 cs.CL cs.LG q-bio.BM 91%

How Creative Are Large Language Models in Generating Molecules?

大语言模型在生成分子时的创造性如何?

Wen Tao, Yiwei Wang, Peng Zhou, Bryan Hooi, Wanlong Fang, Tianle Zhang, Xiao Luo, Yuansheng Liu, Alvin Chan

机构 * Nanyang Technological University(南洋理工大学) University of California, Merced(加州大学默塞德分校) Hunan University(湖南大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究通过系统实证评估,分析大语言模型在分子生成中的创造性行为,揭示其在不同约束下的表现,首次将分子生成能力重新定义为创造性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04717 2026-04-21 cs.CL cs.AI 91%

Beyond Single-Turn: A Survey on Multi-Turn Interactions with Large Language Models

超越单轮:大型语言模型多轮交互的综述

Yubo Li, Xiaobin Shen, Yidi Miao, Xinyu Yao, Xueying Ding, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型在多轮交互中的评估与增强进展,探讨了多轮对话中上下文、连贯性、公平性和响应性等挑战,并总结了模型优化、外部整合和协作技术等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17132 2026-04-21 cs.CL 90%

Please refuse to answer me! Mitigating Over-Refusal in Large Language Models via Adaptive Contrastive Decoding

请拒绝回答我!通过自适应对比解码缓解大语言模型中的过度拒绝问题

Yupeng Qi, Ziyu Lyu, Lixin Cui, Lu Bai, Feng Xia

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学信息科学与技术学院深圳校区) School of Information, Central University of Finance and Economics(中央财经大学信息学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出自适应对比解码方法,通过对比安全提示下的输出分布,缓解大语言模型的过度拒绝问题,同时保持对恶意查询的高拒绝率。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23889 2026-04-21 cs.CY cs.AI 90%

How Large Language Models Systematically Misrepresent American Climate Opinions

大型语言模型如何系统性地歪曲美国气候观点

Sola Kim, Jieshu Wang, Marco A. Janssen, John M. Anderies

机构 * School of Sustainability, Arizona State University(亚利桑那州立大学可持续发展学院) Department of Technology and Society, Stony Brook University(石溪大学技术与社会系) School of Human Evolution and Social Change, Arizona State University(亚利桑那州立大学人类进化与社会变革学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了大型语言模型在分析美国气候观点时对交集身份的代表性问题,发现模型压缩了观点多样性,可能影响气候治理公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09671 2026-04-21 cs.CL 90%

Table Question Answering in the Era of Large Language Models: A Comprehensive Survey of Tasks, Methods, and Evaluation

在大语言模型时代表问题回答的综合调查:任务、方法和评估

Wei Zhou, Bolei Ma, Annemarie Friedrich, Mohsen Mesgar

机构 * Bosch Center for Artificial Intelligence, Renningen, Germany(博世人工智能研究中心,德国Renningen) LMU Munich & Munich Center for Machine Learning, Germany(慕尼黑大学 & 慕尼黑机器学习中心,德国) University of Augsburg, Germany(奥格斯堡大学,德国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文综述了表问题回答任务,探讨了基于大语言模型的方法,分析了现有基准和任务设置,并指出了未被系统覆盖的及时主题,为该领域提供了一个统一的基础。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18169 2026-04-21 cs.CL cs.AI 90%

Beyond Reproduction: A Paired-Task Framework for Assessing LLM Comprehension and Creativity in Literary Translation

超越复制:一种配对任务框架用于评估LLM在文学翻译中的理解与创造力

Ran Zhang, Steffen Eger, Arda Tezcan, Wei Zhao, Simone Paolo Ponzetto, Lieve Macken

机构 * Natural Language Learning Group (NLLG) School of Business Informatics and Mathematics University of Mannheim(曼海姆大学自然语言学习组(NLLG)商学院信息与数学学院) University of Technology Nuremberg (UTN), Department Engineering(纽伦堡技术大学(UTN)工程系) University of Gent, Department of Translation, Interpreting and Communication(根特大学翻译、口译与传播系) University of Aberdeen, Department of Computing Science(阿伯丁大学计算科学系) Natural Language Learning and Generation (NLLG) Lab(自然语言学习与生成(NLLG)实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种配对任务框架,评估LLM在文学翻译中的理解与创造力。通过11本书的文学片段,评估模型的文本理解与翻译创造力,发现强理解不等于人类水平的创造力,仅Mistral-Large接近人类水平。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17714 2026-04-21 cs.CL cs.AI 90%

Screen Before You Interpret: A Portable Validity Protocol for Benchmark-Based LLM Confidence Signals

在解释前筛查:一种便携式有效性协议用于基于基准的LLM置信信号

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文提出一种便携式有效性协议,用于评估基于基准的LLM置信信号,通过临床人格评估中的有效性筛查原则,定义了三个核心指标和结构指标,验证了20个前沿LLM在524个项目上的有效性。

Comments 25 pages, 6 figures, 8 tables, 2 appendices. Companion to arXiv:2604.15702

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16054 2026-04-21 cs.CR cs.CL 90%

Privacy-R1: Privacy-Aware Multi-LLM Agent Collaboration via Reinforcement Learning

Privacy-R1: 通过强化学习实现隐私意识的多LLM代理协作

Zheng Hui, Yijiang River Dong, Sanhanat Sivapiromrat, Ehsan Shareghi, Nigel Collier

机构 * University of Cambridge(剑桥大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Privacy-R1框架,通过强化学习动态路由文本块,在隐私泄露与任务性能间取得平衡,引入医疗数据集验证方法有效性,实现隐私-效用前沿的新状态。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17327 2026-04-21 q-fin.PM cs.AI q-fin.ST 90%

Signal or Noise in Multi-Agent LLM-based Stock Recommendations?

多智能体基于LLM的股票推荐中信号还是噪声?

George Fatouros, Kostas Metaxas

机构 * MarketSenseAI

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文验证了MarketSenseAI多智能体LLM股票系统在投资组合层面的表现,发现其买入推荐在被动基准和随机选择上具有超额收益,揭示了智能体结构对alpha来源的适应性整合机制。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16511 2026-04-21 cs.DB cs.CL 90%

SQL Query Engine: A Self-Healing LLM Pipeline for Natural Language to PostgreSQL Translation

SQL查询引擎:一种自我修复的LLM管道,用于自然语言到PostgreSQL的转换

Muhammad Adeel Ijaz

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出SQL查询引擎,通过两阶段LLM管道将自然语言问题转换为验证过的PostgreSQL查询。第二阶段执行查询并进入自我修复循环以处理错误。系统在多个LLM后端上进行了评估,展示了自我修复循环在准确性上的提升。

Comments 16 pages, 5 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16383 2026-04-21 cs.CY cs.AI 90%

Same Verdict, Different Reasons: LLM-as-a-Judge and Clinician Disagreement on Medical Chatbot Completeness

相同结论,不同原因:LLM作为法官与临床医生在医疗聊天机器人完整性上的分歧

Alexandra DeLucia, Heyuan Huang, Sonal Joshi, Mahsa Yarmohammadi, Ahmed Hassoon, Mark Dredze

机构 * Data Science and AI Institute(数据科学与人工智能研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 研究评估了LLM作为法官在检测医疗聊天机器人完整性上的可靠性,发现其与临床医生在判断标准上存在根本差异,无法有效替代人工评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16339 2026-04-21 cs.AI cs.MA cs.SE 90%

Semantic Consensus: Process-Aware Conflict Detection and Resolution for Enterprise Multi-Agent LLM Systems

语义共识:面向企业多智能体LLM系统的过程感知冲突检测与解决

Vivek Acharya

机构 * Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出语义共识框架,通过过程感知中间件解决多智能体系统中因共享目标解释不一致导致的冲突问题,实现100%工作流完成率和高精度冲突检测。

Comments 18 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16280 2026-04-21 cs.CR cs.AI cs.CY 90%

Love, Lies, and Language Models: Investigating AI's Role in Romance-Baiting Scams

爱情、谎言与语言模型:探讨人工智能在情爱诱骗诈骗中的作用

Gilad Gressel, Rahul Pankajakshan, Shir Rozenfeld, Ling Li, Ivan Franceschini, Krishnashree Achuthan, Yisroel Mirsky

机构 * Center for Cybersecurity Systems & Networks, Amrita Vishwa Vidyapeetham, Amritapuri(网络安全系统与网络中心,阿米特大学,阿米塔普里) Ca’ Foscari University of Venice(威尼斯卡弗斯卡里大学) University of Melbourne(墨尔本大学) Ben Gurion University of the Negev(内盖夫本· Gurion大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 研究探讨AI在情爱诱骗诈骗中的角色,通过访谈和实验发现LLM已被广泛用于诈骗,且安全过滤器无法有效阻止其扩张。

Journal ref USENIX Security Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏