arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-22 至 2026-04-22 共收录 78 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 78 篇

2510.08145 2026-04-22 cs.CL 92%

Mitigating Judgment Preference Bias in Large Language Models through Group-Based Polling

通过基于群体的轮询缓解大语言模型中的判断偏好偏差

Shuliang Liu, Zhipeng Xu, Zhenghao Liu, Yukun Yan, Minghe Yu, Yu Gu, Chong Chen, Huiyuan Xie, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,中国北京) Software College, Northeastern University, Shenyang, China(东北大学软件学院,中国沈阳) Huawei, China(华为,中国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出Genii框架,通过多智能体协作优化缓解LLM判断偏好偏差,无需人工标注数据,提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19260 2026-04-22 econ.GN q-fin.EC 92%

Understanding the Mechanism of Altruism in Large Language Models

理解大型语言模型中的利他主义机制

Shuhuai Zhang, Shu Wang, Zijun Yao, Chuanhao Li, Xiaozhi Wang, Songfa Zhong, Tracy Xiao Liu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 研究通过稀疏自编码器揭示LLM利他行为的内部机制,识别出与行为变化相关的神经网络特征,并验证其对分配决策的影响,为对齐LLM行为与人类价值观提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19354 2026-04-22 cs.AI cs.CR cs.SE 92%

Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture The Flag Challenges

智能体是否梦想着根壳?在夺旗挑战中的LLM智能体部分分数评估

Ali Al-Kaswan, Maksim Plotnikov, Maxim Hájek, Roland Vízner, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DeepRed基准,用于评估LLM智能体在真实夺旗挑战中的能力,通过部分分数评分和自动化标注流程,发现当前智能体在非标准发现和长周期适应任务中表现有限。

Comments Accepted to AIWare'26 Benchmark and Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19124 2026-04-22 cs.CL 92%

Detoxification for LLM: From Dataset Itself

LLM去毒化:从数据集本身开始

Wei Shao, Yihang Wang, Gaoyu Zhu, Ziqiang Cheng, Lei Yu, Jiafeng Guo, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出HSPD方法,通过在原始语料上进行语义保留的改写,有效降低模型毒性,提升数据效用,减少后续调整成本。

Comments Accepted to Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19071 2026-04-22 cs.CL 92%

HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing

HoWToBench: LLM在人类水平写作能力的综合评估方法:写作树

Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Tree-of-Writing方法,通过树状流程结构评估LLM写作能力,构建包含12类文体和1302条指令的中文写作基准,实现与人类判断的高相关性。

Comments 49 pages, 6 figures, 19 tables, ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18660 2026-04-22 cs.CR cs.AI 92%

Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks

评估LLM导师对对抗性学生攻击的答案泄露鲁棒性

Jin Zhao, Marta Knežević, Tanja Käser

机构 * EPFL(瑞士联邦理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了学生对抗性攻击下LLM导师的答案泄露鲁棒性,评估了多种模型在对抗攻击下的表现,并提出标准化基准和防御策略。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18333 2026-04-22 cs.CR cs.CL 92%

Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption

位置:LLM水印应使所有相关方的利益一致以实现实际应用

Yepeng Liu, Xuandong Zhao, Dawn Song, Gregory W. Wornell, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) UC Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了LLM水印技术中利益相关方激励不一致的问题,提出通过设计激励一致的水印方法,如上下文水印,来解决实际应用中的障碍,强调在特定领域内实现可靠工具的重要性。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03108 2026-04-22 cs.CL 91%

ChemPro: A Progressive Chemistry Benchmark for Large Language Models

ChemPro:一种渐进式的化学基准测试用于大语言模型

Aaditya Baranwal, Shruti Vyas

机构 * Aaditya Baranwal Shruti Vyas

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 ChemPro通过4100个化学问题-答案对评估大语言模型在化学领域的表现,涵盖多个难度层级,揭示了LLM在科学推理中的局限性。

Comments Accepted at Artificial Intelligence Chemistry Journal

Journal ref Artif. Intell. Chem. 4(1), 100118 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11199 2026-04-22 cs.CL cs.LG 91%

When and What to Ask: AskBench and Rubric-Guided RLVR for LLM Clarification

何时以及为何提问:AskBench与基于规则的强化学习与验证器(RLVR)用于LLM澄清

Jiale Zhao, Ke Fang, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究如何评估和改进LLM在缺乏关键信息或包含误导信息时的澄清能力,提出AskBench交互基准和基于规则的强化学习与验证器(RLVR)方法,提升准确性和交互效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18955 2026-04-22 cs.CL cs.AI cs.SI 91%

Assessing Capabilities of Large Language Models in Social Media Analytics: A Multi-task Quest

评估大型语言模型在社交媒体分析中的能力:一项多任务探索

Ramtin Davoudi, Kartik Thakkar, Nazanin Donyapour, Tyler Derr, Hamid Karimi

机构 * Utah State University(犹他州立大学) Vanderbilt University(范德比大学) Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文首次全面评估现代LLM在社交媒体分析三项核心任务中的表现,包括身份验证、内容生成和用户属性推断,通过系统采样和用户研究提出新的评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18835 2026-04-22 cs.CL cs.AI cs.LG 90%

Semantic Needles in Document Haystacks: Sensitivity Testing of LLM-as-a-Judge Similarity Scoring

语义针在文档 haystack 中:LLM-as-a-Judge 的相似性评分敏感性测试

Sinan G. Aksoy, Alexandra A. Sabrio, Erik VonKaenel, Lee Burke

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) Washington University in St. Louis(华盛顿大学圣路易斯分校) Humana Inc.(Humana公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一个可扩展的多因素实验框架,系统探讨LLM对文档配对中细微语义变化的敏感性。通过针在 haystack 中的类比,测试不同扰动类型、上下文类型、针位置和文档长度对五种LLM相似性评分的影响,揭示LLM在文档内位置偏倚、上下文相关性对评分的影响及模型间的评分分布差异。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06080 2026-04-22 cond-mat.mtrl-sci cs.LG 90%

Regression with Large Language Models for Materials and Molecular Property Prediction

利用大语言模型进行材料和分子性质预测的回归

Ryan Jacobs, Maciej P. Polak, Lane E. Schultz, Hamed Mahdavi, Vasant Honavar, Dane Morgan

机构 * Department of Materials Science and Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校材料科学与工程系) Department of Computer Science and Engineering, The Pennsylvania State University(宾夕法尼亚州立大学计算机科学与工程系) College of Information Sciences and Technology, The Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) Artificial Intelligence Research Laboratory, The Pennsylvania State University(宾夕法尼亚州立大学人工智能研究实验室) Center for Artificial Intelligence Foundations and Scientific Applications, The Pennsylvania State University(宾夕法尼亚州立大学人工智能基础与科学应用中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文探讨了大语言模型在材料和分子性质回归任务中的能力,通过在QM9数据集和28种材料属性上评估LLaMA 3,发现其在生成损失微调下能提供与随机森林或全连接神经网络相当的回归结果,但误差率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07037 2026-04-22 cs.CL 90%

Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities

超越单一语言假设:在大语言模型时代跨语言自然语言处理的综述

Rajvee Sheth, Samridhi Raj Sinha, Mahavir Patil, Himanshu Beniwal, Mayank Singh

机构 * IIT Gandhinagar(印度理工学院加尔各答分校) NMIMS Mumbai(孟买NMIMS学院) SVNIT Surat(Surat SVNIT学院) LINGO Research Group(LINGO研究小组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文综述了大语言模型时代跨语言自然语言处理的研究,分析了327项研究,涵盖五类研究领域、15+任务、30+数据集和80+语言,指出现有挑战及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15702 2026-04-22 cs.CL cs.LG 90%

The Metacognitive Monitoring Battery: A Cross-Domain Benchmark for LLM Self-Monitoring

元认知监控电池:一个跨领域用于LLM自我监控的基准测试

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出一个跨领域评估LLM元认知监控的基准测试,结合人类心理测量方法,通过524项任务测试学习、元认知校准等六个认知领域,揭示LLM在自信度和自我监控上的差异。

Comments 11 pages, 6 figures, 3 tables. Submitted to NeurIPS 2026 Evaluations and Datasets Track. Code, data, and Croissant metadata: https://github.com/synthiumjp/metacognitive-monitoring-battery

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19111 2026-04-22 cs.HC 90%

Revisiting Framing Codebooks with AI: Employing Large Language Models as Analytical Collaborators in Deductive Content Analysis

重新审视框架代码本:利用大语言模型作为分析合作者进行演绎内容分析

Diego Gomez-Zara, Hernán Valdivieso, Jorge Pérez, Denis Parra, Sebastián Valenzuela

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出利用大语言模型辅助创建和优化框架代码本,通过结合理论框架与数据驱动探索,揭示潜在模式并支持迭代修订,提升分析方法的创造力同时保持研究者的解释权威。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18943 2026-04-22 cs.AI cs.CL cs.HC cs.IR cs.LG 90%

Personalized Benchmarking: Evaluating LLMs by Individual Preferences

个性化基准测试:通过个体偏好评估LLM

Cristina Garbacea, Heran Wang, Chenhao Tan

机构 * University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出个性化LLM基准测试,通过ELO评分和Bradley-Terry系数分析115名用户对LLM的排名差异,发现个体偏好与聚合排名差异显著,强调开发个性化基准的重要性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19262 2026-04-22 cs.CL cs.AI 90%

CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks

CulturALL:基于 grounded 任务的 LLM 多语言和多文化能力基准测试

Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng, Fan Jiang, Yuanbin Cao, Dilda Duisenbek, Adrian Neo Sau Xun, Daria Pozdniakova, Liubou Misevich, Nevena Marinković, Ngoc Gia Linh Nguyen, Thi Khanh Linh Do, Sarakmatak Sophy, Baotian Hu, Guanhua Chen, Gongbo Tang, Alham Fikri Aji, Longyue Wang, Weihua Luo

机构 * Alibaba Group(阿里巴巴集团) Beijing Language and Culture University(北京语言大学) LMU Munich(慕尼黑大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学) IBM Research AI, UAE(阿联酋IBM人工智能研究) MBZUAI Harbin Institute of Technology, Shenzhen(深圳哈尔滨工业大学) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 CulturALL 基准测试,评估 LLM 在 grounded 任务中的多语言和多文化能力,包含 14 种语言 51 个地区 16 个主题的 2610 个样本,实验显示最佳 LLM 准确率仅 44.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19742 2026-04-22 cs.SE 89%

PlayCoder: Making LLM-Generated GUI Code Playable

PlayCoder: 使LLM生成的GUI代码可播放

Zhiyuan Peng, Wei Tao, Xin Yin, Chenhao Ying, Yuan Luo, Yiwen Guo

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出PlayCoder框架,通过生成、评估和迭代修复GUI代码,提升代码的逻辑正确性和语义对齐,实现功能正确性和交互逻辑的改进。

Comments September 11, 2025 Submitted to FSE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06837 2026-04-22 cs.CL 89%

Persuasion with Large Language Models: A Survey of Empirical Evidence, Study Methodologies, and Ethical Implications

利用大语言模型的说服:对实证证据、研究方法和伦理影响的综述

Sander Noels, Alexander Rogiers, Maarten Buyl, Tijl De Bie

机构 * AIDA-IDLab, Electronics and Information Systems, Ghent University(AIDA-ID实验室,电子与信息系统,根特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述了基于大语言模型的说服领域,分析了其在政治、营销等领域的应用,指出其说服力接近或超越人类,并强调了伦理和社会风险,呼吁制定伦理准则和监管框架。

Comments Main changes: - Slightly altered title & author ordering - New section detailing survey methodology - Expanded literature coverage and improved discussion of all references for clarity, precision & conciseness - Removed the "appealing to authority" subsection & integrated its content elsewhere - Overhauled the experimental design section - Significantly expanded success metrics discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19016 2026-04-22 cs.CL 89%

AlignCultura: Towards Culturally Aligned Large Language Models?

AlignCultura: 向文化对齐的大语言模型迈进?

Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University, Australia(麦考瑞大学计算机学院,澳大利亚)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出AlignCultura框架,通过构建HHH-English数据集和评估不同模型的文化对齐能力,提升输出的尊重性和文化多样性。

Comments Accepted at ACL Mains 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00688 2026-04-22 cs.CL eess.AS 89%

OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models

OmniVoice:迈向多语言零样本文本到语音的扩散语言模型

Han Zhu, Lingxuan Ye, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhifeng Han, Weiji Zhuang, Long Lin, Daniel Povey

机构 * Xiaomi Corp.(小米公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.CL

AI总结 OmniVoice是一种支持600多种语言的零样本文本到语音模型,采用新型非自回归架构直接将文本映射到多代码本音频标记,通过全代码本随机掩码策略和预训练LLM初始化提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18607 2026-04-22 cs.NE cs.AI 89%

TurboEvolve: Towards Fast and Robust LLM-Driven Program Evolution

TurboEvolve:迈向快速且稳健的LLM驱动程序进化

Yang Yang, Zining Zhong, Jindong Li, Jiemin Wu, Kaishen Yuan, Wenshuo Chen, Menglin Yang, Yutao Yue

机构 * Artificial Intelligence Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 TurboEvolve通过多岛屿进化框架提升样本效率和鲁棒性,在固定评估预算下实现更可靠的程序进化进展。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18775 2026-04-22 cs.CL cs.LG 88%

An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models

多代采样在大型语言模型 jailbreak 检测中的实证研究

Hanrui Luo, Shreyank N Gowda

机构 * University of Nottingham(诺丁汉大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究通过JailbreakBench数据集和多种生成模型,评估了基于输出的jailbreak检测方法,发现单输出评估低估了模型漏洞,多代采样能更准确检测有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19645 2026-04-22 cs.CL 87%

The signal is the ceiling: Measurement limits of LLM-predicted experience ratings from open-ended survey text

信号即是上限:从开放式调查文本中LLM预测经验评分的测量限制

Andrew Hong, Jason Potteiger, Luis E. Zapata

机构 * Dimension Labs(Dimension实验室)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文研究了提示设计和模型选择对LLM预测经验评分的影响,发现文本本身的语言特征对准确性影响更大,提示工程只能在特定范围内提升性能。

Comments 42 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18566 2026-04-22 cs.AI cs.HC cs.LG 87%

Benchmarking System Dynamics AI Assistants: Cloud Versus Local LLMs on CLD Extraction and Discussion

对系统动力学AI助手的基准测试:云与本地LLM在CLD提取与讨论中的比较

Terry Leitch

机构 * Ruxton AI

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了云和本地LLM在系统动力学AI助手中的表现,发现本地模型在CLD提取和讨论任务中表现不一,且后端选择对性能影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21080 2026-04-22 cs.CL cs.AI cs.CY 87%

InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation

InsideOut: 评估和缓解面试脚本生成中的内部-外部偏见

Yixin Wan, Xingrun Chen, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出InsideOut基准,通过文化情境面试脚本生成任务量化LLM的内部-外部偏见,采用三种评估指标,并提出基于代理的MFA框架缓解偏见,实验表明MFA方法显著降低偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19633 2026-04-22 cs.AI cs.CE 86%

Time Series Augmented Generation for Financial Applications

时间序列增强生成用于金融应用

Anton Kolonin, Alexey Glushchenko, Evgeny Bochkov, Abhishek Saxena

机构 * SingularityNET Foundation(SingularityNET基金会)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种新的评估方法和基准,用于衡量LLM在金融时间序列分析中的推理能力,通过大规模实证研究验证了工具增强范式的有效性。

Comments 11 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04925 2026-04-22 cs.CL 86%

Can AI-Generated Persuasion Be Detected? Persuaficial Benchmark and AI vs. Human Linguistic Differences

AI生成的说服能否被检测?Persuaficial基准与AI与人类语言差异

Arkadiusz Modzelewski, Paweł Golik, Anna Kołos, Giovanni Da San Martino

机构 * NASK National Research Institute(波兰国家科研 institute) University of Padua(意大利帕多瓦大学) Polish-Japanese Academy of Information Technology(波兰-日本信息科技学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨LLM生成的说服内容是否更难自动检测,通过Persuaficial基准对比人类与AI生成文本的语言差异,揭示细微说服策略对检测性能的影响。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22673 2026-04-22 cs.AI 86%

Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks

超越行程规划——多轮和工具使用旅行任务的现实世界基准

Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光林人工智能学院) National University of Singapore(新加坡国立大学) Beihang University(北航) AMAP, Alibaba Group(阿里云实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TravelBench,一个现实世界旅行规划基准,通过多轮对话和工具使用评估LLM的独立解决问题、隐含偏好获取和能力边界识别能力。

Comments Accepted to the ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16167 2026-04-22 cs.HC cs.CL 86%

"You tell me": A Dataset of GPT-4-Based Behaviour Change Support Conversations

你告诉我:一个基于GPT-4的行为改变支持对话数据集

Selina Meyer, David Elsweiler

机构 * Regensburg University(莱茵河畔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个基于GPT-4的对话数据集,用于研究用户行为对LLM生成文本的影响,包含用户互动、语言分析和反馈数据,为行为改变系统设计提供实证支持。

Comments Preprint as accepted at the 2024 ACM SIGIR Conference on Human Information Interaction and Retrieval (CHIIR '24)

Journal ref In Proceedings of the 2024 Conference on Human Information Interaction and Retrieval (CHIIR '24). Association for Computing Machinery, New York, NY, USA, 411-416

详情

展开后加载摘要…

URL PDF HTML 收藏