arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-22 至 2026-04-22 共收录 327 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 78 篇

2602.11199 2026-04-22 cs.CL cs.LG 91%

When and What to Ask: AskBench and Rubric-Guided RLVR for LLM Clarification

何时以及为何提问:AskBench与基于规则的强化学习与验证器(RLVR)用于LLM澄清

Jiale Zhao, Ke Fang, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究如何评估和改进LLM在缺乏关键信息或包含误导信息时的澄清能力,提出AskBench交互基准和基于规则的强化学习与验证器(RLVR)方法,提升准确性和交互效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18955 2026-04-22 cs.CL cs.AI cs.SI 91%

Assessing Capabilities of Large Language Models in Social Media Analytics: A Multi-task Quest

评估大型语言模型在社交媒体分析中的能力:一项多任务探索

Ramtin Davoudi, Kartik Thakkar, Nazanin Donyapour, Tyler Derr, Hamid Karimi

机构 * Utah State University(犹他州立大学) Vanderbilt University(范德比大学) Independent Researcher(独立研究员)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文首次全面评估现代LLM在社交媒体分析三项核心任务中的表现,包括身份验证、内容生成和用户属性推断,通过系统采样和用户研究提出新的评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18835 2026-04-22 cs.CL cs.AI cs.LG 90%

Semantic Needles in Document Haystacks: Sensitivity Testing of LLM-as-a-Judge Similarity Scoring

语义针在文档 haystack 中:LLM-as-a-Judge 的相似性评分敏感性测试

Sinan G. Aksoy, Alexandra A. Sabrio, Erik VonKaenel, Lee Burke

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) Washington University in St. Louis(华盛顿大学圣路易斯分校) Humana Inc.(Humana公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一个可扩展的多因素实验框架,系统探讨LLM对文档配对中细微语义变化的敏感性。通过针在 haystack 中的类比,测试不同扰动类型、上下文类型、针位置和文档长度对五种LLM相似性评分的影响,揭示LLM在文档内位置偏倚、上下文相关性对评分的影响及模型间的评分分布差异。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06080 2026-04-22 cond-mat.mtrl-sci cs.LG 90%

Regression with Large Language Models for Materials and Molecular Property Prediction

利用大语言模型进行材料和分子性质预测的回归

Ryan Jacobs, Maciej P. Polak, Lane E. Schultz, Hamed Mahdavi, Vasant Honavar, Dane Morgan

机构 * Department of Materials Science and Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校材料科学与工程系) Department of Computer Science and Engineering, The Pennsylvania State University(宾夕法尼亚州立大学计算机科学与工程系) College of Information Sciences and Technology, The Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) Artificial Intelligence Research Laboratory, The Pennsylvania State University(宾夕法尼亚州立大学人工智能研究实验室) Center for Artificial Intelligence Foundations and Scientific Applications, The Pennsylvania State University(宾夕法尼亚州立大学人工智能基础与科学应用中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文探讨了大语言模型在材料和分子性质回归任务中的能力,通过在QM9数据集和28种材料属性上评估LLaMA 3,发现其在生成损失微调下能提供与随机森林或全连接神经网络相当的回归结果,但误差率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07037 2026-04-22 cs.CL 90%

Beyond Monolingual Assumptions: A Survey of Code-Switched NLP in the Era of Large Language Models across Modalities

超越单一语言假设:在大语言模型时代跨语言自然语言处理的综述

Rajvee Sheth, Samridhi Raj Sinha, Mahavir Patil, Himanshu Beniwal, Mayank Singh

机构 * IIT Gandhinagar(印度理工学院加尔各答分校) NMIMS Mumbai(孟买NMIMS学院) SVNIT Surat(Surat SVNIT学院) LINGO Research Group(LINGO研究小组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文综述了大语言模型时代跨语言自然语言处理的研究,分析了327项研究,涵盖五类研究领域、15+任务、30+数据集和80+语言,指出现有挑战及未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15702 2026-04-22 cs.CL cs.LG 90%

The Metacognitive Monitoring Battery: A Cross-Domain Benchmark for LLM Self-Monitoring

元认知监控电池:一个跨领域用于LLM自我监控的基准测试

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 本文提出一个跨领域评估LLM元认知监控的基准测试,结合人类心理测量方法,通过524项任务测试学习、元认知校准等六个认知领域,揭示LLM在自信度和自我监控上的差异。

Comments 11 pages, 6 figures, 3 tables. Submitted to NeurIPS 2026 Evaluations and Datasets Track. Code, data, and Croissant metadata: https://github.com/synthiumjp/metacognitive-monitoring-battery

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19111 2026-04-22 cs.HC 90%

Revisiting Framing Codebooks with AI: Employing Large Language Models as Analytical Collaborators in Deductive Content Analysis

重新审视框架代码本:利用大语言模型作为分析合作者进行演绎内容分析

Diego Gomez-Zara, Hernán Valdivieso, Jorge Pérez, Denis Parra, Sebastián Valenzuela

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出利用大语言模型辅助创建和优化框架代码本,通过结合理论框架与数据驱动探索,揭示潜在模式并支持迭代修订,提升分析方法的创造力同时保持研究者的解释权威。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18943 2026-04-22 cs.AI cs.CL cs.HC cs.IR cs.LG 90%

Personalized Benchmarking: Evaluating LLMs by Individual Preferences

个性化基准测试:通过个体偏好评估LLM

Cristina Garbacea, Heran Wang, Chenhao Tan

机构 * University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出个性化LLM基准测试,通过ELO评分和Bradley-Terry系数分析115名用户对LLM的排名差异,发现个体偏好与聚合排名差异显著,强调开发个性化基准的重要性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19262 2026-04-22 cs.CL cs.AI 90%

CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks

CulturALL:基于 grounded 任务的 LLM 多语言和多文化能力基准测试

Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng, Fan Jiang, Yuanbin Cao, Dilda Duisenbek, Adrian Neo Sau Xun, Daria Pozdniakova, Liubou Misevich, Nevena Marinković, Ngoc Gia Linh Nguyen, Thi Khanh Linh Do, Sarakmatak Sophy, Baotian Hu, Guanhua Chen, Gongbo Tang, Alham Fikri Aji, Longyue Wang, Weihua Luo

机构 * Alibaba Group(阿里巴巴集团) Beijing Language and Culture University(北京语言大学) LMU Munich(慕尼黑大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学) IBM Research AI, UAE(阿联酋IBM人工智能研究) MBZUAI Harbin Institute of Technology, Shenzhen(深圳哈尔滨工业大学) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 CulturALL 基准测试,评估 LLM 在 grounded 任务中的多语言和多文化能力,包含 14 种语言 51 个地区 16 个主题的 2610 个样本,实验显示最佳 LLM 准确率仅 44.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19742 2026-04-22 cs.SE 89%

PlayCoder: Making LLM-Generated GUI Code Playable

PlayCoder: 使LLM生成的GUI代码可播放

Zhiyuan Peng, Wei Tao, Xin Yin, Chenhao Ying, Yuan Luo, Yiwen Guo

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出PlayCoder框架,通过生成、评估和迭代修复GUI代码,提升代码的逻辑正确性和语义对齐,实现功能正确性和交互逻辑的改进。

Comments September 11, 2025 Submitted to FSE2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06837 2026-04-22 cs.CL 89%

Persuasion with Large Language Models: A Survey of Empirical Evidence, Study Methodologies, and Ethical Implications

利用大语言模型的说服:对实证证据、研究方法和伦理影响的综述

Sander Noels, Alexander Rogiers, Maarten Buyl, Tijl De Bie

机构 * AIDA-IDLab, Electronics and Information Systems, Ghent University(AIDA-ID实验室,电子与信息系统,根特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文综述了基于大语言模型的说服领域,分析了其在政治、营销等领域的应用,指出其说服力接近或超越人类,并强调了伦理和社会风险,呼吁制定伦理准则和监管框架。

Comments Main changes: - Slightly altered title & author ordering - New section detailing survey methodology - Expanded literature coverage and improved discussion of all references for clarity, precision & conciseness - Removed the "appealing to authority" subsection & integrated its content elsewhere - Overhauled the experimental design section - Significantly expanded success metrics discussion

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19016 2026-04-22 cs.CL 89%

AlignCultura: Towards Culturally Aligned Large Language Models?

AlignCultura: 向文化对齐的大语言模型迈进?

Gautam Siddharth Kashyap, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University, Australia(麦考瑞大学计算机学院,澳大利亚)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出AlignCultura框架,通过构建HHH-English数据集和评估不同模型的文化对齐能力,提升输出的尊重性和文化多样性。

Comments Accepted at ACL Mains 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00688 2026-04-22 cs.CL eess.AS 89%

OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models

OmniVoice:迈向多语言零样本文本到语音的扩散语言模型

Han Zhu, Lingxuan Ye, Wei Kang, Zengwei Yao, Liyong Guo, Fangjun Kuang, Zhifeng Han, Weiji Zhuang, Long Lin, Daniel Povey

机构 * Xiaomi Corp.(小米公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);分类 cs.CL

AI总结 OmniVoice是一种支持600多种语言的零样本文本到语音模型,采用新型非自回归架构直接将文本映射到多代码本音频标记,通过全代码本随机掩码策略和预训练LLM初始化提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18607 2026-04-22 cs.NE cs.AI 89%

TurboEvolve: Towards Fast and Robust LLM-Driven Program Evolution

TurboEvolve:迈向快速且稳健的LLM驱动程序进化

Yang Yang, Zining Zhong, Jindong Li, Jiemin Wu, Kaishen Yuan, Wenshuo Chen, Menglin Yang, Yutao Yue

机构 * Artificial Intelligence Thrust, Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 TurboEvolve通过多岛屿进化框架提升样本效率和鲁棒性,在固定评估预算下实现更可靠的程序进化进展。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18775 2026-04-22 cs.CL cs.LG 88%

An Empirical Study of Multi-Generation Sampling for Jailbreak Detection in Large Language Models

多代采样在大型语言模型 jailbreak 检测中的实证研究

Hanrui Luo, Shreyank N Gowda

机构 * University of Nottingham(诺丁汉大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究通过JailbreakBench数据集和多种生成模型,评估了基于输出的jailbreak检测方法,发现单输出评估低估了模型漏洞,多代采样能更准确检测有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19645 2026-04-22 cs.CL 87%

The signal is the ceiling: Measurement limits of LLM-predicted experience ratings from open-ended survey text

信号即是上限:从开放式调查文本中LLM预测经验评分的测量限制

Andrew Hong, Jason Potteiger, Luis E. Zapata

机构 * Dimension Labs(Dimension实验室)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文研究了提示设计和模型选择对LLM预测经验评分的影响,发现文本本身的语言特征对准确性影响更大,提示工程只能在特定范围内提升性能。

Comments 42 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18566 2026-04-22 cs.AI cs.HC cs.LG 87%

Benchmarking System Dynamics AI Assistants: Cloud Versus Local LLMs on CLD Extraction and Discussion

对系统动力学AI助手的基准测试:云与本地LLM在CLD提取与讨论中的比较

Terry Leitch

机构 * Ruxton AI

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文比较了云和本地LLM在系统动力学AI助手中的表现,发现本地模型在CLD提取和讨论任务中表现不一,且后端选择对性能影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21080 2026-04-22 cs.CL cs.AI cs.CY 87%

InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation

InsideOut: 评估和缓解面试脚本生成中的内部-外部偏见

Yixin Wan, Xingrun Chen, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出InsideOut基准,通过文化情境面试脚本生成任务量化LLM的内部-外部偏见,采用三种评估指标,并提出基于代理的MFA框架缓解偏见,实验表明MFA方法显著降低偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19633 2026-04-22 cs.AI cs.CE 86%

Time Series Augmented Generation for Financial Applications

时间序列增强生成用于金融应用

Anton Kolonin, Alexey Glushchenko, Evgeny Bochkov, Abhishek Saxena

机构 * SingularityNET Foundation(SingularityNET基金会)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种新的评估方法和基准,用于衡量LLM在金融时间序列分析中的推理能力,通过大规模实证研究验证了工具增强范式的有效性。

Comments 11 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04925 2026-04-22 cs.CL 86%

Can AI-Generated Persuasion Be Detected? Persuaficial Benchmark and AI vs. Human Linguistic Differences

AI生成的说服能否被检测?Persuaficial基准与AI与人类语言差异

Arkadiusz Modzelewski, Paweł Golik, Anna Kołos, Giovanni Da San Martino

机构 * NASK National Research Institute(波兰国家科研 institute) University of Padua(意大利帕多瓦大学) Polish-Japanese Academy of Information Technology(波兰-日本信息科技学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨LLM生成的说服内容是否更难自动检测,通过Persuaficial基准对比人类与AI生成文本的语言差异,揭示细微说服策略对检测性能的影响。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22673 2026-04-22 cs.AI 86%

Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks

超越行程规划——多轮和工具使用旅行任务的现实世界基准

Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光林人工智能学院) National University of Singapore(新加坡国立大学) Beihang University(北航) AMAP, Alibaba Group(阿里云实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TravelBench,一个现实世界旅行规划基准,通过多轮对话和工具使用评估LLM的独立解决问题、隐含偏好获取和能力边界识别能力。

Comments Accepted to the ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16167 2026-04-22 cs.HC cs.CL 86%

"You tell me": A Dataset of GPT-4-Based Behaviour Change Support Conversations

你告诉我:一个基于GPT-4的行为改变支持对话数据集

Selina Meyer, David Elsweiler

机构 * Regensburg University(莱茵河畔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个基于GPT-4的对话数据集,用于研究用户行为对LLM生成文本的影响,包含用户互动、语言分析和反馈数据,为行为改变系统设计提供实证支持。

Comments Preprint as accepted at the 2024 ACM SIGIR Conference on Human Information Interaction and Retrieval (CHIIR '24)

Journal ref In Proceedings of the 2024 Conference on Human Information Interaction and Retrieval (CHIIR '24). Association for Computing Machinery, New York, NY, USA, 411-416

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18957 2026-04-22 cs.CV 85%

Bridging Foundation Models and ASTM Metallurgical Standards for Automated Grain Size Estimation from Microscopy Images

弥合基础模型与ASTM冶金标准以实现显微图像中的晶粒尺寸自动估计

Abdul Mueez, Shruti Vyas

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种结合Cellpose-SAM和ASTM E112 Jeffries平面模块的自动化管道,用于显微图像中的密集实例分割和晶粒尺寸估计,通过拓扑感知梯度追踪和适应性提示生成,实现高精度的冶金评估。

Comments Accepted at the 11th IEEE Workshop on Computer Vision for Multimodal Microscopy Image Analysis (CVMI), CVPR Workshops 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00439 2026-04-22 cs.CL 84%

Improving the Distributional Alignment of LLMs using Supervision

通过监督改进大型语言模型的分布对齐

Gauri Kambhatla, Sanjana Gautam, Angela Zhang, Alex Liu, Ravi Srinivasan, Junyi Jessy Li, Matthew Lease

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 本文通过简单监督提升LLM在不同群体上的分布对齐,分析了三个数据集的对齐效果,并为未来研究提供基准。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21242 2026-04-22 cs.CL 84%

Evaluation of LLMs in Medical Text Summarization: The Role of Vocabulary Adaptation in High OOV Settings

评估LLMs在医学文本摘要中的表现:词汇适应在高OOV设置中的作用

Gunjan Balde, Soumyadeep Roy, Mainack Mondal, Niloy Ganguly

机构 * Indian Institute of Technology Kharagpur(印度理工学院克哈格布尔分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文评估了LLMs在医学文本摘要中的表现,发现词汇适应能有效缓解高OOV数据点带来的性能下降问题,并通过实验验证了词汇适应对医疗领域定制化的重要性。

Comments 16 pages. Accepted for publication in the Findings of the 63rd Annual Meeting of the Association for Computational Linguistics (ACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11665 2026-04-22 cs.CL 83%

Multi-Task Reinforcement Learning for Enhanced Multimodal LLM-as-a-Judge

多任务强化学习用于增强多模态大语言模型作为裁判

Junjie Wu, Xuan Kan, Zihao He, Shunwen Tan, Bo Pan, Kaitai Zhang

机构 * Meta AI Hong Kong University of Science and Technology(香港科技大学) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MT-RL-Judge框架,通过多任务强化学习优化多模态大语言模型作为裁判,提升判断一致性和与人类偏好的相关性,并在分布外任务中展现鲁棒泛化能力。

Comments ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18663 2026-04-22 cs.CR cs.AI 81%

Beyond Explicit Refusals: Soft-Failure Attacks on Retrieval-Augmented Generation

超越显式拒绝:针对检索增强生成的软故障攻击

Wentao Zhang, Yan Zhuang, ZhuHang Zheng, Mingfei Zhang, Jiawen Deng, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学) Shenzhen Institute for Advanced Study(深圳先进研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DEJA攻击框架,通过进化优化生成对抗文档,诱导系统产生非信息性但流畅的响应,降低回答确定性,实验显示其在多个RAG配置中有效,SASR超过79%。

Comments 22 pages, Accepted to the ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15907 2026-04-22 cs.CL 81%

TabReX : Tabular Referenceless eXplainable Evaluation

TabReX : 不依赖参考的表格可解释性评估

Tejas Anvekar, Junha Park, Aparna Garimella, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Adobe Research(Adobe研究)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 TabReX 提出了一种不依赖参考的表格生成评估框架,通过图推理方法将源文本和生成表格转化为知识图谱,并计算可解释的评分,实现结构和事实的准确性评估。

Comments Accepted to ACL 2026 (Main Conference). Long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27052 2026-04-22 cs.CL 81%

VISTA: Verification In Sequential Turn-based Assessment

VISTA:基于顺序回合评估的验证

Ashley Lewis, Andrew Perrault, Eric Fosler-Lussier, Michael White

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 VISTA通过声明级验证和顺序一致性追踪评估对话事实性,提升多轮对话中幻觉检测效果,改进现有基准测试的一致性。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01371 2026-04-22 cs.CR cs.AI cs.ET 81%

Prompt to Pwn: Automated Exploit Generation for Smart Contracts

提示至入侵:智能合约自动漏洞利用生成

ZeKe Xiao, Qin Wang, Yuekang Li, Shiping Chen

机构 * UNSW Sydney(新南威尔士大学) CSIRO Data61, Australia(澳大利亚CSIRO数据61研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究提出ReX框架,通过链接LLM生成漏洞利用与Foundry栈实现端到端生成、编译、执行和验证。评估五种LLM在八种漏洞类型中的表现,发现当前模型在单合约漏洞生成有效,但跨合约攻击仍弱,揭示了LLM驱动AEG的边界条件。

Comments ACISP2026

详情

展开后加载摘要…

URL PDF HTML 收藏