arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-21 至 2026-04-21 共收录 803 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 186 篇

2604.17596 2026-04-21 cs.CR cs.AI 81%

Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories

终端 wrench:331个可奖励黑客环境和3,632条exploit轨迹的数据集

Ivan Bercovich, Ivgeni Segal, Kexun Zhang, Shashwat Saxena, Aditi Raghunathan, Ziqian Zhong

机构 * Fewshot Corp(Fewshot公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文发布了一个包含331个终端代理基准环境和3,632条exploit轨迹的数据集,展示了不同任务中的特定exploit方法,并通过LLM评估检测性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17309 2026-04-21 cs.AI 81%

Knows: Agent-Native Structured Research Representations

Knows: 代理原生结构化研究表示

Guangsheng Yu, Xu Wang

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 Knows通过轻量级规范将结构化声明、证据、溯源和可验证关系绑定到研究成果,提升LLM代理处理长文档的能力,实验显示使用侧车可显著提升弱模型准确率,且减少输入token数量。

Comments This paper serves as a technical report/white paper for the Knows.Academy project (https://knows.academy)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11938 2026-04-21 cs.CL 81%

Who is the richest club in the championship? Detecting and Rewriting Underspecified Questions Improve QA Performance

联赛中哪个俱乐部最富裕?检测和重写模糊问题提高问答性能

Yunchong Huang, Gianni Barlacchi, Sandro Pezzelle

机构 * ILLC, University of Amsterdam(伊拉斯姆斯研究所,阿姆斯特丹大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究指出模糊问题导致问答性能下降,通过重写模糊问题提升性能,揭示了问答评估中的关键问题。

Comments 4 pages of main text, 13 pages in total, 5 tables and 10 figures in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01101 2026-04-21 cs.CL 81%

TSVer: A Benchmark for Fact Verification Against Time-Series Evidence

TSVer:一个针对时间序列证据的事实验证基准

Marek Strong, Andreas Vlachos

机构 * Department of Computer Science and Technology(计算机科学与技术系)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出TSVer基准,通过时间序列证据进行事实验证,包含304个真实声明和400个时间序列数据,采用LLM辅助标注提升质量,展示先进模型在时间序列推理上的挑战。

Comments Published at EMNLP 2025. v2 includes a revised version of the dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18128 2026-04-21 cs.CL 81%

Frankentext: Stitching random text fragments into long-form narratives

Frankentext:将随机文本片段拼接成长篇叙述

Chau Minh Pham, Jenna Russell, Dzung Pham, Mohit Iyyer

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 Frankentext通过将大量随机文本片段拼接成连贯故事,挑战LLM生成质量与原创性,同时引发作者权属问题。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17133 2026-04-21 cs.AI cs.CR 81%

If Only My CGM Could Speak: A Privacy-Preserving Agent for Question Answering over Continuous Glucose Data

若我的连续葡萄糖监测仪能说话:一个隐私保护的问答代理

Yanjun Cui, Ali Emami, Temiloluwa Prioleau, Nikhil Singh

机构 * Dartmouth College(达特茅斯学院) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CGM-Agent框架,通过本地计算实现隐私保护的连续葡萄糖数据问答,评估显示顶级模型在合成和现实查询中准确率分别为94%和88%。

Comments Accepted by ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16757 2026-04-21 cs.CL cs.CY 81%

Expressing Social Emotions: Misalignment Between LLMs and Human Cultural Emotion Norms

表达社会情绪:大型语言模型与人类文化情绪规范之间的不一致

Sree Bhattacharyya, Manas Mehta, Leona Chen, Cristina Salvador, Agata Lapedriza, Shiran Dudy, James Z. Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Duke University(杜克大学) Northeastern University(东北大学) Universitat Oberta de Catalunya(巴塞罗那开放大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型在表达社会情绪时与人类文化规范的不一致,通过对比欧洲裔美国人和拉丁美洲人的表现,评估了六种前沿LLM在文化差异表达上的能力,发现模型在情绪表达上存在系统性偏差。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13242 2026-04-21 cs.CY cs.AI 81%

On the Creativity of AI Agents

人工智能代理的创造性

Giorgio Franceschelli, Mirco Musolesi

机构 * University of Bologna(博洛尼亚大学) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文从功能主义和本体论两个视角分析人工智能代理的创造性,指出其在功能层面具有创造力但缺乏本体层面的创造性,并探讨了代理系统实现两种创造力的潜在价值与风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03331 2026-04-21 cs.CV cs.AI cs.LG 81%

MMErroR: A Benchmark for Erroneous Reasoning in Vision-Language Models

MMErroR:面向视觉-语言模型错误推理的基准测试

Yang Shi, Yifeng Xie, Minzhe Guo, Liangsi Lu, Mingxuan Huang, Jingchao Wang, Zhihong Zhu, Boyan Xu, Zhiqi Huang

机构 * Guangdong University of Technology(广东工业大学) Hong Kong Baptist University(香港 Baptist大学) Sun Yat-sen University(中山大学) Peking University(北京大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出MMErroR基准,通过1997个包含单一推理错误的样本,评估视觉-语言模型检测错误推理的能力,发现即使最佳模型也仅能正确分类66.65%的错误。

Comments Accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16586 2026-04-21 cs.LG cs.AI q-bio.QM 81%

A Systematic Survey and Benchmark of Deep Learning for Molecular Property Prediction in the Foundation Model Era

在基础模型时代对深度学习用于分子性质预测的系统调查和基准测试

Zongru Li, Xingsheng Chen, Honggang Wen, Regina Qianru Zhang, Ming Li, Xiaojin Zhang, Hongzhi Yin, Qiang Yang, Kwok-Yan Lam, Pietro Lio, Siu-Ming Yiu

机构 * The University of Hong Kong, Hong Kong SAR(香港大学) Nanyang Technological University, Singapore(南洋理工大学) University of Cambridge, United Kingdom(剑桥大学) Zhejiang Normal University, China(浙江师范大学) The Hong Kong University of Science and Technology, Hong Kong SAR(香港科学与技术大学) The University of Queensland(昆士兰大学) The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文系统调查了深度学习在分子性质预测中的应用,探讨了四种互补范式,并提出了未来三个发展方向,包括物理感知学习、可信推理的基础模型和整合计算与实验数据的基准生态系统。

Comments 32 pages. It is just accepted by Journal of Chemical Theory and Computation 2026

Journal ref Journal of Chemical Theory and Computation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21278 2026-04-21 cs.CV cs.AI cs.CL cs.LG 80%

GeoRC: A Benchmark for Geolocation Reasoning Chains

GeoRC:地理定位推理链基准测试

Mohit Talreja, Joshua Diao, Jim Thannikary James, Radu Casapu, Tejas Santanam, Ethan Mendes, Alan Ritter, Wei Xu, James Hays

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GeoRC基准,通过Champion级GeoGuessr专家生成的800条真实推理链,评估VLM生成推理链的准确性,发现大模型在生成可审计推理链上仍逊于人类专家,而小型模型表现更差。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17313 2026-04-21 cs.CR 80%

GuardPhish: Securing Open-Source LLMs from Phishing Abuse

GuardPhish: 保护开源大语言模型免受钓鱼攻击

Rina Mishra, Gaurav Varshney, Doddipatla Sesha Sahithi

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过GuardPhish数据集研究开源大语言模型在静态安全配置下的钓鱼风险,发现即使模型能识别钓鱼意图,仍可能生成有效钓鱼内容,提出基于GuardPhish的分类器提升防御能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14466 2026-04-21 cs.CL 79%

Robust Bias Evaluation with FilBBQ: A Filipino Bias Benchmark for Question-Answering Language Models

基于FilBBQ的鲁棒偏见评估:一个针对问答语言模型的菲律宾偏见基准

Lance Calvin Lim Gamboa, Yue Feng, Mark Lee

机构 * School of Computer Science, University of Birmingham(伯明翰大学计算机科学学院) Department of Information Systems and Computer Science, Ateneo de Manila University(马尼拉大学信息系统与计算机科学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出FilBBQ,通过四阶段流程构建超过10000个提示,评估模型在菲律宾语境下的性别和同性恋偏见,采用多种子鲁棒评估提升可靠性。

Comments Accepted in LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04029 2026-04-21 cs.CL 79%

SpeakerSleuth: Can Large Audio-Language Models Judge Speaker Consistency across Multi-turn Dialogues?

SpeakerSleuth: 大型音频-语言模型能否在多轮对话中判断说话者一致性?

Jonggeun Lee, Junseong Pyo, Gyuhyeon Seo, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出SpeakerSleuth基准测试,评估大型音频-语言模型在多轮对话中判断说话者一致性的能力,发现模型在识别声音不一致性和处理文本上下文时存在显著偏差。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13868 2026-04-21 cs.CV cs.AI 79%

When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models

当感知超越认知:在视觉-语言模型中解构知识冲突

Francesco Ortu, Zhijing Jin, Diego Doimo, Alberto Cazzaniga

机构 * University of Trieste(特里este大学) AREA Science Park(AREAS科学公园) MPI University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文研究视觉-语言模型如何解决跨模态冲突,通过引入WHOOPS-AHA!数据集,发现特定注意力头可调节模型对内部知识或视觉信息的偏好,提升冲突解决的精确度。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17768 2026-04-21 cs.AI 79%

When Vision-Language Models Judge Without Seeing: Exposing Informativeness Bias

当视觉-语言模型评判而不看:揭示信息性偏差

Xiaohan Zou, Roshan Sridhar, Mohammadtaher Safarzadeh, Dan Roth

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Oracle AI

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究揭示视觉-语言模型在评判时存在的信息性偏差问题,提出BIRCH方法通过修正图像与答案的一致性提升评判可靠性,实验显示偏差降低17%,性能提升9.8%。

Comments Accepted at ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17354 2026-04-21 cs.CL cs.CV 79%

More Than Meets the Eye: Measuring the Semiotic Gap in Vision-Language Models via Semantic Anchorage

超越表象:通过语义锚定测量视觉语言模型中的象征性差距

Wei He

机构 * IDSAI, University of Exeter(IDSAI研究所,埃克塞特大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究通过引入DIVA基准测试,探讨高视觉保真度是否干扰视觉抽象中的隐喻构成性,提出语义对齐差距和方向偏置指标,发现模型规模无法解决字面偏好,高保真度导致象征性对齐减弱。

Comments 16 pages, 4 figures. Accepted to the Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26278 2026-04-21 cs.CV cs.CL 79%

ProfVLM: A lightweight video-language model for multi-view proficiency estimation

ProfVLM:一种轻量级视频-语言模型用于多视角技能评估

Edoardo Bianchi, Jacopo Staiano, Antonio Liotta

机构 * Free University of Bozen-Bolzano(博洛尼亚-博兹纳自由大学) University of Trento(特伦托大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出ProfVLM,一种轻量级视频-语言模型,通过生成式视觉-语言建模实现多视角技能评估,兼具生成自然语言反馈与定量评分,参数更少且训练更快。

Journal ref Computer Vision and Image Understanding, Volume 268, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16841 2026-04-21 cs.CV cs.LG 79%

When Earth Foundation Models Meet Diffusion: An Application to Land Surface Temperature Super-Resolution

当地球基础模型遇见扩散:一种用于地表温度超分辨率的应用

Yiheng Chen, Zihui Ma, Peishi Jiang, Yilong Dai, Qikai Hu, Xinyue Ye, Lingyao Li, Rita Sousa, Runlong Yu

机构 * University of Alabama(阿拉巴马大学) Emory University(埃默里大学) University of Michigan(密歇根大学) University of South Florida(佛罗里达州立大学) New York University(纽约大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出EFDiff框架,利用地球基础模型指导扩散模型进行极端空间退化下的超分辨率重建,通过交叉注意力机制提升细尺度重建效果,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00857 2026-04-21 cs.LG 79%

Harvesting AlphaEarth: Benchmarking the Geospatial Foundation Model for Agricultural Downstream Tasks

收割AlphaEarth:评估用于农业下游任务的地理空间基础模型

Yuchi Ma, Yawen Shen, Anu Swatantran, David B. Lobell

机构 * Department of Earth System Science and Center on Food Security and the Environment, Stanford University, USA(地球系统科学系和食品安全与环境中心,斯坦福大学,美国) Corteva Agriscience™, USA(科特维亚农业科学公司,美国)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文评估了AlphaEarth基础模型在农业下游任务中的表现,包括作物产量预测、耕作 mapping 和覆盖作物 mapping,揭示了其在农业应用中的优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09275 2026-04-21 cs.CL cs.AI 79%

Inflated Excellence or True Performance? Rethinking Medical Diagnostic Benchmarks with Dynamic Evaluation

卓越还是真实表现?通过动态评估重新思考医疗诊断基准

Xiangxu Zhang, Lei Li, Yanyun Zhou, Xiao Zhou, Yingying Zhang, Xian Wu

机构 * GSAI, Renmin University of China(清华大学人工智能研究院,中国人民大学) Tencent Jarvis Lab(腾讯 Jarvis实验室) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(下一代智能搜索与推荐工程技术研究中心,教育部)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DyReMe动态基准,通过生成临床相关干扰因素的咨询式案例,评估医疗诊断模型的鲁棒性,揭示现有模型在临床干扰下的不足。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17771 2026-04-21 cs.CL cs.AI cs.DB 79%

SPENCE: A Syntactic Probe for Detecting Contamination in NL2SQL Benchmarks

SPENCE:一种用于检测NL2SQL基准污染的句法探针

Mohammadtaher Safarzadeh, Hitesh Laxmichand Patel, Afshin Orojlooyjadid, Graham Horwood, Dan Roth

机构 * Oracle AI

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SPENCE通过生成句法变体检测NL2SQL基准中的污染,分析模型在句法差异下的执行准确性变化,揭示基准释放时间与污染程度的关系。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17259 2026-04-21 cs.IR cs.AI cs.CL 79%

HORIZON: A Benchmark for In-the-wild User Behaviour Modeling

HORIZON:一个面向真实世界用户行为建模的基准

Arnav Goel, Pranjal A Chitale, Bhawna Paliwal, Bishal Santra, Amit Sharma

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research India(微软印度研究院) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 HORIZON基准通过跨领域、长时域的数据和任务设计,解决传统用户建模基准的局限性,提出新的任务和评估方法,评估模型在异构环境中的泛化能力。

Comments 19 pages, accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17230 2026-04-21 cs.CL cs.LG 79%

CaseFacts: A Benchmark for Legal Fact-Checking and Precedent Retrieval

CaseFacts:法律事实核查与先例检索的基准

Akshith Reddy Putta, Jacob Devasier, Chengkai Li

机构 * University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CaseFacts基准,用于验证普通法律主张与美国最高法院先例之间的关系,通过多阶段流程利用大语言模型生成数据,并发现任务仍具挑战性,开放检索反而降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11338 2026-04-21 cs.AI cs.LG 79%

Automatic Dataset Construction (ADC): Sample Collection, Data Curation, and Beyond

自动数据集构建(ADC):样本收集、数据整理与更广泛的领域

Minghao Liu, Zonglin Di, Jiaheng Wei, Zhongruo Wang, Hengxiang Zhang, Ruixuan Xiao, Haoyu Wang, Jinlong Pang, Hao Chen, Ankit Shah, Hongxin Wei, Xinlei He, Zhaowei Zhao, Haobo Wang, Lei Feng, Jindong Wang, James Davis, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) Amazon(亚马逊) SUSTech(华南理工大学) Zhejiang University(浙江大学) Yale University(耶鲁大学) Carnegie Mellon University(卡内基梅隆大学) HKUST (GZ)(香港科技大学) Nanyang Technological University(南洋理工大学) Microsoft(微软)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出自动数据集构建方法ADC,通过LLM实现高效数据集生成,减少人工标注成本,构建包含12个主类和12000个细粒度子类的Clothing-ADC数据集,降低标签噪声至10.7%,并设计三个针对标签噪声和类别不平衡的基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17108 2026-04-21 cs.CL cs.AI 79%

Beyond Word Boundaries: A Hebrew Coreference Benchmark and an Evaluation Protocol for Morphologically Complex Text

超越词界:一种希伯来语核心参照基准及形态复杂文本的评估协议

Refael Shaked Greenfeld, Reut Tsarfaty

机构 * Bar-Ilan University(巴伊兰大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出首个希伯来语核心参照基准KibutzR,针对形态复杂语言中词界与提及边界不一致的问题,提出新的评估协议,并显示LLM在希伯来语上表现不如英语。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14774 2026-04-21 cs.CL cs.AI 79%

LiveCLKTBench: Towards Reliable Evaluation of Cross-Lingual Knowledge Transfer in Multilingual LLMs

LiveCLKTBench: 向多语言大语言模型中跨语言知识转移的可靠评估迈进

Pei-Fu Guo, Yun-Da Tsai, Chun-Chia Hsu, Kai-Xin Chen, Ya-An Tsai, Kai-Wei Chang, Nanyun Peng, Mi-Yen Yeh, Shou-De Lin

机构 * National Taiwan University(国立台湾大学) University of California, Los Angeles(加州大学洛杉矶分校) Academia Sinica, Taiwan(台湾“中央研究院”) NTU AI-CoRE(国立清华大学AI研究中心)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LiveCLKTBench,通过自动化生成流程评估多语言大语言模型的跨语言知识转移,发现语言距离和方向对转移影响显著,且模型规模越大收益越小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00573 2026-04-21 cs.NE cs.CE 78%

Benchmarking ERP Analysis: Manual Features, Deep Learning, and Foundation Models

ERP分析基准测试:手动特征、深度学习与基础模型

Yihe Wang, Zhiqiao Kang, Bohan Chen, Yu Zhang, Xiang Zhang

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文系统比较了传统手动特征、深度学习模型和预训练EEG基础模型在ERP分析中的表现,评估了12个数据集上的ERP刺激分类和脑疾病检测任务,探讨了Transformer架构中的嵌入策略。

Comments Accepted by IEEE Transactions on Biomedical Engineering (TBME 2026). Copyright has been transferred to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07711 2026-04-21 cs.CL 77%

Is Agentic RAG worth it? An experimental comparison of RAG approaches

代理RAG值得吗?RAG方法的实验比较

Pietro Ferrazzi, Milica Cvjeticanin, Alessio Piraccini, Davide Giannuzzi

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) University of Padova(帕多瓦大学) Cargill Geneve(卡吉尔日内夫) Alkemy(阿尔凯米) Komebi Studio(科梅比工作室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过多场景多维度实验比较了增强型和代理型RAG方法,揭示了两者在性能与成本上的权衡,为实际应用提供选择指导。

Comments Accepted at ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17718 2026-04-21 cs.CL cs.SI 77%

Do LLMs Use Cultural Knowledge Without Being Told? A Multilingual Evaluation of Implicit Pragmatic Adaptation

大型语言模型是否在未被告知的情况下使用文化知识?一种多语言隐含语用适应性评估

Mehwish Nasim, Sanjeevan Selvaganapathy, Neel Ganapathi Sabhahit, Marie Griesbach, Pranav Bhandari, Janina Lütke Stockdiek, Lennart Schäpermeier, Usman Naseem, Christian Grimme

机构 * Network Analysis and Social Influence Modelling (NASIM) Lab(网络分析与社会影响力建模实验室) School of Physics Maths and Computing(物理数学与计算学院) The University of Western Australia(西澳大学) School of Computing(计算学院) Macquarie University(麦考瑞大学) Computational Social Science & Systems Analysis(计算社会科学与系统分析) University of Münster(明斯特大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在隐含文化提示下是否改变其说话方式,通过五种语言的60个文化相关对话场景,评估了模型在不同提示条件下的语用特征,发现模型在隐含提示下只能部分恢复显式指令下的语用变化。

详情

展开后加载摘要…

URL PDF HTML 收藏