arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-15 至 2026-07-15 共收录 56 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 56 篇

2606.17253 2026-07-15 cs.AR 版本更新 91%

PDAGENT-BENCH: Characterizing, Grounding, and Architecting LLM/VLM Agents for VLSI Physical Design

PDAGENT-BENCH: 用于VLSI物理设计的LLM代理的特征化、基础化与架构化

Qiufeng Li, Rongqian Chen, Quan Cheng, Chengxuan Wang, Sizhe Tang, Chia-Tung Ho, David Z. Pan, Tian Lan, Weidong Cao

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出PDAGENT-BENCH基准,用于评估LLM/VLM代理在VLSI物理设计中的能力,涵盖任务级和工作流级评估,揭示模型在工具执行和长程推理上的局限,并验证人类技能增强工作流的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23781 2026-07-15 cs.CR 版本更新 91%

Leveraging Large Language Models for Trustworthiness Assessment of Web Applications

利用大语言模型评估网络应用的可信度

Oleksandr Yarotskyi, José D'Abruzzo Pereira, João R. Campos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出利用大语言模型自动评估网络应用的可信度,通过比较不同提示工程技术,提出基于逻辑偏好分数的分层质量模型,实验表明规则提示能提高评估可靠性。

Comments Accepted for publication in the 19th IEEE International Conference on Software Testing, Verification and Validation (ICST) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12260 2026-07-15 cs.LG 新提交 90%

From Many to Meaningful: Feature-Guided Zero-Shot Chronic Kidney Disease Screening Using Large Language Models

从众多到有意义:使用大语言模型进行特征引导的零样本慢性肾病筛查

Muhammad Ashad Kabir, Sirajam Munira

机构 * School of Computing, Mathematics and Engineering, Charles Sturt University(查尔斯·斯特尔特大学计算、数学与工程学院) Department of Computer Science, Rensselaer Polytechnic Institute(伦斯勒理工学院计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究探讨用大语言模型进行零样本慢性肾病筛查的可行性,提出特征引导零样本框架,通过特征选择、序列化患者记录实现。实验表明该框架能提升模型性能,在多数据集有良好泛化性,为CKD筛查提供新方法。

Comments Author-prepared preprint. The Version of Record was published in AIME 2026, Springer, and is available via the DOI

Journal ref Proceedings of the Artificial Intelligence in Medicine (AIME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26052 2026-07-15 cs.CL 版本更新 90%

From Prompt Risk to Response Risk: Paired Analysis of Safety Behavior of Large Language Models

从提示风险到响应风险:大型语言模型安全行为的配对分析

Mengya Hu, Qiong Wei, Sandeep Atluri

机构 * Microsoft(微软)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究通过配对分析人类标注的提示和响应记录,探讨了大型语言模型在四个危害类别(性、自残、仇恨和暴力)和有序严重性级别上的安全行为,发现61%的响应比提示减少了危害,3%的响应升级了危害,并揭示了安全行为与无害性之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01311 2026-07-15 cs.CL 版本更新 90%

Catalyst-Agent: Autonomous heterogeneous catalyst screening with an LLM Agent

Catalyst-Agent:基于LLM Agent的自主异质催化剂筛选

Achuth Chandrasekhar, Janghoon Ock, Amir Barati Farimani

机构 * Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA 15213, USA(卡内基梅隆大学机械工程系,匹兹堡,PA 15213,USA) Department of Chemical and Biomolecular Engineering, University of Nebraska--Lincoln, Lincoln, NE 68588, USA(内布拉斯加大学林肯分校化学与生物分子工程系,林肯,NE 68588,USA)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出Catalyst-Agent,一种基于MCP服务器和LLM的AI代理,通过OPTIMADE API探索材料数据库、利用UMA模型计算吸附能,实现闭环自主催化剂筛选,在ORR、NRR和CO2RR反应中成功率达33-41%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12467 2026-07-15 cs.SE 新提交 89%

Understanding before Naming! Enhancing LLM-based Method Name Prediction with Code Summarization

命名之前先理解!通过代码摘要增强基于大语言模型的方法名预测

Wei Liu, Weisong Sun, Tingting Xu, Hanwei Qian, Yi Zhao, Chunrong Fang, Xia Feng

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对方法名预测中现有评估不能反映语义质量、基于LLM的方法与人命名过程不同的问题,通过实证研究比较多种评估器及策略,提出结合摘要和细化的SMNP方法,实验证明该方法在方法名预测上有效且鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12089 2026-07-15 cs.CR cs.SE 新提交 89%

Cross-Cutting Security Analysis of LLM-Generated Code via Metamorphic Testing and Association Rule Mining

通过变形测试和关联规则挖掘对大语言模型生成代码进行横切安全分析

Zedong Peng, Chenggang Wang, Shangyue Zhu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对LLM生成代码的安全漏洞,提出结合变形测试与关联规则挖掘的框架,定义九个MRs并应用于3700个代码片段,揭示共同违反结构与横切模式,还进行提示级风险分析,发现不安全代码生成具结构化和提示依赖性,推动相关验证与干预。

Comments This work has already been accepted by IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16304 2026-07-15 cs.CR cs.SE 版本更新 89%

An Evaluation of Large Language Models for Detection of Malicious Python Packages

注意差距:评估LLMs在高层面恶意包检测与细粒度指标识别中的表现

Ahmed Ryan, Ibrahim Khalil, Abdullah Al Jahid, Md Erfan, Sungbin Park, Akond Ashfaque Ur Rahman, Md Rayhanur Rahman

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了LLMs在恶意包检测与细粒度指标识别中的性能差异,发现通用模型在过滤威胁方面表现优异,但专用编码模型在识别严格结构的攻击时更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11890 2026-07-15 cs.CY cs.AI 新提交 88%

So Many Opinions, So Many LLMs: Comparing Large Language Models to Traditional Machine Learning for Open- Ended Survey Analysis

众多观点,众多大语言模型:将大语言模型与传统机器学习用于开放式调查分析的比较

Abdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究对比多种大语言模型与传统机器学习用于开放式调查分析,在情感分析和主题分类等任务中评估性能,发现LLMs分类准确性更高,但在预测理由及应用类别边界上差异大,凸显了使用LLMs进行定性分析时的权衡并给出实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15222 2026-07-15 cs.SE cs.CL cs.PL 版本更新 88%

PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization

PerfCodeBench:用于系统级高性能代码优化的LLM基准测试

Huihao Jing, Wenbin Hu, Shaojin Chen, Haochen Shi, Hanyu Yang, Sirui Zhang, Haoran Li, Yangqiu Song

机构 * HKUST(香港科技大学) NYU(纽约大学) SWUPL(西南大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PerfCodeBench,用于评估LLM在系统级高性能代码优化中的能力,发现模型生成代码与专家优化代码存在显著差距,尤其在并行和GPU任务中表现更差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01117 2026-07-15 cs.CV 版本更新 88%

MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models

MoHallBench: 视频大语言模型中运动幻觉的基准测试

Sihan Chen, Jiale Li, Jianghang Lin, Mengyuan Liu

机构 * Xiamen University(厦门大学) South China University of Technology(华南理工大学) Peking University(北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出MoHallBench基准,系统评估视频大语言模型中的运动幻觉,涵盖共现先验、顺序推理和相似混淆三类来源,揭示动作识别与幻觉抵抗的解耦现象。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12885 2026-07-15 cs.CL 新提交 87%

LLM Judges Can Be Too Generous When There Is No Reference Answer

当没有参考答案时,大语言模型评判可能过于宽松

Chalamalasetti Kranti, Sowmya Vajjala

机构 * University of Potsdam(波茨坦大学) National Research Council(国家研究委员会)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 探讨在无参考答案时大语言模型评判器能否可靠评估。通过校准和敏感性两阶段实验,发现其在无参考答案时易高估错误答案,添加参考答案信息会大幅改变评判结果,且与人类判断相符,强调校准LLM评判器的必要性并提供了方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15212 2026-07-15 cs.CR 版本更新 87%

LLM vs. SAST: A Technical Analysis on Detecting Coding Bugs of GPT4-Advanced Data Analysis

大语言模型与SAST:关于GPT4-高级数据分析编码漏洞检测的技术分析

Madjid G. Tehrani, Eldar Sultanow, William J. Buchanan, Mahkame Houmani, Christel H. Djaha Fodja

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究对比GPT-4与两个SAST工具在32个安全场景的编码漏洞检测,用二元规则评分、逻辑或基线聚合结果,经McNemar检验,发现GPT-4检测性能更优,还讨论了将其集成到安全软件开发工作流程的相关要点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12884 2026-07-15 cs.CL 新提交 86%

Evaluating Large Language Models on Misconceptions in Multi-Turn Medical Conversations

在多轮医疗对话中的误解上评估大语言模型

Monica Munnangi, Saiph Savage

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 研究多轮医疗对话中模型对误解的处理,引入ThReadMed-QA数据集,用基于准则的框架评估五个大语言模型,发现前沿模型在后续轮次表现大幅下降,错误传播致性能降,强调需捕捉多轮行为的评估框架。

Comments Accepted to MLHC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09570 2026-07-15 cs.CL cs.HC 版本更新 84%

UXBench: Benchmarking User Experience in AI Assistants

UXBench:AI助手中的用户体验基准测试

Mengze Hong, Xia Zeng, Zeyang Lei, Sheng Wang, Chen Jason Zhang, Di Jiang, Taiming Fu, Jinfeng Huang, Mengqiao Liu, Qinghe Chang, Haosheng Zou, Qiongyi Zhou, Sijun He, Simonjmdeng, Haojing Huang, Zijian Li, Lucas Mu Li, Fubao Zhang, Mona Zhou, Wei Ma, Yuan Hua, Qi Zhu, Shuo Jiang, Chenxuan Ma, Yuanmeng Zhang, Jian Song, Minlong Peng, Di Liang, Davey Chen

机构 * Hong Kong Polytechnic University(香港理工大学) Tencent(腾讯)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL

AI总结 提出首个基于真实用户反馈的用户中心基准UXBench,包含三个任务和7400个测试实例,评估26个前沿语言模型,发现用户反馈预测是可学习的能力,并揭示了LLM作为评判者的系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04689 2026-07-15 cs.CL cs.AI 版本更新 84%

Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks

大语言模型评估的自适应测试:一种替代静态基准的心理测量方法

Peiyu Li, Xiuxiu Tang, Si Chen, Ying Cheng, Ronald Metoyer, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(诺丁汉大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型评估成本高、现有协议不合理的问题,提出基于项目反应理论的自适应测试框架ATLAS,通过Fisher信息引导选项目,减少90%项目数仍保持精度,能重构准确率,还可在准确率相当模型中提供精细区分。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12339 2026-07-15 cs.HC cs.AI 版本更新 83%

SheetMind: An End-to-End LLM-Powered Multi-Agent Framework for Spreadsheet Automation

SheetMind:一个由端到端大语言模型驱动的用于电子表格自动化的多智能体框架

Xi Cheng, Ruiyan Zhu, Ke Liu, Rakesh Chowdary Machineni, Lyuhao Chen, Brian Zhu, Daniel Jin, Zheng Qi, Neeraj Parihar, Zhoutian Xu, Oliver Gao

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology (GZ)(香港科学与技术大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 介绍由大语言模型驱动的多智能体框架SheetMind用于电子表格自动化,其分层系统含三个智能体,经评估在SheetCopilot基准测试中执行成功率达100%、功能正确性54.8%超对手,消融研究验证配置优势,还集成到谷歌表格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12215 2026-07-15 cs.CL cs.LG cs.MA 新提交 82%

Fine-Tuned Multi-Agent Framework for Detecting OCEAN in Life Narratives

用于在生活叙事中检测大五人格的微调多智能体框架

Rasiq Hussain, Darshil Italiya, Joshua Oltmanns, Mehak Gupta

机构 * Southern Methodist University(南卫理公会大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究旨在从文本中准确评估人格,提出微调多智能体框架,通过掩码语言建模和心理测量监督让子智能体针对特质采用不同视角,评判大语言模型生成预测,经实验验证该方法可扩展且可解释,突出多智能体推理优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10609 2026-07-15 cs.IR 版本更新 82%

iTIMO: An LLM-empowered Synthesis Dataset for Travel Itinerary Modification

iTIMO:一个基于大语言模型的旅行行程修改合成数据集

Zhuoxuan Huang, Yunshan Ma, Hongyu Zhang, Hua Ma, Zhu Sun

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 iTIMO通过基于大语言模型的意图驱动扰动任务,构建了一个用于旅行行程修改的合成数据集,用于评估和改进旅行推荐系统。

Comments Accepted by SIGIR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12986 2026-07-15 cs.AI cs.SE 新提交 79%

Win by Silence: Deletion Non-Monotonicity, Autonomous Exploitation, and Typed-State Gating in LLM Plan Evaluation

以沉默取胜:大语言模型计划评估中的删除非单调性、自主利用和类型状态门控

Aleh Manchuliantsau

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型计划评估中删除非单调性等问题,通过命题1给出得分变化公式,经实验发现优化器能找到改进结构,GATE可约束搜索,PCSC能消除事后省略拼接,但GATE不验证策略质量。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12200 2026-07-15 cs.AI cs.CR cs.CY 新提交 79%

A Threshold Exceedance Framework for CBRN Uplift Evaluation in Frontier Language Models

前沿语言模型中用于CBRN提升评估的阈值超越框架

Rahul Gupta, Abhinav Mohanty, Payal Motwani, Venkatesh Saligrama, Satyapriya Krishna, Connor Harris, Gary Anthony Ackerman, Brandon Behlendorf, Tom Hobson, Theodore Wilson, Spyros Matsoukas

机构 * Amazon(亚马逊) Nemesys Insights(Nemesys洞察)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究前沿语言模型中CBRN提升评估问题,引入阈值超越标准(TEC)框架,将提升研究分解为独立组件,通过大规模实证研究确定两种提升形式,揭示领域异质性,为相关决策提供信息并总结方法经验。

Comments 19 pages, 1 figure, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15892 2026-07-15 cs.CV cs.AI 版本更新 79%

Egocentric Bias in Vision-Language Models

视觉语言模型中的自我中心偏差

Maijunxian Wang, Yijiang Li, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao, Emmy Liu, Hokin Deng, Dezhi Luo

机构 * Cognitive Science Program, University of California, Berkeley(加州大学伯克利分校认知科学项目) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) School of Computer Science, Georgia Institute of Technology & Emory University(佐治亚理工学院计算机科学学院及埃默里大学) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Equal Advising Department of Computer Science & Wilmer Eye Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系及威尔默眼科研究所) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Weinberg Institute for Cognitive Science, University of Michigan(密歇根大学韦恩伯格认知科学研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出FlipSet基准,揭示视觉语言模型在第二级视觉视角推理中存在系统性自我中心偏差,表明模型在整合社会认知与空间操作方面存在根本性不足。

Comments Accepted at CogSci 2026 (Best Undergraduate Student Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11951 2026-07-15 cs.AI cs.CL cs.FL cs.PL 新提交 79%

GRID: Grammar-Railed Decoding for Enterprise SQL Generation

GRID:用于企业SQL生成的语法约束解码

Mohsen Arjmandi

机构 * evolutionID GmbH(进化ID有限公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对企业SQL生成需求,提出GRID语法约束解码引擎,通过特定方式确定令牌掩码,编译角色访问控制,有四个保证。经实验,Rust内核降低掩码时间,在Spider上约束解码提升模型可执行率,还具备审计跟踪和篡改检测功能。

Comments 18 pages, 3 figures. Extended version; a condensed version is under review at KDD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15239 2026-07-15 cs.CL cs.AI econ.GN q-fin.EC stat.ME 版本更新 79%

Modeling Story Expectations: A Generative Framework using LLMs

建模故事期望:一种使用大语言模型的生成框架

Hortense Fong, George Gui, Bo Yang

机构 * Columbia Business School(哥伦比亚商学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对非结构化叙事内容建模消费者故事期望的难题,利用大语言模型生成故事延续并提取特征,通过两种验证程序,将其应用于不同数据发现模型期望与人类信念及实际故事延续相关,为叙事内容信念建模提供可扩展方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12619 2026-07-15 cs.AI cs.ET 新提交 77%

Agentic Service-Oriented Computing: A Manifesto for the Next Frontier of Service-Oriented Computing

面向智能体的面向服务计算:面向服务计算新前沿宣言

Amin Beheshti, Rong N. Chang, Boualem Benatallah, Fabio Casati, Schahram Dustdar, Geoffrey Fox, Quan Z. Sheng, Yan Wang, Jian Yang, Albert Zomaya

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究LLM驱动的智能体融入复杂工作流面临的挑战,提出面向智能体的面向服务计算(ASOC)。阐述其六个基本原则,组织五维研究议程,旨在将智能体AI从零散演示转变为可靠的基于服务的系统,为新兴领域提供支撑。

Comments Accepted at the 2026 IEEE International Conference on Web Services (ICWS); Corresponding author: Prof. Amin Beheshti; DOI 10.1109/ICWS72778.2026.00163

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22432 2026-07-15 cs.LG 版本更新 77%

AMUSE: Anytime Muon with Stable Gradient Evaluation

AMUSE: 任何时刻的Muon with Stable Gradient Evaluation

Jueun Kim, Baekrok Shin, Jihun Yun, Beomhan Baek, Minhak Song, Chulhee Yun

机构 * KAIST(韩国科学技术院) KRAFTON(KRAFTON公司) Seoul National University(首尔国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文研究了Muon算法的机制,提出了一种名为AMUSE的算法,通过结合Muon的快速批量进步和Schedule-Free平均的稳定效果,实现了无需学习率调度的任何时刻训练,并在视觉任务和大语言模型预训练中提升了性能-迭代帕累托前沿。

Comments 44 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12290 2026-07-15 eess.AS cs.AI cs.CL cs.LG cs.SD 新提交 75%

The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

缺失之音:音频-语言嵌入模型在处理否定时存在困难

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(国家台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(国家台湾大学人工智能卓越研究中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究音频-语言嵌入模型在处理否定时的问题,引入NegEval-Audio框架将数据集转换为否定感知任务,发现模型在否定情况下性能大幅下降,肯定偏差是缺陷,需明确否定感知训练目标。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20867 2026-07-15 cs.IR 版本更新 75%

E-GEO: A Testbed for Generative Engine Optimization in E-Commerce

E-GEO:电子商务中生成引擎优化的测试平台

Puneet S. Bagga, Vivek F. Farias, Tamar Korkotashvili, Tianyi Peng, Yuhang Wu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究电子商务中生成引擎优化问题,引入E-GEO数据集,对多种生成引擎、重写器和启发式方法进行大规模实证研究,将GEO公式化并开发优化算法,通过攻击验证其有效性,揭示存在通用有效GEO策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12338 2026-07-15 cs.AI 新提交 74%

How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks

多少任务足以做出智能体基准决策?对公共大语言模型智能体基准的重放分析

Wei-Jung Huang

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 研究智能体基准测试中多少任务足以做决策,通过重放公共任务级记录,提出部分预算需满足支持完整基准决策、覆盖任务组及控制未解决比较比例等条件,还指出部分评估报告应包含的内容。

Comments KDD 2026 Workshop Agentic AI Evaluation and Trustworthiness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11891 2026-07-15 cs.CL cs.AI 新提交 73%

CANDI: Contextual Alignment for Niche Domains Question Answering

CANDI:特定领域问答的上下文对齐

Megha Chakraborty, Darssan L. Eswaramoorthi, Het Riteshkumar Shah, Madhur Thareja, Michelle A Ihetu, Harshul Raj Surana, Kaushik Roy, Amit Sheth

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对专业领域大语言模型评估问题,提出CANDI-QA数据集,含两类问答对。评估多种语言模型,给出MTSS-Net框架。揭示特定领域上下文对齐挑战及当前模型局限,为上下文感知语言模型研究提供关键基准。

详情

展开后加载摘要…

URL PDF HTML 收藏