arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-28 至 2026-07-28 共收录 543 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 117 篇

2607.24707 2026-07-28 cs.AI cs.CV cs.DB 新提交 79%

ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

ERUnderstand:在结构化实体关系图上评估视觉语言模型

Ali Ansari, Yasmin Mohammadi, Farnoush Nili, Parsa Esmaeilkhani, Longin Jan Latecki, Eduard Dragut

机构 * Temple University(天普大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究针对实体关系图仅为图像限制AI辅助数据库工程的问题,引入ERUnderstand基准测试。通过对2960个图表及标准化表示评估视觉语言模型,发现常见元素恢复良好,但特定元素性能差,推理增强模型可提升性能,为评估多模态理解提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22658 2026-07-28 cs.AI cs.SD eess.AS 新提交 79%

StanceBench: A Benchmark for Audio LLM-Based Interpersonal Stance Evaluation from Speech

StanceBench:一个基于音频大语言模型的语音人际立场评估基准

Yuzhe Wang, Thomas Thebaud, Jennifer Hu, Jesús Villalba-Lopez, Venkatesh Ravichandran, Georgi Tinchev, Najim Dehak, Laureano Moro-Velázquez

机构 * Johns Hopkins University(约翰斯·霍普金斯大学) Amazon AGI(亚马逊通用人工智能公司) Amazon Research(亚马逊研究院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究基于音频大语言模型的语音人际立场评估,引入StanceBench基准,通过Seamless Interaction语料库规范评估,明确9个立场维度,报告大语言模型评判的多项指标,指出不同立场的判断难易及特点。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22600 2026-07-28 cs.AI 新提交 79%

Chart Deception in Vision-Language Models: From Vulnerability to Mitigation

视觉语言模型中的图表欺骗:从漏洞到缓解

Ridwan Mahbub, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Mizanur Rahman, Mir Tafseer Nayeem, Enamul Hoque

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究视觉语言模型对图表欺骗的鲁棒性,引入VisDeception基准和欺骗分数,发现模型易受影响,提出推理时多智能体缓解框架,揭示可靠性差距,确立相关评估及推理方向以开发更可信的视觉分析VLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07544 2026-07-28 cs.AI 版本更新 79%

From Pixels to Prompts: Vision-Language Models

从像素到提示:视觉-语言模型

Khang Nhat Hoang Vo

机构 * MBZUAI

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文探讨了视觉-语言模型的发展历程,旨在提供清晰的认知框架,帮助读者理解该领域的核心概念和应用,而非罗列所有数据集和模型变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27660 2026-07-28 cs.AI 版本更新 79%

From Context to Skills: Can Language Models Learn from Context Skillfully?

从上下文到技能:语言模型能否从上下文中熟练学习?

Shuzheng Si, Haozhe Zhao, Yu Lei, Qingyi Wang, Dingwei Chen, Zhitong Wang, Zhenhailong Wang, Kangyang Luo, Zheng Wang, Gang Chen, Fanchao Qi, Minjia Zhang, Maosong Sun

机构 * THU(清华大学) DeepLang AI UIUC(伊利诺伊大学香槟分校) FDU(福建大学) CUHK(香港中文大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 提出Ctx2Skill框架,通过多智能体自博弈和跨时间回放机制,自动从上下文中发现、提炼和选择技能,提升语言模型在复杂上下文中的学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24190 2026-07-28 cs.RO cs.AI cs.HC 新提交 77%

Not Forgotten: Implementation and Evaluation of a Personalized Episodic Memory for the Humanoid Robot Head Kim

未被遗忘:人形机器人头部Kim的个性化情景记忆的实现与评估

Steve Aschenbrenner, Marcel Heisler, Thomas Sievers, Christian Becker-Asano

机构 * Stuttgart Media University(斯图加特媒体大学) University of Lübeck(吕贝克大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对社交机器人跨会话无记忆问题,提出在人形机器人头部Kim上集成轻量级情景记忆模块,结合语义检索与对话系统,用混合评分函数检索交互并注入提示,实验表明该模块提升社交性且未引发负面反应。

Comments Acceoted at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026) Kitakyushu, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22759 2026-07-28 cs.AR cs.LG 新提交 77%

Benchmarking LLMs for Verilog Design Flows

对用于Verilog设计流程的大语言模型进行基准测试

Angshuman Chakravertty, Rahul Koshti, Buddhi Prakash Sharma, Vinay Chamola

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.LG

AI总结 研究针对大语言模型生成Verilog RTL代码能力的基准测试问题,提出含特定流程的可重复平台,经测试提升了开源模型的语法有效性和模拟通过率,且平台与数据集开源,利于生成式人工智能在硬件设计工作流的评估。

Comments 7 pages, 3 figures, 3 tables. Manuscript prepared for submission to IEEE Design & Test

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25758 2026-07-28 cs.CL 版本更新 77%

StreamProfileBench: A Benchmark for Fine-Grained User Profile Inference in Real-World Streaming Scenarios

StreamProfileBench:真实流式场景中细粒度用户画像推断的基准

Sizhe Wang, Feiyu Duan, Juelin Wang, Liwen Zhang, Zhongyu Wei

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Shanghai University of Finance and Economics(上海财经大学) MOE laboratory for National Development and Intelligent Governance, Fudan University(复旦大学国家发展与智能治理实验室) Research Institute of Intelligent Complex Systems, Fudan University(复旦大学智能复杂系统研究院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出StreamProfileBench基准,通过持续状态维护任务和免标注评估框架,研究大语言模型在流式用户画像更新中的保守偏差问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07889 2026-07-28 cs.CL 版本更新 77%

BioProBench: A Corpus and Benchmark for Biological Protocol Reasoning in Autonomous Science

BioProBench: 一个全面的数据集和生物协议理解与推理基准

Yuyang Liu, Liuzhenghao Lv, Xiancheng Zhang, Jingya Wang Li Yuan, Yonghong Tian

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of Chemical Biology&Biotechnology, Peking University(北京大学化学生物学与生物技术学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 BioProBench通过构建大规模数据集和基准,提升生物协议理解与推理的LLM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23175 2026-07-28 cs.CL cs.AI 新提交 76%

Beyond a Global Norm: Personalizing Toxicity Sensitivity in Language Models Without Retraining

超越全局规范:无需重新训练即可在语言模型中实现毒性敏感性个性化

Rares A. C. Diaconescu, Iulia Slanina, Alina Florea, Andrei B. Trache, Miruna E. Coroi, Anne Arzberger, Jie Yang, Enrico Liscio

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 评测与基准 :language model(title);分类 cs.CL、cs.AI

AI总结 研究如何在语言模型中实现毒性敏感性个性化,通过对免训练方法在三个推理阶段进行比较评估,与PRISM数据集目标对比,各方法降低对齐误差28 - 47%,揭示了多目标间权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22553 2026-07-28 cs.CL cs.AI 新提交 76%

Evaluating the Impact of Reviewer Guideline Design on LLM-Based Automated Peer Review

评估审稿人指南设计对基于大语言模型的自动同行评审的影响

Haowen Li, Yoichi Ishibashi, Masafumi Oyamada

机构 * Keio University(庆应义塾大学) NEC Corporation(日本电气公司)

专题命中 评测与基准 :LLM(title);分类 cs.CL、cs.AI

AI总结 研究分析不同类型审稿人指南对基于大语言模型的自动同行评审的影响,通过实验发现官方会议指南效果最佳,模仿审稿人指南较差,且严格评分标准会降低性能,强调主观和整体评分的重要性。

Comments 18 pages, 2 figures, ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22548 2026-07-28 cs.AI cs.LG cs.PF 新提交 76%

SeT-Diff: Towards Semantic Foundation Models for HPC Telemetry and Time-Series

SeT-Diff:面向高性能计算遥测和时间序列的语义基础模型

Giovanni B. Esposito, Francesco Antici, Daniele Cesarini, Andrea Bartolini

机构 * University of Bologna(博洛尼亚大学) CINECA(意大利国家科研计算中心)

专题命中 评测与基准 :foundation model(title);分类 cs.AI、cs.LG

AI总结 针对数据中心计算节点建模需求,提出SeT-Diff基础模型,采用基于扩散的方法,在真实超级计算机数据集实验中,其重建任务平均绝对误差为0.0470,有零样本排列稳定性,单个模型可有效执行多种任务,是高性能计算系统有效的数据驱动数字孪生。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17492 2026-07-28 cs.AI cs.CL cs.LG 版本更新 75%

PD$^3$: A Project Duplication Detection Framework via Adapted Multi-Agent Debate

PD$^3$:一种通过适应性多智能体辩论的项目重复检测框架

Dezheng Bao, Yueci Yang, Chutian Yu, Xin Chen, Zeguo Fei, Xiang Yuan, Lijun Zhang, Jiangqian Huang, Zhengxuan Jiang, Daoze Zhang, Junru Chen, Yang Yang

机构 * Zhejiang University(浙江大学) State Grid Power Supply Co. Ltd.(国网电力供应有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究项目重复检测问题,提出PD$^3$框架,通过适应性多智能体辩论,结合局部多智能体辩论与全局循环调度检索项目集,能保证公平比较并产生相关分数和反馈,在真实项目上优于基线,还部署平台节省资金。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23519 2026-07-28 cs.CY cs.AI cs.CL 新提交 74%

Auditing Alignment Controllability in LLMs via Political Axes

通过政治轴审计大语言模型中的对齐可控性

Bartol Bućan, Nikola Sočec, Sarah Isufi, Morena Granić, Luka Hobor, Agneza Krajna, Mihael Kovac, Mario Brcic

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

AI总结 研究通过对7个大语言模型进行基于提示可控性的压力测试,探讨其在政治轴上的对齐可控性,发现上下文框架起主要作用,模型移动方式有别,强调政治坐标审计需考虑分散性等可控性因素,并发布相关数据和代码。

Comments 17 pages, 6 figures, 4 tables. Accepted at AIES 2026 (AAAI/ACM Conference on AI, Ethics, and Society). This version includes the supplementary appendix. Code and data: https://github.com/mbrcic/llm-political-steerability (Zenodo DOI 10.5281/zenodo.21489805)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24314 2026-07-28 cs.LG 新提交 74%

MEGA-CL: A Molecular Foundation Model for Generalizable ADMET Prediction through Graph External Attention and Contrastive Learning

MEGA-CL:通过图外部注意力和对比学习实现可泛化ADMET预测的分子基础模型

Tinghui Jin, Kedu Jin, Ying Li, Guanghui Ren, Jingzhi Xue, Shiyu Zhou, Xiaoli Dai, Li-bin Wei, Xijing Chen, Di Zhao, Jinfeng Liu

专题命中 评测与基准 :foundation model(title);分类 cs.LG

AI总结 该研究针对小分子ADMET预测难题,提出MEGA-CL框架,集成自监督对比学习等技术,能同时建模局部与全局关系并减轻过平滑。它在多数据集和任务中优于基线模型,在回归任务及外部验证中表现出色,还通过实验验证了其在药物研发中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22671 2026-07-28 cs.AI 新提交 74%

AIR-BENCH Live: An Evolving Safety Benchmark for Foundation Models

AIR-BENCH Live:基础模型不断演进的安全基准测试

Rohan Naphade, Minzhou Pan, Bo Li

机构 * Virtue AI(美德人工智能公司) Carnegie Mellon University(卡内基梅隆大学) Northeastern University(东北大学) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :foundation model(title);分类 cs.AI

AI总结 研究针对基础模型安全基准测试随模型和法规发展而不足的问题,提出AIR-BENCH Live,通过自动化更新管道和多智能体算法更新提示,扩展了基准测试风险数量,评估模型发现安全范围广等结果,使其能随领域发展。

Comments 11 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24191 2026-07-28 cs.CL cs.AI 新提交 73%

StanceFlip: A Comprehensive Multi-Dimensional Benchmark for Multimodal Conversational Stance Flipping Forecasting

StanceFlip:用于多模态对话立场翻转预测的综合多维基准测试

Heyan Chai, Xin Li, Wenjie Wang, Jianyang Qin, Chaoyang Li, Lu Wang, Hao Chen, Qing Liao

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院) Harbin Institute of Technology Shenzhen(哈尔滨工业大学(深圳)) City University of Macau(澳门城市大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有对话立场检测基准测试的局限,提出StanceFlip基准测试及ConStaFF框架,含多模态立场六元组提取和动态立场翻转归因两个新子任务,基于大语言模型实现端到端立场推理,实验显示该方法性能领先。

Comments 17pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23808 2026-07-28 cs.CL cs.AI 新提交 73%

Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

Indic DiarBench:印度语言的多语言联合语音分离与自动语音识别基准

Deovrat Mehendale, Aditya Mehndiratta, Dhruv Rathi, Kaushal Bhogale, Mitesh M. Khapra

机构 * Sarvam AI(萨尔瓦姆人工智能公司) AI4Bharat, IIT Madras(印度理工学院马德拉斯分校人工智能促进印度发展实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 介绍涵盖印度22种在册语言的Indic DiarBench基准数据集,含约108小时多说话者音频,经人工校正注释。通过评估领先系统建立基线,该数据集作为开放资源推动印度语言多语言语音技术研究。

Comments 5 pages, 2 figures, Interspeech 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22561 2026-07-28 cs.AI cs.LG 新提交 73%

Codifying the Judge: Scalable Evaluation via Program Distillation

将评判器编码:通过程序蒸馏实现可扩展评估

Tzu-Heng Huang, Shengqi Qiu, Frederic Sala

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究针对基于语言模型的评判器成本高、延迟大等问题,提出用程序蒸馏方法,将其决策逻辑提炼成程序委员会。引入PAJAMA系统,实验显示程序评判器性能可匹配大语言模型,还能提高准确率和吞吐量,产生廉价有效奖励信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10156 2026-07-28 cs.IR cs.AI cs.CL 版本更新 73%

$τ$-Rec: A Verifiable Benchmark for Agentic Recommender Systems

$τ$-Rec:面向智能推荐系统的可验证基准

Bharath Sivaram Narasimhan, Karthik R Narasimhan

机构 * Independent Researcher(独立研究员) Princeton University(普林斯顿大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对多轮对话式智能推荐系统评估中主观性强、成本高的问题,提出$τ$-Rec基准,通过可验证奖励和揭示标记引导机制,结合pass^k可靠性指标,系统评估模型推理一致性,发现当前最佳模型可靠性仅约57%。

Comments Accepted at ACM RecSys 2026 (Reproducibility and Resource Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27476 2026-07-28 cs.AI cs.LG 版本更新 73%

PeopleSearchBench: A Multi-Dimensional Benchmark for Evaluating AI-Powered People Search Platforms

PeopleSearchBench: 一个多维度基准,用于评估人工智能驱动的人力搜索平台

Wei Wang, Tianyu Shi, Shuai Zhang, Boyang Xia, Zequn Xie, Chenyu Zeng, Qi Zhang, Lynn Ai, Yaqi Yu, Kaiming Zhang, Feiyue Tang, Lei Ding

机构 * LessieAI research team(LessieAI 研究团队)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出PeopleSearchBench,一个开源基准,评估四个人力搜索平台在119个真实查询中的表现,采用事实验证方法,提出Criterions-Grounded Verification,评估三个维度:相关性精度、有效覆盖和信息效用,Lessie在所有指标中表现最佳。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22080 2026-07-28 cs.SE cs.AI cs.CL 版本更新 73%

CodeEvo: Interaction-Driven Synthesis of Code-centric Data through Hybrid and Iterative Feedback

CodeEvo:通过混合和迭代反馈以交互驱动方式合成以代码为中心的数据

Qiushi Sun, Jinyang Gong, Lei Li, Qipeng Guo, Fei Yuan

机构 * Shanghai AI Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 为解决高质量指令-代码对获取难题,提出双智能体架构CodeEvo,审查器制定模式并结合混合验证协议,构建CodeEvo-100K数据集,实验表明基于此数据微调的模型在代码生成基准测试中表现出色。

Comments ACL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23722 2026-07-28 cs.AI 新提交 70%

E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios

E-Bench:在现实世界产品场景中对多步工具使用智能体进行基准测试

Weihuang Zheng, Tianyuan Zou, Eileen Ye, Alphet Liu, Youyong Kong, Ya-Qin Zhang, Duran Zheng, Maxm Pan

机构 * Hunyuan Team, Tencent(腾讯混元团队) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型多步工具使用能力,介绍E-Bench基准测试,通过解耦环境与任务合成构建可扩展可控测试平台,对11个前沿模型测试发现多步工具使用仍具挑战,即便结合代码执行可靠性也不高。

Comments 29 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23425 2026-07-28 cs.SE cs.AI 新提交 70%

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation

TLA$^{+}$-Bench:用于自然语言到TLA+规范生成的基于执行的基准测试和数据集

Arslan Bisharat, Eric Spencer, Brian Ortiz, Khushboo Bhadauria, Mujtaba Nazari, Beatriz Santos, Anisa Ramos, TaiNing Wang, George K. Thiruvathukal, Konstantin Läufer, Mohammed Abuhamad

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型编写TLA$^{+}$规范进展难测问题,提出TLA$^{+}$-Bench数据集和基准测试,基于执行评级。通过该基准测试发现评级选择影响正确率,存在正确性包络,且模型编写有效规范多但正确规范少,正确性随难度下降。

Comments 17 pages, appendix included. Introduces TLA+-Bench, an execution-grounded benchmark and dataset for natural-language to TLA$^{+}$ specification generation. Dataset, evaluation code, and model outputs available at publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23326 2026-07-28 cs.AI 新提交 70%

ESF-Bench: Benchmarking Challenging Slot-Filling Scenarios for Real-World Enterprise Applications

ESF-Bench:针对现实世界企业应用的具有挑战性的槽填充场景基准测试

Toby Liang, Gopal Sarda, Sagar Davasam, Vikas Yadav

机构 * ServiceNow(ServiceNow公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型在企业实际部署中槽填充面临的挑战,介绍ESF-Bench基准,它含多轮样本和槽,跨越多个领域,揭示了当前模型局限性,还公开了数据集、分类法及评估代码以推动该领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23147 2026-07-28 cs.CR cs.AI 新提交 70%

False Prophets: On the Security of World Models in Agentic Systems

虚假预言:论智能体系统中世界模型的安全性

Erik Imgrund, Anna Wimbauer, Klim Kireev, Konrad Rieck

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究智能体系统中世界模型的安全性,发现其存在特定漏洞,引入安全基准数据集,指出攻击者能诱导错误预测,成功率达95%,并为从业者提供减轻危害、强化系统的实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23123 2026-07-28 cs.AI 新提交 70%

SQBench: A Benchmark for Evaluating Task Delivery by Language-Model Agents in Production-Oriented Workflows

SQBench:用于评估面向生产工作流程中语言模型代理任务交付的基准测试

Summer Sun

机构 * Shaqiu Community(沙丘社区)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究面向生产工作流程中语言模型代理任务交付评估问题,核心方法是引入SQBench基准测试,包含多种任务并按特定方式评估,主要贡献是揭示功能完成度不能完全体现交付质量,风险判定需单独报告。

Comments 17 pages, 8 figures. Code and aggregate results: https://github.com/shaqiu-ai/SQBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22632 2026-07-28 cs.AI 新提交 70%

VlogReward: Learning Multi-Dimensional Evaluation for Vlog Editing

VlogReward:学习用于Vlog编辑的多维评估

Yexiang Liu, Wen Zhong, Sijie Zhu, Xin Gu, Fan Chen, Junxian Duan, Jie Cao, Longyin Wen, Zhenfang Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对Vlog评估主观性强且缺乏标准等问题,提出VlogReward模型。通过专业指导定义评估框架,构建数据集和基准,增强GRPO框架。该模型能提供多维分数与反馈,优于现有MLLMs,助力Vlog创作者及自动化评估完善系统。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13385 2026-07-28 cs.CR cs.AI cs.CY cs.HC cs.MM 版本更新 70%

Who Pays the Price? Stakeholder-Centric Prompt Injection Benchmarking for Real-world Web Agents

谁买单?面向真实世界网络代理的以利益相关者为中心的提示注入基准测试

Zihao Wang, Yiming Li, Yutong Wu, Kangjie Chen, Zheyu Liu, Fok Kar Wai, Pin-Yu Chen, Vrizlynn L. L. Thing, Bo Li, Dacheng Tao, Tianwei Zhang

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ST Engineering, Singapore(ST工程,新加坡) IBM Research, USA(IBM研究院,美国) University of Illinois Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出以利益相关者为中心的基准测试框架,系统分类和归因真实世界网络代理系统中的提示注入危害,揭示当前代理无法可靠抵抗任何攻击目标,且失败模式多样。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22113 2026-07-28 cs.DC cs.AI cs.SE 70%

PRAXIS: Integrating Program Analysis with Observability for Root-Cause Analysis

PRAXIS:将程序分析与可观测性集成用于根本原因分析

Shengkun Cui, Rahul Krishna, Saurabh Jha, Ravishankar K. Iyer

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 PRAXIS通过整合程序分析与可观测性,提升云故障根本原因分析的准确性,减少token消耗,适用于真实世界故障场景。

Comments 15 pages. Accepted to appear in The 56th Annual IEEE/IFIP International Conference on Dependable Systems and Networks

详情

展开后加载摘要…

URL PDF HTML 收藏