arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-15 至 2026-05-15 共收录 79 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 79 篇

2605.14460 2026-05-15 cs.CR cs.SE 92%

Exploiting LLM Agent Supply Chains via Payload-less Skills

通过无负载技能利用LLM代理供应链

Xinyu Liu, Yukai Zhao, Xing Hu, Xin Xia

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究提出Semantic Compliance Hijacking攻击,利用LLM生成能力动态合成恶意行为,通过无负载技能实现对自主编码环境的攻击,展示了其在不同框架和模型中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06718 2026-05-15 cs.CR cs.AI 92%

GhostCite: A Large-Scale Analysis of Citation Validity in the Age of Large Language Models

GhostCite: 对大规模语言模型时代引用有效性的大规模分析

Zuyao Xu, Yuqi Qiu, Lu Sun, Fasheng Miao, Fubin Wu, Xiang Li, Xinyi Wang, Haozhe Lu, Zhengze Zhang, Yuxin Hu, Jialu Li, Luo Jin, Feng Zhang, Rui Luo, Xinran Liu, Yingxian Li, Jiaji Liu

机构 * Nankai University(南开大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究通过三个实验分析LLM时代引用有效性,发现13个模型在引用生成任务中存在14.23%-94.93%的伪造引用率,2025年无效引用率上升80.9%,并揭示87.2%的研究人员使用AI工具,76.7%的审稿人未彻底检查参考文献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20924 2026-05-15 cs.CR 91%

RLCracker: Evaluating the Worst-Case Vulnerability of LLM Watermarks with Adaptive RL Attacks

RLCracker: 评估LLM水印的最坏情况漏洞

Hanbo Huang, Yiran Zhang, Hao Zheng, Xuan Gong, Yihan Li, Lin Liu, Zhuotao Liu, Shiyu Liang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出RLCracker,通过强化学习方法评估LLM水印的最坏情况漏洞,证明水印对改写攻击高度敏感,并在有限样本下实现高移除率。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13873 2026-05-15 cs.DL cs.AI cs.HC 91%

Large Language Models for Web Accessibility: A Systematic Literature Review

用于网络可访问性的大型语言模型:系统文献综述

Wajdi Aljedaani, Rubel Hassan Mollik

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文综述了38篇研究,探讨了大型语言模型在网页可访问性中的应用,发现大多数研究集中在文本导向和结构明确的任务,主要参考WCAG标准,但对认知可访问性指南考虑有限,评估方法多样且缺乏残障用户直接参与。

Comments Accepted at the 23rd International Web for All Conference (W4A 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15034 2026-05-15 cs.CL cs.AI cs.CY cs.MA 91%

AI Knows When It's Being Watched: Functional Strategic Action and Contextual Register Modulation in Large Language Models

AI 知道它在被观察:大型语言模型中的功能性战略行为与情境语境调节

Vinicius Covas, Jorge Alberto Hidalgo Toledo

机构 * Center for Applied Communication Research (CICA)(应用沟通研究中心) Human & NonHuman Communication Laboratory(人类与非人类沟通实验室) Faculty of Communication(传播学院) Universidad Anáhuac México(墨西哥安纳胡阿克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨大型语言模型在感知社会观察情境下是否表现出系统性的语言适应,通过实验发现AI行为对观察者身份敏感,对AI审计系统的影响较小,对AI治理和算法审计有重要启示。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14517 2026-05-15 cs.CL cs.AI 91%

Dimension-Level Intent Fidelity Evaluation for Large Language Models: Evidence from Structured Prompt Ablation

大型语言模型的维度意图保真度评估:基于结构化提示消融的证据

GAng Peng

机构 * Huizhou Lateni AI Technology Co., Ltd.(惠州拉提尼人工智能技术有限公司) Huizhou University(惠州大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出一种维度意图保真度评估框架,通过2880个跨三语言、三任务领域和六种LLM的结构化提示消融研究,分别衡量结构恢复和意图保真度,揭示了系统性的结构保真度分裂,并证明了维度保真度评分比整体评分更可靠。

Comments Preprint. 30 tasks, 3 languages, 6 LLMs, 2,880 outputs; includes human evaluation and structured prompt ablation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14635 2026-05-15 cs.CV cs.AI 90%

MultiEmo-Bench: Multi-label Visual Emotion Analysis for Multi-modal Large Language Models

MultiEmo-Bench:多标签视觉情绪分析用于多模态大语言模型

Tianwei Chen, Takuya Furusawa, Yuki Hirakawa, Ryotaro Shimizu, Mo Fan, Takashi Wada

机构 * ZOZO NEXT Inc.(ZOZO NEXT公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一个多标签视觉情绪分析基准数据集,用于评估多模态大语言模型对图像引发情绪的预测能力。通过改进标注方案,提供更可靠的数据集,并评估了多个模型在情绪预测上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26100 2026-05-15 cs.AI 90%

AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models

AgenticEval: 向大型语言模型的代理和自演化安全评估迈进

Yixu Wang, Xin Wang, Yang Yao, Xinyuan Li, Xibang Yang, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The University of Hong Kong(香港大学) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.AI

AI总结 本文提出AgenticEval框架,通过自演化评估流程动态检测LLM安全风险,实验显示模型安全评分随评估强化而下降,揭示静态评估的局限性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08584 2026-05-15 cs.CL 90%

CounselBench: A Large-Scale Expert Evaluation and Adversarial Benchmarking of Large Language Models in Mental Health Question Answering

CounselBench: 一个大规模专家评估和对抗性基准测试,用于评估大型语言模型在心理健康问答中的表现

Yahan Li, Jifan Yao, John Bosco S. Bunyi, Adam C. Frank, Angel Hsing-Chi Hwang, Ruishan Liu

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系) Department of Electrical and Computer Engineering, University of Southern California(南加州大学电气与计算机工程系) Suzanne Dworak-Peck School of Social Work, University of Southern California(南加州大学苏兹安·德沃拉克-佩克社会工作学院) Department of Psychiatry and the Behavioral Sciences, University of Southern California(南加州大学精神病学与行为科学系) Annenberg School for Communication, University of Southern California(南加州大学安纳伯格通信学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 CounselBench通过100名心理健康专家评估GPT-4、LLaMA 3等模型在真实求助场景中的表现,揭示其在临床敏感性和安全风险方面的不足,并通过对抗性数据集深入分析模型失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14744 2026-05-15 cs.CL cs.AI cs.CY 90%

Mechanical Enforcement for LLM Governance:Evidence of Governance-Task Decoupling in Financial Decision Systems

针对LLM治理的机械执行:在金融决策系统中治理-任务解耦的证据

José Manuel de la Chica Rodríguez, Carlos Martí-González

机构 * Santander AI Lab(Santander AI实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出五种治理指标,用于评估政策在决策理由层面的合规性,并在合成银行领域比较纯文本治理与机械执行的效果,发现机械执行能显著提升决策信息内容和任务准确性,表明治理与任务评估是两个独立的维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14543 2026-05-15 cs.LG cs.AI 90%

RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation

RxEval: 一个处方级基准,用于评估LLM药物推荐

Shuhao Chen, Weisen Jiang, Changmiao Wang, Xiaoqing Wu, Xuanren Shi, Yu Zhang, James T. Kwok

机构 * The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) Shenzhen University General Hospital(深圳大学人民医院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 RxEval通过多选题评估LLM处方能力,包含1547个问题,涵盖584名患者、18种诊断类别和969种药物,测试16个LLM显示其挑战性和区分性,F1值从45.18到77.10,最佳精确匹配仅46.10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08522 2026-05-15 cs.CL 90%

Coordinates of Capability: A Unified MTMM-Geometric Framework for LLM Evaluation

能力坐标:一种统一的MTMM-几何框架用于LLM评估

Adib Sakhawat, Tahsin Islam, Takia Farhin, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种统一的MTMM-几何框架,将九种评估指标统一到共享的潜在坐标空间中,通过三个正交维度分析模型能力,提供稳健且经验稳定的基准设计方法。

Comments The paper has mistake of undertaking political spaces to semantic dimensions. This needs to be removed because this is a fetal flaw in consideration. The initial hypothesis and premise needs to be rigorously formulated within the political landscape not generalizing the metrics. Hence a withdrawal for now is necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24586 2026-05-15 cs.SE cs.CL 90%

Comparing Developer and LLM Biases in Code Evaluation

比较开发者与LLM在代码评估中的偏见

Aditya Mittal, Ryan Shar, Zichu Wu, Shyam Agarwal, Tongshuang Wu, Chris Donahue, Ameet Talwalkar, Wayne Chi, Valerie Chen

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出TRACE框架,评估LLM在代码评估中的偏见,发现LLM在与开发者偏好对齐方面表现不佳,揭示了人类与模型在代码质量标准上的系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03630 2026-05-15 cs.CL 90%

Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases

推理模型优于LLM-判官,但存在偏见

Hui Huang, Xuanxin Wu, Muyun Yang, Yuki Arase

机构 * Institute of Science Tokyo(东京科学研究院) Harbin Institute of Technology(哈尔滨工业大学) The University of Osaka(大阪大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文系统比较了推理模型在判断任务中的表现,发现其在准确性、指令遵循和抗攻击能力上优于非推理LLM,但存在显著偏见,提出PlanJudge策略以缓解偏见问题。

Comments Accepted by ACL 2026 Workshop EvalEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14312 2026-05-15 cs.SE 89%

Making OpenAPI Documentation Agent-Ready: Detecting Documentation and REST Smells with a Multi-Agent LLM System

使OpenAPI文档具备代理准备性:利用多代理LLM系统检测文档和REST气味

Rayfran Rocha Lima, Davi G. Assunção Pinheiro, Thiago Medeiros de Menezes

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 研究通过多代理LLM系统检测OpenAPI文档和REST相关问题,发现2450个气味,揭示微服务环境中结构有效性不保证语义准备性,推动API治理流程改进。

Comments 10 pages. Accepted in EASE 2026, 9-12 June 2026, Glasgow, Scotland, United Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13898 2026-05-15 cs.SE 89%

Bidirectional Empowerment of Metamorphic Testing and Large Language Models: A Systematic Survey

双向赋能:变形测试与大语言模型的相互促进:系统综述

Zheng Zheng, Zenghui Zhou, Yinwang Xu, Daixu Ren, Tsong Yueh Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文系统综述了93项研究,探讨变形测试与大语言模型之间的双向赋能关系,提出分类框架,分析其在验证、评估和自动化测试中的应用。

Comments Daixu Ren is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10346 2026-05-15 cs.CL cs.LG 88%

Geometry-Aware Decoding with Wasserstein-Regularized Truncation and Mass Penalties for Large Language Models

具有Wasserstein正则化截断和质量惩罚的几何感知解码

Arash Gholami Davoodi, Navid Rezazadeh, Seyed Pouyan Mousavi Davoudi, Pouya Pezeshkpour

机构 * Carnegie Mellon University(卡内基梅隆大学) Megagon Labs(Megagon实验室) University of California, Irvine(加州大学伊文斯顿分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Top-W解码方法,通过Wasserstein距离保持token嵌入空间几何特性,平衡概率质量与熵,提升大语言模型生成质量与创造力。

Comments 20 pages, 3 figures, 8 tables, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12034 2026-05-15 cs.SE cs.CR 88%

OpDiffer: LLM-Assisted Opcode-Level Differential Testing of Ethereum Virtual Machine

OpDiffer:基于LLM的以太坊虚拟机指令级差分测试

Jie Ma, Ningyu He, Jinwen Xi, Mingzhe Xing, Haoyu Wang, Ying Gao, Yinliang Yue

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 OpDiffer利用LLM和静态分析方法,针对EVM安全测试中的输入多样性不足和无法自动定位bug问题,提出指令级差分测试框架,发现26个未知bug,提升代码覆盖率达71.06%等。

Comments To appear in ISSTA'25

Journal ref Proc. ACM Softw. Eng. 2, ISSTA, Article ISSTA069 (2025), 1559-1582

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05465 2026-05-15 cs.CL 88%

Small Language Models (SLMs) Can Still Pack a Punch: A survey (updated 2026)

小型语言模型 (SLMs) 仍能大放异彩:一篇综述(更新 2026)

Akanksha Gupta, Bijo Thomas, Harshita Asnani, Phanindra Reddy Madduru, Samia Feroze, Shreyas Subramanian, Vikram Elango, Mecit Gungor

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

AI总结 本文综述了160篇论文,探讨小型语言模型在1-80亿参数范围内如何在性能、效率、可扩展性和成本之间取得平衡,展示小型模型可媲美甚至超越大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23023 2026-05-15 cs.AI 88%

Deceive, Detect, and Disclose: Large Language Models Play Mini-Mafia

欺骗、检测与揭露:大型语言模型扮演迷你黑帮

Davi Bastos Costa, Renato Vicente

机构 * TELUS Digital Research Hub(TELUS数字研究中心) Center for Artificial Intelligence and Machine Learning(人工智能与机器学习中心) Institute of Mathematics, Statistics and Computer Science(数学、统计与计算机科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出迷你黑帮游戏,通过分析语言模型在社交推理中的表现,揭示了模型在欺骗、检测和揭露能力上的差异,并展示了其作为评估语言模型交互能力的基准。

Comments Adds a validation section for the theoretical model and restructures the presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07509 2026-05-15 cs.SE 88%

MASPrism: Lightweight Failure Attribution for Multi-Agent Systems Using Prefill-Stage Signals

MASPrism:基于预填充阶段信号的轻量级多智能体系统故障归因

Yang Liu, Hongjiang Feng, Junsong Pu, Zhuangbin Chen

专题命中 评测与基准 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);language model(abstract);small language model(abstract)

AI总结 本文提出MASPrism,通过预填充阶段信号实现多智能体系统故障归因,利用小型语言模型提取负对数似然和注意力权重,提升故障源识别效率,实验显示在Who&When和TRAIL数据集上性能优异,速度提升显著。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14537 2026-05-15 cs.AI 87%

Cattle Trade: A Multi-Agent Benchmark for LLM Bluffing, Bidding, and Bargaining

牛市交易:一种多智能体基准,用于评估大语言模型在战略推理、对抗互动和资源约束下的表现

Robert Müller, Clemens Müller

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Cattle Trade基准,用于评估大语言模型在多智能体经济游戏中整合战略推理、对抗互动和资源分配的能力,揭示了智能体在资源管理与对抗策略中的表现差异。

Comments malgai workshop at iclr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14153 2026-05-15 cs.CR cs.AI 87%

ExploitBench: A Capability Ladder Benchmark for LLM Cybersecurity Agents

ExploitBench: 一个用于LLM网络安全代理的能力阶梯基准

Seunghyun Lee, David Brumley

机构 * Carnegie Mellon University(卡内基梅隆大学) Bugcrowd

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 ExploitBench通过16个可测量标志分解exploitation过程,评估模型在网络安全任务中的能力差异,揭示了公开部署模型与私有模型在exploitation能力上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13940 2026-05-15 cs.CR cs.AI 86%

AgentTrap: Measuring Runtime Trust Failures in Third-Party Agent Skills

AgentTrap: 评估LLM代理在第三方技能中抵御恶意运行行为的能力

Haomin Zhuang, Hanwen Xing, Yujun Zhou, Yuchen Ma, Yue Huang, Yili Shen, Yufei Han, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) University of Southern California(南加州大学) LMU Munich(慕尼黑大学) Inria, France(法国国家信息与自动化技术研究院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 AgentTrap通过141个任务评估LLM代理在使用第三方技能时抵御恶意行为的能力,发现最关键的失败并非简单劫持,而是模型在完成用户任务时将不安全副作用视为正常流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15015 2026-05-15 cs.AI cs.CL cs.HC 86%

Small, Private Language Models as Teammates for Educational Assessment Design

小型私有语言模型作为教育评估设计的队友

Chris Davis Jaldi, Anmol Saini, Shan Zhang, Noah Schroeder, Cogan Shimizu, Eleni Ilkou

机构 * Wright State University(怀特州立大学) University of Florida(佛罗里达大学) TIB – Leibniz Information Centre for Science and Technology(莱布尼茨信息科学与技术研究中心)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究小型语言模型在教育评估设计中的有效性,通过对比大型语言模型和小型语言模型,评估生成质量并分析可靠性,发现小型模型在隐私和资源限制下表现优异,但模型评估仍存在系统性偏差,强调需引入人类在循环机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14679 2026-05-15 cs.CL cs.AI 86%

AI-assisted cultural heritage dissemination: Comparing NMT and glossary-augmented LLM translation in rock art documents

人工智能辅助文化遗产传播:比较NMT和术语增强大语言模型在岩画文档中的翻译

Vicent Briva-Iglesias, María Ferre-Fernández

机构 * Dublin City University(都柏林城市大学) CTTS(文化传承研究所) ADAPT Centre(适应中心) SALIS Universidad de Almería(阿尔梅里亚大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文比较了NMT和术语增强大语言模型在岩画文档翻译中的表现,发现术语增强方法在术语准确性上更优,且在保持整体质量方面表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14120 2026-05-15 cs.LG cs.CL 86%

Mini-JEPA Foundation Model Fleet Enables Agentic Hydrologic Intelligence

Mini-JEPA基础模型舰队实现智能水文智能

Mashrekur Rahman

机构 * Dartmouth Libraries, Dartmouth College(达特茅斯图书馆,达特茅斯大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出Mini-JEPA基础模型舰队,通过路由代理为特定问题选择传感器,提升水文分析精度,实验显示其在土壤湿度、干旱和降水预测中优于AlphaEarth。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14932 2026-05-15 cs.CR 86%

Toward Securing AI Agents Like Operating Systems

向操作系统一样安全地保护AI代理

Lukas Pirch, Micha Horlboge, Patrick Großmann, Syeda Mahnur Asif, Klim Kireev, Thorsten Holz, Konrad Rieck

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过操作系统视角研究LLM代理的安全性,分析了现有开源代理的攻击面,并提出安全设计建议。

Comments 17 pages, under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12772 2026-05-15 cs.MM cs.CV 86%

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

JointAVBench: 一个用于联合音频视觉推理评估的基准测试

Jianghan Chao, Jianzhang Gao, Wenhui Tan, Yuchong Sun, Ruihua Song, Liyun Ru

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学香樟人工智能学院) Baichuan Inc(百川科技)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文提出JointAVBench基准测试,旨在评估多模态大语言模型在联合音频视觉推理中的表现,涵盖多模态依赖、多类音频信息和不同场景跨度,通过自动化流程生成问题并评估不同模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14761 2026-05-15 cs.AI cs.HC 85%

AI Outperforms Humans in Personalized Image Aesthetics Assessment via LLM-Based Interviews and Semantic Feature Extraction

人工智能在基于大语言模型的访谈和语义特征提取的个性化图像审美评估中胜过人类

Yoshia Abe, Tatsuya Daikoku, Yasuo Kuniyoshi

机构 * Graduate School of Information Science and Technology(信息科学与技术研究生院) The University of Tokyo(东京大学) Bunkyo-ku, Tokyo(东京都文京区)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合深度学习与大语言模型的系统,通过语义特征提取和主动收集偏好信息,准确预测个体图像审美评价,实验表明该系统在高评分图像上表现优异,优于人类预测者和自身再评估。

Comments 25 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏