arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-01 至 2026-04-01 共收录 62 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 62 篇

2603.28769 2026-04-01 cs.DC cs.CL cs.LG 92%

Spark-LLM-Eval: A Distributed Framework for Statistically Rigorous Large Language Model Evaluation

Spark-LLM-Eval: 一个用于统计严谨大语言模型评估的分布式框架

Subhadip Mitra

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Spark-LLM-Eval,一个基于Apache Spark的分布式评估框架,通过数据并行处理实现大规模LLM评估,强调统计严谨性,提供置信区间和显著性检验,并利用Delta Lake实现响应缓存以降低评估成本。

Comments 16 pages, 2 figures, 6 tables. Open source: https://github.com/bassrehab/spark-llm-eval. Cross-list requested: cs.CL, cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04472 2026-04-01 cs.IR cs.AI cs.CL cs.LG 90%

EventChat: Implementation and user-centric evaluation of a large language model-driven conversational recommender system for exploring leisure events in an SME context

EventChat: 一种基于大语言模型的对话推荐系统在中小企业休闲活动探索中的实现与用户导向评估

Hannes Kunstmann, Joseph Ollier, Joel Persson, Florian von Wangenheim

机构 * Swiss Federal Institute of Technology, Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于大语言模型的对话推荐系统,通过客观指标和用户评价评估其在中小企业场景下的性能,揭示了系统在用户体验和商业可行性方面的挑战。

Comments Just accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29846 2026-04-01 cs.CL 89%

SNEAK: Evaluating Strategic Communication and Information Leakage in Large Language Models

SNEAK:评估大语言模型中的战略沟通与信息泄露

Adar Avsian, Larry Heck

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 SNEAK通过模拟盟友和间谍两种角色,评估语言模型在信息共享与保密之间的平衡能力,发现当前系统在非对称信息下的战略沟通仍存在挑战,人类表现显著优于模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09082 2026-04-01 cs.CV cs.AI cs.LG 89%

AVA-Bench: Atomic Visual Ability Benchmark for Vision Foundation Models

AVA-Bench:用于视觉基础模型的原子视觉能力基准

Zheda Mai, Arpita Chowdhury, Zihe Wang, Sooyoung Jeon, Lemeng Wang, Jiacheng Hou, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Adobe Research(Adobe研究院) Boston University(波士顿大学)

专题命中 评测与基准 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 AVA-Bench通过解耦14种原子视觉能力,揭示视觉基础模型的性能差异,提升模型选择的科学性与效率。

Comments Accepted by CVPR 2026. The first two authors contribute equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15738 2026-04-01 cs.NE 89%

EvoDR: Evolving Dispatching Rules via Large Language Model for Dynamic Flexible Assembly Flow Shop Scheduling

EvoDR:基于大语言模型的动态柔性装配流水车间调度的进化调度规则

Junhao Qiu, Haoyang Zhuang, Fei Liu, Jianjun Liu, Qingfu Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出EvoDR框架,利用大语言模型的语义理解能力,通过双专家共演化机制生成适应动态特征的调度规则,实验表明其在降低平均延误和鲁棒性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28972 2026-04-01 cs.CR cs.AI 89%

Privacy Guard & Token Parsimony by Prompt and Context Handling and LLM Routing

通过提示和上下文处理及LLM路由实现隐私保护与令牌节约

Alessio Langiu

机构 * National Research Council of Italy - Institute of Marine Sciences (CNR-ISMAR)(意大利国家研究委员会海洋科学研究所(CNR-ISMAR))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出隐私守护机制,结合上下文管理和LLM路由,通过自动提示优化减少云服务成本和敏感信息泄露风险,实验证明在隐私保护与成本节约之间取得平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29497 2026-04-01 cs.CL 88%

Distilling Human-Aligned Privacy Sensitivity Assessment from Large Language Models

从大语言模型中提炼人类对齐的隐私敏感性评估

Gabriel Loiseau, Damien Sileo, Damien Riquet, Maxime Meyer, Marc Tommasi

机构 * Hornetsecurity Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学、法国国家信息与自动化研究所、法国国家科学研究中心、中央理工-里尔高等电力学院,UMR 9189 - CRIStAL)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出通过轻量级编码器模型提炼大语言模型的隐私评估能力,降低计算成本并验证其在去标识化系统中的实用性。

Comments Accepted to the LREC CALD-pseudo 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29288 2026-04-01 cs.CY cs.AI cs.CL cs.HC cs.SI 86%

Sima AIunty: Caste Audit in LLM-Driven Matchmaking

Sima AIunty: LLM驱动的匹配中阶级审计

Atharva Naik, Shounok Kar, Varnika Sharma, Ashwin Rajadesingan, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过实世界婚姻资料审计LLM在匹配中的阶级偏见,发现同阶级匹配评分更高,揭示现有阶级体系在AI决策中的再现,需制定文化导向的评估与干预策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29112 2026-04-01 cs.AI cs.CL 86%

GISTBench: Evaluating LLM User Understanding via Evidence-Based Interest Verification

GISTBench:通过证据基础的兴趣验证评估大语言模型的用户理解能力

Iordanis Fostiropoulos, Muhammad Rafay Azhar, Abdalaziz Sawwan, Boyu Fang, Yuchen Liu, Jiayi Liu, Hanchao Yu, Qi Guo, Jianyu Wang, Fei Liu, Xiangjun Fan

机构 * Meta Recommendation Systems (MRS)(Meta推荐系统(MRS))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 GISTBench通过证据基础的兴趣验证评估大语言模型在推荐系统中理解用户的能力,提出两种新指标并验证了合成数据集的准确性。

Comments 9 figures, 20 tables; code at https://github.com/facebookresearch/GISTBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00314 2026-04-01 cs.CL cs.AI 86%

When Metrics Disagree: Automatic Similarity vs. LLM-as-a-Judge for Clinical Dialogue Evaluation

当度量标准产生分歧:自动相似性与LLM作为评判者在临床对话评估中的对比

Bian Sun, Zhenjian Wang, Orvill de la Torre, Zirui Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在临床对话评估中,LLM作为评判者与传统自动相似性度量之间的分歧,通过LoRA技术对Llama-2-7B进行领域适应,并发现自动化指标可能无法完全反映临床实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10780 2026-04-01 cs.CL cs.LG 86%

Script Gap: Evaluating LLM Triage on Indian Languages in Native vs Romanized Scripts in a Real World Setting

脚本间隙:在真实世界环境中评估LLM在印度语言本土脚本与罗马化脚本上的三线分类

Manurag Khullar, Utkarsh Desai, Poorva Malviya, Aman Dalmia, Zheyuan Ryan Shi

机构 * School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM在印度语言及尼泊尔语的本土脚本与罗马化脚本在真实世界中的三线分类可靠性,发现罗马化文本导致性能下降达24分,并提出基于不确定性的选择路由方法以缩小脚本差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29559 2026-04-01 cs.CL cs.CY 85%

When Can We Trust LLM Graders? Calibrating Confidence for Automated Assessment

当我们可以信任LLM评分者?校准自动评估的置信度

Robinson Ferrer, Damla Turgut, Zhongzhou Chen, Shashank Sonkar

机构 * University of Central Florida(中佛罗里达大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了如何通过校准LLM评分器的置信度来提高自动评估的可靠性,比较了三种置信度估计方法在不同规模的LLM上的表现,发现自报置信度在所有条件下均表现最佳,且大模型在不同数据集上具有更好的校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29517 2026-04-01 cs.CL 85%

LLM Probe: Evaluating LLMs for Low-Resource Languages

LLM Probe:评估低资源语言的大型语言模型

Hailay Kidu Teklehaymanot, Gebrearegawi Gebremariam, Wolfgang Nejdl

机构 * L3S Research Center, Leibniz University Hannover(莱布尼茨汉诺威大学L3S研究中心) Aksum University(阿克苏姆大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LLM Probe框架,通过词典基础方法系统评估低资源语言中LLM的语言能力,揭示序列到序列模型在形态语法分析和翻译质量上的优势,以及因果模型在词汇对齐上的表现。

Comments 11 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29217 2026-04-01 eess.AS cs.CL cs.SD 85%

Advancing LLM-based phoneme-to-grapheme for multilingual speech recognition

推进基于大语言模型的音素到字母转换以实现多语言语音识别

Lukuang Dong, Ziwei Li, Saierdaer Yusuyin, Xianyu Zhao, Zhijian Ou

机构 * TasiTech Co., Ltd., China(塔斯科技股份有限公司,中国) Speech Processing and Machine Intelligence (SPMI) Lab, Tsinghua University, China(清华大学语音处理与机器智能(SPMI)实验室,中国) School of Computer Science and Technology, Xinjiang University, China(新疆大学计算机科学与技术学院,中国)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了基于大语言模型的多语言音素到字母转换,通过鲁棒训练和低资源过采样将平均识别错误率从10.56%降至7.66%。

Comments Update after INTERSPEECH2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07204 2026-04-01 cs.AI cs.CY cs.MA 85%

Evaluating Online Moderation Via LLM-Powered Counterfactual Simulations

通过LLM赋能的反事实模拟评估在线 moderation

Giacomo Fidone, Lucia Passaro, Riccardo Guidotti

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的反事实模拟方法,用于评估在线社交网络的 moderation 策略,揭示了社交传染现象及个性化策略的有效性。

Comments Accepted for publication at AAAI Conference on Artificial Intelligence 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29623 2026-04-01 cs.SE 85%

Enhancing LLM-Based Bug Reproduction for Android Apps via Pre-Assessment of Visual Effects

通过预评估视觉效果增强基于LLM的Android应用Bug重现

Xiangyang Xiao, Huaxun Huang, Rongxin Wu

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出LTGDroid,通过执行所有可能的UI操作并记录视觉效果,指导LLM选择重现bug的UI操作,提升Android应用bug重现的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29273 2026-04-01 cs.HC 85%

Customer Analysis and Text Generation for Small Retail Stores Using LLM-Generated Marketing Presence

利用大语言模型生成营销存在的小型零售店客户分析与文本生成

Shiori Nakamura, Masato Kikuchi, Tadachika Ozono

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种人机协作系统,通过模拟人物帮助小型零售店创建更高质量的点售材料,实验显示文本质量平均提升2.37分。

Comments The 17th International Conference on Smart Computing and Artificial Intelligence (SCAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26898 2026-04-01 cs.CL cs.AI cs.LG 85%

Magic Words or Methodical Work? Challenging Conventional Wisdom in LLM-Based Political Text Annotation

魔术词还是方法论工作?挑战基于大语言模型的政治文本标注中的传统智慧

Lorcan McLaren, James Cross, Zuzanna Krakowska, Robin Rauner, Martijn Schoonvelde

机构 * University College Dublin(都柏林大学) University of Groningen(格罗宁根大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过控制实验检验了政治科学文本标注中模型选择、大小、学习方法和提示风格的交互影响,发现方法论主导因素影响显著,传统最佳实践在受控比较中并不稳固。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23067 2026-04-01 cs.CL cs.AI 84%

Semantic Voting: A Self-Evaluation-Free Approach for Efficient LLM Self-Improvement on Unverifiable Open-ended Tasks

语义投票:一种无需自评的高效LLM在不可验证的开放性任务中的自我改进方法

Chunyang Jiang, Yonggang Zhang, Yiyang Cai, Chi-Min Chan, Yulong Liu, Mingming Chen, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种无需自评的语义投票方法,通过软匹配提升LLM在不可验证任务中的效率与性能,减少计算负担和自评偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29848 2026-04-01 cs.AI cs.MA 83%

AgentFixer: From Failure Detection to Fix Recommendations in LLM Agentic Systems

AgentFixer: 从LLM代理系统中故障检测到修复建议

Hadar Mulian, Sergey Zeltyn, Ido Levy, Liane Galanti, Avi Yaeli, Segev Shlomov

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出一个综合验证框架,通过系统诊断和改进可靠性故障,结合轻量规则检查与LLM评估,提升代理系统性能,通过实验展示改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05411 2026-04-01 cs.IR cs.AI 83%

A Systematic Framework for Enterprise Knowledge Retrieval: Leveraging LLM-Generated Metadata to Enhance RAG Systems

企业知识检索的系统框架:利用LLM生成的元数据增强RAG系统

Pranav Pushkar Mishra, Kranti Prakash Yeole, Ramyashree Keshavamurthy, Mokshit Bharat Surana, Fatemeh Sarayloo

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种系统性的元数据增强框架,利用大语言模型提升RAG系统的文档检索性能,通过实验验证元数据增强对检索精度和排名质量的提升效果。

Comments Accepted to 2026 IEEE Conference on Artificial Intelligence (CAI). 8 pages, 1 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01142 2026-04-01 cs.CV 82%

ArtLLM: Generating Articulated Assets via 3D LLM

ArtLLM: 通过3D语言模型生成拟合资产

Penghao Wang, Siyuan Xie, Hongyu Yan, Xianghui Yang, Jingwei Huang, Chunchao Guo, Jiayuan Gu

机构 * ShanghaiTech University(上海科技大学) Tencent Hunyuan(腾讯混元) HKUST(香港科技大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 ArtLLM通过3D语言模型直接从完整3D网格生成高质量拟合资产,解决了传统方法在关节拟合和部分检索中的局限,提升了部分布局和关节预测的准确性。

Comments CVPR 2026. Project page: https://authoritywang.github.io/artllm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29878 2026-04-01 cs.IR cs.AI cs.DC 81%

Performance Evaluation of LLMs in Automated RDF Knowledge Graph Generation

对LLMs在自动RDF知识图谱生成中的性能评估

Ioana Ramona Martin, Tudor Cioara, Ionut Anghel, Gabriel Arcas

机构 * Distributed Systems Research Laboratory, Computer Science Department, Technical University of Cluj-Napoca(克卢日-纳波卡技术大学计算机科学系分布式系统研究实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了多种LLM架构和提示策略在自动RDF提取中的性能,通过控制框架和两个处理半结构化日志数据的管道,分析了Few-Shot学习在生成RDF三元组中的有效性,并揭示了不同LLM架构的局限性。

Comments submitted to journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18014 2026-04-01 cs.CL cs.LG 81%

Real-Time Trustworthiness Scoring for LLM Structured Outputs and Data Extraction

面向LLM结构化输出的实时可信度评分及数据提取

Hui Wen Goh, Jonas Mueller

机构 * Cleanlab

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出CONSTRUCT,一种实时评估LLM结构化输出可信度的方法,通过评分帮助优先处理人类审核,支持复杂结构化输出,无需标注数据或定制模型部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23364 2026-04-01 cs.LG cs.AI 81%

ZeroFlood: Flood Hazard Mapping from Single-Modality SAR Using Geo-Foundation Models

ZeroFlood:基于单一模态SAR数据的洪水危险映射Geo-基础模型

Hyeongkyun Kim, Orestis Oikonomou

机构 * German Aerospace Center (DLR), Remote Sensing Technology Institute(德国航空航天中心(DLR)遥感技术研究所) ETH Zurich, Seminar for Applied Mathematics(苏黎世联邦理工学院应用数学研讨会) ETH AI Center(苏黎世联邦理工学院人工智能中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ZeroFlood框架,利用Geo-Foundation Models对单一模态EO数据进行洪水危险映射,实验表明TerraMind模型在F1-score上达到88.36%,优于监督学习基线。

Comments 16th European Conference on Synthetic Aperture Radar

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29281 2026-04-01 cs.CV cs.AI cs.RO 79%

PRISM: A Multi-View Multi-Capability Retail Video Dataset for Embodied Vision-Language Models

PRISM:一个多视角多能力零售视频数据集用于具身视觉-语言模型

Amirreza Rouhi, Parikshit Sakurikar, Satya Sai Reddy, Narsimha Menga, Anirudh Govil, Sri Harsha Chittajallu, Rajat Aggarwal, Anoop Namboodiri, Sashi Reddi

机构 * DreamVu

专题命中 评测与基准 :language model(title);SFT(abstract);分类 cs.AI

AI总结 PRISM是首个针对真实世界零售环境的多视角多能力视频数据集,通过领域特定的SFT训练提升具身视觉-语言模型的感知能力与空间理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27942 2026-04-01 cs.CV cs.AI 79%

JaWildText: A Benchmark for Vision-Language Models on Japanese Scene Text Understanding

JaWildText:面向日文场景文本理解的视觉-语言模型基准测试

Koki Maeda, Naoaki Okazaki

机构 * Institute of Science Tokyo, Tokyo, Japan(东京科学大学,日本东京) Research and Development Center for Large Language Models, National Institute of Informatics, Tokyo, Japan(国立信息学研究所大型语言模型研发中心,日本东京)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出JaWildText基准测试,针对日文场景文本理解中的多脚本、垂直书写和字符多样性问题,包含3241个实例和112万字符标注,涵盖STVQA、KIE和手写OCR三个任务,评估14种VLM模型,发现最佳模型在三个任务上的平均得分为0.64。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29467 2026-04-01 cs.CL cs.AI 79%

M-MiniGPT4: Multilingual VLLM Alignment via Translated Data

M-MiniGPT4:通过翻译数据实现多语言VLLM对齐

Seung Hun Han, Youssef Mohamed, Mohamed Elhoseiny

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) KAUST(阿卜杜拉国王科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出M-MiniGPT4多语言视觉大语言模型,通过混合原生多语言和翻译数据提升MiniGPT4的多语言视觉理解能力,并引入多语言对齐训练阶段,使模型在多语言MMMU基准测试中达到36%的准确率。

Comments 6 pages, ACL 2026, Proceedings of the 7th Workshop on African Natural Language Processing (AfricaNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17899 2026-04-01 cs.LG cs.AI cs.NE 79%

Automated Algorithm Design for Auto-Tuning Optimizers

为自动调优优化器设计自动化算法

Floris-Jan Willemsen, Niki van Stein, Ben van Werkhoven

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出利用大语言模型自动生成适应自动调优问题的优化算法,通过问题描述和搜索空间特征提示模型,生成、测试并迭代改进专用优化器,在六个硬件平台上评估后,展示出30.7%和14.6%的性能提升,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08917 2026-04-01 cs.HC cs.CV 78%

"It's trained by non-disabled people": Evaluating How Image Quality Affects Product Captioning with Vision-Language Models

由非残障人士训练的模型:评估图像质量如何影响产品描述生成

Kapil Garg, Xinru Tang, Jimin Heo, Dwayne R. Morgan, Darren Gergle, Erik B. Sudderth, Anne Marie Piper

机构 * University of California, Irvine(加州大学尔湾分校) Northwestern University(西北大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究评估图像质量对视觉语言模型生成产品描述准确性的影响,发现图像质量下降会导致模型性能显著降低,提出改进模型可靠性的建议。

Comments Published at CHI 2026; Honorable Mention for Best Paper (Top 5%). Dataset available at: https://github.com/Accessibility-Research-Collective-UCI/image-quality-vlm-chi26

详情

展开后加载摘要…

URL PDF HTML 收藏