arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-05 至 2026-06-05 共收录 383 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 96 篇

2606.05249 2026-06-05 cs.SE 89%

SWE-InfraBench: Evaluating Language Models on Cloud Infrastructure Code

SWE-InfraBench:评估语言模型在云基础设施代码上的表现

Natalia Tarasova, Enrique Balp-Straffon, Aleksei Iancheruk, Yevhenii Sielskyi, Nikita Kozodoi, Liam H. Byrne, Jack Butler, Dayuan Jiang, Marcin Czelej, Andrew Ang, Yash Shah, Roi Blanco, Sergei Ivanov

专题命中 评测与基准 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract)

AI总结 提出SWE-InfraBench基准,通过AWS CDK仓库中的真实代码修改任务评估LLM在云基础设施即代码(IaC)上的能力,发现当前最先进模型成功率仅34%。

Comments Accepted to NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05486 2026-06-05 cs.CL cs.LG 88%

Localizing Prompt Ambiguity in Large Language Models with Probe-Targeted Attribution

通过探针目标归因定位大型语言模型中的提示歧义

Govind Ramesh, Yao Dou, Wei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出PRIG方法,利用线性探针和梯度归因,通过中间表示而非输出层定位提示中的歧义位置,在合成和人工基准上取得高AUROC。

Comments 23 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26046 2026-06-05 cs.CL cs.AI cs.LG cs.MA cs.SE 88%

When Gradients Collide: Failure Modes of Multi-Objective Prompt Optimization for LLM Judges

当梯度冲突时:多目标提示优化用于LLM评判器的失败模式

Parth Darshan, Abhishek Divekar

机构 * IIT Jodhpur(印度理工学院乔普里尔) Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多目标文本梯度优化中梯度稀释和指令干扰两种失败模式,通过分解优化器信息共享方式揭示性能下降原因。

Comments Accepted at ACL 2026 - CustomNLP4U Workshop. Code, prompts and data available at https://github.com/adivekar-utexas/when-gradients-collide

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05874 2026-06-05 cs.CL 88%

Evaluating Stochastic Collapse and Implicit Bias in Multimodal Large Language Models

评估多模态大语言模型中的随机坍缩与隐式偏差

Huiyuan Zheng, Houtao Zhang, Boyang Wang, Qingyi Si, Hongcheng Guo

机构 * Fudan University(复旦大学) Beihang University(北航) JD.com(京东)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出RandomBench基准测试,通过熵和分布偏差指标揭示多模态大语言模型在逻辑中性场景下存在随机坍缩现象,即无法维持均匀随机性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05697 2026-06-05 cs.AI 87%

PerceptUI: LLM Agents as Human-Aligned Synthetic Users for UI/UX Evaluation

PerceptUI: 用于UI/UX评估的与人类对齐的合成用户的LLM智能体

Nicolas Bougie, Xiaotong Ye, Gian Maria Marconi, Narimasa Watanabe

机构 * Woven by Toyota(丰田 woven)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PerceptUI框架,通过对比反思微调和反思式提示进化,使多模态大语言模型能够模拟特定用户对界面问题的回答,实现与人类水平相当的UI/UX评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05670 2026-06-05 cs.AI 87%

Do More Agents Help? Controlled and Protocol-Aligned Evaluation of LLM Agent Workflows

更多智能体有帮助吗?LLM智能体工作流的受控与协议对齐评估

Yuhang Fu, Ruishan Fang, Jiaqi Shao, Huiyu Zheng, Zhengtao Zhu, Bing Luo, Tao Lin

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Westlake University(西湖大学) Zhejiang University(浙江大学) Duke Kunshan University(杜克大学昆山分校) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University of Technology(浙江工业大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出BenchAgent框架,在统一协议下比较单智能体、固定多智能体和演化多智能体工作流,发现大多数多智能体系统在准确率上未超越单智能体基线,但运行时生成的工作流在GAIA上表现优异。

Comments https://github.com/LINs-lab/MASArena/tree/BenchAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25256 2026-06-05 cs.AI 87%

Whose Alignment? Comparing LLM Process Alignment Across Diverse Organizational Decision Contexts

谁的对齐?比较不同组织决策情境下的大语言模型过程对齐

Niklas Weller, Emilio Barkett

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 本文提出一种决策策略捕获方法测量过程对齐,发现LLM在ECHR第6条决策中过程对齐与输出准确性高度相关,但在德国消费信贷决策中关系消失,揭示了多元对齐挑战。

Comments Accepted to Pluralistic Alignment Workshop @ ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03555 2026-06-05 cs.MA cs.AI cs.SI 87%

Benchmarking Emergent Coordination in Large-Scale LLM Populations: An Evaluation Framework on the MoltBook Archive

在大规模大语言模型群体中评估涌现协调:对MoltBook档案库的评估框架

Brandon Yee, Pairie Koh

机构 * Management Lab, Yee Collins Research Group(Yee Collins研究组管理实验室)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种评估框架,用于在开放代理环境中评估角色专业化、信息扩散和协作任务解决的涌现协调,通过MoltBook档案库的数据集展示了该框架,并建立了量化基准,揭示了核心-外围结构、重尾级联分布和去中心化任务解决中的严重协调开销。

Comments Substantial Revision Required

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00460 2026-06-05 cs.CL 87%

Pitfalls of Evaluating Language Models with Open Benchmarks

使用开放基准评估语言模型的陷阱

Md. Najib Hasan, Md Mahadi Hassan Sibat, Mohammad Fakhruddin Babar, Souvika Sarkar, Monowar Hasan, Santu Karmaker

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 本文探讨了使用开放基准评估语言模型时存在的数据泄露风险,并通过构建作弊模型验证了这种风险,指出开放基准可能无法反映实际应用效果,需补充私有或动态生成的基准以维持评估的完整性。

Comments After further review, we found that the core contribution and methodology substantially overlap with previously published work. As a result, the manuscript does not provide a sufficiently distinct or original contribution in its current form. To avoid repetition in the literature and prevent possible confusion for readers, we believe withdrawal is the most appropriate action

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14291 2026-06-05 cs.LG stat.ML 87%

Advances in Temporal Point Processes: Bayesian, Neural, and LLM Approaches

时间点过程的进展:贝叶斯、神经网络和大语言模型方法

Feng Zhou, Quyu Kong, Jie Qiao, Cheng Wan, Yixuan Zhang, Ruichu Cai

机构 * Center for Applied Statistics and School of Statistics, Renmin University of China(应用统计中心和中国人民大学统计学院) Independent Researcher(独立研究者) School of Computer Science, Guangdong University of Technology(广东工业大学计算机学院) School of Statistics and Data Science, Southeast University(东南大学统计与数据科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文综述了时间点过程的最新研究,从贝叶斯、深度学习和大语言模型三个角度探讨了模型设计、参数估计以及经典应用领域,并展望了未来的研究挑战和方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06286 2026-06-05 cs.CL cs.AI 87%

LLMs Can Leak Training Data But Do They Want To? A Propensity-Aware Evaluation of Memorization in LLMs

LLMs 可能泄露训练数据,但它们愿意吗?一种基于倾向性的 LLM 记忆评估

Gianluca Barmina, Peter Schneider-Kamp, Lukas Galke Poech

机构 * University of Southern Denmark(南部丹麦大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出 PropMe 框架,通过对比前缀攻击与非对抗评估,揭示 LLM 在非对抗设置下很少泄露训练数据,并引入 SimpleTrace 流水线进行归因和度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06271 2026-06-05 cs.CL cs.HC 86%

FOXGLOVE: Understanding Goal-Oriented and Anchored Writing Feedback from Experts and LLMs on Argumentative Essays

FOXGLOVE: 理解专家与LLM在议论文中的目标导向和锚定写作反馈

Yijun Liu, Yifan Song, John Gallagher, Sarah Sterman, Tal August

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过构建FOXGLOVE数据集,系统比较了写作专家和大型语言模型在议论文反馈中的目标导向、锚定性和优先级,发现两者在反馈目标和位置分布上相似,但在具体句子选择和反馈复杂度上存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18937 2026-06-05 cs.AI 86%

Evaluating the Utility of Personal Health Records in Personalized Health AI

评估个人健康记录在个性化健康AI中的效用

Rory Sayres, Kejia Chen, Ayush Jain, Matthew Thompson, Jonathan Richina, Xiang Yin, Jimmy Hu, Fan Zhang, Bob Lou, Mike Sanchez, Ines Mezerreg, Meredith Schreier, Hamsa Subramaniam, I-Ching Lee, Yugang Jia, Daniel Mcduff, Yossi Matias, Avinatan Hassidim, Dale Webster, Yun Liu, Jackie Barr, Quang Duong

机构 * Google Research(谷歌研究)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了利用个人健康记录(PHR)中的临床数据通过大语言模型(LLM)回答用户健康问题的效用,发现提供PHR上下文能显著提高回答的有用性、安全性和个性化水平,并揭示了LLM在理解复杂PHR方面的不足。

Comments 35 pages, 3 figures, 10 tables [bugfix / minor numerical update]

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06031 2026-06-05 cs.CL 85%

NAVIRA: Decoupled Stochastic Remasking for Masked Diffusion Language Models

NAVIRA: 解耦随机重掩码用于掩码扩散语言模型

Andrey Fomenko, Maksim Kryzhanovskiy, Svetlana Glazyrina, Roman Ischenko

机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫莫斯科国立大学) Institute for Artificial Intelligence(人工智能研究所)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对掩码扩散语言模型并行生成中的上下文污染问题,提出NAVIRA解码策略,通过解耦质量检测与重生成、随机采样重掩码位置,提升流畅性和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04135 2026-06-05 cs.CY cs.AI cs.CL 85%

Frontier Lag: A Bibliometric Audit of Capability Misrepresentation in Academic AI Evaluation

前沿滞后:学术AI评估中能力误述的文献计量审计

David Gringras, Misha Salahshoor

机构 * Harvard University(哈佛大学) AISST

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 通过审计112,303篇LLM相关论文,发现中位论文评估的模型落后同期前沿10.85 ECI(约1.4倍Claude Sonnet 3.7与Claude Opus 4.5的差距),且差距以每年5.53 ECI扩大,仅3.2%的摘要披露推理模式状态,52.5%的结论将结果泛化为“AI”,并提出VERSIO-AI检查表等补救措施。

Comments v2. 65 pp, 9 figs, 8 tables, 8 appendices. Pre-registered on OSF: doi.org/10.17605/OSF.IO/7XM3D. Code+data: doi.org/10.5281/zenodo.20060457. VERSIO-AI v1.2 reporting checklist (Appendix A): doi.org/10.5281/zenodo.20060459. frontierlag package + per-DOI audit tool: frontierlag.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10875 2026-06-05 cs.CL cs.AI cs.LG 85%

A Survey on Diffusion Language Models

扩散语言模型的综述

Tianyi Li, Mingda Chen, Bowei Guo, Zhiqiang Shen

机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(维拉实验室,穆罕默德·本·扎耶德人工智能大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 评测与基准 :language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了扩散语言模型的发展现状,探讨了其与自回归模型和掩码语言模型的关系,分析了预训练策略、后训练方法以及推理优化技术,并讨论了多模态扩展、应用场景、局限性及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05716 2026-06-05 cs.CL 84%

Interpreting Style Representations via Style-Eliciting Prompts

通过风格诱导提示解释风格表示

Junghwan Kim, David Jurgens

机构 * University of Michigan(密歇根大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出一种通过风格诱导提示解释风格表示的新框架,利用大型语言模型生成自然语言描述,并在风格描述和模仿任务中优于直接提示的基线方法。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05632 2026-06-05 cs.AI 84%

Evaluation of LLMs for Mathematical Formalization in Lean

LLM在Lean中数学形式化的评估

Tyson Klingner, Drew Bladek, Escher Crawford, Bohao Chen, Ariel Fu, Kaira Nair, Jarod Alper, Giovanni Inchiostro, Vasily Ilin

机构 * University of California, Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过pass@k和refine@k指标在miniF2F和miniCTX子集上比较了多种大语言模型在Lean 4中生成形式化证明的能力,发现Gemini 3.1 Pro和Claude Opus 4.7性能最佳,而NVIDIA Nemotron 3 Super和GPT-OSS 120B在考虑成本时效率最高。

Comments 15 pages, 13 figures, 10 tables. Comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20628 2026-06-05 cs.CL 84%

Divide-Prompt-Refine: a Training-Free, Structure-Aware Framework for Biomedical Abstract Generation

Divide-Prompt-Refine:一种无需训练的、结构感知的生物医学摘要生成框架

Sylvey Lin, Joe Menke, Shufan Ming, Dongin Nam, Neil Smalheiser, Halil Kilicoglu

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出DPR-BAG框架,旨在生成具有完整文本但无摘要的生物医学文章的连贯且事实准确的摘要。该框架通过分解全文文档为结构化的修辞要素,进行并行LLM摘要生成,并应用最终的精炼阶段恢复全局话语连贯性。

Comments Accepted by BioNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23845 2026-06-05 cs.CL 84%

CLFEC: A New Task for Unified Linguistic and Factual Error Correction in paragraph-level Chinese Professional Writing

CLFEC:一种新的任务,用于段落级中文专业写作中的统一语言和事实纠错

Jian Kai, Zidong Zhang, Jiwen Chen, Zhengxiang Wu, Songtao Sun, Fuyang Li, Yang Cao, Qiang Liu

机构 * Huazhong University of Science and Technology(华中科技大学) WPS AI, Kingsoft Office(WPS AI,Kingsoft Office)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出CLFEC任务,旨在解决段落级中文专业写作中语言和事实错误的联合纠错问题,构建了多领域数据集,并系统研究了基于LLM的纠错方法,揭示了实际挑战并展示了统一纠错的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03650 2026-06-05 cs.CL cs.AI 84%

CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks

CoEval: 无标注数据或可信基准下为自定义任务排序语言模型

Alexander Apartsin, Yehudit Aperstein

机构 * Holon Institute of Technology(霍洛技术学院) Afeka Tel Aviv Academic College of Engineering(阿法卡特拉维大学工程学院)

专题命中 评测与基准 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出CoEval框架,通过教师模型生成无污染基准和跨族评审团,无需标注数据或人工评估即可对语言模型进行排序,在真实排名恢复上达ho=0.86。

Comments 16 pages, 5 images

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00965 2026-06-05 stat.AP cs.AI cs.LG 84%

Binary Gaussian Copula Synthesis: an LLM-powered data augmentation framework for early dialysis prediction in chronic kidney disease

二元高斯卷积合成:一种基于LLM的数据增强框架,用于慢性肾病早期透析预测

Hamed Khosravi, Milad Khanchi, Mobina Noori, Srinjoy Das, Abdullah Al-Mamun, Imtiaz Ahmed

机构 * Department of Industrial & Management Systems Engineering, West Virginia University(威斯康星大学工业与管理系统工程系) Department of Electrical and Computer Engineering, Concordia University(康科迪亚大学电气与计算机工程系) Department of Computer Science, University of California, Davis(加州大学戴维斯分校计算机科学系) School of Mathematical & Data Sciences, West Virginia University(威斯康星大学数学与数据科学学院) School of Systems Science and Industrial Engineering, The State University of New York at Binghamton(纽约州立大学布法罗分校系统科学与工业工程学院) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(佐治亚理工学院H.米尔顿·斯图尔特工业与系统工程学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出Binary Gaussian Copula Synthesis (BGCS),一种专为二元临床数据设计的两阶段数据增强方法,通过生成合成少数类样本并过滤不合理的样本,提高了早期透析预测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05793 2026-06-05 cs.CL cs.AI cs.CY cs.LG 83%

CollabBench: Benchmarking and Unleashing Collaborative Ability of LLMs with Diverse Players via Proactive Engagement

CollabBench: 通过主动参与与多样化玩家基准测试和释放LLMs的协作能力

Hong Qian, Yuanhao Liu, Zihan Zhou, Zongbao Zhang, Hanjie Ge, Haotian Shi, Liang Dou, Xiangfeng Wang, Jingwen Yang, Aimin Zhou

机构 * Shanghai Institute of AI for Education(上海人工智能教育研究院) School of Computer Science(计算机科学学院) East China Normal University(东华大学) Tencent Inc.(腾讯公司) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CollabBench基准,通过多样化玩家模拟和协作智能体训练范式,提升LLM在合作游戏中的任务效率和情感适应能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12983 2026-06-05 cs.CL 83%

ChartAttack: Testing the Vulnerability of LLMs to Malicious Prompting in Chart Generation

ChartAttack: 测试大型语言模型在图表生成中对恶意提示的脆弱性

Jesus-German Ortiz-Barajas, Jonathan Tonglet, Vivek Gupta, Iryna Gurevych

机构 * INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT索菲亚大学"圣克莱门特·欧赫里迪斯基") Ubiquitous Knowledge Processing Lab (UKP Lab), Department of Computer Science, TU Darmstadt and National Research Center for Applied Cybersecurity ATHENE(无处不在知识处理实验室(UKP实验室)、计算机科学系、图腾达姆斯塔特大学和应用网络安全国家研究中心ATHENE) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :prompting(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ChartAttack框架,用于评估多模态大语言模型在生成误导性图表方面的能力,通过注入误导性元素来诱导错误解释,并引入AttackViz数据集来评估和改进模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05330 2026-06-05 cs.CL cs.AI cs.HC 82%

A Model of Multi-turn Human Persuadability Using Probabilistic Belief Tracing

基于概率信念追踪的多轮人类可说服性模型

Jared Moore, Noah Goodman, Nick Haber, Max Kleiman-Weiner

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PERSUASIONTRACE框架,通过记录多轮信念报告、标注修辞维度并引入贝叶斯网络模拟目标,将说服评估从端点变化转向过程保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05531 2026-06-05 cs.CV cs.AI cs.CL cs.LG 82%

Almieyar-Oryx-BloomBench: A Bilingual Multimodal Benchmark for Cognitively Informed Evaluation of Vision-Language Models

Almieyar-Oryx-BloomBench:一个用于视觉语言模型认知知情评估的双语多模态基准

Mohammad Mahdi Abootorabi, Omid Ghahroodi, Anas Madkoor, Marzia Nouri, Doratossadat Dastgheib, Mohamed Hefeeda, Ehsaneddin Asgari

机构 * University of British Columbia(不列颠哥伦比亚大学) Zuse School(Zuse学校) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有基准无法诊断视觉语言模型真实推理能力的问题,提出基于Bloom认知分类学的双语多模态基准BloomBench,系统评估六个认知层次,揭示模型在事实回忆和创造性合成方面的深层局限。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10897 2026-06-05 cs.CV 82%

Can Language Models Learn to Listen?

语言模型能否学会倾听?

Evonne Ng, Sanjay Subramanian, Dan Klein, Angjoo Kanazawa, Trevor Darrell, Shiry Ginosar

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract)

AI总结 本文提出了一种基于说话人话语生成适当面部回应的框架,通过将量化后的面部动作元素作为额外语言token输入到基于transformer的大型语言模型中,从而提升监听响应的质量。

Comments ICCV 2023; Project page: https://people.eecs.berkeley.edu/~evonne_ng/projects/text2listen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06454 2026-06-05 cs.SE cs.CL 81%

Scaffold, Not Vocabulary? A Controlled, Two-Tier, Pre-Registered Study of a Popperian Code-Generation Skill

脚手架,而非词汇?一项受控、双层、预注册的波普尔式代码生成技能研究

Mehmet Iscan

机构 * PythaLab, Yıldız Technical University, Istanbul, Turkey(Pytha实验室,伊兹密尔技术大学,伊斯坦布尔,土耳其)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过双层消融实验(包括长度匹配安慰剂、仅标签脚手架和真实执行测试),研究发现波普尔式提示技能对代码正确性的提升主要来自脚手架结构而非其内容,并在大模型上因天花板效应无法检测,在小模型上仅标签脚手架即可达到类似效果。

Comments 34 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05522 2026-06-05 cs.SD cs.AI eess.AS 81%

Exploring LLMs for South Asian Music Understanding and Generation

探索大语言模型对南亚音乐的理解与生成

Faria Binte Kader, Mohtasim Hadi Rafi, Shah Wasif Sajjad, Santu Karmaker

机构 * University of Central Florida(佛罗里达中央大学) Auburn University(阿伯伯大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文系统评估大语言模型在基于拉格和塔拉的南亚古典音乐理解与生成任务中的表现,发现前沿模型在理解任务上准确率达85-90%,但生成任务中风格忠实度仅40%。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17260 2026-06-05 cs.CL 81%

Rethinking Meeting Effectiveness: A Benchmark and Framework for Temporal Fine-grained Automatic Meeting Effectiveness Evaluation

重新思考会议有效性:一个用于时间细粒度自动会议有效性评估的基准和框架

Yihang Li, Chenhui Chu

机构 * Kyoto University(京都大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种新的会议有效性评估方法,通过定义有效性为时间内的客观成就率,并引入AMI-ME数据集和自动评估框架,以支持对会议中各个话题段落的有效性评分,从而建立一个全面的基准并评估框架的通用性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏