arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-05 至 2026-08-05 共收录 439 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 63 篇

2608.03084 2026-08-05 cs.CV 新提交 50%

SUV: Future Scene Understanding as Video Generation for End-to-End Driving

SUV:将未来场景理解建模为视频生成的端到端驾驶

Yibo Yuan, Jiacheng Fu, Jiangtong Zhu, Yi Li, Jianhua Han, Meng Tian, Zhuohan Liu, Zhiwei Xiong, Hang Xu, Jianwu Fang, Jianru Xue

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 SUV是将未来场景理解建模为视频生成的端到端驾驶框架,其在NAVSIM-v2和WOD-E2E基准上优于近期SOTA方法,实现了更优的轨迹规划性能。

Comments 16 pages, 5 figures. Code: https://github.com/ASH-2046/SUV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00868 2026-08-05 cs.CV cs.HC 版本更新 50%

MIDAL: A Dataset of Math Image Descriptions for Accessible Learning

MIDAL:用于无障碍学习的数学图像描述

Rebeka Popek, Vaghawan Ojha, Young Hwan You

机构 * E.K. Solutions Pvt. Ltd.(E.K.解决方案私人有限公司)

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究推出含2020张多级别数学图像的MIDAL数据集,用于训练视觉语言模型生成无障碍图像描述,还可微调语言模型提升数学推理能力,助力高等教育STEM内容无障碍性建设。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 105 篇

2507.19308 2026-08-05 cs.SD cs.CL eess.AS 版本更新 92%

The Eloquence team submission for task 1 of MLC-SLM challenge

Eloquence团队针对MLC-SLM挑战赛任务1的提交

Lorenzo Concina, Jordi Luque, Alessio Brutti, Marco Matassoni, Yuchen Zhang

机构 * Fondazione Bruno Kessler(布鲁诺·科塞拉基金会) Telefónica Innovación Digital, Scientific Group(电信创新数字公司,科学小组) University of Essex(埃塞克斯大学)

专题命中 评测与基准 :SLM(title,title_cn);language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 该研究针对MLC-SLM挑战赛任务1,探索三种多语言ASR方法,评估基线、利用SLAM-ASR框架训练投影器并研究对比学习与会话上下文的作用。

Comments Technical Report for MLC-SLM Challenge of Interspeech2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02966 2026-08-05 cs.CL 新提交 92%

Every Wrong Answer Counts: Option-Level Psychometrics for LLM Multiple-Choice Benchmarks

每个错误答案都有价值:面向LLM多项选择基准的选项层面心理测量学

Xiao Fei, Yang Zhang, Sarah Almeida Carneiro, Michalis Vazirgiannis

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对LLM多项选择基准提出LLM-NRM框架,利用错误答案的独特信息提升能力估计精度与基准测试效率,其能力估计与人类偏好排行榜相关性达0.920,仅错误回答就能实现0.943的高相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03983 2026-08-05 cs.PL cs.AI 新提交 91%

Can Large Language Models Recover Semantic Optimization Opportunities That Compilers Miss?

大语言模型能否恢复编译器遗漏的语义优化机会?

Hailong Jiang, Feng Yu, Emran Hossain, Jianfeng Zhu, Mengfei Ren, Qiang Guan, Chunwei Xia

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文探究大语言模型能否恢复编译器遗漏的语义优化机会,推出含多类案例的可执行基准SeGaBench,实验显示最强模型生成的工件可实现较高正确率与加速比,证实LLM可作为编译器的补充语义提议者。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00155 2026-08-05 cs.AI cs.LG 交叉投稿 91%

AgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?

AgentStream:自进化大语言模型智能体在流式任务下的表现如何?

Dong Yan, Jian Liang, Dapeng Hu, Ran He, Nicholas Jing Yuan, Qi Zhang, Tieniu Tan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Microsoft(微软公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出AgentStream框架,评估三种流式场景下三种基础模型的五种自进化LLM智能体方法,发现自进化表现受场景、模型能力等影响,为方法选择提供指导。

Comments Code is available at https://github.com/Jasper-Yan/AgentStream

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02620 2026-08-05 cs.CL 新提交 91%

JudgeArena: A Unified Framework for Reproducible LLM-Judge Evaluation

JudgeArena:用于可复现LLM-评判者评估的统一框架

Erlis Lushtaku, Bora Kargi, Ali Elganzory, Fabio Ferreira, Alejandro R. Salamanca, Julia Kreutzer, David Salinas

机构 * University of Freiburg(弗莱堡大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Microsoft AI(微软人工智能部门) Cohere Labs(Cohere实验室) Prior Labs(Prior实验室)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 JudgeArena是统一主流LLM评判者基准的开源框架,支持可替换评判者,配备调优开源评判者配置,可高精度模拟LMArena Elo分数,减少对闭源模型的依赖,提升评估的透明度与可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03803 2026-08-05 cs.CL cs.LG 新提交 91%

M-GATE: Multilingual Grammar, Accuracy in Translation, and Efficiency Benchmark for Large Language Models

M-GATE:面向大语言模型的多语言语法、翻译准确性与效率基准

Tomáš Burkert, Angelika Peljak-Łapińska, David Zelený

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);pretraining(abstract)

AI总结 本研究推出多语言基准M-GATE,评估50余种模型的80余种配置,发现翻译与语法能力分离,低资源语言惩罚随模型迭代缩小,推理对翻译提升显著。

Comments 45 pages (97 incl. appendices), 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03416 2026-08-05 cs.AI cs.LG 新提交 91%

AI World Cup 2026: Benchmarking Large Language Models for End-to-End Football Tournament Prediction

2026 AI世界杯:用于端到端足球锦标赛预测的大语言模型基准测试

Jonaid Shianifar, Iias Faiud

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过AI世界杯基准测试,对10款大语言模型进行2026年FIFA世界杯端到端预测,发现淘汰赛表现决定排名,GPT-5.5 Thinking夺冠,相关成果已公开以支持后续研究。

Comments 18 pages, 8 figures, 7 tables. Project repository available in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02703 2026-08-05 cs.CL cs.LG 新提交 91%

ARCHead: Activation-Metric Residual Correction for Large Language Model Output Heads

ARCHead:大语言模型输出头的激活度量残差修正

Şuayp Talha Kocabay, Talha Rüzgar Akkuş, Kamer Ali Yuksel

机构 * aiXplain, Inc.(aiXplain公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 ARCHead是一种LM-head压缩器,通过量化低秩核心、分组INT4残差及激活衍生低秩修正,将LM-head存储降3.7-3.9倍,在Qwen3-8B-Base上性能优于朴素INT4,可补充块量化器。

Comments 13 pages, 4 figures. Submitted to ACL Rolling Review (ARR). Code: https://github.com/suayptalha/archead

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03565 2026-08-05 cs.IR 版本更新 90%

Skill Is Not Document: Query-Conditioned Compatibility for LLM Agent Skill Routing

技能不是文档:面向LLM智能体技能路由的查询条件基准与两阶段检索器

Zifei Wang, Wei Wen, Qiang Ji, Keyu Chen, Ruizhi Qiao, Xing Sun

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM智能体技能路由中技能兼容性被忽视的问题,提出Reject-as-Resource Retriever (R3)框架,构建双语基准R3-Skill,并设计两阶段检索系统(R3-Embedding + R3-Reranker)显式建模技能兼容性,显著提升检索效果。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18790 2026-08-05 cs.CR 版本更新 90%

RoguePrompt: Dual-Layer Ciphering for Self-Reconstruction to Circumvent LLM Moderation

RoguePrompt: 双层加密用于自我重建以规避LLM审核

Benyamin Tafreshian

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 RoguePrompt通过双层加密技术实现自我重建,有效规避LLM审核并诱导模型执行禁止指令。

Comments This submission has been withdrawn because it has been superseded by a substantially revised and expanded version, available as arXiv:2607.27373. Please refer to and cite the newer version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02915 2026-08-05 cs.AR cs.CL cs.SE 新提交 90%

LACE: Large Language Model Aided Multi-Agent Framework for Agile RISC-V Instruction Extension

LACE:用于敏捷RISC-V指令扩展的大语言模型辅助多智能体框架

Pingqing Zheng, Jiayin Qin, Fuqi Zhang, Zishen Wan, Shang Wu, Yu Cao, Caiwen Ding, Yang Katie Zhao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 针对RISC-V指令扩展实现验证缓慢碎片化问题,提出LLM辅助多智能体框架LACE,可提升指令生成准确率并减少集成返工。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03206 2026-08-05 cs.CY cs.AI cs.CL 新提交 90%

EduClaw-Bench: A Long-Horizon Benchmark for Pedagogical LLM Agents with Simulated Learners

EduClaw-Bench:面向教学大型语言模型智能体的长周期基准测试集(含模拟学习者)

Unggi Lee, Sookbun Lee, Yeil Jeong, Eunjoo Lee, Minchul Shin, Hoilym Kwon

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出EduClaw-Bench长周期基准测试集,结合模拟学习者评估LLM智能体辅导效果,发现辅导质量取决于基础模型与智能体适配器的结合,且多数组合无法维持全程良好辅导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03636 2026-08-05 cs.NE cs.AI 新提交 90%

MuEvo: LLM-Driven Evolution of Multi-Heuristic Ensemble

MuEvo:大语言模型驱动的多启发式集成演化

Haoze Lv, Ning Lu, Shengcai Liu, Shaofeng Zhang, Ke Tang

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出MuEvo框架,结合动态组件管理与LLM驱动协同演化,在四类组合优化领域的实验显示其优于现有LLM-AHD方法,可改进人工设计的优化框架。

Comments 30 pages, 4 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03627 2026-08-05 cs.AI 新提交 90%

Unequal Verdicts: Investigating Gender Bias in LLM-Based Fake News Detection

不等的裁决:研究基于大语言模型的假新闻检测中的性别偏见

Razieh Chalehchaleh, Reza Farahbakhsh, Noel Crespi

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过扩展LIAR基准数据集,评估六个LLM的假新闻检测性能,发现存在性别偏见,影响检测的可靠性与公平性,且数据集已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03591 2026-08-05 cs.CR cs.AI 新提交 90%

DiagChain: A Diagnostic Benchmark for Evaluating LLM Agents on Evidence-Grounded Attack Chain Reconstruction

DiagChain:用于评估大语言模型智能体基于证据的攻击链重构的诊断基准

Xuyang Liu, Yibin Han, Zhenwei Zhang, Kai Chang, Zhiwei Xu, Tian Qiu, Weixian Deng, Jiabao Gao, Xiaolin Peng, Hai Wan, Xibin Zhao

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对LLM智能体攻击链重构基准的不足,提出DiagChain基准与ECRAG方法,经6种LLM评估发现模型在证据整合与排序环节存在瓶颈,为网络安全智能体改进提供了诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03501 2026-08-05 cs.AI 新提交 90%

Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Autonomous Experimental Design

大语言模型(LLM)能否设计高质量实验?一项针对自主实验设计的全面系统基准测试

Zejun Liu, Jian Wu, Ru Peng, Yuliang Ji, Dongyuan Li, Renhe Jiang, Yue Zhang

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究构建SCOPE基准评估LLM的自主实验设计能力,发现多数LLM无法直接设计高质量实验,低层配置存在瓶颈,进而提出OptED工作流缓解该瓶颈。

Comments 32 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03239 2026-08-05 cs.CL 新提交 90%

Relational Priors as Convergence Pressure in LLM-Based Multi-Agent Systems

关系先验作为基于大语言模型的多智能体系统中的收敛压力

Ming Shen, Chao Shang, Sadat Shahriar, Devang Kulshreshtha, Yi Zhang, Sandesh Swamy, Yanjun Qi

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究将关系先验注入LLM-MAS提示中,发现其主要起收敛压力作用,正向性提升可促进智能体协调但未必提高准确性,建议按需使用而非默认添加。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02677 2026-08-05 cs.SE cs.AI cs.MA 新提交 90%

When Policies Change Probabilities: Modular Decision-Making for LLM Code Review

当策略改变概率时:用于LLM代码审查的模块化决策

Rasvik Kudum, Max Corbett, Hitansh Paliwal, Romaisa Fatima, Thomas Jiralerspong, Sneheel Sarangi

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究针对LLM代码审查,测试4种审查界面的策略与概率分离情况,提出模块化流水线可提升概率准确性、降低损失,验证了风险与行动分离评估的必要性。

Comments 20 pages, 6 figures; includes technical appendices. Code and data: https://github.com/rasvik/when-policies-change-probabilities

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03810 2026-08-05 cs.CL cs.AI 新提交 90%

VIBE: A VAD-Informed Benchmark for Entity-Centered Affective Profiling of Large Language Model Outputs

VIBE:面向大型语言模型输出的以实体为中心的情感分析基准,基于VAD(效价-唤醒度-支配度)

Andrei Chetvergov, Alexander Evseev, Timofei Sivoraksha, Stepan Ukolov, Mikhail Solovev, Danil Sazanakov, Sergey Bolovtsov

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于VAD的VIBE基准,用于以实体为中心分析大型语言模型输出的情感,明确了测量契约,通过三个实证层面验证了相关假设,推动该领域成为规范化实践。

Comments 25 pages, 13 figures, 22 tables. Submitted to ACL Rolling Review, August 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03880 2026-08-05 cs.PF cs.DC 新提交 89%

Evaluating MFU as a Proxy for GPU Power for Energy-Aware Simulation of LLM Training

评估MFU作为GPU功耗代理用于LLM训练的能效感知仿真

Niklas Enskat, Philipp Wiesner

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本研究测试MFU能否作为LLM训练的GPU功耗预测器,通过近3000次单设备训练基准测试,发现计算密集型 workload 下基于MFU的线性模型适用,特定参数拟合可大幅降低误差。

Comments Accepted at MASCOTS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03535 2026-08-05 cs.SE 新提交 89%

CodeAssay: A Multi-Metric Benchmark with Audited Ground Truth for LLM Code Generation

CodeAssay:带有审计基准真值的多指标大语言模型代码生成基准

Shahbaz Siddeeq, Muhammad Waseem, Umar Subhan Malhi, Pekka Abrahamsson

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出CodeAssay基准,涵盖185个Python任务,结合多类测试与度量,经审计后发现模型正确性标签有9.0%变化,且验证了多类LLM代码生成的评估特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03091 2026-08-05 cs.IR 新提交 89%

Position Bias Undermines Preference Consistency in Listwise LLM-Based Reranking

位置偏差破坏基于大语言模型的列表式重排序中的偏好一致性

Ethan Bito, Yongli Ren, Estrid He

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究揭示基于LLM的列表式重排序存在位置偏差,引入多维度评估框架验证其会破坏偏好一致性,且均衡位置曝光无法修复该问题。

Comments Accepted at RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02827 2026-08-05 cs.MA 新提交 89%

Emergence of Biased Consensus in Multi-Agent LLM Debates

多智能体LLM辩论中偏向性共识的涌现

Maya Okawa

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究针对多智能体LLM辩论中集体偏向性共识的涌现问题,提出物理启发的社会动力学分析框架,经实验验证其相变规律,发现智能体异质性可抑制该现象,且见解可推广至投资等现实决策任务。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02758 2026-08-05 cs.MA 新提交 89%

Everyone Conforms, No One Believes: Pluralistic Ignorance in LLM Agent Populations

人人遵从,无人认同:LLM智能体群体中的多元无知

Yashwanth YS

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究证实LLM智能体群体中会出现多元无知,构建了多场景基准评估8种模型,发现遵从率高且级联成功率低,提示模型选择会影响模拟结果,LLM模拟或高估社会规范稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03512 2026-08-05 cs.AI 新提交 89%

Reversing Arrows in Large Language Models

反转大语言模型中的箭头

Sefika Efeoglu, Adrian Paschke

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究首次系统探究大语言模型的反向关系方向性,用含5457个实例的基准评估5种开源模型,发现其反向关系分类存在不对称性,关系描述与实体表示会影响性能。

Comments The preprint is under review in a venue

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03154 2026-08-05 cs.CL 新提交 89%

ANCHOR-RE: An Agentic Neuro-Symbolic Framework for Grounded Biomedical Relation Extraction

ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架

Shufan Ming, Yikun Han, Gibong Hong, Rui Zhang, Halil Kilicoglu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。

Comments Submitted to Journal of Biomedical Informatics (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16217 2026-08-05 cs.CL cs.AI 版本更新 88%

ChiEngMixBench: Evaluating Large Language Models on Expert-Style Chinese-English Terminology Mixing

ChiEngMixBench: 评估大型语言模型在自发和自然的中英混合生成中的能力

Qingyan Yang, Tongxi Wang, Yunsheng Luo

机构 * School of Future Technology(未来技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 ChiEngMixBench通过评估中英混合生成的自发性和自然性,揭示多语言模型与人类交流的结构化认知对齐

Comments 15 pages, 2 figures, 8 tables. Substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03532 2026-08-05 cs.CL 新提交 88%

Cross-Lingual Bias in Large Language Models: A Comparative Analysis of English and Swahili

大语言模型中的跨语言偏见:英语与斯瓦希里语的对比分析

Ruolei Zhang, Teddy Njuguna, Yue Feng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过对比GPT-5.2与Gemini 2.5 Flash在英语和斯瓦希里语上的9类人口统计偏见表现,发现偏见会转变而非转移,仅英语偏见审计无法覆盖多语言部署需求。

详情

展开后加载摘要…

URL PDF HTML 收藏