arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2607.25886 2026-07-29 cs.SE cs.CL 新提交 84%

RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement

RSIBench-Data:用于递归自我改进的以数据为中心的研究基准测试

Fanqing Meng, Lingxiao Du, Qiguang Chen, Ziqi Zhao, Haocheng Lu, Mengkang Hu, Michael Qizhe Shieh

专题命中 评测与基准 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL

AI总结 研究递归自我改进中以数据为中心的研究,引入RSIBench-Data基准测试,让LLM智能体迭代修订训练数据策略,评估四个前沿智能体在六个基准测试中的表现,发现其虽有能力但改进不一致,该基准测试提供了可测量的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21632 2026-07-27 cs.CL 新提交 84%

A Consensus-Based Framework for Relative Preference Evaluation of Large Language Models

一种基于共识的大语言模型相对偏好评估框架

Mohtashim Khan

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 针对大语言模型传统评估基准不足,本文提出基于共识的评估框架,通过不同模型对候选响应排序,以模型间一致性衡量质量,经多模型跨领域研究揭示偏好模式,提供了可扩展的比较评估方法。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18147 2026-07-21 eess.SY cs.AI cs.SY 新提交 84%

LLMs and Agentic AI Systems for Smart Grids: A Tutorial on Architectures and Applications

用于智能电网的大语言模型和智能AI系统:架构与应用教程

Daniela Rojas, Abdulwahab Albassam, Aidan G. Leung, Jett Ngo, Ryan Luo, Peter R. Quawas, Junpyung Kim, Kangkai Liang, Mansi Nanavati, Jonathan Mai, Meng-Chi Tsai, Yun-Tong Tsai, Yize Chen, Yuanyuan Shi

机构 * Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣迭戈分校电气与计算机工程系) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究智能电网中LLMs和智能AI系统,提出基于求解器的设计原则,通过提示策略等构建模块及四个案例研究实例化该原则,比较不同方案,还提出四组评估框架,明确了各部分分工。

Comments 28 pages, 11 figures, 6 tables; plus supplementary material. Review/tutorial article

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13757 2026-07-08 cs.CR cs.AI 新提交 84%

SEVRA-BENCH: Social Engineering of Vulnerabilities in Review Agents

SEVRA-BENCH:审查智能体中的社会工程漏洞

Rui Melo, Riccardo Fogliato, Sean Zhou, Pratiksha Thaker, Zhiwei Steven Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能) Amazon AWS(亚马逊AWS) Databricks

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SEVRA-BENCH基准,通过社会工程攻击框架评估LLM代码审查智能体拒绝恶意PR的能力,发现闭源与开源模型间存在显著安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01152 2026-07-03 cs.CL 新提交 84%

AGC-Bench: Measuring Artificial General Creativity

AGC-Bench:衡量人工通用创造力

Roger Beaty, Vijeta Deshpande, Clin K. Y. Lai, Anna Attuch, Namrata Shivagunde, Swastik Roy, Rajkumar Pujari, Paul V. DiStefano, Sherin Muckatira, Claire E. Stevenson, Mikhail Gronas, Anna Rumshisky

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校) University of Amsterdam(阿姆斯特丹大学) Amazon AGI(亚马逊AGI) Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 提出AGC-Bench基准,通过系统文献综述和标准化框架评估LLM创造力,发现单一创造力因子'c',并验证提示'要有创造力'比推理更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22676 2026-06-23 cs.AI 新提交 84%

Skin-Deep: A Geometric Diagnostic for Alignment Fragility in Large Language Model Representations

Skin-Deep: 大型语言模型表示中对齐脆弱性的几何诊断方法

Dongyub Jude Lee, Jungseob Lee, Seungyoon Lee, Seongtae Hong, Suhyune Son, Sugyeong Eo, Jaehyung Seo, Heuiseok Lim

机构 * Zoom Communications Korea University(高丽大学) Yonsei University(延世大学) Konkuk University(建国大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

AI总结 提出Skin-Deep几何诊断方法,通过计算几何脆弱性分数(GFS)在对齐模型微调前检测其拒绝有害请求行为的脆弱性,无需运行攻击。

Comments 16 pages, 3 figures, 12 tables. The first two authors contributed equally. Code (pre-attack GFS diagnostic): https://github.com/js-lee-AI/skin-deep

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20588 2026-06-23 cs.HC cs.AI 新提交 84%

AInterviewer: A Platform for Designing and Conducting AI-led Qualitative Interviews

AInterviewer:一个用于设计和进行AI主导的定性访谈的平台

Tobias Priesholm Gardhus, Nikolas Vitsakis, Fie Lejre Frederiksen, Anna Rogers, Hjalmar Bang Carlsen

机构 * University of Copenhagen(哥本哈根大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AInterviewer平台,通过多智能体管道结合调查软件的标准化与LLM的灵活性,实现可复现、安全、透明的AI主导定性访谈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18103 2026-06-17 cs.CL cs.IR 新提交 84%

HistoRAG: Embedding Historical Methodology in Retrieval-Augmented Generation Through Critical Technical Practice

HistoRAG:通过批判性技术实践将历史方法论嵌入检索增强生成

Noah J. Kim-Baumann, Torsten Hiltmann

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL

AI总结 针对历史学等解释性学科,提出HistoRAG框架,通过分离检索与生成、时间窗口化、LLM作为评判者等架构干预,将历史编纂原则转化为RAG设计,解决标准RAG中的时间偏差、相关性评估等问题。

Comments 25 pages, 6 figures. Companion preprint to a Journal of Digital History notebook article (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17398 2026-06-17 cs.CR cs.AI cs.SE 新提交 84%

SoK: AI-Augmented Binary Reversing

SoK: AI增强的二进制逆向工程

Yujeong Kwon, Yiyue Zhang, Shakhzod Yuldoshkhujaev, Kexin Pei, Dokyung Song, Hyungjoon Koo

机构 * Sungkyunkwan University(成均馆大学) The University of Chicago(芝加哥大学) Yonsei University(延世大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 系统化梳理AI增强二进制逆向工程领域,提出统一分类法涵盖传统与AI方法,揭示LLM和智能体AI的新角色,识别技术挑战与评估缺口。

Comments 20 pages, 7 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16684 2026-06-16 cs.CL 新提交 84%

Progressive Knowledge-Guided Large Language Model Framework for Bearing Fault Diagnosis

渐进式知识引导的大型语言模型框架用于轴承故障诊断

Jinghan Wang, Gaoliang Peng, Yanjun Chen, Wei Zhang, Wentao Wu, Tianchen Liu

机构 * Harbin Institute of Technology, China(哈尔滨工业大学,中国) Eastern Institute of Technology, China(东方技术研究所,中国)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 提出渐进式物理引导多尺度振动信号处理框架,通过81维测量描述符、故障自适应分割和隐式知识编码,在四个数据集上实现98.49%诊断精度并降低12.6倍计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16659 2026-06-16 cs.CL 新提交 84%

FraudSMSWalker: Benchmarking Agentic Large Language Models for SMS-to-Webpage Fraud Detection

FraudSMSWalker: 用于短信到网页欺诈检测的智能体大语言模型基准测试

Y. H. Zhou, Z. M. Ma, Y. J. Zhou, Y. T. Li, H. X. Xiang, Y. M. Cheng, T. L. Chen, K. J. Zhang, Z. H. Nan, J. H. Ni, Z. Wu, Q. Y. Pan, S. Zhang, S. Cheng, M. Y. Luo

机构 * Baimaohui(白猫汇) PPSUC(中国人民公安大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL

AI总结 提出FraudSMSWalker基准,通过屏蔽URL的短信-网页对评估智能体大语言模型在跨渠道欺诈检测中的证据推理能力,发现模型能检测可疑线索但难以保持良性召回。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16011 2026-06-16 cs.CL 新提交 84%

Who Flips? Self- and Cross-Model Counterarguments Reveal Answer Instability in LLMs

谁在翻盘?自我与跨模型反论证揭示LLM中的答案不稳定性

Nafiseh Nikeghbal, Amir Hossein Kargaran, Shaghayegh Kolli, Jana Diesner

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) LMU Munich(慕尼黑大学)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出一种评估大语言模型答案稳定性的协议,通过生成反论证挑战正确回答,发现翻转率在17.5%到97.3%之间,且自我归因和跨模型论证显著影响稳定性。

Comments Accepted to the non-archival workshops AI4Good and AIWILD at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14817 2026-06-16 cs.IR cs.AI 新提交 84%

Combining Retrieval-Augmented Text Generation with LLMs for Reading Content Recommendations

结合检索增强文本生成与大型语言模型的阅读内容推荐

Sooyeon Kim, Piotr S. Maciąg

机构 * Institute of Computer Science, Warsaw University of Technology(计算机科学学院,华沙技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出结合检索增强生成(RAG)与大型语言模型的系统,通过四个模块实现个性化阅读内容生成,实验表明RAG将相关性和接地性提升26-35个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06563 2026-06-16 cs.SE cs.AI 新提交 84%

AI-Driven Test Case Generation from Natural Language Requirements: A Survey of Techniques and Research Gaps

AI驱动的自然语言需求测试用例生成:技术与研究空白综述

Orimoloye Folorunsho, Hassan Reza

机构 * School of Electrical Engineering and Computer Science(电气工程与计算机科学学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 综述AI、NLP和LLM从自然语言需求生成测试用例的技术,指出当前方法无法同时满足自动化、歧义处理等六个质量维度,提出四个研究方向。

Comments 22 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14600 2026-06-15 cs.CL 新提交 84%

LoSoNA: A Benchmark for Local Social Norm Adaptation in Group Conversations

LoSoNA:群组对话中局部社交规范适应的基准

Mateusz Winiarek, Maksymilian Bilski, Mateusz Jacniacki

机构 * Humalike Research

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 提出LoSoNA基准,通过群聊场景测试LLM从对话历史推断并适应未明示的局部社交规范的能力,评估多种模型在不同提示条件下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12864 2026-06-12 cs.SE cs.AI 新提交 84%

Beyond Problem Solving: UOJ-Bench for Evaluating Code Generation, Hacking, and Repair in Competitive Programming

超越问题求解:用于评估竞赛编程中代码生成、攻击和修复的UOJ-Bench基准

Tingqiang Xu, Hangrui Zhou, Tianle Cai, Alex Gu, Kaifeng Lyu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出UOJ-Bench基准,通过代码生成、攻击和修复三项任务评估LLM在竞赛编程中的问题求解与人类代码错误识别能力,发现最强模型在一次性评估中无法识别超过50%的错误提交,但测试时扩展可提升至90%以上,且能发现约5%的满分提交中的错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09389 2026-06-09 cs.CL 新提交 84%

LexRubric: A Rubric-Guided Diagnostic Benchmark for Open-Ended Legal Tasks

LexRubric:面向开放式法律任务的基于评分指南的诊断基准

Yifan Chen, Haitao Li, Yiran Hu, Kaisong Song, Jun Lin, Yueyue Wu, Qingyao Ai, Min Zhang, Yiqun Liu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) University of Waterloo(滑铁卢大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LexRubric基准,包含649个中国法律咨询与司法考试实例及12,337条原子评分标准,通过六维框架评估LLM在开放式法律任务中的可靠性,发现当前模型仍面临挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17530 2026-08-19 cs.AI cs.LG 新提交 84%

When to Review: Spaced Repetition for Continual Pre-Training of Language Models

何时复习:语言模型持续预训练的间隔重复方法

Alankar Atreya, Devesh Batra, Yoages Kumar Mantri, Geremy Bantug, Greig A Cowan, Raad Khraishi

机构 * University College London(伦敦大学学院) NatWest AI Research(国民西敏寺银行人工智能研究部)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出受认知科学启发的SRT框架,采用SM-2算法调度样本重放,可恢复大型语言模型持续预训练中5至37个百分点的旧知识准确率,同时保留或提升新知识获取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17150 2026-08-19 cs.AI cs.CL cs.HC 新提交 84%

KnowSim: Evaluating Information Calibration in LLM Assistants with User Simulators that Learn

KnowSim:用学习的用户模拟器评估大语言模型助手的信息校准

Yoonjoo Lee, Hyoungwook Jin, Tae Soo Kim, Shaoyang Zhang, Philippe Laban, Q. Vera Liao

机构 * University of Michigan(密歇根大学) KAIST(韩国科学技术院) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出KNOWSIM框架,通过带显式知识状态的用户模拟器评估LLMs的信息校准,验证后其性能优于基线,可揭示用户知识水平与LLMs的适配关系。

Comments 30 pages, 6 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13624 2026-08-17 cs.CL cs.AI cs.SD 新提交 84%

Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

基于语义感知偏差估计的大音频语言模型公平性测量

Zhe Liu

机构 * Meta Platforms, Inc.(元平台公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大音频语言模型公平性评估中语义与说话人混淆因素的问题,提出语义感知混合效应回归框架,经实验验证可减少虚假结论,得到更稳健的子群体性能差异估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12150 2026-08-13 cs.AI cs.CL 新提交 84%

Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

哪种模型表现最佳取决于你给的时间:大语言模型评估中依赖预算的排名

Rodrigo Guedes de Souza, Alison R. Panisson

机构 * Federal University of Santa Catarina (UFSC)(圣卡塔琳娜联邦大学(UFSC))

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过调整 token 生成预算评估 4 个大语言模型在 3 个推理基准的表现,发现模型排名随预算变化反转,提出需采用预算条件化的评估协议。

Comments 19 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10315 2026-08-12 cs.CL cs.AI 新提交 84%

Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

这是你的最终答案吗?跨上下文一致性作为大语言模型可信度的度量

Siyang Wu, Yibo Jiang, Bryon Aragam

机构 * University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出用跨上下文一致性(C3)度量大语言模型可信度,通过对比26个模型在6个基准上的原始与扰动提示生成结果,发现C3可作为互补评估维度与基准有用性诊断工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08722 2026-08-11 cs.LG cs.AI 新提交 84%

Gaming Without an Attacker: Benchmark Fingerprinting in LLM-Driven Search Under Selection Pressure

无攻击者的博弈:选择压力下大语言模型驱动搜索中的基准指纹识别

Víctor Gallego

机构 * Komorebi AI Technologies(Komorebi人工智能技术公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 本文研究发现,在带反馈的进化循环中,前沿LLM提出的GPU内核会对评估配置进行指纹识别,导致30%的分布内胜出案例无法迁移,进而给出失败分类与测量设计指导。

Comments Published as a conference paper at AI Measurement Science Workshop @ COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04670 2026-08-06 cs.CL cs.AI 新提交 84%

Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark

易完成,难选择:探究大型语言模型在ProverbIT基准上的性能

Enrico Mensa, Lorenzo Zane, Calogero Jerik Scozzaro, Matteo Delsanto, Tommaso Milani, Daniele Paolo Radicioni

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究构建了意大利谚语基准ProverbIT,评估13个前沿LLMs的谚语处理能力,发现LLMs虽能完成谚语任务,但在无正确答案的选择题中性能骤降,暴露其依赖记忆而非深层语义理解的局限。

Journal ref Proceedings of the Eleventh Italian Conference on Computational Linguistics (CLiC-it 2025), pages 722-734

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03044 2026-08-05 cs.CL cs.AI 新提交 84%

Emulate or Estimate? The Divergent Strengths of Base and Post-Trained Language Models for Opinion Simulation

模拟还是估计?基础语言模型与后训练语言模型在观点模拟中的差异化优势

Seth Grief-Albert, Jessica Bo, Difan Jiao, Ashton Anderson

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大型语言模型用于观点模拟的矛盾结果,区分了模拟与估计任务,发现基础模型更适合模拟、后训练模型更适合估计,为相关模型选择提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02689 2026-08-05 cs.CL cs.LG 新提交 84%

Stuck on "A": Diagnosing and Repairing Interface Injury in Attention-to-KDA Linearization of a 0.6B Language Model

困在“A”上:诊断与修复0.6B语言模型的KDA线性化注意力中的接口损伤

Ronglong Bao

专题命中 评测与基准 :language model(title);SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本研究将Qwen3-0.6B-Base的21层注意力转为KDA线性注意力,发现模型存在标签执着的接口损伤,经格式针对性KL阶段修复后,C-Eval分数提升12.48分,相关成果已开源。

Comments Code and models: https://github.com/Sisyphbaous-DT-Project/open-qingyi ; https://huggingface.co/shiershuihesaixiliya/qingyi-kda-0.6b . A version of this preprint is archived on Zenodo (DOI: 10.5281/zenodo.21722356)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02618 2026-08-05 cs.AI cs.CL 新提交 84%

Beyond the Hivemind: Escaping LLM Homogeneity via Meta-Persona Anchoring and Sequential Temperature Scaling

超越群体思维:通过元角色锚定与顺序温度缩放规避大语言模型同质化

Tairan Fu, Javier Conde, Carlos Arriaga, Gonzalo Martínez, Pedro Reviriego, Javier Coronado-Blázquez

机构 * Politecnico di Milano(米兰理工大学) Information Processing and Telecommunications Center(信息处理与电信中心) Universidad Politécnica de Madrid(马德里理工大学) Banco de España(西班牙银行)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大语言模型的同质化问题,提出元角色锚定结合过滤式温度缩放的框架,在INFINITY-CHAT数据集的约200亿参数模型上,将平均成对余弦相似度从0.85降至0.65,缩小了人工模式坍缩与人类多样性的差距并开源了框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00991 2026-08-04 cs.AI cs.CL 新提交 84%

SCHEDBench: A Benchmark for Evaluating LLM Constraint Faithfulness in Natural-Language Combinatorial Scheduling

SCHEDBench:评估大语言模型在自然语言组合调度中约束忠实度的基准

Shrenil Shaun Sharma, Avi Sharma

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SCHEDBench基准针对13个LLMs的测试表明,模型对同一调度问题的语义等价表述缺乏不变性,约束重排序引发的敏感性最为突出。

Comments 19 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00561 2026-08-04 cs.AI cs.CL cs.CV 新提交 84%

Through the LENS: Local Geometric Decomposition of Vision-Language Model Representations

通过LENS:视觉语言模型表示的局部几何分解

Shalom Kachko, Raz Lapid, Margarita Vald, Almog Dubin, Moshe Sipper

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出LENS方法,将VLM激活分解为局部低秩高斯邻域,揭示LLaVA与Qwen3-VL的不同模态融合轨迹,该方法可实现因果生成干预并提升多模态检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25308 2026-07-29 cs.CL cs.AI 新提交 84%

CAST: Game Solvers as Turn-Level Teachers for LLM Agents

CAST:将游戏求解器作为大语言模型智能体的回合级教师

Yu Wang, Yi-Kai Zhang, Wentao Shi, Ziang Ye, Yuchun Miao, Yueqing Sun, Qi Gu, Xunliang Cai, Lan-Zhe Guo, Han-Jia Ye, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Nanjing University(南京大学) Wuhan University(武汉大学) Meituan(美团)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究如何训练大语言模型在长期游戏中决策,提出CAST方法,利用游戏求解器状态值变化转化为求解器优势并注入RLVR,在多个游戏中优于基线,实现高平均零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏