arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-07 至 2026-07-07 共收录 712 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 164 篇

2607.03298 2026-07-07 cs.LG cs.AI econ.GN physics.ao-ph q-fin.EC 新提交 81%

A harmonised dataset for Earth system foundation models

用于地球系统基础模型的统一数据集

Carlos Rodriguez-Pardo, Massimo Tavoni

机构 * Politecnico di Milano, Department of Management, Economics and Industrial Engineering(米兰理工大学管理、经济与工业工程系) RFF-CMCC European Institute on Economics and the Environment(资源未来研究所-欧洲经济与环境CMCC研究所) CMCC Foundation - Euro-Mediterranean Center on Climate Change(CMCC基金会-欧洲地中海气候变化中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对地球系统基础模型训练数据缺乏统一资源的问题,构建WorldTensor数据集,整合多类数据到标准网格,为训练和评估模型提供资源,推动多模态地球系统基础模型发展。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00190 2026-07-07 cs.LG cs.AI 版本更新 81%

OSF: On Pre-training and Scaling of Sleep Foundation Models

OSF:关于睡眠基础模型的预训练和扩展

Zitao Shuai, Zongzhe Xu, David Yang, Wei Wang, Yuzhe Yang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Emory University(埃默里大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 为填补睡眠基础模型预训练和扩展理解空白,创建睡眠记录语料库及基准,评估预训练目标,发现关键结论,引入OSF家族模型取得多样任务最优性能并揭示其特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18253 2026-07-07 cs.CL cs.AI 版本更新 81%

BoRP: Bootstrapped Regression Probing for Scalable and Human-Aligned LLM Evaluation

BoRP:用于可扩展且符合人类偏好的大语言模型评估的自训练回归探测

Peng Sun, Xiangyu Zhang, Duan Wu, Lu Tan, Jian Lin, He Yang, Qi Qian, Yikai Wang

机构 * Qwen Business Unit of Alibaba(阿里巴巴Qwen业务单元)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对开放式对话AI用户满意度评估难题,提出BoRP框架。利用大语言模型潜在空间几何属性,通过极化指数自训练机制自动生成评分准则,用偏最小二乘法映射隐藏状态到连续分数,提升评估准确性与效率。

Comments This is a pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05171 2026-07-07 cs.CL 新提交 79%

RABBiT: Rapidly adaptive BOLD foundation model via brain-tuning for accurate zero-shot and few-shot prediction of speech-elicited responses in the brain

RABBiT:基于脑调优的快速自适应BOLD基础模型,用于脑内语音诱发响应的精准零样本与少样本预测

Omer Moussa, Mariya Toneva

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL

AI总结 针对脑语言理解泛化难问题,提出RABBiT紧凑音频-fMRI编码器,依托脑调优等创新实现跨被试跨场景语音诱发脑响应的高精度零/少样本预测,支撑规模化脑语言分析。

Comments Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04576 2026-07-07 cs.CL cs.CY cs.IR 新提交 79%

Progressive Disclosure for LLM-Maintained Wiki Knowledge Bases: a Preregistered Ablation

大语言模型维护的维基知识库的渐进式披露:一项预注册的对比研究

Theodore O. Cochran

机构 * AI for Altruism (A4A)(人工智能促进利他主义组织)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对大语言模型维护的维基知识库,通过预注册对比研究,改造知识库实现渐进式披露。虽原节省索引加载成本未实现,但答案质量达标且成本降低,源于更有针对性的访问。

Comments 14 pages, 2 figures, 6 tables. Preregistered on OSF (https://osf.io/feka7, DOI 10.17605/OSF.IO/FEKA7). Materials-availability and deviations described in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04528 2026-07-07 cs.AI 新提交 79%

Measuring Harness-Induced Belief Divergence in Multi-Step LLM Agents

测量多步语言模型智能体中工具诱导的信念差异

Haiwen Yi, Xinyuan Song

机构 * University of Toronto(多伦多大学) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究多步语言模型智能体中工具对其信念的影响,引入信念展开诊断,定义跨工具信念差异并分解,通过实验表明工具设计是智能体评估中的实验变量。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02623 2026-07-07 cs.LG cs.SY eess.SY 新提交 79%

Evaluating Time Series Foundation Models for Electricity Price Forecasting: Contamination Risk, Distributional Shifts, and Covariate Dependence

评估用于电价预测的时间序列基础模型:污染风险、分布变化和协变量依赖性

Zhenghua Pan, Ahmed Aziz Ezzat

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 针对电价预测中时间序列基础模型在协变量驱动、非平稳设置下泛化不足的问题,提出双数据集基准框架,评估其多方面表现,发现该模型有竞争力但性能依赖协变量支持,简单集成有潜力。

Journal ref ICML 2026 Foundation Models for Structured Data Workshop, 43rd International Conference on Machine Learning (ICML), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02599 2026-07-07 cs.SE cs.AI cs.LO 新提交 79%

AgentLTL: A Trace-Verification Framework for Measuring, Enforcing, and Training Procedural Compliance in Tool-Using LLM Agents

AgentLTL:一种用于测量、执行和训练使用工具的语言模型代理程序合规性的跟踪验证框架

Laïla Elkoussy, Julien Perez

机构 * EPITA Bpifrance

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 介绍基于一阶线性时态逻辑的AgentLTL语言,用于表达代理跟踪的程序规则,产生确定性无评判的合规分数,此框架可用于约束和微调,提升模型合规性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02575 2026-07-07 cs.CV cs.AI 新提交 79%

Criterion-Conditional In-Context Learning: Evaluating Criterion-Shift Adaptation in Vision-Language Models

标准条件上下文学习:评估视觉语言模型中的标准转移适应性

Kaiyun Yang, Ruilin Yang, Zhimin Yao, J. Wang, Wei Ge

机构 * Megvii Technology Inc., Beijing, China(美科科技有限公司,北京,中国)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究提出标准条件上下文学习(CC-ICL)新设置,模型需从上下文推断潜在标准并据此调整预测。为此提出两个评估指标,构建CC-Bench基准。实验发现多数模型有边界偏差,简单多标准训练可改善。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06857 2026-07-07 cs.CL 新提交 79%

Interpreting Brain Responses to Language with Sparse Features from Language Models

用语言模型稀疏特征解释大脑对语言的响应

Michael A. Lepori, Kendrick Kay, Greta Tuckute

机构 * Brown University(布朗大学) University of Minnesota(明尼苏达大学) Harvard University(哈佛大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 提出增强稀疏编码模型,用分层稀疏自编码器特征替代密集LM隐状态,并加入惊奇度预测器,解释大脑语言皮层响应,发现前颞叶语言网络由共同特征预测,且大脑响应与LM中最通用的特征对应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17248 2026-07-07 eess.AS cs.CL cs.SD 版本更新 79%

VIBE: Voice-Induced open-ended Bias Evaluation for Large Audio-Language Models via Real-World Speech

VIBE:通过真实世界语音进行大型音频-语言模型生成偏见评估的语音诱导开放式偏见评估

Yi-Cheng Lin, Yusuke Hirota, Sung-Feng Huang, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(台湾大学通信工程研究所) NVIDIA, Taiwan(台湾NVIDIA) Artificial Intelligence Center of Research Excellence, National Taiwan University, Taiwan(台湾大学人工智能卓越研究中心)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 VIBE通过真实世界语音的开放式任务评估大型音频-语言模型的生成偏见,揭示了性别线索比口音线索更易引发分布偏移,表明当前模型复现了社会刻板印象。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08467 2026-07-07 cs.CV cs.LG eess.IV 版本更新 79%

Zero-Shot Distracted Driver Detection via Vision Language Models with Double Decoupling

基于双解耦视觉语言模型的零样本分心驾驶员检测

Takamichi Miyata, Sumiko Miyata, Andrew Morris

机构 * Chiba Institute of Technology(千叶工业大学) Institute of Science Tokyo(东京科学大学) Loughborough University(拉夫堡大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 提出一种主体解耦框架,通过提取驾驶员外观嵌入并从图像嵌入中移除其影响,再结合度量投影正交化文本嵌入,实现零样本分心驾驶检测,显著提升实际场景性能。

Comments Accepted to IEEE 15th International Symposium on Communication Systems, Networks and Digital Signal Processing (CSNDSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06643 2026-07-07 cs.SE cs.CL 版本更新 79%

Is Your Benchmark Still Useful? Dynamic Benchmarking for Code Language Models

你的基准仍然有用吗?代码语言模型的动态基准测试

Batu Guan, Xiao Wu, Yuanyuan Yuan, Shaohua Li

机构 * The Chinese University of Hong Kong(香港中文大学) Huazhong University of Science and Technology(华中科技大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究模型评估中如何在模型训练可能已见过基准的情况下保持其有用性,提出动态基准测试框架,通过语义保留突变变换输入构建新基准,评估发现模型性能变差、排名变化及能抵抗数据污染问题。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03091 2026-07-07 cs.AI cs.CL cs.CY cs.MA stat.ME 新提交 79%

Silicon Sampling via Cross-Survey Transfer

通过跨调查转移进行硅采样

Chan-Tung Ku, Chan Hsu, Pei-Cing Huang, Frank Cheng-shan Liu, I-Ling Cheng, Yihuang Kang

机构 * National Sun Yat-sen University(国立中山大学) National Chung Hsing University(中国台湾国立中兴大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究提出跨调查转移评估框架,用大语言模型根据部分问题答案预测同调查中其他不同问题答案。利用2024年台湾选举与民主化研究数据等,发现零样本大语言模型精度及不同结构可预测性层级等,明确硅采样前景与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20659 2026-07-07 cs.AI cs.LG cs.SE 新提交 79%

Skill Coverage: A Test Adequacy Metric for Agent Skills

技能覆盖率:一种用于智能体技能的测试充分性度量

Boyin Tan, Xiaowei Huang, Youcheng Sun

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Liverpool(利物浦大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出技能覆盖率度量,通过提取技能文档中的行为约束并评估智能体轨迹是否提供足够证据来测试技能,发现现有基准仅覆盖39.90%-43.98%的约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05291 2026-07-07 q-fin.ST econ.EM 新提交 78%

Forecasting Realized Volatility with Time Series Foundation Models: A Comparison with Econometric Benchmarks

使用时间序列基础模型预测已实现波动率:与计量经济学基准的比较

Alessio Brini

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究预训练时间序列基础模型能否改进已实现波动率预测的计量经济学基准。通过对多种模型在多资产多预测期测试比较,发现基础模型优势集中于少数资产,简单平均模型表现良好,选对模型架构更重要。

Comments 5 figures, 41 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05264 2026-07-07 cs.CV 新提交 78%

SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments

SteelBench:真实工业环境下的视觉语言模型评估基准

Suryanarayana Reddy Yarrabothula, Manisha Chawla, Kunal Sinha, Gagan Raj Gupta, Sashank Lekkala, Ashirvadhan Dosapati, Saikamal Nannuri, Katragadda Ajay RamaSwamy Chowdary Gowtham

机构 * Indian Institute of Technology Bhilai(印度理工学院比莱分校) Steel Authority of India Limited(印度钢铁管理局有限公司) VIT Vellore(维洛尔理工学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对现有基准无法适配真实工业监控场景的问题,构建含1345条标注片段的SteelBench基准,评估视觉语言模型的工业活动识别、安全规则推理等能力,发现现有模型性能远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05197 2026-07-07 cs.SE 新提交 78%

Is Three the Magic Number? An Empirical Evaluation of LLM-Based Repair Loops

三是神奇数字吗?基于大语言模型的修复循环的实证评估

Tobias Kiecker, Eik Reichmann, Hosung Kang, Gabin An, Lars Grunske

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究基于大语言模型的修复循环迭代限制,通过多个软件工程任务观察到收益递减模式,前几次迭代收获大,后续贡献小,还发现修复行为受工作流编排和反馈设计影响更大。

Comments 4 Pages (+1 for references), NIER Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02857 2026-07-07 cs.CR cs.SE 新提交 78%

MOSAIC: Knowledge-Guided CLI Command Composition Attack in LLM Coding Agents

MOSAIC:大语言模型编码代理中知识引导的命令行命令组合攻击

Jiangrong Wu, Huaijin Wang, Yihao Zhang, Yuhong Nan, Shuai Wang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究大语言模型编码代理中CLI命令组合风险,提出知识引导框架MOSAIC,从漏洞等提取命令状态行为总结成攻击路径,实例化开发者工作流程,通过多实验得高攻击成功率。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02853 2026-07-07 cs.CV cs.SE 新提交 78%

Prior Bias in Vision Language Models on UML Diagram Interpretation

视觉语言模型在UML图解释中的先验偏差

Zaiyu Cheng, Khai-Nguyen Nguyen, Antonio Mastropaolo

机构 * Dept. of Computer Science(计算机科学系) William & Mary, USA(威廉玛丽学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究视觉语言模型在UML图解释时是依据先验知识还是真正理解图表。通过引入对比基准测试,评估多个模型,发现反转关系箭头会降低开源模型关系方向准确率,不同模型表现有差异,揭示先验驱动的理解故障。

Comments 16 pages, 14 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02605 2026-07-07 cs.SE 新提交 78%

A Survey of LLM-Driven Penetration Testing: Taxonomy, Co-Evolution, and Open Challenges

大语言模型驱动的渗透测试综述:分类法、共同演化及开放挑战

Zheyuan He, Jiaxun Dong, Zihao Li, Ting Chen, Gelei Deng, Feng Luo, Jinkun Ji, Yuanlong Cao, Xiapu Luo

专题命中 评测与基准 :LLM(title,abstract)

AI总结 通过系统分析2023至2026年间81篇论文,梳理大语言模型驱动的渗透测试文献分类,追溯架构四阶段演化,指出关键发现,识别出评估可靠性等三个开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02604 2026-07-07 cs.CV cs.RO 新提交 78%

DynaWM: A Base-VLA-Guided World Foundation Model for Moving-Object Manipulation

DynaWM:用于移动物体操纵的基于基础VLA的世界基础模型

Chongkei Chang, Zhidong Deng

机构 * Department of Computer Science and Technology, THUAI, Tsinghua University, Beijing 100084, China(计算机科学与技术系,THUAI,清华大学,北京100084,中国)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 针对移动物体操纵挑战,提出DynaWM模型,用多种编码器提取特征,联合条件流匹配DiT生成动作轨迹,构建数据集评估,相比其他模型有性能提升,消融实验验证各部分作用。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25312 2026-07-07 cs.CV 新提交 78%

LEVIRDet: A Million-Scale 159-Category Dataset and Foundation Model for Universal Remote Sensing Object Detection

LEVIRDet: 用于通用遥感目标检测的百万级159类数据集与基础模型

Qinzhe Yang, Dongyu Wang, Haohan Niu, Jia Xu, Zhenwei Shi, Zhengxia Zou

机构 * Shen Yuan Honors College, Beihang University(北京航空航天大学沈元荣誉学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Qian Xuesen Laboratory of Space Technology, China Academy of Space Technology(中国空间技术研究院钱学森空间技术实验室)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 提出包含159类、256万边界框的遥感目标检测数据集LEVIRDet-159,并设计尺度层次感知检测基础模型LEVIRDetNet,在9个外部基准上无需微调即达到SOTA,平均mAP提升5.02。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15177 2026-07-07 cs.SD cs.MM eess.AS 版本更新 78%

Audio-Language Models for Audio-Centric Tasks: A Systematic Survey

用于以音频为中心任务的音频-语言模型:系统综述

Yi Su, Jisheng Bai, Qisheng Xu, Kele Xu, Yong Dou

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) School of Communications and Information Engineering, Xi’an University of Posts and Telecommunications(通信与信息工程学院,西安邮电大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 对基于配对音频-文本数据训练的音频-语言模型进行系统综述,涵盖语音、音乐和声音,给出统一分类法,建立研究框架,助研究者了解技术发展与趋势,为应用提供参考。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05202 2026-07-07 cs.AI 新提交 77%

EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer

EvoAgentBench:通过能力迁移评测智能体自进化的基准平台

Xingze Gao, Chuanrui Hu, Hongda Chen, Pengfei Yao, Zhao Wang, Yi Bai, Zhengwei Wu, Yunyun Han, Xiaofeng Cong, Jie Gui, Yafeng Deng, Teng Li

机构 * Anhui University(安徽大学) EverMind, Shanda Group(盛趣游戏灵眸智能科技) Southeast University(东南大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对现有评测无法分离大语言模型智能体程序性经验迁移的问题,提出跨四领域的EvoAgentBench基准,可将自进化评测转为对经验编码、路由与吸收的细粒度诊断。

Comments 15 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04433 2026-07-07 cs.IR cs.CL 新提交 77%

Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems

自主信息寻求:智能推荐系统路线图

Xinyu Lin, Yashar Deldjoo, Sunhao Dai, Honghui Bao, Xiaopeng Ye, Fatemeh Nazary, Wenjie Wang, Tommaso Di Noia, Jun Xu, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Polytechnic University of Bari(巴里理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 综述基于大语言模型的智能体融入推荐系统带来的转变,介绍基于自主性水平的分类法及三种核心范式,分析各范式采用的架构和智能体对关键组件的增强,探讨评估方法及未解决问题,指出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03702 2026-07-07 cs.AI 新提交 77%

Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry

通过关键感知自反馈重试的智能体强化学习

Weiyang Guo, Zesheng Shi, Longhui Zhang, Zeen Zhu, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型智能体在处理失败轨迹时的问题,提出PivoARL框架,通过结构化反思识别关键错误转向并局部重试,减少冗余交互,设计关键感知信用分配机制,实验证明该方法能显著提升性能。

Comments 26pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23816 2026-07-07 cs.SE cs.AI 版本更新 77%

Query2Diagram: Answering Developer Queries with UML Diagrams

Query2Diagram:通过UML图回答开发者查询

Oleg Baryshnikov, Anton M. Alekseev, Sergey I. Nikolenko

机构 * HSE University(俄罗斯高等经济学院) St. Petersburg Department of Steklov Mathematical Institute, RAS(圣彼得堡斯捷克洛夫数学研究所(俄罗斯科学院)) St. Petersburg State University(圣彼得堡国立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文提出基于LLM的UML图生成方法,通过微调Qwen2.5-Coder-14B模型,生成语义聚焦的代码图谱,提升文档生成的准确性和实用性。

Comments 20 pages, 6 figures. Code: https://github.com/i-need-a-pencil/query2diagram

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00660 2026-07-07 cs.DB cs.AI 版本更新 77%

Streaming Model Cascades for Semantic SQL

流式模型级联用于语义SQL

Paweł Liskowski, Kyle Schmaus

机构 * Snowflake Inc.(雪花公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出两种流式模型级联算法,用于在分布式系统中高效处理语义SQL查询,通过迭代阈值优化和联合精度召回保证提升效率与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20629 2026-07-07 cs.LG 版本更新 77%

QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs

QEDBENCH:量化大学水平数学证明自动评估中的对齐差距

Santiago Gonzalez, Alireza Amiri Bavandpour, Peter Ye, Edward Zhang, Ruslans Aleksejevs, Todor Antić, Polina Baron, Sujeet Bhalerao, Shubhrajit Bhattacharya, Zachary Burton, John Byrne, Hyungjun Choi, Nujhat Ahmed Disha, Koppany István Encz, Yuchen Fang, Robert Joseph George, Ebrahim Ghorbani, Alan Goldfarb, Jing Guo, Meghal Gupta, Stefano Huber, Annika Kanckos, Minjung Kang, Hyun Jong Kim, Dino Lorenzini, Levi Lorenzo, Tianyi Mao, Giovanni Marzenta, Ariane M. Masuda, Lukas Mauth, Ana Mickovic, Andres Miniguano-Trujillo, Antoine Moulin, Wenqi Ni, Tomos Parry, Kevin Ren, Hossein Roodbarani, Mathieu Rundström, Manjil Saikia, Detchat Samart, Rebecca Steiner, Connor Stewart, Dhara Thakkar, Jeffrey Tse, Vasiliki Velona, Yunhai Xiang, Sibel Yalçın, Jun Yan, Ji Zeng, Arman Cohan, Quanquan C. Liu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究大语言模型自动评估的可靠性,引入QEDBench基准,通过对比特定课程评分标准与专家常识标准,测量与人类专家的对齐情况,揭示部分前沿评估器偏差及离散领域推理差距,还发布该基准用于评估改进AI裁判。

详情

展开后加载摘要…

URL PDF HTML 收藏