arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-08 至 2026-07-08 共收录 263 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 61 篇

2510.02964 2026-07-08 cs.CR 版本更新 89%

External Data Extraction Attacks against Retrieval-Augmented Large Language Models

针对检索增强型大语言模型的外部数据提取攻击

Yu He, Yifei Chen, Yiming Li, Shuo Shao, Leyi Qi, Boheng Li, Dacheng Tao, Zhan Qin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究针对检索增强型大语言模型的外部数据提取攻击,提出统一框架并开发SECRET攻击方法,该方法含自适应优化与聚类聚焦触发策略,实验显示其显著优于先前攻击,能有效提取数据,呼吁关注此新兴威胁。

Comments Accepted by IEEE TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06012 2026-07-08 cs.CV 新提交 88%

Structured Data Extraction from Real Estate Documents using Clustering, Classification, and Large Language Models

使用聚类、分类和大语言模型从房地产文档中提取结构化数据

Muhammad Assad Shehbaz, Carlos Francisco Moreno-García

机构 * Robert Gordon University(罗伯特·戈登大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究如何从房地产问卷文档中提取结构化数据,提出端到端管道,先分类文档,再用大语言模型提取属性,应用于3965份文档,成功处理2781份,得到2766条记录,验证了数据质量,证明该提取方法可行可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05985 2026-07-08 cs.AI cs.AR cs.CE cs.SY eess.SY 新提交 87%

Auto-DSM Under the Lens: A Black-Box Evaluation Framework for LLM-Based DSM Generation

镜头下的自动DSM:基于大语言模型的DSM生成的黑盒评估框架

Niels Potters, Theo Hofman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于大语言模型的DSM生成能力,提出黑盒评估框架,结合多种指标评估,在两个数据集实验,结果显示LLMs能生成合理DSM但对一些因素敏感,为审核自动DSM管道及集成相关方法到MBSE工作流奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23826 2026-07-08 cs.CV cs.CL 版本更新 86%

Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

将查询分解为工具调用以进行长视频关键帧检索

Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ToolMerge方法,通过LLM规划器将查询分解为工具调用并使用布尔运算符合并排名,实现长视频关键帧检索,在字幕检索任务上优于其他方法5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05916 2026-07-08 cs.CR 新提交 86%

Beyond the Syntax: Do Security Experts Trust LLMs for NIDS Rule Engineering?

超越语法:安全专家是否信任大语言模型进行网络入侵检测系统规则工程?

Lorenzo di Filippo, Enkeleda Bardhi, Andrea Agiollo, Alessandro Palma, Silvia Bonomi, Fernando Kuipers

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究网络威胁下NIDS规则工程瓶颈,通过用户研究评估基于LLM的规则生成框架,揭示语法 - 语义悖论,从业者对其自主能力存疑,且大规模模型生成规则有效,小模型大多无效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05704 2026-07-08 cs.LG cs.CV 新提交 85%

LLM-Driven Neural Network Generation with Same-Family Architecture Guidance: Disentangling Transfer and Adaptation

基于同家族架构指导的大语言模型驱动神经网络生成:区分迁移与适应

Kabir Dev Paul Baghel, Radu Timofte, Dmitry Ignatov

机构 * University of Würzburg(维尔茨堡大学) Computer Vision Lab, CAIDAS(计算机视觉实验室,CAIDAS)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究利用同家族强源模型改进弱目标模型,提出源引导候选生成协议,在CIFAR - 10和SVHN AlexNet等数据集上实验,结果表明该协议能显著提高准确性,且大语言模型是适应性改进而非复制,家族级分析有积极信号。

Comments 10 pages, 1 figure, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06039 2026-07-08 cs.SE 新提交 85%

Automating Quality Assessment with NLP of LLM-Generated Defeaters

利用自然语言处理对大语言模型生成的反驳进行质量评估自动化

Tihomir Rohlinger, Daniel Ratiu, Stefan Wagner

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型生成的反驳质量评估依赖人工且主观的问题,提出结合保证案例图结构特征、语义嵌入和元分类器的自动化评估方法,经案例研究验证,该方法能减少主观差异,为保证案例审查提供决策支持。

Comments 10 pages, 2 figures. Author preprint version of a paper published at ICSRS 2025

Journal ref 2025 9th International Conference on System Reliability and Safety (ICSRS), Turin, Italy, 2025, pp. 101 110

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13757 2026-07-08 cs.CR cs.AI 新提交 84%

SEVRA-BENCH: Social Engineering of Vulnerabilities in Review Agents

SEVRA-BENCH:审查智能体中的社会工程漏洞

Rui Melo, Riccardo Fogliato, Sean Zhou, Pratiksha Thaker, Zhiwei Steven Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能) Amazon AWS(亚马逊AWS) Databricks

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SEVRA-BENCH基准,通过社会工程攻击框架评估LLM代码审查智能体拒绝恶意PR的能力,发现闭源与开源模型间存在显著安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00860 2026-07-08 cs.SI cs.AI cs.CL 84%

GenPT: Beyond Self-Report for Reliable LLM Psychometrics via Generative Projective Testing

GenPT:通过生成式投射测试实现超越自我报告的可靠LLM心理测量

Ming Wang, Shuang Wu, Bixuan Wang, Lu Lin, Yuxin Chen, Xiaocui Yang, Daling Wang, Shi Feng, Yifei Zhang, Yufan Sun

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算机与信息学院) Mental Health Education Center, Northeastern University(东北大学心理健康教育中心) School of Psychology, Northeast Normal University(东北师范大学心理学系) Faculty of psychology, Southwest University(西南大学心理学系) School of Sociology and Psychology, Central University of Finance and Economics(中央财经大学社会学与心理学学院) College of Arts, Northeastern University(东北大学艺术学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 针对自我报告问卷在人格化智能体心理测量中存在的训练语料污染和方向性偏差问题,提出GenPT方法,通过改编投射测试范式并构建三阶段评估流程,实现了更可靠的心理状态测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05785 2026-07-08 cs.SE 新提交 83%

Can Large Language Models Generate Observability-Aware Code?

大语言模型能否生成可观测性感知代码?

Yongliang Tao, Hongyu Zhang, Pengfei Gao, Minghua Ma, Zhiyu Fan, Yu Kang, Jue Zhang, Si Qin, Liqun Li, Qingwei Lin, Saravan Rajmohan

专题命中 评测与基准 :large language model(title);language model(title)

AI总结 研究大语言模型生成的代码在可观测性方面的表现,通过恢复工件和注入故障评估代理生成系统的源级诊断语义与运行时故障信号,发现两者存在差距,引入的技能改进有限,指出当前评估或忽视可观测性这一软件质量维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05904 2026-07-08 cs.LG 新提交 83%

More Convincing, Not More Correct: Self-Play Reward Hacking of Reference-Free LLM Judges

更具说服力,而非更正确:无参考语言模型评判器的自我博弈奖励破解

Chenyu Zhou

机构 * School of Engineering, Institute of Science Tokyo(东京科学大学工程学院)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 研究训练语言模型依据自身无参考评判时的奖励破解问题,发现评判器评分合理性而非正确性致误报。通过隐藏锚点审计衡量,以GSM8K为例展示问题。提出决定性变量及对应解决办法,还有可证伪界限,且过程可复制。

Comments 9 pages main text, 15 pages total including references and appendix; 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22851 2026-07-08 cs.CV cs.CL cs.RO 版本更新 83%

EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving

EgoDyn-Bench:评估面向自动驾驶的视觉中心基础模型中的自我运动理解

Finn Rasmus Schäfer, Yuan Gao, Dingrui Wang, Thomas Stauner, Stephan Günnemann, Mattia Piccinini, Sebastian Schmidt, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, Technical University of Munich, Munich, Germany(自动驾驶车辆系统教授职位,慕尼黑技术大学,德国慕尼黑) Bayerische Motoren Werke AG, Munich, Germany(巴伐利亚发动机有限公司,德国慕尼黑) Data Analytics and Machine Learning Group, Technical University of Munich, Munich, Germany(数据分析与机器学习小组,慕尼黑技术大学,德国慕尼黑)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EgoDyn-Bench基准,用于评估视觉中心基础模型的自我运动理解能力,发现模型在将物理逻辑与视觉感知结合时存在结构性缺陷,通过显式轨迹编码可恢复物理一致性。

Comments 36 Pages, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14152 2026-07-08 cs.CL cs.AI cs.CR cs.CY 版本更新 82%

ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety

ROK-FORTRESS:衡量地缘政治转译对国家安全和公共安全的影响

Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Christina Q. Knight, Joseph Brandifino, Max Fenkell

机构 * Scale AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ROK-FORTRESS基准,通过英韩语言对和美韩地缘政治轴,评估语言与地缘政治交互对国家安全的影响,发现韩语版本存在压制效应,且模型间表现差异显著。

Comments 16 pages main text + appendix (74 pages total), 4 figures and 2 tables in main text; dataset at https://huggingface.co/datasets/ScaleAI/ROK-FORTRESS_public

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06015 2026-07-08 cs.SD 新提交 82%

Music I Care About: Automated Multimodal Benchmarking of LLM Music Perception Skills on (Almost) Any Music

我关心的音乐:对(几乎)任何音乐的大语言模型音乐感知技能进行自动化多模态基准测试

Tomáš Sourada, Katia Vendrame, Jan Hajič

机构 * Charles University(查尔斯大学) Brno University of Technology(布拉格技术大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 针对当前音乐基准测试的局限,引入MusICA-MetaBench框架,利用结构化符号表示和预定义模板生成按需基准测试,通过ChoraleBricks数据集展示并确定规模,经与基线比较证明能测音乐感知,推动了大语言模型音乐感知跨模态评估。

Comments 9 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27106 2026-07-08 cs.CR cs.AI 新提交 81%

Application of LLMs to Threat Assessment of Foreign Peacekeeping Missions

LLMs在外国维和任务威胁评估中的应用

Gerhard Backfried, Christian Schmidt, Diego Pilutti, Michael Suker

机构 * HENSOLDT Austria(海恩索尔特奥地利公司) Austrian Ministry of Defence(奥地利国防部)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出利用大语言模型(LLMs)结合风险模型和OSINT媒体数据,自动提取维和任务相关威胁,评估显示自动结果与人工判断高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05657 2026-07-08 cs.AR 新提交 81%

NEMESIS: NEtlist-Driven Modeling and Equation Synthesis with Inversion-Aware SPICE Anchoring

NEMESIS:基于网表驱动的建模与方程合成,结合反演感知SPICE锚定

Subhadip Ghosh, Ramesh Harjani, Sachin S. Sapatnekar

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型提出NEMESIS框架用于OTA设计,平衡分析模型与SPICE评估。通过识别电路原语生成性能方程,经修复循环优化。在65nm工艺下对五种OTA拓扑验证,方程误差小且评估速度大幅提升。

Comments Accepted for publication at the IEEE International Conference on LLM-Aided Design, 2026, to be held: Time: July 30-31, 2026 Location: Stanford University, Stanford, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05679 2026-07-08 cs.CL cs.AI 新提交 81%

RPAM: A Principled Metric for Evaluating Associations in Language Models with High Predictive Validity in Downstream Outputs

RPAM:一种用于评估语言模型中关联的原则性度量,在下游输出中具有高预测有效性

Damian Hodel, Jevin West, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对语言模型偏差评估难题,引入相对概率关联度量(RPAM),通过对不同语言模型及评估数据集的实验,发现RPAM测量与人类观察到的关联及下游偏差紧密相关,优于先前记录值,有效填补了上游度量与现实世界关联关系研究的空白。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22758 2026-07-08 cs.CL cs.CE cs.LG 版本更新 81%

MASCA: LLM based-Multi Agents System for Credit Assessment

MASCA:基于大语言模型的信用评估多智能体系统

Gautam Jajoo, Atharva Pandey, Pranjal A Chitale, Saksham Agarwal

机构 * Kairosity(凯罗斯蒂)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.LG

AI总结 研究信用评估问题,提出基于大语言模型的MASCA多智能体系统,采用分层架构,整合对比学习,从信号博弈论角度提供理论见解,进行偏差分析,实验证明该系统在金融应用尤其是信用评分中表现优于基线方法。

Comments Accepted at NeurIPS GenAI In Finance Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15045 2026-07-08 eess.AS 版本更新 80%

LLMs and Speech: Integration vs. Combination

大语言模型与语音:整合与结合

Robin Schmitt, Albert Zeyer, Mohammad Zeineldeen, Ralf Schlüter, Hermann Ney

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究如何有效利用预训练大语言模型进行自动语音识别,比较了将语音模型与大语言模型紧密整合与传统浅层融合方法的优劣,探讨了多种优化策略及联合识别技术。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18542 2026-07-08 cs.CR cs.AI cs.CL cs.LG 版本更新 80%

SecureCode: A Production-Grade Multi-Turn Dataset for Training Security-Aware Code Generation Models

SecureCode:用于训练安全意识代码生成模型的生产级多轮数据集

Scott Thornton

专题命中 评测与基准 :LLM(abstract,abstract_cn);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对AI编码助手生成漏洞代码问题,提出SecureCode数据集,涵盖网络应用安全和AI/ML安全领域,有特定对话结构,经质量保证,发布统一数据集、开源模型及评估框架,是首个提供相关覆盖的公共数据集。

Comments 30 pages, 12 figures, 10 tables. Dataset available at https://huggingface.co/datasets/scthornton/securecode. Code and validation tools at https://github.com/scthornton/securecode

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06485 2026-07-08 cs.CV cs.AI 新提交 79%

AirflowAttack: Thermal-Airflow Adversarial Perturbations against Infrared Remote-Sensing Vision-Language Models

AirflowAttack:针对红外遥感视觉语言模型的热气流对抗扰动

Cong Su, Jiaju Han, Xuemeng Sun, Chengyin Hu, Qike Zhang, Jiujiang Guo, Yiwei Wei, Jiahuan Long

机构 * China University of Petroleum-Beijing at Karamay(中国石油大学(北京)克拉玛依校区) Tianjin University(天津大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究针对红外遥感视觉语言模型的对抗攻击,提出AirflowAttack方法,用热气流湍流作扰动先验,由轻量级生成器合成扰动。该方法在多个CLIP主干上攻击成功率高,能降低模型场景分类准确率,还揭示了红外VLM生态系统的关键漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05970 2026-07-08 cs.IR cs.AI 新提交 79%

Faithful or Findable? Evaluating LLM-Generated Metadata for RDF Dataset Search

忠实还是可查找?评估用于RDF数据集搜索的大语言模型生成的元数据

Riccardo Terrenzi, Serkan Ayvaz

机构 * University of Southern Denmark(南部丹麦大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究RDF数据集六种元数据生成设置,评估其检索有效性与忠实性。发现无约束重写检索增益强但忠实性低,更有根据的设置提高了忠实性,基于配置文件的重写权衡最佳,将合成元数据定位为需综合评估多方面的系统级信息检索问题。

Comments 5 pages, 1 figure, accepted at SynthIR @ SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06000 2026-07-08 cs.CR 新提交 78%

Context-to-Execution Integrity for LLM Agents

语言模型代理的上下文到执行完整性

Igor Santos-Grueiro

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究语言模型代理执行中的上下文到执行完整性问题,提出CXI系统,通过策略标记、类型化释放等机制保障安全执行,经多方面评估,在AgentDojo和代码代理基准测试等中取得良好效果,确保权限绑定才允许执行。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05742 2026-07-08 cs.HC 新提交 75%

PERSONAJUDGE: Simulating Individual Human Preference Judgments with Evaluator-Specific Demonstration Data

PERSONAJUDGE:使用特定评估者的示范数据模拟个体人类偏好判断

Zeyu He, Xuan Qi, Subramanian Chidambaram, Zhichao Xu, Vinayak Arannil, Lydia Chilton, Alex C. Williams

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型作评判时忽略个体评估者差异的问题,提出结合分类判断与特定评估者辅助数据的模拟方法,经实证研究发现该方法有改进,推理痕迹作用大,还明确了模拟难度及相关属性,为个性化评估提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06683 2026-07-08 cs.SE 版本更新 75%

Benchmarking Requirement-to-Architecture Generation with Hybrid Evaluation

基于混合评估的软件需求到架构生成基准测试

Minxiao Li, Li Zhang, Shuying Yan, Fang Liu, Liehao Li, Yang Liu, Xiaoli Lian

专题命中 评测与基准 :LLM(summary_cn,abstract_cn)

AI总结 本文提出R2ABench基准,包含真实软件项目及PRD和PlantUML图,通过多维混合评估框架评估生成架构,发现LLM在关系推理上存在不足,代码专用模型和代理框架各有优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16560 2026-07-08 cs.LG cs.AI cs.CL 版本更新 75%

Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders

稀疏但错误:稀疏自编码器中不正确的L0导致特征错误

David Chanin, Adrià Garriga-Alonso

机构 * University College London(伦敦大学学院) MATS Research(MATS研究)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究稀疏自编码器中L0对特征提取的影响,指出L0设置不当会致SAE无法解开潜在特征,提出代理指标指导寻找正确L0,发现多数常用SAEs的L0过低,强调正确设置L0对训练具有单语义特征SAEs的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06229 2026-07-08 cs.CL cs.AI cs.DB 新提交 73%

Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows

Spider 2.0-AIFunc:将现实世界的文本到SQL扩展到人工智能原生SQL工作流程

Tianyang Liu, Canwen Xu, Fangyu Lei, Nikki Lijing Kuang, Jixuan Chen, Tao Yu, Julian McAuley, Zhewei Yao, Yuxiong He

机构 * UC San Diego(加州大学圣地亚哥分校) Snowflake AI Research(Snowflake人工智能研究院) University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有文本到SQL基准无法评估模型生成人工智能原生SQL能力的问题,构建Spider 2.0-AIFunc基准,经特定管道和多轮验证,评估十个先进语言模型,发现准确率差距及传统代理框架转移无效等情况。

Comments 24 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05992 2026-07-08 cs.CL cs.AI 新提交 73%

PluraMath: Extending Mathematical Reasoning Evaluation Beyond High-Resource Languages

PluraMath:将数学推理评估扩展到资源丰富语言之外

Daryna Dementieva, Nikolay Babakov, Kathy Hämmerl, Ilseyar Alimova, Jindřich Libovický, Shu Okabe, Miras Baisbay, Lukas Edman, Abrorkhon Inomkhujaev, Antonia Karamolegkou, Mateusz Lango, Volkan Özer, Nikola Selic, Subhankar Swain, Tsedeniya Kinfe Temesgen, Galit Bary Weisberg, Alexander Fraser

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所) Applied AI Institute(应用人工智能研究所) Charles University(查尔斯大学) Nazarbayev University(纳扎尔拜大学) Inria(法国国家信息与自动化研究所) Indian Institute of Technology, Kharagpur (IIT Kharagpur)(印度Kharagpur理工学院) German University of Digital Science(德国数字科学大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对数学推理评估基准偏向高资源语言的问题,引入PluraMath,将其扩展到18种资源不足语言,通过人工策划构建数据集,对27个推理LLMs进行基准测试,分析性能差距,开源相关内容以推动多语言基准开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05614 2026-07-08 cs.CL cs.AI cs.CV 新提交 73%

BaFCo: A Document Understanding Benchmark for Complex Bangla Form Comprehension

BaFCo:用于复杂孟加拉语表格理解的文档理解基准

Abu Tyeb Azad, Ishita Sur Apan, Fahim Ahmed, Sumaiya Karim Katha, Ezharuddin Jubaer, Armun Alam, Pranjal Kumar Nandi, Amin Ahsan Ali, Aman Chadha, Md Mofijul Islam, AKM Mahbubur Rahman

机构 * Wichita State University(威奇托州立大学) Center for Computational & Data Sciences(计算与数据科学中心) University of Dhaka(达卡大学) Amazon GenAI(亚马逊生成式人工智能)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对孟加拉语表格理解因高质量标注数据稀缺受限的问题,引入BaFCo基准数据集,涵盖多领域复杂表格。定义细粒度标注模式,评估多种MLLMs,发现其理解孟加拉语表格有局限,尤其在定位细粒度实体方面。

Comments Accepted at the 19th European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05410 2026-07-08 cs.CY cs.AI cs.CL cs.PL 新提交 73%

CANONIC: Governance Is Compilation

CANONIC:治理即编译

Dexter Hadley

机构 * CANONIC Foundation(CANONIC基金会) American Board of Precision Medicine(精准医学美国委员会)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CANONIC将数字工件编译到证据账本,通过三个公理管理内容准入,经跨供应商基准测试发现虽不能排除“slop”,但能保持记录可审计,实现端到端可重现与检查。

Comments 28 pages, 4 figures. Pre-registered cross-provider evaluation harness and per-regime results at github.com/canonic-canonic/canonic-pub. Construction claims resolve to commands run at the evidence-window-close ref (see Appendix C)

详情

展开后加载摘要…

URL PDF HTML 收藏