arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 877 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 190 篇

2603.22868 2026-05-12 cs.CR cs.AI 87%

Agent-Sentry: Bounding LLM Agents via Execution Provenance

Agent-Sentry: 通过执行溯源界定了LLM代理

Rohan Sequeira, Stavros Damianakis, Umar Iqbal, Konstantinos Psounis

机构 * University of Southern California(南加州大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Agent Sentry,通过学习代理良性执行的边界来检测恶意行为,有效阻止注入攻击,同时允许良性执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09348 2026-05-12 cs.CL cs.AI cs.DB cs.MM 87%

HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities

HOME-KGQA:一个多模态知识图谱问答基准数据集用于家庭日常活动

Shusaku Egami, Aoi Ohta, Tomoki Tsujimura, Masaki Asada, Tatsuya Ishigaki, Ken Fukuda, Masahiro Hamasaki, Hiroya Takamura

机构 * National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HOME-KGQA基准数据集,用于多模态知识图谱问答,包含多跳自然语言问题和图数据库查询语言,挑战多级时空推理和多模态 grounding。实验表明基于LLM的KGQA方法在该数据集上表现不佳,凸显实际部署中KGQA系统的挑战。

Comments 12 pages, 4 figures, 7 tables, accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17283 2026-05-12 cs.CL cs.AI 87%

Towards Cross-lingual Values Judgment: A Consensus-Pluralism Perspective

迈向跨语言价值判断:一种共识多元主义视角

Yukun Chen, Xinyu Zhang, Boyi Deng, Jialong Tang, Yu Wan, Fei Huang, Yuxi Zhou, Baosong Yang, Yiming Li

机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高科技园区(滨江)区块链与数据安全研究院) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出X-Value基准,用于评估LLM跨语言判断内容深层价值的能力,通过两阶段人机协作标注框架解决文化多样性和学科复杂性挑战,涵盖14种语言7大全球议题类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09514 2026-05-12 cs.CL cs.AI 87%

EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies

EcoGym:评估基于LLM的长周期计划与执行能力于交互经济中

Xavier Hu, Jinxiang Xia, Shengze Xu, Kangqi Song, Yishuo Yuan, Guibin Zhang, JinCheng Ren, Boyu Feng, Li Lu, Tieyong Zeng, Jiaheng Liu, Minghao Liu, He Zhu, Yuchen Eleanor Jiang, Wei Wang, Wangchunshu Zhou

机构 * OPPO-PersonalAI(OPPO-个人AI)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI

AI总结 EcoGym提出一个通用基准,用于评估LLM在交互经济中的长周期计划与执行能力,通过三个环境展示不同策略和行动的优化挑战。

Comments update

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08178 2026-05-12 cs.AI 86%

Aligning Agents via Planning: A Benchmark for Trajectory-Level Reward Modeling

通过规划对齐代理:一个轨迹级奖励建模的基准测试

Jiaxuan Wang, Yulan Hu, Wenjin Yang, Zheng Pan, Xin Li, Lan-Zhe Guo

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) AMAP, Alibaba Group(阿里集团AMAP)

专题命中 评测与基准 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Plan-RewardBench,用于评估奖励模型在复杂工具使用场景中区分优选与干扰代理轨迹的能力,揭示了代理级奖励建模在长周期轨迹上的挑战。

Comments accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08687 2026-05-12 cs.DB cs.AI 86%

PrepBench: How Far Are We from Natural-Language-Driven Data Preparation?

PrepBench: 我们距离自然语言驱动的数据准备还有多远?

Jingzhe Xu, Rui Wang, Jiannan Wang, Guoliang Li

机构 * Department of Computer Science and Technology, BNRist, Tsinghua University(计算机科学与技术系,BNRist,清华大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PrepBench评估自然语言驱动的数据准备能力,涵盖交互澄清、代码生成和代码到工作流翻译三项核心能力,通过爬取数据挑战并设计系统性基准,揭示当前LLM在实现该范式转变中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00327 2026-05-12 cs.AI cs.HC 86%

SayNext-Bench: Why Do LLMs Struggle with Next-Utterance Anticipation?

SayNext-Bench:为什么LLMs在下一句预测中挣扎?

Yueyi Yang, Haotian Liu, Fang Kang, Mengqi Zhang, Zheng Lian, Hao Tang, Haoyu Chen

机构 * University of Oulu(奥卢大学) College of William and Mary(威廉与玛丽学院) Tongji University(同济大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨LLM在人类对话中的下一句预测能力,指出人类可通过多模态线索预测,而LLM表现不足。提出SayNext-Bench基准,结合多模态数据集和评估框架,开发SayNext-Chat模型,证明其在多层面优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00149 2026-05-12 physics.comp-ph 86%

Towards Verifiable and Self-Correcting AI Physicists for Quantum Many-Body Simulations

迈向量子多体模拟的可验证和自校正人工智能物理学家

Ken Deng, Xiangfei Wang, Guijing Duan, Chen Mo, Junkun Huang, Runqing Zhang, Ling Qian, Zhiguo Huang, Jize Han, Di Luo

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出QMP-Bench基准和PhysVEC框架,通过自验证和纠错机制提升AI在量子多体模拟中的可靠性与准确性,显著优于现有LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08104 2026-05-12 cs.CR 86%

AgentCrypt: Advancing Privacy and (Secure) Computation in AI Agent Collaboration

AgentCrypt: 推动AI代理协作中的隐私与(安全)计算发展

Harish Karthikeyan, Yue Guo, Leo de Castro, Antigoni Polychroniadou, Udari Madhushani Sehwag, Leo Ardon, Sumitra Ganesh, Manuela Veloso

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 AgentCrypt通过三层框架提升AI代理协作中的隐私和安全计算,解决传统访问控制不足和LLM安全性的不足问题,实现数据安全计算和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10639 2026-05-12 cs.AI 85%

Navigating the Sea of LLM Evaluation: Investigating Bias in Toxicity Benchmarks

在LLM评估之海中航行:探究毒性基准中的偏见

Regina Gugg, Selina Niederländer, Andreas Stöckl, Martin Flechl

机构 * Dynatrace Research, Linz, Austria(奥地利林茨Dynatrace研究机构) University of Applied Sciences Upper Austria, Hagenberg, Austria(上奥地利应用科学大学哈根贝格分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了毒性基准的鲁棒性,发现评估设置变化会导致基准行为差异,任务类型改变会增加有害内容被标记的倾向,且输入数据域变化时基准表现不稳定,需更完善的评估框架。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08800 2026-05-12 cs.CV cs.AI 85%

PPU-Bench:Real World Benchmark for Personalized Partial Unlearning in Vision Language Models

PPU-Bench: 用于视觉语言模型个性化部分遗忘的现实世界基准

Jiahui Guang, Zexun Zhan, Zhenlin Xu, Cuiyun Gao, Haiyan Wang, Jing Li, Zhaoquan Gu, Yanchun Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学) Zhejiang Normal University(浙江师范大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出PPU-Bench,一个无需微调的现实世界基准,用于评估视觉语言模型中个性化部分遗忘的效果,通过24K多模态和单模态样本测试遗忘与保留的平衡及跨模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09147 2026-05-12 cs.CL cs.AI stat.AP 85%

From Traditional Taggers to LLMs: A Comparative Study of POS Tagging for Medieval Romance Languages

从传统标注器到LLMs:一种中世纪罗曼语词性标注的比较研究

Matthias Schöffel, Esteban Garces Arias

机构 * Bavarian Academy of Sciences (BAdW)(巴伐利亚科学院) Department of Statistics, LMU Munich, Germany(慕尼黑大学统计系) Munich Center for Machine Learning (MCML), LMU Munich, Germany(慕尼黑机器学习中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文比较了传统规则和统计标注器与现代开源LLMs在中世纪罗曼语词性标注中的表现,发现LLMs在零样本、少样本、单语微调和跨语言迁移学习中均表现更优,尤其在资源匮乏语言中跨语言迁移学习效果显著。

Comments Accepted at NLP4DH @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10739 2026-05-12 eess.IV cs.AI cs.CV 84%

Geospatial-Temporal Sensemaking of Remote Sensing Activity Detections with Multimodal Large Language Model

基于多模态大语言模型的遥感活动检测的时空感知

David F. Ramirez, Tim Overman, Kristen Jaskie, Andreas Spanias

机构 * SenSIP Center, School of ECEE, Arizona State University(SenSIP中心,电子与计算机工程学院,亚利桑那州立大学) Prime Solutions Group Inc(Prime Solutions Group公司) Intelligence Advanced Research Projects Activity(智能高级研究计划局)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

AI总结 本文提出SMART-HC-VQA数据集,用于人类活动的时空分析,通过多模态大语言模型训练框架实现遥感活动的检测与推理。

Comments Accepted to 2026 SPIE Defense + Security, Automatic Target Recognition XXXVI

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09295 2026-05-12 cs.CL 84%

LEAF-SQL: Level-wise Exploration with Adaptive Fine-graining for Text-to-SQL Skeleton Prediction

LEAF-SQL: 基于分层探索与自适应细化的文本到SQL骨架预测

Zhao Tan, Xiping Liu, Qing Shu, Qizhi Wan, Dexi Liu, Changxuan Wan

机构 * School of Computing(计算学院) Artificial Intelligence(人工智能) Jiangxi University of Finance(江西财经大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 LEAF-SQL通过分层探索与自适应细化方法,提升复杂SQL生成性能,实验表明其在BIRD基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08094 2026-05-12 cs.CY cs.AI 84%

MedThink: Enhancing Diagnostic Accuracy in Small Models via Teacher-Guided Reasoning Correction

MedThink: 通过教师引导的推理校正提升小模型的诊断准确性

Xinchun Su, Chunxu Luo, Lipeng Ma, Yixuan Li, Weidong Yang

机构 * School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机学院,上海,中国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 MedThink通过两阶段知识蒸馏框架提升小语言模型的临床推理能力,在医疗基准测试和胃肠病数据集上均优于传统方法,提升诊断准确率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08924 2026-05-12 cs.CE 83%

PPI2Text: Captioning Protein-Protein Interactions with Coordinate-Aligned Pair-Map Decoding

PPI2Text:基于坐标对齐的配对映射解码进行蛋白质-蛋白质相互作用描述

Xiao Fei, Sarah Almeida Carneiro, Yang Zhang, Lawrence P. Petalidis, Achilleas Tsortos, Costas Bouyioukos, Michalis Vazirgiannis

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 PPI2Text通过自由文本描述蛋白质-蛋白质相互作用,利用ESM3编码器和Qwen3解码器生成更丰富的表达,提升可解释性和文献整合能力,同时引入PaCo-RoPE位置编码和PPI2Text-Dataset数据集,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13332 2026-05-12 cs.AI cs.CL 83%

Explicit Reasoning Makes Better Judges: A Systematic Study on Accuracy, Efficiency, and Robustness

显式推理使评判更可靠:对准确性、效率和鲁棒性的系统研究

Pratik Jayarao, Himanshu Gupta, Neeraj Varshney, Chaitanya Dwivedi

机构 * Arizona State University(亚利桑那州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract,comments);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比显式推理与非显式推理模型在RewardBench任务中的表现,发现显式推理模型在准确性、效率和鲁棒性上均优于非显式模型,且在多语言环境下也表现出优势。

Comments Accepted in 2025 NeurIPS Foundations of Reasoning in Language Models Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10614 2026-05-12 cs.AI 83%

PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines

PRISM:多智能体大语言模型管道中生成时间的秘密泄漏检测与缓解

Riya Tapwal, Abhishek Kumar, Carsten Maple

机构 * School of Computing and Electrical Engineering(计算与电子工程学院) Indian Institute of Technology, Mandi (IIT)(印度理工学院,曼迪(IIT)) The Alan Turing Institute, London(阿兰·图灵研究所,伦敦) University of Warwick(沃里克大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 PRISM通过实时检测生成过程中的风险累积,利用16种特征信号预测并阻止敏感信息泄露,有效提升安全性和输出实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10528 2026-05-12 cond-mat.stat-mech cs.CL cs.MA physics.soc-ph 83%

Collective Alignment in LLM Multi-Agent Systems: Disentangling Bias from Cooperation via Statistical Physics

大语言模型多智能体系统中的集体对齐:通过统计物理方法分离偏见与合作

Cristiano De Nobili

机构 * Critiqality

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 研究通过统计物理方法分析大语言模型多智能体系统在二维正方形晶格中的集体动态,揭示社会从众与内在偏见的分离,计算临界指数并探测多智能体系统的集体行为与可能相变。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09808 2026-05-12 cs.CL 83%

Quantifying the Utility of User Simulators for Building Collaborative LLM Assistants

量化用户模拟器在构建协作大语言模型助手中的效用

Joseph Suh, Ayush Raj, Minwoo Kang, Serina Chang

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文通过实验评估用户模拟器的质量,发现基于细调模拟器训练的助手在真实人类交互中表现更优,且模拟器规模扩大对细调模拟器有效,但对角色扮演模拟器无帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02954 2026-05-12 cs.SD cs.AI 83%

The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models

世界并非单一声场:为大型音频-语言模型启用空间理解

Yuhuan You, Lai Wei, Xihong Wu, Tianshu Qu

机构 * School of Intelligence Science and Technology(智能科学与技术学院)

专题命中 评测与基准 :language model(title,abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出TWNM框架,通过物理基础的FOA模拟和元数据引导训练,实现音频场景分析的三层次能力,提升空间音频语言理解的准确性和可审计性。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09104 2026-05-12 cs.AI 83%

Token Economics for LLM Agents: A Dual-View Study from Computing and Economics

大语言模型代理的代币经济学:从计算和经济学的双重视角研究

Yuxi Chen, Junming Chen, Chenyu He, Yiwei Li, Yicheng Ji, Yifan Wu, Dingyu Yang, Lansong Diao, Lidan Shou, Hongliang Zhang, Huan Li, Gang Chen

机构 * College of Computer Science and Technology Zhejiang University(浙江大学计算机科学与技术学院) School of Economics Zhejiang University(浙江大学经济学院) The State Key Laboratory of Blockchain and Data Security Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Alibaba Cloud(阿里云)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文从计算与经济学双重视角,首次系统探讨代币经济学,提出四维分类框架,涵盖单代理、多代理系统、代理生态系统及安全领域,旨在解决输出质量与经济成本的平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20251 2026-05-12 stat.ML cs.LG 83%

Efficient Evaluation of LLM Performance with Statistical Guarantees

高效评估大语言模型性能的统计保证

Skyler Wu, Yash Nair, Emmanuel J. Candès

机构 * Department of Statistics(统计学系)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Factorized Active Querying方法,在有限查询预算下通过统计推断提升模型准确率的置信区间,实现有效样本量提升5倍,支持可重复评估。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18256 2026-05-12 cs.LG cs.AI 82%

MolRGen: A Training and Evaluation Setting for De Novo Molecular Generation with Reasonning Models

MolRGen:一种用于从头分子生成的训练和评估设置

Philippe Formont, Maxime Darrin, Ismail Ben Ayed, Pablo Piantanida

机构 * Université Paris-Saclay(巴黎萨克雷大学) ÉTS Montréal(蒙特利尔ÉTS) ILLS – International Laboratory on Learning Systems(学习系统国际实验室) Mila – Quebec AI Institute(魁北克人工智能研究所) Mistral AI LIVIA CNRS, CentraleSupélec(国家科学研究中心,中央超导大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MolRGen,一种用于训练和评估基于推理的分子生成模型的基准测试平台,通过多目标优化提示结合结合亲和力评分和分子性质,评估从头生成的分子,并引入多样性感知的top-k指标和GRPO算法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10027 2026-05-12 cs.CL cs.AI 82%

Speech-based Psychological Crisis Assessment using LLMs

基于语音的心理危机评估使用大语言模型

Terumi Chiba, Yang Luo, Ziyun Cui, Yongsheng Tong, Chao Zhang

机构 * Tsinghua University(清华大学) Peking University Huilongguan Clinical Medical School(北京大学回龙guan临床医学院) WHO Collaborating Centre for Research and Training in Suicide Prevention(世界卫生组织自杀预防研究与培训协作中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大语言模型自动分类危机等级,通过引入语音学注入方法和增强推理训练策略,提升热线服务质量。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07024 2026-05-12 cs.LG cs.AI 82%

Delulu: A Verified Multi-Lingual Benchmark for Code Hallucination Detection in Fill-in-the-Middle Tasks

Delulu:一种经过验证的多语言基准,用于检测填充中间任务中的代码幻觉

Mahdi Erfanian, Nelson Daniel Troncoso, Aashna Garg, Amabel Gale, Xiaoyu Liu, Pareesa Ameneh Golnari, Shengyu Fu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft(微软)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Delulu是一个包含1951个跨7种语言和4种幻觉类型的填充中间任务样本的多语言基准,通过对抗性流程筛选出经过验证的样本,评估了11种开放式FIM模型,证明了任务内在难度而非模型家族特定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02510 2026-05-12 cs.CL cs.AI stat.ML 82%

Top-H Decoding: Adapting the Creativity and Coherence with Bounded Entropy in Text Generation

顶部H解码:在受限制的熵下适应创造力和连贯性

Erfan Baghaei Potraghloo, Seyedarmin Azizi, Souvik Kundu, Massoud Pedram

机构 * University of Southern California(南加州大学) Intel AI(英特尔人工智能)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出top-H解码,通过熵约束最小散度问题提升文本生成的创造力与连贯性,实验证明其在创意写作任务中优于现有方法,且在问答数据集上表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09186 2026-05-12 cs.AI cs.CL 82%

Agentic MIP Research: Accelerated Constraint Handler Generation

代理MIP研究:加速约束处理程序生成

Liding Xu, Yugeng Zhou, Sebastian Pokutta

机构 * Zuse Institute Berlin(柏林泽尼茨研究所) Technische Universität Berlin(柏林技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于代理的MIP研究框架,通过嵌入LLM代理生成、验证和评估SCIP求解器的插件,加速约束处理程序的开发。该框架在MIPLIB 2017基准上成功恢复了约束编程中的全局约束结构,并生成了可执行的约束检测器和仅传播的约束处理程序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08838 2026-05-12 cs.CL cs.AI 82%

Generating Leakage-Free Benchmarks for Robust RAG Evaluation

生成无泄漏的基准以评估鲁棒的RAG

Jiayi Liu, Jiaxing Zhang, Bowen Jin, Jennifer Neville

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) New Jersey Institute of Technology(新泽西理工学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SeedRG方法,通过半合成方式生成无知识泄漏的RAG评估基准,解决基准老化问题,确保评估的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08498 2026-05-12 cs.LG cs.AI cs.LO 82%

MathConstraint: Automated Generation of Verified Combinatorial Reasoning Instances for LLMs

MathConstraint:为LLMs自动生成验证的组合推理实例

Viresh Pati, Zhengyu Li, Piyush Jha, Rahul Garg, Yatharth Sejpal, Vijay Ganesh

机构 * Georgia Institute of Technology, USA(佐治亚理工学院) KNOWIDEA Technologies(KNOWIDEA技术公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 MathConstraint是一个用于评估LLMs组合推理能力的严格适应性基准,通过结合约束满足问题和严格求解器验证,生成持续具有挑战性的实例,展示基准生成器对LLM推理能力进步的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏