arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2607.25921 2026-07-29 cs.CV cs.AI 新提交 70%

Evaluating VLMs for Autonomous Agent-Driven Geometry Clipping Detection in Video Game QA

评估用于视频游戏QA中自主代理驱动的几何裁剪检测的视觉语言模型

Carlos Celemin, Benedict Wilkins, Adrián Barahona-Ríos, Saman Zadtootaghaj, Nabajeet Barman

机构 * Sony Interactive Entertainment(索尼互动娱乐)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究在代理驱动游戏QA中用VLMs检测几何裁剪异常,通过自定义代理收集视觉观察,自动注释提供标签,在零样本提示下对六个VLMs基准测试,分析对提示变体的敏感性,结果显示VLMs适合作多阶段QA管道的高召回候选过滤器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25648 2026-07-29 cs.CY cs.AI 新提交 70%

Why Public Service AI Governance Frameworks Risk Failing in the Age of General-Purpose AI: Lessons from Policing

为何公共服务人工智能治理框架在通用人工智能时代面临失败风险:来自警务领域的教训

Sam Relins, Daniel Birks

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究公共服务中通用人工智能治理框架面临的风险,以警务为例,指出其特性破坏安全条件,常用缓解措施失效,建议明确分类、技术简约、暂停部署并建立国家安全基础设施。

Comments Preprint; submitted for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25642 2026-07-29 cs.CV cs.CL 新提交 70%

Instruction-based Image Editing: A Survey on Data, Models, Evaluation, and Applications

基于指令的图像编辑:数据、模型、评估及应用综述

Xianghao Zang, Zijian Jiang, Jiarong Cheng, Qianrui Teng, Ying He, Yuxuan Mu, Chao Ban, Huayu Zhang, Lanxiang Zhou, Zerun Feng, Chi Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 综述基于指令的图像编辑研究,围绕任务定义、数据构建、模型架构、评估指标及商业应用五个维度展开,提出综合深度诊断基准,通过开源方案比较揭示优缺点,探讨未来研究方向以推动该领域发展。

Comments 33 pages, 7 figures, Vicinagearth

Journal ref Zang, X., Jiang, Z., Cheng, J. et al. Instruction-based image editing: a survey on data, models, evaluation, and applications. Vicinagearth 3, 3 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25218 2026-07-29 cs.AI 新提交 70%

Everyone is unique: Towards Behaviorally Heterogeneous Negotiation Dialogue Systems for Debt Collection

每个人都是独特的:迈向用于债务催收的行为异质性协商对话系统

Yuhang Yang, Kai Tang, Chao Ye, Haobo Wang, Qiqi Luo, Jinguang Zheng, Zhixin Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对债务催收场景中现有基准无法体现用户行为异质性的问题,提出DebtBench基准并开发DebtGPT代理,用16个先进LLMs实验,发现多数模型表现不佳,DebtGPT优于开源基线且性能与GPT-4o相当。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24856 2026-07-29 cs.CV cs.AI 新提交 70%

DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization

DisasterTD:使用多模态大语言模型和跨视角地理定位的灾害地名消歧

Wenping Yin, Ziqi Liu, Naixia Mou, Weijia Li, Danfeng Hong, Hao Li

机构 * College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院) School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Automation, Southeast University(东南大学自动化学院) Department of Geography, National University of Singapore(新加坡国立大学地理系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对社交媒体图像地理参考模糊问题,提出DisasterTD框架,集成多模态大语言模型语义推理与跨视角地理定位,在飓风哈维数据集上评估,该方法优于基线,能有效进行细粒度灾害地理定位,提升不同距离下的定位准确率并减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23722 2026-07-28 cs.AI 新提交 70%

E-Bench: Benchmarking Multi-Step Tool-Use Agents in Real-World Product Scenarios

E-Bench:在现实世界产品场景中对多步工具使用智能体进行基准测试

Weihuang Zheng, Tianyuan Zou, Eileen Ye, Alphet Liu, Youyong Kong, Ya-Qin Zhang, Duran Zheng, Maxm Pan

机构 * Hunyuan Team, Tencent(腾讯混元团队) Institute for AI Industry Research, Tsinghua University(清华大学人工智能产业研究院) School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型多步工具使用能力,介绍E-Bench基准测试,通过解耦环境与任务合成构建可扩展可控测试平台,对11个前沿模型测试发现多步工具使用仍具挑战,即便结合代码执行可靠性也不高。

Comments 29 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23425 2026-07-28 cs.SE cs.AI 新提交 70%

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation

TLA$^{+}$-Bench:用于自然语言到TLA+规范生成的基于执行的基准测试和数据集

Arslan Bisharat, Eric Spencer, Brian Ortiz, Khushboo Bhadauria, Mujtaba Nazari, Beatriz Santos, Anisa Ramos, TaiNing Wang, George K. Thiruvathukal, Konstantin Läufer, Mohammed Abuhamad

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型编写TLA$^{+}$规范进展难测问题,提出TLA$^{+}$-Bench数据集和基准测试,基于执行评级。通过该基准测试发现评级选择影响正确率,存在正确性包络,且模型编写有效规范多但正确规范少,正确性随难度下降。

Comments 17 pages, appendix included. Introduces TLA+-Bench, an execution-grounded benchmark and dataset for natural-language to TLA$^{+}$ specification generation. Dataset, evaluation code, and model outputs available at publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23326 2026-07-28 cs.AI 新提交 70%

ESF-Bench: Benchmarking Challenging Slot-Filling Scenarios for Real-World Enterprise Applications

ESF-Bench:针对现实世界企业应用的具有挑战性的槽填充场景基准测试

Toby Liang, Gopal Sarda, Sagar Davasam, Vikas Yadav

机构 * ServiceNow(ServiceNow公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型在企业实际部署中槽填充面临的挑战,介绍ESF-Bench基准,它含多轮样本和槽,跨越多个领域,揭示了当前模型局限性,还公开了数据集、分类法及评估代码以推动该领域研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23147 2026-07-28 cs.CR cs.AI 新提交 70%

False Prophets: On the Security of World Models in Agentic Systems

虚假预言:论智能体系统中世界模型的安全性

Erik Imgrund, Anna Wimbauer, Klim Kireev, Konrad Rieck

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究智能体系统中世界模型的安全性,发现其存在特定漏洞,引入安全基准数据集,指出攻击者能诱导错误预测,成功率达95%,并为从业者提供减轻危害、强化系统的实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23123 2026-07-28 cs.AI 新提交 70%

SQBench: A Benchmark for Evaluating Task Delivery by Language-Model Agents in Production-Oriented Workflows

SQBench:用于评估面向生产工作流程中语言模型代理任务交付的基准测试

Summer Sun

机构 * Shaqiu Community(沙丘社区)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究面向生产工作流程中语言模型代理任务交付评估问题,核心方法是引入SQBench基准测试,包含多种任务并按特定方式评估,主要贡献是揭示功能完成度不能完全体现交付质量,风险判定需单独报告。

Comments 17 pages, 8 figures. Code and aggregate results: https://github.com/shaqiu-ai/SQBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22632 2026-07-28 cs.AI 新提交 70%

VlogReward: Learning Multi-Dimensional Evaluation for Vlog Editing

VlogReward:学习用于Vlog编辑的多维评估

Yexiang Liu, Wen Zhong, Sijie Zhu, Xin Gu, Fan Chen, Junxian Duan, Jie Cao, Longyin Wen, Zhenfang Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对Vlog评估主观性强且缺乏标准等问题,提出VlogReward模型。通过专业指导定义评估框架,构建数据集和基准,增强GRPO框架。该模型能提供多维分数与反馈,优于现有MLLMs,助力Vlog创作者及自动化评估完善系统。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21832 2026-07-27 cs.SE cs.LG 新提交 70%

How Do AI Coding Agents Contribute to Software Development? an Empirical Study of Agentic Pull Requests

人工智能编码代理如何为软件开发做出贡献?对代理拉取请求的实证研究

Iren Mazloomzadeh, Mohammad Mehdi Morovati, Foutse Khomh

机构 * Polytechnique Montréal(蒙特利尔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究人工智能编码代理对软件开发的贡献,通过AIDev数据集,分析代理与人工生成PR的合并率差异、任务分布及关键特征,从实证和纵向角度理解其在软件开发中的作用、优点及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21445 2026-07-24 cs.CL 新提交 70%

When Trivia Is Not Trivial: Everyday Knowledge Failures in Multilingual LLMs

当琐事并非微不足道:多语言大语言模型中的日常知识缺陷

Anna Mosolova, Djamé Seddah

机构 * INRIA Paris(法国国家信息与自动化研究所巴黎分部)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究用问答式问题测试多语言大语言模型在各类主题上的表现,引入TriviaRoomQA基准评估其日常等知识,发现模型在知识密集型主题强,流行文化主题弱,且性能因语言而异,揭示了现有基准未捕捉的知识差距。

Comments submitted to the ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20730 2026-07-24 cs.CR cs.AI 新提交 70%

GPE: Evaluating Robust Evidence Aggregation for Fact Verification under Controllable GEO-Style Poisoning

GPE:在可控的地理风格中毒情况下评估用于事实核查的稳健证据聚合

Zhaoqi Wang, Zijian Zhang, Xiaomei Yuan, Pengtao Kou, Jiamou Liu, Zhen Li, Liehuang Zhu

机构 * School of Cyberspace Science and Technology, Beijing Institute of Technology(航天信息科学技术学院,北京理工大学) School of Computer Science, The University of Auckland(计算机科学学院,奥克兰大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大型语言模型利用搜索工具时文档可能被操纵的问题,提出GPE,包含多领域事实核查基准及评估框架,通过实验证明其能揭示仅干净评估无法发现的稳健性下降与效率权衡,凸显对抗性证据环境下评估事实核查的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20589 2026-07-24 cs.CL 新提交 70%

Evaluating the Effectiveness of Persona Simulation in Opinion Prediction with GPT-4.1

用GPT-4.1评估角色模拟在观点预测中的有效性

Sarah Y. Li, Ziyu Yao

机构 * Columbia University(哥伦比亚大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究用GPT-4.1测试角色模拟在观点预测中的有效性,利用相关数据集进行实验,在选举结果和医学观点预测上取得一定成果,生成对话符合角色特点,解决偏差后角色模拟在多领域观点分析等应用前景广阔。

Comments ICDM 2025 Undergraduate and High School Symposium

Journal ref Proceedings of the 2025 IEEE International Conference on Data Mining Workshops (ICDMW), pp. 2938-2942

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20452 2026-07-24 cs.AI 新提交 70%

AINTMA: Agentic AI Architecture for Autonomous Test Management with Generative Intelligence, Secure Cloud Communication and Adaptive Quality Analytics

AINTMA:用于自主测试管理的智能AI架构,具备生成式智能、安全云通信和自适应质量分析

Vinil Pasupuleti, Shyalendar Reddy Allala, Siva Rama Krishna Varma Bayyavarapu, Shrey Tyagi, Srinivasateja Songa

机构 * International Business Machines (IBM)(国际商业机器公司(IBM)) Global Atlantic Financial(全球大西洋金融公司) Docusign(DocuSign公司) Salesforce Inc(Salesforce公司) The Home Depot(家得宝公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对现代软件质量保证需求,提出AINTMA多智能体AI系统。通过六个专门智能体及安全通信框架协调,结合生成式智能等技术。经实验评估,该系统在测试优先级、周期时间、缺陷逃逸率等方面表现出色,推进了云环境下软件质量管理。

Comments 11 pages, 2 figures, 4 tables, Submitted to AICCONS (AIP Conference Proceedings format)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20439 2026-07-24 cs.CL 新提交 70%

AsymVerify at SemEval-2026 Task 6: Asymmetric Confidence-Gated Verification for Political Evasion Detection

SemEval-2026任务6中的AsymVerify:用于政治逃避检测的非对称置信门控验证

Sebastien Kawada

机构 * Kaons 𝑲 ∗

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究针对政治逃避检测难题,提出AsymVerify系统用于SemEval-2026任务6的三元分类。核心方法是对问答对分类后对低置信预测进行非对称验证,主要贡献是取得高排名,在不同数据集上提升宏F1分数,且降低推理成本。

Comments Accepted to SemEval-2026 Task 6 (CLARITY) at ACL 2026. Team AsymVerify placed 2nd of 41 teams on the official Subtask 1 leaderboard. Task: https://konstantinosftw.github.io/CLARITY-SemEval-2026/. Code: https://github.com/kaons-research/AsymVerify-ACL. Website: https://kaons.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20437 2026-07-24 cs.CL cs.CR cs.IR 新提交 70%

TopoGuard: Graph Theory Based Defenses Against Split-Knowledge Attacks on RAG

TopoGuard:基于图论的针对RAG分裂知识攻击的防御方法

Chahana Dahal, Zuobin Xiong

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对RAG系统分裂知识攻击的防御,提出基于图论的TopoGuard方法,通过构建语义相似性图检测恶意拓扑。实验表明其在捕获攻击、运行效率和对抗性方面优于现有方法,有效防御分裂知识攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19409 2026-07-23 cs.AI 新提交 70%

FORCE-Bench: A Benchmark, Dataset, and Evaluation Harness for Agentic AI in Enterprise Finance

FORCE-Bench:企业金融中智能代理人工智能的基准测试、数据集和评估工具

Wolfgang M. Pauli, Sarah Panda, Kidus Admassu, Said Bleik, Ademola Okerinde, Jeremy Reynolds

机构 * Microsoft Corporation(微软公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对智能代理在企业金融领域应用,提出FORCE-Bench基准测试,含251个专家注释查询,从八个维度评估三种任务类型,在特定设置下评估通用和专用代理,结果显示专用代理更可靠,相关资源开源助力企业金融环境应用。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19108 2026-07-22 cs.AI 新提交 70%

OpenRTAG: A Comprehensive Benchmark for Robust Text-Attributed Graph Learning under Data Quality Degradation

OpenRTAG:数据质量退化下鲁棒文本属性图学习的综合基准

Yuze Dai, Zhihan Zhang, Yan Zhao, Ruoyu Wu, Xunkai Li, Zekai Chen, Qiangqiang Dai, Hongchao Qin, Ronghua Li

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对现实中TAGs存在质量问题影响学习的情况,提出OpenRTAG基准,将质量问题分类,支持多数据集和任务的标准化评估,能系统评估场景与模型,比较多种模型,研究基线情况及复合场景下模型行为,为理解TAG学习鲁棒性提供平台。

Comments 9 pages, 10 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18777 2026-07-22 cs.LG q-bio.MN 新提交 70%

PertReason: A Knowledge-Grounded Benchmark and Framework for Cell-State-Conditioned Mechanistic Reasoning of Perturbation Effects

PertReason:用于细胞状态条件下扰动效应机制推理的知识基础基准和框架

Dongkwan Kim, Yiming Gao, Yining Yang, Yang Shen

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究针对科学领域机器学习评估难题,引入PertReason基准和框架套件,通过PertReasonQA测试模型,结合多数据与知识图谱,发现现有模型预测与推理差距,提出PertReasonLM,为科学系统中忠实推理失败提供诊断框架。

Comments Preprint; 31 pages; Dongkwan Kim and Yiming Gao contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18325 2026-07-22 cs.CV cs.AI cs.RO 新提交 70%

Hazard or Anomaly? Evaluating VLMs for Understanding Dangers and Discrepancies

危险还是异常?评估用于理解危险和差异的视觉语言模型

Murali Indukuri, Mohammad Eskandari, Sree Nitya Kollu, Stephanie Lukin, Cynthia Matuszek

机构 * Interactive Robotics and Language Lab, University of Maryland Baltimore County(马里兰大学巴尔的摩县分校交互式机器人与语言实验室) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究针对现代安全关键系统中VLM的评估问题,通过明确区分危险和异常,在两个数据集及多种提示策略下评估多个先进VLM,发现其常误判,明确区分能提供更具信息性评估并揭示失败模式。

Comments 8 pages, accepted to RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18240 2026-07-22 cs.AI 新提交 70%

Calibrated Selective Fact-Checking via Evidence Chain Evaluation

通过证据链评估进行校准的选择性事实核查

Dekun Yang

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对大语言模型事实核查的可靠性问题,提出证据链评估框架ECE,通过网络搜索等收集证据并返回结构化裁决。在ECE - Bench上有较好表现,虽总体校准指标未超最强基线,但实现了选择性预测权衡,弃权可处理弱证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17288 2026-07-21 cs.DB cs.AI 新提交 70%

SAGA: Synthetic Agentic Graph Architecture for Temporal Benchmark Generation

SAGA:用于时间基准生成的合成智能体图架构

Jiacheng Ding, Xiaofei Zhang

机构 * University of Memphis(密苏里大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对时间图基准稀缺问题,SAGA系统通过四阶段管道生成大规模语义丰富的时间图,其架构解耦结构与语义,能实现结构真实性、语义丰富性和自动异常标注,在单个H100 GPU上高效生成大量带受控异常的时间边。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17269 2026-07-21 cs.AI cs.DB 新提交 70%

An Explicit World Model Based on Data-First Ontology: DaoQL Multimodal Storage Validation and Counterfactual Reasoning Evaluation

基于数据优先本体的显式世界模型:DaoQL多模态存储验证与反事实推理评估

Zhanbo Li, Shifeng Wu, Xiangjin Meng, Wenjie Cai

机构 * School of Mathematics and Statistics, Chongqing University(重庆大学数学与统计学院) Guangzhou Polytechnic Normal University(广州技术师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大型语言模型隐式编码世界模型的风险,提出数据优先本体并构建DaoQL多模态数据库。通过形式化显式世界模型,对比隐式模型优势。实验展示系统性能,如在反事实实验中DaoQL+GPT-4o可组合反事实可分解性大幅提升。

Comments 20 pages, 2 figures. Code: https://github.com/zhanbolee/DaoQL-Edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15883 2026-07-20 cs.HC cs.AI 新提交 70%

Perceived AGI: Believability as Dimensional Completeness, Not Capability

感知通用人工智能:可信度取决于维度完整性,而非能力

Sebastian Cochinescu

机构 * University of Bucharest(布加勒斯特大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨大语言模型在对话中缺乏思维存在感的问题,提出可信度取决于维度完整性的假设,定义了时间、真相、熵和爱四个维度及相关行为立场,识别出行为层,还陈述了可证伪预测,为感知通用人工智能提供概念框架。

Comments 12 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15766 2026-07-20 cs.CL 新提交 70%

Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery

行动之前:在前瞻性假设发现任务上对大语言模型进行基准测试

Tianyun Zhong, Wangyi Jiang, Wei Wang, Xuanang Chen, Yaojie Lu, Shiwei Ye, Yuzhen Shi, Boyu Yang, Jinghang Wang, Han Li, Weiqi Zhai, Bing Zhao, Hu Wei, Haiyang Yu, Yongbin Li, Hongyu Lin, Le Sun, Xianpei Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究旨在评估大语言模型在开放式结论前阶段的发现能力,引入前瞻性假设发现任务及评估框架HypoArena,提出回顾性上下文回归构建基准数据,实验揭示模型能力分层及效应,结果支持将其作为评估大语言模型制定调查方向的独特目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15641 2026-07-20 cs.RO cs.AI 新提交 70%

IMBench: A Benchmark for Intuitive Robotic Manipulation

IMBench:直观机器人操作的基准测试

Anurag Maurya, Sukhvansh Jain, Prajwal Avhad, Gautham Balachandran, Ziyi Zhou, Atharva Kshirsagar, Satyam Singh, Bowen Li. Rishabh Mukund, Ritul Singh, Jatin Vira, Suvonil Chatterjee, Devesh K. Jha

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 IMBench旨在评估直观机器人操作这一综合能力,其任务含物理结构推断与动作序列生成。通过35个任务等进行实验,发现视觉语言模型和视觉 - 语言 - 动作模型的不足,为评估和发展物理智能提供基准。

Comments Accepted to SemRob Workshop, RSS 2026. Project Website: https://imbench.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15592 2026-07-20 cs.AI 新提交 70%

MGDT: MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts for Multimodal Knowledge Graph Completion

MGDT:具有关系自适应专家混合的MLLM引导扩散变压器用于多模态知识图谱补全

Xu Hou, Meiyu Liang, Wei Huang, Yawen Li, Zhe Xue, Wu Liu, Guanhua Ye, Lei Shi, Kangkang Lu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Communication University of China(中国传媒大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态知识图谱补全问题,提出MGDT框架,先通过RASR-MoE模块选路径、抑干扰,再用MLLM对齐表示,最后KGDT去噪生成,实验证明该框架在三个基准数据集上性能优于基线。

Comments 8pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15092 2026-07-17 cs.CL 新提交 70%

Rubrics on Trial: Evolving Rubrics from a Single Query via Synthetic Pairwise Evidence

试验中的评分标准:通过合成成对证据从单个查询中演化评分标准

Haocheng Yang, Licheng Pan, Xiaoxi Li, Zhichao Chen, Zhiheng Zhang, Yuan Lu, Haoxuan Li, Hao Wang

机构 * School of Computing, National University of Singapore(新加坡国立大学计算学院) Xiaohongshu Inc.(小红书公司) School of Cyber Science and Technology, Zhejiang University(浙江大学网络空间安全学院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对构建可靠特定查询评分标准难的问题,提出“试验中的评分标准”框架,仅从查询演化评分标准集,靠合成响应对获取监督并验证,实验证明该框架有效,平均准确率最佳且在多数评估集领先。

详情

展开后加载摘要…

URL PDF HTML 收藏