arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2606.05792 2026-07-28 cs.AI cs.LG cs.LO cs.SE 62%

Can LLMs Write Correct TLA+ Specifications? Evaluating Natural-Language-to-TLA+ Generation

LLM 能写出正确的 TLA+ 规范吗?自然语言到 TLA+ 生成的评估

Arslan Bisharat, Brian Ortiz, Eric Spencer, Khushboo Bhadauria, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer, Mohammed Abuhamad

机构 * Department of Computer Science, Loyola University Chicago(洛约奈大学芝加哥分校计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统评估基于 LLM 从自然语言合成 TLA+ 规范的能力,发现模型在语义正确性上仅达 8.6%,且成功依赖于渐进式提示,揭示了模型大小与质量无关、代码专用模型表现不佳等关键发现。

Comments 12 pages, 11 tables. Accepted at the 21st International Conference on Software Technologies (ICSOFT 2026); Recommended as Best Paper Award Candidate

Journal ref ICSOFT 2026, pp. 39-50, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05515 2026-07-28 cs.AI cs.CL cs.CV 版本更新 62%

LEGO Co-builder: Exploring Fine-Grained Vision-Language Modeling for Multimodal LEGO Assembly Assistants

乐高协同构建器:探索用于多模态乐高组装助手的细粒度视觉语言建模

Haochen Huang, Yue Su, Xin Sun, Moonisa Ahsan, Mohammad Aliannejadi, Irene Viola, Zhaochun Ren, Chuang Yu, Aneta Lisowska, Artem Belopolsky, Koen Hindriks, Pablo Cesar, Junxiao Wang, Jiahuan Pei

机构 * Vrije University of Amsterdam University of Amsterdam Centrum Wiskunde \& Informatic University of Amsterdam National Institute of Informatics Centrum Wiskunde \& Informatic Centrum Wiskunde \& Informatic Leiden University University College London Vrije University of Amsterdam Centrum Wiskunde \& Informatica Technische Universiteit Delft Guangzhou University Vrije University of Amsterdam Centrum Wiskunde \& Informatic

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对视觉语言模型理解多模态组装指令的挑战,提出乐高协同构建器基准,引入统一框架评估多个VLMs及推理模型,发现物体检测性能高但细粒度场景理解和状态检测有挑战,还发布相关资源助力未来研究。

Comments This version has been accepted by ICMI 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22153 2026-07-27 cs.AI cs.LG 新提交 62%

Industrial Tokenization for LLM-Based Health Intelligence: A Federated Architecture for Industrial Evidence Integration

基于大语言模型的工业健康智能的工业令牌化:一种用于工业证据集成的联邦架构

Deshui Li, Xiao-Ming Yuan, Zishun Wang

机构 * Mingyang Smart Energy Co., Ltd.(明阳智慧能源集团股份有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究工业健康管理中异构信息源集成问题,提出工业令牌化概念及联邦架构,将特定源分析输出转为工业令牌,以实现跨源推理。给出基于振动诊断输出等的端到端诊断令牌路径,定位工业令牌化为语义接口。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20908 2026-07-24 cs.LG cs.AI 新提交 62%

Multi-turn RL with Structural and Performance Aware Rewards for CUDA Kernel Generation

用于 CUDA 内核生成的具有结构和性能感知奖励的多轮强化学习

Quazi Ishtiaque Mahmud, Nesreen K. Ahmed, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学) Cisco AI Research(思科人工智能研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对 CUDA 内核生成,提出 CudaPerf 框架,结合可验证执行奖励与结构代码感知奖励,分离线排序和在线训练两阶段,利用执行反馈迭代细化,通过实验证明其显著优于基线,在加速和正确性上有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20709 2026-07-24 cs.AI cs.CL 新提交 62%

NVIDIA-labs OO Agents: Native Python Object-Oriented Agents

NVIDIA实验室的OO智能体:原生Python面向对象智能体

Paul Furgale, Severin Klingler, James Nolan, Matt Staats, Gaia Di Lorenzo, Elisa Martinez Abad, Christian Schüller, Razvan Dinu, Alessio Devoto, Pascal Berard, Gal Kaplun, Elad Sarafian, Riccardo Roveri, Leon Derczynski, Ricardo Silveira Cabral

机构 * NVIDIA-labs(英伟达实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究提出NOOA这一Python框架构建可靠AI智能体,采用智能体即Python对象的编程模型,结合六个面向模型的理念,证明当前模型能有效使用此接口并在相关测试中表现良好,为智能体开发提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20558 2026-07-24 cs.LG cs.AI 新提交 62%

StabilityBench: Benchmarking Instability in LLMs

StabilityBench:评估大语言模型中的不稳定性

Emma Kondrup, Zachary Yang, Anne Imouza, Reihaneh Rabbany

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型实际行为难测、现有评估协议有局限的问题,提出StabilityBench基准测试工具,通过注入现实模拟增强现有基准,应用于四个基准测试评估九个模型,发现性能不稳定,还提出StabilityBench-Mini以实现更现实评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20526 2026-07-24 cs.AI cs.LG stat.ML 新提交 62%

ConfidenceBench: Evaluating Confidence Calibration in Large Language Models

ConfidenceBench:评估大语言模型中的置信度校准

Matthew ffrench-Constant, Daniel Yang, Xinmeng Huang, Sanyam Kapoor

机构 * ETH Zurich(苏黎世联邦理工学院) University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型在特定场景下仅靠准确性不足的问题,提出ConfidenceBench校准基准,用Brier分数评估15个前沿LLMs口头置信度,经实验发现模型准确性与校准差异大,证明口头置信度校准是LLM可靠性重要维度,补充了基于准确性的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20510 2026-07-24 cs.AI cs.CL 新提交 62%

Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain

电信-GAIA:电信领域智能体的双语基准测试

Dmitrii Khizbullin, Zaid Alyafeai, Abdelrahman Eldesokey, Nourah AlSultan, Raghad Alshalan, David R. Pugh, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) stc(沙特电信公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 介绍电信-GAIA双语多模态基准测试,含100个人工验证问答任务,需多跳推理,跨越多种异构源。以沙盒化Docker环境提供,通过规范化精确字符串匹配评分。评估发现其具有挑战性,为企业智能体提供测试平台和构建基准测试的模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19604 2026-07-23 cs.CL cs.LG 新提交 62%

Scaling Laws for Hypernetwork-Based Knowledge Injection in Large Language Models

基于超网络的大语言模型知识注入的缩放定律

Nischay Dhankhar, Dos Baha, Abulhair Saparov

机构 * Nace AI(Nace人工智能公司) Purdue University(普渡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型训练时知识注入问题,核心方法是用超网络生成LoRA适配器,主要贡献是发现超网络注入能力随规模变化规律,能可靠进行分布外泛化,为训练时适应提供新基础及缩放定律。

Comments Preprint, 22 pages, 14 figures. Dataset collection available at https://huggingface.co/collections/nace-ai/hypernetwork-datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19353 2026-07-23 cs.AI cs.LG 新提交 62%

Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX

在英特尔 TDX 下对 NVIDIA H100 上的机密 GPU 推理进行基准测试

Wei Wang, Abdul Hyee Waqas, Burns Smith

机构 * Mozilla

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究在英特尔 TDX 下 NVIDIA H100 GPU 上,比较标准与机密计算模式对语言模型推理的影响。通过两个模型实验,测量多项指标,发现机密模式会使首次令牌时间增加、全局令牌吞吐量下降,较大模型更早饱和,为容量规划提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28282 2026-07-23 cs.LG cs.AI cs.DC 版本更新 62%

Pre-Deployment Complexity Estimation for Federated Perception Systems

联邦感知系统部署前复杂度估计

KMA Solaiman, Shafkat Islam, Ruy de Oliveira, Bharat Bhargava

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Purdue University Northwest(普渡大学西北校区) Purdue University(普渡大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需分类器的预部署框架,用于估计联邦学习在分布式环境中的学习复杂度,通过联合建模数据固有属性和环境特征,实验表明该指标与联邦学习性能及通信成本密切相关。

Comments Accepted and presented at Edge AI Research Symposium 2026 (EdgeAI2026), San Diego, CA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19219 2026-07-22 cs.CL cs.AI 新提交 62%

Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards

超越分数预测:基于强化学习和评分标准奖励的基于大语言模型的作文评分与反馈生成

Xuefeng Jin, Jiashuo Zhang, Teng Cao, Bin Yang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究基于大语言模型的作文评分与反馈生成,提出RLAES框架,通过强化学习联合优化。引入RFE评估框架,提出AGFO和ACR方法。实验表明RFE能捕捉一致性,RLAES-AGFO在评分性能上最佳,保持反馈质量同时避免反馈退化。

Comments 12 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19096 2026-07-22 cs.AI cs.CL 新提交 62%

Supra Cognitive Modes: A Routed Architecture for Agent Memory

超认知模式:一种用于智能体记忆的路由架构

Joshua Tobkin, David Yang

机构 * Supra Research(超研)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究智能体记忆工作负载,提出超认知模式(SCM)架构,通过共享摄取底层及相关机制处理查询,在三个基准上进行表征,给出参考运行成绩等,展示了一种路由配置及故障模式,验证了相关设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19011 2026-07-22 cs.CL cs.AI cs.MM 新提交 62%

Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

基于多模态语言模型的计算幽默:方法、数据集、评估及挑战

Tuo Liang, Zhe Hu, Disheng Liu, Jing Li, Yu Yin

机构 * Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究聚焦于单图像和多面板作品中的视觉幽默理解,通过与先前综述对比,按能力层次组织文献,综合基准设计等内容,追溯领域转变,指出进展的主要障碍包括易出现捷径的评估、文化覆盖有限等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18360 2026-07-22 cs.CR cs.AI cs.LG 新提交 62%

HALLMARK: Diagnosing Three Failure Modes in LLM Citation Verifiers

HALLMARK:诊断大语言模型引用验证器中的三种失败模式

Patrik Reizinger, Wieland Brendel

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型引用验证器的失败模式,通过HALLMARK基准测试评估多种验证器,发现误报率决定验证器是否可部署,并具体指出三种失败模式,强调误报率是部署瓶颈,未检测到的伪造对科学记录代价更高。

Comments 59 pages, 7 figures, 40 tables. Benchmark and code: https://github.com/rpatrik96/hallmark (v1.2.0); verification tool: https://github.com/rpatrik96/bibtexupdater (v1.5.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18228 2026-07-21 cs.AI cs.CL 新提交 62%

Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes

压力下的逻辑判断:用学习到的软前缀诊断三段论稳定性

Brian K Chen

机构 * National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究在三段论推理基准前加软前缀,探究学习到的上下文压力对模型逻辑判断的影响,发现软前缀能改变正确答案,在多模型测试中效果优于随机对照,主要影响是答案偏好,不同模型有显著差异。

Comments 41 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17765 2026-07-21 cs.LG cs.AI cs.DB 新提交 62%

FIFA World Cup 2026 as a Contamination-Free Benchmark for LLM Forecasting Agents: Four Models, a Bookmaker, and 104 Matches

2026年国际足联世界杯作为语言模型预测代理的无污染基准:四个模型、一个博彩公司和104场比赛

Jiacheng Ding, Cong Guo, Jason Xu

机构 * University of Memphis(孟菲斯大学) QuantaInsight(量子洞察)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 介绍WC2026-Agents基准和数据集,用于评估大语言模型作为世界杯预测代理。四个前沿模型对104场比赛运行相同循环,与博彩市场数据配对。揭示模型预测虽有相同首选,但在决策质量等方面差异大,可衡量校准等方面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16712 2026-07-21 cs.AI cs.CL 新提交 62%

DS@GT ARC at eRisk 2026: Hybrid Multi-Agent LLM System with Structured Algorithmic Guidance for Conversational Depression Screening

DS@GT在eRisk 2026的ARC:用于对话式抑郁症筛查的具有结构化算法指导的混合多智能体大语言模型系统

Victor Gong, David Guecha

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 介绍DS@GT参加eRisk 2026对话式抑郁症筛查挑战赛,其系统历经三个阶段,最终采用混合配置并添加算法组件。提交三次运行结果,混合运行3表现出色,以低成本超付费基线,验证较弱开源模型经算法监督可与专有模型竞争。

Comments Conference and Labs of the Evaluation Forum (CLEF), 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06411 2026-07-21 cs.SE cs.AI cs.CL 版本更新 62%

RuBench: A Repository-Level Agentic Coding Benchmark with Natively Authored Russian Task Specifications

RuBench:一个具有原生编写的俄语任务规范的仓库级智能编码基准测试

Evgeny Shilov

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RuBench 1.0是含25个俄语任务的仓库级智能编码基准测试,任务源于开源仓库修复提交,按客户请求风格编写。评估多种产品配置,报告运行结果,发现最佳配置解决78.7%任务,还发现产品替换模型问题,为智能编码评估提供新基准。

Comments 20 pages, 1 figure, 9 tables. v2 adds Round 2: Russian-market coding agents (SourceCraft CLI, Koda CLI), Antigravity with Gemini 3.1 Pro / 3.5 Flash, and Codex CLI with GPT-5.6 on the same frozen task set, plus a tool-call contamination re-audit (network + disk layers). Data, full trajectories and harness: https://github.com/eugeneshilow/rubench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20918 2026-07-21 cs.LG cs.AI cs.SY eess.SY 版本更新 62%

Short-Term Electricity Demand Forecasting for New England: A Comprehensive Machine Learning Benchmark with Weather, Calendar, and COVID-19 Indicators

基于混合Transformer-XGBoost框架的新英格兰短期电力需求预测:融合天气、日历和COVID-19指标

Reza Ghanavati, Behrooz Mosallaei

机构 * Department of Chemical and Materials Engineering, New Mexico State University(新墨西哥州立大学化学与材料工程系) Department of Electrical and Communications Engineering, New Jersey Institute of Technology(新泽西理工学院电气与通信工程系)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出混合Transformer-XGBoost框架,集成天气、日历和COVID-19变量,用于新英格兰短期电力需求预测,测试RMSE为8876 MWh,MAPE为2.05%,并发现COVID-19特征在疫情后成为噪声。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09079 2026-07-21 cs.LG cs.AI 版本更新 62%

FlashMemory-DeepSeek-V4: Lightning Index Ultra-Long Context via Lookahead Sparse Attention

FlashMemory-DeepSeek-V4: 通过前瞻稀疏注意力实现闪电索引超长上下文

Yan Wang, Qifan Zhang, Jiachen Yu, Tian Liang, Dongyang Ma, Xiang Hu, Zibo Lin, Chunyang Li, Zhichao Wang, Miao Peng, Nuo Chen, Jia Li, Yujiu Yang, Haitao Mi, Dong Yu

机构 * Independent Researchers(独立研究者) Tencent(腾讯) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出前瞻稀疏注意力(LSA),基于DeepSeek-V4架构的神经记忆索引器,通过预测未来上下文需求仅保留关键KV块,在超长上下文场景下将物理KV缓存压缩至全上下文的13.5%,同时保持或略微提升下游准确率。

Comments Technical report. 11 pages. Code and model available at https://github.com/libertywing/FlashMemory-Deepseek-V4 and https://huggingface.co/libertywing/FlashMemory-Deepseek-V4

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22328 2026-07-21 cs.LG cs.AI cs.CE 版本更新 62%

FETS Benchmark: Foundation Models Enable Scalable and Generalizable Energy Time Series Forecasting

FETS基准:基础模型在能源时间序列预测中优于数据集特定的机器学习

Marco Obermeier, Marco Pruckner, Florian Haselbeck, Andreas Zeiselmair

机构 * Julius-Maximilians-Universität Würzburg, Modeling and Simulation Lab(乌尔姆-马克斯·普朗克大学,建模与仿真实验室) Weihenstephan-Triesdorf University of Applied Sciences, Smart Farming(魏因施泰因-特里尔夫应用科学大学,智能农业) Weihenstephan-Triesdorf University of Applied Sciences, Digital Energy Transition(魏因施泰因-特里尔夫应用科学大学,数字能源转型)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文通过FETS基准展示了基础模型在能源时间序列预测中优于传统机器学习方法,揭示了基础模型在不同数据集和场景下的优越性能及应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22228 2026-07-21 cs.LG cs.AI 版本更新 62%

When Fewer Layers Break More Chains: Layer Pruning Harms Test-Time Scaling in LLMs

当更少的层打破更多的链条:层剪枝损害大语言模型的测试时扩展性

Keyu Wang, Tian Lyu, Guinan Su, Lu Yin, Marco Canini, Jonas Geiping, Shiwei Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究层剪枝对大语言模型长链推理中测试时扩展性的影响,经大量实验发现剪枝会严重损害其扩展性,标准微调补救无效,确定了扩展性脆弱机制及应用层剪枝的风险,呼吁重新思考策略并为保推理鲁棒性方法提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11889 2026-07-20 cs.CL cs.AI 版本更新 62%

Scaling Point-in-Time Language Models

扩展即时语言模型

Bryan Kelly, Semyon Malamud, Johannes Schwab, Teng Andrea Xu

机构 * Yale School of Management(耶鲁大学管理学院) AQR Capital Management(AQR资产管理公司) NBER(美国国家经济研究局) Swiss Finance Institute(瑞士金融研究所) EPFL(洛桑联邦理工学院) CEPR(经济政策研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究旨在解决大型语言模型的前瞻性偏差问题,通过在大量按时间顺序过滤的令牌上训练仅解码器变压器构建即时语言模型,缩小了与无约束模型的性能差距,经LoRA微调提升可用性,并发布完整管道支持相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10024 2026-07-20 cs.CV cs.AI cs.LG 版本更新 62%

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

LVSum:一个用于时间感知长视频摘要的基准测试

Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng, Ganesh Nagarajan

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LVSum基准测试,用于评估长视频摘要中时间对齐的性能,通过引入新的评估指标揭示现有MLLM在时间理解上的系统性差距。

Comments 25 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15161 2026-07-17 cs.LG cs.CL 新提交 62%

On-Policy Delta Distillation

策略内增量蒸馏

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

机构 * NAVER AI Lab(NAVER人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究基于策略内蒸馏,引入新的增量信号作为蒸馏奖励,提出策略内增量蒸馏方法。实验表明该方法能显著改进策略内蒸馏,使推理语言模型在短训练期内表现出色,优于传统方法。

Comments 19 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14989 2026-07-17 cs.CL cs.AI 新提交 62%

OmniaBench: Benchmarking General AI Agents Across Diverse Scenarios

OmniaBench:跨多样场景对通用人工智能智能体进行基准测试

Chengyu Shen, Yujie Fu, Gangtao Xin, Yanheng Hou, Wenlong Fei, Guojie Zhu, Jiawei Li, Hongcheng Gao, Runming He, Zhen Hao Wong, Meiyi Qiang, Hao Liang, Zhao Cao, Hao Jiang, Chong Chen, Wentao Zhang

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型向通用智能体演变,现有基准测试有局限的问题,引入OmniaBench。通过多渠道获取场景知识形成分类法,构建可执行环境并合成任务,还引入能力分类法等。其数据集含多任务,对前沿模型构成挑战,能表征通用智能体能力边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14159 2026-07-17 cs.AI cs.CL 新提交 62%

MemoHarness: Agent Harnesses That Learn from Experience

MemoHarness:从经验中学习的智能体控制层

Yue Huang, Wenjie Wang, Han Bao, Yuchen Ma, Xiaonan Luo, Yi Nian, Haomin Zhuang, Zheyuan Liu, Yue Zhao, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) LMU Munich(慕尼黑大学) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对智能体控制层设计影响行为但改进方法窄且多重用单一全局控制层的问题,提出自适应框架MemoHarness,通过分解控制层、存储经验并检索应用,在多基准测试中优于固定控制层,证明执行经验可构建更具适应性的控制层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14099 2026-07-17 cs.CL cs.AI cs.CV 新提交 62%

Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs

只需持续提示:评估视觉语言模型中的重复苏格拉底式提示

Shayda Moezzi, Bishoy Galoaa, Lorena Genua, Taskin Padir, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究视觉语言模型在反复提示下的稳定性,引入JKP多轮评估框架,用三种策略对模型提问,在STAR基准子集上评估GPT-4o、Gemini 2.5 Pro和Qwen3-VL-30B,发现重复提示利弊兼具且因模型而异,揭示了模型压力反应概况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09142 2026-07-17 cs.AI cs.CL cs.CV 版本更新 62%

MedRealMM: A Real-World Multimodal Benchmark for Chinese Online Medical Consultation

MedRealMM:用于中国在线医疗咨询的真实世界多模态基准测试

Runhan Shi, Quan Zhou, Yuqian Xu, Shuai Yang, Xin Wu, Zitong Zhou, Hui Liu, Bin Zha, Zheming Wang, Liya Li, Wei Wei, Jinru Ding, Wenrao Pang, Mouxiao Bian, Haoyuan Hu, Jun Xu, Jie Xu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对现有在线医疗咨询基准与实际临床实践契合度差的问题,构建MedRealMM基准测试,用多模态临床挑战点提取框架转化任务并设评分标准,评估多个大语言模型,指出图像信息重要,前沿模型有不足,为多模态医学推理评估提供现实可重复基准。

详情

展开后加载摘要…

URL PDF HTML 收藏