arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-15 至 2026-07-15 共收录 215 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 56 篇

2607.11890 2026-07-15 cs.CY cs.AI 新提交 88%

So Many Opinions, So Many LLMs: Comparing Large Language Models to Traditional Machine Learning for Open- Ended Survey Analysis

众多观点,众多大语言模型:将大语言模型与传统机器学习用于开放式调查分析的比较

Abdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究对比多种大语言模型与传统机器学习用于开放式调查分析,在情感分析和主题分类等任务中评估性能,发现LLMs分类准确性更高,但在预测理由及应用类别边界上差异大,凸显了使用LLMs进行定性分析时的权衡并给出实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15222 2026-07-15 cs.SE cs.CL cs.PL 版本更新 88%

PerfCodeBench: Benchmarking LLMs for System-Level High-Performance Code Optimization

PerfCodeBench:用于系统级高性能代码优化的LLM基准测试

Huihao Jing, Wenbin Hu, Shaojin Chen, Haochen Shi, Hanyu Yang, Sirui Zhang, Haoran Li, Yangqiu Song

机构 * HKUST(香港科技大学) NYU(纽约大学) SWUPL(西南大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PerfCodeBench,用于评估LLM在系统级高性能代码优化中的能力,发现模型生成代码与专家优化代码存在显著差距,尤其在并行和GPU任务中表现更差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01117 2026-07-15 cs.CV 版本更新 88%

MoHallBench: A Benchmark for Motion Hallucination in Video Large Language Models

MoHallBench: 视频大语言模型中运动幻觉的基准测试

Sihan Chen, Jiale Li, Jianghang Lin, Mengyuan Liu

机构 * Xiamen University(厦门大学) South China University of Technology(华南理工大学) Peking University(北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 提出MoHallBench基准,系统评估视频大语言模型中的运动幻觉,涵盖共现先验、顺序推理和相似混淆三类来源,揭示动作识别与幻觉抵抗的解耦现象。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12885 2026-07-15 cs.CL 新提交 87%

LLM Judges Can Be Too Generous When There Is No Reference Answer

当没有参考答案时,大语言模型评判可能过于宽松

Chalamalasetti Kranti, Sowmya Vajjala

机构 * University of Potsdam(波茨坦大学) National Research Council(国家研究委员会)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 探讨在无参考答案时大语言模型评判器能否可靠评估。通过校准和敏感性两阶段实验,发现其在无参考答案时易高估错误答案,添加参考答案信息会大幅改变评判结果,且与人类判断相符,强调校准LLM评判器的必要性并提供了方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15212 2026-07-15 cs.CR 版本更新 87%

LLM vs. SAST: A Technical Analysis on Detecting Coding Bugs of GPT4-Advanced Data Analysis

大语言模型与SAST:关于GPT4-高级数据分析编码漏洞检测的技术分析

Madjid G. Tehrani, Eldar Sultanow, William J. Buchanan, Mahkame Houmani, Christel H. Djaha Fodja

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究对比GPT-4与两个SAST工具在32个安全场景的编码漏洞检测,用二元规则评分、逻辑或基线聚合结果,经McNemar检验,发现GPT-4检测性能更优,还讨论了将其集成到安全软件开发工作流程的相关要点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12884 2026-07-15 cs.CL 新提交 86%

Evaluating Large Language Models on Misconceptions in Multi-Turn Medical Conversations

在多轮医疗对话中的误解上评估大语言模型

Monica Munnangi, Saiph Savage

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.CL

AI总结 研究多轮医疗对话中模型对误解的处理,引入ThReadMed-QA数据集,用基于准则的框架评估五个大语言模型,发现前沿模型在后续轮次表现大幅下降,错误传播致性能降,强调需捕捉多轮行为的评估框架。

Comments Accepted to MLHC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09570 2026-07-15 cs.CL cs.HC 版本更新 84%

UXBench: Benchmarking User Experience in AI Assistants

UXBench:AI助手中的用户体验基准测试

Mengze Hong, Xia Zeng, Zeyang Lei, Sheng Wang, Chen Jason Zhang, Di Jiang, Taiming Fu, Jinfeng Huang, Mengqiao Liu, Qinghe Chang, Haosheng Zou, Qiongyi Zhou, Sijun He, Simonjmdeng, Haojing Huang, Zijian Li, Lucas Mu Li, Fubao Zhang, Mona Zhou, Wei Ma, Yuan Hua, Qi Zhu, Shuo Jiang, Chenxuan Ma, Yuanmeng Zhang, Jian Song, Minlong Peng, Di Liang, Davey Chen

机构 * Hong Kong Polytechnic University(香港理工大学) Tencent(腾讯)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL

AI总结 提出首个基于真实用户反馈的用户中心基准UXBench,包含三个任务和7400个测试实例,评估26个前沿语言模型,发现用户反馈预测是可学习的能力,并揭示了LLM作为评判者的系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04689 2026-07-15 cs.CL cs.AI 版本更新 84%

Adaptive Testing for LLM Evaluation: A Psychometric Alternative to Static Benchmarks

大语言模型评估的自适应测试:一种替代静态基准的心理测量方法

Peiyu Li, Xiuxiu Tang, Si Chen, Ying Cheng, Ronald Metoyer, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame(诺丁汉大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型评估成本高、现有协议不合理的问题,提出基于项目反应理论的自适应测试框架ATLAS,通过Fisher信息引导选项目,减少90%项目数仍保持精度,能重构准确率,还可在准确率相当模型中提供精细区分。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12339 2026-07-15 cs.HC cs.AI 版本更新 83%

SheetMind: An End-to-End LLM-Powered Multi-Agent Framework for Spreadsheet Automation

SheetMind:一个由端到端大语言模型驱动的用于电子表格自动化的多智能体框架

Xi Cheng, Ruiyan Zhu, Ke Liu, Rakesh Chowdary Machineni, Lyuhao Chen, Brian Zhu, Daniel Jin, Zheng Qi, Neeraj Parihar, Zhoutian Xu, Oliver Gao

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology (GZ)(香港科学与技术大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 介绍由大语言模型驱动的多智能体框架SheetMind用于电子表格自动化,其分层系统含三个智能体,经评估在SheetCopilot基准测试中执行成功率达100%、功能正确性54.8%超对手,消融研究验证配置优势,还集成到谷歌表格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12215 2026-07-15 cs.CL cs.LG cs.MA 新提交 82%

Fine-Tuned Multi-Agent Framework for Detecting OCEAN in Life Narratives

用于在生活叙事中检测大五人格的微调多智能体框架

Rasiq Hussain, Darshil Italiya, Joshua Oltmanns, Mehak Gupta

机构 * Southern Methodist University(南卫理公会大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究旨在从文本中准确评估人格,提出微调多智能体框架,通过掩码语言建模和心理测量监督让子智能体针对特质采用不同视角,评判大语言模型生成预测,经实验验证该方法可扩展且可解释,突出多智能体推理优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10609 2026-07-15 cs.IR 版本更新 82%

iTIMO: An LLM-empowered Synthesis Dataset for Travel Itinerary Modification

iTIMO:一个基于大语言模型的旅行行程修改合成数据集

Zhuoxuan Huang, Yunshan Ma, Hongyu Zhang, Hua Ma, Zhu Sun

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 iTIMO通过基于大语言模型的意图驱动扰动任务,构建了一个用于旅行行程修改的合成数据集,用于评估和改进旅行推荐系统。

Comments Accepted by SIGIR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12986 2026-07-15 cs.AI cs.SE 新提交 79%

Win by Silence: Deletion Non-Monotonicity, Autonomous Exploitation, and Typed-State Gating in LLM Plan Evaluation

以沉默取胜:大语言模型计划评估中的删除非单调性、自主利用和类型状态门控

Aleh Manchuliantsau

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型计划评估中删除非单调性等问题,通过命题1给出得分变化公式,经实验发现优化器能找到改进结构,GATE可约束搜索,PCSC能消除事后省略拼接,但GATE不验证策略质量。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12200 2026-07-15 cs.AI cs.CR cs.CY 新提交 79%

A Threshold Exceedance Framework for CBRN Uplift Evaluation in Frontier Language Models

前沿语言模型中用于CBRN提升评估的阈值超越框架

Rahul Gupta, Abhinav Mohanty, Payal Motwani, Venkatesh Saligrama, Satyapriya Krishna, Connor Harris, Gary Anthony Ackerman, Brandon Behlendorf, Tom Hobson, Theodore Wilson, Spyros Matsoukas

机构 * Amazon(亚马逊) Nemesys Insights(Nemesys洞察)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 研究前沿语言模型中CBRN提升评估问题,引入阈值超越标准(TEC)框架,将提升研究分解为独立组件,通过大规模实证研究确定两种提升形式,揭示领域异质性,为相关决策提供信息并总结方法经验。

Comments 19 pages, 1 figure, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15892 2026-07-15 cs.CV cs.AI 版本更新 79%

Egocentric Bias in Vision-Language Models

视觉语言模型中的自我中心偏差

Maijunxian Wang, Yijiang Li, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao, Emmy Liu, Hokin Deng, Dezhi Luo

机构 * Cognitive Science Program, University of California, Berkeley(加州大学伯克利分校认知科学项目) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) School of Computer Science, Georgia Institute of Technology & Emory University(佐治亚理工学院计算机科学学院及埃默里大学) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Equal Advising Department of Computer Science & Wilmer Eye Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系及威尔默眼科研究所) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Weinberg Institute for Cognitive Science, University of Michigan(密歇根大学韦恩伯格认知科学研究所)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出FlipSet基准,揭示视觉语言模型在第二级视觉视角推理中存在系统性自我中心偏差,表明模型在整合社会认知与空间操作方面存在根本性不足。

Comments Accepted at CogSci 2026 (Best Undergraduate Student Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11951 2026-07-15 cs.AI cs.CL cs.FL cs.PL 新提交 79%

GRID: Grammar-Railed Decoding for Enterprise SQL Generation

GRID:用于企业SQL生成的语法约束解码

Mohsen Arjmandi

机构 * evolutionID GmbH(进化ID有限公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对企业SQL生成需求,提出GRID语法约束解码引擎,通过特定方式确定令牌掩码,编译角色访问控制,有四个保证。经实验,Rust内核降低掩码时间,在Spider上约束解码提升模型可执行率,还具备审计跟踪和篡改检测功能。

Comments 18 pages, 3 figures. Extended version; a condensed version is under review at KDD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15239 2026-07-15 cs.CL cs.AI econ.GN q-fin.EC stat.ME 版本更新 79%

Modeling Story Expectations: A Generative Framework using LLMs

建模故事期望:一种使用大语言模型的生成框架

Hortense Fong, George Gui, Bo Yang

机构 * Columbia Business School(哥伦比亚商学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对非结构化叙事内容建模消费者故事期望的难题,利用大语言模型生成故事延续并提取特征,通过两种验证程序,将其应用于不同数据发现模型期望与人类信念及实际故事延续相关,为叙事内容信念建模提供可扩展方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12619 2026-07-15 cs.AI cs.ET 新提交 77%

Agentic Service-Oriented Computing: A Manifesto for the Next Frontier of Service-Oriented Computing

面向智能体的面向服务计算:面向服务计算新前沿宣言

Amin Beheshti, Rong N. Chang, Boualem Benatallah, Fabio Casati, Schahram Dustdar, Geoffrey Fox, Quan Z. Sheng, Yan Wang, Jian Yang, Albert Zomaya

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究LLM驱动的智能体融入复杂工作流面临的挑战,提出面向智能体的面向服务计算(ASOC)。阐述其六个基本原则,组织五维研究议程,旨在将智能体AI从零散演示转变为可靠的基于服务的系统,为新兴领域提供支撑。

Comments Accepted at the 2026 IEEE International Conference on Web Services (ICWS); Corresponding author: Prof. Amin Beheshti; DOI 10.1109/ICWS72778.2026.00163

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22432 2026-07-15 cs.LG 版本更新 77%

AMUSE: Anytime Muon with Stable Gradient Evaluation

AMUSE: 任何时刻的Muon with Stable Gradient Evaluation

Jueun Kim, Baekrok Shin, Jihun Yun, Beomhan Baek, Minhak Song, Chulhee Yun

机构 * KAIST(韩国科学技术院) KRAFTON(KRAFTON公司) Seoul National University(首尔国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文研究了Muon算法的机制,提出了一种名为AMUSE的算法,通过结合Muon的快速批量进步和Schedule-Free平均的稳定效果,实现了无需学习率调度的任何时刻训练,并在视觉任务和大语言模型预训练中提升了性能-迭代帕累托前沿。

Comments 44 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12290 2026-07-15 eess.AS cs.AI cs.CL cs.LG cs.SD 新提交 75%

The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

缺失之音:音频-语言嵌入模型在处理否定时存在困难

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(国家台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(国家台湾大学人工智能卓越研究中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究音频-语言嵌入模型在处理否定时的问题,引入NegEval-Audio框架将数据集转换为否定感知任务,发现模型在否定情况下性能大幅下降,肯定偏差是缺陷,需明确否定感知训练目标。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20867 2026-07-15 cs.IR 版本更新 75%

E-GEO: A Testbed for Generative Engine Optimization in E-Commerce

E-GEO:电子商务中生成引擎优化的测试平台

Puneet S. Bagga, Vivek F. Farias, Tamar Korkotashvili, Tianyi Peng, Yuhang Wu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究电子商务中生成引擎优化问题,引入E-GEO数据集,对多种生成引擎、重写器和启发式方法进行大规模实证研究,将GEO公式化并开发优化算法,通过攻击验证其有效性,揭示存在通用有效GEO策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12338 2026-07-15 cs.AI 新提交 74%

How Many Tasks Are Enough for Agent Benchmark Decisions? A Replay Analysis of Public LLM Agent Benchmarks

多少任务足以做出智能体基准决策?对公共大语言模型智能体基准的重放分析

Wei-Jung Huang

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 研究智能体基准测试中多少任务足以做决策,通过重放公共任务级记录,提出部分预算需满足支持完整基准决策、覆盖任务组及控制未解决比较比例等条件,还指出部分评估报告应包含的内容。

Comments KDD 2026 Workshop Agentic AI Evaluation and Trustworthiness

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11891 2026-07-15 cs.CL cs.AI 新提交 73%

CANDI: Contextual Alignment for Niche Domains Question Answering

CANDI:特定领域问答的上下文对齐

Megha Chakraborty, Darssan L. Eswaramoorthi, Het Riteshkumar Shah, Madhur Thareja, Michelle A Ihetu, Harshul Raj Surana, Kaushik Roy, Amit Sheth

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对专业领域大语言模型评估问题,提出CANDI-QA数据集,含两类问答对。评估多种语言模型,给出MTSS-Net框架。揭示特定领域上下文对齐挑战及当前模型局限,为上下文感知语言模型研究提供关键基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11198 2026-07-15 cs.CL cs.AI 版本更新 73%

Declarative by Design, Assistable Only by Convention: Benchmarking Multi-Agent Frameworks for AI-Assistability

DDL2PropBank Agent:通过一种新的关系模式映射任务评估多智能体框架的开发者体验

Shafiuddin Rehan Ahmed, Sourabh Deshpande

机构 * Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 DDL2PropBank Agent通过新的关系模式映射任务评估多智能体框架的开发者体验,揭示了不同框架在代码复杂性和AI辅助性上的差异,Agno表现出最佳性能。

Comments ACM Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12375 2026-07-15 cs.CV cs.AI eess.IV 新提交 70%

IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment

IQA-T1:基于工具的图像质量评估视觉证据推理

Jinjian Wu, Jiaqi Tang, Wei Wei, Yingying Yan, Jianmin Chen, Botong Geng, Lei Zhang, Qifeng Chen

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机科学学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对开放世界图像质量评估难题,提出IQA-T1框架,通过自主调用工具生成视觉证据增强多模态大语言模型推理,构建Q-Tool数据集,实验表明该框架性能最佳且评估可解释、基于证据。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14217 2026-07-15 cs.CL 版本更新 70%

Rethinking Evaluation in Retrieval-Augmented Personalized Dialogue: A Cognitive and Linguistic Perspective

重新思考基于检索增强的个性化对话的评估:认知与语言学视角

Tianyi Zhang, David Traum

机构 * Institute for Creative Technologies, University of Southern California(南加州大学创意技术研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文从认知与语言学角度重新审视基于检索增强的个性化对话评估,指出传统表面相似度指标无法反映对话质量的深层特征,并通过LAPDOG框架分析,强调需建立更符合人类沟通原理的评估方法。

Comments Accepted by LREC 2026, official link: http://www.lrec-conf.org/proceedings/lrec2026/pdf/2026.lrec2026-1.892.pdf

Journal ref In Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08862 2026-07-15 cs.RO cs.LG 版本更新 70%

APPLV: Adaptive Planner Parameter Learning from Vision-Language-Action Model

APPLV: 从视觉-语言-动作模型中自适应学习规划器参数

Yuanjie Lu, Beichen Wang, Zhengqi Wu, Yang Li, Xiaomin Lin, Chengzhi Mao, Xuesu Xiao

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学) Department of Engineering Science, University of South Florida(工程科学系,佛罗里达州立大学) Department of Computer Science, Rutgers University(计算机科学系,罗格斯大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出APPLV,通过从视觉-语言-动作模型中自适应学习规划器参数,提升移动机器人在受限环境中的导航性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06486 2026-07-15 cs.AI 版本更新 70%

JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks

JADE:面向开放式专业任务的专家基础动态评估

Lanbo Lin, Jiayao Liu, Tianyuan Yang, Li Cai, Yuanwu Xu, Lei Wei, Sicong Xie, Guannan Zhang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出JADE双层评估框架,结合专家知识与动态声明级评估,解决开放式专业任务中严格性与灵活性的矛盾,在BizBench等基准上提升稳定性并揭示关键失败模式。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12911 2026-07-15 cs.CV 新提交 67%

Open-KNEAD: Knowledge-grounded Nutrition Estimation via Agentic Decomposition

Open-KNEAD:通过智能分解实现基于知识的营养估计

Bruce Coburn, Jingbo Yue, Jinge Ma, Siddeshwar Raghavan, Gautham Vinod, Fengqing Zhu

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究探讨多模态大语言模型用于膳食评估时检索增强基础方法是否仍有价值。提出无需训练、可本地部署的Open-KNEAD框架,通过营养感知检索关联食物项与FNDDS代码,提高份量估计,还能恢复非美国烹饪风格估计偏差,优势显著并开源相关框架与知识库。

Comments 10 pages main paper, 5 pages supplementary

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12541 2026-07-15 cs.SE 新提交 67%

Taming the Drift: Context-aware Repair of Dockerfile Drift during Software Evolution

驯服漂移:软件演化过程中Dockerfile漂移的上下文感知修复

Chengjie Wang, Jingzheng Wu, Xiang Ling, Tianyue Luo, Chen Zhao

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究针对软件演化中Dockerfile漂移致CI/CD构建失败的问题,提出上下文感知框架Cadre,通过构建CDG并结合两步工作流程来修复,在$D^3$基准上修复率高,相比基线优势明显,还避免提示溢出故障,提升了上下文感知基础设施即代码维护能力。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12497 2026-07-15 cs.CV 新提交 67%

TerraLogic: A Benchmark for Hierarchical Geospatial Reasoning in Earth Observation

TerraLogic:地球观测中分层地理空间推理的基准

Yuhang Yan, Linchao Mou, Bokang Yang, Qingyu Li

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对遥感中认知地理空间推理研究不足的问题,引入TerraLogic基准及HieraPlan工具增强智能体,通过545个任务推动评估向认知级发展,实验显示HieraPlan在分层地理空间推理上表现出色,为相关研究提供强大基线。

Comments 8 pages, 3 figures, and 7 tables. Dataset and agent code are available at https://github.com/Ireliya/TerraLogic

详情

展开后加载摘要…

URL PDF HTML 收藏