arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-16 至 2026-07-16 共收录 237 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 59 篇

2607.13189 2026-07-16 cs.CL cs.AI 新提交 87%

RAGthoven at SemEval-2026 Task 1: A Multi-Stage Pipeline Walks Into a Benchmark and Barely Clears the Bar

RAGthoven参加SemEval-2026任务1:一个多阶段管道进入基准测试且勉强达标

Marek Šuppa, Viktória Ondrejová, Lucia Ganajová, Gregor Karetka, Daniel Skala

机构 * Comenius University in Bratislava(布拉迪斯拉发的夸美纽斯大学) Cisco Systems(思科系统公司) Zaitra s.r.o.(扎伊特拉有限公司) NaiveNeuron(天真神经元)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 介绍用于SemEval-2026任务1子任务A的RAGthoven系统,它将幽默文本生成分解为多阶段LLM管道,经多次实验优化,最终配置用RAG增强规划器,还评估两种智能变体,虽工具调用预算增加,但在英语样本上未超非智能管道,在三种语言中与基线并列第一,显示语言相关回报递减。

Comments SemEval-2026 Task 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13036 2026-07-16 cs.CL cs.AI 新提交 85%

Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry

诊断前先询问:Safe-Psych,一种用于精神病学领域大语言模型的顺序评估基准

Oriana Presacan, Andreea Grama, Larisa Irimină, Alireza Nik, Jaya Ojha, Vajira Thambawita, Ciprian I. Băcilă, Bogdan Ionescu, Michael A. Riegler

机构 * National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学国立科技大学) Psychiatric Hospital Doctor Gheorghe Preda(格奥尔基·普雷达医生精神病医院) Oslo Metropolitan University(奥斯陆都市大学) Kristiania University of Applied Sciences(克里斯蒂亚尼亚应用科学大学) SimulaMet(SimulaMet公司) Lucian Blaga University of Sibiu(锡比乌卢西安·布拉加大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型在精神病学决策支持中处理证据不完整问题,引入顺序评估基准Safe-Psych,通过模拟真实临床记录及精神科医生行动标签,评估多个模型,发现模型存在过早诊断等问题,揭示其局限性,为改善模型安全性研究提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08803 2026-07-16 q-bio.QM cs.AI cs.LG 版本更新 84%

TheBioCollection: Unified Pre-Training Scale LLM Corpus for Biology

TheBioCollection:用于生物学的统一预训练规模语言模型语料库

Hyunjin Seo, Hyeon Hwang, Gyubok Lee, Jay Shin, Jimin Park, Taesoo Kim, Sanghoon Lee, Hongjoon Ahn, Sungjun Han, Sangwon Jung

机构 * Trillion Labs KAIST(韩国科学技术院) SK Biopharmaceuticals Co., Ltd.(SK生物制药公司) Lunit Inc.(Lunit公司) AIGEN Sciences Inc.(AIGEN科学公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 为满足生物学大语言模型训练需求,提出TheBioCollection语料库,整合异构生物资源并丰富记录、引入新任务,配对TheBioCollection-Eval评估,固定架构训练后模型在各领域表现提升,语言能力基本不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22426 2026-07-16 cs.DL 83%

Can ChatGPT be a good follower of academic paradigms? Research quality evaluations in conflicting areas of sociology

ChatGPT能否成为良好的学术范式追随者?社会学冲突领域的研究质量评估

Mike Thelwall, Ralph Schroeder, Meena Dhanda

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了ChatGPT在评估学术出版物质量时对不同社会学范式偏见的影响,发现遵循对齐范式时评分最高,而对立范式评估导致显著劣势。

Journal ref Journal of Data and Information Science., 11(2), 394-404

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13707 2026-07-16 cs.CL cs.SE 新提交 83%

The Test Oracle Problem in Synthetic LLM-as-Judge Corpora: Disappearance, Distortion and a Validation Protocol

合成语言模型作为评判语料库中的测试预言机问题:消失、扭曲与验证协议

Serkan Ballı

机构 * Mehmet Akif Ersoy University(梅赫梅特·阿基夫·埃尔索伊大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究语言模型作为评判系统中合成语料库的测试预言机问题,指出其负面示例由语言模型生成时存在完整性验证漏洞,通过多语言语料库案例揭示答案截断、偏差扭曲等问题,并提出验证协议供无预言机模式分析师使用。

Comments 23 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13305 2026-07-16 cs.CV cs.AI cs.MM 新提交 83%

Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

无需基础的准确性:诊断视频语言模型基准测试中的视觉依赖解离

Jae Joong Lee

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究视频语言模型基准测试中视觉依赖问题,引入视觉依赖差距(VDG),通过实验表明准确性与视觉依赖可分离,任务类型排名稳定,帧多样性贡献大,H.264实验有新发现,VDG可作标准审查,推动相关研究。

Comments Accepted, ACM International Conference on Multimedia 2026 (ACM MM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13618 2026-07-16 cs.AI cs.LG 新提交 81%

STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle

库存盘点:使用公平预言机测量大语言模型智能体中感知与行动之间的差距

Sagar Deb, Ashwanth Krishnan

机构 * QpiAI

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型智能体在多周决策任务中的知行差距,提出库存盘点基准,通过公平参考策略区分感知与行动失败,测量知行差距两方向,为评估大语言模型智能体提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13568 2026-07-16 cs.CL cs.LG 新提交 81%

Graded Entity-Familiarity Readouts in Language Models: Polish Adaptation, Cross-Language Robustness, and Refusal Steering

语言模型中的分级实体熟悉度读数:波兰语适配、跨语言鲁棒性和拒绝引导

Grzegorz Brzezinka

机构 * Prosit AS(Prosit公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型能否在生成答案前估计对实体的熟悉度,通过新数据集及实验发现熟悉度探测分数可区分实体,在波兰语适配家族中追踪实体受欢迎程度,跨语言鲁棒,在特定模型中可调节拒绝率,校准后的熟悉度探测有竞争力。

Comments 16 pages, 8 figures, 5 tables. Code and data: https://github.com/agentGreg/bielik-entity-familiarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11098 2026-07-16 cs.SE cs.AI cs.CL 版本更新 81%

AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP

AgentCheck:用于基于MCP的大型语言模型智能体的重现-干预-缓解工作台

Aritra Mazumder, Nusrat jahan Lia

机构 * University of Utah(犹他大学) University of Dhaka(达卡大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对工具使用型大语言模型智能体在工具出现问题时开发者难以处理故障的情况,提出AgentCheck开源工作台,通过特定运行和重放方式形成重现-干预-确认循环,能对故障模式进行评估验证,提升智能体故障处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13477 2026-07-16 cs.SD cs.CL eess.AS 新提交 79%

Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation

大型音频语言模型语音评估中协议级捷径的审计

Joonyong Park, David M. Chan, Yuki Saito, Hiroshi Saruwatari

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究大型音频语言模型语音评估中协议级捷径,通过对三种部署协议审计发现多个LALM依赖此类捷径,如特征蓝图评判中错误标签影响准确率,拼接A/B比较有固定选择倾向,强调联合评估模型与协议及用匹配探针评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13453 2026-07-16 cs.CR cs.AI 新提交 79%

Adversarial Prompting Framework for AI Safety Assessment

用于人工智能安全评估的对抗性提示框架

Yash Bhatnagar, Kunal Banerjee, Anirban Chatterjee

机构 * Microsoft(微软)

专题命中 评测与基准 :prompting(title,abstract);分类 cs.AI

AI总结 针对人工智能尤其是生成式人工智能应用增加带来的安全问题,提出对抗性提示框架,通过生成多复杂程度的对抗性提示评估模型弹性,在企业环境中实现自动化测试并获定量指标及差异结果。

Comments 3 pages, 1 figure, presented as a poster at International Conference on Data Science (CODS), December 17-20, 2025, Pune, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13071 2026-07-16 cs.SE cs.AI 新提交 79%

Compaction as Epistemic Failure: How Agentic LLM Tools Fabricate Confirmed Results from Killed Processes

作为认知失败的压缩:智能语言模型工具如何从终止进程中编造确认结果

Hiroki Tamba

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究智能语言模型编码工具中Claude Code的失败模式,即超时命令部分输出被误记为确认结果并传播误报,揭示其观察与持久性 conflation 的机制,指出对依赖会话连续性的工作流程有影响。

Comments 8 pages, companion to arXiv:2606.26185

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13041 2026-07-16 cs.CY cs.AI cs.LG cs.MM 新提交 79%

LessonBench-V1: A Benchmark Dataset for Evaluating AI Lesson Generation Agents

LessonBench-V1:用于评估人工智能课程生成代理的基准数据集

Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird

机构 * Department of Computer Science, Nottingham Trent University, Nottingham, UK(计算机科学系,诺丁汉特伦特大学,诺丁汉,英国) Department of Physics and Mathematics, Nottingham Trent University, Nottingham, UK(物理与数学系,诺丁汉特伦特大学,诺丁汉,英国)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对无标准化基准评估人工智能课程生成系统的问题,引入LessonBench-V1基准数据集,其含人工编写课程与逆向工程课程计划,经人工审核并综合多种教学方法生成,可系统评估相关代理,还提出三维评估管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13968 2026-07-16 q-fin.GN 新提交 78%

Measuring Sentiment News with Transformer-Based Language Models

用基于Transformer的语言模型衡量新闻情绪

Maria Saveria Mavillonio, Stefano Borgioli, Caterina Giannetti, Chiara Ongari, Giampiero M. Gallo

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究财经新闻情绪衡量,提出用基于Transformer语言模型构建指数框架,经实验将其结果与基准指标对比,并通过人类标注验证,发现该模型能产生更贴近人类评估的情绪指标,与人类判断一致性更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14026 2026-07-16 cs.CE 新提交 78%

From Forecasts to Auditable Reports: Evidence Contracts for LLM-Assisted Housing-Guarantee Risk Monitoring

从预测到可审计报告:大语言模型辅助住房担保风险监测的证据契约

Hyeongcheol Kim, Yoontae Hwang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究将住房担保风险预测转化为可审计报告的挑战,提出证据约束报告流程,利用韩国租房押金数据,结合预测模型与结构化证据、验证及分析师监督,提升高风险检测能力,经评估报告支持实际决策,证明该方法可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08842 2026-07-16 cs.CY 版本更新 78%

L2-Bench: An Evaluation Benchmark for Measuring LLM Capabilities in Second Language Education

L2-Bench:用于衡量第二语言教育中大型语言模型能力的评估基准

James Edgell, Wm. Matthew Kennedy, Ben Knight, Danielle Carvalho, Martin Ku, Isaac Pattis

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究针对第二语言教育中AIED系统评估不足的问题,引入L2-Bench开源基准。通过 validated分类法、基于评分标准的评估方法和评估数据集,对大型模型能力进行评估,发现Claude Opus 4.7总体最佳,难任务性能降,为教育决策提供方法,推动AI评估科学成熟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22830 2026-07-16 cs.CV cs.RO 版本更新 78%

A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions

大型视觉-语言模型在SOTIF条件下2D目标检测的比较评估

Ji Zhou, Yilin Ding, Yongqi Zhao, Jiachen Xu, Dong Bi, Johannes Betz, Arno Eichberger

机构 * Institute of Automotive Engineering, Graz University of Technology(汽车工程研究所,格拉茨技术大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文评估了大型视觉-语言模型在SOTIF条件下2D目标检测的性能,发现其在复杂场景中召回率显著优于传统方法,但几何精度仍有一定优势。

Comments 8 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22633 2026-07-16 cs.SE 版本更新 78%

Rethinking the Capability of Fine-Tuned Language Models for Automated Vulnerability Repair

重新思考微调语言模型在自动漏洞修复方面的能力

Woorim Han, Yeongjun Kwak, Miseon Yu, Kyeongmin Kim, Younghan Lee, Hyungon Moon, Yunheung Paek

专题命中 评测与基准 :language model(title,abstract)

AI总结 探讨基于微调语言模型的自动漏洞修复技术,通过语义变换、重划数据集和引入新基准三种方式,考察现有模型能力及匹配评估指标充分性,以提升模型修复未见漏洞的能力和评估准确性。

Comments To appear at ICSE 2026. 13 pages. The L-AVRBench benchmark, Docker images, and evaluation scripts are available at https://github.com/rimwoohan/L-AVRBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11715 2026-07-16 cs.CL 版本更新 77%

JobHop v2: A Large-Scale Career Trajectory Dataset from Unstructured Resumes

JobHop v2:一个来自非结构化简历的大规模职业轨迹数据集

Iman Johary, Guillaume Bied, Alexandru C. Mara, Tijl De Bie

机构 * AIDA-IDLab, Department of Electronics and Information Systems, Ghent University, Ghent, Belgium(AIDA-ID实验室,电子与信息系统系,根特大学,根特,比利时) AIDA-IDLab, Department of Electronics(AIDA-ID实验室,电子系) Information Systems, Ghent University, Ghent, Belgium(信息系统,根特大学,根特,比利时)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出JobHop v2数据集,通过端到端大语言模型从大量简历中提取职业轨迹。它扩大了覆盖范围与注释丰富度,引入新提取管道、模式及评估协议,最好提取器接近注释者间一致性上限,数据集和代码公开助力职业轨迹研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15886 2026-07-16 cs.CL 版本更新 77%

Linked Multi-Modal Data on Russian Domestic and Foreign Policy Speeches

连接多模型数据:俄罗斯国内与对外政策演讲

Daria Blinova, Gayathri Emuru, Rakesh Emuru, Kushagradheer Shridheer Srivastava, Mina Rulis, Sunita Chandrasekaran, Benjamin E. Bagozzi

机构 * University of Delaware, Department of Political Science & International Relations(德克萨斯大学,政治科学与国际关系系) University of Delaware, Masters of Science in Data Science Program(德克萨斯大学,数据科学硕士项目) University of Delaware, Department of Computer & Information Sciences(德克萨斯大学,计算机与信息科学系) University of Pennsylvania, Department of Political Science(宾夕法尼亚大学,政治科学系)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍了一个连接多模态政治通讯的数据集,涵盖俄罗斯政府多个 decades 的官方演讲,提供俄语和英语文本、图像及注释,并通过 transformer 多模态模型进行主题标注,支持政治通讯的多模态分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13987 2026-07-16 cs.CR 新提交 75%

Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation

智能体技能安全:威胁模型、攻击、防御与评估

Sanket Badhe, Priyanka Tiwari

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究智能体可复用技能安全,提出SkillSec-Eval框架,刻画技能生命周期并开发威胁分类法,通过对327个真实技能实证评估,发现多阶段有漏洞,强调需进行生命周期感知安全分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13035 2026-07-16 cs.CL cs.AI cs.LG cs.SE 新提交 75%

FixItFlow: Automated Troubleshooting Guide Generation from Cloud Incidents

FixItFlow:从云事件中自动生成故障排除指南

Srihari Unnikrishnan, Jaskaran Singh Walia, Drishti Goel, Supriyo Ghosh

机构 * Microsoft Research(微软研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Inception

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对云事件手动创建故障排除指南的问题,提出FixItFlow系统,利用大语言模型从历史事件数据生成指南,能提取诊断模式、合成结构化指南并严格验证,经评估可提升事件响应,减轻团队文档负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27232 2026-07-16 cs.CL 版本更新 74%

Targeted Linguistic Analysis of Sign Language Models with Minimal Translation Pairs

基于最小翻译对的手语语言模型目标语言分析

Serpil Karabüklü, Kanishka Misra, Shester Gueuwou, Diane Brentari, Greg Shakhnarovich, Karen Livescu

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) Linguistics Department, The University of Texas at Austin(德克萨斯大学奥斯汀分校语言学系) Linguistics Department, The University of Chicago(芝加哥大学语言学系)

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 针对手语翻译模型,通过构建美国手语最小翻译对数据集(ASL-MTP)并消融输入线索,分析模型对不同手语现象(尤其是非手动线索)的捕捉能力。

Comments It is accepted to CVPR 2026 Workshop GenSign: Generative AI for Sign Language

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13548 2026-07-16 cs.AI 新提交 70%

How Far Can Root Cause Analysis Go on Real-World Telemetry Data?

根因分析在实际遥测数据上能走多远?

Athira Gopal, Ashwanth Krishnan

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究生产微服务故障根因分析难题,提出结构化多智能体RCA管道,性能超现有方法。引入反向推理智能体和自动规则挖掘管道,发现故障证据多,瓶颈在智能体推理能力,模型推理和领域知识是主要限制,进步需模型改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13111 2026-07-16 cs.SE cs.AI 新提交 70%

SemaDiff: Identifying Semantic-Changing Commits with Generated Code and Tests

SemaDiff:使用生成的代码和测试识别语义变化的提交

Maha Ayub, Michael Konstantinou, Ahmed Khanfir, Nikolaos Tsantalis, Mike Papadakis

机构 * SnT, University of Luxembourg(卢森堡大学SnT分校) RIADI, ENSI, University of Manouba(突尼斯曼努巴大学RIADI与ENSI分校) Concordia University(康科德大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究软件仓库挖掘中区分语义保留与变化提交的问题,提出SemaDiff方法,通过行为分析、生成额外调用方法及依赖类等,实现对提交的语义判断,实验表明该方法能较准确地区分,语义变化提交检测精度高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12963 2026-07-16 cs.CL 版本更新 70%

The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context

稳健性的错觉:聚合准确率掩盖了与任务无关的上下文下的预测翻转

Yanzhe Zhang, Sanmi Koyejo, Diyi Yang

机构 * Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究大语言模型在含无关上下文环境中的表现,发现聚合准确率掩盖了单个示例预测的不稳定性,如随机伪词会改变部分预测,且此不稳定性受多种因素调节,揭示了尾部风险,推动对模型进行单个示例可靠性评估。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16307 2026-07-16 cs.AI 版本更新 70%

NeSy-Route: A Neuro-Symbolic Benchmark for Constrained Route Planning in Remote Sensing

NeSy-Route:一种用于遥感约束路径规划的神经符号基准

Ming Yang, Zhi Zhou, Shi-Yu Tian, Kun-Yang Yu, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) School of Artifical Intelligence, Nanjing University, China(人工智能学院,南京大学) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 NeSy-Route是一个大规模神经符号基准,用于评估遥感中的约束路径规划能力,通过自动化数据生成框架和三级评估协议,全面测试多模态大语言模型的感知、推理和规划能力。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00546 2026-07-16 cs.AI cs.CV 版本更新 70%

Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation

通过能力导向的基准和MCTS驱动的数据生成推进多模态评判模型

Zeyu Chen, Huanjin Yao, Ziwang Zhao, Min Yang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出M-JudgeBench和Judge-MCTS框架,通过能力导向的基准和MCTS驱动的数据生成提升多模态评判模型的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24563 2026-07-16 cs.CV cs.CL 版本更新 70%

NeMo: Needle in a Montage for Video-Language Understanding

NeMo:视频语言理解中的蒙太奇之针

Zi-Yuan Hu, Shuo Liang, Duo Zheng, Yanyang Li, Yeyao Tao, Shijia Huang, Wei Feng, Jia Qin, Jianguang Yu, Jing Huang, Meng Fang, Yin Li, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Phoenix TV(凤凰电视台) Stanford University(斯坦福大学) University of Liverpool(利物浦大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 为评估视频大语言模型时间理解能力,提出蒙太奇之针(NeMo)任务,开发自动数据生成管道并构建NeMoBench基准,能生成高质量数据,评估了20个模型,展现其能力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14075 2026-07-16 cs.SE 新提交 67%

VisualRepair: Dynamic Tool Calling and Region Focusing for Visual Software Issue Repair

VisualRepair:用于视觉软件问题修复的动态工具调用和区域聚焦

Jingyu Xiao, Zhongyi Zhang, Haoran Hou, Yuxuan Wan, Yuan Jiang, Yintong Huo, Michael R. Lyu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对现代软件视觉信息利用难题,提出VisualRepair框架,通过图像类型感知工具调用和动态测试时区域聚焦两模块,在SWE-bench基准测试中性能超现有方法,有效提升自动视觉软件问题修复能力。

Comments The paper was completed in March 2026 and is currently under review. The code will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏