arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-20 至 2026-07-20 共收录 44 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 44 篇

2606.16127 2026-07-20 cs.CL cs.AI cs.LG 版本更新 92%

AuAu: A Benchmark for Auditing Authoritarian Alignment in Large Language Models

AuAu: 大型语言模型中威权对齐审计基准

Andreas Einwiller, Max Klabunde, Florian Lemmerich

机构 * University of Zurich(苏黎世大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AuAu基准,结合心理测量、情境行为测试和用户提示评估LLM的威权倾向,发现17个模型均存在显著威权响应,且系统提示可操纵多数模型。

Comments v2, 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15899 2026-07-20 cs.LG 新提交 90%

ContinuityBench: A Benchmark and Systems Study of Stateful Failover in Multi-Provider LLM Routing

ContinuityBench:多提供商大语言模型路由中有状态故障转移的基准测试与系统研究

Vishal Pandey, Gopal Singh

机构 * Metriqual(梅特里夸尔)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究多提供商LLM路由中状态故障转移问题,提出有状态代理架构及历史转发策略,引入新指标,通过continuity - bench评估,实证表明该架构CPR达99.20%,刻画延迟分布,为构建多模型推理系统提供基础。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15517 2026-07-20 cs.CV cs.AI 新提交 89%

SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification

SLAPBench:用于四指SLAP指纹验证的多模态大语言模型基准测试

Bibesh Pyakurel, M. G. Sarwar Murshed

机构 * University of Wisconsin–Green Bay(威斯康星大学格林湾分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究四指SLAP指纹验证,介绍SLAPBench基准,评估多个MLLM在不同提示下的表现,发现提示控制崩溃,模型能力控制歧视,建立了特定于SLAP的MLLM基线,揭示了模型在指纹验证中的能力差距和公平性问题。

Comments 19 pages, 6 figures, 2 tables. Includes appendix with supporting figures and per-subgroup fairness detail. Code and data: https://github.com/bibeshpyakurel/SLAPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06742 2026-07-20 cs.SE cs.AI 版本更新 89%

Evaluating LLM-Based 0-to-1 Software Generation in End-to-End CLI Tool Scenarios

评估基于LLM的从零开始软件生成在端到端CLI工具场景中的表现

Ruida Hu, Xinchen Wang, Chao Peng, Cuiyun Gao, David Lo

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Independent Researcher, China(独立研究者,中国) Singapore Management University, Singapore(新加坡管理大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CLI-Tool-Bench基准,用于评估从零生成CLI工具的能力,发现顶级模型成功率低于43%,指出生成代码倾向单体化。

Comments Data link: https://github.com/kinesiatricssxilm14/CLI-Tool-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15414 2026-07-20 cs.LG cs.AI q-fin.CP 新提交 88%

AI Trading: Evaluating Large Language Models for Technical Market Analysis

人工智能交易:评估用于技术市场分析的大语言模型

Geofrey Ntale

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文系统比较评估五个大语言模型用于技术市场分析的能力,涵盖四项任务,采用多种定量指标。实验发现GPT-4 Turbo在通用模型中年化回报和夏普比率最高,FinGPT经领域微调表现出色,二者均超标准普尔500指数基准,还识别出模型存在的问题及得出相关结论。

Comments Master's research paper, Georgia Institute of Technology. 31 pages, 4 figures

Journal ref Georgia Institute of Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15396 2026-07-20 cs.CL 88%

Attribution, Citation, and Quotation: A Survey of Evidence-based Text Generation with Large Language Models

归因、引用与引述:基于大语言模型的证据导向文本生成综述

Tobias Schreieder, Tim Schopf, Michael Färber

机构 * TU Dresden & ScaDS.AI Dresden/Leipzig(德累斯顿技术大学及ScaDS.AI德累斯顿/莱比锡)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文综述了基于大语言模型的证据导向文本生成,分析了134篇论文,提出统一的分类体系,探讨了引用、归因和引述三种方法,并指出未来研究方向和挑战。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13347 2026-07-20 cs.CL cs.AI cs.LG 版本更新 87%

LLM-as-a-Judge Scores Are Unreliable Optimization Signals in Closed-Loop Table Recognition

评估能力并不意味着优化效用:闭环表格识别中的大语言模型作为评判信号

Donghwan Kim

机构 * Aidentyx Inc.(艾登蒂克斯公司)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究闭环表格识别中LLM-as-a-judge的效用,发现其评判信号弱,无特定反馈也有严重损失,结构保留约束效果不佳,表明评估能力不意味着优化效用,迭代细化需确定性检测结构变化的验证信号。

Comments 32 pages, 9 figures, appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15555 2026-07-20 cs.IR 新提交 86%

LLMs Encode Relevance as a Layer-Wise Cross-Lingual Signal

语言模型将相关性编码为分层跨语言信号

Pietro Bernardelle, Samaneh Mohtadi, Stefano Civelli, Joel Mackenzie, Gianluca Demartini

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型中查询与文档相关性是否可线性解码,通过引导中等规模模型、提取激活并训练线性探针,发现相关性是深度依赖信号,多语言实验有部分跨语言可移植性,为基于LLM的相关性评估提供表征视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14835 2026-07-20 cs.IR 版本更新 85%

LLM-Based Re-Ranking for Real Estate Search

基于大语言模型的房地产搜索重排

Nkateko Ntimane, Rafael Guedes, Tiago Cunha, Pedro Nogueira

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对拉丁美洲住房市场搜索难题及用户期望变化,提出基于大语言模型的重排器,依用户对话意图重排候选房源,构建评估数据集并验证,提升了搜索重排质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23786 2026-07-20 cs.AI cs.LG 版本更新 84%

FAIR_XAI: Improving Multimodal Foundation Model Fairness via Explainability for Wellbeing Assessment

FAIR_XAI: 通过可解释性提升多模态基础模型公平性以用于幸福感评估

Sophie Chiang, Tom Brennan, Fethiye Irmak Dogan, Jiaee Cheong, Hatice Gunes

机构 * Department of Computer Science & Technology, University of Cambridge(计算机科学与技术系,剑桥大学) Harvard University(哈佛大学)

专题命中 评测与基准 :foundation model(title);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了多模态基础模型在幸福感评估中的公平性问题,通过可解释性干预框架改善诊断可靠性与公平性,发现不同模型在不同数据集上表现差异显著,且存在性别和种族偏见。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10029 2026-07-20 cs.CL cs.AI cs.CR 版本更新 84%

Latent Fusion Jailbreak: Blending Harmful and Harmless Representations to Elicit Unsafe LLM Outputs

潜在融合越狱:融合有害与无害表征以引出不安全的大语言模型输出

Wenpeng Xing, Bohan Yang, Mohan Li, Chunqiang Hu, Haitao Xu, Ningyu Zhang, Bo Lin, Meng Han

机构 * Bingjiang Institute of Zhejiang University(浙江大学滨江学院) Zhejiang University(浙江大学) Guangzhou University(广州大学) Chongqing University(重庆大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究如何通过白盒干预操纵安全对齐的大语言模型,核心方法是潜在融合越狱(LFJ),通过配对有害与良性表征、优化混合系数等实现,在多个模型和基准上取得高攻击成功率,还设计了对抗训练程序降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16066 2026-07-20 cs.NI cs.AI 新提交 83%

LLM-Powered Agentic AI for 5G/6G Networks: A Tutorial and Survey on Architectures, Protocols, and Standardization

用于5G/6G网络的基于大语言模型的智能体人工智能:架构、协议和标准化教程与综述

Mazene Ameur, Abdelkader Mekrache, Bouziane Brik, Adlen Ksentini

机构 * EURECOM University of Sharjah(谢贾学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究5G/6G网络中基于大语言模型的智能体人工智能,通过分为两部分的教程与综述,形式化5G和6G相关平面,涵盖智能体系统基础,映射其能力到控制面等,识别自主电信面临的开放挑战。

Comments 35 pages, 4 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10024 2026-07-20 cs.CV cs.AI cs.LG 版本更新 82%

LVSum: A Benchmark for Timestamp-Aware Long Video Summarization

LVSum:一个用于时间感知长视频摘要的基准测试

Alkesh Patel, Melis Ozyildirim, Ying-Chang Cheng, Ganesh Nagarajan

机构 * Apple(苹果公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LVSum基准测试,用于评估长视频摘要中时间对齐的性能,通过引入新的评估指标揭示现有MLLM在时间理解上的系统性差距。

Comments 25 pages, 5 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25878 2026-07-20 eess.IV cs.CV 版本更新 82%

A Clinically Validated Foundation Model for Comprehensive Lung Pathology Interpretation

临床验证的基础模型用于全面肺部病理解读

Zhengrui Guo, Zhengyu Zhang, Jiabo Ma, Yihui Wang, Fengtao Zhou, Yingxue Xu, Ling Liang, Chenglong Zhao, Qi Xie, Jinbang Li, Shujing Guo, Fangyi Han, Zhijian Cen, Ziyi Liu, Cheng Jin, Junlin Hou, Zhixuan Chen, Yu Cai, Lijuan Qu, Shifu Chen, Yueping Liu, Zhe Wang, Xiuming Zhang, Muyan Cai, Li Liang, Hao Chen

机构 * Department of Pathology, Nanfang Hospital, Southern Medical University, Guangzhou, China(南方医科大学南芳医院病理科,广州,中国) Department of Pathology, School of Basic Medical Sciences, Southern Medical University, Guangzhou, China(南方医科大学基础医学学院病理科,广州,中国) Department of Computer Science and Engineering, Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学计算机科学与工程系,香港,中国) Guangdong Provincial Key Laboratory of Molecular Tumor Pathology, Guangzhou, China(广东省分子肿瘤病理重点实验室,广州,中国) Department of Pathology, Shandong Provincial Qianfoshan Hospital, Jinan, Shandong, China(山东省青岛坊山医院病理科,济南,山东,中国)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 提出PulmoFoundation,一种基于Virchow2和约4万张H&E染色全切片图像进行亚专科预训练的肺部病理基础模型,通过32项临床任务和前瞻性随机对照试验验证,在诊断准确性、效率和一致性上显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16031 2026-07-20 cs.LG cs.AI 新提交 81%

Revisiting data-driven dynamic security assessment with a tabular foundation model

使用表格基础模型重新审视数据驱动的动态安全评估

Olayiwola Arowolo, Maosheng Yang, Jochen Cremer

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对数据驱动的电力系统动态安全评估方法的局限,提出用表格基础模型,通过上下文学习评估稳定性,无需重新训练或调参。单个模型可评估多故障,经案例研究表明该模型用少量标记样本就能达到高分数,为电力系统基础模型开发部署奠基。

Comments Paper is in the review process

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12069 2026-07-20 cs.CL cs.AI cs.LG 版本更新 80%

Robust Explanations for User Trust in Enterprise NLP Systems

企业NLP系统中用户信任的鲁棒解释

Guilin Zhang, Kai Zhao, Jeffrey Friedman, Xu Chu, Amine Anoun, Jerry Ting

机构 * Workday AI

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种统一的黑盒鲁棒性评估框架,用于评估token级解释的鲁棒性,通过留一法遮挡和现实扰动测试,发现解码器LLM比编码器基线更稳定,且模型规模越大稳定性越强,同时建立了鲁棒性与推理成本的实用权衡曲线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10310 2026-07-20 cs.CL 版本更新 79%

PolyInterview: An LLM-based Platform for Immersive Mock Interview Practice with Comprehensive Multimodal Assessment

PolyInterview:一个基于大语言模型的沉浸式模拟面试平台,具备全面的多模态评估

Zhiyuan Wen, Jiannong Cao, Kelly Chan, Zijian Wang, Chen Chen, Xiaoyun Liu, Jianing Yin, Zhuo Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Chongqing University of Posts and Telecommunications(重庆邮电大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 PolyInterview平台利用大语言模型,基于职位描述和简历为求职者生成定制面试问题,通过数字人类面试官进行多轮口语面试,全面评估回答内容、语音表达和非语言行为,提供结构化反馈,助力求职者更好地准备面试。

Comments 10 pages, 7 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16024 2026-07-20 cs.SE 新提交 78%

DiffTestGen: Change-Directed LLM-Based Testing for Exposing Behavioral Differences

DiffTestGen:基于大语言模型的变更导向测试以揭示行为差异

Huimin Hu, Cristian Cadar, Michael Pradel

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究如何确保软件行为变化符合预期,提出基于大语言模型的DiffTestGen方法,利用静态调用图分析等确定入口点并改进联合覆盖指标,实验表明该方法能有效揭示行为差异、提高覆盖率并检测回归错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16175 2026-07-20 cs.CR cs.AI 新提交 77%

Evaluating Open-Weight LLMs for Generating Structured Threat Information for Autonomous Vehicle Vulnerabilities

评估开放权重语言模型用于生成自动驾驶车辆漏洞的结构化威胁信息

Md Erfan, Ahmed Ryan, Md Kamal Hossain Chowdhury, Md Rayhanur Rahman

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究自动驾驶车辆漏洞相关结构化威胁信息生成问题,利用开放权重语言模型,通过构建CAV-STIXGen数据集评估11个模型,分析CWE和MITRE ATT&CK共现,展示AI辅助转换可自动化威胁情报并优先防御运输安全。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16001 2026-07-20 cs.CL 新提交 77%

BayesPO: Bayesian Prompt Optimization via Parallel-Tempered Gradient-Guided Discrete MCMC

BayesPO:通过并行回火梯度引导离散MCMC进行贝叶斯提示优化

Junjie Zhou, Zhijian Ou

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究将提示优化作为离散提示令牌上的贝叶斯后验采样问题,提出BayesPO框架,结合任务似然项与语言模型先验定义后验分布,用马尔可夫链蒙特卡罗实例化,实验表明其能发现有意义提示、逃离局部最优并提高准确率,同时揭示了两个主要局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15560 2026-07-20 cs.NE cs.AI 新提交 77%

Evolutionary Algorithm-Guided LLMs for Physics-Informed Neural Network Design

用于物理信息神经网络设计的进化算法引导的大语言模型

Xu Yang, Mingyang Yu, Jing Xu, Keqian Li

机构 * Shanghai Institute of Intelligent Education, East China Normal University, Shanghai(上海智能教育研究所,华东师范大学,上海) College of Artificial Intelligence, Nankai University(人工智能学院,南开大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对物理信息神经网络(PINNs)设计敏感的问题,提出用进化算法引导大语言模型跨代生成可执行配置,经一维波动方程实验验证可行性,能降低均方误差,还揭示了低解误差与高PDE残差可共存等情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16122 2026-07-20 cs.AI cs.LG 新提交 76%

CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data

CRAFT:聚类评分标准以诊断大型语言模型的能力短板并生成针对性的微调数据

Vipul Gupta, Zihao Wang, Razvan-Gabriel Dumitru, MohammadHossein Rezaei, Aakash Sabharwal, Yunzhong He

机构 * Scale AI(Scale人工智能公司)

专题命中 评测与基准 :LLM(title);分类 cs.AI、cs.LG

AI总结 研究针对评估应指导模型改进及提供训练数据的问题,提出CRAFT方法,将评分标准评估数据集转化为模型能力短板诊断,通过聚类能力描述、评估模型节点等生成微调数据,实验表明该方法能更精准诊断模型弱点并提升性能。

Comments 18 pages, 3 Tables, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29573 2026-07-20 cs.CV 版本更新 75%

Reliability-Prioritized Fine-Grained Generation in Multimodal Large

多模态大模型中可靠性优先的细粒度生成

Xiaomeng Fan, Wei Wu, Yuwei Wu, Zhi Gao, Shiyu Luo, Mingyang Gao, Haoyu Zhao, Zhenxin Diao, Yuxuan Ba, Lijia Feng, Yunde Jia, Mehrtash Harandi

机构 * Beijing Key Laboratory of Intelligent Information Technology, School of Computer Science & Technology, Beijing Institute of Technology(北京智能信息科技重点实验室,计算机科学与技术学院,北京理工大学) Guangdong Laboratory of Machine Perception and Intelligent Computing, Shenzhen MSU-BIT University(广东机器感知与智能计算实验室,深圳MSU-BIT大学) Department of Electrical and Computer System Engineering, Monash University(电子与计算机系统工程系,莫纳什大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 针对多模态大模型细粒度生成易出错的问题,提出GranFact基准和层次感知评估算法,并基于直接偏好优化提出可靠性优先的偏好优化方法,提升细粒度生成同时保持可靠性。

Comments Equal contribution: Xiaomeng Fan and Wu Wei. Corresponding authors: Zhi Gao and Yunde Jia

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24009 2026-07-20 cs.CR cs.AI cs.CL cs.LG 版本更新 75%

Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking

Jailbreak Foundry: 从论文到可运行攻击的可重复基准测试

Zhicheng Fang, Jingjie Zheng, Chenxu Fu, Wei Xu

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Tsinghua University(清华大学) University of Melbourne(墨尔本大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 JAILBREAK FOUNDRY通过多代理工作流将论文转换为可执行模块,实现可重复基准测试的标准化评估和自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16050 2026-07-20 cs.LG 新提交 74%

DELUGE: Towards Continental-Scale Daily Pluvial Flood Damage Prediction via Interpretable Conditioning on Foundation Model Embeddings

DELUGE:通过基础模型嵌入的可解释条件实现大陆尺度每日暴雨洪水灾害预测

Yuya Kawakami, Daniel Cayan, Dongyu Liu, Kwan-Liu Ma, Tom Corringham

机构 * University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 评测与基准 :foundation model(title);分类 cs.LG

AI总结 研究针对美国暴雨洪水难预测及现有方法局限问题,提出DELUGE多模态深度学习框架,通过对特定单元格建模,利用参数模块结合基础模型嵌入实现可解释预测,在PR - AUC指标上优于基线,且该条件设定方案可用于其他地理空间预测任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15883 2026-07-20 cs.HC cs.AI 新提交 70%

Perceived AGI: Believability as Dimensional Completeness, Not Capability

感知通用人工智能:可信度取决于维度完整性,而非能力

Sebastian Cochinescu

机构 * University of Bucharest(布加勒斯特大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨大语言模型在对话中缺乏思维存在感的问题,提出可信度取决于维度完整性的假设,定义了时间、真相、熵和爱四个维度及相关行为立场,识别出行为层,还陈述了可证伪预测,为感知通用人工智能提供概念框架。

Comments 12 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15766 2026-07-20 cs.CL 新提交 70%

Before the Action: Benchmarking LLMs on Prospective Hypothesis Discovery

行动之前:在前瞻性假设发现任务上对大语言模型进行基准测试

Tianyun Zhong, Wangyi Jiang, Wei Wang, Xuanang Chen, Yaojie Lu, Shiwei Ye, Yuzhen Shi, Boyu Yang, Jinghang Wang, Han Li, Weiqi Zhai, Bing Zhao, Hu Wei, Haiyang Yu, Yongbin Li, Hongyu Lin, Le Sun, Xianpei Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究旨在评估大语言模型在开放式结论前阶段的发现能力,引入前瞻性假设发现任务及评估框架HypoArena,提出回顾性上下文回归构建基准数据,实验揭示模型能力分层及效应,结果支持将其作为评估大语言模型制定调查方向的独特目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15641 2026-07-20 cs.RO cs.AI 新提交 70%

IMBench: A Benchmark for Intuitive Robotic Manipulation

IMBench:直观机器人操作的基准测试

Anurag Maurya, Sukhvansh Jain, Prajwal Avhad, Gautham Balachandran, Ziyi Zhou, Atharva Kshirsagar, Satyam Singh, Bowen Li. Rishabh Mukund, Ritul Singh, Jatin Vira, Suvonil Chatterjee, Devesh K. Jha

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 IMBench旨在评估直观机器人操作这一综合能力,其任务含物理结构推断与动作序列生成。通过35个任务等进行实验,发现视觉语言模型和视觉 - 语言 - 动作模型的不足,为评估和发展物理智能提供基准。

Comments Accepted to SemRob Workshop, RSS 2026. Project Website: https://imbench.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15592 2026-07-20 cs.AI 新提交 70%

MGDT: MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts for Multimodal Knowledge Graph Completion

MGDT:具有关系自适应专家混合的MLLM引导扩散变压器用于多模态知识图谱补全

Xu Hou, Meiyu Liang, Wei Huang, Yawen Li, Zhe Xue, Wu Liu, Guanhua Ye, Lei Shi, Kangkang Lu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Communication University of China(中国传媒大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态知识图谱补全问题,提出MGDT框架,先通过RASR-MoE模块选路径、抑干扰,再用MLLM对齐表示,最后KGDT去噪生成,实验证明该框架在三个基准数据集上性能优于基线。

Comments 8pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16193 2026-07-20 cs.CV 新提交 67%

Knowing the Self, Understanding the World: A Dual-Cognition Benchmark for UAV Spatio-temporal Reasoning with MLLMs

认识自我,理解世界:用于基于多模态大语言模型的无人机时空推理的双认知基准测试

Like Liu, Zhengzheng Xu, Haitao He, Hongzhe Li, Shuchang Zhang, Dian Shao

机构 * Northwestern Polytechnical University(西北工业大学) China University of Petroleum(中国石油大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对多模态大语言模型在无人机场景双认知能力评估不足的问题,提出UAV-DualCog基准测试,涵盖图像和视频任务,通过自动化管道构建数据,评估发现现有模型存在瓶颈,该基准测试有价值。

Comments 11 pages, 4 figures, 7 tables. Project website: https://uav-dualcog.lozumi.com

详情

展开后加载摘要…

URL PDF HTML 收藏