arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 717 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 160 篇

2605.17028 2026-05-19 cs.CL cs.AI 73%

PARALLAX: Separating Genuine Hallucination Detection from Benchmark Construction Artifacts

PARALLAX:区分真实幻觉检测与基准构建人工制品

Khizar Hussain, Murat Kantarcioglu

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型幻觉检测中的基准构建人工制品问题,提出DRIFT作为对比方法,发现大部分基线方法在控制条件下表现接近随机,而SAPLMA和DRIFT作为上层隐藏状态的监督探针表现出例外。

Comments Preprint to Neurips 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16650 2026-05-19 cs.CL cs.AI 73%

SKG-Eval: Stateful Evaluation of Multi-Turn Dialogue via Incremental Semantic Knowledge Graphs

SKG-Eval: 通过增量语义知识图谱进行多轮对话的有状态评估

Avijit Shil, Suman Samui

机构 * Maulana Abul Kalam Azad University of Technology(Maulana Abul Kalam Azad 工业技术大学) National Institute of Technology Durgapur(Durgapur 国家理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出SKG-Eval框架,通过增量语义知识图谱模型,解决多轮对话评估中长距离不一致问题,提供可解释的评估信号和可复现的评分结果。

Comments 36 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17843 2026-05-19 cs.CL cs.AI cs.HC 73%

ShareChat: A Dataset of Chatbot Conversations in the Wild

ShareChat: 一个真实对话的大型数据集

Yueru Yan, Tuc Nguyen, Bo Su, Melissa Lieffers, Thai Le

机构 * Indiana University(印第安纳大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ShareChat数据集,包含142,808条对话(660,293个回合),涵盖95种语言,分析不同平台对话完整性和响应延迟差异,揭示多平台交互特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16295 2026-05-19 cs.CY cs.AI cs.CL cs.GR cs.HC cs.MM 73%

ANVIL: Analogies and Videos for Lecturers

ANVIL:为讲师提供类比和视频

Yuri Noviello, Anastasiia Birillo, Gosia Migut

机构 * Delft University of Technology(代尔夫特理工大学) JetBrains Research(JetBrains研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 ANVIL是一种多模态生成系统,可自动生成基于类比的计算机科学教学动画。通过生成文本类比、结构化视觉剧本和可执行代码,提升教学有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18754 2026-05-19 cs.CV 71%

Can These Views Be One Scene? Evaluating Multiview 3D Consistency when 3D Foundation Models Hallucinate

这些视角能是一个场景吗?在3D基础模型产生幻觉时评估多视角3D一致性

Soumava Paul, Prakhar Kaushik, Alan Yuille

机构 * CCVL, Johns Hopkins University(计算机视觉实验室,约翰霍普金斯大学)

专题命中 评测与基准 :foundation model(title)

AI总结 本文研究了在3D基础模型产生幻觉时多视角3D一致性的可靠性问题,提出了一种可控的鲁棒性基准和参数化家族,将神经度量分解为backbone、残差和聚合组件,并引入基于COLMAP的度量方法,以提高与人类判断的一致性。

Comments Project Page at https://mvp18.github.io/3d-consistency-metrics/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18029 2026-05-19 cs.CV 71%

What Matters for Grocery Product Retrieval with Open Source Vision Language Models

在开源视觉语言模型中,什么因素影响杂货产品检索

Emmanuel G. Maminta, Rowel O. Atienza

机构 * AI Graduate Program, University of the Philippines, Diliman, Quezon City(菲律宾大学达林学院人工智能研究生项目) EEEI, University of the Philippines, Diliman, Quezon City(菲律宾大学达林学院电子工程系)

专题命中 评测与基准 :language model(title)

AI总结 本文研究了开源视觉语言模型在杂货产品检索任务中的表现,发现数据质量比规模更重要,高效模型可以胜出,并且存在召回率差距的问题。

Comments Accepted in the 28th International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18684 2026-05-19 cs.SE cs.AI 70%

Reversa: A Reverse Documentation Engineering Framework for Converting Legacy Software into Operational Specifications for AI Agents

Reversa:一个用于将遗留软件转换为AI代理操作规范的反向文档工程框架

Sanderson Oliveira de Macedo, Ronaldo Martins da Costa

机构 * Federal Institute of Goias(戈亚斯联邦理工学院) Federal University of Goias(戈亚斯联邦大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Reversa框架,旨在通过反向文档工程将遗留软件转换为AI代理可操作的规范,通过多代理流水线流程提取隐含规则,生成可追溯的操作规范,并提出评估协议以衡量覆盖率、可追溯性、置信度、效用和成本。

Comments Preprint. Includes a generative AI use statement

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18621 2026-05-19 cs.CV cs.AI 70%

CrossView Suite: Harnessing Cross-view Spatial Intelligence of MLLMs with Dataset, Model and Benchmark

CrossView Suite: 利用数据集、模型和基准 harnessing MLLMs 的跨视图空间智能

Wei Wang, Yuqian Yuan, Tianwei Lin, Wenqiao Zhang, Siliang Tang, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出CrossView Suite,通过开发CrossViewSet、CrossViewBench和CrossViewer三个组件,解决跨视图推理中的数据稀缺、评估不足和对齐机制缺失问题,提升多视图空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18284 2026-05-19 cs.SE cs.AI 70%

CommitDistill: A Lightweight Knowledge-Centric Memory Layer for Software Repositories

CommitDistill: 一种轻量级的知识导向内存层用于软件仓库

Divya Chukkapalli, Thejesh Avula, Aditya Aggarwal, Harsimran Singh, Amith Tallanki

机构 * Microsoft Corporation(微软公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CommitDistill,一种轻量级的知识导向内存层,通过确定性正则表达式从本地git历史中提取类型化知识单元,并通过TF-IDF检索器进行检索,以提高软件仓库中历史信息的利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16278 2026-05-19 cs.CV cs.AI cs.RO 70%

DriveMoE: Mixture-of-Experts for Vision-Language-Action Model in End-to-End Autonomous Driving

DriveMoE:面向端到端自动驾驶的视觉-语言-动作混合专家模型

Zhenjie Yang, Yilin Chai, Xiaosong Jia, Qifeng Li, Yuqian Shao, Xuekai Zhu, Haisheng Su, Junchi Yan

机构 * Sch. of Computer Science & Sch. of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学计算机科学学院与人工智能学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) AnyScale AI Project(AnyScale AI项目)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DriveMoE,一种基于混合专家架构的端到端自动驾驶框架,通过场景专用的视觉混合专家和技能专用的动作混合专家,实现了对复杂驾驶场景的有效处理,展示了在自动驾驶任务中结合视觉和动作混合专家的有效性。

Comments Accepted by CVPR 2026, Project Page: https://thinklab-sjtu.github.io/DriveMoE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17829 2026-05-19 cs.AI 70%

Interactive Evaluation Requires a Design Science

交互评估需要一种设计科学

Keyang Xuan, Peiyang Song, Pan Lu, Pengrui Han, Wenkai Li, Zhenyu Zhang, Zexue He, Wenyue Hua, Manling Li, Jiaxuan You, Adrian Weller, Yizhong Wang, Jiaxin Pei

机构 * University of Texas Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) Northwestern University(西北大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了交互评估应被视为一种原则性的评估范式,而非仅仅是新的智能体基准。通过定义评估为证据到判断的自主映射,文章展示了交互评估如何改变这一映射的两方面,并提出双轴分类法,制定设计原则和报告标准,分析了长期评估挑战在轨迹层面的再现。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17714 2026-05-19 cs.CL 70%

From Documents to Segments: A Contextual Reformulation for Topic Assignment

从文档到段落:一种用于主题分配的上下文重述

Hoonsang Yoon, Takyoung Kim, Wonkee Lee, Ilmin Cho, Dilek Hakkani-Tür, Stanley Jungkyu Choi

机构 * LG AI Research(LG AI研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于段落的主题分配方法(SBTA),通过将主题分配到短小且连贯的文本段落而非整个文档,以解决传统主题模型中文档多主题问题导致的主题污染问题,从而提升主题分析的清晰度和可解释性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17698 2026-05-19 cs.LG cs.MA 70%

Agent Bazaar: Enabling Economic Alignment in Multi-Agent Marketplaces

Agent Bazaar: 使多智能体市场场所具备经济对齐能力

Seth Karten, Cameron Crow, Chi Jin

机构 * Princeton University(普林斯顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究提出Agent Bazaar框架,用于评估多智能体系统的经济对齐能力,通过分析两种失败模式(算法不稳定和Sybil欺骗)发现模型难以自我调节,并提出经济对齐的训练方法和EAS评分标准。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17669 2026-05-19 cs.AI 70%

Multimodal Cultural Heritage Knowledge Graph Extension with Language and Vision Models

多模态文化遗产品知图扩展与语言和视觉模型

Yang Zhang, Nada Mimouni, Jean-Claude Moissinac, Fayçal Hamdi

机构 * Center for Studies and Research in Computer Science and Communication, CNAM(计算机科学与通信研究所以及CNAME)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种多模态方法,利用语言和视觉模型扩展文化遗产品知图,通过构建多模态知识图谱WJoconde并建立评估基准,提高知识图谱的扩展效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17652 2026-05-19 cs.CL 70%

Beyond Transcripts: Iterative Peer-Editing with Audio Unlocks High-Quality Human Summaries of Conversational Speech

超越转录:借助音频的迭代同行编辑解锁高质量的对话语音总结

Kaavya Chaparala, Thomas Thebaud, Jesús Villalba López, Laureano Moro-Velazquez, Peter Viechnicki, Najim Dehak

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究通过比较音频和转录本总结的质量,探讨了同行编辑在提升语音总结质量中的作用,并发现音频总结在信息量和压缩程度上不如转录本总结,但通过迭代同行编辑可以弥补这一差距。

Comments Accepted in LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09609 2026-05-19 cs.AI cs.RO 70%

General-purpose LLMs as Models of Human Driver Behavior: The Case of Simplified Merging

通用大语言模型作为人类驾驶员行为模型:简化合并案例

Samir H. A. Mohammad, Wouter Mooi, Arkady Zgonnikov

机构 * Department of Transport and Planning, Delft University of Technology(代尔夫特理工大学交通与规划系) Department of Cognitive Robotics(认知机器人学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了通用大语言模型在模拟人类驾驶员行为中的应用,通过在简化的一维合并场景中嵌入两个通用大语言模型,并与人类数据进行定量和定性分析,发现模型在间歇性操作控制和空间线索战术依赖方面能再现人类行为,但在动态速度线索响应和安全性能方面存在差异,提示未来需进一步研究其失效模式以确保其作为人类驾驶行为模型的有效性。

Comments To be published in proceedings of IEEE ITSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16990 2026-05-19 cs.AI cs.CE 70%

Conv-FinRe: A Conversational and Longitudinal Benchmark for Utility-Grounded Financial Recommendation

Conv-FinRe:一种用于实用导向财务推荐的对话和纵向基准

Yan Wang, Yi Han, Lingfei Qian, Yueru He, Xueqing Peng, Dongji Feng, Zhuohan Xie, Vincent Jim Zhang, Rosie Guo, Fengran Mo, Jimin Huang, Yankai Chen, Xue Liu, Jian-Yun Nie

机构 * Georgia Institute of Technology(佐治亚理工学院) Columbia University(哥伦比亚大学) California State University(加州州立大学) University of Montreal(蒙特利尔大学) The University of Manchester(曼彻斯特大学) McGill University(麦吉尔大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出Conv-FinRe基准,用于评估金融推荐模型在对话和长期视角下的实用性,通过多视角参考区分描述性行为与基于投资者风险偏好的规范性效用,揭示理性决策与行为一致性的张力。

Comments Accepted by SIGIR 2026 Resource Track. Pre-camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08886 2026-05-19 cs.CL cs.CE cs.IR 70%

FinAuditing: A Financial Taxonomy-Structured Multi-Document Benchmark for Evaluating LLMs

FinAuditing: 一个基于财务分类结构的多文档基准,用于评估LLMs

Yan Wang, Keyi Wang, Shanshan Yang, Jaisal Patel, Jeff Zhao, Fengran Mo, Xueqing Peng, Lingfei Qian, Yankai Chen, Víctor Gutiérrez-Basulto, Jimin Huang, Guojun Xiong, Xiao-Yang Liu, Xue Liu, Jian-Yun Nie

机构 * Columbia University(哥伦比亚大学) Stevens Institute of Technology(史蒂文斯理工学院) Rensselaer Polytechnic Institute(拉特格斯理工学院) University of Montreal(蒙特利尔大学) McGill University(麦吉尔大学) MBZUAI(麦吉尔大学人工智能研究所) Cardiff University(卡迪夫大学) The University of Manchester(曼彻斯特大学) Harvard University(哈佛大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出FinAuditing,一个基于财务分类结构的多文档基准,用于评估大型语言模型在财务审计任务中的能力,通过三个任务:财务语义匹配、财务关系提取和财务数学推理,揭示了现有LLMs在概念检索、分类感知关系建模和跨文档一致性推理方面的显著差距。

Comments Accepted by SIGIR 2026 Resource Track. Pre-camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21820 2026-05-19 cs.CL 70%

Can LLMs Generate and Solve Linguistic Olympiad Puzzles?

大语言模型能否生成并解决语言奥林匹克谜题?

Neh Majmudar, Elena Filatova

机构 * CUNY(纽约大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了大语言模型在生成和解决语言谜题中的能力,发现其在大多数谜题类型上优于人类,但对书写系统和不为人知语言的谜题表现较弱,提出了通过谜题生成促进语言学普及的研究意义。

Comments Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17309 2026-05-19 cs.CV cs.AI 70%

StyleText: A Large-Scale Dataset and Benchmark for Stylized Scene Text Inpainting

StyleText: 一个大规模数据集和基准,用于具有风格保留的场景文本修复

Aleksandr Simonyan, Nipun Jindal

机构 * Adobe Inc.(Adobe公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出StyleText,一个用于具有风格保留的场景文本修复的大规模数据集和基准,通过控制评估文本可读性和视觉一致性,利用共享场景上下文。

Comments Accepted at the SynData4CV Workshop, CVPR 2026. 8 pages + 1 page of references, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17255 2026-05-19 cs.AI math.OC 70%

CAM-Bench: A Benchmark for Computational and Applied Mathematics in Lean

CAM-Bench: 一个用于Lean中的计算与应用数学的基准测试

Wentao Long, Yunfei Zhang, Chenyi Li, Li Zhou, Chumin Sun, Zaiwen Wen

机构 * Fudan University(复旦大学) Qingdao University(青岛大学) Peking University(北京大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CAM-Bench,一个包含1000个Lean证明目标的基准测试,涵盖优化、数值线性代数和数值分析等领域,旨在补充现有形式化数学基准测试,通过针对依赖教科书概念和基本定理的应用数学问题进行评估。

Comments Preprint. 44 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17163 2026-05-19 cs.CR cs.AI 70%

STRIDE-AI: A Threat Modeling Framework for Generative AI Security Assessment

STRIDE-AI: 一种用于生成式AI安全评估的威胁建模框架

Tsafac Nkombong Regine Cyrille, Franziska Schwarz

机构 * SRH University of Applied Sciences Heidelberg School of Technology(海德堡应用科学大学技术与建筑学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出STRIDE-AI框架,旨在填补高层风险标准与技术漏洞分类之间的差距,通过六个阶段的评估生命周期和针对AI系统的威胁建模适应,降低AI系统面临攻击的成功率。

Comments 4 pages, 5 figures , 2 tables, CIIT 2026 23rd International Conference on Informatics and Information Technologies (CIIT)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14271 2026-05-19 cs.CL cs.CY 70%

Auditing Agent Harness Safety

审查代理安全

Chengzhi Liu, Yichen Guo, Yepeng Liu, Yuzhe Yang, Qianqi Yan, Xuandong Zhao, Wenyue Hua, Sheng Liu, Sharon Li, Yuheng Bu, Xin Eric Wang

机构 * UCB(加州大学伯克利分校) WISC(威斯康星大学) STANFORD(斯坦福大学) MSR1(微软研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出HarnessAudit框架,用于审查执行轨迹中的边界合规性、执行保真度和系统稳定性,揭示多代理Harness中的安全风险,并通过HarnessAudit-Bench验证了安全风险与轨迹长度、领域和代理角色的关系。

Comments 11 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16623 2026-05-19 cs.CY cs.AI 70%

To Trust or Not to Trust: Authors' Response to AI-based Reviews

信任还是不信任:作者对基于AI的评论的回应

César Leblanc, Lukas Picek

机构 * École Normale Supérieure(巴黎高等师范学院) Sorbonne University(索邦大学) University of West Bohemia(西波什埃大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过两项研究探讨作者对AI辅助评审的使用和看法,发现大多数作者认为AI反馈有用,但不将其等同于人类评审,且更倾向于在提交前使用AI作为内部工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16535 2026-05-19 cs.IR cs.AI 70%

RAPT: Retrieval-Augmented Post-hoc Thresholding for Multi-Label Classification

RAPT:基于检索的后处理阈值法用于多标签分类

Lasal Jayawardena, Nirmalie Wiratunga, Ikechukwu Nkisi-Orji, Darren Nicol

机构 * Robert Gordon University(罗伯特·戈登大学) William Nicol (Aberdeen) Limited(威廉·尼科尔(阿伯丁)有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 RAPT通过检索增强的方法改进多标签分类中的标签集选择,无需重新训练模型,有效应对OCR噪声和标签不平衡等问题,提升预测性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16297 2026-05-19 cs.CY cs.AI cs.HC cs.SE 70%

Task-Level AI Readiness Assessment for Business Process Management:The T-IPO Model and LARA Matrix in Financial-Services IT Operations

面向业务流程管理的任务级AI准备性评估:T-IPO模型与LARA矩阵在金融服务IT运营中的应用

Mingjun Li, Xiaojun Ye

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出T-IPO模型和LARA矩阵,用于评估任务级AI代理的适用性,通过认知执行复杂度和治理合规强度的两因素结构提升预测效用。

Comments 19 pages, 7 figures, 8 tables, 50 references. A shortened workshop version has been submitted to the BPM 2026 Workshop. This preprint is the complete version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18577 2026-05-19 cs.CV 67%

OmniPro: A Comprehensive Benchmark for Omni-Proactive Streaming Video Understanding

OmniPro: 一个全面的多模态流视频理解基准测试

Ruixiang Zhao, Jie Yang, Zijie Xin, Tianyi Wang, Fengyun Rao, Jing LYU, Xirong Li

机构 * Renmin University of China(中国人民大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出OmniPro基准测试,旨在评估多模态感知、主动响应和多样视频理解任务,通过2700个经人类验证的样本覆盖9个子任务和3个认知层次,揭示音频在流视频理解中的关键作用及模型在长时间任务中的鲁棒性问题。

Comments Project page: https://ruixiangzhao.github.io/OmniPro

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06754 2026-05-19 cs.SE 67%

ScarfBench: A Benchmark for Cross-Framework Application Migration in Enterprise Java

ScarfBench:企业Java应用跨框架应用迁移的基准测试

Advait Pavuluri, Bridget McGinn, Ashita Saxena, George Safta, Srikanth Tamilselvam, Raju Pavuluri, Michele Merler, Baishakhi Ray, Rahul Krishna

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出ScarfBench,一个用于评估企业Java应用跨框架迁移行为保持性的基准测试,通过专家编写实现三元组,涵盖Spring、Jakarta EE和Quarkus框架,生成102个变体和204个定向重构任务,评估了五种最先进的编码代理,并揭示了不同框架方向和架构层的难度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15756 2026-05-19 cs.SE 67%

An empirical analysis of vulnerability detection tools for solidity smart contracts

针对Solidity智能合约漏洞检测工具的实证分析

Francesco Salzano, Cosmo Kevin Antenucci, Simone Scalabrino, Giovanni Rosa, Rocco Oliveto, Remo Pareschi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文通过实证评估分析了针对Solidity智能合约的自动化漏洞分析工具,利用SmartBugs 2.0框架和手动标注的2182个实例数据集,评估了不同工具在检测各类漏洞上的有效性,并展示了结合多种检测方法能提高漏洞识别的准确性。

Comments 47 pages

Journal ref Empirical Software Engineering 31, 143 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17336 2026-05-19 cs.RO cs.CV eess.SP 67%

Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms

基于触觉的多模态融合在具身智能中的应用:视觉、语言和接触驱动范式的综述

Zhixiang Cao, Di Tian, Runwei Guan, Yanzhou Mu, Xiaolou Sun, Shaofeng Liang, Daizong Liu, Tao Huang, Yutao Yue, Henghui Ding, Bin Fang, Alex Zhou, Qing-Long Han, Hui Xiong

机构 * School of Electronic Science and Engineering, Xi’an Jiaotong University, China(西安交通大学电子科学与技术学院) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)人工智能研究所) State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) Purple Mountain Laboratory, China(紫金山实验室) Institute for Math & AI, Wuhan University, China(武汉大学数学与人工智能学院) Centre for AI and Data Science Innovation and the School of Science and Engineering, James Cook University, Australia(詹姆斯库克大学人工智能与数据科学创新中心及科学与工程学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) Institute of Big Data, Fudan University, China(复旦大学大数据研究院) Linkerbot (Beijing) Technology Co., Ltd, China(北京链动科技有限公司) School of Engineering, Swinburne University of Technology, Melbourne(斯威本技术大学工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文综述了多模态触觉融合在具身智能中的研究,探讨了如何通过整合视觉、语言和触觉信息来提升物理交互与语义推理的结合,提出了一种分层的分类体系,并总结了当前的研究挑战和未来方向。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏