arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2601.12560 2026-01-21 cs.AI cs.MA 70%

Agentic Artificial Intelligence (AI): Architectures, Taxonomies, and Evaluation of Large Language Model Agents

代理型人工智能(AI):架构、分类及大语言模型代理的评估

Arunkumar V, Gangadharan G. R., Rajkumar Buyya

机构 * University College of Engineering, Anna University(安娜大学工程学院) National Institute of Technology Tiruchirappalli(Tiruchirappalli 国家理工学院) School of Computing and Information Systems University of Melbourne(墨尔本大学计算机与信息系统学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了代理型人工智能的架构、分类及评估,提出统一分类框架,分析从线性推理到原生推理模型的转变,并指出未来研究方向以提升自主系统的可靠性。

Comments 28 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10904 2026-01-19 cs.AI 70%

ARC Prize 2025: Technical Report

ARC 2025奖项:技术报告

François Chollet, Mike Knoop, Gregory Kamradt, Bryan Landers

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文探讨了ARC-AGI-2基准竞赛中精炼循环对AGI进展的作用,分析了当前AI推理的局限性,并预览了ARC-AGI-3的交互推理挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05467 2026-01-16 cs.SE cs.AI 70%

STELP: Secure Transpilation and Execution of LLM-Generated Programs

STELP: 保障LLM生成程序的编译与执行

Swapnil Shinde, Sahil Wadhwa, Andy Luo, Akshay Gupta, Mohammad Shahed Sorower

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 STELP通过安全编译和执行LLM生成的代码,解决生产环境中的安全性和可靠性问题,提升代码执行的安全性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17200 2026-01-15 cs.AI 70%

Large Language Model-Based Automatic Formulation for Stochastic Optimization Models

基于大语言模型的随机优化模型自动建模

Amirreza Talebi

机构 * Department of Integrated Systems Engineering(集成系统工程系)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型通过结构化提示自动建模随机优化问题,引入软评分度量提升模型质量,展示LLMs在SO建模中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08942 2026-01-15 cs.CL 70%

SOP-Maze: Evaluating Large Language Models on Complicated Business Standard Operating Procedures

SOP-Maze:在复杂业务标准操作规程上评估大语言模型

Jiaming Wang, Zhe Tang, Zehao Jin, Hefei Chen, Yilin Jin, Peng Ding, Xiaoyu Li, Xuezhi Cao

机构 * Meituan M17(美团M17) Georgia Institute of Technology(佐治亚理工学院) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 SOP-Maze通过评估大语言模型在复杂业务标准操作规程中的表现,揭示了模型在遵循规程、对话处理和计算推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08288 2026-01-14 cs.AI 70%

OpenMic: A Multi-Agent-Based Stand-Up Comedy Generation System

OpenMic: 基于多智能体的站立喜剧生成系统

Yuyang Wu, Hanzhong Cao, Jianhao Chen, Yufei Li

机构 * School of Electronics Engineering and Computer Science, Peking University(电子工程与计算机科学学院,北京大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 OpenMic通过多智能体系统生成基于文化背景的站立喜剧,结合检索增强生成和专用JokeWriter提升幽默与节奏表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07280 2026-01-13 cs.CL 70%

ReasonTabQA: A Comprehensive Benchmark for Table Question Answering from Real World Industrial Scenarios

ReasonTabQA: 一个全面的表格问题回答基准,用于现实世界工业场景

Changzai Pan, Jie Zhang, Kaiwen Wei, Chenshuo Pan, Yu Zhao, Jingwang Huang, Jian Yang, Zhenhe Wu, Haoyang Zeng, Xiaoyan Gu, Weichao Sun, Yanbo Zhai, Yujie Mao, Zhuoru Jiang, Jiang Zhong, Shuangyong Song, Yongxiang Li, Zhongjiang He

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所) Chongqing University(重庆大学) Beihang University(北京航空航天大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 ReasonTabQA是一个针对现实工业场景的表格问题回答基准,通过引入TabCodeRL强化学习方法提升模型推理能力,揭示了工业级表格问答的复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18951 2026-01-13 cs.CL 70%

BnMMLU: Measuring Massive Multitask Language Understanding in Bengali

BnMMLU:测量孟加拉语大规模多任务语言理解

Saman Sarker Joy, Swakkhar Shatabda

机构 * University of Malaya(马来大学) BRAC University(BRAC大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 BnMMLU通过大规模多任务评估孟加拉语语言理解,揭示模型推理和应用能力的不足,并推动多语言NLP发展。

Comments 19 Pages, 10 Tables, 12 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01802 2026-01-09 cs.AI 70%

PsychEval: A Multi-Session and Multi-Therapy Benchmark for High-Realism AI Psychological Counselor

PsychEval: 一个多会话和多疗法的基准,用于高真实感的AI心理顾问

Qianjun Pan, Junyi Wang, Jie Zhou, Yutao Yang, Junsong Li, Kaiyin Xu, Yougen Zhou, Yihan Li, Jingyuan Zhao, Qin Chen, Ningning Zhou, Kai Chen, Liang He

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) School of Psychology and Cognitive Science, East China Normal University(东华大学心理学与认知科学学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 PsychEval是一个多会话和多疗法的基准,用于评估高真实感的AI心理顾问,通过多阶段数据集和全面评估框架提升AI在心理咨询服务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04654 2026-01-09 eess.AS cs.AI cs.SD 70%

LLMs-Integrated Automatic Hate Speech Recognition Using Controllable Text Generation Models

集成大语言模型的自动仇恨言论识别方法:使用可控文本生成模型

Ryutaro Oshima, Yuya Hosoda, Youji Iiguni

机构 * The University of Osaka(大阪大学) Ritsumeikan University(立命馆大学)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型和可控文本生成模型,通过课程学习逐步训练以提高仇恨言论识别的准确率和效率。

Comments In Proceedings of the 17th Asia Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04137 2026-01-08 cs.RO cs.AI cs.CV 70%

Wow, wo, val! A Comprehensive Embodied World Model Evaluation Turing Test

哇,哇,val!一个综合的具身世界模型评估图灵测试

Chun-Kai Fan, Xiaowei Chi, Xiaozhu Ju, Hao Li, Yong Bao, Yu-Kai Wang, Lizhang Chen, Zhiyuan Jiang, Kuangzhi Ge, Ying Li, Weishi Mi, Qingpo Wuwu, Peidong Jia, Yulin Luo, Kevin Zhang, Zhiyuan Qin, Yong Dai, Sirui Han, Yike Guo, Shanghang Zhang, Jian Tang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) Beijing Innovation Center of Humanoid Robotics(人形机器人创新中心) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出Wow-wo-val基准测试,评估视频基础模型在具身人工智能中的生成能力,发现其在长期规划和物理一致性上表现有限,揭示了现实世界与生成视频之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10390 2026-01-08 cs.CL cs.CR 70%

Jailbreaking Commercial Black-Box LLMs with Explicitly Harmful Prompts

通过显式有害提示对商用黑盒大语言模型进行劫持

Chiyu Zhang, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The Chinese University of Hong Kong(香港中文大学) Zhejiang Lab(浙江实验室)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出DH-CoT攻击方法,通过整合多种劫持技巧和恶意内容检测框架,有效劫持了包括GPT-5和Claude-4在内的商用大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03589 2026-01-08 cs.CL 70%

OLA: Output Language Alignment in Code-Switched LLM Interactions

OLA:代码切换交互中的输出语言对齐

Juhyun Oh, Haneul Yoo, Faiz Ghifari Haznitrama, Alice Oh

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 OLA研究了代码切换交互中LLM输出语言对齐问题,发现现有模型存在隐含语言期望识别偏差,通过Code-Switching Aware DPO方法显著提升对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17394 2026-01-08 cs.CL cs.CV cs.CY 70%

Are Vision Language Models Cross-Cultural Theory of Mind Reasoners?

视觉语言模型是否是跨文化理论思维推理者?

Zabir Al Nazi, GM Shahariar, Md. Abrar Hossain, Wei Peng

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出CulturalToM-VQA基准测试集,评估视觉语言模型在跨文化理论思维推理中的表现,发现前沿模型在准确性上显著提升,但存在假信念推理和区域差异等局限,揭示模型的社会可取性偏差问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02364 2026-01-07 cs.IR cs.AI 70%

Towards Trustworthy LLM-Based Recommendation via Rationale Integration

通过推理整合实现可信的基于大语言模型的推荐

Chung Park, Taesan Kim, Hyeongjun Yun, Dongjoon Hong, Junui Hong, Kijung Park, MinCheol Cho, Mira Myong, Jihoon Oh, Min sung Choi

机构 * SK Telecom(SK电信)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的推荐系统,通过生成逻辑严谨的理由提升推荐的可解释性和性能。

Comments Accepted at RS4SD'25 (CIKM'25 Workshop)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03663 2026-01-06 cs.CL cs.CV 70%

UNIDOC-BENCH: A Unified Benchmark for Document-Centric Multimodal RAG

UNIDOC-BENCH: 一个统一的文档中心多模态RAG基准

Xiangyu Peng, Can Qin, Zeyuan Chen, Ran Xu, Caiming Xiong, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 UniDoc-Bench是首个大规模文档中心多模态RAG基准,通过多模态问答对评估文本-图像融合与联合检索性能,揭示多模态嵌入不足及视觉上下文补充机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03146 2025-12-30 cs.CL 70%

MME-CC: A Challenging Multi-Modal Evaluation Benchmark of Cognitive Capacity

MME-CC:认知能力多模态评估基准

Kaiyuan Zhang, Chenghao Yang, Zhoufutu Wen, Sihang Yuan, Qiuyue Wang, Chaoyi Huang, Guosheng Zhu, He Wang, Huawenyu Lu, Jianing Wen, Jianpeng Jiao, Lishu Luo, Longxiang Liu, Sijin Wu, Xiaolei Zhu, Xuanliang Zhang, Yu Liu, Ge Zhang, Yi Lin, Guang Shi, Chaoyou Fu, Wenhao Huang

机构 * Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 MME-CC提出一个以视觉为基础的多模态评估基准,系统评估大语言模型在空间、几何和知识推理中的认知能力,揭示封闭源模型在总体表现上的优势及空间几何推理的薄弱环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21902 2025-12-29 cs.CL 70%

Explainable Statute Prediction via Attention-based Model and LLM Prompting

基于注意力模型和大语言模型提示的可解释法规预测

Sachin Pawar, Girish Keshav Palshikar, Anindita Sinha Banerjee, Nitin Ramrakhiyani, Basit Ali

机构 * TCS Research(TCS研究)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出基于注意力模型和大语言模型提示的法规预测方法,通过生成可解释的预测结果提升法律AI系统的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07148 2025-12-29 cs.CL 70%

TCM-Eval: An Expert-Level Dynamic and Extensible Benchmark for Traditional Chinese Medicine

TCM-Eval: 一个专家级动态且可扩展的中医基准测试

Zihao Cheng, Yuheng Lu, Huaiqian Ye, Zeming Liu, Minqi Wang, Jingjing Liu, Zihan Li, Wei Fan, Yuanfang Guo, Ruiji Fu, Shifeng She, Gang Wang, Yunhong Wang

机构 * School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院) Beijing Zhimingtang Technology Co., Ltd.(北京智明堂科技有限公司) Beijing Zhiyan AI Technology Co., Ltd.(北京智言AI科技有限公司) Guangzhou University of Chinese Medicine(广州中医药大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 TCM-Eval通过动态可扩展的基准测试和SI-CoTE方法,开发出ZMT模型,显著超越人类中医从业者水平,推动中医领域LLM研究发展。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17559 2025-12-22 cs.AI 70%

Towards Explainable Conversational AI for Early Diagnosis with Large Language Models

迈向具有大语言模型的可解释对话AI用于早期诊断

Maliha Tabassum, M Shamim Kaiser

机构 * Department of Information and Communication Technology(信息与通信技术系) Bangladesh University of Professionals(孟加拉专业大学) Institute of Information Technology(信息技术研究所) Jahangirnagar University(贾汗吉尔纳瓦德大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究提出基于大语言模型的可解释对话AI,用于提高早期诊断的透明性和互动性,实验显示其在诊断准确性上优于传统机器学习模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07553 2025-12-17 cs.AI 70%

COMMA: A Communicative Multimodal Multi-Agent Benchmark

COMMA:一种基于通信的多模态多智能体基准

Timothy Ossowski, Danyal Maqbool, Jixuan Chen, Zefan Cai, Tyler Bradshaw, Junjie Hu

机构 * Department of Computer Sciences University of Wisconsin-Madison(计算机科学系威斯康星大学麦迪逊分校) Department of Computer Sciences UC San Diego(计算机科学系加州大学圣地亚哥分校) Department of Radiology University of Wisconsin-Madison(放射学系威斯康星大学麦迪逊分校) Department of Computer Sciences Department of Biostatistics and Medical Informatics University of Wisconsin-Madison(计算机科学系生物统计学与医学信息学系威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 COMMA基准通过语言通信评估多模态多智能体系统的协作性能,揭示现有模型在智能体协作中的不足。

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05178 2025-12-15 cs.MA cs.AI 70%

CREW-WILDFIRE: Benchmarking Agentic Multi-Agent Collaborations at Scale

CREW-WILDFIRE:大规模代理协作基准测试

Jonathan Hyun, Nicholas R Waytowich, Boyuan Chen

机构 * Duke University(杜克大学) Army Research Laboratory(陆军研究实验室)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 CREW-WILDFIRE是一个开源基准测试,用于评估大规模多代理协作的可扩展性、鲁棒性和协作能力,通过真实复杂的野火响应场景推动多代理Agentic AI的研究发展。

Comments Our project website is at: http://generalroboticslab.com/CREW-Wildfire

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20781 2025-12-10 cs.SE cs.AI 70%

Using LLMs in Generating Design Rationale for Software Architecture Decisions

在软件架构决策中使用LLMs生成设计理由

Xiyu Zhou, Ruiyin Li, Peng Liang, Beiqi Zhang, Mojtaba Shahin, Zengyang Li, Chen Yang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) RMIT University(皇家墨尔本理工大学) School of Computer Science, Central China Normal University(中央师范大学计算机学院) School of Artificial Intelligence, Shenzhen Polytechnic University(深圳职业技术学院人工智能学院)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 本研究评估了LLMs在生成软件架构决策设计理由方面的性能,通过实验和访谈探讨了不同提示策略的效果及实际应用的可行性。

Comments Preprint accepted for publication in ACM Transactions on Software Engineering and Methodology (TOSEM), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05339 2025-12-08 cs.LG 70%

Taxonomy-Adaptive Moderation Model with Robust Guardrails for Large Language Models

具有鲁棒防护栏的分类适应调谐模型用于大型语言模型

Mahesh Kumar Nandwana, Youngwan Lim, Joseph Liu, Alex Yang, Varun Notibala, Nishchaie Khanna

机构 * Project Lead(项目负责人)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 Roblox Guard 1.0通过指令微调提升大型语言模型的安全性,采用输入输出调谐和可扩展的安全分类评估框架。

Comments To be presented at AAAI-26 PerFM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03558 2025-12-04 cs.CV cs.CL 70%

CartoMapQA: A Fundamental Benchmark Dataset Evaluating Vision-Language Models on Cartographic Map Understanding

CartoMapQA: 一个评估视觉-语言模型在制图地图理解上的基础基准数据集

Huy Quang Ung, Guillaume Habault, Yasutaka Nishimura, Hao Niu, Roberto Legaspi, Tomoki Oya, Ryoichi Kojima, Masato Taya, Chihiro Ono, Atsunori Minamikawa, Yan Liu

机构 * KDDI Research, Inc.(KDDI研究公司) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 CartoMapQA通过问答任务评估视觉-语言模型在制图地图理解上的能力,揭示了模型在地图语义和地理推理方面的不足。

Comments Accepted at SIGSPATIAL 2025 (Best paper candidates), 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21444 2025-11-27 cs.AI physics.ao-ph 70%

EWE: An Agentic Framework for Extreme Weather Analysis

EWE:极端天气分析的代理框架

Zhe Jiang, Jiong Wang, Xiaoyu Yue, Zijie Guo, Wenlong Zhang, Fenghua Ling, Wanli Ouyang, Lei Bai

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Sydney(悉尼大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 EWE是首个用于极端天气分析的智能代理框架,通过知识引导的规划和闭环推理实现自动化诊断,提供首个该领域基准测试,推动科学发现民主化进程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16383 2025-11-26 cs.CL 70%

Large Language Models in Argument Mining: A Survey

大型语言模型在论证挖掘中的应用:综述

Hao Li, Viktor Schlegel, Yizheng Sun, Riza Batista-Navarro, Goran Nenadic

机构 * University of Manchester(曼彻斯特大学) Imperial College London(伦敦帝国学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文综述了大型语言模型对论证挖掘领域的影响,分析了LLM如何改变任务设计、数据集构建和评估方法,并提出了未来研究方向。

Comments Work draft

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18298 2025-11-25 cs.AI 70%

Cross-Disciplinary Knowledge Retrieval and Synthesis: A Compound AI Architecture for Scientific Discovery

跨学科知识检索与综合:一种用于科学发现的复合AI架构

Svitlana Volkova, Peter Bautista, Avinash Hiriyanna, Gabriel Ganberg, Isabel Erickson, Zachary Klinefelter, Nick Abele, Hsien-Te Kao, Grant Engberson

机构 * Aptima, Inc.(Aptima公司)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 BioSage通过整合LLMs与RAG,利用专门代理实现跨学科知识检索与综合,提升科学发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15511 2025-11-24 cs.RO cs.AI 70%

AeroVerse: UAV-Agent Benchmark Suite for Simulating, Pre-training, Finetuning, and Evaluating Aerospace Embodied World Models

AeroVerse:用于模拟、预训练、微调和评估航空航天具身世界模型的UAV-Agent基准套件

Fanglong Yao, Yuanchang Yue, Youzhi Liu, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology(TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空信息研究所目标认知与应用技术重点实验室)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 AeroVerse是一个用于模拟、预训练、微调和评估航空航天具身世界模型的基准套件,包含多个数据集和评估指标,旨在推动航空航天具身智能的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16221 2025-11-21 cs.CV cs.CL 70%

Can MLLMs Read the Room? A Multimodal Benchmark for Assessing Deception in Multi-Party Social Interactions

大语言模型能读取环境吗?一个多模态基准用于评估多当事人社交互动中的欺骗

Caixin Kang, Yifei Huang, Liangyang Ouyang, Mingfang Zhang, Ruicong Liu, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出多模态互动欺骗评估任务,通过新颖数据集评估多种MLLMs的欺骗检测能力,揭示其在多模态社交线索处理上的不足,并提出SoCoT和DSEM模块提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏