arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2601.12820 2026-01-21 cs.CV 67%

A Generalist Foundation Model for Total-body PET/CT Enables Diagnostic Reporting and System-wide Metabolic Profiling

一种通用的基础模型用于全身PET/CT,实现诊断报告和系统层面的代谢分析

Wei Chen, Liang Wu, Shuyi Lu, Yuanyuan Sun, Wenkai Bi, Zilong Yuan, Yaoyao He, Feng Wang, Junchi Ma, Shuyong Liu, Zhaoping Cheng, Xiaoyan Hu, Jianfeng Qiu

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract)

AI总结 SDF-HOLO是一种用于全身PET/CT的通用基础模型,通过多模态学习实现诊断报告和系统代谢分析,提升医疗影像处理的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12491 2026-01-21 cs.HC 67%

VASTU: Value-Aligned Social Toolkit for Online Content Curation

VASTU:面向在线内容编纂的价值对齐社交工具包

Agam Goyal, Xianyang Zhan, Charlotte Lambert, Koustuv Saha, Eshwar Chandrasekharan

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 VASTU通过社区特定模型在内容编纂中实现价值对齐,微调的转换器表现最佳,揭示了学习社区规范的重要性。

Comments Preprint: 15 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20323 2026-01-16 cs.CL cs.AI cs.LG 67%

PMOA-TTS: Introducing the PubMed Open Access Textual Times Series Corpus

PMOA-TTS:引入PubMed开放获取文本时间序列语料库

Shahriar Noroozizadeh, Sayantan Kumar, George H. Chen, Jeremy C. Weiss

机构 * Machine Learning Department, School of Computer Science(计算机科学系机器学习部门) Heinz College of Information Systems and Public Policy(信息系统与公共政策学院) National Library of Medicine(国家医学图书馆)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 PMOA-TTS通过大规模语言模型管道构建,为时间序列分析提供结构化文本时间线,支持时间推理、生存建模和事件预测研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08141 2026-01-14 cs.CL cs.AI cs.LG 67%

Qalb: Largest State-of-the-Art Urdu Large Language Model for 230M Speakers with Systematic Continued Pre-training

Qalb:面向2.3亿使用者的最先进的乌尔都语大型语言模型,采用系统性持续预训练

Muhammad Taimoor Hassan, Jawad Ahmed, Muhammad Awais

机构 * Auburn University, USA(美国阿伯杜大学) BHT Berlin, Germany(柏林BHT学院) BTU Cottbus, Germany(库滕堡工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Qalb通过持续预训练和监督微调,为乌尔都语构建了最先进的大型语言模型,显著提升了在多种任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06779 2026-01-13 cs.CR 67%

CyberLLM-FINDS 2025: Instruction-Tuned Fine-tuning of Domain-Specific LLMs with Retrieval-Augmented Generation and Graph Integration for MITRE Evaluation

CyberLLM-FINDS 2025:基于检索增强生成和图集成的领域特定LLM指令微调方法用于MITRE评估

Vasanth Iyer, Leonardo Bobadilla, S. S. Iyengar

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出了一种基于检索增强生成和图集成的领域特定LLM微调方法,通过STIX威胁情报实现与MITRE ATT&CK技术的对齐,提升网络安全威胁情报分析的准确性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06193 2026-01-13 cs.LG cs.AI cs.CL 67%

MLB: A Scenario-Driven Benchmark for Evaluating Large Language Models in Clinical Applications

MLB:面向临床应用的大型语言模型评估场景驱动基准

Qing He, Dongsheng Bi, Jianrong Lu, Minghui Yang, Zixiao Chen, Jiacheng Lu, Jing Chen, Nannan Du, Xiao Cu, Sijing Wu, Peng Xiang, Yinyin Hu, Yi Guo, Chunpu Li, Shaoyang Li, Zhuo Dong, Ming Jiang, Shuai Guo, Liyun Feng, Jin Peng, Jian Wang, Jinjie Gu, Junwei Liu

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Health Information Center of Zhejiang Province(浙江省健康信息中心) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MLB基准通过场景驱动的评估方法,评估大型语言模型在临床应用中的表现,揭示模型在结构化任务与患者交互场景间的性能差异。

Comments 11 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06106 2026-01-13 cs.LG cs.AI cs.CL cs.CV cs.MA 67%

Judge Model for Large-scale Multimodality Benchmarks

大规模多模态基准的判断模型

Min-Han Shih, Yu-Hsin Wu, Yu-Wei Chen

机构 * Department of Electrical and Computer Engineering, Viterbi School of Engineering, University of Southern California(电气与计算机工程系,维特比工程学院,南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种多模态判断模型,用于评估多种任务,通过聚合多模态判断并生成诊断反馈,展示了其在多模态AI研究中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20166 2026-01-13 eess.AS cs.AI cs.CL cs.LG cs.SD 67%

From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data

从对齐到提升:通过合成数据 bootstrap 音频-语言对齐

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出BALSa框架,通过合成数据生成提升音频-语言对齐能力,缓解幻觉问题并增强模型理解与推理性能。

Comments Published in IEEE Transactions on Audio, Speech, and Language Processing (TASLP). Project Website: https://kuan2jiu99.github.io/Balsa

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4604-4619, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04202 2026-01-09 cs.CL cs.AI cs.LG 67%

TeleTables: A Benchmark for Large Language Models in Telecom Table Interpretation

TeleTables: 电信表格解释中的大语言模型基准

Anas Ezzakri, Nicola Piovesan, Mohamed Sana, Antonio De Domenico, Fadhel Ayed, Haozhe Zhang

机构 * Paris Research Center, Huawei Technologies(巴黎研究中心,华为技术)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TeleTables 是一个用于评估大语言模型在电信表格解释能力的基准,揭示了在电信标准上进行领域微调的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03432 2026-01-08 cs.SE 67%

CodeEval: A pedagogical approach for targeted evaluation of code-trained Large Language Models

CodeEval: 一种面向代码训练大语言模型的教育性评估方法

Danny Brahman, Mohammad Mahoor

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract)

AI总结 CodeEval通过多维基准数据集和开源执行框架,针对代码训练大语言模型的评估与改进提供教育性方法。

Comments Accepted at the International Joint Conference on Natural Language Processing & Asia-Pacific Chapter of the Association for Computational Linguistics, 2025. Will be published at ACL anthology

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03286 2026-01-08 cs.CV cs.AI cs.CL cs.LG 67%

HyperCLOVA X 32B Think

NAVER Cloud HyperCLOVA X Team

机构 * NAVER Cloud HyperCLOVA X Team(NAVER云HyperCLOVA X团队)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01216 2026-01-08 cs.CL cs.AI cs.LG 67%

Detecting PTSD in Clinical Interviews: A Comparative Analysis of NLP Methods and Large Language Models

在临床访谈中检测PTSD:自然语言处理方法和大语言模型的比较分析

Feng Chen, Dror Ben-Zeev, Gillian Sparks, Arya Kadakia, Trevor Cohen

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究比较了NLP方法和大语言模型在临床访谈中检测PTSD的效果,发现领域特定模型和嵌入方法表现最佳,强调了领域适应技术在PTSD筛查中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02783 2026-01-07 cs.CV 67%

EarthVL: A Progressive Earth Vision-Language Understanding and Generation Framework

EarthVL: 一种渐进式地球视觉-语言理解和生成框架

Junjue Wang, Yanfei Zhong, Zihang Chen, Zhuo Zheng, Ailong Ma, Liangpei Zhang

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 EarthVL提出一种渐进式视觉-语言框架,通过多任务数据集和语义引导网络提升城市规划中的遥感目标识别与问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01952 2026-01-06 cs.SE 67%

Context-Adaptive Requirements Defect Prediction through Human-LLM Collaboration

基于人类与大语言模型协作的上下文自适应需求缺陷预测

Max Unterbusch, Andreas Vogelsang

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出基于人类与大语言模型协作的上下文自适应需求缺陷预测方法,通过反馈循环和少量样本学习提升预测性能,优于传统方法。

Comments Accepted at ICSE-NIER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03860 2026-01-06 cs.CL cs.AI cs.LG 67%

Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models

幻觉与事实:大型语言模型中事实核查与事实性评估的综述

Subhey Sadi Rahman, Md. Adnanul Islam, Md. Mahbub Alam, Musarrat Zeba, Md. Abdur Rahman, Sadia Sultana Chowa, Mohaimenul Azam Khan Raiaan, Sami Azam

机构 * Department of Computer Science and Engineering, United International University, Dhaka 1212, Bangladesh(乌姆特国际大学计算机科学与工程系) Department of Computer Science and Engineering, Daffodil International University, Dhaka-1341, Bangladesh(达芙尼国际大学计算机科学与工程系) Faculty of Science and Technology, Charles Darwin University, Casuarina, NT 0909, Australia(查尔斯·达尔文大学科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了大型语言模型中事实核查与事实性评估的关键挑战及方法,强调了提升事实准确性的重要性。

Journal ref Artif. Intell. Rev. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22257 2025-12-30 q-bio.QM 67%

LiveProteinBench: A Contamination-Free Benchmark for Assessing Models' Specialized Capabilities in Protein Science

LiveProteinBench: 一种无污染的基准测试,用于评估模型在蛋白质科学中的专用能力

Dingyi Rong, Zijian Chen, Qi Jia, Kaiwei Zhang, Haotian Lu, Guangtao Zhai, Ning Liu

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 LiveProteinBench通过无污染的多模态基准测试,评估LLM在蛋白质科学中的专用能力,揭示了通用模型在零样本性能上的优势及多模态信息融合的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17436 2025-12-23 cs.CV 67%

Xiaomi MiMo-VL-Miloco Technical Report

小米 MiMo-VL-Miloco 技术报告

Jiaze Li, Jingyang Chen, Yuxun Qu, Shijie Xu, Zhenru Lin, Junyou Zhu, Boshen Xu, Wenhui Tan, Pei Fu, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Xiaomi(小米)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 小米提出 MiMo-VL-Miloco 模型,专为家庭场景设计,通过两阶段训练提升多模态推理与家庭场景理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18014 2025-12-23 cs.CL cs.AI cs.LG 67%

ReGal: A First Look at PPO-based Legal AI for Judgment Prediction and Summarization in India

ReGal:基于PPO的法律AI在印度判决预测和摘要中的初步探索

Shubham Kumar Nigam, Tanuj Tyagi, Siddharth Shukla, Aditya Kumar Guru, Balaramamahanthi Deepak Patnaik, Danush Khanna, Noel Shallum, Kripabandhu Ghosh, Arnab Bhattacharya

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ReGal通过PPO结合多任务指令微调与强化学习,探索法律AI在印度判决预测和摘要中的应用,揭示了强化学习在法律文本中的挑战与潜力。

Comments Accepted in AILaw @ AAAI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16969 2025-12-22 cs.AI cs.CL cs.LG 67%

Probing Scientific General Intelligence of LLMs with Scientist-Aligned Workflows

通过科学家对齐的工作流探测大语言模型的科学通用智能

Wanghan Xu, Yuhao Zhou, Yifan Zhou, Qinglong Cao, Shuo Li, Jia Bu, Bo Liu, Yixin Chen, Xuming He, Xiangyu Zhao, Xiang Zhuang, Fengxiang Wang, Zhiwang Zhou, Qiantai Feng, Wenxuan Huang, Jiaqi Wei, Hao Wu, Yuejin Yang, Guangshuai Wang, Sheng Xu, Ziyan Huang, Xinyao Liu, Jiyao Liu, Cheng Tang, Wei Li, Ying Chen, Junzhi Ning, Pengfei Jiang, Chenglong Ma, Ye Du, Changkai Ji, Huihui Xu, Ming Hu, Jiangbin Zheng, Xin Chen, Yucheng Wu, Feifei Jiang, Xi Chen, Xiangru Tang, Yuchen Fu, Yingzhou Lu, Yuanyuan Zhang, Lihao Sun, Chengbo Li, Jinzhe Ma, Wanhao Liu, Yating Liu, Kuo-Cheng Wu, Shengdu Chai, Yizhou Wang, Ouwen Zhangjin, Chen Tang, Shufei Zhang, Wenbo Cao, Junjie Ren, Taoyong Cui, Zhouheng Yao, Juntao Deng, Yijie Sun, Feng Liu, Wangxu Wei, Jingyi Xu, Zhangrui Li, Junchao Gong, Zijie Guo, Zhiyu Yao, Zaoyu Chen, Tianhao Peng, Fangchen Yu, Bo Zhang, Dongzhan Zhou, Shixiang Tang, Jiaheng Liu, Fenghua Ling, Yan Lu, Yuchen Ren, Ben Fei, Zhen Zhao, Xinyu Gu, Rui Su, Xiao-Ming Wu, Weikang Si, Yang Liu, Hao Chen, Xiangchao Yan, Xue Yang, Junchi Yan, Jiamin Wu, Qihao Zheng, Chenhui Li, Zhiqiang Gao, Hao Kong, Junjun He, Mao Su, Tianfan Fu, Peng Ye, Chunfeng Song, Nanqing Dong, Yuqiang Li, Huazhu Fu, Siqi Sun, Lijing Cheng, Jintai Lin, Wanli Ouyang, Bowen Zhou, Wenlong Zhang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于实用探究模型的科学通用智能定义,通过四个科学家对齐任务构建SGI-Bench,揭示大语言模型在科学推理中的不足,并引入测试时强化学习提升创新性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15634 2025-12-18 cs.CL cs.AI cs.LG 67%

How Much is Too Much? Exploring LoRA Rank Trade-offs for Retaining Knowledge and Domain Robustness

过多的幅度有多大?探索LoRA秩的权衡以保留知识和领域鲁棒性

Darshita Rathore, Vineet Kumar, Chetna Bansal, Anindya Moitra

机构 * PayPal

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨LoRA秩配置在保留知识和领域鲁棒性方面的权衡,通过多任务评估展示LoRA在推理任务中的竞争力。

Comments Accepted at AACL IJCNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12868 2025-12-16 cs.CL cs.AI cs.LG 67%

Counting Clues: A Lightweight Probabilistic Baseline Can Match an LLM

计数线索:一个轻量级概率基线可以匹配LLM

Furong Jia, Yuan Pu, Finn Guo, Monica Agrawal

机构 * Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种轻量级概率排名器FBPR,通过共现统计信息实现与LLM相当的性能,展示了概率基线在临床诊断中的互补优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14507 2025-12-16 cs.LG cs.AI cs.CL 67%

From Pruning to Grafting: Dynamic Knowledge Redistribution via Learnable Layer Fusion

从剪枝到嫁接:通过可学习层融合实现动态知识再分配

Zehua Pei, Hui-Ling Zhen, Xianzhi Yu, Sinno Jialin Pan, Mingxuan Yuan, Bei Yu

机构 * The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) Noah’s Ark Lab, Huawei, Hong Kong SAR(华为诺亚实验室,香港)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FuseGPT通过动态知识再分配和可学习层融合,实现更高效的模型压缩与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09271 2025-12-11 cs.CV 67%

LongT2IBench: A Benchmark for Evaluating Long Text-to-Image Generation with Graph-structured Annotations

LongT2IBench: 一个用于评估长文本到图像生成的基准,具有图结构注释

Zhichao Yang, Tianjiao Gu, Jianjie Wang, Feiyu Lin, Xiangfei Sheng, Pengfei Chen, Leida Li

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

AI总结 LongT2IBench通过图结构注释和LongT2IExpert提出,用于评估长文本到图像生成的对齐和解释能力。

Comments The paper has been accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14295 2025-12-10 cs.CL cs.AI cs.LG 67%

AraLingBench A Human-Annotated Benchmark for Evaluating Arabic Linguistic Capabilities of Large Language Models

AraLingBench:一个用于评估大型语言模型阿拉伯语语言能力的人工标注基准

Mohammad Zbeeb, Hasan Abed Al Kader Hammoud, Sina Mukalled, Nadine Rizk, Fatima Karnib, Issam Lakkis, Ammar Mohanna, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(卡斯泰克大学) American University of Beirut (AUB)(贝鲁特美国大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AraLingBench通过150道人工标注的多项选择题评估阿拉伯语LLM的语言能力,揭示模型在语法和句法推理上的不足,强调了记忆与模式识别对模型性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06751 2025-12-09 cs.CL cs.AI cs.LG 67%

Becoming Experienced Judges: Selective Test-Time Learning for Evaluators

成为经验丰富的法官:用于评估者的选择性测试时间学习

Seungyeon Jwa, Daechul Ahn, Reokyoung Kim, Dongyeop Kang, Jonghyun Choi

机构 * Seoul National University(首尔国立大学) University of Minnesota(明尼苏达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出选择性测试时间学习框架,使评估者在推理过程中逐步改进,通过自适应元提示提升评估效果,实验证明其在多个基准上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04871 2025-12-05 cs.AI cs.CL cs.LG 67%

STELLA: Guiding Large Language Models for Time Series Forecasting with Semantic Abstractions

STELLA: 通过语义抽象引导大型语言模型进行时间序列预测

Junjie Fan, Hongye Zhao, Linduo Wei, Jiayu Rao, Guijia Li, Jiaxin Yuan, Wenqi Xu, Yong Qi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 STELLA通过动态语义抽象机制,提升大型语言模型在时间序列预测中的表现,实现更精准的长期和短期预测。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04643 2025-12-05 cs.CV cs.AI cs.CL cs.LG 67%

SEASON: Mitigating Temporal Hallucination in Video Large Language Models via Self-Diagnostic Contrastive Decoding

SEASON: 通过自诊断对比解码缓解视频大语言模型中的时间幻觉

Chang-Hsun Wu, Kai-Po Chang, Yu-Yang Sheng, Hung-Kai Chung, Kuei-Chun Wang, Yu-Chiang Frank Wang

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SEASON通过自诊断对比解码方法,无需训练即可提升视频大语言模型在时间信息处理上的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04308 2025-12-05 cs.RO 67%

ResponsibleRobotBench: Benchmarking Responsible Robot Manipulation using Multi-modal Large Language Models

ResponsibleRobotBench: 使用多模态大语言模型评估负责任的机器人操控

Lei Zhang, Ju Dong, Kaixin Bai, Minheng Ni, Zoltan-Csaba Marton, Zhaopeng Chen, Jianwei Zhang

机构 * University of Hamburg(汉堡大学) Agile Robots SE(敏捷机器人公司) Technical University of Munich(慕尼黑技术大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 ResponsibleRobotBench通过多模态大语言模型评估机器人操控的责任性,涵盖23个多阶段任务,强调安全性、泛化能力和物理可靠性。

Comments https://sites.google.com/view/responsible-robotbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18214 2025-12-04 cs.CV cs.AI cs.CL cs.LG 67%

VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety

VLSU:联合多模态理解在AI安全中的极限映射

Shruti Palaskar, Leon Gatys, Mona Abdelrahman, Mar Jacobo, Larry Lindsey, Rutika Moharir, Gunnar Lund, Yang Xu, Navid Shiee, Jeffrey Bigham, Charles Maalouf, Joseph Yitan Cheng

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 VLSU通过细粒度分类和组合分析,揭示了多模态安全评估中联合理解的缺陷,为改进AI安全研究提供关键测试平台。

Comments 10 pages, 5 figures, 4 tables, detailed appendix. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02719 2025-12-03 cs.CL cs.AI cs.CV cs.LG q-bio.NC 67%

Emergent Bayesian Behaviour and Optimal Cue Combination in LLMs

涌现的贝叶斯行为与LLMs中的最优线索整合

Julian Ma, Jun Wang, Zafeirios Fountas

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) AI Centre, Department of Computer Science, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示LLMs在多模态整合中表现出贝叶斯策略,但准确性不等于鲁棒性,提出贝叶斯一致性分数以评估不确定性处理。

详情

展开后加载摘要…

URL PDF HTML 收藏