arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-08 至 2026-04-08 共收录 107 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 32 篇

2604.05135 2026-04-08 cs.CL cs.CE 79%

SenseAI: A Human-in-the-Loop Dataset for RLHF-Aligned Financial Sentiment Reasoning

SenseAI:一种用于RLHF对齐的金融情感推理的人机协同数据集

Berny Kabalisa

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 SenseAI通过整合推理链、置信度评分和市场结果,为金融情感推理提供RLHF对齐的数据支持,揭示模型行为中的系统性模式及改进机会。

Comments Dataset available on request (bernykabalisa18@gmail.com) See GitHub for dataset snapshot and automated data collection script demo https://github.com/bernykabalisa18-netizen/SenseAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04570 2026-04-08 cs.CV cs.CL 79%

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

通过视频思考:视频生成作为一种有前途的多模态推理范式

Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究所) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出'通过视频思考'范式,利用视频生成模型实现多模态推理,通过VideoThinkBench评估显示Sora-2在视觉和文本任务中均表现出色,证明视频生成模型在统一多模态理解与生成中的潜力。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17652 2026-04-08 q-bio.QM cs.CV 78%

TeamPath: Building MultiModal Pathology Experts with Reasoning AI Copilots

TeamPath: 构建多模态病理专家的推理AI助手

Tianyu Liu, Weihao Xuan, Hao Wu, Peter Humphrey, Marcello DiStasio, Mohamed Kahila, Alfonso Garcia Tan, Heli Qi, Rui Yang, Simeng Han, Tinglin Huang, Fang Wu, Chen Liu, Qingyu Chen, Nan Liu, Irene Li, Hua Xu, Hongyu Zhao

机构 * Interdepartmental Program in Computational Biology and Biomedical Informatics, Yale University(耶鲁大学计算生物学与生物医学信息学跨学科项目) Department of Biostatistics, Yale University(耶鲁大学生物统计学系) Broad Institute of MIT and Harvard(博德研究所) Department of Complexity Science and Engineering, The University of Tokyo(东京大学复杂科学与工程系) Center for Advanced Intelligence Project, RIKEN(理化学研究所先进智能项目中心) Department of Pathology, Yale University(耶鲁大学病理学系) Department of Anatomical Pathology, Singapore General Hospital(新加坡中央医院解剖病理学系) Center for Biomedical Data Science, Duke–NUS Medical School, Singapore, Singapore(杜克-新加坡国立大学医学院生物医学数据科学中心) Department of Computer Science, Yale University(耶鲁大学计算机科学系) Department of Computer Science, Stanford University(斯坦福大学计算机科学系)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 TeamPath通过强化学习和路由增强方案,整合多模态数据提升病理诊断与跨模态生成能力,为临床提供可靠的信息交流系统。

Comments 45 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21210 2026-04-08 cs.CV 78%

Toward Generalizable Forgery Detection and Reasoning

朝通用伪造检测与推理方向发展

Yueying Gao, Dongliang Chang, Bingyao Yu, Haotian Qin, Muxi Diao, Lei Chen, Kongming Liang, Zhanyu Ma

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出FDR-Task任务,利用多模态大语言模型实现伪造检测与推理,通过MMFR数据集和FakeReasoning框架提升检测与推理性能。

Comments Accepted to IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05168 2026-04-08 cs.AI 77%

Instruction-Tuned LLMs for Parsing and Mining Unstructured Logs on Leadership HPC Systems

指令调优的LLM用于领导型HPC系统上解析和挖掘无结构日志

Ahmad Maroof Karimi, Jong Youl Choi, Charles Qing Cao, Awais Khan

机构 * Oak Ridge National Laboratory(橡树岭国家实验室) University of Tennessee(田纳西大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出一种基于指令调优的LLM框架,利用链式推理解析HPC日志,结合领域特定日志模板和示例对LLaMA模型进行微调,实现高精度的日志解析与挖掘,验证了其在大规模日志数据上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04997 2026-04-08 cs.IR cs.AI cs.CL cs.CV cs.LG 75%

Evaluation of Embedding-Based and Generative Methods for LLM-Driven Document Classification: Opportunities and Challenges

嵌入式与生成方法在LLM驱动文档分类中的评估:机遇与挑战

Rong Lu, Hao Liu, Song Hou

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文比较了基于嵌入和生成模型在地学技术文档分类中的表现,发现增强的生成视觉-语言模型在零样本准确率上表现更优,但监督微调对训练数据不平衡敏感。

Comments Accepted at the IMAGE'25 Workshop (PCW-11), Society of Exploration Geophysicists (SEG). Published version available at https://doi.org/10.1190/image2025-w11-03.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05775 2026-04-08 cs.CL q-bio.GN 70%

PhageBench: Can LLMs Understand Raw Bacteriophage Genomes?

PhageBench: LLMs能否理解原始噬菌体基因组?

Yusen Hou, Weicai Long, Haitao Hu, Houcheng Su, Junning Feng, Yanlin Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL

AI总结 PhageBench通过模拟生物信息学专家流程,评估LLM对噬菌体基因组的理解能力,发现通用模型在噬菌体contig识别和宿主预测上表现优异,但在复杂推理任务中存在明显局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00185 2026-04-08 cond-mat.mtrl-sci cs.AI 70%

QUASAR: A Universal Autonomous System for Atomistic Simulation and a Benchmark of Its Capabilities

QUASAR:一个通用的自主系统用于原子模拟及其能力的基准测试

Fengxu Yang, Jack D. Evans

机构 * School of Physics, Chemistry and Earth Sciences, Adelaide University(阿德莱德大学物理、化学与地球科学学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 QUASAR通过整合多种原子模拟方法,实现自主的多尺度工作流,展示了其在材料筛选和新型材料评估中的应用潜力。

Comments 14 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05930 2026-04-08 cs.CL cs.AI cs.LG cs.MA 67%

Can We Predict Before Executing Machine Learning Agents?

在执行机器学习代理之前,我们能否进行预测?

Jingsheng Zheng, Jintian Zhang, Yujie Luo, Yuren Mao, Yunjun Gao, Lun Du, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过内部化执行先验来预测数据驱动的解决方案偏好,利用预验证的数据分析报告提升LLM的预测能力,并在FOREAGENT中实现预测-验证循环,加速收敛并超越基于执行的基线。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20983 2026-04-08 cs.CL cs.AI cs.LG 67%

Automatic Replication of LLM Mistakes in Medical Conversations

医疗对话中大语言模型错误的自动复制

Oleksii Proniakin, Diego Fajardo, Ruslan Nazarenko, Razvan Marinescu

机构 * Lumos AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MedMistake自动管道,通过提取医疗对话中LLM的错误生成单次问答对,构建基准测试集,验证了GPT、Claude和Grok在医疗问答任务中的最佳性能。

Comments 48 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05930 2026-04-08 cs.CL cs.AI 62%

"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?

我看出你在那儿:大型视觉-语言模型能否理解多模态双关语?

Naen Xu, Jiayi Sheng, Changjiang Li, Chunyi Zhou, Yuyuan Li, Tianyu Du, Jun Wang, Zhihui Fu, Jinbao Li, Shouling Ji

机构 * Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Palo Alto Networks Hangzhou Dianzi University(杭州电子科技大学) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) OPPO Research Institute(OPPO研究院) Qilu University of Technology(齐鲁工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型视觉-语言模型理解多模态双关语的能力,提出多模态双关语生成流程和MultiPun数据集,通过评估发现模型在区分真实双关语与干扰项上表现不足,并提出提示级和模型级策略提升理解性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04192 2026-04-08 cs.CV cs.AI cs.LG 62%

Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks

Graphic-Design-Bench:一个全面的评估AI在图形设计任务中的基准测试

Adrienne Deganutti, Elad Hirsch, Haonan Zhu, Jaejung Seol, Purvanshi Mehta

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphicDesignBench,首个针对专业图形设计任务的全面基准测试集,评估AI模型在布局、排版、信息图、模板设计和动画等任务中的表现,揭示当前模型在空间推理、矢量代码生成和动画分解等方面存在的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05467 2026-04-08 cs.IR cs.CL cs.LG 62%

CUE-R: Beyond the Final Answer in Retrieval-Augmented Generation

CUE-R:超越检索增强生成的最终答案

Siddharth Jain, Venkat Narayan Vedam

机构 * Intuit

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 CUE-R通过干预基于证据项的检索使用痕迹,评估单次检索增强生成中每个证据项的操作效用,揭示证据项对正确性、基础忠实度和置信度误差的影响。

Comments 6 figures, 14 tables; appendix includes bootstrap CIs, metric definitions, duplicate position sensitivity, prompt template, and reproducibility details

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05445 2026-04-08 cs.CL cs.AI cs.CV 62%

Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling

学习什么重要:可解释视觉语言奖励建模的动态维度选择与聚合

Qiyuan Chen, Hongsen Huang, Jiahe Chen, Qian Shao, Jintai Chen, Hongxia Xu, Renjie Hua, Chuan Ren, Jian Wu

机构 * Zhejiang University(浙江大学) Soochow Securities Co.,Ltd.(东吴证券股份有限公司) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VL-MDR框架,通过动态分解评价为细粒度可解释维度,提升视觉语言奖励建模的可解释性与效率,实验显示其在基准测试中优于现有模型,并有效缓解视觉幻觉。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05117 2026-04-08 cs.CV cs.AI cs.CL 62%

Watch Before You Answer: Learning from Visually Grounded Post-Training

在回答前观看:从视觉引导的后训练中学习

Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang, Penghui Du, Yiming Jia, Dongfu Jiang, Xuan He, Shenhui Zhang, Ping Nie, Peter West, Kelsey R. Allen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Etude AI Kolors Team, Kuaishou Technology(快手科技Kolors团队) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文发现现有视频理解基准中40-60%的问题可通过文本线索回答,提出VidGround方法通过仅使用视觉引导问题提升VLM性能,实验显示其在后训练中效果优于复杂方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12705 2026-04-08 cs.CL cs.AI cs.CV eess.IV 62%

MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs

MedXIAOHE:构建医疗多模态大语言模型的全面指南

Baorong Shi, Bo Cui, Boyuan Jiang, Deli Yu, Fang Qian, Haihua Yang, Huichao Wang, Jiale Chen, Jianfei Pan, Jieqiong Cao, Jinghao Lin, Kai Wu, Lin Yang, Shengsheng Yao, Tao Chen, Xiaojun Xiao, Xiaozhong Ji, Xu Wang, Yijun He, Zhixiong Yang

机构 * ByteDance XiaoHe Medical AI(字节跳动小荷医疗AI)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MedXIAOHE通过实体感知持续预训练框架和强化学习提升医疗理解与推理,实现医疗多模态大模型的突破性进展。

Comments XIAOHE Medical AI team. See paper for full author list. Currently, the model is exclusively available on XIAOHE AI Doctor, accessible via both the App Store and the Douyin Mini Program. Updated to improve the layout

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06138 2026-04-08 cs.SD cs.AI 57%

Generating Synthetic Doctor-Patient Conversations for Long-form Audio Summarization

生成用于长文本音频摘要的合成医生-患者对话

Yanis Labrak, David Grünert, Séverin Baroudi, Jiyun Chun, Pawel Cyrta, Sergio Burdisso, Ahmed Hassoon, David Liu, Adam Rothschild, Reed Van Deusen, Petr Motlicek, Andrew Perrault, Ricard Marxer, Thomas Schaaf

机构 * Idiap Research Institute(Idiap 研究所) University of Zurich(苏黎世大学) The Ohio State University(俄亥俄州立大学) Université de Toulon, Aix Marseille Univ, LIS, CNRS(土伦大学,艾克斯-马赛大学,计算机与系统实验室,法国国家科学研究中心) Stenograf Johns Hopkins University Bloomberg School of Public Health(约翰·霍普金斯大学布隆伯格公共卫生学院) Colorado School of Mines(科罗拉多矿业学院) Allegheny Health Network(阿勒格尼健康网络) University of Pittsburgh Medical Center(匹兹堡大学医学中心) ILLS, CNRS(ILLS,法国国家科学研究中心) Solventum Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出生成合成医生-患者对话数据的方法,用于长文本音频摘要任务,通过多阶段流程生成包含音频和参考笔记的数据集,评估显示级联方法优于端到端模型。

Comments Submitted for review at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06019 2026-04-08 cs.CR cs.AI 57%

CritBench: A Framework for Evaluating Cybersecurity Capabilities of Large Language Models in IEC 61850 Digital Substation Environments

CritBench:用于评估大型语言模型在IEC 61850数字变电站环境中的网络安全能力的框架

Gustav Keppler, Moritz Gstür, Veit Hagenmeyer

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CritBench框架,用于评估大型语言模型在IEC 61850数字变电站环境中的网络安全能力,测试了五种先进模型在81个领域特定任务中的表现,发现模型在静态分析和单工具网络枚举中表现良好,但在动态任务中性能下降。

Comments 16 pages, 4 figures, 3 tables. Submitted to the 3rd ACM SIGEnergy Workshop on Cybersecurity and Privacy of Energy Systems (ACM EnergySP '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05875 2026-04-08 cs.AI 57%

Joint Knowledge Base Completion and Question Answering by Combining Large Language Models and Small Language Models

通过结合大语言模型和小语言模型实现知识库补全与问答的联合处理

Yinan Liu, Dongying Lin, Sigang Luo, Xiaochun Yang, Bin Wang

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,沈阳,中国) National Frontiers Science Center for Industrial Intelligence and Systems optimization, Northeastern University, Shenyang, China(东北大学工业智能与系统优化国家级前沿科学中心,沈阳,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出JCQL框架,结合大语言模型与小语言模型,通过迭代增强知识库补全与问答任务,提升两者性能。

Comments 20 pages, 11 figures

Journal ref ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09726 2026-04-08 cs.CL 57%

Forgetting as a Feature: Cognitive Alignment of Large Language Models

作为特征的遗忘:大型语言模型的认知对齐

Alexandros Christoforos

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究将遗忘视为大型语言模型的认知机制,通过建立基准测试评估时间推理、概念漂移适应和联想回忆,发现模型遗忘率与人类记忆效率的权衡相似,并提出概率记忆提示策略提升长期推理性能。

Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22765 2026-04-08 cs.CL cs.SD eess.AS 57%

StressTest: Can YOUR Speech LM Handle the Stress?

StressTest: 你的语音语言模型能承受压力测试吗?

Iddo Yosha, Gallil Maimon, Yossi Adi

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出StressTest基准,评估语音模型在应力模式下区分语音含义的能力,发现现有模型表现不佳,并提出StresSLM模型在压力推理和检测上优于现有模型。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05755 2026-04-08 cs.SE cs.AI 57%

CAKE: Cloud Architecture Knowledge Evaluation of Large Language Models

CAKE:大型语言模型云架构知识评估

Tim Lukas Adam, Phongsakon Mark Konrad, Riccardo Terrenzi, Florian Girardo Lukas, Rahime Yilmaz, Krzysztof Sierszecki, Serkan Ayvaz

机构 * Centre for Industrial Software(工业软件中心) University of Southern Denmark(南丹麦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CAKE基准测试,评估大型语言模型对云原生软件架构的理解,涵盖四个认知层次和五个主题,通过多选和自由回答形式评估22种模型配置,发现多选准确率随参数增加而稳定,自由回答持续区分模型,推理增强提升表现,工具增强则降低小型模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05674 2026-04-08 cs.CR cs.AI 57%

From Incomplete Architecture to Quantified Risk: Multimodal LLM-Driven Security Assessment for Cyber-Physical Systems

从不完整架构到量化风险:面向网络物理系统的多模态LLM驱动安全评估

Shaofei Huang, Christopher M. Poskitt, Lwin Khin Shar

机构 * Singapore Management University(新加坡管理大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ASTRAL方法,利用多模态LLM重构和分析网络物理系统架构,通过提示链、少样本学习和架构推理实现安全威胁识别和风险量化评估。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05116 2026-04-08 cs.AI 57%

Uncertainty-Guided Latent Diagnostic Trajectory Learning for Sequential Clinical Diagnosis

不确定性的引导潜在诊断轨迹学习用于顺序临床诊断

Xuyang Shen, Haoran Liu, Dongjin Song, Martin Renqiang Min

机构 * University of Connecticut(康涅狄格大学) Texas A&M University(德克萨斯农工大学) NEC Laboratories America(NEC美国实验室)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出基于规划LLM和诊断LLM的潜在诊断轨迹学习框架,通过后验分布优先选择高诊断信息轨迹,提升顺序临床诊断的准确率并减少检测次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18911 2026-04-08 cs.LG 57%

From Human-Level AI Tales to AI Leveling Human Scales

从人类水平AI故事到AI人类尺度

Peter Romero, Fernando Martínez-Plumed, Zachary R. Tidler, Matthieu Téhénan, Sipeng Chen, Álvaro David Gómez Antón, Luning Sun, Manuel Cebrian, Lexin Zhou, Yael Moros Daval, Daniel Romero-Alvarado, Félix Martí Pérez, Kevin Wei, José Hernández-Orallo

机构 * Valencian Research Institute of Artificial Intelligence, Universitat Politècnica de València(瓦伦西亚人工智能研究所,瓦伦西亚理工大学) Leverhulme Centre for the Future of Intelligence, University of Cambridge(勒弗休姆未来智能中心,剑桥大学) The Psychometrics Centre, University of Cambridge(心理测量中心,剑桥大学) Georgia Institute of Technology(佐治亚理工学院) Harvard University(哈佛大学) Center for Automation and Robotics, Spanish National Research Council(自动化与机器人中心,西班牙国家研究委员会) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) Carnegie Mellon University(卡内基梅隆大学) University of Cambridge, Department of Computer Sciences and Technology(剑桥大学计算机科学与技术系)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出一种框架,通过校准项目以'世界人口'为基准,建立人类锚定的共同尺度,以更准确评估AI能力。

Comments 23 pages, 10 figures. submitted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02949 2026-04-08 cs.CL cs.CV 57%

ProMQA-Assembly: Multimodal Procedural QA Dataset on Assembly

ProMQA-Assembly:多模态装配任务问答数据集

Kimihiro Hasegawa, Wiradee Imrattanatrai, Masaki Asada, Susan Holm, Yuran Wang, Vincent Zhou, Ken Fukuda, Teruko Mitamura

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) National Institute of Advanced Industrial Science and Technology (AIST)(国立研究开发法人产业技术综合研究所(AIST))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出ProMQA-Assembly数据集,包含646个多模态问答对,用于评估装配任务中的人机交互系统,通过半自动化标注方法生成问题并结合细粒度动作标签提升多样性,验证了推理模型在复杂多模态任务中的表现。

Comments LREC 2026. Code and data: https://github.com/kimihiroh/promqa-assembly

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02591 2026-04-08 cs.CL 57%

CharBench: Evaluating the Role of Tokenization in Character-Level Tasks

CharBench:评估字符级任务中分词作用

Omri Uzan, Yuval Pinter

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 CharBench通过大规模字符级任务评估,揭示了分词对字符级任务性能的影响,发现tokenization与正确性弱相关,而词长和字符数更关键,且长token会掩盖字符位置信息。

Comments AAAI-26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05934 2026-04-08 cs.CV eess.IV 50%

Leveraging Image Editing Foundation Models for Data-Efficient CT Metal Artifact Reduction

利用图像编辑基础模型实现数据高效的CT金属伪影减少

Ahmet Rasim Emirdagi, Süleyman Aslan, Mısra Yavuz, Görkay Aydemir, Yunus Bilge Kurt, Nasrin Rahimi, Burak Can Biner, M. Akın Yılmaz

机构 * Codeway AI Research(Codeway AI 研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出利用视觉语言扩散基础模型进行金属伪影减少,通过参数高效低秩适应技术,仅需16-128对训练样本即可实现高效伪影抑制,并证明领域适应对减少幻觉至关重要。

Comments Accepted to CVPRW 2026 Med-Reasoner

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05900 2026-04-08 cs.CV 50%

AICA-Bench: Holistically Examining the Capabilities of VLMs in Affective Image Content Analysis

AICA-Bench:全面评估VLMs在情感图像内容分析中的能力

Dong She, Xianrong Yao, Liqun Chen, Jinghe Yu, Yang Gao, Zhanpeng Jin

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出AICA-Bench基准,通过情感理解、推理和生成三个任务评估VLMs在情感图像分析中的能力,发现其在强度校准和描述深度方面存在不足,并提出GAT提示方法提升性能。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05076 2026-04-08 cs.MA cs.MM cs.SD 50%

GLANCE: A Global-Local Coordination Multi-Agent Framework for Music-Grounded Non-Linear Video Editing

GLANCE:一种用于音乐引导非线性视频编辑的全局-局部协调多智能体框架

Zihao Lin, Haibo Wang, Zhiyang Xu, Siyao Dai, Huanjie Dong, Xiaohan Wang, Yolo Y. Tang, Yixin Wang, Qifan Wang, Lifu Huang

机构 * Fudan University(复旦大学) Stanford University(斯坦福大学) University of Rochester(罗切斯特大学) Meta AI

专题命中 推理评测 :planning(abstract)

AI总结 GLANCE提出一种全局-局部协调多智能体框架,通过双环架构实现视频编辑任务的长期规划与分段处理,引入新的协调机制和评估框架,实验表明其在视频生成质量上优于现有方法。

Comments 14 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏