arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-01 至 2026-04-01 共收录 83 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 21 篇

2511.00524 2026-04-01 cs.CV 50%

Text-guided Fine-Grained Video Anomaly Understanding

基于文本引导的细粒度视频异常理解

Jihao Gu, Kun Li, He Wang, Kaan Akşit

机构 * University College London(伦敦大学学院) CVLab, College of Information Technology, United Arab Emirates University(阿联酋大学信息技术学院计算机视觉实验室)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出T-VAU框架,通过多模态推理提取细粒度视频异常证据,结合Anomaly Heatmap Decoder和Region-aware Anomaly Encoder提升异常检测与解释能力。

Comments Accepted by CVPR 2026 SVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 13 篇

2601.13358 2026-04-01 cs.AI cs.LG 84%

The Geometry of Thought: How Scale Restructures Reasoning In Large Language Models

思维的几何学:大规模语言模型中规模如何重构推理

Samuel Cyrenius Anderson

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示大规模语言模型中推理能力的几何重构特性,通过分析不同领域和规模的推理轨迹,发现神经规模定律触发领域特定的相变而非均匀能力提升,提出神经推理算子并识别出跨领域和规模的振荡特征。

Comments The theoretical framework has been shown to be wrong and should not be followed for future research direction

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29165 2026-04-01 cs.CV cs.AI cs.RO 74%

LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning

LatentPilot: 通过潜意识视觉推理进行场景感知的视觉-语言导航

Haihong Hao, Lei Chen, Mingfei Han, Changlin Li, Dong An, Yuqiang Yang, Zhihui Li, Xiaojun Chang

机构 * University of Science and Technology of China(中国科学技术大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Stanford University(斯坦福大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉空间推理 :reasoning(title);分类 cs.AI

AI总结 LatentPilot通过利用未来观测作为训练数据源,学习动作条件的视觉动态,无需访问未来帧即可实现场景感知的视觉-语言导航,实验在多个基准上取得新SOTA结果。

Comments Project page:https://abdd.top/latentpilot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29654 2026-04-01 cs.LG cs.AI stat.ML 62%

Concept frustration: Aligning human concepts and machine representations

概念冲突:对齐人类概念与机器表示

Enrico Parisini, Christopher J. Soelistyo, Ahab Isaac, Alessandro Barp, Christopher R. S. Banerji

机构 * The Francis Crick Institute(弗朗西斯·克里克研究所) Department of Statistical Science, University College London(伦敦大学学院统计科学系) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种几何框架,用于比较监督人类概念与无监督中间表示,揭示概念冲突现象,并展示其在任务对齐几何中的检测能力,为解释AI的发展提供新思路。

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21458 2026-04-01 cs.AI cs.CL cs.CV 62%

MindCube: Spatial Mental Modeling from Limited Views

MindCube:从有限视角构建空间心理模型

Qineng Wang, Baiqiao Yin, Pingyue Zhang, Jianshu Zhang, Kangrui Wang, Zihan Wang, Jieyu Zhang, Keshigeyan Chandrasegaran, Han Liu, Ranjay Krishna, Saining Xie, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过MindCube基准测试,探讨视觉语言模型能否从有限视角构建空间心理模型,提出'map-then-reason'方法提升模型性能,实现从37.8%到61.3%的准确率提升。

Comments The latest version includes an expanded discussion of scaffolding, along with updated data statistics and experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29777 2026-04-01 cs.CV cs.AI 57%

From Skeletons to Semantics: Design and Deployment of a Hybrid Edge-Based Action Detection System for Public Safety

从骨架到语义:一种混合边缘基于的动作检测系统在公共安全中的设计与部署

Ganen Sethupathy, Lalit Dumka, Jan Schagen

机构 * Sopra Steria Germany(Sopra Steria德国) Sopra Steria India(Sopra Steria印度)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种混合边缘动作检测系统,结合骨架运动分析与视觉语言模型,以提升公共安全中的实时视频分析能力,通过系统级对比展示两种方法在边缘计算中的互补性与局限性。

Comments Preprint version of a manuscript currently under review at IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16790 2026-04-01 cs.SE cs.AI 57%

InCoder-32B: Code Foundation Model for Industrial Scenarios

InCoder-32B:面向工业场景的代码基础模型

Jian Yang, Wei Zhang, Jiajun Wu, Junhang Cheng, Shawn Guo, Haowen Wang, Weicheng Gu, Yaxin Du, Joseph Li, Fanglin Xu, Yizhi Li, Lin Jing, Yuanbo Wang, Yuhan Gao, Ruihao Gong, Chuan Hao, Ran Tao, Aishan Liu, Tuney Zheng, Ganqu Cui, Zhoujun Li, Mingjie Tang, Chenghua Lin, Wayne Xin Zhao, Xianglong Liu, Ming Zhou, Bryan Dai, Weifeng Lv

机构 * Beihang University(北京航空航天大学) IQuest Research Shanghai Jiao Tong University(上海交通大学) ELLIS University of Manchester(曼彻斯特大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Langboat(朗博特)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出InCoder-32B,首个统一芯片设计、GPU内核优化等工业领域的32B参数代码基础模型,通过高效架构和多阶段训练方法,在通用和工业任务中均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29405 2026-04-01 cs.CV cs.AI 57%

Hallucination-aware intermediate representation edit in large vision-language models

具有幻觉意识的中间表示编辑在大视觉-语言模型中

Wei Suo, Hanzu Zhang, Lijun Zhang, Ji Ma, Peng Wang, Yanning Zhang

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种动态检测和消除幻觉表示的框架,通过最小额外计算成本在现有基准上实现最先进的性能,展示了高效且稳健的幻觉消除能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29798 2026-04-01 cs.CV 50%

SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes

SceneTeract:代理功能可能性与视觉语言模型在3D场景中的 grounded 性

Léopold Maillard, Francis Engelmann, Tom Durand, Boxiao Pan, Yang You, Or Litany, Leonidas Guibas, Maks Ovsjanikov

机构 * École Polytechnique(巴黎综合理工学院) Dassault Systèmes(达索系统) Stanford University(斯坦福大学) USI Lugano(卢加诺大学) Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SceneTeract 通过结合高层语义推理与低层几何检查,验证3D场景功能,评估合成环境中的功能失败及VLM对功能可能性的预测能力,揭示语义信心与物理可行性之间的系统性不匹配。

Comments Project page: https://sceneteract.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29437 2026-04-01 cs.CV 50%

SeGPruner: Semantic-Geometric Visual Token Pruner for 3D Question Answering

SeGPruner: 用于3D问答的语义-几何视觉令牌修剪器

Wenli Li, Kai Zhao, Haoran Jiang, Enquan Yang, Yi Su, Dan Zeng

机构 * Shanghai University(上海大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出SeGPruner,通过语义和几何引导的令牌减少框架提升3D问答效率,显著降低视觉令牌预算和推理延迟,同时保持竞争性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29428 2026-04-01 cs.CV 50%

Seeing the Evidence, Missing the Answer: Tool-Guided Vision-Language Models on Visual Illusions

看到证据,却错失答案:基于工具引导的视觉语言模型在视觉错觉中的应用

Xuesong Wang, Harry Wang

机构 * Wayne State University(韦恩州立大学) University of Michigan(密歇根大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一种工具引导的推理框架,通过通用图像处理工具和提示系统,解决视觉语言模型在处理视觉错觉时的系统性偏差问题,并展示其在不同结构错觉变体上的跨结构泛化能力。

Comments CVPR 2026 DataCV Workshop, code: https://github.com/Davidxswang/cvpr_2026_datacv_submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29095 2026-04-01 cs.HC 50%

VueBuds: Visual Intelligence with Wireless Earbuds

VueBuds:集成摄像头的无线耳机实现视觉智能

Maruchi Kim, Rasya Fawwaz, Zhi Yang Lim, Brinda Moudgalya, Hexi Wang, Yuanhao Zeng, Shyamnath Gollakota

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 VueBuds通过集成摄像头的无线耳机实现视觉智能,利用低功耗单色摄像头和视觉语言模型进行实时场景理解与文本阅读,其性能与智能眼镜相当。

Comments CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25165 2026-04-01 cs.CV 50%

Towards Foundation Models for 3D Scene Understanding: Instance-Aware Self-Supervised Learning for Point Clouds

迈向3D场景理解的基础模型:点云的实例感知自监督学习

Bin Yang, Mohamed Abdelsamad, Miao Zhang, Alexandru Paul Condurache

机构 * Bosch Research, Robert Bosch GmbH(博世研究,罗伯特·博世有限公司) Institute for Neuro- and Bioinformatics, University of Lübeck(神经与生物信息学研究所,吕贝克大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出PointINS框架,通过几何感知学习增强点云表示,引入ODR和SCR正则化策略,提升实例定位性能,在多个数据集上实现更优的mAP和PQ指标。

Comments The paper was accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06874 2026-04-01 cs.CV 50%

MVGGT: Multimodal Visual Geometry Grounded Transformer for Multiview 3D Referring Expression Segmentation

MVGGT:多模态视觉几何 grounded 变换器用于多视角3D指称表达分割

Changli Wu, Haodong Wang, Jiayi Ji, Yutian Yao, Chunsai Du, Jihua Kang, Yanwei Fu, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ByteDance(字节跳动) Tianjin University of Science and Technology(天津科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出MVGGT,一种高效的端到端框架,通过双分支设计将语言信息整合到稀疏视角的几何推理中,解决稀疏视角下的优化障碍,建立首个强基线,实现高精度和快速推理。

Comments Accepted to CVPR 2026; Project Website: https://mvggt.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 1 篇

2603.29301 2026-04-01 cs.CV 50%

Self-Consistency for LLM-Based Motion Trajectory Generation and Verification

基于大语言模型的运动轨迹生成与验证的自一致性

Jiaju Ma, R. Kenny Jones, Jiajun Wu, Maneesh Agrawala

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出利用自一致性技术提升大语言模型生成运动轨迹的准确性,通过聚类和几何变换实现轨迹的一致性验证,提升生成精度4-6%并验证精度11%。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 6 篇

2603.29602 2026-04-01 cs.GR cs.AI cs.CV cs.MA 83%

IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection

IMAGAgent:通过约束感知规划与反思协调多轮图像编辑

Fei Shen, Chengyu Xie, Lihong Wang, Zhanyi Zhang, Xin Jiang, Xiaoyu Du, Jinhui Tang

机构 * National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学) Nanjing Forestry University(南京林业大学)

专题命中 复杂问题求解 :planning(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 IMAGAgent通过闭环机制整合指令解析、工具调度与自适应修正,解决多轮图像编辑中的上下文感知与反馈问题,提升编辑精度与整体质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00818 2026-04-01 cs.AI cs.CV 79%

Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning

Med-CMR:一个整合视觉证据和临床逻辑的细粒度基准,用于医疗复杂多模态推理

Haozhen Gong, Xiaozhong Ji, Yuansen Liu, Wenbin Wu, Xiaoxiao Yan, Jingjing Liu, Kai Wu, Jiazhen Pan, Bailiang Jian, Jiangning Zhang, Xiaobin Hu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Tongji University(同济大学) Ruijin Hospital(瑞金医院) Technical University of Munich(慕尼黑工业大学) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 Med-CMR通过细粒度分解医疗多模态推理能力,设计挑战性任务并覆盖广泛高质量数据,评估18种先进大语言模型,发现GPT-5在多项选择题和开放性评分中表现最佳,但专业医疗大语言模型并不总能超越强通用模型,长尾泛化成为主要失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08115 2026-04-01 cs.AI 79%

TeamMedAgents: Pareto-Efficient Multi-Agent Medical Reasoning Through Teamwork Theory

TeamMedAgents: 通过团队理论实现帕累托高效多智能体医疗推理

Pranav Pushkar Mishra, Mohammad Arvan, Mohan Zalake

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 TeamMedAgents基于团队理论构建模块化多智能体框架,通过共享心理模型、团队领导、团队导向等机制,提升医疗推理效率,实现帕累托效率前沿提升,并在低token成本下取得竞争性准确率。

Comments 19 pages, 6 figure, 12 tables, 2 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01639 2026-04-01 cs.CV 50%

ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval

ReCALL: 为基于MLLM的组合图像检索 recalibrate 能力退化

Tianyu Yang, Chenwei He, Xiangzhao Hao, Tianyue Wang, Jiarui Guo, Haiyun Guo, Leigang Qu, Jinqiao Wang, Tat-Seng Chua

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Southeast University(东南大学) Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究院) Guangdong Provincial Key Laboratory of Intellectual Property and Big Data, Guangdong Polytechnic Normal University(广东技术师范大学广东省知识产权大数据重点实验室)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ReCALL通过诊断生成器盲点、生成修正指令和三元组、并持续训练来缓解基于生成式MLLM的检索能力退化问题,实验证明其在CIRR和FashionIQ上达到SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28889 2026-04-01 cs.DB 50%

DeepEye: A Steerable Self-driving Data Agent System

DeepEye:一种可调节的自动驾驶数据代理系统

Boyan Li, Yiran Peng, Yupeng Xie, Sirong Lu, Yizhang Zhu, Xing Mu, Xinyu Liu, Yuyu Luo

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出DeepEye,一种基于工作流的生产级数据代理系统,通过统一多模态协调协议和分层推理机制,解决异构数据源联合分析和上下文爆炸问题,实现透明执行和自动化优化。

Comments SIGMOD Demo (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28807 2026-04-01 cs.CR 50%

SafeClaw-R: Towards Safe and Secure Multi-Agent Personal Assistants

SafeClaw-R:迈向安全且安全的多智能体个人助理

Haoyu Wang, Zibo Xiao, Yedi Zhang, Christopher M. Poskitt, Jun Sun

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出SafeClaw-R框架,通过在执行图层面强制安全不变量,提升多智能体系统在安全性和隐私保护方面的性能,实验表明其在多个领域均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 22 篇

2407.03004 2026-04-01 cs.CL cs.AI 84%

SemioLLM: Evaluating Large Language Models for Diagnostic Reasoning from Unstructured Clinical Narratives in Epilepsy

SemioLLM:评估用于癫痫诊断推理的大型语言模型在无结构临床叙述中的表现

Meghal Dani, Muthu Jeyanthi Prakash, Filip Rosa, Zeynep Akata, Stefanie Liebe

机构 * University of Tübingen(蒂宾根大学) Technical University of Munich(慕尼黑工业大学) University Clinic Tübingen(蒂宾根大学医院) Hertie Institute for Clinical Brain Research(赫蒂临床脑研究所) Excellence Cluster Machine Learning, Tübingen University(蒂宾根大学机器学习卓越集群) Hertie Institute for AI in Brain Health (Hertie AI)(赫蒂人工智能脑健康研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了八个大型语言模型在癫痫诊断任务中的表现,通过过滤和标准化 seizure 描述短语,将其映射到七个可能的癫痫发作起始区。结果显示,经过提示工程后,多数模型表现接近临床水平,但临床情境下的表现受语言上下文影响显著,需改进模型的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29791 2026-04-01 cs.AI cs.CL cs.LG 82%

Reasoning-Driven Synthetic Data Generation and Evaluation

基于推理的合成数据生成与评估

Tim R. Davidson, Benoit Seguin, Enrico Bacis, Cesar Ilharco, Hamza Harkous

机构 * EPFL(瑞士联邦理工学院洛桑) Google(谷歌) Google Deepmind(谷歌DeepMind)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Simula框架,通过无种子、代理化方法生成大规模合成数据,提供可解释且可控的生成流程,验证了其在多种数据集上的有效性,为合成数据机制设计和大规模生成评估提供指导。

Comments Accepted to TMLR 2026, J2C Certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28021 2026-04-01 cs.SD 82%

Audio Language Model for Deepfake Detection Grounded in Acoustic Chain-of-Thought

基于声学推理的深度伪造检测音频语言模型

Runkun Chen, Yixiong Fang, Pengyu Chang, Yuante Li, Massa Baali, Bhiksha Raj

机构 * Carnegie Mellon University, USA(卡内基梅隆大学,美国)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract)

AI总结 本文提出CoLMbo-DF,通过整合深度伪造检测与显式的声学推理,利用结构化文本表示提升检测准确性,实验表明其在解释性深度伪造语音检测中取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10788 2026-04-01 cs.AI cs.CL 81%

From Efficiency to Adaptivity: A Deeper Look at Adaptive Reasoning in Large Language Models

从效率到适应性:深入探讨大语言模型中的适应性推理

Chao Wu, Baoheng Li, Mingchen Gao, Yu Tian, Zhenyi Wang

机构 * University at Buffalo(布法罗大学) University of Central Florida(中佛罗里达大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨大语言模型中适应性推理的核心方法与贡献,提出适应性推理的控制增强策略优化问题,并构建系统分类法以比较不同策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16635 2026-04-01 cs.MA cs.AI cs.CL cs.HC cs.IR 81%

MA-SAPO: Multi-Agent Reasoning for Score-Aware Prompt Optimization

MA-SAPO:多智能体推理用于评分感知提示优化

Wonduk Seo, Juhyeon Lee, Junseo Koh, Wonseok Choi, Hyunjin An, Jian Park, Seunghyun lee, Haihua Chen, Yi Bu

机构 * Enhans Peking University(北京大学) Fudan University(复旦大学) University of North Texas(北德克萨斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MA-SAPO框架,通过多智能体推理将评估结果与针对性改进联系起来,提升提示优化的可解释性和可控性,实验表明其在多个评估指标上优于现有方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29608 2026-04-01 cs.CL 79%

Learning Diagnostic Reasoning for Decision Support in Toxicology

学习毒理学诊断推理以支持决策

Nico Oberländer, David Bani-Harouni, Tobias Zellner, Nassir Navab, Florian Eyer, Matthias Keicher

机构 * Computer Aided Medical Procedures, Technical University of Munich, Germany(德国慕尼黑工业大学计算机辅助医疗程序研究所) Munich Center for Machine Learning (MCML), Germany(德国慕尼黑机器学习中心(MCML)) Department of Clinical Toxicology and Poison Control Center Munich, TUM Klinikum rechts der Isar, Germany(德国慕尼黑工业大学伊萨尔河右岸医院临床毒理学与毒物控制中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出DeToxR,通过强化学习处理毒理学中的多标签预测,结合未结构化和结构化数据提升诊断准确性,优于基线模型和专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28924 2026-04-01 cs.CL 79%

CrossTrace: A Cross-Domain Dataset of Grounded Scientific Reasoning Traces for Hypothesis Generation

CrossTrace:一种跨领域 grounded 科学推理轨迹数据集用于假设生成

Andrew Bouras, OMS-II Research Fellow

机构 * Nova Southeastern University Dr. Kiran C. Patel College of Osteopathic Medicine(诺瓦东南大学基兰·C·帕特尔骨科医学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 CrossTrace 是一个跨领域 grounded 科学推理轨迹数据集,包含 1389 个轨迹,涵盖生物医学研究、AI/ML 和跨领域工作。通过 QLoRA 微调 Qwen2.5-7B-Instruct,显著提升 IAScore 和结构合规性,验证跨领域推理轨迹的有效性。

Comments 14 pages, 1 figure, 8 tables. Dataset and code available at https://github.com/andrewbouras/crosstrace

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.30028 2026-04-01 cs.CY 78%

Can Commercial LLMs Be Parliamentary Political Companions? Comparing LLM Reasoning Against Romanian Legislative Expuneri de Motive

商业大语言模型能成为议会政治伙伴吗?比较大语言模型推理与罗马尼亚立法解释

Iulian Lucău, Adelin-George Voicu

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文通过比较六种大语言模型在罗马尼亚议会法案解释上的表现,探讨其作为政治顾问工具的可靠性,发现前沿模型在语义接近度上表现优异,但所有模型在任务依赖性上均存在编造问题。

Comments 12 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21507 2026-04-01 cs.CV 78%

SVBench: Evaluation of Video Generation Models on Social Reasoning

SVBench:视频生成模型在社会推理中的评估

Wenshuo Peng, Gongxuan Wang, Tianmeng Yang, Chuanhao Li, Xiaojie Xu, Hui He, Kaipeng Zhang

机构 * Tsinghua University(清华大学) Shanda AI Research Tokyo(盛大人工智能研究院东京) Shanghai AI Lab(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出SVBench基准,用于评估视频生成模型在社会推理能力上的不足,通过七大核心维度和免训练流程,评估七种先进模型,揭示表面合理性与深层社会推理能力间的差距。

Comments 10pages

详情

展开后加载摘要…

URL PDF HTML 收藏