arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-23 至 2026-03-23 共收录 90 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 20 篇

2603.20094 2026-03-23 cs.IR cs.AI cs.DB 57%

LLM-Enhanced Semantic Data Integration of Electronic Component Qualifications in the Aerospace Domain

基于大语言模型的航空领域电子元件资格语义数据整合

Antonio De Santis, Marco Balduini, Matteo Belcao, Andrea Proia, Marco Brambilla, Emanuele Della Valle

机构 * Politecnico di Milano, DEIB(米兰Politecnico大学DEIB系) Quantia Consulting(Quantia咨询公司) Motus ml(Motus ml实验室) Thales Alenia Space(Thales Alenia空间公司)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出利用虚拟知识图谱和大语言模型整合航空领域电子元件资格数据,通过本体数据访问和向量搜索提升检索效率,减少人工处理成本。

Comments ESWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20028 2026-03-23 cs.SE cs.AI 57%

Orchestrating Human-AI Software Delivery: A Retrospective Longitudinal Field Study of Three Software Modernization Programs

协调人机AI软件交付:三种软件现代化项目的回顾纵向实地研究

Maximiliano Armesto, Christophe Kolb

机构 * Taller Technologies(塔勒技术)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究通过回顾三个软件现代化项目,分析AI与人类协作在软件交付各阶段的效果,发现嵌入协调工作流的AI能显著提升效率与覆盖率。

Comments 18 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19896 2026-03-23 cs.AI 57%

Utility-Guided Agent Orchestration for Efficient LLM Tool Use

基于效用的代理协调以提高大语言模型工具使用效率

Boyan Liu, Gongming Zhao, Hongli Xu

机构 * University of Science and Technology of China(科学技术大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种基于效用的代理协调策略,通过平衡收益、成本、不确定性及冗余性来优化大语言模型工具使用中的质量与成本权衡。实验表明显式协调信号显著影响代理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19710 2026-03-23 cs.IR cs.AI 57%

AIGQ: An End-to-End Hybrid Generative Architecture for E-commerce Query Recommendation

AIGQ: 电商查询推荐的端到端混合生成架构

Jingcao Xu, Jianyun Zou, Renkai Yang, Zili Geng, Qiang Liu, Haihong Tang

机构 * Taobao \& Tmall Group of Alibaba Hangzhou China University of Electronic Science Taobao \& Tmall Group of Alibaba

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 AIGQ通过端到端生成框架解决电商查询推荐中的语义浅层、冷启动差和偶然性问题,采用兴趣感知列表监督微调和兴趣感知列表组相对策略优化,提升查询相关性和列表属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07451 2026-03-23 cs.CL 57%

DLLM Agent: See Farther, Run Faster

DLLM Agent: 看得更远,跑得更快

Huiling Zhen, Weizhe Lin, Renxi Liu, Kai Han, Yiming Li, Yuchuan Tian, Hanting Chen, Xiaoguang Li, Xiaosong Li, Chen Chen, Xianzhi Yu, Mingxuan Yuan, Youliang Yan, Peifeng Qin, Jun Wang, Yu Wang, Dacheng Tao, Yunhe Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) UCL(伦敦大学学院) Tsinghua University(清华大学) NTU(国立新加坡大学) Peking University(北京大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文研究了扩散大语言模型(DLLM)在代理多步决策中的表现,发现其在准确率相当的情况下,整体效率比自回归模型(AR)高30%以上,并提出部署扩散骨架的两个实用考虑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20795 2026-03-23 cs.CL 57%

Test-Time Alignment for Large Language Models via Textual Model Predictive Control

通过文本模型预测控制对大型语言模型进行测试时对齐

Kuang-Da Wang, Teng-Ruei Chen, Yu Heng Hung, Guo-Xun Ko, Shuoyang Ding, Yueh-Hua Wu, Yu-Chiang Frank Wang, Chao-Han Huck Yang, Wen-Chih Peng, Ping-Chun Hsieh

机构 * National Yang Ming Chiao Tung University NVIDIA National Taiwan University

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 本文提出TMPC方法,通过文本模型预测控制解决测试时对齐问题,通过分层强化学习原理改进生成过程,提升不同任务的性能。

Comments Accepted for ICLR 2026. Project page: https://rl-bandits-lab.github.io/TMPC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13757 2026-03-23 cs.CY 50%

Assessing the Case for Africa-Centric AI Safety Evaluations

评估非洲中心的AI安全评估的必要性

Gathoni Ireri, Cecil Abungu, Jean Cheptumo, Sienka Dounia, Mark Gitau, Stephanie Kasaon, Michael Michie, Chinasa T. Okolo, Jonathan Shock

专题命中 规划推理 :planning(abstract)

AI总结 本文探讨了非洲环境中前沿AI系统带来的严重风险,提出了一种分类方法来识别这些风险,并提出了针对非洲情境的威胁建模策略及评估指导。

Comments 41 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17861 2026-03-23 cs.RO 50%

From Vocal Instructions to Household Tasks: The Inria TIAGo++ in the euROBIN Service Robots Coopetition

从语音指令到家庭任务:Inria TIAGo++在euROBIN服务机器人竞赛中的应用

Fabio Amadio, Clemente Donoso, Dionis Totsila, Raphael Lorenzo, Quentin Rouxel, Olivier Rochel, Enrico Mingo Hoffman, Jean-Baptiste Mouret, Serena Ivaldi

机构 * Inria/LORIA

专题命中 规划推理 :planning(abstract)

AI总结 本文介绍了Inria团队在euROBIN竞赛中使用的集成机器人系统,通过改进TIAGo++平台实现自主和远程操作模式,并结合LLM进行指令理解和任务规划,解决了服务机器人部署中的实际问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 5 篇

2512.15160 2026-03-23 cs.CV 82%

EagleVision: A Dual-Stage Framework with BEV-grounding-based Chain-of-Thought for Spatial Intelligence

EagleVision:基于BEV的双阶段框架用于空间智能

Jiaxu Wan, Xu Wang, Mengwei Xie, Hang Zhang, Mu Xu, Yang Han, Hong Zhang, Ding Yuan, Yifan Yang

机构 * Atlas Lab(Atlas实验室) School of Aerospace, BUAA(北京航空航天大学航空学院) School of Software, BUAA(北京航空航天大学软件学院) State Key Laboratory of HERATT(HERATT国家重点实验室) Key Laboratory of SDODS (MOE) Project(SDODS重点实验室(教育部))

专题命中 视觉空间推理 :chain-of-thought(title,abstract);reasoning(abstract)

AI总结 EagleVision通过结合几何感知帧选择与主动BEV推理,提升视频空间推理能力,实现空间感知与验证的闭环循环。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05786 2026-03-23 cs.CV cs.AI 74%

How to Enable LLM with 3D Capacity? A Survey of Spatial Reasoning in LLM

如何使LLM具备3D能力?LLM中空间推理的综述

Jirong Zha, Yuxuan Fan, Xiao Yang, Chen Gao, Xinlei Chen

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology (Guang Zhou)(香港科学与技术大学(广州))

专题命中 视觉空间推理 :reasoning(title);分类 cs.AI

AI总结 本文综述了将LLM与3D空间理解结合的方法,提出分类体系,涵盖图像、点云和混合模态方法,并讨论了当前限制与未来研究方向。

Comments 9 pages, 5 figures

Journal ref IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19203 2026-03-23 cs.CV 50%

Tinted Frames: Question Framing Blinds Vision-Language Models

着色边框:问题框架使视觉语言模型失明

Wan-Cyuan Fan, Jiayun Luo, Declan Kutscher, Leonid Sigal, Ritwik Gupta

机构 * University of British Columbia(不列颠哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Vector Institute for AI(人工智能向量研究所)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究视觉语言模型在不同问题框架下的注意力分配问题,发现框架影响其视觉输入处理,提出轻量级提示调优方法提升视觉感知能力。

Comments Preprint. Project page: https://davidhalladay.github.io/tinted_frames_demo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18282 2026-03-23 cs.CV 50%

CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning

CycleCap: 通过自监督循环一致性微调提升VLMs的描述性能

Marios Krestenitis, Christos Tzelepis, Konstantinos Ioannidis, Stefanos Vrochidis, Ioannis Kompatsiaris, Georgios Tzimiropoulos, Shaogang Gong, Ioannis Patras

机构 * Queen Mary, University of London(伦敦大学玛丽女王学院) Centre for Research and Technology Hellas(希腊研究中心) City St George’s, University of London(伦敦大学圣乔治学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出CycleCap,通过自监督循环一致性训练提升VLMs的图像描述性能,利用GRPO优化策略,基于重建图像与原始图像相似性作为奖励信号,无需标注数据即可提高描述准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19481 2026-03-23 cs.CV 50%

Narrative Aligned Long Form Video Question Answering

叙事对齐的长视频问答

Rahul Jain, Keval Doshi, Burak Uzkent, Garin Kessler

机构 * Purdue University(普渡大学) Amazon(亚马逊)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出NA-VQA基准,评估长视频中的深度时间与叙事推理能力,通过88部完整电影和4.4K开放性问题测试模型整合分散叙事信息的能力,提出Video-NaRA框架提升远距离推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 4 篇

2603.19328 2026-03-23 cs.CR 85%

The Verifier Tax: Horizon Dependent Safety Success Tradeoffs in Tool Using LLM Agents

验证者税:工具使用LLM代理中地平线依赖的安全成功权衡

Tanmay Sah, Vishal Srivastava, Dolly Sah, Kayden Jordan

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);planning(abstract)

AI总结 研究运行时强制执行对多步骤工具使用大语言模型代理端到端任务性能的影响,发现安全调解虽能拦截94%的非合规动作,但难以保证安全完成,凸显了需要具备基础身份验证和后干预推理能力的代理。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20046 2026-03-23 cs.AI 57%

Experience is the Best Teacher: Motivating Effective Exploration in Reinforcement Learning for LLMs

经验是最好的老师:在大型语言模型强化学习中激励有效的探索

Wenjian Zhang, Kongcheng Zhang, Jiaxin Qi, Baisheng Lai, Jianqiang Huang

机构 * Dalian University of Technology(大连理工大学) Zhejiang University(浙江大学) Chinese Academy of Sciences(中国科学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HeRL框架,通过引导经验提升LLM的探索效率,有效学习高质量样本,实验显示其优于基线方法并能通过经验自我改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19863 2026-03-23 cs.CV 50%

MedQ-Engine: A Closed-Loop Data Engine for Evolving MLLMs in Medical Image Quality Assessment

MedQ-Engine:一种用于医疗图像质量评估中进化多模态大语言模型的闭环数据引擎

Jiyao Liu, Junzhi Ning, Wanying Qu, Lihao Liu, Chenglong Ma, Junjun He, Ningsheng Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出MedQ-Engine,通过闭环数据引擎迭代评估模型,发现失败原型,利用人类在循环注释提升模型性能,使8B参数模型在医疗图像质量评估中超越GPT-4o 13%并接近人类专家水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19364 2026-03-23 cs.CV 50%

AURORA: Adaptive Unified Representation for Robust Ultrasound Analysis

AURORA:适应性统一表示用于鲁棒超声分析

Ufaq Khan, L. D. M. S. Sai Teja, Ayuba Shakiru, Mai A. Shaaban, Yutong Xie, Muhammad Bilal, Muhammad Haris Khan

机构 * MBZUAI NIT Silchar(Silchar国立理工学院) Birmingham City University(伯明翰城市大学)

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出基于Transformer视觉编码器的统一多任务框架,解决超声图像在不同设备、操作者和解剖目标下的泛化问题,通过轻量级多尺度特征金字塔实现像素级预测与全局推理,提升多任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 9 篇

2511.17910 2026-03-23 cs.CL 92%

L2V-CoT: Cross-Modal Transfer of Chain-of-Thought Reasoning via Latent Intervention

L2V-CoT:通过潜在干预实现链式推理的跨模态转移

Yuliang Zhan, Xinyu Tang, Han Wan, Jian Li, Ji-Rong Wen, Hao Sun

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL

AI总结 本文提出L2V-CoT方法,通过潜在干预将链式推理从LLM转移到VLM,利用低频潜在表示提升多步推理能力,实验表明优于无训练基线和监督方法。

Comments AAAI 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19558 2026-03-23 cs.CL 83%

TextReasoningBench: Does Reasoning Really Improve Text Classification in Large Language Models?

TextReasoningBench: 推理是否真的能提升大语言模型中的文本分类性能?

Xinyu Guo, Yazhou Zhang, Jing Qin

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) School of Nursing, The Hong Kong Polytechnic University(香港理工大学护理学院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文通过TextReasoningBench评估推理策略在文本分类中的有效性与效率,发现推理并非总能提升性能,且多数策略效率低下。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03018 2026-03-23 cs.CL cs.AI cs.LG 82%

Dementia-R1: Reinforced Pretraining and Reasoning from Unstructured Clinical Notes for Real-World Dementia Prognosis

Dementia-R1: 从无结构临床笔记中通过强化预训练和推理进行真实世界痴呆症预后预测

Choonghan Kim, Hyunmin Hwang, Hangeol Chang, Jaemin Kim, Jinse Park, Jae-Sung Lim, Jong Chul Ye

机构 * Graduate School of AI, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) Haeundae Paik Hospital, Inje University, Republic of Korea(韩国延世大学海云台医院) Asan Medical Center, University of Ulsan College of Medicine, Republic of Korea(韩国釜山大学医学院阿桑医院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Dementia-R1框架,通过强化学习解决长期痴呆症预后预测问题,通过预训练提升疾病进展推理能力,在真实世界数据集上达到84.02%的AUROC,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18533 2026-03-23 cs.LG cs.CL 81%

Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning

平衡推理负担:基于长度再分配的难度差异化策略优化用于高效且鲁棒的强化学习

Yinan Xia, Haotian Zhang, Huiming Wang

机构 * Tianjin University(天津大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出DDPO算法,通过区分任务难度优化输出长度,提升强化学习的效率与鲁棒性,实验表明在多个基准上准确率提升1.85%的同时平均回答长度减少12%。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16665 2026-03-23 cs.LG cs.AI cs.DC 81%

Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter

驯服长尾:通过自适应草案器实现高效的推理强化学习训练

Qinghao Hu, Shang Yang, Junxian Guo, Xiaozhe Yao, Yujun Lin, Yuxian Gu, Han Cai, Chuang Gan, Ana Klimovic, Song Han

机构 * MIT(麻省理工学院) ETH Zurich(苏黎世联邦理工学院) NVIDIA(英伟达) MIT-IBM AI Lab(麻省理工-IBM人工智能实验室) MIT, NVIDIA(麻省理工学院、英伟达)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TLT系统,通过自适应草案器和自适应回放引擎,解决强化学习训练中响应生成的长尾分布问题,实现1.7倍的训练加速并保持模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19293 2026-03-23 cs.CL cs.AI 81%

LLM-MRD: LLM-Guided Multi-View Reasoning Distillation for Fake News Detection

LLM-MRD: 基于大语言模型的多视角推理蒸馏用于虚假新闻检测

Weilin Zhou, Shanwen Tan, Enhao Gu, Yurong Qian

机构 * Xinjiang University, Urumqi, China(新疆大学) Sichuan University, Chengdu, China(四川大学) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University, Urumqi, China(丝绸之路多语种认知计算国际联合实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM-MRD框架,通过多视角推理蒸馏提升虚假新闻检测性能,实验显示在准确率和F1-Fake指标上均优于现有方法。

Comments Accepted at DASFAA 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24903 2026-03-23 cs.CV cs.CE 78%

FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation

FinMMDocR:基于场景意识、文档理解与多步骤计算的金融多模态推理基准测试

Zichen Tang, Haihong E, Rongjin Li, Jiacheng Liu, Linwei Jia, Zhuodi Hao, Zhongjun Yang, Yuanze Li, Haolin Tian, Xinyi Hu, Peizhi Zhao, Yuan Liu, Zhengyu Wang, Xianghe Wang, Yiling Huang, Xueyuan Lin, Ruofei Bai, Zijian Xie, Qian Huang, Ruining Cao, Haocheng Gao

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 FinMMDocR通过引入场景意识、文档理解和多步骤计算,推动多模态大语言模型在现实金融场景中的推理能力提升,其包含12种隐含金融场景、9类丰富文档及平均11步推理任务。

Comments Accepted by AAAI-26 Main Track

Journal ref Proc. AAAI 2026 (Vol. 40, No. 30), pages 25858-25866

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19574 2026-03-23 cs.HC cs.AI cs.CL cs.CY cs.SI 62%

AI Psychosis: Does Conversational AI Amplify Delusion-Related Language?

AI精神病:对话AI是否会放大妄想相关语言?

Soorya Ram Shimgekar, Vipin Gunda, Jiwon Kim, Violeta J. Rodriguez, Hari Sundaram, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨对话AI对妄想相关语言的影响,通过模拟用户和三种模型家族分析妄想语言的变化,发现高妄想用户对话中妄想得分持续上升,而AI响应可有效降低此趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20143 2026-03-23 cs.CV 50%

Synergistic Perception and Generative Recomposition: A Multi-Agent Orchestration for Expert-Level Building Inspection

协同感知与生成重组:一种多智能体协作方法用于专家级建筑检查

Hui Zhong, Yichun Gao, Luyan Liu, Xusen Guo, Zhaonian Kuang, Qiming Zhang, Xinhu Zheng

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出FacadeFixer框架,通过多智能体协作解决建筑立面缺陷检测难题,利用生成代理实现语义重组,提升检测与分割模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 22 篇

2602.20945 2026-03-23 cs.CL cs.AI 87%

The Art of Efficient Reasoning: Data, Reward, and Optimization

高效推理的艺术:数据、奖励与优化

Taiqiang Wu, Zenan Xu, Bo Zhou, Ngai Wong

机构 * The University of Hong Kong(香港大学) LLM Department, Tencent(腾讯人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文系统研究了大型语言模型的高效推理机制,通过精细化指标评估发现训练过程分为长度适应与推理优化两阶段,提出保持正奖励密度以避免短即正确陷阱,并验证了在不同领域和难度下的通用性。

Comments Tech Report, Insights on Efficient Reasoning via Reward Shaping

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01038 2026-03-23 cs.CV cs.AI 85%

From Intuition to Investigation: A Tool-Augmented Reasoning MLLM Framework for Generalizable Face Anti-Spoofing

从直觉到探究:一种工具增强的推理MLLM框架用于可推广的面部反伪装

Haoyuan Zhang, Keyao Wang, Guosheng Zhang, Haixiao Yue, Zhiwen Tan, Siran Peng, Tianshuo Zhang, Xiao Tan, Kunbin Chen, Wei He, Jingdong Wang, Ajian Liu, Xiangyu Zhu, Zhen Lei

机构 * SAI, UCAS(UCAS智能科学研究院) MAIS, CASIA(CASIA模式识别与智能信息处理研究院) Baidu Inc(百度公司) CAIR, HKISI, CAS(HKISI CAS计算机视觉研究院) M.U.S.T

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出TAR-FAS框架,通过整合外部视觉工具提升面部反伪装的泛化能力,采用CoT-VT范式使MLLM深入分析细微伪装线索,实验表明其在跨域协议下达到SOTA性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19539 2026-03-23 cs.CL cs.AI 81%

FDARxBench: Benchmarking Regulatory and Clinical Reasoning on FDA Generic Drug Assessment

FDARxBench:基于FDA通用药物评估的监管与临床推理基准测试

Betty Xiong, Jillian Fisher, Benjamin Newman, Meng Hu, Shivangi Gupta, Yejin Choi, Lanyan Fang, Russ B Altman

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) U.S. Food and Drug Administration(美国食品药品监督管理局)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出FDARxBench基准测试,用于评估基于文档的问答任务,通过FDA药物标签文档生成高质量问答示例,揭示语言模型在事实基础、长上下文检索和安全拒绝行为方面的差距。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19306 2026-03-23 cs.IR cs.AI cs.LG 81%

VERDICT: Verifiable Evolving Reasoning with Directive-Informed Collegial Teams for Legal Judgment Prediction

VERDICT: 可验证的演进推理与指令驱动的协作团队用于法律判断预测

Hui Liao, Chuan Qin, Yongwen Ren, Hao Li, Zhenya Huang, Yanyong Zhang, Chao Wang

机构 * University of Science and Technology of China(中国科学技术大学) Chinese Academy of Sciences(中国科学院) iFLYTEK AI Research(iFLYTEK人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 VERDICT通过模拟虚拟合议庭,提出自反思协作多智能体框架,结合混合法理记忆实现法律推理的可验证性和适应性,提升法律预测的准确性和解释性。

Comments 15 pages,3 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏