arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-24 至 2026-04-24 共收录 79 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 20 篇

2602.13211 2026-04-24 cs.NI cs.AI 57%

An Overlay Multicast Routing Method Based on Network Situational Awareness and Hierarchical Multi-Agent Reinforcement Learning

基于网络态势感知和分层多智能体强化学习的overlay组播路由方法

Miao Ye, Yanye Chen, Yong Wang, Cheng Zhu, Qiuxiang Jiang, Gai Huang, Feng Ding

机构 * School of Information and Communication, Guilin University of Electronic Technology(桂林电子科技大学信息与通信学院) School of Computer Science and Information Security, Guilin University of Electronic Technology(桂林电子科技大学计算机科学与信息安全学院) Information Center, Guilin Medical University(桂林医学院信息中心) School of Optoelectronic Engineering, Guilin University of Electronic Technology(桂林电子科技大学光电工程学院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出MA-DHRL-OM方法,通过分层多智能体强化学习和SDN全局视图构建组播路径规划模型,解决传统组播在动态流量适应性和多目标优化中的不足,实验表明其在延迟、带宽利用和丢包率方面表现更优。

Comments 30page, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11569 2026-04-24 cs.AI 57%

SemaPop: Semantic-Persona Conditioned and Controllable Population Synthesis

SemaPop:基于语义-人设的可控人口合成

Zhenlin Qin, Yancheng Ling, Leizhen Wang, Francisco Câmara Pereira, Zhenliang Ma

机构 * Department of Civil and Architectural Engineering, KTH Royal Institute of Technology(土木与建筑系,皇家理工学院) Digital Future, KTH Royal Institute of Technology(数字未来,皇家理工学院) Department of Data Science and Artificial Intelligence, Monash University(数据科学与人工智能系,墨尔本大学) Department of Technology, Management and Economics, Technical University of Denmark(技术、管理与经济学系,丹麦技术大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 SemaPop通过引入人设表示作为生成条件,实现可控的人口合成,提升生成性能并保持统计一致性与样本多样性。

Comments Submitted to Transportation Research Part C: Emerging Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11159 2026-04-24 cs.AI 57%

C-SHAP for time series: An approach to high-level temporal explanations

C-SHAP用于时间序列:一种高层面时间解释的方法

Annemarie Jutte, Faizan Ahmed, Jeroen Linssen, Maurice van Keulen

机构 * Saxion University of Applied Sciences(萨克逊应用科学大学) University of Twente(代尔夫特理工大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出C-SHAP方法,通过提取时间序列中的高层模式来提升AI决策的可解释性,应用于医疗和工业领域,如活动识别和预测维护。

Comments Comments: 18 pages, 7 figures, improved and expanded version of the original paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20916 2026-04-24 cs.AR 50%

AnalogMaster: Large Language Model-based Automated Analog IC Design Framework from Image to Layout

AnalogMaster: 基于大语言模型的从图像到布局的自动化模拟集成电路设计框架

Xian Rong Qin, Yong Zhang, Ying Hu, Tao Su, Bo-Wen Jia, Ning Xu

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出AnalogMaster框架,利用大语言模型实现模拟集成电路设计的端到端自动化,通过统一流程完成电路图像到网表生成、参数优化、布局和布线,验证了其有效性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05320 2026-04-24 cs.RO 50%

ExpressMM: Expressive Mobile Manipulation Behaviors in Human-Robot Interactions

ExpressMM: 人机交互中的表达性移动 manipulation 行为

Souren Pashangpour, Haitong Wang, Matthew Lisondra, Goldie Nejat

机构 * Autonomous Systems and Biomechatronics Laboratory(自主系统与生物机械实验室) Department of Mechanical and Engineering(机械与工程系) University of Toronto(多伦多大学)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出ExpressMM框架,结合视觉语言模型和低层策略生成表达性机器人行为,支持中断交互,提升人机协作任务中的沟通效果与社会适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 6 篇

2604.21249 2026-04-24 cs.RO 88%

Reasoning About Traversability: Language-Guided Off-Road 3D Trajectory Planning

轨迹可 traversability 的推理:语言引导的越野3D轨迹规划

Byounggun Park, Soonmin Hwang

机构 * Department of Automotive Engineering, Hanyang University, Seoul, Republic of Korea(韩雅大学汽车工程系,首尔,大韩民国)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(title,abstract)

AI总结 本文提出语言精修框架与偏好优化策略,通过动作对齐监督和地形感知优化,提升越野3D轨迹规划的合规性与地形一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21409 2026-04-24 cs.CV 82%

S1-VL: Scientific Multimodal Reasoning Model with Thinking-with-Images

S1-VL:具有图像思维的科学多模态推理模型

Qingxiao Li, Lifeng Xu, QingLi Wang, Yudong Bai, Mingwei Ou, Shu Hu, Nan Xu

机构 * ScienceOne AI

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 S1-VL是一种支持科学推理和图像思维的多模态模型,通过Python代码执行图像处理,提升科学图表、显微图像和几何推理等复杂场景的性能。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07961 2026-04-24 cs.CV 80%

SGG-R$^{\rm 3}$: From Next-Token Prediction to End-to-End Unbiased Scene Graph Generation

SGG-R$^{\rm 3}$: 从单token预测到端到端无偏场景图生成

Jiaye Feng, Qixiang Yin, Yuankun Liu, Tong Mo, Weiping Li

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Zhongguancun Academy(中关村学院)

专题命中 视觉空间推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出SGG-R$^{\rm 3}$框架,通过结合任务特定的推理过程和强化学习优化,解决场景图生成中的关系稀疏和长尾问题,提升生成效果和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21160 2026-04-24 cs.CV 67%

Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment

通过几何奖励信用分配强化点-视觉-语言模型的3D理解

Jingkun Chen, Ruoshi Xu, Mingqi Gao, Shengda Luo, Jungong Han

机构 * Northwestern Polytechnical University(西北工业大学) Southern University of Science and Technology(南方科技大学) The University of Sheffield(谢菲尔德大学) Hengqin Laboratory(横琴实验室) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);verifier(abstract)

AI总结 本文提出几何奖励信用分配框架,通过分离整体监督信号并定向反馈,提升点-视觉-语言模型的3D结构对齐能力,同时引入重投影一致性项约束物理可行性,从而提升3D KPA和重投影一致性评分。

Comments 10 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21523 2026-04-24 cs.CV cs.CL 57%

Seeing Isn't Believing: Uncovering Blind Spots in Evaluator Vision-Language Models

看到并不等于相信:揭示评估者视觉-语言模型的盲区

Mohammed Safi Ur Rahman Khan, Sanjay Suryanarayanan, Tushar Anand, Mitesh M. Khapra

机构 * Nilekani Centre at AI4Bharat(AI4Bharat的Nilekani中心) Indian Institute of Technology Madras(印度理工学院马德拉斯分校) BITS Pilani, Hyderabad(海得拉巴 BITS学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 本文系统评估了评估者视觉-语言模型在I2T和T2I任务中的可靠性,通过引入针对性扰动测试其在对象幻觉、空间推理等关键错误维度上的检测能力,发现当前模型存在显著盲区。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20981 2026-04-24 q-bio.QM cs.CV cs.LG 57%

PanGuide3D: Cohort-Robust Pancreas Tumor Segmentation via Probabilistic Pancreas Conditioning and a Transformer Bottleneck

PanGuide3D:通过概率胰腺条件和一个Transformer瓶颈实现队列鲁棒的胰腺肿瘤分割

Sunny Joy Ma, Xiang Ma

机构 * Trailridge School(Trailridge学校) Department of Biochemistry, Grand View University(生物化学系,Grand View大学) Department of Computer Science, Iowa State University(计算机科学系,Iowa State大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 本文提出PanGuide3D,通过概率胰腺条件和Transformer瓶颈提升跨队列鲁棒性,实现高效且实用的3D CT肿瘤分割,尤其在小肿瘤和复杂解剖位置表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 4 篇

2506.12721 2026-04-24 cs.AI cs.CL cs.LG stat.ML 82%

Strategic Scaling of Test-Time Compute: A Bandit Learning Approach

测试时计算的战略扩展:一种多臂学习方法

Bowen Zuo, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 测试时计算 :test-time compute(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种多臂学习方法,通过动态分配计算资源提升大语言模型性能,针对不同查询难度优化计算分配,实验表明在多个基准数据集上显著提升性能。

Comments To appear at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21611 2026-04-24 cs.CL cs.AI 81%

Process Supervision via Verbal Critique Improves Reasoning in Large Language Models

通过口头批评过程监督提高大语言模型的推理能力

Hao-Yuan Chen

机构 * Mindify AI Research(Mindify AI研究院) University of London(伦敦大学) Senate House, Malet Street, London WC1E 7HU, United Kingdom(伦敦大学 Senate House, 马莱特街, 伦敦 WC1E 7HU, 英国)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过外部口头监督提升大语言模型推理能力的方法,通过结构化自然语言批评指导生成-批评-完善循环,提升推理性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20860 2026-04-24 cs.IR cs.AI 70%

RealRoute: Dynamic Query Routing System via Retrieve-then-Verify Paradigm

RealRoute:通过检索-验证范式实现动态查询路由系统

Jiahe Liu, Qinkai Yu, Jingcheng Niu, Xi Zhu, Zirui He, Zhen Xiang, Fan Yang, Jinman Zhao

机构 * Technical University of Denmark(技术大学) University of Exeter(埃克塞特大学) University of Toronto(多伦多大学) Rutgers University(罗格斯大学) NJIT(新 jersey 工业技术学院) University of Georgia(佐治亚大学) Wake Forest University(威克森林大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 RealRoute引入一种鲁棒的检索-验证机制,通过并行源无关检索和动态验证器确保证据完整性,优于预测基线,在多跳RAG推理任务中表现更佳。

Comments 12 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21525 2026-04-24 cs.CL 57%

Job Skill Extraction via LLM-Centric Multi-Module Framework

通过以LLM为中心的多模块框架进行工作技能提取

Guojing Li, Zichuan Fu, Junyi Li, Faxue Liu, Wenxia Zhou, Yejing Wang, Jingtong Gao, Maolin Wang, Rungen Liu, Wenlin Zhang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Renmin University of China(中国人民大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 本文提出SRICL框架,结合语义检索、上下文学习和监督微调,解决长尾术语和跨域迁移下的工作广告技能提取问题,提升F1指标并减少无效标签。

Comments 5 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 5 篇

2511.06209 2026-04-24 cs.AI cs.CL 84%

ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models

ReProbe:通过探测大语言模型的内部状态实现多步骤推理的高效测试时间扩展

Jingwei Ni, Ekaterina Fadeeva, Tianyi Wu, Mubashara Akhtar, Jiaheng Zhang, Elliott Ash, Markus Leippold, Timothy Baldwin, See-Kiong Ng, Artem Shelmanov, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) National University of Singapore(新加坡国立大学) MBZUAI(马斯喀特人工智能研究所) University of Zürich(苏黎世大学) The University of Melbourne(墨尔本大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于探测大语言模型内部状态的轻量级方法,用于多步骤推理验证,其性能超越了810倍大的Process Reward Models,为可扩展的测试时间扩展和更可 introspective 的大语言模型提供了新路径。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06428 2026-04-24 cs.LG 83%

BackPlay: Head-Only Look-Back Self-Correction for Diffusion Language Models

BackPlay:用于扩散语言模型的头部-only回溯自校正

Liming Liu, Binxuan Huang, Zixuan Zhang, Xin Liu, Bing Yin, Tuo Zhao

机构 * Amazon(亚马逊)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 BackPlay通过在冻结的生成器上训练轻量级校正头,改进多token解码下的生成质量,利用回溯校正机制减少错误积累。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21584 2026-04-24 cs.AI cs.CE cs.LG 81%

CoFEE: Reasoning Control for LLM-Based Feature Discovery

CoFEE:基于LLM的特征发现的推理控制

Maximilian Westermann, Ben Griffin, Aaron Ontoyin Yin, Zakari Salifu, Yagiz Ihlamur, Kelvin Amoaba, Joseph Ternasky, Fuat Alican, Yigit Ihlamur

机构 * University of Oxford(牛津大学) Vela Research(Vela研究) Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CoFEE框架,通过引入认知行为提升LLM特征发现的预测性和效率,实验显示其在预测性和成本控制上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24239 2026-04-24 cs.LG cs.AI 81%

ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models

ChessArena: 一个用于评估大语言模型战略推理能力的国际象棋测试平台

Jincheng Liu, Sijun He, Jingjing Wu, Xiangsen Wang, Yang Chen, Zhaoqi Kuang, Siqi Bao, Yuan Yao

机构 * State Key Laboratory of Novel Software Technology(新型软件技术国家重点实验室) Baidu(百度) University of Electronic Science and Technology of China(电子科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ChessArena测试平台,用于评估大语言模型的战略推理能力,测试了13个模型在800多局游戏中表现,发现无模型能击败业余水平的Maia-1100,但经过微调的Qwen3-8B模型表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20878 2026-04-24 cs.CL cs.CV cs.LG eess.IV 73%

AITP: Traffic Accident Responsibility Allocation via Multimodal Large Language Models

AITP:通过多模态大语言模型进行交通事故责任分配

Zijin Zhou, Songan Zhang

机构 * Global Institute of Future Technology(未来技术全球研究院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AITP模型,结合多模态链式推理和法律知识检索,解决交通事故责任分配问题,并构建DecaTARA基准测试集,验证模型在责任分配、事故检测和理解任务中的领先性能。

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理评测 20 篇

2604.10072 2026-04-24 cs.CL 81%

Reason Only When Needed: Efficient Generative Reward Modeling via Model-Internal Uncertainty

仅在必要时推理:通过模型内部不确定性实现高效的生成奖励建模

Chao Xue, Yao Wang, Mengqiao Liu, Di Liang, Xingsheng Han, Peiyang Liu, Xianjie Wu, Chenyao Lu, Lei Jiang, Yu Lu, Haibo Shi, Shuang Liang, Minlong Peng, Flora D. Salim

机构 * University of New South Wales(新南威尔士大学) Tencent Hunyuan(腾讯文言) Tencent Yuanbao(腾讯元宝) UESTC(电子科技大学) Peking University(北京大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出E-GRM框架,利用模型内部不确定性选择性触发推理,减少计算成本并提升答案准确性。

Comments accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20904 2026-04-24 cs.LG cs.AI 81%

Reinforcing privacy reasoning in LLMs via normative simulacra from fiction

通过小说中的规范仿像强化大语言模型的隐私推理

Matt Franchi, Madiha Zahrah Choksi, Harold Triedman, Helen Nissenbaum

机构 * Cornell Tech(康奈尔科技)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过从小说中提取规范仿像,结合监督学习和GRPO强化学习,提升大语言模型的隐私推理能力,验证了小说来源的规范仿像在现实领域中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15096 2026-04-24 cs.AI cs.LG 81%

OpenEstimate: Evaluating LLMs on Reasoning Under Uncertainty with Real-World Data

OpenEstimate:评估语言模型在不确定性下的推理能力实现实验

Alana Renda, Jillian Ross, Michael Cafarella, Jacob Andreas

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出OpenEstimate基准测试,用于评估语言模型在不确定环境下进行数值估计的能力,发现模型的先验概率常不准确且过度自信,但通过改进不确定性引导方式可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27820 2026-04-24 cs.CL 79%

Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning

通过反事实多智能体推理提升临床诊断

Zhiwen You, Xi Chen, Aniket Vashishtha, Simo Du, Gabriel Erion-Barner, Hongyuan Mei, Hao Peng, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Jacobi Medical Center, Albert Einstein College of Medicine(雅各布医疗中心,阿尔伯特·爱因斯坦学院) Department of Emergency Medicine, Beth Israel Deaconess Medical Center(贝斯以色列医疗中心急诊科) Leaning machines(Leanings machines)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种基于反事实推理的多智能体诊断框架,通过反事实案例编辑和反事实概率差距方法,提升诊断准确性与可解释性,尤其在复杂和模糊病例中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21461 2026-04-24 cs.CV cs.HC 78%

Do MLLMs Understand Pointing? Benchmarking and Enhancing Referential Reasoning in Egocentric Vision

多模态大语言模型理解指认吗?在自我中心视觉中的基准测试与增强指认推理

Chentao Li, Zirui Gao, Mingze Gao, Yinglian Ren, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Academy of Art & Design, Tsinghua University(清华大学艺术与设计学院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出EgoPoint-Bench基准测试,用于评估和提升自我中心视角下的多模态指认推理能力,通过11k高质量样本展示细调合成数据能显著提升性能和现实迁移能力。

Comments 20 pages, 14 figures. Committed to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08927 2026-04-24 cs.MA 78%

Beyond the Individual: Virtualizing Multi-Disciplinary Reasoning for Clinical Intake via Collaborative Agents

超越个体:通过协作代理虚拟化多学科推理以实现临床摄入

Huangwei Chen, Wu Li, Junhao Jia, Yining Chen, Xiaotao Pang, YaLong Chen, Gonghui Li, Haishuai Wang, Jiajun Bu, Lei Wu

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出Aegle框架,通过图基多代理架构在门诊咨询中实现多学科推理,提升文档质量和诊断准确性。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21229 2026-04-24 cs.CL cs.AI 62%

EngramaBench: Evaluating Long-Term Conversational Memory with Structured Graph Retrieval

EngramaBench:基于结构化图检索评估长期对话记忆

Julian Acuna

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EngramaBench基准测试,评估长期对话记忆系统在事实回忆、跨空间整合等任务中的表现,对比Engrama与GPT-4o和Mem0的性能差异。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20994 2026-04-24 cs.CR cs.AI cs.CL 62%

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

打破MCP:函数劫持攻击:函数调用和代理模型的新威胁

Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(三一学院都柏林) Imperial College London(帝国理工学院伦敦) ADAPT Research Centre(ADAPT研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的函数劫持攻击,通过操纵代理模型的工具选择过程,迫使调用特定攻击者选择的函数,展示了代理模型在函数调用接口上的新漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20983 2026-04-24 cs.CV cs.AI cs.CL 62%

Thinking Like a Botanist: Challenging Multimodal Language Models with Intent-Driven Chain-of-Inquiry

像植物学家一样思考:用意图驱动的连续询问挑战多模态语言模型

Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin, Hasan Muhammad Abdullah, Md. Mehedi Hasan, Mohammad Zabed Hossain, Shifat E. Arman

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) Department of Agronomy, Gazipur Agricultural University(加兹ipur农业大学作物学系) Department of Botany, University of Dhaka(达卡大学植物学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PlantInquiryVQA基准,通过结构化询问提升植物病害诊断准确性,揭示多步意图驱动的视觉推理方法,改进多模态模型的临床推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20850 2026-04-24 cs.IR cs.AI cs.CL 62%

Association Is Not Similarity: Learning Corpus-Specific Associations for Multi-Hop Retrieval

关联并非相似性:为多跳检索学习语料特定的关联

Jason Dury

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AAR方法,通过对比学习在嵌入空间中学习语料特定的关联关系,提升多跳检索的召回率,且无需评估集调优。

Comments 10 pages, 7 appendices, 10 tables. Code: https://github.com/EridosAI/AAR

详情

展开后加载摘要…

URL PDF HTML 收藏