arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-09 至 2026-04-09 共收录 102 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 22 篇

2604.06571 2026-04-09 cs.CL cs.AI cs.IR cs.LG 67%

LLM-based Schema-Guided Extraction and Validation of Missing-Person Intelligence from Heterogeneous Data Sources

基于大型语言模型的异构数据源中缺失人员情报提取与验证方案

Joshua Castillo, Ravi Mukkamala

机构 * Old Dominion University(欧道明大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Guardian Parser Pack,通过AI驱动的解析与规范化流程,将多源调查文档统一为符合模式的表示,提升缺失人员情报的提取与验证效率,同时展示系统架构及性能评估结果。

Comments 9 pages, 6 figures. Accepted at International Conference on Intelligent Digitization of Systems and Services (IDSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06603 2026-04-09 cs.CL cs.AI 62%

Scientific Knowledge-driven Decoding Constraints Improving the Reliability of LLMs

基于科学知识的解码约束:提升大语言模型的可靠性

Maotian Ma, Zheni Zeng, Zhenghao Liu, Yukun Yan

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Northeastern University(东北大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SciDC方法,通过整合领域知识与强约束提升LLM在科学任务中的可靠性,实验显示在工业配方设计、肿瘤诊断和逆合成规划中平均准确率提升12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06696 2026-04-09 cs.AI 57%

AgentGate: A Lightweight Structured Routing Engine for the Internet of Agents

AgentGate: 一种轻量级的结构化路由引擎用于物联网代理

Yujun Cheng, Enfang Cui, Hao Qin, Zhiyuan Liang, Qi Xu

机构 * School of Artificial Intelligence, University of Science and Technology Beijing(北京科技大学人工智能学院) China Telecom Research Institute(中国电信研究院) Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出AgentGate,一种轻量级结构化路由引擎,用于在资源受限条件下高效且隐私友好的代理系统,通过分阶段决策和结构化接地提升路由效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06280 2026-04-09 physics.med-ph cs.AI 57%

DosimeTron: Automating Personalized Monte Carlo Radiation Dosimetry in PET/CT with Agentic AI

DosimeTron:利用代理AI自动化PET/CT中的个性化蒙特卡洛辐射剂量学

Eleftherios Tzanis, Michail E. Klontzas, Antonios Tzortzakakis

机构 * Division of Radiology, Department for Clinical Science, Intervention and Technology (CLINTEC), Karolinska Institutet(卡罗林斯卡学院临床科学、干预与技术系放射学部门) Artificial Intelligence and Translational Imaging (ATI) Lab, Department of Radiology, School of Medicine, University of Crete(克里特大学医学院放射学系人工智能与转化影像实验室) Department of Nuclear Medicine and Medical Physics, Section Nuclear Medicine Huddinge, Karolinska University Hospital(卡罗林斯卡大学医院核医学与医学物理系胡丁厄核医学部门) Department of Nuclear Medicine and Medical Physics, Theranostics Trial Center, Karolinska University Hospital(卡罗林斯卡大学医院核医学与医学物理系治疗诊断试验中心) Computational Biomedicine Laboratory, Institute of Computer Science Foundation for Research and Technology Hellas (ICS - FORTH)(研究与技术基金会计算机科学研究所计算生物医学实验室)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DosimeTron,一种基于代理AI的系统,用于自动化PET/CT检查中的患者特定蒙特卡洛内部辐射剂量学,通过自然语言交互实现DICOM元数据提取、图像预处理、MC模拟、器官分割和剂量报告,验证了其在114例病例和22个器官上的高精度与临床可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06198 2026-04-09 cs.CY cs.AI 57%

Concentrated siting of AI data centers drives regional power-system stress under rising global compute demand

人工智能数据中心的集中布局在日益增长的全球计算需求下加剧了区域电力系统压力

Danbo Chen, Zijun Zhou, Yongyang Cai, Jiahong Qin, Ani Katchova, Lei Chen

机构 * The Ohio State University(俄亥俄州立大学) Meta Platforms Inc.(Meta平台公司) Zhejiang A&F University(浙江农林大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文研究了人工智能数据中心的集中布局对电力系统的影响,通过结合大语言模型分析和能源系统建模,预测了2025至2030年间AI数据中心的电力足迹,发现北美、西欧和亚太地区占90%以上计算能力,部分区域电网面临高压力。

Comments 32 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14735 2026-04-09 q-fin.CP cs.AI cs.CV 57%

PyFi: Toward Pyramid-like Financial Image Understanding for VLMs via Adversarial Agents

PyFi: 通过对抗代理实现金字塔式金融图像理解的愿景语言模型

Yuqun Zhang, Yuxuan Zhao, Sijia Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Yantai Research Institute, Harbin Engineering University(哈尔滨工程大学烟台研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 PyFi通过对抗代理生成的金字塔结构数据集,提升VLM在金融图像理解中的推理能力,实验显示模型在复杂金融问题上的准确率提升19.52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06376 2026-04-09 cs.CV 50%

MTA-Agent: An Open Recipe for Multimodal Deep Search Agents

MTA-Agent:多模态深度搜索代理的开放配方

Xiangyu Peng, Can Qin, An Yan, Xinyi Yang, Zeyuan Chen, Ran Xu, Chien-Sheng Wu

机构 * Salesforce AI Research(Salesforce 人工智能研究院)

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出MTA-Agent,通过构建高质量多跳视觉-语言训练数据,实现多模态深度搜索代理,其在六个基准测试中达到54.63%的平均准确率,优于其他模型,同时降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 3 篇

2604.06777 2026-04-09 cs.CV 82%

Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization

行走与言说:通过多模态代理策略优化弥合图像推理与行动之间的差距

Wenhao Yang, Yu Xia, Jinlong Huang, Shiyin Lu, Qing-Guo Chen, Zhao Xu, Weihua Luo, Kaifu Zhang, Yuchen Zhou, Xiaobo Xia, Yuanyu Wan, Lijun Zhang, Tat-Seng Chua

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) AI Business, Alibaba Group(阿里巴巴集团智能计算研究院) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University, China(上海交通大学自动化与智能感知学院) School of Intelligent Systems Engineering, Sun Yat-sen University, Shenzhen, China(中山大学智能工程学院(深圳)) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学技术学院) School of Software Technology, Zhejiang University, China(浙江大学软件学院) School of Computing, National University of Singapore, Singapore, Singapore(新加坡国立大学计算机学院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出MAPO方法,通过强制生成视觉内容的显式文本描述,结合语义对齐与任务奖励,提升多模态推理能力,实验表明其在多个视觉推理基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06725 2026-04-09 cs.CV 82%

Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning

通过主动3D场景探索增强MLLM空间理解以实现多视角推理

Jiahua Chen, Qihong Tang, Weinong Wang, Qi Fan

机构 * Tsinghua University(清华大学) Nanjing University(南京大学) Tencent(腾讯)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出一种无需训练的框架,通过显式3D重建机制提升MLLM的空间理解能力,通过主动探索生成新视角,优于专门空间模型和通用MLLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18100 2026-04-09 cs.CV 78%

Spatial-Conditioned Reasoning in Long-Egocentric Videos

长时自体视频中的空间条件推理

James Tribble, Hao Wang, Si-En Hong, Chaoyi Zhou, Ashish Bastola, Siyu Huang, Abolfazl Razi

机构 * Clemson University(克莱姆森大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文研究了在不修改模型架构的情况下,显式空间信号如何影响基于VLM的视频理解,通过引入Sanpo-D数据集和评估多个VLM在导航导向的空间查询上的表现,发现深度感知和空间化表示能提升安全关键任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 11 篇

2604.06347 2026-04-09 cs.CV 88%

Evidence-Based Actor-Verifier Reasoning for Echocardiographic Agents

基于证据的Actor-验证者推理用于超声波代理

Peng Huang, Yiming Wang, Yineng Chen, Liangqiao Gui, Hui Guo, Bo Peng, Shu Hu, Xi Wu, Tsao Connie, Hongtu Zhu, Balakrishnan Prabhakaran, Xin Wang

机构 * University at Albany, SUNY(纽约州立大学奥尔巴尼分校) Southwest Jiaotong University(西南交通大学) Purdue University(普渡大学) Chengdu University of Information Technology(成都信息工程大学) Harvard Medical School(哈佛医学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 测试时计算 :reasoning(title,abstract);verifier(title,abstract)

AI总结 本文提出EchoTrust框架,通过结构化中间表示和不同角色分析,提升超声波临床决策支持系统中推理的可靠性与可解释性。

Comments cvprw 2026(AIMS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06794 2026-04-09 cs.CL 85%

GCoT-Decoding: Unlocking Deep Reasoning Paths for Universal Question Answering

GCoT-Decoding:解锁通用问答中的深度推理路径

Guanran Luo, Wentao Qiu, Zhongquan Jian, Meihong Wang, Qingqiang Wu

机构 * School of Informatics, Xiamen University(厦门大学信息学院)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出GCoT-Decoding策略,结合Fibonacci采样和启发式错误回溯,生成候选解码路径并计算置信度,通过语义相似路径聚合获得共识答案,提升通用问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06389 2026-04-09 cs.AI 79%

SELFDOUBT: Uncertainty Quantification for Reasoning LLMs via the Hedge-to-Verify Ratio

SELFDOUBT:通过Hedge-to-Verify比率对推理大语言模型进行不确定性量化

Satwik Pandey, Suresh Raghu, Shashwat Pandey

机构 * Independent Researcher(独立研究员) Zillow Group(Zillow集团)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI

AI总结 SELFDOUBT是一种单次通过的不确定性框架,通过从推理轨迹中提取行为信号解决推理大语言模型的不确定性量化问题,其核心信号Hedge-to-Verify比率能检测推理轨迹中的不确定性标记及自我检查行为,适用于任何私有API的部署。

Comments 9 pages, 4 figures, 4 tables, plus appendix. Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22025 2026-04-09 cs.AI cs.CL cs.CV 73%

UI-AGILE: Advancing GUI Agents with Effective Reinforcement Learning and Precise Inference-Time Grounding

UI-AGILE: 通过有效的强化学习和精确的推理时间接地提升GUI代理

Shuquan Lian, Yuhang Wu, Jia Ma, Yifan Ding, Zihan Song, Bingqi Chen, Xiawu Zheng, Hui Li, Rongrong Ji

机构 * Sino-Russian Research Center for Digital Economy(中俄数字经济研究中心)

专题命中 测试时计算 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 UI-AGILE通过改进监督微调过程和推理中的分解接地,提升了GUI代理的接地性能和通用能力,在ScreenSpot-Pro和ScreenSpot-v2基准上实现了最佳表现,地面准确率提升23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06753 2026-04-09 cs.CL 70%

Select-then-Solve: Paradigm Routing as Inference-Time Optimization for LLM Agents

选择后再解决:作为大语言模型代理推理时间优化的范式路由

Heng Zhou, Zelin Tan, Zhemeng Zhang, Yutao Fan, Yibing Lin, Li Kang, Xiufeng Song, Rui Li, Songtao Huang, Ao Yu, Yuchen Fan, Yanxu Chen, Kaixin Xu, Xiaohong Liu, Yiran Qin, Philip Torr, Chen Zhang, Zhenfei Yin

专题命中 测试时计算 :reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 研究通过比较六种推理范式在四个前沿LLM和十个基准上的表现,发现推理结构对任务效果有显著影响,提出选择后再解决方法通过轻量级嵌入路由提升任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06728 2026-04-09 cs.CV cs.AI cs.MM 57%

URMF: Uncertainty-aware Robust Multimodal Fusion for Multimodal Sarcasm Detection

URMF:面向多模态讽刺检测的不确定性感知鲁棒多模态融合

Zhenyu Wang, Weichen Cheng, Weijia Li, Junjie Mou, Zongyou Zhao, Guoying Zhang

机构 * School of Artificial Intelligence, China University of Mining and Technology-Beijing(中国矿业大学(北京)人工智能学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出URMF框架,通过建模模态可靠性提升多模态讽刺检测的准确性和鲁棒性,采用多头交叉注意力和自注意力机制,并结合不确定性建模和联合训练目标,在公开基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06385 2026-04-09 cs.CL 57%

Application-Driven Pedagogical Knowledge Optimization of Open-Source LLMs via Reinforcement Learning and Supervised Fine-Tuning

通过强化学习和监督微调驱动的开源大语言模型教学知识优化

Navan Preet Singh, Xiaokun Wang, Anurag Garikipati, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * East China Normal University, Shanghai, China(华东师范大学) Incept Labs, Houston, TX(Incept Labs)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出结合强化学习和监督微调的多阶段优化策略,通过EduQwen 32B-RL1、EduQwen 32B-SFT及EduQwen 32B-SFT-RL2等模型,提升大语言模型的教学知识能力,实现跨领域教学知识基准的新状态-of-the-art结果。

Comments * These authors contributed equally to this work and share first authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06240 2026-04-09 cs.CR cs.AI cs.MA 57%

The Art of Building Verifiers for Computer Use Agents

构建计算机使用代理验证器的艺术

Corby Rosset, Pratyusha Sharma, Andrew Zhao, Miguel Gonzalez-Fernandez, Ahmed Awadallah

机构 * Microsoft Research(微软研究院) Browserbase

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 本文提出通用验证器,通过四个原则减少噪声、分离奖励信号、区分可控不可控失败、并采用分治上下文管理,提升验证可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22396 2026-04-09 cs.CV cs.AI 57%

Asking like Socrates: Socrates helps VLMs understand remote sensing images

像苏格拉底提问:苏格拉底帮助VLMs理解遥感图像

Run Shao, Ziyu Li, Zhaoyang Zhang, Linrui Xu, Xinran He, Hongyuan Yuan, Bolei He, Yongxing Dai, Yiming Yan, Yijun Chen, Wang Guo, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Baidu Inc.(百度公司) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RS-EoT方法,通过迭代视觉证据寻求机制和两阶段强化学习策略,解决遥感图像中伪推理问题,提升视觉证据基础的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06849 2026-04-09 cs.CV 50%

Vision-Language Model-Guided Deep Unrolling Enables Personalized, Fast MRI

基于视觉-语言模型的深度展开实现个性化快速MRI

Fangmao Ju, Yuzhu He, Zhiwen Xue, Chunfeng Lian, Jianhua Ma

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出PASS框架,利用视觉-语言模型指导深度展开网络,实现任务导向的快速成像,通过动态个性化成像流程提升MRI图像质量及诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19433 2026-04-09 cs.CV 50%

dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

dMLLM-TTS:用于扩散多模态大语言模型的自验证和高效测试时间扩展

Yi Xin, Siqi Luo, Tianxiang Xu, Qi Qin, Haoxing Chen, Kaiwen Zhu, Zhiwei Zhang, Yangfan He, Rongchao Zhang, Jinbin Bai, Shuo Cao, Bin Fu, Junjun He, Yihao Liu, Yuewen Cao, Xiaohong Liu

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :verifier(abstract)

AI总结 本文提出dMLLM-TTS框架,通过轨迹探索扩展和迭代细化扩展两个互补的扩展轴,提升生成多样性和稳定性,同时通过自验证机制提高效率,实验表明在GenEval基准上生成质量显著提升且效率提高6倍。

Comments Project page: https://github.com/Alpha-VLLM/Lumina-DiMOO

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 12 篇

2604.06787 2026-04-09 cs.CL 85%

When Is Thinking Enough? Early Exit via Sufficiency Assessment for Efficient Reasoning

思考何时足够?通过充分性评估实现高效的推理早期退出

Yang Xiang, Yixin Ji, Ruotao Xu, Dan Qiao, Zheming Yang, Juntao Li, Min Zhang

机构 * Soochow University(苏州大学) ByteDance(字节跳动)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出DTSR框架,通过动态评估推理链的充分性,实现早期退出,减少计算冗余,提升推理效率。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06834 2026-04-09 cs.CL cs.AI 84%

On the Step Length Confounding in LLM Reasoning Data Selection

在LLM推理数据选择中的步长混淆问题

Bing Wang, Rui Miao, Chen Shen, Shaotian Yan, Kaiyuan Liu, Ximing Li, Xiaosong Yuan, Sinan Fan, Jun Zhang, Jieping Ye

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering, MoE, Jilin University(吉林大学符号计算与知识工程教育部重点实验室) Alibaba Cloud Computing(阿里云) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Department of Mathematics, University of Michigan(密歇根大学数学系) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能研究中心)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文分析了自然性基于的数据选择方法在LLM推理数据中系统性偏好长推理步骤的问题,并提出ASLEC-DROP和ASLEC-CASL方法以缓解此混淆。

Comments Accepted by Findings of ACL 2026. 15 pages, 9 figures. Code: https://github.com/wangbing1416/ASLEC

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07079 2026-04-09 cs.IR 82%

MARVEL: Multimodal Adaptive Reasoning-intensiVe Expand-rerank and retrievaL

MARVEL:多模态自适应推理-增强扩展-排序和检索

Mahmoud SalahEldin Kasem, Mohamed Mahmoud, Mostafa Farouk Senussi, Mahmoud Abdalla, Abdelrahman Abdallah, Hyun-Soo Kang

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出MARVEL框架,通过统一的扩展-检索-排序流程,结合LLM驱动的查询扩展、增强推理的密集检索器和基于GPT-4o的逐步推理排序,提升了多模态检索性能,在MM-BRIGHT基准上实现了37.9nDCG@10的高分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06685 2026-04-09 cs.CL cs.AI 81%

ChemVLR: Prioritizing Reasoning in Perception for Chemical Vision-Language Understanding

ChemVLR:在化学视觉语言理解中优先考虑推理

Xuanle Zhao, Xinyuan Cai, Xiang Cheng, Xiuyi Chen, Bo Xu

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ChemVLR通过细化化学描述符识别,提升化学视觉语言模型的推理能力,实现更清晰的推理路径,实验显示其在分子和反应任务中达到SOTA性能。

Comments Accepted by ACL 2026 Findings, Preprint Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06824 2026-04-09 cs.CV 78%

Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning

生成、分析与优化:基于MLLM元推理的无训练声源定位

Subin Park, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出无训练的声源定位框架,利用多模态大语言模型的推理能力,通过生成-分析-优化流程实现声源定位,实验表明在单源和多源基准上表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21540 2026-04-09 cs.CR cs.CV 78%

PRISM: Programmatic Reasoning with Image Sequence Manipulation for LVLM Jailbreaking

PRISM:基于图像序列操作的程序化推理用于LVLM劫持

Quanchen Zou, Zonghao Ying, Moyang Chen, Wenzhuo Xu, Yisong Xiao, Yakai Li, Deyue Zhang, Dongdong Yang, Zhao Liu, Xiangzheng Zhang

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出PRISM框架,通过分解有害指令为多个无害视觉组件,利用模型推理过程生成有害输出,有效提升LVLM劫持成功率。

Comments This version is withdrawn to consolidate the submission under the corresponding author's primary account. The most recent and maintained version of this work can be found at arXiv:2603.09246

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01986 2026-04-09 cs.CV cs.AI 70%

Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing

Draw-In-Mind: 在统一多模态模型中重新平衡设计师-画家角色有助于图像编辑

Ziyun Zeng, David Junhao Zhang, Wei Li, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab) TikTok

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出Draw-In-Mind模型,通过重新分配设计职责提升图像编辑性能,展示了在统一多模态模型中平衡理解与生成模块的重要性。

Comments ICLR 2026 Camera Ready Version; Add more discussions and fix typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06699 2026-04-09 cs.CL cs.LG 62%

Adaptive Prompt Structure Factorization: A Framework for Self-Discovering and Optimizing Compositional Prompt Programs

自适应提示结构分解:一种自我发现和优化组合提示程序的框架

Haoyue Liu, Zhichao Wang, Yongxin Guo, Haoran Shou, Xiaoying Tang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Taobao and Tmall Group(淘宝天猫集团)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出aPSF框架,通过语义因素发现和单因素更新优化提示程序,提升大语言模型的推理可靠性,实验显示在多个基准上准确率提升2.16个百分点,优化成本降低45-87%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06650 2026-04-09 cs.CL cs.AI 62%

A Parameter-Efficient Transfer Learning Approach through Multitask Prompt Distillation and Decomposition for Clinical NLP

一种通过多任务提示蒸馏与分解的参数高效迁移学习方法用于临床NLP

Cheng Peng, Mengxian Lyu, Ziyi Chen, Yonghui Wu

机构 * Department of Health Outcomes and Biomedical Informatics, College of Medicine, University of Florida(佛罗里达大学医学院健康结果与生物医学信息学系) Cancer Informatics Shared Resource, University of Florida Health Cancer Center(佛罗里达大学健康癌症中心癌症信息学共享资源)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出多任务提示蒸馏与分解框架,通过学习共享元提示在临床NLP任务中实现高效迁移,参数更少且性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏