arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-26 至 2026-03-26 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 22 篇

2603.23067 2026-03-26 cs.CV 89%

MLLM-HWSI: A Multimodal Large Language Model for Hierarchical Whole Slide Image Understanding

MLLM-HWSI: 一种用于分层全滑动图像理解的多模态大语言模型

Basit Alawode, Arif Mahmood, Muaz Khalifa Al-Radi, Shahad Albastaki, Asim Khan, Muhammad Bilal, Moshira Ali Abdalla, Mohammed Bennamoun, Sajid Javed

机构 * Department of Computer Science, Khalifa University of Science and Technology(卡利法科技大学计算机科学系) Information Technology University(信息技术大学) KAU(卡乌大学) University of the Western Australia(西澳大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出MLLM-HWSI,一种分层全滑动图像级多模态大语言模型,通过四级尺度对齐视觉特征与病理语言,提升解释性证据接地推理能力,在六个CPath任务上取得新SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16917 2026-03-26 cs.AI cs.CL cs.LG 88%

Generative Adversarial Reasoner: Enhancing LLM Reasoning with Adversarial Reinforcement Learning

生成对抗推理器:通过对抗性强化学习增强大语言模型推理

Qihao Liu, Luoxin Ye, Wufei Ma, Yu-Cheng Chou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出生成对抗推理器,通过对抗性强化学习联合训练LLM推理器和判别器,提升推理质量与准确性。

Comments Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24382 2026-03-26 cs.LG cs.AI cs.CE 86%

MolEvolve: LLM-Guided Evolutionary Search for Interpretable Molecular Optimization

MolEvolve: 基于大语言模型的可解释分子优化进化搜索

Xiangsen Chen, Ruilong Wu, Yanyan Lan, Ting Ma, Yang Liu

机构 * Hong Kong University of Science(香港科技大学) Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MolEvolve通过大语言模型引导进化搜索,实现可解释的分子优化,优于传统方法在属性预测和分子优化任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04607 2026-03-26 cs.OS cs.AI cs.LG 86%

From Imperative to Declarative: Towards LLM-friendly OS Interfaces for Boosted Computer-Use Agents

从命令式到声明式:面向提升计算机使用代理的LLM友好操作系统接口

Yuan Wang, Mingyu Li, Haibo Chen

机构 * Key Laboratory of System Software (Chinese Academy of Sciences)(中国科学院系统软件重点实验室) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Shanghai Jiao Tong University(上海交通大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Declarative Model Interface (DMI),通过将传统GUI转化为三种声明式原语,提升LLM驱动的计算机使用代理的任务成功率和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23909 2026-03-26 cs.AI 85%

DUPLEX: Agentic Dual-System Planning via LLM-Driven Information Extraction

DUPLEX:基于LLM驱动信息提取的代理双系统规划

Keru Hua, Ding Wang, Yaoying Gu, Xiaoguang Ma

机构 * Midea Corporate Research Center(美的集团研发中心) Midea Group(美的集团) Northeastern University(东北大学) Engineering Department(工程部)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DUPLEX通过限制LLM进行结构化语义 grounding,结合符号规划器实现可靠规划,优于现有端到端和混合LLM基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24030 2026-03-26 cs.CV cs.MM 85%

Decompose and Transfer: CoT-Prompting Enhanced Alignment for Open-Vocabulary Temporal Action Detection

分解与迁移:基于CoT提示的对齐增强开放词汇时序动作检测

Sa Zhu, Wanqian Zhang, Lin Wang, Xiaohua Chen, Chenxu Cui, Jinchao Zhang, Bo Li

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) Hangzhou Dianzi University(杭州电子科技大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 推理与问题求解 :prompting(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出PDA框架,通过CoT提示语义分解和适应性相位对齐,提升开放词汇时序动作检测的跨类别迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24065 2026-03-26 cs.AI 81%

Enhanced Mycelium of Thought (EMoT): A Bio-Inspired Hierarchical Reasoning Architecture with Strategic Dormancy and Mnemonic Encoding

增强思维菌丝(EMoT):一种受生物启发的分层推理架构,具有战略休眠和记忆编码

Florian Odi Stummer

机构 * Institute of General Medicine(医学系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 EMoT是一种受生物启发的分层推理架构,通过四层结构(微、中、宏、元)实现战略休眠与激活,结合记忆宫殿和五种记忆编码方式,提升多领域复杂问题解决能力,但存在样本量小、计算成本高等限制。

Comments 32 pages, 6 figures, 15 tables; includes ablation studies and reasoning trace visualisation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15259 2026-03-26 cs.AI 77%

SAG-Agent: Enabling Long-Horizon Reasoning in Strategy Games via Dynamic Knowledge Graphs

SAG-Agent:通过动态知识图谱实现策略游戏中长周期推理

Chenwei Tang, Lin Long, Xinyu Liu, Jingyu Xing, Zizhou Wang, Joey Tianyi Zhou, Jiawei Du, Liangli Zhen, Jiancheng Lv

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education(教育部机器学习与工业智能工程研究中心) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR)高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR)前沿人工智能研究中心)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SAG-Agent通过构建持久化的状态-动作图,解决无API环境下自主代理的效率瓶颈,提升探索效率和战略深度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16371 2026-03-26 cs.CV 75%

Anchored Video Generation: Decoupling Scene Construction and Temporal Synthesis in Text-to-Video Diffusion Models

锚定视频生成:解耦场景构建与时间合成在文本到视频扩散模型中

Mariam Hassan, Bastien Van Delft, Wuyang Li, Alexandre Alahi

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出锚定视频生成方法,通过解耦场景构建与时间合成任务,提升文本到视频扩散模型在复杂场景生成和时间逻辑遵循上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23577 2026-03-26 cs.LG cs.CL cs.CY 73%

The Geometric Price of Discrete Logic: Context-driven Manifold Dynamics of Number Representations

离散逻辑的几何价格:数表示的上下文驱动流形动力学

Long Zhang, Dai-jun Lin, Wei-neng Chen

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究通过分析语言模型中的流形动力学,揭示了离散逻辑形成所需的拓扑变形成本,提出了一种双调控机制以解释语义分类和逻辑边界生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24558 2026-03-26 cs.CV cs.AI 70%

LensWalk: Agentic Video Understanding by Planning How You See in Videos

LensWalk: 通过规划如何在视频中观看实现代理视频理解

Keliang Li, Yansong Li, Hongze Shen, Mengdi Liu, Hong Chang, Shiguang Shan

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peng Cheng Laboratory(鹏城实验室) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LensWalk通过建立紧密的推理-计划-观察循环,使大语言模型能够主动控制视觉观察,提升视频理解的准确性和鲁棒性。

Comments To be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24004 2026-03-26 cs.CL 70%

Thinking with Tables: Enhancing Multi-Modal Tabular Understanding via Neuro-Symbolic Reasoning

基于表格的思考:通过神经符号推理增强多模态表格理解

Kun-Yang Yu, Zhi Zhou, Shi-Yu Tian, Xiao-Wen Yang, Zi-Yi Jia, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学,中国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TWT框架,通过神经符号推理解决表格数据结构多样性、特征依赖复杂性及任务异质性问题,在八个数据集上验证了其在多模态表格理解任务中的优越性能。

Comments 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23554 2026-03-26 cs.IR cs.AI 70%

Mixture of Demonstrations for Textual Graph Understanding and Question Answering

演示混合用于文本图理解与问答

Yukun Wu, Lihui Liu

机构 * Independent Researcher, Wayne State University(韦恩州立大学独立研究者) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗克琴court研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MixDemo框架,通过MoE机制选择信息丰富的演示,结合查询特定图编码器减少噪声,提升文本图问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22460 2026-03-26 cs.AI 70%

GeoSketch: A Neural-Symbolic Approach to Geometric Multimodal Reasoning with Auxiliary Line Construction and Affine Transformation

GeoSketch: 一种基于神经符号的方法,用于几何多模态推理中的辅助线构造与仿射变换

Shichao Weng, Zhiqiang Wang, Yuhua Zhou, Rui Lu, Ting Liu, Zhiyang Teng, Xiaozhang Liu, Hanmeng Liu

机构 * Fudan University(复旦大学) IFLYTEK CO.LTD(若lytek有限公司) Zhejiang University(浙江大学) The Hong Kong University of Science and Technology(香港科学与技术大学) National University of Defense Technology(国防科技大学) Hainan University(海南大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GeoSketch通过整合感知、符号推理和绘图动作模块,实现动态几何推理,提升多模态推理的准确性和解决问题的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23802 2026-03-26 cs.CY 67%

How are AI agents used? Evidence from 177,000 MCP tools

AI代理是如何被使用的?来自177,436个MCP工具的证据

Merlin Stein

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究通过分析177,436个MCP工具,发现AI代理主要用于软件开发,其中67%为软件开发工具,90%的MCP服务器下载量来自此领域。行动工具占比从27%上升至65%,涵盖中等和高风险任务,如金融交易。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24014 2026-03-26 cs.AI 57%

Language-Grounded Multi-Agent Planning for Personalized and Fair Participatory Urban Sensing

基于语言的多智能体规划用于个性化和公平的参与式城市传感

Xusen Guo, Mingxing Peng, Hongliang Lu, Hai Yang, Jun Ma, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出MAPUS框架,通过语言协商实现个性化和公平的参与式城市传感,提升参与度和可持续性。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23676 2026-03-26 cs.AI cs.RO 57%

Grounding Vision and Language to 3D Masks for Long-Horizon Box Rearrangement

将视觉与语言接地于3D遮罩以实现长周期箱子整理

Ashish Malik, Caleb Lowe, Aayam Shrestha, Stefan Lee, Fuxin Li, Alan Fern

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出RAMP-3D模型,通过3D遮罩的序列预测实现长周期3D箱子整理任务,优于2D VLM基线,证明基于遮罩的反应策略在长周期规划中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24376 2026-03-26 cs.CV 50%

GeoRouter: Dynamic Paradigm Routing for Worldwide Image Geolocalization

GeoRouter:面向全球图像地理定位的动态路由范式

Pengyue Jia, Derong Xu, Yingyi Zhang, Xiaopeng Li, Wenlin Zhang, Yi Wen, Yuanshao Zhu, Xiangyu Zhao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出GeoRouter动态路由框架,通过分析视觉内容并结合距离感知偏好目标,优化图像地理定位任务,实验表明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24181 2026-03-26 cs.CV 50%

Unlocking Few-Shot Capabilities in LVLMs via Prompt Conditioning and Head Selection

通过提示条件和头部选择解锁LVLMs的少样本能力

Adhemar de Senneville, Xavier Bou, Jérémy Anger, Rafael Grompone, Gabriele Facciolo

机构 * Université Paris-Saclay, CNRS, ENS Paris-Saclay, Centre Borelli(巴黎萨克雷大学、国家科学研究中心、巴黎萨克雷高等师范学院、Borelli中心) École Polytechnique, AMIAD(巴黎高等理工学院、AMIAD) Institut Universitaire de France(法国高等科学研究院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出Head Ensemble Classifiers (HEC)通过提示条件和头部选择提升LVLMs在少样本和零样本分类中的性能,实现与CLIP基方法的性能平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08462 2026-03-26 cs.CR cs.PL cs.SE 50%

QLCoder: A Query Synthesizer For Static Analysis of Security Vulnerabilities

QLCoder:一种用于静态分析安全漏洞的查询生成器

Claire Wang, Ziyang Li, Saikat Dutta, Mayur Naik

专题命中 推理与问题求解 :LLM(abstract)

AI总结 QLCoder通过结合LLM与执行反馈,利用MCP接口生成有效的安全查询,有效检测漏洞。在111个Java项目中,53.4%的CVE被正确识别,优于仅使用Claude Code的10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24057 2026-03-26 cs.CV 50%

Beyond Semantic Priors: Mitigating Optimization Collapse for Generalizable Visual Forensics

超越语义先验:缓解可泛化视觉取证中的优化崩溃

Jipeng Liu, Haichao Shi, Siyu Xing, Rong Yin, Xiao-Yu Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(信息工程研究所,中国科学院) School of Cyber Science and Technology, Beihang University(北京航空航天大学信息与科学学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出CoRIT模型,通过对比梯度代理和三种无训练策略缓解优化崩溃,提升跨领域和通用伪造检测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23855 2026-03-26 cs.HC 50%

General Intellectual Humility Is Malleable Through AI-Mediated Reflective Dialogue

一般智力谦虚性可通过AI介导的反思对话进行改变

Mohammad Ratul Mahjabin, Raiyan Abdul Baten

专题命中 推理与问题求解 :LLM(abstract)

AI总结 研究通过AI介导的反思对话提升一般智力谦虚性,发现其可产生持久变化,且不受政治立场和初始人格特征影响。

详情

展开后加载摘要…

URL PDF HTML 收藏