arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-19 至 2026-03-19 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 15 篇

2603.17199 2026-03-19 cs.LG cs.AI cs.CL 89%

Catching rationalization in the act: detecting motivated reasoning before and after CoT via activation probing

在行动中捕捉理性化:通过激活探测检测推理前后的动机推理

Parsa Mirtaheri, Mikhail Belkin

机构 * UC San Diego(加州大学圣迭戈分校)

专题命中 其他推理 :reasoning(title,abstract);CoT(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过激活探测检测LLM在Cot中的动机推理现象,证明内部表示比CoT监控更可靠,且预生成探测能早期发现动机行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17360 2026-03-19 cs.CV 88%

MCoT-MVS: Multi-level Vision Selection by Multi-modal Chain-of-Thought Reasoning for Composed Image Retrieval

MCoT-MVS:基于多模态链式推理的多级视觉选择用于组合图像检索

Xuri Ge, Chunhao Wang, Xindi Wang, Zheyun Qin, Zhumin Chen, Xin Xin

机构 * Shandong University(山东大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract)

AI总结 本文提出MCoT-MVS方法,通过多模态链式推理提取参考图像的多级视觉特征,结合注意力机制与文本提示,提升组合图像检索的准确性和鲁棒性。

Comments Accepted by The Web Conference 2026 (WWW2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16928 2026-03-19 cs.CR cs.LG 85%

Noticing the Watcher: LLM Agents Can Infer CoT Monitoring from Blocking Feedback

察觉观察者:LLM代理可通过阻塞反馈推断CoT监控

Thomas Jiralerspong, Flemming Kondrup, Yoshua Bengio

机构 * Mila Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) LawZero

专题命中 其他推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 研究探讨LLM代理是否能自主推断其内部推理被监控,并在无显式训练的情况下产生逃避策略,发现高能力模型能通过阻塞反馈推断监控存在,但无法有效执行逃避意图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14045 2026-03-19 cs.IR cs.CL 85%

The Reasoning Bottleneck in Graph-RAG: Structured Prompting and Context Compression for Multi-Hop QA

图式推理瓶颈:用于多跳问答的结构化提示与上下文压缩

Yasaman Zarrinkia, Venkatesh Srinivasan, Alex Thomo

机构 * University of Victoria(维多利亚大学) Santa Clara University(圣克拉拉大学)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 图式推理瓶颈:本文提出结构化提示和上下文压缩方法,通过SPARQL链式思考提示和图遍历压缩提升多跳问答准确性,验证其在不同Graph-RAG系统中的有效性。

Comments 11 pages, 2 figures, 9 tables; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09233 2026-03-19 cs.LG cs.AI cs.CL 67%

GIFT: Reconciling Post-Training Objectives via Finite-Temperature Gibbs Initialization

GIFT:通过有限温度吉布斯初始化调和后训练目标

Zhengyang Zhao, Lu Ma, Yizhen Jiang, Xiaochen Ma, Zimo Meng, Chengyu Shen, Lexiang Tang, Haoze Sun, Peng Pei, Wentao Zhang

机构 * Peking University(北京大学) Meituan(美团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GIFT方法,通过将监督视为有限温度能量势,解决后训练阶段目标不一致问题,实验表明其在强化学习初始化中优于传统SFT及其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17891 2026-03-19 cs.LG cs.AI 62%

RAMP: Reinforcement Adaptive Mixed Precision Quantization for Efficient On Device LLM Inference

RAMP:强化适应混合精度量化用于高效设备端LLM推理

Arpit Singh Gautam, Saurabh Jha

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RAMP通过强化学习动态调整各层位宽,优化精度与效率平衡,在LLaMA 2 7B上实现更小模型体积和更高推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17692 2026-03-19 cs.LG cs.AI q-fin.CP q-fin.PM 62%

Can Blindfolded LLMs Still Trade? An Anonymization-First Framework for Portfolio Optimization

盲folded LLMs仍能进行交易吗?一个以匿名化优先的资产组合优化框架

Joohyoung Jeon, Hongchul Lee

机构 * Korea University(韩国大学) Mirae Asset Securities(美亚证券)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种以匿名化为核心的资产组合优化框架,通过盲fold LLMs来验证市场信号的合法性,实验显示在2025年期间实现了1.40的夏普比率,并通过负控实验验证信号的有效性。

Comments Accepted at the ICLR 2026 Workshop on Advances in Financial AI (FinAI). 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16889 2026-03-19 cs.CL cs.AI cs.SD eess.AS 62%

Rubric-Guided Fine-tuning of SpeechLLMs for Multi-Aspect, Multi-Rater L2 Reading-Speech Assessment

基于评分标准的语音大模型多维度多评分者二语阅读语音评估

Aditya Kamlesh Parikh, Cristian Tejedor-Garcia, Catia Cucchiarini, Helmer Strik

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于评分标准的语音大模型微调方法,通过多维度评分标准和不确定性校准,提升二语阅读语音评估的可靠性与可解释性。

Comments Accepted to LREC 2026. This publication is part of the project Responsible AI for Voice Diagnostics (RAIVD) with file number NGF.1607.22.013 of the research programme NGF AiNed Fellowship Grants, which is financed by the Dutch Research Council (NWO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21852 2026-03-19 cs.LG cs.AI 62%

A Comedy of Estimators: On KL Regularization in RL Training of LLMs

估计器的喜剧:关于在LLM训练中的KL正则化

Vedant Shah, Johan Obando-Ceron, Vineet Jain, Brian Bartoldson, Bhavya Kailkhura, Sarthak Mittal, Glen Berseth, Pablo Samuel Castro, Yoshua Bengio, Nikolay Malkin, Moksh Jain, Siddarth Venkatraman, Aaron Courville

机构 * McGill University(麦吉尔大学) LawZero(法零) LLNL(劳伦斯利弗莫尔国家实验室) University of Edinburgh(爱丁堡大学) CIFAR AI Chair(CIFAR人工智能主席) CIFAR Fellow

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在LLM训练中使用KL正则化的估计器方法,分析了不同配置对训练稳定性及下游性能的影响,发现偏导数估计器可能导致训练不稳定,而无偏导数估计器能提升模型在领域内外任务的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17613 2026-03-19 cs.CL cs.PL 57%

VeriAgent: A Tool-Integrated Multi-Agent System with Evolving Memory for PPA-Aware RTL Code Generation

VeriAgent:一种集成工具的多智能体系统,具有进化记忆,用于PPA感知的RTL代码生成

Yaoxiang Wang, Qi Shi, ShangZhan Li, Qingguo Hu, Xinyu Yin, Bo Guo, Xu Han, Maosong Sun, Jinsong Su

机构 * Xiamen University(厦门大学) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一种集成EDA工具的多智能体框架,用于高质量Verilog代码生成,通过进化记忆机制实现功能正确性和PPA指标的联合优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17311 2026-03-19 cs.CL 57%

Ruyi2.5 Technical Report

Ruyi2.5 技术报告

Huan Song, Shuyu Tian, Qingfei Zhao, Wenhao Hong, Jiang Liu, Ting Long, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Ruyi2.5基于AI Flow框架构建多模态家族模型,通过共享主干架构实现多尺度模型协同训练,提升部署层级语义一致性,同时提出隐私保护摄像头系统及BPPO算法加速强化学习微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25693 2026-03-19 cs.AI 57%

ScheduleMe: Multi-Agent Calendar Assistant

ScheduleMe: 多智能体日历助手

Oshadha Wijerathne, Amandi Nimasha, Dushan Fernando, Nisansa de Silva, Srinath Perera

机构 * Department of Computer Science & Engineering, University of Moratuwa(moratuwa大学计算机科学与工程系) WSO2 LLC(WSO2公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ScheduleMe,一种多智能体日历助手,通过自然语言帮助用户管理Google日历事件。系统采用图结构协调机制,通过中央监督代理和专用任务代理实现模块化、冲突解决和上下文感知交互。

Comments Published at PACLIC 2025 https://aclanthology.org/2025.paclic-1.27/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17895 2026-03-19 cs.CV 50%

A Creative Agent is Worth a 64-Token Template

一个创意代理值得一个64-token模板

Ruixiao Shi, Fu Feng, Yucheng Xie, Xu Yang, Jing Wang, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(1 南京大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(2 教育部新一代人工智能技术及其跨学科应用关键实验室(东南大学))

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出CAT框架,通过创意令牌化提升文本到图像生成的创造力,实现3.7倍速度提升和4.8倍计算成本降低,生成图像更受人类偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14827 2026-03-19 cs.CV 50%

SemanticFace: Semantic Facial Action Estimation via Semantic Distillation in Interpretable Space

SemanticFace: 通过可解释空间中的语义蒸馏进行语义面部动作估计

Zejian Kang, Kai Zheng, Yuanchen Fei, Wentao Yang, Hongyuan Zou, Xiangru Huang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Hunan University(湖南大学) The University of Hong Kong(香港大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 SemanticFace通过语义蒸馏在可解释空间中估计面部动作,提升系数精度和可解释性,实现跨身份泛化和抗域移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17043 2026-03-19 cs.CV 50%

OpenQlaw: An Agentic AI Assistant for Analysis of 2D Quantum Materials

OpenQlaw: 一种用于二维量子材料分析的代理AI助手

Sankalp Pandey, Xuan-Bac Nguyen, Hoang-Quan Nguyen, Tim Faltermeier, Nicholas Borys, Hugh Churchill, Khoa Luu

机构 * Quantum AI Lab, University of Arkansas, USA(量子人工智能实验室,美国亚拉巴马大学) University of Utah, USA(美国犹他大学) Department of Physics, University of Arkansas, USA(美国亚拉巴马大学物理系) MonARK NSF Quantum Foundry(MonARK NSF 量子熔炉)

专题命中 其他推理 :reasoning(abstract)

AI总结 OpenQlaw通过整合NanoBot和QuPAINT,实现二维材料分析中的动态推理与可视化,提升科研人员在高通量器件制造中的效率。

详情

展开后加载摘要…

URL PDF HTML 收藏