arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-13 至 2026-05-13 共收录 161 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 20 篇

2605.11613 2026-05-13 cs.LG cs.AI 62%

From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation

从通用相关性到输入特定的信用在在线自我蒸馏中

Guobin Shen, Lei Huang, Xiang Cheng, Chenxiao Zhao, Jindong Li, Dongcheng Zhao, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究在线自我蒸馏中奖励的测量与信用分配,提出CREDIT方法通过对比学习分离输入特定成分,提升模型在多个基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12426 2026-05-13 cs.CL 57%

Geometric Factual Recall in Transformers

变换器中的几何事实回忆

Shauli Ravfogel, Gilad Yehudai, Joan Bruna, Alberto Bietti

机构 * New York University(纽约大学) Flatiron Institute(Flatiron研究所)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL

AI总结 研究探讨了变换器模型如何通过几何方式记忆事实关联,证明嵌入维度与事实数量呈对数关系,并展示了多跳查询中的容量-深度权衡。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12398 2026-05-13 cs.CL cs.IR 57%

Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring

通过答案可信度评分估计问题难度

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Q-DAPS方法,通过计算候选答案可信度的熵来估计问题难度,在四个数据集上表现优异,具有可解释性和鲁棒性。

Comments Accepted at ACL 2026

Journal ref Proceedings of the 64rd Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12120 2026-05-13 cs.AI 57%

To Whom Do Language Models Align? Measuring Principal Hierarchies Under High-Stakes Competing Demands

语言模型对谁进行对齐?在高风险竞争需求下测量主导层级

Fangyi Yu, Nabeel Seedat, Jonathan Richard Schwarz, Andrew M. Bean

机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) University of Oxford(牛津大学) Imperial College London(帝国理工学院伦敦分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了在高风险专业场景中语言模型如何在用户、机构权威和专业规范之间进行对齐,发现模型在任务执行中常忽视专业规范,且对齐层级在不同领域和模型间不稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12056 2026-05-13 cs.AI 57%

OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

OmniRefine: 一种面向对齐的协作压缩方法以提高多模态大语言模型的效率

Yuchen Deng, Zidang Cai, Hai-Tao Zheng, Jie Wang, Feidiao Yang, Yuxing Han

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Pengcheng Laboratory(鹏城实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OmniRefine,一种无需训练的两阶段框架,通过跨模态对齐和协作压缩提升多模态大语言模型的推理效率与性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09115 2026-05-13 cs.CR cs.AI 57%

AI Native Asset Intelligence

原生AI资产智能

Gal Engelberg, Leon Goldberg, Konstantin Koutsyi, Boris Plotnikov, Tiltan Gilat, Ben Benhemo

机构 * Sola Security(Sola安全)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出原生AI资产智能框架,通过结构化方法整合异构安全数据,实现一致、上下文感知和主动的资产推理。框架结合建模层和评分层,通过敏感性分析和消融研究验证其在资产优先级和安全态势推理中的有效性。

Comments 23 pages, 4 figures, 8 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10815 2026-05-13 cs.AI eess.AS 57%

Probing Cross-modal Information Hubs in Audio-Visual LLMs

探测音频-视觉大语言模型中的跨模态信息枢纽

Jihoo Jung, Chaeyoung Jung, Ji-Hoon Kim, Joon Son Chung

机构 * Department of Electrical Engineering, Korea Advanced Institute of Science The Graduate School of Advanced Imaging Science, Multimedia \& Film, Chung-Ang University, Seoul, Republic of Korea

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了音频-视觉大语言模型中音频与视觉模态间的跨模态信息流动,发现信息主要存储在sink tokens中,并提出一种无需训练的hallucination缓解方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08828 2026-05-13 cs.AI 57%

When Agents Overtrust Environmental Evidence: An Extensible Agentic Framework for Benchmarking Evidence-Grounding Defects in LLM Agents

当智能体过度信任环境证据:一个可扩展的智能体框架,用于基准测试LLM智能体中的证据 grounding 缺陷

Strick Sheng, Ziyue Wang, Liyi Zhou

机构 * The University of Sydney(悉尼大学) Nanjing University(南京大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EnvTrustBench框架,用于评估智能体在环境证据过时、错误或恶意时的可靠性问题,通过生成多个任务场景并验证结果,揭示证据 grounding 是智能体可靠性的重要挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01103 2026-05-13 cs.AI 57%

Probing RLVR training instability through the lens of objective-level hacking

通过目标层面黑客的视角探查RLVR训练不稳定性

Yiming Dong, Kun Fu, Haoyu Li, Xinyuan Zhu, Yurou Liu, Lijing Shao, Jieping Ye, Zheng Wang

机构 * School of Physics, Peking University(北京大学物理学院) Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团) Kavli Institute for Astronomy and Astrophysics, Peking University(北京大学天文与天体物理研究院) National Astronomical Observatories, Chinese Academy of Sciences(中国科学院国家天文台)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过目标层面黑客视角揭示RLVR训练不稳定性的根源,分析MoE模型中训练-推理差异异常增长的机制,为设计稳定的RLVR算法提供指导。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11061 2026-05-13 cs.CV cs.MM 50%

HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer

HiDream-O1-Image:一种原生统一的图像生成基础模型,具有像素级统一的Transformer

Qi Cai, Jingwen Chen, Chengmin Gao, Zijian Gong, Yehao Li, Yingwei Pan, Yi Peng, Zhaofan Qiu, Kai Yu, Yiheng Zhang, Hao Ai, Siying Bai, Yang Chen, Zhihui Chen, Fengbin Gao, Ying Guo, Dong Li, Zhen Shen, Leilei Shi, Jing Wang, Siyu Wang, Yimeng Wang, Rui Zheng, Ting Yao, Tao Mei

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出HiDream-O1-Image,通过像素空间扩散Transformer实现多模态输入的结构统一,无需外部VAE或离散文本编码器,提升生成和编辑任务的性能,实验表明其在多种生成任务中表现优异。

Comments Source codes and models are available at Github: https://github.com/HiDream-ai/HiDream-O1-Image and Huggingface: https://huggingface.co/HiDream-ai/HiDream-O1-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11023 2026-05-13 cs.CY 50%

The Metaverse Is Not a Place Apart: Law, Code, and the Recursive Governance of Digital Space (A Review Essay on Mark Findlay, Governing the Metaverse: Law, Order and Freedom in Digital Space (2025))

元宇宙并非一个独立的空间:法律、代码与数字空间的递归治理(对马克·芬莱《治理元宇宙:数字空间中的法律、秩序与自由》(2025)的评论文章)

Oren Perez

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨马克·芬莱对元宇宙作为社会和想象空间的治理问题,指出其核心概念“元宇宙”和“新法律”理论不足,强调治理需考虑代码、平台和法律的递归互动。

Comments Forthcoming, Journal of Law & Society (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏