arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-13 至 2026-05-13 共收录 20 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 20 篇

2502.01941 2026-05-13 cs.CL cs.AI 88%

Semantic Integrity Matters: Benchmarking and Preserving High-Density Reasoning in KV Cache Compression

语义完整性至关重要:在KV缓存压缩中基准测试与保持高密度推理

Xiang Liu, Zhenheng Tang, Hong Chen, Peijie Dong, Zeyu Li, Xiuze Zhou, Bo Li, Xuming Hu, Xiaowen Chu

机构 * The Hong Kong University of Science(香港科学与技术大学) Guangzhou HKUST Fok Ying Tung Research Institute(广州HKUST傅种群研究院)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KVFundaBench基准测试,揭示了在高密度推理中压缩导致的严重任务依赖性退化问题,并提出ShotKV方法,通过分离prefill和解码阶段以优先保持语义完整性,提升了长上下文生成任务的准确率并降低了延迟。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05922 2026-05-13 cs.CV 87%

Think, then Score: Decoupled Reasoning and Scoring for Video Reward Modeling

思考,然后评分:视频奖励建模中的解耦推理与评分

Yuan Wang, Ouxiang Li, Yulong Xu, Borui Liao, Jiajun Liang, Jinghan Li, Meng Wang, Xintao Wang, Pengfei Wan, Kuien Liu, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 本文提出DeScore模型,通过解耦推理与评分机制提升视频奖励建模的泛化能力,结合冷启动和强化学习优化,实现更稳定的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12466 2026-05-13 cs.LG cs.AI cs.CL cs.NE 82%

Solve the Loop: Attractor Models for Language and Reasoning

循环求解:语言和推理的吸引子模型

Jacob Fein-Ashley, Paria Rashidinejad

机构 * University of Southern California(南加州大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出吸引子模型,通过固定点求解实现循环优化,提升语言模型和推理性能,在大规模预训练和小模型推理中均优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02408 2026-05-13 cs.CV cs.AI 79%

ReasonEdit: Editing Vision-Language Models using Human Reasoning

ReasonEdit:通过人类推理编辑视觉语言模型

Jiaxing Qiu, Kaihua Hou, Roxana Daneshjou, Ahmed Alaa, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 ReasonEdit通过引入人类推理机制,改进视觉语言模型的编辑能力,提升编辑泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11931 2026-05-13 cs.CV 78%

Learn to Think: Improving Multimodal Reasoning through Vision-Aware Self-Improvement Training

学会思考:通过视觉感知的自我改进训练提升多模态推理

Qihuang Zhong, Liang Ding, Wenjie Xuan, Juhua Liu, Bo Du, Dacheng Tao

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software, Institute of Artificial Intelligence(计算机学院、多媒体软件国家工程研究中心、人工智能研究院) Hubei Key Laboratory of Multimedia(湖北多媒体重点实验室) Network Communication Engineering, Wuhan University, China(网络通信工程、武汉大学,中国) The University of Sydney, Australia(悉尼大学,澳大利亚) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出VISTA框架,通过视觉感知的自我改进训练提升多模态推理能力,解决数据不平衡和语言先验偏差问题,实验显示在多种训练场景下提升性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11522 2026-05-13 cs.DC 78%

State Twins: An Off-Chain Substrate for Agentic Reasoning over Decentralized Finance Protocols

状态双生:一种链下子层,用于在去中心化金融协议上进行代理推理

Ian C. Moore

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出State Twin,一种链下子层,用于在去中心化金融协议上进行代理推理。通过将AMM池建模为离散时间受控动态系统,提供精确数学模型和操作扩展能力,实现快速回放和反事实模拟。

Comments 14 pages, 1 table, 7 listings; reference implementation at https://github.com/defipy-devs/defipy

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09769 2026-05-13 cs.AI 74%

UTS at PsyDefDetect: Multi-Agent Councils and Absence-Based Reasoning for Defense Mechanism Classification

在PsyDefDetect上使用UTS:多智能体委员会与基于缺席的推理用于防御机制分类

Dima Galat, Marian-Andrei Rizoiu

机构 * University of Technology Sydney(技术大学悉尼)

专题命中 其他推理 :reasoning(title);分类 cs.AI

AI总结 本文提出利用DMRS对情感支持对话中的防御机制进行分类,通过多阶段 deliberative 委员会架构,采用特定类别的倡导者评估证据强度,实现F1 0.382的高精度,同时通过针对性的重写集提升F1至0.410。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12460 2026-05-13 cs.LG cs.CL 62%

Multi-Stream LLMs: Unblocking Language Models with Parallel Streams of Thoughts, Inputs and Outputs

多流语言模型:通过并行思维、输入和输出流解除语言模型瓶颈

Guinan Su, Yanwu Yang, Xueyan Li, Jonas Geiping

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) ETH Zurich(苏黎世联邦理工学院) University Hospital Tübingen(图宾根大学医院) University of Tübingen(图宾根大学) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过并行计算流替代顺序消息格式,提升语言模型的效率、安全性和可监控性,解决单流计算的局限性。

Comments Preprint, 37 pages. Code at https://github.com/seal-rg/streaming/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12419 2026-05-13 cs.CL cs.IR cs.LG 62%

ORBIT: Preserving Foundational Language Capabilities in GenRetrieval via Origin-Regulated Merging

ORBIT:通过起源调节合并在生成检索中保留基础语言能力

Neha Verma, Nikhil Mehta, Shao-Chuan Wang, Naijing Zhang, Alicia Tsai, Li Wei, Lukasz Heldt, Lichan Hong, Ed Chi, Xinyang Yi

机构 * Johns Hopkins University(约翰霍普金斯大学) Google DeepMind(谷歌DeepMind) Google(谷歌)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 ORBIT通过跟踪模型权重距离并使用加权平均策略,在生成检索微调中减少模型漂移,有效保留语言基础能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11613 2026-05-13 cs.LG cs.AI 62%

From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation

从通用相关性到输入特定的信用在在线自我蒸馏中

Guobin Shen, Lei Huang, Xiang Cheng, Chenxiao Zhao, Jindong Li, Dongcheng Zhao, Xing Yu

机构 * Xiaohongshu Inc.(小红书公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究在线自我蒸馏中奖励的测量与信用分配,提出CREDIT方法通过对比学习分离输入特定成分,提升模型在多个基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12426 2026-05-13 cs.CL 57%

Geometric Factual Recall in Transformers

变换器中的几何事实回忆

Shauli Ravfogel, Gilad Yehudai, Joan Bruna, Alberto Bietti

机构 * New York University(纽约大学) Flatiron Institute(Flatiron研究所)

专题命中 其他推理 :chain-of-thought(abstract);分类 cs.CL

AI总结 研究探讨了变换器模型如何通过几何方式记忆事实关联,证明嵌入维度与事实数量呈对数关系,并展示了多跳查询中的容量-深度权衡。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12398 2026-05-13 cs.CL cs.IR 57%

Question Difficulty Estimation for Large Language Models via Answer Plausibility Scoring

通过答案可信度评分估计问题难度

Jamshid Mozafari, Bhawna Piryani, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文提出Q-DAPS方法,通过计算候选答案可信度的熵来估计问题难度,在四个数据集上表现优异,具有可解释性和鲁棒性。

Comments Accepted at ACL 2026

Journal ref Proceedings of the 64rd Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12120 2026-05-13 cs.AI 57%

To Whom Do Language Models Align? Measuring Principal Hierarchies Under High-Stakes Competing Demands

语言模型对谁进行对齐?在高风险竞争需求下测量主导层级

Fangyi Yu, Nabeel Seedat, Jonathan Richard Schwarz, Andrew M. Bean

机构 * Thomson Reuters Foundational Research(汤姆森·路透基础研究) University of Oxford(牛津大学) Imperial College London(帝国理工学院伦敦分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了在高风险专业场景中语言模型如何在用户、机构权威和专业规范之间进行对齐,发现模型在任务执行中常忽视专业规范,且对齐层级在不同领域和模型间不稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12056 2026-05-13 cs.AI 57%

OmniRefine: Alignment-Aware Cooperative Compression for Efficient Omnimodal Large Language Models

OmniRefine: 一种面向对齐的协作压缩方法以提高多模态大语言模型的效率

Yuchen Deng, Zidang Cai, Hai-Tao Zheng, Jie Wang, Feidiao Yang, Yuxing Han

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Pengcheng Laboratory(鹏城实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OmniRefine,一种无需训练的两阶段框架,通过跨模态对齐和协作压缩提升多模态大语言模型的推理效率与性能稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09115 2026-05-13 cs.CR cs.AI 57%

AI Native Asset Intelligence

原生AI资产智能

Gal Engelberg, Leon Goldberg, Konstantin Koutsyi, Boris Plotnikov, Tiltan Gilat, Ben Benhemo

机构 * Sola Security(Sola安全)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出原生AI资产智能框架,通过结构化方法整合异构安全数据,实现一致、上下文感知和主动的资产推理。框架结合建模层和评分层,通过敏感性分析和消融研究验证其在资产优先级和安全态势推理中的有效性。

Comments 23 pages, 4 figures, 8 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10815 2026-05-13 cs.AI eess.AS 57%

Probing Cross-modal Information Hubs in Audio-Visual LLMs

探测音频-视觉大语言模型中的跨模态信息枢纽

Jihoo Jung, Chaeyoung Jung, Ji-Hoon Kim, Joon Son Chung

机构 * Department of Electrical Engineering, Korea Advanced Institute of Science The Graduate School of Advanced Imaging Science, Multimedia \& Film, Chung-Ang University, Seoul, Republic of Korea

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了音频-视觉大语言模型中音频与视觉模态间的跨模态信息流动,发现信息主要存储在sink tokens中,并提出一种无需训练的hallucination缓解方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08828 2026-05-13 cs.AI 57%

When Agents Overtrust Environmental Evidence: An Extensible Agentic Framework for Benchmarking Evidence-Grounding Defects in LLM Agents

当智能体过度信任环境证据:一个可扩展的智能体框架,用于基准测试LLM智能体中的证据 grounding 缺陷

Strick Sheng, Ziyue Wang, Liyi Zhou

机构 * The University of Sydney(悉尼大学) Nanjing University(南京大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出EnvTrustBench框架,用于评估智能体在环境证据过时、错误或恶意时的可靠性问题,通过生成多个任务场景并验证结果,揭示证据 grounding 是智能体可靠性的重要挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01103 2026-05-13 cs.AI 57%

Probing RLVR training instability through the lens of objective-level hacking

通过目标层面黑客的视角探查RLVR训练不稳定性

Yiming Dong, Kun Fu, Haoyu Li, Xinyuan Zhu, Yurou Liu, Lijing Shao, Jieping Ye, Zheng Wang

机构 * School of Physics, Peking University(北京大学物理学院) Tongyi Lab(通义实验室) Alibaba Group(阿里巴巴集团) Kavli Institute for Astronomy and Astrophysics, Peking University(北京大学天文与天体物理研究院) National Astronomical Observatories, Chinese Academy of Sciences(中国科学院国家天文台)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过目标层面黑客视角揭示RLVR训练不稳定性的根源,分析MoE模型中训练-推理差异异常增长的机制,为设计稳定的RLVR算法提供指导。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11061 2026-05-13 cs.CV cs.MM 50%

HiDream-O1-Image: A Natively Unified Image Generative Foundation Model with Pixel-level Unified Transformer

HiDream-O1-Image:一种原生统一的图像生成基础模型,具有像素级统一的Transformer

Qi Cai, Jingwen Chen, Chengmin Gao, Zijian Gong, Yehao Li, Yingwei Pan, Yi Peng, Zhaofan Qiu, Kai Yu, Yiheng Zhang, Hao Ai, Siying Bai, Yang Chen, Zhihui Chen, Fengbin Gao, Ying Guo, Dong Li, Zhen Shen, Leilei Shi, Jing Wang, Siyu Wang, Yimeng Wang, Rui Zheng, Ting Yao, Tao Mei

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出HiDream-O1-Image,通过像素空间扩散Transformer实现多模态输入的结构统一,无需外部VAE或离散文本编码器,提升生成和编辑任务的性能,实验表明其在多种生成任务中表现优异。

Comments Source codes and models are available at Github: https://github.com/HiDream-ai/HiDream-O1-Image and Huggingface: https://huggingface.co/HiDream-ai/HiDream-O1-Image

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11023 2026-05-13 cs.CY 50%

The Metaverse Is Not a Place Apart: Law, Code, and the Recursive Governance of Digital Space (A Review Essay on Mark Findlay, Governing the Metaverse: Law, Order and Freedom in Digital Space (2025))

元宇宙并非一个独立的空间:法律、代码与数字空间的递归治理(对马克·芬莱《治理元宇宙:数字空间中的法律、秩序与自由》(2025)的评论文章)

Oren Perez

专题命中 其他推理 :reasoning(abstract)

AI总结 本文探讨马克·芬莱对元宇宙作为社会和想象空间的治理问题,指出其核心概念“元宇宙”和“新法律”理论不足,强调治理需考虑代码、平台和法律的递归互动。

Comments Forthcoming, Journal of Law & Society (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏