arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-11 至 2026-06-11 共收录 114 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 28 篇

2601.03792 2026-06-11 cs.CL 版本更新 57%

VietMed-MCQ: A Consistency-Filtered Data Synthesis Framework for Vietnamese Traditional Medicine Evaluation

VietMed-MCQ:面向越南传统医学评估的一致性过滤数据合成框架

Huynh Trung Kiet, Dao Sy Duy Minh, Nguyen Dinh Ha Duong, Le Hoang Minh Huy, Long Nguyen, Dien Dinh

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出基于检索增强生成和一致性过滤的VietMed-MCQ数据集,含3190道多选题,经专家验证准确率94.2%,基准测试显示通用模型优于越南语模型。

Comments The authors have withdrawn this article because the current version is still undergoing substantial revision. Several components of the data synthesis framework, consistency-filtering procedure, evaluation protocol, and experimental analysis are being refined and expanded. As a result, the current manuscript should not be considered a complete or final representation of the work

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01529 2026-06-11 cs.LG cs.CR 版本更新 57%

Bypassing Prompt Guards in Production with Controlled-Release Prompting

绕过生产环境中的提示守卫:受控释放提示攻击

Jaiden Fairoze, Sanjam Garg, Keewoo Lee, Mingyuan Wang

机构 * UC Berkeley(加州大学伯克利分校) zkBricks Inc(zkBricks公司) Ethereum Foundation(以太坊基金会) NYU Shanghai(纽约大学上海分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 针对AI对齐的提示过滤存在理论上的不可能性,本文提出受控释放提示攻击,利用轻量级输入过滤器与主模型之间的资源不对称性,在实际部署的大语言模型系统中成功绕过提示守卫。

Comments Accepted to USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11464 2026-06-11 cs.RO 新提交 50%

Bridging the sim2real gap in the table tennis robot with a transformer-based ball states predictor

基于Transformer的乒乓球状态预测器弥合仿真到现实的差距

Yin Bi, Christian Conti, Bilan Yang, Alexander Sigrist, Peter Dürr, Naoya Takahashi

机构 * Sony AI, Zürich, Switzerland(索尼AI,苏黎世,瑞士) Sony AI, Tokyo, Japan(索尼AI,东京,日本)

专题命中 推理评测 :planning(abstract)

AI总结 提出基于Transformer的乒乓球状态预测框架,利用注意力机制建模长程时间依赖,结合大规模真实数据集,并引入SPAD策略替换仿真器,无需重新训练即可缩小sim2real差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10508 2026-06-11 cs.CR cs.NI 版本更新 50%

A Deployment-Oriented Framework for Explainable AI-Assisted eBPF/XDP Mitigation at the IoT Edge

面向部署的可解释AI辅助eBPF/XDP缓解框架在物联网边缘的应用

Abdurrahman Tolay

专题命中 推理评测 :reasoning(abstract)

AI总结 提出一种基于Linux的物联网边缘网关框架,结合资源感知的AI风险评分、事件级可解释性和eBPF/XDP限界缓解,实现可部署的异常流量管控。

Comments 59 pages, 2 figures, 12 tables. Conceptual framework and research agenda for explainable AI-assisted eBPF/XDP mitigation at the IoT edge. Corrected truncated abstract metadata

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20795 2026-06-11 cs.CV 版本更新 50%

What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing

什么语义能经受住连接器的考验?视频编辑中VLM到DiT对齐的诊断

Hangyu Lin, Chao Wen, Chengming Xu, Jianxiong Gao, Jiangning Zhang, Xiaobin Hu, Yanwei Fu

机构 * HKUST(香港理工大学) FDU(福建大学) ZJU(浙江大学) NUS(新加坡国立大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究探讨了视频生成模型中VLM与DiT对齐过程中的语义瓶颈问题,通过提出TRACE-Edit数据集和诊断协议,发现连接器模块会导致细粒度结构语义的严重退化,挑战了原有假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00461 2026-06-11 cs.CV 版本更新 50%

ReMoT: Reinforcement Learning with Motion Contrast Triplets

ReMoT: 基于运动对比三元组的强化学习

Cong Wan, Zeyu Guo, Jiangyang Li, SongLin Dong, Yifan Bai, Lin Peng, Zhiheng Ma, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学) Shenzhen University of Advanced Technology(深圳先进技术大学) DAMO Academy, Alibaba Group(阿里巴巴集团 DAMO 院)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出ReMoT统一训练范式,通过规则生成大规模运动对比数据集和组相对策略优化,解决VLM时空一致性问题,在时空推理任务上提升25.1%。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 18 篇

2606.11998 2026-06-11 cs.LG 新提交 83%

Bootstrapped Monitoring: Leveraging Transparent Reasoning to Oversee Stronger AI Agents

自助监控:利用透明推理监督更强的AI智能体

Frank Xiao, Mary Phuong

机构 * California Institute of Technology(加州理工学院)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 提出自助监控协议,通过插入具有透明思维链的不可信中间模型来监督更强智能体,在软件工程任务中显著提升捕获率,即使不可信监控者与智能体合谋。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11219 2026-06-11 cs.CL cs.AI cs.SD 新提交 81%

Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents

Afrispeech Semantics: 评估跨领域和口音的口语语言模型中的音频语义推理

Chibuzor Okocha, Christan Grant

机构 * University of Florida(佛罗里达大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出五项语义与副语言推理任务(蕴含、一致性、合理性、口音漂移、口音约束),评估音频语言模型在口音变化、领域迁移和语义过度推断下的推理能力,揭示当前评估的局限性。

Comments Accepted to ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09762 2026-06-11 cs.AI 版本更新 80%

Position: Stop Anthropomorphizing Intermediate Tokens as Reasoning/Thinking Traces!

立场:停止将中间令牌拟人化为推理/思考痕迹!

Subbarao Kambhampati, Karthik Valmeekam, Siddhant Bhambri, Vardhan Palod, Lucas Saldyt, Kaya Stechly, Soumya Rani Samineni, Durgesh Kalwar, Upasana Biswas

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文论证将模型生成的中间令牌拟人化为“推理痕迹”或“思考痕迹”具有误导性,呼吁社区避免此类拟人化。

Comments Appears in ICML 2026. [This is a fork of v1. This fork, while overlapping with v1 in background section, differs both in the overall focus as well as the specific argument against anthropomorphization of reasoning traces]

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12199 2026-06-11 eess.AS cs.CL cs.SD 新提交 79%

Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation

哪种语音表示更匹配文本原生推理?帧率和表示对语音-文本对齐的研究

Zhen Ye, Xu Tan, Yiming Li, Guangyan Zhang, Chimin Chan, Haohe Liu, Zhengxi Liu, Hongzhan Lin, Zheqi Dai, Xinshen Zhang, Peiwen Sun, Qiuqiang Kong, Wei Xue

机构 * Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学) Tencent, China(腾讯) University of Surrey, United Kingdom(Surrey大学) Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) Hong Kong Baptist University, Hong Kong SAR(香港 Baptist大学) Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学) Independent Researcher(独立研究者)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究语音与文本模态差异中的时间粒度不匹配问题,提出因子化FSQ和轻量非自回归音频LM头以降低帧率,发现4.17Hz帧率结合中间层表示对齐在语音问答中表现最佳。

Comments Accepted by Interspeech 2026 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12373 2026-06-11 cs.CL 新提交 79%

Verifiable Environments Are LEGO Bricks: Recursive Composition for Reasoning Generalization

可验证环境是乐高积木:递归组合实现推理泛化

Hao Xiang, Qiaoyu Tang, Le Yu, Yaojie Lu, Xianpei Han, Ben He, Le Sun, Bowen Yu, Peng Wang, Hongyu Lin, Dayiheng Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 提出RACES框架,将可验证环境视为可递归组合的构建块,通过定义四种组合算子自动生成复合环境,在六个未见基准上平均提升DeepSeek-R1-Distill-Qwen-14B 3.1分,且仅用50个基础环境即可达到300个环境的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11745 2026-06-11 cs.CV cs.AI 新提交 79%

From Prompts to Tokens: Internalizing Causal Supervision in Vision-Language Model for Multi-Image Causal Reasoning

从提示到标记:将因果监督内化到视觉-语言模型中进行多图像因果推理

Haoping Yu, Yuanxi Li, Jing Ma

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出BridgeVLM,通过从多图像输入诱导因果图并转换为因果标记,注入LLM解码器进行因果消息传递,显著提升多图像因果推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11548 2026-06-11 cs.CV 版本更新 78%

How Auxiliary Reasoning Unleashes GUI Grounding in VLMs

辅助推理如何释放VLM中的GUI定位能力

Weiming Li, Yan Shao, Jing Yang, Yujing Lu, Ling Zhong, Yuhan Wang, Min Yu, Tongxiao Ruan, Manni Duan

机构 * Zhejiang Lab(浙江实验室) Hangzhou Research and Development Center(杭州研发中心) China Mobile(中国移动) Innovation Center of Yangtze River Delta(长江三角洲创新中心) Zhejiang University(浙江大学)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 针对VLM在GUI定位任务中隐式空间理解强但显式坐标输出弱的问题,提出三种零样本辅助推理方法(如标记网格),通过输入图像添加空间线索,显著提升定位性能,在多个基准上达到接近最优微调方法的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10968 2026-06-11 cs.LG cs.AI 版本更新 62%

Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning

超越大语言模型强化学习中的统一令牌级信任区域

Renjie Mao, Xiangxin Zhou, Lvfang Tao, Yixin Ding, Yu Shi, Yongguang Lin, Yuheng Wu, Honglin Zhu, Qian Qiu, Wenxi Zhu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对PPO风格信任区域在自回归生成中的位置无关问题,提出CPPO方法,通过位置加权阈值和累积前缀预算动态调整令牌级约束,提升训练稳定性和推理准确性。

Comments Project Page: https://hunyuan-cppo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13733 2026-06-11 cs.LG cs.AI cs.RO 版本更新 62%

Vision-Language-Action Jump-Starting for Reinforcement Learning Robotic Agents

视觉-语言-动作跳跃启动用于强化学习机器人智能体

Angelo Moroncelli, Roberto Zanetti, Marco Maccarini, Loris Roveda

机构 * University of Applied Science and Arts of Southern Switzerland, Department of Innovative Technologies(瑞士南方应用科学与艺术大学创新技术系) Università della Svizzera Italiana, Faculty of Informatics, Lugano, Switzerland(瑞士意大利大学信息学院,卢加诺,瑞士)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出VLAJS方法,通过稀疏的VLA高层动作建议引导PPO探索,结合方向性动作一致性正则化,提升强化学习在长时域操作任务中的样本效率,并在仿真和真实机器人上验证。

Comments ICRA 2026 Workshop on Reinforcement Learning in the Era of Imitation Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11897 2026-06-11 cs.CL 新提交 57%

Notes2Skills: From Lab Notebooks to Certainty-Aware Scientific Agent Skills

Notes2Skills: 从实验室笔记本到具有确定性意识的科学智能体技能

Shi Liu, Jiayao Chen, Chengwei Qin, Yanqing Hu, Jufan Zhang, Linyi Yang

机构 * Southern University of Science and Technology(南方科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University College Dublin(都柏林大学学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出Notes2Skills框架,将实验室笔记转化为保留作者确定性的可验证科学智能体技能,解决不确定判断与确认结论混淆问题。

Comments 28 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11632 2026-06-11 cs.CR cs.AI cs.DC cs.MA 新提交 57%

Sovereign Assurance Boundary: Certificate-Bound Admission for Agentic Infrastructure

主权保证边界:面向智能体基础设施的证书绑定准入机制

Jun He, Deying Yu

机构 * OpenKedge.io(OpenKedge实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 针对智能体基础设施中非确定性推理系统对生产资源的高风险操作,提出主权保证边界(SAB),通过证书绑定的运行时准入层,将代理提案编译为执行合约并绑定加密证据,实现可验证、可撤销的授权控制。

Comments 12 pages, 1 figure, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11445 2026-06-11 cs.AI 新提交 57%

Forecasting Future Behavior as a Learning Task

将未来行为预测作为学习任务

Mosh Levy, Yoav Goldberg, Asa Cooper Stickland

机构 * Bar-Ilan University(巴伊兰大学) Allen Institute for AI(艾伦人工智能研究所) UK AI Security Institute(英国人工智能安全研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出将AI行为预测作为可学习任务,训练行为预测器从推理轨迹中预测未来行为,无需解释步骤,在两项任务上优于GPT-5.4和Claude Opus-4.6。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11213 2026-06-11 cs.CL 新提交 57%

Beyond Compaction: Structured Context Eviction for Long-Horizon Agents

超越压缩:面向长周期智能体的结构化上下文驱逐

Andrew Semenov, Svyatoslav Dorofeev

机构 * Kiz8

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 提出上下文窗口生命周期(CWL)方案,通过结构化、语义感知的驱逐策略,使长周期LLM智能体在有限上下文预算内实现无限工作视野,避免性能下降和幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16651 2026-06-11 cs.CV cs.LG 版本更新 57%

Right Predictions, Misleading Explanations: On the Vulnerability of Vision-Language Model Explanations

正确预测,误导性解释:关于视觉-语言模型解释的脆弱性

Narges Babadi, Hadis Karimipour

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 研究探讨了视觉-语言模型中解释热图在对抗条件下是否忠实反映推理过程,提出X-Shift攻击揭示解释与预测行为的脱节,验证了解释机制的脆弱性。

Comments Accepted at the ICML 2026 Workshop on Trustworthy AI for Good (AI4GOOD), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22934 2026-06-11 cs.AI 版本更新 57%

ProGRank: Probe-Gradient Reranking to Defend Dense-Retriever RAG from Corpus Poisoning

ProGRank: 探针梯度重排序以防御密集检索器RAG免受语料投毒攻击

Xiangyu Yin, Yi Qi, Chih-Hong Cheng

机构 * Chalmers University of Technology, Sweden(瑞典查尔姆斯理工大学) University of Leeds, United Kingdom(英国利兹大学) Carl von Ossietzky University of Oldenburg, Germany(德国奥尔登堡卡尔·冯·奥西特齐大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 提出ProGRank,一种无需训练的后处理检索器端防御方法,通过随机扰动下探针梯度提取不稳定信号并重排序,有效防御密集检索器RAG的语料投毒攻击。

Comments accepted by ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12285 2026-06-11 cs.CY 新提交 50%

Why AI Slop Matters, but Not Like That

为什么AI垃圾内容重要,但不是那样重要

Sachita Nishal, Marijn Sax, Kimon Kieslich

专题命中 其他推理 :reasoning(abstract)

AI总结 本文回应《为什么垃圾内容重要》一文,通过内在和外部批判,指出其推理忽视了AI垃圾内容的社会技术背景,并基于伦理和社会科学视角,强调应关注其社会功能和审美价值,呼吁进行语境化和文化基础的讨论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05203 2026-06-11 cs.RO 版本更新 50%

SIL: Symbiotic Interactive Learning for Language-Conditioned Human-Agent Co-Adaptation

SIL: 语言条件的人机协同适应的共生交互学习

Linus Nwankwo, Bjoern Ellensohn, Christian Rauch, Elmar Rueckert

机构 * Technical University of Leoben(莱博恩技术大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出共生交互学习(SIL)框架,实现人类与智能体在共享潜在任务空间中的双向协同适应,通过联合信念状态、FM空间推理和记忆架构,在指令跟随等任务中达到90.4%完成率和0.83信念对齐分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15680 2026-06-11 cs.SD eess.AS 版本更新 50%

SAM: A Mamba-2 State-Space Audio-Language Model

SAM: 一种基于 Mamba-2 状态空间的音频-语言模型

Taehan Lee, Jaehan Jung, Hyukjun Lee

机构 * Sogang University(ソンガン大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出 SAM,一种结合 Mamba-2 骨干网络的音频-语言模型,在 AudioSet 和 AudioCaps 上以更少参数达到或超越 7B 变压器模型性能,并系统分析了 SSM 与音频编码器输出的交互机制。

Comments 6 pages, Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏