arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-01 至 2026-07-01 共收录 138 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 33 篇

2606.31689 2026-07-01 cs.SE 新提交 50%

ScratchWorld: Evaluating If World Models Compute Executable Consequences

ScratchWorld: 评估世界模型是否计算可执行后果

Yufeng Lin, Jialu Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 提出ScratchWorld基准,通过Scratch项目验证世界模型在稀疏变化环境中的状态预测、因果归因等能力,发现模型常忽略可执行规则,最高仅达13.8%的F1值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31219 2026-07-01 cs.CV 新提交 50%

CooperScene: Multi-Modal Cooperative Autonomy Benchmark with C-V2X Communication Characterization

CooperScene: 具有C-V2X通信特性的多模态协作自主基准

Bo Wu, Ruoshen Mo, Justin Yue, Yanyu Zhang, Janice Nguyen, Guoyuan Wu, Amit Roy-Chowdhury, Matthew J. Barth, Hang Qiu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 推理评测 :planning(abstract)

AI总结 提出CooperScene数据集,通过真实C-V2X通信特性、多模态传感器和3GPP标准,建立多车协作感知基准,包含59K帧、344K标注对象。

Comments Accepted to ECCV 2026. 15 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31187 2026-07-01 cs.CV 新提交 50%

Learning to Deny: Action Denial in Multimodal Large Language Models

学习拒绝:多模态大语言模型中的动作否定

Raiyaan Abdullah, Shehreen Azad, Yogesh Singh Rawat

机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。

Comments Accepted to ECCV 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31169 2026-07-01 cs.CV 新提交 50%

Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding

超越单字符:评估多模态大语言模型在句子级甲骨文理解中的表现

Ziqi Li, Zijian Chen, Tingzhu Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University of Science and Technology(南京理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出S-OBI基准,通过字形替换与组合合成清晰标准的句子级甲骨文实例,设计语义匹配、语义槽提取和上下文推理任务,评估多模态大语言模型在句子级甲骨文理解中的表现,发现当前模型仍依赖字符级识别。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31100 2026-07-01 cs.CV 新提交 50%

TaxoMIL: Taxonomy-Constrained Learning for Hierarchical Whole Slide Image Analysis

TaxoMIL:用于层次化全切片图像分析的分层约束学习

Chaeyeon Lee, Khang Nguyen Quoc, Jinsol Song, Yosep Chong, Kwangil Yim, Jin Tae Kwak

机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) Department of Hospital Pathology, The Catholic University of Korea College of Medicine(韩国天主教大学医学院医院病理学系)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出TaxoMIL框架,将WSI诊断重构为多粒度文本生成任务,通过双头Transformer解码器和分类学引导目标,实现层次感知的准确预测。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21173 2026-07-01 cs.RO cs.CV 版本更新 50%

Multimodal Benchmark for Safety Assessment in Industrial Inspection Scenarios

工业检测场景安全评估的多模态基准

Zeyi Liu, Shuang Liu, Jihai Min, Zhaoheng Zhang, Jun Cen, Pengyu Han, Songqiao Hu, Zihan Meng, Xiao He, Donghua Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) DAMO Academy, Alibaba Group(阿里巴巴达摩院) School of Automation, Southeast University(东南大学自动化学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。

Comments 14 pages, 6 figures, Accepted by Scientific Data

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 12 篇

2606.22158 2026-07-01 cs.CV 新提交 89%

Improving Reasoning in Vision-Language Models via Perception Verified Self-Training

通过感知验证自训练提升视觉-语言模型的推理能力

Sourabh Sharma, Sonam Gupta, Sadbhawna

机构 * Malaviya National Institute of Technology Jaipur(马拉维亚国家理工学院斋浦尔分校) IBM Research(IBM研究院)

专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract)

AI总结 提出感知验证自训练框架,通过解耦感知与推理的CoT模板和无监督评估方法PerceptEval,结合两阶段课程学习,提升视觉-语言模型在视觉推理中的准确性并减少幻觉。

Comments Accepted at The European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31580 2026-07-01 cs.DC 新提交 87%

LASER: Load-Aware Serving with Early-Exit for Reasoning LLMs at the Edge

LASER: 面向边缘推理大模型的负载感知早退服务

Zhiqing Tang, Size Li, Hanshuai Cui, Zilan Huang, Jianxiong Guo, Tian Wang, Yuan Wu, Weijia Jia

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出LASER系统,通过负载感知自适应退出阈值和难度与负载感知的推理预算预分配,联合优化推理质量与服务延迟,在边缘部署中降低延迟17-38%并提升SLO满足率3-6%。

Comments to be published in WASA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21495 2026-07-01 cs.LG cs.AI cs.CL 版本更新 82%

Generalizing Numerical Reasoning in Table Data through Operation Sketches and Self-Supervised Learning

通过操作草图和自监督学习推广表格数据中的数值推理

Hanjun Cho, Gahyun Yoo, Hanseong Kim, Jay-Yoon Lee

机构 * Seoul National University(首尔国立大学) Soongsil University(顺天大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TaNOS框架,通过操作草图和自监督学习提升表格数据中数值推理的泛化能力,实验显示其在FinQA数据集上表现优异,且在领域转移中鲁棒性更强。

Comments Accepted to TACL. This is a pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06687 2026-07-01 cs.CV 版本更新 78%

RASR: Retrieval-Augmented Semantic Reasoning for Fake News Video Detection

RASR:基于检索的语义推理用于虚假新闻视频检测

Hui Li, Peien Ding, Jun Li, Guoqi Ma, Zhanyu Liu, Ge Xu, Junfeng Yao, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) School of Computer Science and Information Security, Guilin University of Electronic Technology(桂林电子科技大学计算机科学与信息安全学院) School of Computer and Big Data, Minjiang University(闽江学院计算机与大数据学院) Xiamen University(厦门大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出RASR框架,通过跨实例语义解析器和检索器、领域引导多模态推理模块和多视图特征解耦融合模块,提升虚假新闻视频检测的准确性和跨域泛化能力。

Comments The paper needs revision, and the experiments need to be expanded

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30649 2026-07-01 cs.CY 新提交 75%

Thinking Out Loud: Real-Time Deception Monitoring in Asymmetric LLM Negotiations

大声思考:非对称LLM谈判中的实时欺骗监控

Nolan Coffey, Faithful Odoi, Makenzie Johnson, Nasir U. Eisty

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 提出轻量级实时思维链监控器,在二手车销售场景中检测卖家隐藏缺陷的欺骗行为,实验表明监控能提高买家退出率但存在智能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31725 2026-07-01 cs.SE 新提交 67%

Do Machines Struggle Where Humans Do? LLM and Human Comprehension of Obfuscated Code

机器会在人类感到困难的地方也遇到困难吗?大语言模型与人类对混淆代码的理解

Jack Le, Anh H. N. Nguyen, Tien N. Nguyen

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 基于人类对混淆代码理解的研究,评估大语言模型是否共享人类在混淆代码下的失败模式,发现推理调优模型与人类困难模式显著对齐,而指令调优模型相关性接近零。

Comments 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30989 2026-07-01 cs.CL cs.AI 新提交 62%

Wait, am I Being Fair? Characterizing Deductive Stereotyping and Mitigating It with Fair-GCG

等等,我公平吗?刻画演绎刻板印象并用 Fair-GCG 缓解它

Naihao Deng, Yilun Zhu, Joan Nwatu, Clayton Scott, Rada Mihalcea

机构 * University of Michigan(密歇根大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文识别出大语言模型中的演绎刻板印象失败模式,提供统计解释,并提出推理时注入框架 Fair-GCG 以发现有效短语,提升多个公平性基准的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30813 2026-07-01 cs.LG cs.AI 新提交 62%

Gradient Smoothing: Coupling Layer-wise Updates for Improved Optimization

梯度平滑:耦合逐层更新以改进优化

Haoming Meng, Anton Sugolov, Vardan Papyan

机构 * Vector Institute(向量研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出深度梯度增强框架,通过窗口平滑算子沿深度方向变换优化器更新,在不改变模型架构或训练目标下提升多种架构和任务的优化与泛化性能。

Comments Published in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30801 2026-07-01 cs.CL cs.CY cs.LG cs.SI 新提交 62%

Using AI Agents to Automate Black-Box Audits of Personalization Algorithms at Scale

使用AI代理自动化大规模黑盒审计个性化算法

Alessandro Morosini, Sarah H. Cen, Andrew Ilyas, Hedi Driss, Aleksander Mądry, Chara Podimata

机构 * Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出用生成式AI代理作为行为引擎进行黑盒审计,通过固定人设和反事实扰动解耦用户属性与行为,在X平台部署1120个代理发现算法推荐放大有毒、极化内容且效果因用户意识形态而异。

Comments 43 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30944 2026-07-01 eess.AS cs.SD 新提交 50%

Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation

保留语音到文本LLM能力的语音到语音生成

Yuxuan Hu, Heng Lu, Ruchao Fan, Yao Qian, Xiaofei Wang, Jian Xue, Heming Wang, Shuohang Wang, Young Jin Kim, Yelong Shen, Jinyu Li

机构 * Microsoft(微软)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出PRIME-Speech框架,通过冻结骨干网络并仅训练语音生成模块,在保持语音到文本性能的同时实现高质量语音到语音转换,支持多轮对话。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31383 2026-07-01 cs.CV 新提交 50%

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs

MS-Resampler: 用于高效多模态大语言模型的多范围视觉重采样

Zhongyang Li, Yaqian Li, Faming Fang, Rinyoichi Takezoe, Zi-Hao Bo, Cheng Qian, Mo Guang, Guixu Zhang, Kaiwen Long

机构 * Li Auto Inc.(理想汽车) East China Normal University(华东师范大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 提出MS-Resampler,通过多范围视觉重采样框架,注入显式空间范围先验,使模型在固定令牌预算内同时捕获局部细节和全局上下文,提升多模态理解与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30922 2026-07-01 cond-mat.other 新提交 50%

An Interaction Language Model: Mechanism Discovery from Statistical Patterns of Physical Interactions

交互语言模型:从物理交互的统计模式中发现机制

Triparna Ganguly, Hanqi Jiang, Xinliang Li, Yi Pan, Junhao Chen, Miyuki Karunathilaka, Tianming Liu, Yohannes Abate

专题命中 其他推理 :reasoning(abstract)

AI总结 提出交互语言模型(ILM),通过统计学习物理交互的依赖关系,推断交互路径、识别缺失步骤并预测下一步交互,在分子扩散任务中实现可审计的机制发现。

Comments Corresponding authors: Tianming Liu, Yohannes Abate

详情

展开后加载摘要…

URL PDF HTML 收藏