ScratchWorld: Evaluating If World Models Compute Executable Consequences
ScratchWorld: 评估世界模型是否计算可执行后果
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ScratchWorld基准,通过Scratch项目验证世界模型在稀疏变化环境中的状态预测、因果归因等能力,发现模型常忽略可执行规则,最高仅达13.8%的F1值。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
ScratchWorld: 评估世界模型是否计算可执行后果
专题命中 推理评测 :reasoning(abstract)
AI总结 提出ScratchWorld基准,通过Scratch项目验证世界模型在稀疏变化环境中的状态预测、因果归因等能力,发现模型常忽略可执行规则,最高仅达13.8%的F1值。
CooperScene: 具有C-V2X通信特性的多模态协作自主基准
机构 * University of California, Riverside(加州大学河滨分校)
专题命中 推理评测 :planning(abstract)
AI总结 提出CooperScene数据集,通过真实C-V2X通信特性、多模态传感器和3GPP标准,建立多车协作感知基准,包含59K帧、344K标注对象。
Comments Accepted to ECCV 2026. 15 pages, 15 figures
学习拒绝:多模态大语言模型中的动作否定
机构 * Institute of Artificial Intelligence, University of Central Florida(中佛罗里达大学人工智能研究所)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出UCF101-AD基准测试,评估多模态大语言模型在强上下文线索下识别动作缺失的能力,发现模型倾向于肯定动作而非验证其真实性,并通过因果图CausalAct减少误报。
Comments Accepted to ECCV 2026 main conference
超越单字符:评估多模态大语言模型在句子级甲骨文理解中的表现
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanjing University of Science and Technology(南京理工大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出S-OBI基准,通过字形替换与组合合成清晰标准的句子级甲骨文实例,设计语义匹配、语义槽提取和上下文推理任务,评估多模态大语言模型在句子级甲骨文理解中的表现,发现当前模型仍依赖字符级识别。
Comments 13 pages, 4 figures
TaxoMIL:用于层次化全切片图像分析的分层约束学习
机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) ; Department of Hospital Pathology, The Catholic University of Korea College of Medicine(韩国天主教大学医学院医院病理学系)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出TaxoMIL框架,将WSI诊断重构为多粒度文本生成任务,通过双头Transformer解码器和分类学引导目标,实现层次感知的准确预测。
Comments Accepted at ECCV 2026
工业检测场景安全评估的多模态基准
机构 * Department of Automation, Tsinghua University(清华大学自动化系) ; Institute for Embodied Intelligence and Robotics, Tsinghua University(清华大学具身智能与机器人研究所) ; TetraBOT Intelligence Co., Ltd.(天博智能科技有限公司) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; School of Automation, Southeast University(东南大学自动化学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对工业现场多模态安全评估缺乏真实数据的问题,构建了首个包含真实机器人巡检数据、像素级标注和七种同步模态的基准数据集InspecSafe-V1,覆盖五个典型场景,支持多模态异常识别与安全评估。
Comments 14 pages, 6 figures, Accepted by Scientific Data
通过感知验证自训练提升视觉-语言模型的推理能力
机构 * Malaviya National Institute of Technology Jaipur(马拉维亚国家理工学院斋浦尔分校) ; IBM Research(IBM研究院)
专题命中 其他推理 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(abstract)
AI总结 提出感知验证自训练框架,通过解耦感知与推理的CoT模板和无监督评估方法PerceptEval,结合两阶段课程学习,提升视觉-语言模型在视觉推理中的准确性并减少幻觉。
Comments Accepted at The European Conference on Computer Vision 2026
LASER: 面向边缘推理大模型的负载感知早退服务
专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)
AI总结 提出LASER系统,通过负载感知自适应退出阈值和难度与负载感知的推理预算预分配,联合优化推理质量与服务延迟,在边缘部署中降低延迟17-38%并提升SLO满足率3-6%。
Comments to be published in WASA 2026
通过操作草图和自监督学习推广表格数据中的数值推理
机构 * Seoul National University(首尔国立大学) ; Soongsil University(顺天大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出TaNOS框架,通过操作草图和自监督学习提升表格数据中数值推理的泛化能力,实验显示其在FinQA数据集上表现优异,且在领域转移中鲁棒性更强。
Comments Accepted to TACL. This is a pre-MIT Press publication version
RASR:基于检索的语义推理用于虚假新闻视频检测
机构 * School of Informatics, Xiamen University(厦门大学信息学院) ; School of Computer Science and Information Security, Guilin University of Electronic Technology(桂林电子科技大学计算机科学与信息安全学院) ; School of Computer and Big Data, Minjiang University(闽江学院计算机与大数据学院) ; Xiamen University(厦门大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 其他推理 :reasoning(title,abstract)
AI总结 本文提出RASR框架,通过跨实例语义解析器和检索器、领域引导多模态推理模块和多视图特征解耦融合模块,提升虚假新闻视频检测的准确性和跨域泛化能力。
Comments The paper needs revision, and the experiments need to be expanded
大声思考:非对称LLM谈判中的实时欺骗监控
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 提出轻量级实时思维链监控器,在二手车销售场景中检测卖家隐藏缺陷的欺骗行为,实验表明监控能提高买家退出率但存在智能差距。
机器会在人类感到困难的地方也遇到困难吗?大语言模型与人类对混淆代码的理解
专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)
AI总结 基于人类对混淆代码理解的研究,评估大语言模型是否共享人类在混淆代码下的失败模式,发现推理调优模型与人类困难模式显著对齐,而指令调优模型相关性接近零。
Comments 13 pages, 15 figures
等等,我公平吗?刻画演绎刻板印象并用 Fair-GCG 缓解它
机构 * University of Michigan(密歇根大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文识别出大语言模型中的演绎刻板印象失败模式,提供统计解释,并提出推理时注入框架 Fair-GCG 以发现有效短语,提升多个公平性基准的性能。
梯度平滑:耦合逐层更新以改进优化
机构 * Vector Institute(向量研究所)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出深度梯度增强框架,通过窗口平滑算子沿深度方向变换优化器更新,在不改变模型架构或训练目标下提升多种架构和任务的优化与泛化性能。
Comments Published in the Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)
使用AI代理自动化大规模黑盒审计个性化算法
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出用生成式AI代理作为行为引擎进行黑盒审计,通过固定人设和反事实扰动解耦用户属性与行为,在X平台部署1120个代理发现算法推荐放大有毒、极化内容且效果因用户意识形态而异。
Comments 43 pages, 10 figures
保留语音到文本LLM能力的语音到语音生成
机构 * Microsoft(微软)
专题命中 其他推理 :reasoning(abstract)
AI总结 提出PRIME-Speech框架,通过冻结骨干网络并仅训练语音生成模块,在保持语音到文本性能的同时实现高质量语音到语音转换,支持多轮对话。
MS-Resampler: 用于高效多模态大语言模型的多范围视觉重采样
机构 * Li Auto Inc.(理想汽车) ; East China Normal University(华东师范大学)
专题命中 其他推理 :reasoning(abstract)
AI总结 提出MS-Resampler,通过多范围视觉重采样框架,注入显式空间范围先验,使模型在固定令牌预算内同时捕获局部细节和全局上下文,提升多模态理解与推理。
交互语言模型:从物理交互的统计模式中发现机制
专题命中 其他推理 :reasoning(abstract)
AI总结 提出交互语言模型(ILM),通过统计学习物理交互的依赖关系,推断交互路径、识别缺失步骤并预测下一步交互,在分子扩散任务中实现可审计的机制发现。
Comments Corresponding authors: Tianming Liu, Yohannes Abate