Evolution & Foundation: AI Shares Creative Control
进化与基础模型:AI共享创意控制
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出一种结合遗传算法与多模态AI基础模型的框架,实现自动化设计3D有机形态,将艺术家角色从直接选择转变为系统设计,加速创意探索。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
进化与基础模型:AI共享创意控制
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出一种结合遗传算法与多模态AI基础模型的框架,实现自动化设计3D有机形态,将艺术家角色从直接选择转变为系统设计,加速创意探索。
VL-MemKnG:结合时空知识图谱的混合记忆用于长程自我中心导航轨迹问答
机构 * Mobile Robotics Laboratory, Artificial Intelligence Center(移动机器人实验室,人工智能中心) ; Skoltech(斯科尔科沃科学技术学院) ; Intelligent Multimodal Vision Analysis Group, Department of Engineering, Universitat Pompeu Fabra(智能多模态视觉分析组,工程系,庞培法布拉大学) ; Independent Researcher(独立研究员)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出VL-MemKnG混合记忆框架,结合时空知识图谱与片段级上下文记忆,通过混合检索推理模块提升长程自我中心视频导航问答的准确性和效率。
对象标记作为机器人手术中分割与视觉问答的桥梁
机构 * Department of Biomedical Engineering, Eindhoven University of Technology(埃因霍温理工大学生物医学工程系) ; Department of Electrical Engineering, Eindhoven University of Technology(埃因霍温理工大学电气工程系) ; Department of Surgery, University Medical Center Utrecht(乌得勒支大学医学中心外科)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出统一框架,联合像素级分割与视觉问答,通过VLM生成对象标记引导答案预测和分割掩码,在RAMIE和EndoVis18数据集上优于基线方法。
自监督单目视频深度估计的3D一致性优化
机构 * Fudan University(复旦大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出一种将视频深度估计转化为多视图3D重建的框架,通过光度渲染、世界坐标对齐和多尺度时间梯度一致性约束,实现全局3D结构一致性,在自监督和零样本临床场景中达到最先进的空间精度。
MamBOA:用于视频识别的状态空间架构
机构 * Ankara Medipol University(安卡拉梅迪波尔大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出MamBOA框架,通过交错扫描结构将选择性状态空间递归(S6)作为运动合成器,从骨干网络提取的连续特征中编码运动,实现细粒度动作识别的高效时序建模。
Comments 15 pages, 7 figures. Codes available at [https://github.com/BOA-clk/MamBOA]
语义感知的潜水员活动识别框架用于有效的水下多人类-机器人协作
机构 * University of Minnesota(明尼苏达大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出DAR-Net框架,结合Transformer时间推理与像素级场景监督,通过多损失训练对齐全局活动识别与局部人机交互语义,解决低可见度水下环境中的潜水员活动识别问题,并发布首个水下潜水员活动数据集UDA。
3D-CoS:基于VLM代码合成的新型3D重建范式
机构 * Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Microsoft(微软) ; University of Oxford(牛津大学)
专题命中 视觉空间推理 :planning(abstract)
AI总结 提出3D代码合成(3D-CoS)范式,将3D资产表示为可执行的Blender代码,利用VLM进行程序化重建,实现高可控性和局部编辑能力。
Comments Preprint. 24 pages, 11 figures
基于视觉语言模型的海岸线几何定位
机构 * The University of Waikato(怀卡托大学) ; The University of Auckland(奥克兰大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出将海岸线提取视为几何边界定位任务,基于GeoChat-7B/LLaVA-1.5架构构建CoastlineVLM-7B模型,直接预测折线而非分割掩码,在几何指标上优于传统分割方法。
KPGrasp: 可扩展的关键点流匹配用于灵巧抓取生成
机构 * Peking University(北京大学) ; Galbot ; Xi’an Jiaotong University(西安交通大学) ; Tsinghua University(清华大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出KPGrasp框架,通过全欧几里得手部关键点参数化和Transformer流模型,从大规模数据学习灵巧抓取先验,无需接触损失或测试时优化,在模拟和真实场景中实现高成功率与低穿透深度。
Comments 14 pages, 7 figures, 6 tables
PhysAgent: 通过轨迹驱动的多智能体反馈实现基于物理的4D合成自动化
机构 * Beijing Institute of Technology(北京理工大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出PhysAgent,首个模拟器在环的多智能体框架,通过解耦材料与外力、利用视觉基础模型提取轨迹并借助LLM常识推理,实现自动化、物理可信的4D运动合成,显著提升生成多样性与物理准确性。
自信记忆:具有概率保证的时空记忆不确定性量化
机构 * MIT(麻省理工学院)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 针对机器人长期操作中VLM描述噪声大、视角不一致的问题,提出目标级语义不确定性评分,并集成到UQ-DAAAM系统中,通过主动选择高质量视图和融合多视角描述来降低不确定性,同时提供概率保证。
Audio-Oscar: 一个用于复杂音频场景生成、编排和优化的多智能体系统
机构 * MoE Key Lab of Artificial Intelligence(人工智能混合专家实验室) ; X-LANCE Lab(X-LANCE实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai AI Laboratory(上海人工智能实验室) ; Xiamen University(厦门大学) ; State Key Laboratory of Complex & Critical Software Environment, China(复杂与关键软件环境国家重点实验室,中国)
专题命中 视觉空间推理 :planning(abstract)
AI总结 提出Audio-Oscar多智能体框架,通过协调多个专业智能体处理角色建模、语音生成、时间线规划等,实现复杂音频场景的生成与优化,并构建ASG-Bench基准进行评估。
Stream3D-VLM:基于增量几何先验的在线3D空间理解
机构 * Zhejiang University(浙江大学) ; Tencent Hunyuan(腾讯文汇) ; HKUST(香港科技大学) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 提出在线3D视觉语言模型Stream3D-VLM,通过自回归流控制、轻量视觉-空间特征融合模块和几何自适应体素压缩,实现从流式视频中实时理解3D空间,并构建超百万在线3D问答数据集,在多项任务上超越现有模型。
Comments Project Page: https://stream3d-vlm.github.io/
机器人需要的不仅仅是VLA和世界模型
机构 * Motoniq.ai ; Stanford University(斯坦福大学) ; Istituto Italiano di Tecnologia(意大利技术研究院) ; ETH Zurich(苏黎世联邦理工学院) ; Technical University of Darmstadt(德累斯顿技术大学) ; UCL Centre for AI(伦敦大学学院人工智能中心)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文认为机器人通用智能的关键瓶颈不仅是策略学习,还缺乏将非结构化行为数据转化为机器人可用监督的机制,并提出了四种缺失的接口组件。
CaVe-VLM-CoT:一种可解释的视觉-语言模型框架
机构 * Vector Institute(向量研究所)
专题命中 测试时计算 :CoT(title,title_cn);reasoning(abstract);chain-of-thought(abstract);verifier(abstract)
AI总结 提出CaVe-VLM-CoT框架,通过五阶段闭环流水线(提取器、检索器、求解器、引用注入器、验证器)实现证据推理,并引入CaVeScore复合指标评估检索质量、引用忠实度和跨模态基础,在ScienceQA和MMMU上取得性能提升。
重新审视有限监督下的思维链推理:半监督思维链学习
机构 * University of Warwick(沃里克大学) ; University of Cambridge(剑桥大学)
专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI、cs.LG
AI总结 提出半监督思维链学习框架Semi-CoT,利用未标注问题通过熵门控选择低熵伪思维链作为可靠监督信号,实验显示高精度但部分任务效果有限。
Comments Tech Report
LLM-as-a-Verifier:一种通用验证框架
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; NVIDIA Research(英伟达研究院)
专题命中 测试时计算 :verifier(title,title_cn);reasoning(abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该工作将验证确定方案正确性的能力作为大模型新扩展轴,提出无需额外训练的通用LLM验证框架,生成连续评分,在多基准上取得SOTA性能,还可用于强化学习等场景。
Comments Code: https://github.com/llm-as-a-verifier/llm-as-a-verifier Website: https://llm-as-a-verifier.com
过重采样优化:大语言模型推理的测试时自校正
机构 * University of Oklahoma(俄克拉荷马大学) ; Stanford University(斯坦福大学) ; Universitat Pompeu Fabra(庞培法布拉大学) ; Air University(空军大学)
专题命中 测试时计算 :reasoning(title,abstract);self-correction(title,abstract);test-time compute(abstract);verifier(abstract)
AI总结 本文提出无验证器的广度-深度优化框架,通过迭代自我批判与校正优化采样的 LLM 推理轨迹,在多个数学推理数据集及多款开放权重模型上,较基线方法实现了推理准确率的显著提升。
Comments Submitted to EMNLP 2026
量化膨胀推理:低比特推理模型的隐藏成本——令牌膨胀
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft(微软) ; Anyscale ; Snowflake
专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(title,abstract);test-time compute(abstract);分类 cs.AI、cs.LG
AI总结 研究发现低比特后训练量化虽保持推理准确性,但会显著增加推理令牌使用量,导致端到端服务性能下降,并提出了CoT令牌膨胀比来量化该效应。
超越承诺边界:探究大型推理模型中的附带思维链
机构 * CLCG, University of Groningen(格罗宁根大学CLCG) ; University of Milano-Bicocca(米兰-布雷拉大学) ; University of Trieste(特里耶大学) ; Khoury College of Computer Sciences, Northeastern University(东北大学Khoury计算机科学学院)
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过早期退出估计思维链步骤的因果重要性,发现推理中存在从瞬态猜测到稳定答案的“承诺边界”,后续步骤为附带现象,可提前退出以缩短推理长度达55%而不影响性能。
CASE:用于提高思维链忠实度的因果对齐和结构强化
专题命中 测试时计算 :CoT(summary_cn,abstract);chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL
AI总结 研究思维链推理中生成的推理无法忠实支持最终答案的问题,提出CASE框架,通过训练时因果对齐和推理时结构强化,结合构建多种数据集及选择性损失微调、屏蔽注意力等方法,提升CoT忠实度、跨数据集转移能力及平均准确率。
当进一步推理无益时停止:推理模型中的注意力状态自适应生成
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省 ubiquitous 智能与可信服务重点实验室)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);test-time compute(abstract)
AI总结 针对大型推理模型过度思考导致冗余和准确率下降的问题,提出无需训练的注意力状态自适应生成方法ASAG,通过推断推理状态动态调整生成策略,在多个基准上平均准确率提升3.2%,生成token减少近40%。
Comments ICML 2026 Spotlight
发散-收敛推理:通过结构化解决方案合成扩展测试时计算
机构 * School of Computing, Queen’s University(女王大学计算学院) ; IBM T.J. Watson Research Center(IBM T.J.沃森研究中心) ; University of Chicago(芝加哥大学) ; Tensormesh Inc.(Tensormesh公司)
专题命中 测试时计算 :reasoning(title,abstract);test-time compute(title,abstract);分类 cs.AI
AI总结 该研究提出发散-收敛推理(DCR),引入递归DCR方法,利用分歧信息优化测试时计算分配,在AIME 2024、2025数据集上实现高准确率且减少计算量,揭示LLM测试时推理的扩展规律。
基于验证器的热能存储控制推理模型强化微调
机构 * The University of Tokyo(东京大学) ; Tokyo University of Science(东京理科大学)
专题命中 测试时计算 :reasoning(title,abstract);verifier(title);planning(abstract);分类 cs.LG
AI总结 研究针对建筑物热能存储控制中模型难以扩展的问题,采用基于可验证奖励的强化学习,通过强化微调训练开放权重推理模型,在简单办公楼TES基准测试中取得较好效果,明确了规划模式转移情况,推动了相关测试与验证器发展。
Comments 29 pages, 8 figures
RLVR 相对于 SFT 在推理模型中的可证明优势:学习高效回溯
机构 * Princeton University(普林斯顿大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 本文从理论上证明,在推理任务中,基于可验证奖励的强化学习(RLVR)相比监督微调(SFT)能学习高效回溯,从而在推理时计算上实现指数级优势。
ProcessThinker: 通过基于展开的过程奖励增强多模态大语言模型推理
机构 * LMU Munich(慕尼黑大学) ; Harvard University(哈佛大学) ; University of Cambridge(剑桥大学) ; Mina AI ; Konrad Zuse School of Excellence in Reliable AI (relAI)(康拉德·楚泽可靠人工智能卓越学校(relAI))
专题命中 测试时计算 :reasoning(title,abstract);logical reasoning(abstract,comments);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ProcessThinker,一种无需显式过程奖励模型的后训练方法,通过步骤标记格式和基于展开的过程奖励,为多步推理提供密集的步骤级奖励,提升多模态推理一致性。
Comments Accepted at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. 7 pages, 1 figure
CritiqueDriveVLM:从验证器引导的强化学习到自动驾驶的潜在思想蒸馏
机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) ; School of Digital Media & Design Arts(数字媒体与设计艺术学院) ; Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 提出CritiqueDriveVLM框架解决自动驾驶中推理幻觉等问题,先通过验证器引导的强化学习培养强大教师模型,再用潜在思想蒸馏压缩能力到学生模型,提升性能并大幅降低推理延迟。
Comments Accepted by ECCV 2026
从最小标签扩展LLM推理:一种带有轻量级验证器的半监督框架
机构 * Fujitsu Limited(富士通株式会社) ; Kyoto University(京都大学) ; National Institute of Informatics(国立信息学研究所)
专题命中 测试时计算 :reasoning(title,abstract);verifier(title);分类 cs.CL、cs.AI
AI总结 提出半监督框架,用轻量级推理正确性分类器和熵过滤从少量标注数据生成高质量伪推理链,在数学和视觉问答任务上达到10-15倍标注数据效果。
Comments LREC 2026. Section 3.3 is updated
LaRec:释放基于大语言模型的生成式推荐中的潜在推理能力
专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)
AI总结 研究针对LLMs在推荐中现有方法的问题,提出LaRec框架。核心方法是通过潜在预训练赋予潜在推理能力,用个性化强化学习调整引导遍历多样推理路径。主要贡献是在多数据集实验中,以相当效率显著超越现有基线。
无验证器的测试时扩展的一致性方法
专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文针对现有基于置信度的无验证器测试时扩展(VF-TTS)方法在复杂任务上失效的问题,提出一致性(consilience)框架,通过评估置信度时间不对称性提升LLM推理性能,在数学和代码生成任务上优于基线。