StatsClaw: An AI-Collaborative Workflow for Statistical Software Development
StatsClaw:统计软件开发的AI协作工作流
专题命中 规划推理 :planning(abstract)
AI总结 StatsClaw通过多智能体架构实现统计软件开发的可靠自动化,通过信息隔离机制确保代码生成与验证的独立性,提升软件生命周期的工程效率并保持研究人员对方法学的控制。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
StatsClaw:统计软件开发的AI协作工作流
专题命中 规划推理 :planning(abstract)
AI总结 StatsClaw通过多智能体架构实现统计软件开发的可靠自动化,通过信息隔离机制确保代码生成与验证的独立性,提升软件生命周期的工程效率并保持研究人员对方法学的控制。
不要浪费比特!面向轻量级设备LLM的自适应KV缓存量化
机构 * Clemson University(克莱姆森大学)
专题命中 规划推理 :reasoning(abstract)
AI总结 本文提出自适应KV缓存量化方法,通过动态调整token重要性分配比特数,减少内存和延迟并提升准确性。
Comments Accepted by the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
将领域专用语言模型与AI测量工具整合用于确定性原子分辨率实验
专题命中 规划推理 :planning(abstract)
AI总结 本文提出一种框架,通过专门的小语言模型实现扫描探针显微镜的自主控制,结合AI驱动的测量工具,实现室温下的原子分辨率SPM实验,提升实验可靠性和可控性。
数字孪生与约束性大语言模型的系统整合用于可解释的网络物理异常检测
专题命中 规划推理 :reasoning(abstract)
AI总结 本文提出一种结合确定性启发法与约束性大语言模型的混合检测方法,用于实时检测工业控制系统中的异常,通过数字孪生保持过程同步并生成行为描述,验证了该方法在四个典型攻击场景中的有效性。
通过高效深度学习策略实现多模态城市树木检测:结合卫星和街景图像
机构 * Department of Computer Science, University of California, Davis(加州大学戴维斯分校计算机科学系) ; Department of Biological and Agricultural Engineering, University of California, Davis(加州大学戴维斯分校生物与农业工程系)
专题命中 规划推理 :planning(abstract)
AI总结 本文提出多模态框架,结合高分辨率卫星图像与地面Google街景图像,实现低标注条件下城市树木的高效检测。通过领域自适应和三种学习策略(半监督、主动学习、混合策略),提升检测精度,混合策略F1-score达0.90,显著优于基线模型。
通过序列世界模型增强多机器人协作
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室)
专题命中 规划推理 :planning(abstract)
AI总结 本文提出SeqWM框架,通过引入序列范式提升多机器人MBRL的协作能力,实验表明其在性能和样本效率上优于现有方法,并展示了预测适应、时间对齐和角色分配等先进协作行为。
Embodied-R1:强化的具身推理用于通用机器人操作
机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)
专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出Embodied-R1,通过引入指向作为统一的中间表示,结合强化微调方法,实现通用机器人操作中的具身推理,展示了在多个基准测试中的卓越性能和零样本泛化能力。
Comments Embodied-R1 technical report v2; Published as a conference paper at ICLR 2026
多模态字体攻击在音频视觉推理中的系统研究
机构 * Boston University(波士顿大学)
专题命中 视觉空间推理 :reasoning(title,abstract)
AI总结 本文研究多模态字体攻击对多模态大语言模型的影响,发现跨模态攻击比单模态攻击更有效,揭示了多模态推理中的关键安全漏洞。
FunFact:通过因子图推理构建概率性功能3D场景图
机构 * ETH Zürich(苏黎世联邦理工学院) ; Microsoft(微软) ; University of Bonn & Lamarr Institute(波恩大学与拉马尔研究所)
专题命中 视觉空间推理 :reasoning(title)
AI总结 FunFact通过因子图推理构建概率性功能3D场景图,结合语义和几何先验,提升场景功能理解的鲁棒性与准确性。
3D点云深度学习中的持久同调设计空间
机构 * Saint Mary's University, Halifax, Canada(圣玛丽大学(哈利法克斯,加拿大)) ; Nanjing Forestry University, China(南京林业大学)
专题命中 视觉空间推理 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
AI总结 本文提出一个统一的设计空间,将持久同调用于3D点云学习,通过六个注入点将拓扑学作为结构诱导偏差,提升分类和分割的准确性与鲁棒性。
Comments 27 pages, 12 figures, 5 tables
HI-MoE:基于实例的混合专家架构用于目标检测
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
AI总结 HI-MoE提出一种分层实例条件混合专家架构,通过两级路由机制提升目标检测效率,尤其在小目标检测上表现优异。
InfBaGel: 基于动态感知和迭代细化的人-物体-场景交互生成
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Sichuan University(四川大学) ; Shenzhen University(深圳大学) ; The University of Hong Kong(香港大学)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种粗到细的指令条件交互生成框架,结合一致性模型的迭代去噪过程,通过动态感知策略和 bump-aware 指导减少物理伪影,提升 HOSI 和 HOI 生成性能。
Comments ICLR 2026
超越静态视觉:场景动态场解锁多模态大语言模型中的直观物理理解
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tianjin University(天津大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI
AI总结 研究探讨多模态大语言模型在物理理解上的不足,提出Scene Dynamic Field方法提升对连续物体动态的理解能力,实现20.7%的改进并展现良好的泛化能力。
看清它,放置它:利用视觉-语言模型进行宏放置
机构 * Harvard University(哈佛大学) ; Kempner Institute for the Study of Natural and Artificial Intelligence(肯普纳自然与人工智能研究所) ; Google DeepMind(谷歌DeepMind)
专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出利用视觉-语言模型进行芯片布局中的宏放置优化,通过进化搜索策略提升放置质量,在9/10基准上优于现有方法,且能泛化至分析型布局器。
Comments 31 pages, 12 figures, 14 tables
超越全局评分:细粒度令牌接地作为检测LVLM幻觉的稳健检测器
机构 * Hanoi University of Science and Technology(河内科技大学) ; Australian Institute for Machine Learning, University of Adelaide(澳大利亚机器学习研究所,阿德莱德大学) ; Nanjing University(南京大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Hanoi-Amsterdam High School for the Gifted(河内阿姆斯特丹天才高中)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出细粒度令牌接地方法,通过分析模型层间令牌交互,发现幻觉令牌的扩散注意力模式和语义对齐失败特征,实现90%的幻觉检测准确率。
Comments Accepted at CVPR2026 Main Track
大语言模型在设计综合中的可靠性:方差、提示敏感性和方法框架的实证研究
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本研究探讨大语言模型在设计综合中的可靠性,通过方差、提示敏感性和方法框架的实证分析,评估三种LLM在不同提示策略下的表现,发现偏好对齐虽提升设计意图符合度,但无法消除非确定性,模型行为影响设计可靠性。
Journal ref International Conference on Software Architecture 2026
对软件架构图理解的VLMs基准测试与评估
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出SADU基准,评估VLMs在理解软件架构图作为结构化软件工程制品上的能力,揭示当前模型在图表推理和视觉关系定位方面的不足。
基于场景图的多模态交通代理:视频理解的模块化框架
机构 * Technical University of Munich(慕尼黑工业大学)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 SGTA结合结构化场景图与多模态推理,通过检测、跟踪和车道提取构建交通场景图,并利用ReAct处理大语言模型的推理轨迹,实现复杂视频问题的可解释决策。
弥合维度差距:2D视觉模型适应3D分析的分类与综述
机构 * Independent Researcher(独立研究员)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文综述了将2D视觉模型适应3D分析的策略,分类为数据导向、架构导向和混合方法,探讨了计算复杂度、预训练依赖性和几何归纳偏置的权衡。
Comments VISAPP 2026
Journal ref Proceedings of the 21st International Conference on Computer Vision Theory and Applications - Volume 3: VISAPP 2026; ISBN 978-989-758-804-4; ISSN 2184-4321, SciTePress, pages 353-364
全景语言模型:超越拼接的全景场景理解
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Hunan University(湖南大学) ; Shenzhen University(深圳大学) ; UCL(伦敦大学学院)
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出全景语言模型PLM,通过全景图像实现超越单目视角的综合推理,同时构建包含恶劣全景场景的PanoVQA数据集,开发可插拔的稀疏注意力模块以提升模型处理全景图像的能力。
Comments Accepted by CVPR 2026. Project page: https://github.com/InSAI-Lab/PanoVQA
ArchMap:用于牙齿计数和结构牙科理解的拱形扁平化和知识引导的视觉语言模型
机构 * Xi'an Jiaotong-Liverpool University(西交利物浦大学) ; University of Liverpool(利物浦大学) ; Zhejiang University of Technology(浙江工业大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 视觉空间推理 :reasoning(abstract)
AI总结 本文提出ArchMap,一种无需训练的知识引导框架,通过几何归一化和本体引导的多模态推理,提升3D口腔扫描的结构化分析能力,实现牙齿计数、解剖分区、牙列阶段分类及临床状况识别。
Journal ref In Proceedings of the 2025 IEEE International Conference on Big Data (BigData), pp. 7529-7538, 2025
阿普里尔-1.5-开放式推理机:基于强化学习的后训练通用高效推理
机构 * ServiceNow
专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG
AI总结 本文提出Apriel-1.5-OpenReasoner,通过可复现的多领域强化学习后训练方法,在Apriel-Base上实现跨五个领域的通用高效推理,提升推理效率并优化不同难度问题的推理长度。
Comments 20 pages, 4 tables, 6 figures, appendix included
CODA:面向自适应推理的难度感知计算分配
机构 * Fudan University(复旦大学)
专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出CODA,通过难度感知信号动态分配计算资源,实现自适应推理。在易任务中降低token成本,在难任务中提升性能。
解毒经验提升LLM代理的测试时间推理
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Stanford University(斯坦福大学) ; MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 测试时计算 :reasoning(abstract);math reasoning(abstract);test-time compute(abstract);分类 cs.AI、cs.LG
AI总结 本文研究通过解毒经验提升LLM代理测试时间推理性能,探讨如何通过经验构建有效上下文以优化复杂推理任务。
回顾锚定策略优化:在稀疏奖励设置中将失败转化为反馈
机构 * Amazon(亚马逊)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出HAPO策略优化方法,通过合成成功注入机制和 Thompson 采样启发的门控机制,解决稀疏奖励下策略优化的分布偏置问题,实现渐近一致性。
Comments Published as a conference paper ICLR 2026 CAO Workshop
向下钻探与伪造测试(DDFT):一种衡量语言模型认知鲁棒性的协议
专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出DDFT协议,用于评估语言模型在语义压缩和对抗性伪造下的认知鲁棒性,发现鲁棒性与传统设计无关,且错误检测能力是关键瓶颈。
Comments This version strengthens the theoretical and empirical grounding of the CI metric, including explicit analysis of structural dependencies and ranking stability under ablations (e.g., excluding Turn 4). Claims regarding scale and robustness are revised to avoid overgeneralization. The evaluation protocol, jury methodology, and limitations are expanded to clarify assumptions and boundary conditions
基于多视角地面影像的自动化火灾损害评估:通过视觉语言模型
机构 * Department of Computer Science and Engineering, Texas A&M University(德州农工大学计算机科学与工程系)
专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出利用预训练多模态大语言模型进行火灾损害评估,通过对比实验验证多视角分析的有效性,展示了零样本方法在快速准确评估中的应用。
重点至关重要:面向视觉语言模型中幻觉的相位感知抑制
机构 * Pusan National University(釜山大学) ; Pukyong National University(釜庆大学)
专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出一种轻量级干预方法,在视觉编码器的聚焦阶段选择性抑制低关注的token,通过单次前向传递统计信息和DPP保留多样视觉线索,减少幻觉的同时保持caption质量,且推理延迟低。
多轮医学诊断基准测试:Hold、Lure 和 Self-Correction
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; New York University(纽约大学) ; The University of Texas Southwestern Medical Center(德克萨斯大学西南医学中心) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL
AI总结 本文通过MINT基准测试揭示了大语言模型在多轮证据积累中的行为模式,发现提前回答、自我修正和强诱因影响诊断决策,提出延迟提问和保留关键证据可提升诊断准确性。
LightThinker++:从推理压缩到内存管理
机构 * Zhejiang University(浙江大学)
专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出LightThinker++,通过引入显式自适应内存管理,有效压缩LLM推理过程中的中间思维,减少内存占用并提升推理效率,尤其在长周期智能任务中表现突出。
Comments Work in progress. This is an extended version of LightThinker