arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-19 至 2026-05-19 共收录 279 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 72 篇

2502.02463 2026-05-19 stat.ML cs.LG 57%

Distribution Transformers: Fast Approximate Bayesian Inference With On-The-Fly Prior Adaptation

分布变换器:通过实时先验适应实现快速近似贝叶斯推断

George Whittle, Juliusz Ziomek, Jacob Rawling, Maike A. Osborne

机构 * Mind Foundry Ltd(Mind Foundry有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出分布变换器,一种能够学习任意分布到分布映射的新型架构,通过实时先验适应实现快速近似贝叶斯推断,显著降低计算时间并达到与现有方法相当或更优的对数似然性能。

Comments Spotlight acceptance at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18111 2026-05-19 cs.CL cs.CV 57%

How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking

LLMs在回答孟加拉语医学视觉问题方面的表现如何?数据集与基准测试

Rafid Ahmed, Intesar Tahmid, Mir Sazzat Hossain, Tasnimul Hossain Tomal, Md Fahim, Md Farhad Alam Bhuiyan

机构 * Penta Global Limited Center for Computational & Data Sciences, Independent University(独立大学计算与数据科学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出BanglaMedVQA数据集,用于评估当前基础模型在孟加拉语医学视觉问答任务中的表现,发现其性能显著低于英语基准,揭示了低资源语言在医学推理中的挑战。

Comments 14 pages, 7 figures, 5 tables, Proceedings of The Second AAAI Bridge Program on AI for Medicine and Healthcare, PMLR 317:1-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18101 2026-05-19 cs.CV cs.AI 57%

SENSE: Satellite-based ENergy Synthesis for Sustainable Environment

SENSE: 基于卫星的能源合成以实现可持续环境

Kailai Sun, Mingyi He, Heye Huang, Can Rong, Alok Prakash, Baoshen Guo, Shenhao Wang, Jinhua Zhao

机构 * Massachusetts Institute of Technology(麻省理工学院) University of Florida(佛罗里达大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文提出SENSE,一种统一的生成性城市建筑能耗框架,通过结合生成扩散模型和大规模视觉模型知识,生成高分辨率的城市卫星图像和对齐的高质量建筑能耗和高度地图,以提高城市可持续发展预测性能。

Comments Accpted by KDD 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17911 2026-05-19 cs.CL 57%

A Pilot Benchmark for NL-to-FOL Translation in Planetary Exploration

行星探测中自然语言到一阶逻辑翻译的试点基准

Hayden Moore, Suman Saha, Mahfuza Farooque

机构 * Department of Computer Science and Engineering, College of Engineering, The Pennsylvania State University(计算机科学与工程系,工程学院,宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一个试点基准,用于在行星探测领域将自然语言转换为一阶逻辑,通过NASA PDS的实测文档构建数据集,并手动标注FOL表示,以支持语言理解和形式推理的交叉研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17826 2026-05-19 cs.CV cs.AI 57%

CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models

CounterCount: 一种用于视觉语言模型计数偏差诊断的框架

Reem Alzahrani, Hassan Alshanqiti, Bushra Bin Hemid, Zaid Alyafeai, Abdelrahman Eldesokey, Bernard Ghanem

机构 * KAUST(卡尔斯鲁德大学) University of Edinburgh(爱丁堡大学) King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出CounterCount框架,通过对比事实性与反事实性图像来诊断视觉语言模型在计数任务中的偏差问题,揭示模型对物体级先验知识的依赖,并提出统一的注意力调节策略提升反事实计数准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17625 2026-05-19 cs.AI 57%

Episodic-Semantic Memory Architecture for Long-Horizon Scientific Agents

用于长周期科学代理的事件-语义记忆架构

Nikola Milosevic

机构 * Serbian Institute for Artificial Intelligence Research and Development(塞尔维亚人工智能研究与发展研究所) Bayer A.G.(勃林格殷曼有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种双过程记忆架构,用于解决科学代理在长周期任务中面临的情境窗口饱和问题,通过分离即时事件需求和长期知识整合,提升了在大规模科学工作流中的表现和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17435 2026-05-19 cs.CL 57%

BELIEF: Structured Evidence Modeling and Uncertainty-Aware Fusion for Biomedical Question Answering

BELIEF: 结构化证据建模与不确定性感知融合用于生物医学问答

Chang Zong, Hao Ning, Siliang Tang, Jie Huang, Jian Wan

机构 * School of Computer Science and Technology, Zhejiang University of Science and Technology(浙江理工大学计算机科学与技术学院) College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院) Zhejiang Key Laboratory of Biomedical Intelligent Computing Technology, Zhejiang University of Science and Technology(浙江理工大学生物医学智能计算技术重点实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出BELIEF框架,通过结构化证据建模和不确定性感知融合,提升生物医学问答任务中检索文献的利用效率,实现对证据可靠性、不确定性以及候选假设的支持强度的显式建模。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23355 2026-05-19 cs.AI 57%

LEGO: An LLM Skill-Based Front-End Design Generation Platform

LEGO: 一个基于LLM技能的前端设计生成平台

Jincheng Lou, Ruohan Xu, Jiecheng Ma, Runzhe Tao, Xinyu Qu, Yibo Lin

机构 * School of IC, Peking University(北京大学集成电路学院) School of EECS, Peking University(北京大学电子信息技术学院) School of Microelectronics, Xidian University(西安电子科技大学微电子学院) Institute of EDA, Peking University(北京大学EDA研究院) Beijing Advanced Innovation Center for IC(北京集成电路先进创新中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LEGO平台,通过将数字前端流程分解为六个独立步骤,并将每个代理能力表示为标准化的可组合电路技能,实现了高效的前端设计生成,显著提升了RTL设计自动化的效果。

Comments Accepted to ISEDA 2026. Best Paper Nomination. 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24238 2026-05-19 cs.LG 57%

Time Series Foundation Models as Strong Baselines in Transportation Forecasting: A Large-Scale Benchmark Analysis

时间序列基础模型在交通预测中的强大基准作用:一项大规模基准分析

Javier Yanes-Pulido, Filipe Rodrigues

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 本文通过在十个真实世界数据集上评估最新时间序列模型Chronos-2的零样本性能,证明了通用时间序列基础模型在交通预测中的有效性,展示了其在多数数据集上达到或超越传统统计基线和专用深度学习架构的准确性,尤其在长预测范围内表现突出。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04070 2026-05-19 cs.CL 57%

T-FIX: Text-Based Explanations with Features Interpretable to eXperts

T-FIX:基于文本的可解释性方法,具备可解释的专家特征

Shreya Havaldar, Weiqiu You, Chaehyeon Kim, Anton Xue, Helen Jin, Marco Gatti, Bhuvnesh Jain, Helen Qu, Amin Madani, Daniel A. Hashimoto, Gary E. Weissman, Rajat Deo, Sameed Khatana, Lyle Ungar, Eric Wong

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Computer Science, University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Department of Physics and Astronomy, University of Pennsylvania(宾夕法尼亚大学物理与天文学系) Flatiron Institute(Flatiron研究所) Department of Surgery, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院外科系) Division of Pulmonary, Allergy, and Critical Care, Perelman School of Medicine, University of Pennsylvania(宾夕菲亚大学佩雷尔曼医学院呼吸、过敏与危重医学科) Division of Cardiovascular Medicine, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院心血管医学科) Department of Surgery, University of Toronto(多伦多大学外科系) University Health Network(大学健康网络)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出T-FIX框架,用于评估LLM生成的解释是否符合专家的推理方式,通过七个科学任务和三个领域进行验证,实现了自动且可定制的专家对齐评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08886 2026-05-19 cs.CL cs.CE cs.IR 57%

FinAuditing: A Financial Taxonomy-Structured Multi-Document Benchmark for Evaluating LLMs

FinAuditing: 一个基于财务分类结构的多文档基准,用于评估LLMs

Yan Wang, Keyi Wang, Shanshan Yang, Jaisal Patel, Jeff Zhao, Fengran Mo, Xueqing Peng, Lingfei Qian, Yankai Chen, Víctor Gutiérrez-Basulto, Jimin Huang, Guojun Xiong, Xiao-Yang Liu, Xue Liu, Jian-Yun Nie

机构 * Columbia University(哥伦比亚大学) Stevens Institute of Technology(史蒂文斯理工学院) Rensselaer Polytechnic Institute(拉特格斯理工学院) University of Montreal(蒙特利尔大学) McGill University(麦吉尔大学) MBZUAI(麦吉尔大学人工智能研究所) Cardiff University(卡迪夫大学) The University of Manchester(曼彻斯特大学) Harvard University(哈佛大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出FinAuditing,一个基于财务分类结构的多文档基准,用于评估大型语言模型在财务审计任务中的能力,通过三个任务:财务语义匹配、财务关系提取和财务数学推理,揭示了现有LLMs在概念检索、分类感知关系建模和跨文档一致性推理方面的显著差距。

Comments Accepted by SIGIR 2026 Resource Track. Pre-camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05606 2026-05-19 cs.CL cs.HC 57%

OPeRA: A Dataset of Observation, Persona, Rationale, and Action for Evaluating LLMs on Human Online Shopping Behavior Simulation

OPeRA: 一个用于评估LLM在模拟人类在线购物行为上的表现的观察、人设、推理和行动数据集

Ziyi Wang, Yuxuan Lu, Wenbo Li, Amirali Amini, Bo Sun, Yakov Bart, Weimin Lyu, Jiri Gesi, Tian Wang, Jing Huang, Yu Su, Upol Ehsan, Malihe Alikhani, Toby Jia-Jun Li, Lydia Chilton, Dakuo Wang

机构 * Northeastern University(东北大学) University of Southern California(南加州大学) Stony Brook University(石溪大学) Independent Researcher(独立研究者) Ohio State University(俄亥俄州立大学) University of Notre Dame(Notre Dame 大学) Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出OPeRA数据集,用于评估LLM在模拟人类在线购物行为上的能力,通过收集真实用户在在线购物会话中的观察、人设、推理和行动,建立首个评估LLM预测特定用户下一步行动和推理的基准。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17093 2026-05-19 cs.CV cs.CL 57%

HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation

HEED:基于密度加权残差对齐的混合视觉-语言模型蒸馏

Yihao Liang, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出HEED方法,通过密度加权残差对齐改进混合视觉-语言模型蒸馏,提升在OCR和文档任务中的性能,同时在不同教师模型和混合架构上实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17007 2026-05-19 cs.CL 57%

HalluScore: Large Language Model Hallucination Question Answering Benchmark

HalluScore: 大语言模型幻觉问答基准

Aisha Alansari, Hamzah Luqman

机构 * Department of Information and Computer Science, King Fahd University of Petroleum and Minerals(国王法赫德石油与矿物大学信息与计算机科学系) SDAIA-KFUPM Joint Research Center for Artificial Intelligence(SDAIA-KFUPM人工智能联合研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出HalluScore基准,用于评估大语言模型在不同推理难度、知识领域、历史时间线和文化场景中的幻觉行为,通过827个精心编写的题目评估、检测和缓解幻觉,同时提供高质量的人类标注以识别不同模型的幻觉表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16999 2026-05-19 cs.LG 57%

Ranking-Aware Calibration for Reliable Multimodal Reinforcement Learning

基于排名的校准:可靠多模态强化学习

Peng Cui, Boyao Yang, Jun Zhu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, BNRist Center, Tsinghua-Bosch Joint ML Center, THBI Lab, Tsinghua University, Beijing(计算机科学与技术系,人工智能研究院,BNRist中心,清华大学-博世联合机器学习中心,THBI实验室,清华大学,北京) Dept. of Automation, Tsinghua University, Beijing(自动化系,清华大学,北京)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Ranking-Aware Calibration方法,通过利用组内强化学习自然产生的比较信号,提升多模态强化学习的校准能力,从而提高任务准确性和校准效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16909 2026-05-19 cs.AI 57%

TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents

TOBench:面向真实世界工具使用代理的任务导向多模态基准

Zhiqiang Liu, Wenhui Dong, Yilang Tan, Yuwen Qu, Haochen Yin, Chenyang Si

机构 * Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学) Southwest Jiaotong University(西南交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TOBench,一个面向真实世界工具使用代理的多模态基准,通过闭环多模态验证设计,评估和推动下一代多模态工具使用代理的发展。

Comments Github: https://github.com/Pi3AI/TOBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16883 2026-05-19 cs.LG 57%

SE-GA: Memory-Augmented Self-Evolution for GUI Agents

SE-GA:基于记忆的自进化GUI代理

Shilong Jin, Lanjun Wang, Zhuosheng Zhang

机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(天津大学智能与计算学院) School of New Media and Communication, Tianjin University, Tianjin, China(天津大学新媒体与传播学院) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 本文提出SE-GA框架,通过整合分层记忆结构和迭代自我改进机制,解决GUI代理在多步骤任务中因上下文窗口受限和静态策略无法适应动态环境的问题,实验表明其在多个基准测试中均达到领先性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16821 2026-05-19 cs.AI 57%

Multi-Paradigm Agent Interaction in Practice:A Systematic Analysis of Generator-Evaluator, ReAct Loop,and Adversarial Evaluation in the buddyMe Framework

多范式代理交互实践:buddyMe框架中生成器-评估器、ReAct循环和对抗性评估的系统分析

Xiaohua Wang, Chao Han, Kai Yu, XiaoLiang Xu, Liang Wang

机构 * BuddyMe Research Team(buddyMe研究团队) CHARMMIRAEL Biotech Co., Ltd(CHARMMIRAEL生物技术有限公司)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 本文通过系统分析buddyMe框架中生成器-评估器、ReAct循环和对抗性评估三种代理交互范式,揭示了在实际应用中多范式代理系统的设计挑战与优化策略。

Comments 11 pages, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14498 2026-05-19 cs.CL 57%

GroupMemBench: Benchmarking LLM Agent Memory in Multi-Party Conversations

GroupMemBench: 多方对话中LLM代理记忆的基准测试

Jingbo Yang, Kwei-Herng Lai, Xiaowen Wang, Shiyu Chang, Yaar Harari, Evgeniy Gabrilovich

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) Microsoft(微软)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出GroupMemBench,用于评估多方对话中LLM代理的记忆能力,揭示现有记忆系统在群体动态、信念跟踪和语言适应方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21937 2026-05-19 cs.AI cs.MA 57%

MolClaw: An Autonomous Agent with Hierarchical Skills for Drug Molecule Evaluation, Screening, and Optimization

MolClaw:一种具有分层技能的自主代理,用于药物分子评估、筛选和优化

Lisheng Zhang, Lilong Wang, Xiangyu Sun, Wei Tang, Haoyang Su, Yuehui Qian, Qikui Yang, Qingsong Li, Zhenyu Tang, Haoran Sun, Yingnan Han, Yankai Jiang, Wenjie Lou, Bowen Zhou, Xiaosong Wang, Lei Bai, Zhengwei Xie

机构 * Peking University Health Science Center, Peking University, Beijing, China(北京大学北京医院科学中心,北京大学,北京,中国) Shanghai AI Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Academy for Advanced Interdisciplinary Studies, Peking University, Beijing, China(北京大学先进跨学科研究学院,北京大学,北京,中国)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 MolClaw通过分层技能架构整合30余种领域资源,实现药物分子评估、筛选和优化的自动化,其在复杂工作流中的表现优于现有AI代理。

Comments 28 pages, 8 figures. Code and data will be released

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23986 2026-05-19 cs.AI 57%

TusoAI: Agentic Optimization for Scientific Methods

TusoAI: 科学方法的代理优化

Alistair Turcan, Kexin Huang, Lei Li, Martin Jinye Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Phylo

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TusoAI通过整合领域知识和迭代优化,提升科学任务中计算方法的性能,优于现有专家方法和科学AI代理,在单细胞RNA测序数据去噪和卫星地球监测等任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05442 2026-05-19 cs.CV cs.AI 57%

Structured Labeling Enables Faster Vision-Language Models for End-to-End Autonomous Driving

结构化标注加速面向端到端自动驾驶的视觉-语言模型

Hao Jiang, Chuan Hu, Yukang Shi, Yuan He, Ke Wang, Xi Zhang, Zhipeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) KargoBot

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出结构化标注的NuScenes-S数据集和紧凑型FastDrive模型,提升自动驾驶中决策任务的效率与准确性,实验显示在结构化数据集上性能优异,推理速度提升超10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16547 2026-05-19 cs.LG 57%

World Model-Enabled Causal Digital Twins for Semantic Communications in Physical AI Systems

面向物理人工智能系统的语义通信世界模型增强因果数字孪生

Lingyi Wang, Tingyu Shui, Walid Saad, Pascal Adjakple

机构 * Bradley Department of Electrical and Computer Engineering, Virginia Tech(弗吉尼亚理工大学电子与计算机工程系 Bradley 部门) Research and Innovation Labs, InterDigital Communications Inc.(InterDigital Communications Inc. 研究与创新实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出基于世界模型的因果数字孪生框架,解决物理人工智能系统中语义通信的长期回报最大化问题,通过因果信息价值指标和策略训练提升导航成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16439 2026-05-19 cs.CV cs.AI 57%

KVCapsule: Efficient Sequential KV Cache Compression for Vision-Language Models with Asymmetric Redundancy

KVCapsule: 用于视觉-语言模型的高效序列KV缓存压缩方法:不对称冗余

Yingbing Huang, Tharun Adithya Srikrishnan, Steven K. Reinhardt, Deming Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) AMD

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出KVCapsule,一种针对视觉语言模型的KV缓存压缩框架,通过轻量压缩和重建组件实现内存节省,提升吞吐量并减少内存占用,同时保持精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13839 2026-05-19 cs.CV 50%

DisasterVQA: A Visual Question Answering Benchmark Dataset for Disaster Scenes

DisasterVQA: 一个用于灾难场景的视觉问答基准数据集

Aisha Al-Mohannadi, Ayisha Firoz, Yin Yang, Muhammad Imran, Ferda Ofli

机构 * Qatar Computing Research Institute(卡塔尔计算研究所) Hamad Bin Khalifa University(哈马德·本·卡伊夫大学) College of Science & Engineering(科学与工程学院) Qatar University(卡塔尔大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出DisasterVQA数据集,用于灾难场景中的感知与推理任务,通过1395张真实图像和4405对专家 curated 的问答对,评估了七种最先进的视觉-语言模型在灾难响应中的性能,发现模型在细粒度定量推理、物体计数和上下文敏感解释方面存在不足。

Comments Accepted at ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17527 2026-05-19 cs.CV 50%

Designing streetscapes from street-view imagery using diffusion models

利用扩散模型从街景图像中设计街道景观

Yuzhou Chen, Yuebing Liang, Lingqian Hu, Kailai Sun, Qingqi Song, Chang Zhao, Shenhao Wang

机构 * Department of Urban and Regional Planning, University of Florida(城市与区域规划系,佛罗里达大学) Singapore-MIT Alliance for Research and Technology Centre (SMART)(新加坡-麻省理工联合研究中心(SMART)) Department of Landscape Architecture and Urban Planning, Texas A&M University(景观建筑与城市规划系,德克萨斯大学安德森分校) Department of Agronomy, University of Florida(农业系,佛罗里达大学)

专题命中 推理评测 :planning(abstract)

AI总结 本文提出了一种生成多模态AI框架,通过目标视觉指标生成替代的街道景观,提升了城市规划和设计中的视觉探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20522 2026-05-19 cs.CV 50%

AI-assisted radiographic analysis in detecting alveolar bone-loss severity and patterns

辅助人工智能的放射学分析用于检测牙槽骨丧失的严重程度和模式

Chathura Wimalasiri, Piumal Rathnayake, Shamod Wijerathne, Sumudu Rasnayaka, Dhanushka Leuke Bandara, Roshan Ragel, Vajira Thambawita, Isuru Nawinne

机构 * Faculty of Engineering, University of Peradeniya(工程学院,珀德尼亚大学) Faculty of Dental Sciences, University of Peradeniya(牙科学院,珀德尼亚大学) Simula Metropolitan Center for Digital Engineering(模拟 Metropolitan 数字工程中心)

专题命中 推理评测 :planning(abstract)

AI总结 本研究提出了一种新型的基于人工智能的深度学习框架,利用牙内窥镜根尖放射图像自动检测和量化牙槽骨丧失及其模式,通过结合YOLOv8进行牙齿检测和Keypoint R-CNN模型识别解剖标志物,实现了对牙槽骨丧失严重程度的精确计算,并通过几何分析确定水平与角状骨丧失模式,实验结果在1000张专家标注的放射图像上达到了高准确率。

Comments This manuscript is 17 pages with 5 tables and 12 figures. The manuscript is under review at Nature Scientific Reports

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17336 2026-05-19 cs.RO cs.CV eess.SP 50%

Tactile-based Multimodal Fusion in Embodied Intelligence: A Survey of Vision, Language, and Contact-Driven Paradigms

基于触觉的多模态融合在具身智能中的应用:视觉、语言和接触驱动范式的综述

Zhixiang Cao, Di Tian, Runwei Guan, Yanzhou Mu, Xiaolou Sun, Shaofeng Liang, Daizong Liu, Tao Huang, Yutao Yue, Henghui Ding, Bin Fang, Alex Zhou, Qing-Long Han, Hui Xiong

机构 * School of Electronic Science and Engineering, Xi’an Jiaotong University, China(西安交通大学电子科学与技术学院) Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)人工智能研究所) State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) Purple Mountain Laboratory, China(紫金山实验室) Institute for Math & AI, Wuhan University, China(武汉大学数学与人工智能学院) Centre for AI and Data Science Innovation and the School of Science and Engineering, James Cook University, Australia(詹姆斯库克大学人工智能与数据科学创新中心及科学与工程学院) School of Artificial Intelligence, Beijing University of Posts and Telecommunications, China(北京邮电大学人工智能学院) Institute of Big Data, Fudan University, China(复旦大学大数据研究院) Linkerbot (Beijing) Technology Co., Ltd, China(北京链动科技有限公司) School of Engineering, Swinburne University of Technology, Melbourne(斯威本技术大学工程学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文综述了多模态触觉融合在具身智能中的研究,探讨了如何通过整合视觉、语言和触觉信息来提升物理交互与语义推理的结合,提出了一种分层的分类体系,并总结了当前的研究挑战和未来方向。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17225 2026-05-19 eess.AS 50%

Can Large Audio Language Models Ignore Multilingual Distractors? An Evaluation of Their Selective Auditory Attention Capabilities

大型音频语言模型能否忽略多语言干扰?对其选择性听觉注意力能力的评估

Heejoon Koo

专题命中 推理评测 :reasoning(abstract)

AI总结 本文通过引入MUSA多语言基准测试,评估了大型音频语言模型在多语言干扰下的选择性听觉注意力能力,发现单阶段性能强并不意味着在复杂环境下具有鲁棒性,分离技术虽减少声音重叠但无法解决源归属问题。

Comments 2 figures, 9 tables, and 12 pages total, with 4 pages of main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17070 2026-05-19 cs.CV 50%

EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models

EPIC-Bench: 一种以感知为中心的细粒度具身视觉 grounding 的基准

Haozhe Shan, Xiancong Ren, Han Dong, Haoyuan Shi, Yingji Zhang, Jiayu Hu, Yi Zhang, Yong Dai, Bin Shen, Lizhen Qu, Zenglin Xu, Xiaozhu Ju

机构 * X-Humanoid Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Monash University(墨尔本大学) Celonis AI University of New South Wales(新南威尔士大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出 EPIC-Bench,一种以感知为中心的细粒度具身视觉 grounding 基准,旨在系统评估 VLMs 在现实世界具身环境中的视觉感知能力。该基准包含 6.6k 个精心标注的元组(图像,文本,掩码),涵盖 23 个细粒度任务,涉及具身交互管道的三个核心阶段:目标定位、导航和操作。评估结果显示,尽管先进推理模型表现出潜力,但当前 VLMs 在复杂视觉-文本对齐方面普遍存在困难,特别是在多目标计数、部分-整体关系理解和 affordance 区域检测方面存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏