arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3361 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3361 篇

2604.08645 2026-04-13 cs.CV cs.AI cs.LG cs.RO 62%

3D-VCD: Hallucination Mitigation in 3D-LLM Embodied Agents through Visual Contrastive Decoding

3D-VCD:通过视觉对比解码缓解3D-LLM具身代理中的幻觉

Makanjuola Ogunleye, Eman Abdelrahman, Ismini Lourentzou

机构 * Virginia Tech(弗吉尼亚理工大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出3D-VCD,一种用于缓解3D具身代理幻觉的视觉对比解码框架,通过构造扭曲的3D场景图来提升 grounded 推理能力,实验表明其在3D-POPE和HEAL基准上有效。

Comments 8 pages, 6 figures, Accepted at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02231 2026-04-13 cs.CV cs.AI cs.LG 62%

See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models

看见、听见与理解:多模态大语言模型中人类语音理解基准测试

Le Thien Phuc Nguyen, Zhuoran Yu, Samuel Low Yu Hang, Subin An, Jeongik Lee, Yohan Ban, SeungEun Chung, Thanh-Huy Nguyen, JuWan Maeng, Soochahn Lee, Yong Jae Lee

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Kookmin University(国民大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AV-SpeakerBench基准测试,通过3212道多选题评估多模态大语言模型在真实视频中对语音的细粒度理解能力,发现Gemini 2.5 Pro在音频视觉融合方面表现最佳。

Comments Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04638 2026-04-08 cs.AI cs.CL cs.IR 62%

Advancing AI Research Assistants with Expert-Involved Learning

通过专家参与学习推进AI研究助手

Tianyu Liu, Simeng Han, Hanchen Wang, Xiao Luo, Pan Lu, Biqing Zhu, Yuge Wang, Keyi Li, Jiapeng Chen, Rihao Qu, Yufeng Liu, Xinyue Cui, Aviv Yaish, Yuhang Chen, Minsheng Hao, Chuhan Li, Kexing Li, Yinsheng Lu, Xinyu Wei, Qinzhe Xing, Antonia Panescu, Mengbo Wang, Vibha Annaswamy, Alicia Sanchez, Jack Cloherty, Arman Cohan, Hua Xu, Mark Gerstein, James Zou, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) Genentech(基因泰克) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ARIEL框架,通过专家验证任务评估大语言模型和多模态模型在生物医学领域的表现,发现提示工程和轻量级微调能提升文本覆盖,计算扩展策略增强视觉问答能力,构建了集成文本和视觉线索的AI助手,提出可检验的机理假设。

Comments 43 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02071 2026-04-03 cs.CV cs.AI cs.LG 62%

Mining Instance-Centric Vision-Language Contexts for Human-Object Interaction Detection

挖掘实例导向的视觉-语言上下文以实现人-物交互检测

Soo Won Seo, KyungChae Lee, Hyungchan Cho, Taein Son, Nam Ik Cho, Jun Won Choi

机构 * Seoul National University(首尔国立大学) Hanyang University(汉阳大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出InCoM-Net框架,通过整合VLM提取的语义知识与实例特征,提升人-物交互检测的交互推理能力,实验表明其在HICO-DET和V-COCO基准上达到最优性能。

Comments Accepted to CVPR 2026. Code: https://github.com/nowuss/InCoM-Net

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29654 2026-04-01 cs.LG cs.AI stat.ML 62%

Concept frustration: Aligning human concepts and machine representations

概念冲突:对齐人类概念与机器表示

Enrico Parisini, Christopher J. Soelistyo, Ahab Isaac, Alessandro Barp, Christopher R. S. Banerji

机构 * The Francis Crick Institute(弗朗西斯·克里克研究所) Department of Statistical Science, University College London(伦敦大学学院统计科学系) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种几何框架,用于比较监督人类概念与无监督中间表示,揭示概念冲突现象,并展示其在任务对齐几何中的检测能力,为解释AI的发展提供新思路。

Comments 34 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21458 2026-04-01 cs.AI cs.CL cs.CV 62%

MindCube: Spatial Mental Modeling from Limited Views

MindCube:从有限视角构建空间心理模型

Qineng Wang, Baiqiao Yin, Pingyue Zhang, Jianshu Zhang, Kangrui Wang, Zihan Wang, Jieyu Zhang, Keshigeyan Chandrasegaran, Han Liu, Ranjay Krishna, Saining Xie, Jiajun Wu, Li Fei-Fei, Manling Li

机构 * Northwestern University(西北大学) Stanford University(斯坦福大学) New York University(纽约大学) University of Washington(华盛顿大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过MindCube基准测试,探讨视觉语言模型能否从有限视角构建空间心理模型,提出'map-then-reason'方法提升模型性能,实现从37.8%到61.3%的准确率提升。

Comments The latest version includes an expanded discussion of scaffolding, along with updated data statistics and experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27693 2026-03-31 cs.CV cs.AI cs.LG cs.MA cs.MM 62%

LVRPO: Language-Visual Alignment with GRPO for Multimodal Understanding and Generation

LVRPO:基于GRPO的语言-视觉对齐用于多模态理解和生成

Shentong Mo, Sukmin Yun

机构 * Department of Machine Learning, CMU, USA(卡内基梅隆大学机器学习系,美国) Department of Machine Learning, MBZUAI, UAE(穆罕默德·本·扎耶德人工智能大学机器学习系,阿联酋) Department of Artificial Intelligence, Hanyang University ERICA, South Korea(汉阳大学ERICA校区人工智能系,韩国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LVRPO框架,通过GRPO显式对齐语言和视觉表示,提升多模态理解和生成性能,无需辅助编码器或人工目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17112 2026-03-25 cs.AI cs.LG 62%

Cascade-Aware Multi-Agent Routing: Spatio-Temporal Sidecars and Geometry-Switching

级联感知多智能体路由:时空侧车与几何切换

Davide Di Gioia

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出时空侧车模型,通过结合欧几里得和双曲评分器,解决路由几何结构感知问题,提升调度器在不同拓扑下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20975 2026-03-24 cs.CL cs.LG 62%

DiscoUQ: Structured Disagreement Analysis for Uncertainty Quantification in LLM Agent Ensembles

DiscoUQ:用于LLM代理集合不确定性量化中的结构分歧分析

Bo Jiang

机构 * Temple University(Temple 大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出DiscoUQ框架,通过分析代理间分歧的结构特性,提升不确定性量化效果,实验表明其在多个基准测试中表现优异,尤其在弱分歧层级表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20406 2026-03-24 cs.LG cs.AI 62%

Thinking in Different Spaces: Domain-Specific Latent Geometry Survives Cross-Architecture Translation

在不同空间中思考:领域特定的潜在几何在跨架构翻译中得以保持

Marcus Armstrong, Navid Ayoobi, Arjun Mukherjee

机构 * Department of Computer Science(计算机科学系) University of Houston(休斯顿大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了独立训练的语言模型是否收敛到几何兼容的潜在表示,并探讨如何利用这种兼容性在推理时纠正模型行为。通过线性投影矩阵将大教师模型的激活向量映射到小学生模型的坐标系中,通过替换学生内部状态实现干预,结果显示方法在不同推理领域具有泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20823 2026-03-13 cs.CV cs.AI cs.LG 62%

RefTr: Recurrent Refinement of Confluent Trajectories for 3D Vascular Tree Centerlines

RefTr: 基于连通轨迹的3D血管树中心线递归细化

Roman Naeem, David Hagerman, Jennifer Alvén, Fredrik Kahl

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 RefTr通过递归细化连通轨迹生成3D血管树中心线,采用Transformer架构提升精度并减少参数,实验显示其在性能、速度和参数数量上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17439 2026-03-11 cs.RO cs.AI cs.CV cs.LG 62%

From Spatial to Actions: Grounding Vision-Language-Action Model in Spatial Foundation Priors

从空间到动作:在空间先验基础上构建视觉-语言-动作模型

Zhengshen Zhang, Hao Li, Yalun Dai, Zhengbang Zhu, Lei Zhou, Chenchen Liu, Dong Wang, Francis E. H. Tay, Sijin Chen, Ziwei Liu, Yuxiao Liu, Xinghang Li, Pan Zhou

机构 * ByteDance Seed(字节跳动种子) NUS(新加坡国立大学) NTU(国立技术大学) THU(清华大学) SMU(南方大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 FALCON通过引入丰富的3D空间标记,改进了视觉-语言-动作模型的空间表示、模态可转移性和对齐能力,在多个基准和现实任务中取得最佳性能。

Comments Accepted at ICLR 2026. Project page: https://falcon-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08173 2026-03-11 cs.RO cs.AI cs.CL cs.CV 62%

NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions

NavSpace: 导航代理如何遵循空间智能指令

Haolin Yang, Yuxing Long, Zhuoyuan Yu, Zihan Yang, Minghan Wang, Jiapeng Xu, Yihan Wang, Ziyan Yu, Wenzhe Cai, Lei Kang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 NavSpace基准测试通过评估导航代理的空间感知与推理能力,提出SNav模型在指令遵循任务中表现优异,为具身智能研究提供新基准。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05522 2026-03-10 cs.AI cs.CV cs.LG cs.RO 62%

RoboLayout: Differentiable 3D Scene Generation for Embodied Agents

RoboLayout: 用于具身智能体的可微3D场景生成

Ali Shamsaddinlou

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RoboLayout通过引入智能体感知推理和改进优化稳定性,提升3D场景生成在具身智能体交互中的可行性与物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02765 2026-03-04 cs.LG cs.AI 62%

Next Embedding Prediction Makes World Models Stronger

下一步嵌入预测使世界模型更强大

George Bredis, Nikita Balagansky, Daniil Gavrilov, Ruslan Rakhimov

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 NE-Dreamer通过时间转换器预测下一步嵌入,无需解码器即可在复杂环境中提升基于模型的强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08550 2026-02-25 cs.CV cs.AI cs.LG cs.MM eess.IV 62%

GOT-Edit: Geometry-Aware Generic Object Tracking via Online Model Editing

GOT-Edit:基于几何的通用目标跟踪 via 在线模型编辑

Shih-Fang Chen, Jun-Cheng Chen, I-Hong Jhuo, Yen-Yu Lin

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国立阳明交通大学计算机科学系) Academia Sinica(学术院) Microsoft AI(微软人工智能)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GOT-Edit通过在线模型编辑整合几何感知线索,提升通用目标跟踪在遮挡和杂乱环境中的鲁棒性和准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17871 2026-02-23 cs.CV cs.AI cs.LG cs.MM 62%

Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models

理解视觉语言模型的细粒度知识能力

Dhruba Ghosh, Yuhui Zhang, Ludwig Schmidt

机构 * Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉语言模型在细粒度知识任务中的表现,发现更好的语言模型和视觉编码器对细粒度分类性能有显著影响,预训练阶段也至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16826 2026-02-20 cs.LG cs.AI 62%

HiVAE: Hierarchical Latent Variables for Scalable Theory of Mind

HiVAE:用于可扩展理论之心的层次潜在变量

Nigel Doering, Rahath Malladi, Arshia Sangwan, David Danks, Tauhidur Rahman

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 HiVAE通过层次化变分架构提升理论之心推理能力,解决现实时空领域中的心理状态推断问题,并提出自监督对齐策略以增强潜在表示的参照性。

Comments Accepted at the Workshop on Theory of Mind for AI (ToM4AI) at the 40th AAAI Conference on Artificial Intelligence (AAAI-26), Singapore, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16537 2026-02-19 cs.CV cs.AI cs.CL cs.RO 62%

RoboSpatial: Teaching Spatial Understanding to 2D and 3D Vision-Language Models for Robotics

RoboSpatial: 教授机器人2D和3D视觉-语言模型空间理解能力

Chan Hee Song, Valts Blukis, Jonathan Tremblay, Stephen Tyree, Yu Su, Stan Birchfield

机构 * The Ohio State University(俄亥俄州立大学) NVIDIA(英伟达)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RoboSpatial通过构建大规模空间理解数据集,提升机器人2D和3D视觉-语言模型的空间推理能力。

Comments CVPR 2025 (Oral); Project Website: https://chanh.ee/RoboSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11073 2026-02-13 cs.CV cs.AI cs.CL 62%

Chatting with Images for Introspective Visual Thinking

与图像对话以进行反思性视觉思维

Junfei Wu, Jian Guan, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan

机构 * NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ViLaVT通过语言引导的特征调节框架,实现多图像区域的联合重编码,提升跨模态对齐与复杂空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07061 2026-02-10 cs.LG cs.AI 62%

TACIT: Transformation-Aware Capturing of Implicit Thought

TACIT:面向隐式思维的变换感知捕捉

Daniel Nobrega

机构 * Independent Researcher(独立研究者)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 TACIT提出一种基于扩散的Transformer模型,通过像素空间中的校正流实现可解释的视觉推理,在迷宫求解中展示了隐式思维的同步涌现特性。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02559 2026-02-04 cs.AI cs.CV cs.LG cs.MA 62%

Experience-Driven Multi-Agent Systems Are Training-free Context-aware Earth Observers

基于经验的多智能体系统是无需训练的上下文感知地球观测者

Pengyu Dai, Weihao Xuan, Junjue Wang, Hongruixuan Chen, Jian Song, Yafei Ou, Naoto Yokoya

机构 * The University of Tokyo(东京大学) RIKEN AIP(日本理化学研究所AIP) Hokkaido University(北海道大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 GeoEvolver通过结构化交互使LLM代理无需训练即可获得地球观测专业知识,提升复杂任务的成功率。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15388 2026-02-03 cs.CV cs.AI cs.CL 62%

LLaVA-PruMerge: Adaptive Token Reduction for Efficient Large Multimodal Models

LLaVA-PruMerge: 适应性令牌减少用于高效的大多模态模型

Yuzhang Shang, Mu Cai, Bingxin Xu, Yong Jae Lee, Yan Yan

机构 * UCF(佛罗里达大学) UW-Madison(威斯康星大学麦迪逊分校) USC(南加州大学) UIC(伊利诺伊大学香槟分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LLaVA-PruMerge通过自适应视觉令牌减少策略,显著降低视觉令牌数量而不影响性能,适用于高效的大多模态模型。

Comments Accepted to ICCV 2025. First Version is released in 2024/03

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04778 2026-01-09 cs.CV cs.AI cs.CL cs.MM 62%

CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models

CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉

Tobia Poppi, Burak Uzkent, Amanmeet Garg, Lucas Porto, Garin Kessler, Yezhou Yang, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara, Florian Schiffers

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(帕尔马大学) Amazon Prime Video(亚马逊Prime视频)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18262 2025-12-30 cs.RO cs.AI cs.CV cs.HC cs.LG 62%

ReSemAct: Advancing Fine-Grained Robotic Manipulation via Semantic Structuring and Affordance Refinement

ReSemAct:通过语义结构化和效用细化推进细粒度机器人操作

Chenyu Su, Weiwei Shang, Chen Qian, Fei Zhang, Shuang Cong

机构 * Department of Automation, University of Science and Technology of China(自动化系,中国科学技术大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ReSemAct 通过语义结构化和效用细化方法,在细粒度机器人操作中实现更精确的效用目标生成与动态环境适应。

Comments Code and videos: https://github.com/scy-v/ReSemAct and https://resemact.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15178 2025-12-23 cs.RO cs.AI cs.LG cs.SY eess.SY 62%

GUIDEd Agents: Enhancing Navigation Policies through Task-Specific Uncertainty Abstraction in Localization-Limited Environments

GUIDEd Agents: 通过在定位受限环境中任务特定的不确定性抽象增强导航策略

Gokul Puthumanaillam, Paulo Padrao, Jose Fuentes, Leonardo Bobadilla, Melkior Ornik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Providence College(普罗维登斯学院) Florida International University(佛罗里达国际大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 GUIDE通过任务特定不确定性抽象提升机器人在定位受限环境中的导航策略,实现任务完成与不确定性管理的平衡。

Comments Accepted for publication at RAL (Robotics and automation letters). Updated with the final version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16891 2025-12-19 cs.CV cs.AI cs.IR cs.LG cs.MM 62%

LinkedOut: Linking World Knowledge Representation Out of Video LLM for Next-Generation Video Recommendation

LinkedOut: 从视频大语言模型中提取世界知识表示以实现下一代视频推荐

Haichao Zhang, Yao Lu, Lichen Wang, Yunzhe Li, Daiwei Chen, Yunpeng Xu, Yun Fu

机构 * Northeastern University(东北大学) LinkedIn(领英) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 LinkedOut通过从视频中提取世界知识表示,实现低延迟、多视频输入的视频推荐,无需人工标注,取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15885 2025-12-19 cs.CV cs.AI cs.CL cs.MM 62%

Seeing Beyond Words: Self-Supervised Visual Learning for Multimodal Large Language Models

超越文字:面向多模态大语言模型的自监督视觉学习

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Pier Luigi Dovesi, Shaghayegh Roohi, Mark Granroth-Wilding, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) AMD Silo AI

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 JARVIS通过自监督视觉学习提升多模态大语言模型的视觉推理能力,无需依赖语言监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14725 2025-12-18 cs.LG cs.AI 62%

Generative Urban Flow Modeling: From Geometry to Airflow with Graph Diffusion

生成性城市风场建模:从几何到气流的图扩散

Francisco Giral, Álvaro Manzano, Ignacio Gómez, Petros Koumoutsakos, Soledad Le Clainche

机构 * Applied Mathematics Department, ETSIAE-School of Aeronautics, Universidad Politécnica de Madrid(应用数学系、ETSIAE航空学院、马德里理工大学) Microflown Technologies(Microflown技术公司) Computational Science and Engineering Laboratory, Harvard University(计算科学与工程实验室、哈佛大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于图扩散的生成模型,用于在非结构化网格上合成城市风场,通过结合层次图神经网络和分数扩散建模,实现对复杂几何形状的高效风场模拟与预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02925 2025-12-15 cs.LG cs.CL q-bio.BM 62%

Large Language Model Agent for Modular Task Execution in Drug Discovery

用于药物发现模块化任务执行的大型语言模型代理

Janghoon Ock, Radheesh Sharma Meda, Srivathsan Badrinarayanan, Neha S. Aluru, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Department of Chemical Engineering, Carnegie Mellon University(化学工程系,卡内基梅隆大学) Department of Material Science and Engineering, Carnegie Mellon University(材料科学与工程系,卡内基梅隆大学) Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种基于大型语言模型的模块化框架,用于药物发现中的任务执行,通过自动化分子生成和属性预测提升药物筛选效率。

详情

展开后加载摘要…

URL PDF HTML 收藏