arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-02 至 2026-04-02 共收录 103 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 30 篇

2506.19846 2026-04-02 cs.AI 57%

HiMA-Ecom: Enabling Joint Training of Hierarchical Multi-Agent E-commerce Assistants

HiMA-Ecom:面向电商场景的分层多智能体助手联合训练

Junxing Hu, Ai Han, Haolan Zhan, Pu Wei, Zhiqian Zhang, Yuhang Guo, Jiawei Lu, Zhen Chen, Haoran Li, Zicheng Zhang

机构 * JD Retail, JD.com, Inc.(京东零售,京东集团) Faculty of Engineering and Information Technology, The University of Melbourne(墨尔本大学工程与信息技术学院) School of Mathematical Sciences, University of Chinese Academy of Sciences(中国科学院大学数学科学学院)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出HiMA-Ecom电商多智能体基准,通过VR-GRPO算法实现多智能体联合训练,基于3B/7B开源模型在电商场景中取得优于DeepSeek-V3的性能。

Comments 39 pages, 10 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00281 2026-04-02 cs.AI 57%

Human-in-the-Loop Control of Objective Drift in LLM-Assisted Computer Science Education

人机协同控制LLM辅助计算机科学教育中的目标漂移

Mark Dranias, Adam Whitley

机构 * Asheville Institute for Memory and Longevity(阿什维尔记忆与长寿研究所) University of North Carolina Asheville(北卡罗来纳大学阿什维尔分校)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 本文提出一种人机协同的教学方法,通过分离规划与执行,训练学生在代码生成前指定接受标准和架构约束,以稳定AI辅助学习过程。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00074 2026-04-02 cs.LG cs.CY 57%

PASM: Population Adaptive Symbolic Mixture-of-Experts Model for Cross-location Hurricane Evacuation Decision Prediction

PASM:用于跨地点飓风疏散决策预测的群体自适应符号混合专家模型

Xiao Qian, Shangjia Dong

机构 * University of Delaware(特拉华大学)

专题命中 规划推理 :planning(abstract);分类 cs.LG

AI总结 本文提出PASM模型,通过符号回归与混合专家架构,解决跨地点疏散决策预测中的泛化问题,实现高准确率和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00659 2026-04-02 eess.SY cs.SY 50%

Battery Electric Truck Infrastructure Co-design via Joint Optimization and Agent-based Simulation

通过联合优化和基于代理的仿真设计电池电动卡车基础设施

Juan Pablo Bertucci, Mauro Salazar, Theo Hofman

专题命中 规划推理 :planning(abstract)

AI总结 本文通过联合优化和基于代理的仿真,研究了物流配送网络中充电基础设施与调度的协同设计,验证了优化框架在荷兰案例中的有效性,展示了优化策略在降低成本和减少排队时间方面的优势。

Journal ref IEEE Transactions on Transportation Electrification, vol. 11, no. 5, pp. 11296-11306, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00428 2026-04-02 cs.RO 50%

Certificate-Driven Closed-Loop Multi-Agent Path Finding with Inheritable Factorization

基于证书的闭环多智能体路径寻找与可继承分解

Jiarui Li, Runyu Zhang, Gioele Zardini

机构 * Laboratory for Information and Decision Systems, Massachusetts Institute of Technology(麻省理工学院信息与决策系统实验室)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出基于证书的闭环多智能体路径寻找方法,通过可继承分解提升密集场景下的路径规划一致性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22514 2026-04-02 eess.SY cs.SY 50%

Robust Multi-Agent Safety via Tube-Based Tightened Exponential Barrier Functions

通过管状紧缩指数屏障函数实现多智能体系统鲁棒安全性

Armel Koulong, Ali Pakniyat

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种构造性框架,用于合成非线性多智能体系统在有界扰动下的可证明安全控制器。核心贡献是通过约束紧缩方法将鲁棒误差反馈与名义轨迹规划相结合,利用RPI管的几何特性推导状态依赖的安全余量,从而保证轨迹安全性。

Comments Joint submission to IFAC World Congress 2026 and NAHS journal (Reference: NAHS_101717). Accepted for NAHS journal; under review by World Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.09744 2026-04-02 cs.MA 50%

Inferring Occluded Agent Behavior in Dynamic Games from Noise Corrupted Observations

从噪声受损观测中推断动态博弈中被遮挡行为

Tianyu Qiu, David Fridovich-Keil

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种考虑遮挡的博弈推理方法,用于估计可能被遮挡的智能体位置,并推断可见和被遮挡智能体的意图,同时验证了在噪声观测下的导航安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22588 2026-04-02 cs.HC cs.ET 50%

Practitioner Voices Summit: How Teachers Evaluate AI Tools through Deliberative Sensemaking

实践者声音峰会:教师如何通过 deliberative sensemaking 评估 AI 工具

Dorottya Demszky, Christopher Mah, Helen Higgins

专题命中 规划推理 :reasoning(abstract)

AI总结 本文探讨教师在整合AI工具时的评估标准及支持条件,通过全国峰会收集61名数学教师制定的200余条评估标准,揭示了 deliberative sensemaking 的五种机制及TPACK与代理的相互促进循环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22690 2026-04-02 cs.CV 50%

Ar2Can: An Architect and an Artist Leveraging a Canvas for Multi-Human Generation

Ar2Can:利用画布进行多人体生成的架构与艺术家

Shubhankar Borse, Phuc Pham, Farzad Farhadzadeh, Seokeon Choi, Phong Ha Nguyen, Anh Tuan Tran, Sungrack Yun, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research, an initiative of Qualcomm Technologies, Inc.(高通人工智能研究院,高通技术公司旗下)

专题命中 规划推理 :planning(abstract)

AI总结 Ar2Can提出一种两阶段框架,通过分离空间规划与身份渲染,解决多人体生成中人脸身份丢失问题,采用空间引导的面部匹配奖励提升生成质量,使用合成数据实现高精度和保真度。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 9 篇

2604.00558 2026-04-02 cs.CV 82%

STAR: Mitigating Cascading Errors in Spatial Reasoning via Turn-point Alignment and Segment-level DPO

STAR:通过转弯点对齐和段级DPO缓解空间推理中的级联错误

Pukun Zhao, Longxiang Wang, Chen Chen, Peicheng Wang, Fanqing Zhou, Runze Li, Haojian Huang

机构 * Guangdong University of Finance and Economics(广东财经大学) Chongqing University(重庆大学) Westlake University(西湖大学) The University of Hong Kong(香港大学)

专题命中 视觉空间推理 :reasoning(title,abstract);self-correction(abstract)

AI总结 本文提出STAR框架,通过拓扑锚点解决复杂拓扑中的级联错误问题,引入RedMaze-23K数据集并采用段级DPO提升长距离导航的自我修正能力,实验表明其32B版本在开源模型中表现最优。

Comments 9 pages, 6 figures, 4 tables, Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00057 2026-04-02 cs.MM cs.AI 79%

Towards Automatic Soccer Commentary Generation with Knowledge-Enhanced Visual Reasoning

面向知识增强视觉推理的自动足球解说生成

Zeyu Jin, Xiaoyu Qin, Songtao Zhou, Kaifeng Yun, Jia Jia

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) BNRist, Tsinghua University(清华大学北京信息科学与技术国家研究中心)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出GameSight模型,通过视觉推理与知识增强生成更准确的足球解说,提升解说质量与上下文相关性。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00867 2026-04-02 cs.CV 78%

A 4D Representation for Training-Free Agentic Reasoning from Monocular Laparoscopic Video

一种用于无训练代理推理的4D表示

Maximilian Fehrentz, Nicolas Stellwag, Robert Wiebe, Nicole Thorisch, Fabian Grob, Patrick Remerscheid, Ken-Joel Simmoteit, Benjamin D. Killeen, Christian Heiliger, Nassir Navab

机构 * Computer Aided Medical Procedures, TU Munich(慕尼黑工业大学计算机辅助医疗程序研究所) Hospital of the LMU Munich, Ludwig-Maximilians-Universität (LMU)(慕尼黑大学医院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出一种基于显式4D表示的框架,利用多模态大语言模型实现无训练的手术代理推理,提升时空理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12545 2026-04-02 cs.CV 78%

Spatial Reasoning is Not a Free Lunch: A Controlled Study on LLaVA

空间推理并非免费午餐:对LLaVA的受控研究

Nahid Alam, Leema Krishna Murali, Siddhant Bharadwaj, Patrick Liu, Timothy Chung, Drishti Sharma, Akshata A., Kranthi Kiran, Wesley Tam, Bala Krishna S Vegesna

机构 * Cohere Labs Community(Cohere Labs社区) Indian Institute of Science, Bangalore(印度科学研究所班加罗尔分校) UIUC(伊利诺伊大学厄巴纳-香槟分校) Imperial College London(伦敦帝国学院) Eisai Inc.(卫材公司) EleutherAI Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文通过LLaVA框架探讨了空间推理能力不足的原因,发现图像编码器设计和位置编码结构对空间理解有显著影响,但无法完全解决空间推理问题。

Comments Accepted as a poster at ICLR 2026 workshop ICBINB, typo fixed

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17312 2026-04-02 cs.CV 78%

CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning

CodeDance: 一种动态集成工具的多模态大语言模型用于可执行视觉推理

Qi Song, Honglin Li, Yingchen Yu, Haoyi Zhou, Lin Yang, Song Bai, Qi She, Zilong Huang, Yunqing Zhao

机构 * Beihang University(北京航空航天大学) Westlake University(西湖大学) ByteDance Singapore(字节跳动新加坡) ByteDance China(字节跳动中国)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 CodeDance通过可执行代码实现视觉推理,结合多工具协作与自检机制,提升复杂任务的灵活性和可解释性,实验显示其在多个基准测试中优于现有方法。

Comments CVPR 2026. Project page: https://codedance-vl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00597 2026-04-02 cs.CV 50%

Towards Viewpoint-Robust End-to-End Autonomous Driving with 3D Foundation Model Priors

面向视角鲁棒的端到端自动驾驶与3D基础模型先验

Hiroki Hashimoto, Hiromichi Goto, Hiroyuki Sugai, Hiroshi Kera, Kazuhiko Kawamoto

机构 * Chiba University(千叶大学) National Institute of Informatics(国立信息学研究所)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出一种无需数据增强的端到端自动驾驶方法,利用3D基础模型的几何先验提升视角变化鲁棒性,实验显示在pitch和高度扰动下性能提升显著。

Comments Accepted at CVPR Workshop on Simulation for Autonomous Driving 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00507 2026-04-02 cs.CV 50%

RegFormer: Transferable Relational Grounding for Efficient Weakly-Supervised Human-Object Interaction Detection

RegFormer:可转移的交互关系接地以实现高效的弱监督人类-物体交互检测

Jihwan Park, Chanhyeong Yang, Jinyoung Park, Taehoon Song, Hyunwoo J. Kim

机构 * KAIST(韩国科学技术院) LG Energy Solution(LG新能源) Korea University(高丽大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 RegFormer通过空间接地信号实现高效的弱监督人类-物体交互检测,无需额外训练即可直接迁移至实例级推理,实验表明其在效率和性能上均优于传统方法。

Comments Accepted at CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27183 2026-04-02 cs.CV 50%

Communicating about Space: Language-Mediated Spatial Integration Across Partial Views

关于空间的交流:通过语言介导的空间整合跨部分视图

Ankur Sikarwar, Debangan Mishra, Sudarshan Nikhil, Ponnurangam Kumaraguru, Aishwarya Agrawal

机构 * Mila – Quebec AI Institute(Mila – 魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) IIIT Hyderabad(海得拉巴国际信息技术学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究探讨多模态大语言模型能否通过对话整合不同视角,发现其在识别共享锚点物体上表现较好,但在关系推理和全局地图构建上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19660 2026-04-02 cs.CV cs.SD 50%

Semantic Audio-Visual Navigation in Continuous Environments

语义音频视觉导航在连续环境中

Yichen Zeng, Hebaixu Wang, Meng Liu, Yu Zhou, Chen Gao, Kehan Chen, Gongping Huang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Shandong Jianzhu University(山东建筑大学) Nankai University(南开大学) Tsinghua University(清华大学) CASIA(中国科学院自动化研究所) UCAS(中国科学院大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出MAGNet模型,通过多模态Transformer实现语义目标推理,提升在连续空间中导航的鲁棒性与成功率。

Comments This paper has been accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 6 篇

2604.00018 2026-04-02 cs.CL cs.AI 81%

Think Twice Before You Write -- an Entropy-based Decoding Strategy to Enhance LLM Reasoning

再三思考后再写作——一种基于熵的解码策略以增强大语言模型推理

Jiashu He, Meizhu Liu, Olaitan P Olaleye, Amit Agarwal, M. Avendi, Yassi Abbasi, Matthew Rowe, Hitesh Laxmichand Patel, Paul Li, Tao Sheng, Sujith Ravi, Dan Roth

机构 * Oracle AI Science(甲骨文人工智能科学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于熵的解码策略,通过在生成过程中引入令牌级适应性,提高大语言模型的推理能力,实验表明在GSM8K等数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14275 2026-04-02 cs.CL 70%

Let the Model Distribute Its Doubt: Confidence Estimation through Verbalized Probability Distribution

让模型分配其怀疑:通过 verbalized 概率分布进行置信度估计

Ante Wang, Weizhi Ma, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(清华大学计算机科学与技术系、人工智能研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过生成 verbalized 概率分布提升置信度估计,系统实验显示其在多个 LLM 和任务中表现优异,推理效率高且计算节省显著,但也揭示了特定任务的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00356 2026-04-02 cs.AI cs.CL 62%

Signals: Trajectory Sampling and Triage for Agentic Interactions

信号:代理互动的轨迹采样与优先级排序

Shuguang Chen, Adil Hafeez, Salman Paracha

机构 * DigitalOcean Holdings, Inc.(DigitalOcean控股公司)

专题命中 测试时计算 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于信号的轻量框架,用于高效筛选代理交互轨迹,通过计算低成本信号提升采样效率,实验证明其在不同任务中均能有效提升信息量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00072 2026-04-02 cs.LG cs.AI stat.ML 62%

Empirical Validation of the Classification-Verification Dichotomy for AI Safety Gates

对AI安全闸门中分类-验证二元对立的实证验证

Arsenios Scrivens

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究通过实证表明,基于分类器的安全闸门在AI系统经过数百次迭代后无法维持可靠监管,且结构上无法实现。

Comments 21 pages, 9 figures. Companion theory paper: doi:10.5281/zenodo.19237451

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01220 2026-04-02 cs.CL 57%

Universal YOCO for Efficient Depth Scaling

通用YOCO用于高效深度扩展

Yutao Sun, Li Dong, Tianzhu Ye, Shaohan Huang, Jianyong Wang, Furu Wei

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL

AI总结 本文提出通用YOCO(YOCO-U),结合递归计算与YOCO解码器解码器架构,实现更高效的推理效率与深度扩展能力,通过参数共享和浅层高效注意力层提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02966 2026-04-02 cs.PL cs.AI cs.MA 57%

Lumos: Let there be Language Model System Certification

Lumos: 让语言模型系统认证成为可能

Isha Chaudhary, Vedaant Jain, Prineet Parhar, Kavya Sachdeva, Avaljot Singh, Sayan Ranu, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Indian Institute of Technology Delhi(印度理工学院德里分校)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 Lumos提出首个系统化框架,通过概率编程DSL实现语言模型系统行为的正式认证,支持复杂关系和时间规格,揭示了先进视觉语言模型在自动驾驶场景中的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 15 篇

2508.07629 2026-04-02 cs.LG cs.AI cs.CL 87%

Klear-Reasoner: Advancing Reasoning Capability via Gradient-Preserving Clipping Policy Optimization

Klear-Reasoner: 通过梯度保持裁剪策略优化提升推理能力

Zhenpeng Su, Leiyu Pan, Xue Bai, Dening Liu, Guanting Dong, Jiaming Huang, Minxuan Lv, Wenping Hu, Fuzheng Zhang, Kun Gai, Guorui Zhou

机构 * Klear Team, Kuaishou Technology(快手科技Klear团队)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Klear-Reasoner通过梯度保持裁剪策略优化提升推理能力,在数学和编程领域表现出色,达到多项基准测试的高分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09136 2026-04-02 cs.AI cs.CL cs.IR 73%

Agentic Retrieval-Augmented Generation: A Survey on Agentic RAG

代理检索增强生成:关于代理RAG的综述

Aditi Singh, Abul Ehtesham, Saket Kumar, Tala Talaei Khoei, Athanasios V. Vasilakos

机构 * Cleveland State University(克利夫兰州立大学) Kent State University(肯特州立大学) Northeastern University(东北大学) Roux Institute at Northeastern University(东北大学鲁克斯研究所) University of Agder (UiA)(阿格德尔大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了代理RAG系统,分析了其架构分类、设计权衡及应用,指出其在灵活性、可扩展性和上下文感知方面的优势,并探讨了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00687 2026-04-02 cs.SE 67%

SCPatcher: Automated Smart Contract Code Repair via Retrieval-Augmented Generation and Knowledge Graph

SCPatcher:通过检索增强生成与知识图谱实现智能合约代码自动修复

Xiaoqi Li, Shipeng Ye, Wenkai Li, Zongwei Li

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出SCPatcher框架,结合检索增强生成与知识图谱实现智能合约漏洞自动修复,通过构建5000个验证过的以太坊合约知识图谱,提升大语言模型推理能力,实现高修复率和编译通过率。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00657 2026-04-02 cs.SE cs.CR 67%

LibScan: Smart Contract Library Misuse Detection with Iterative Feedback and Static Verification

LibScan: 利用迭代反馈和静态验证的智能合约库误用检测

Yishun Wang, Wenkai Li, Xiaoqi Li, Zongwei Li, Lei Xie, Yuqing Zhang

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract)

AI总结 本文提出LibScan框架,结合大语言模型和规则分析,识别智能合约中八类库误用,通过迭代修正和知识库提升检测准确率至85.15%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00304 2026-04-02 cs.CL cs.AI 62%

Asymmetric Actor-Critic for Multi-turn LLM Agents

多轮LLM代理的非对称Actor-Critic

Shuli Jiang, Zhaoyang Zhang, Yi Zhang, Shuo Yang, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出非对称Actor-Critic框架,利用专有LLM作为Actor,开源模型作为Critic,提升多轮对话可靠性。实验显示该方法在τ-bench和UserBench上优于单Agent基线,且轻量级Critic表现优异。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00007 2026-04-02 cs.CL cs.AI 62%

Dynin-Omni: Omnimodal Unified Large Diffusion Language Model

Dynin-Omni: 多模态统一的大扩散语言模型

Jaeik Kim, Woojin Kim, Jihwan Hong, Yejoon Lee, Sieun Hyeon, Mintaek Lim, Yunseok Han, Dogeun Kim, Hoeun Lee, Hyunggeun Kim, Jaeyoung Do

机构 * AIDAS Lab Seoul National University [1.5ex] Project Page Code Model Demo -2em

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Dynin-Omni首次提出基于掩码扩散的多模态基础模型,统一文本、图像、语音的理解与生成,以及视频理解,通过共享离散令牌空间实现双向上下文迭代优化。

Comments Project Page: https://dynin.ai/omni/

详情

展开后加载摘要…

URL PDF HTML 收藏