arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 5898 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 888 篇

2602.09924 2026-08-12 cs.CL cs.AI cs.LG 版本更新 80%

LLMs Encode Their Failures: Predicting Success from Pre-Generation Activations

LLMs编码其失败:从预生成激活中预测成功

William Lugoloobi, Thomas Foster, William Bankes, Chris Russell

机构 * Oxford Internet Institute, University of Oxford(牛津大学牛津互联网研究所) FLAIR, University of Oxford(牛津大学FLAIR) Department of Computer Science, University College London(伦敦大学学院计算机科学系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过预生成激活预测LLM在数学和编程任务中的成功率,发现模型内部表示能有效指导更高效的推理,且在MATH任务中通过模型池路由可提升性能并降低70%的推理成本。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17535 2026-08-05 cs.SE 版本更新 80%

AgentModernize: Preserving Business Logic in Legacy Modernization with Multi-Agent LLMs and Behavioral Specification Graphs

AgentModernize: 通过多智能体LLM和行为规范图在遗留系统现代化中保留业务逻辑

Sheikh Nazib Ahmed, Marnim Galib

专题命中 推理与问题求解 :LLM(title_cn,abstract)

AI总结 本文提出AgentModernize框架,通过多智能体系统和行为规范图来保留业务逻辑,解决传统方法在遗留系统现代化中丢失隐含规则和交叉模块约束的问题,实验表明该方法在多个场景中表现优异。

Comments 10 pages, 8 tables, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03822 2026-08-04 cs.SE cs.CR 版本更新 80%

KVerus: Scalable and Resilient Formal Verification Proof Generation for Rust Code

KVerus:面向Rust代码的可扩展且高鲁棒性的形式化验证证明生成工具

Yuwei Liu, Xinyi Wan, Yanhao Wang, Minghua Wang, Lin Huang, Tao Wei

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 KVerus是适配Rust代码的形式化验证工具,通过自适应范式与动态知识库,在单文件、仓库级基准及Rust内核验证中均优于现有方案,为形式化验证的规模化应用提供了关键进展。

Comments Accepted at ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26613 2026-08-04 cs.DB 版本更新 80%

EcoTable: Cost-effective Table Integration in Data Lakes for Natural Language Queries

EcoTable: 数据湖中面向自然语言查询的经济高效的表集成

Yuhui Wang, Jinqi Liu, Chengliang Chai, Hangyu Zhao, Yuhao Deng, Yuyu Luo, Xin Tang, Ye Yuan, Guoren Wang, Fengjin Wang, Lei Cao

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 针对数据湖中表格格式多样导致ETL困难的问题,提出EcoTable框架,利用LLM的语义理解和复杂推理能力,通过图结构搜索和轻量级模型降低LLM调用成本,在4个基准数据集上准确率提升30%以上,成本降低5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10207 2026-07-31 cs.IR 版本更新 80%

LASAR: Latent Adaptive Semantic Aligned Reasoning for Generative Recommendation

LASAR:潜在自适应语义对齐推理用于生成推荐

Yiwen Chen, Fuwei Zhang, Zehao Chen, Hehan Li, Peizhi Xu, Hanmeng Liu, Shuanglong Li, Xin Pei, Fuzhen Zhuang, Zhao Zhang

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 LASAR通过自适应语义对齐推理提升生成推荐性能,解决潜在推理与语义对齐的挑战,实现更高效的推荐质量与速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10345 2026-07-31 cs.SE 版本更新 80%

Recovering Fine-Grained Code Change Rationale from Multiple Software Artifacts

细粒度多文档提取与代码变更理由生成

Mehedi Sun, Antu Saha, Nadeeshan De Silva, Antonio Mastropaolo, Oscar Chaparro

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 本文研究如何从多个文档中提取代码变更理由,提出ARGUS方法,通过LLM生成简洁的变更理由摘要,提升代码理解和维护效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00341 2026-07-28 cs.CL cs.AI cs.LG 版本更新 80%

DiscoLoop: Looping Discrete Embeddings and Continuous Hidden States for Multi-hop Reasoning

DiscoLoop: 循环离散嵌入与连续隐藏状态用于多跳推理

Hengyu Fu, Tianyu Guo, Zixuan Wang, Hanlin Zhu, Jason D. Lee, Jiantao Jiao, Stuart Russell, Song Mei

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对多跳推理中非循环Transformer的深度局部存储问题,提出DiscoLoop架构,通过循环同时携带离散嵌入和连续隐藏状态,实现近乎完美的泛化,并在符号和合成语言任务中显著减少训练步数。

Comments 16 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08274 2026-07-28 cs.MA 版本更新 80%

Toward Human-Centered Multi-Agent Systems: Integrating Cognition, Culture, Values, and Cooperation in AI Agents

迈向以人为中心的多智能体系统:在AI智能体中整合认知、文化、价值观与合作

Safia Baloch, Rahemeen Khan

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文综述了从认知科学、文化对齐、价值学习到多智能体协调的研究,指出现有系统缺乏整合认知、文化、价值观和社会行为的统一框架,并提出了构建文化感知、价值对齐、认知基础与合作的多智能体系统的方向。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22114 2026-07-28 cs.SE 版本更新 80%

Automated Lemma Discovery in Agentic Program Verification

代理程序验证中的引理发现

Huan Zhao, Haoxin Tu, Zhengyao Liu, Martin C. Rinard, Abhik Roychoudhury

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出LemmaNet代理,通过分析源代码和规格,发现辅助引理以提升程序验证的正确性保证。

Comments 13 pages. To appear in ASE 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15591 2026-07-27 cs.IR 版本更新 80%

RecGPT-V3 Technical Report

RecGPT-V3技术报告

Bowen Zheng, Chao Yi, Dian Chen, Gaoyang Guo, Han Zhu, Jiakai Tang, Jian Wu, Mao Zhang, Wen Chen, Yifan Lu, Yujie Luo, Yuning Jiang, Zhujin Gao, Bo Zheng, Chenchi Zhang, Dixuan Wang, Hao Fang, Jiancai Liu, Jing Yu, Junjun Zheng, Ke Chen, Kewei Zhu, Mengyan Li, Mingke Xu, Wenjun Yang, Xiangheng Kong, Xinming Zhang, Xunke Xi, Zile Zhou

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究针对大规模运行RecGPT的挑战,提出RecGPT-V3这一有状态混合模态推荐系统。通过内存中心、混合模态基础模型和潜在意图推理等方法,在淘宝“猜你喜欢”推荐中取得多指标提升及资源消耗降低的成果。

Comments Technique Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14512 2026-07-22 cs.AI cs.CL cs.LG 版本更新 80%

RetroAgent: Harnessing LLMs to Search Over Structured Memory for Agentic Retrosynthesis Planning

RetroAgent:利用大语言模型在结构化记忆中进行搜索以实现智能逆合成规划

Yanqiao Zhu, Jingru Gan, Xiaoqi Sun, Fang Sun, Yidan Shi, Md Mofijul Islam, Chao Shang, Wenhao Gao, Connor W. Coley, Yizhou Sun, Wei Wang

机构 * UCLA(加利福尼亚大学洛杉矶分校) MIT(麻省理工学院) Amazon(亚马逊公司) UPenn(宾夕法尼亚大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多步逆合成规划难题,提出RetroAgent智能体,通过结合结构化记忆桥接符号搜索与神经推理,利用记忆和化学工具观察搜索状态,实验证明其在分布内和分布外基准测试中性能强且泛化能力好。

Comments To appear at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07939 2026-07-21 cs.CY 版本更新 80%

The atomic structure of work: a micro-action instrument reveals two-pole AI occupational exposure and its decade-scale polar inversion

稳定几何,反转两极:AI职业替代性的双极结构及其十年尺度反转

Shuyao Gao, Minghao Huang

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 通过多智能体LLM流水线将O*NET活动分解为微动作,发现职业替代性呈双极结构(物理操作与规划设计为两极),且过去十年间两极高低顺序已反转。

Comments v2: major revision, retitled (v1: "Stable Geometry, Reversing Poles"). Adds an independent blind three-annotator validation study (construct kappa = 0.90; encoder-vs-human kappa = 0.63), a vintage-matched O*NET 18.1 reprojection, a demographic overlay, and recalibrated claims throughout. 27 pages; Supplementary Information (29 pages) in ancillary files. Dataset: doi:10.5281/zenodo.21395792

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17868 2026-07-16 cs.SE 版本更新 80%

UniCode: Augmenting Evaluation for Code Reasoning

UniCode: 增强代码推理的评估

Xinyue Zheng, Haowei Lin, Shaofei Cai, Yaodong Yang, Zilong Zheng, Yitao Liang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 UniCode通过多维增强和自动化测试生成框架,揭示了大语言模型在代码推理中的性能下降问题,强调模型对捷径的依赖而非真正的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07403 2026-07-07 cs.CV cs.AI cs.CL cs.LG 版本更新 80%

SpatialThinker: Reinforcing Scene Graph-Grounded Spatial Reasoning via Dense Rewards

空间思考者:通过密集奖励强化场景图基础的空间推理

Hunar Batra, Haoqin Tu, Hardy Chen, Yuanze Lin, Cihang Xie, Ronald Clark

机构 * University of Oxford(牛津大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对多模态大语言模型空间推理难题,提出SpatialThinker,通过在线强化学习统一场景图生成与视觉推理,构建心理场景图并借助密集奖励推理,贡献包括基于SGG推理、高质量训练数据集及密集奖励设计。

Comments Preprint. Accepted at NeurIPS 2025 Workshops on SPACE in Vision, Language, and Embodied AI (SpaVLE) as Oral, Embodied World Models for Decision Making (EWM), Aligning Reinforcement Learning Experimentalists and Theorists (ARLET), and Scaling Environments for Agents (SEA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02444 2026-07-03 cs.DB 版本更新 80%

From Textual Columns to Query Plans: A Unified Relational-Semantic Execution Framework for Hybrid Query Processing

OmniTQA:一种面向半结构化数据的混合查询处理成本感知系统

Nima Shahbazi, Seiji Maekawa, Nikita Bhutani, Estevam Hruschka

专题命中 推理与问题求解 :LLM(summary_cn,abstract)

AI总结 OmniTQA通过整合LLM语义操作与传统关系运算符,提出了一种成本感知的混合查询处理框架,有效处理结构化与半结构化数据,提升复杂查询和大规模表的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05256 2026-07-03 cs.CV 版本更新 80%

Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum

Wiki-R1: 通过数据和采样课程激励基于知识的多模态推理用于VQA

Shan Ning, Longtian Qiu, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心) Lingang Laboratory(临港实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 提出Wiki-R1框架,通过可控课程数据生成和课程采样策略,结合强化学习激励MLLMs在KB-VQA中的推理能力,在Encyclopedic VQA和InfoSeek上取得新SOTA。

Comments Accepted by ICLR 26, code and weights are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28076 2026-06-18 cs.CL cs.AI cs.LG 版本更新 80%

TopBench: A Benchmark for Implicit Predictive Reasoning in Tabular Question Answering

TopBench:表格问答中隐式预测推理的基准

An-Yang Ji, Jun-Peng Jiang, De-Chuan Zhan, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国) National Key Laboratory for Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学,中国)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TopBench基准,包含779个样本和四个子任务,评估大语言模型在表格问答中识别隐式预测意图并进行可靠推理的能力,发现当前模型在意图识别上存在困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01650 2026-06-17 cs.CL cs.AI cs.LG 版本更新 80%

EngTrace: A Symbolic Benchmark for Verifiable Process Supervision of Engineering Reasoning

EngTrace:工程推理可验证过程监督的符号基准

Ayesha Gull, Muhammad Usman Safder, Rania Elbadry, Fan Zhang, Veselin Stoyanov, Preslav Nakov, Zhuohan Xie

机构 * Namal University(纳马尔大学) MBZUAI(马克斯·普朗克智能人工智能研究所) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出EngTrace符号基准,包含1350个参数化测试用例,通过两阶段可验证评估框架(分层协议+AI仲裁)检验中间推理轨迹与最终答案,揭示数值精度与轨迹保真度的权衡。

Comments 33 pages, includes figures and tables; introduces the EngTrace benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02435 2026-06-16 cs.IR 版本更新 80%

Beyond Chunks and Graphs: Retrieval-Augmented Generation through Triplet-Driven Thinking

超越分块与图:基于三元组驱动的检索增强生成

Shengbo Gong, Xianfeng Tang, Qi He, Carl Yang, Wei jin

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出T$^2$RAG框架,利用三元组知识库和迭代检索,在六数据集上平均性能提升11%,检索成本降低45%。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19228 2026-06-09 cs.CL cs.AI cs.IT cs.LG math.IT 版本更新 80%

Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution

通过分步置信度归因诊断黑盒大语言模型的多步推理失败

Xiaoou Liu, Tiejin Chen, Dengjia Zhang, Yaqing Wang, Lu Cheng, Hua Wei

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于分步置信度归因(SCA)的方法,用于诊断黑盒大语言模型在多步推理中的失败,通过信息瓶颈原理对生成的推理轨迹进行置信度评估,并通过实验验证该方法在数学推理和多跳问答任务中的有效性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02909 2026-08-18 cs.LG cs.AI 版本更新 80%

Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR

延迟、平台期或崩溃:评估系统性验证错误对RLVR的影响

Kazuki Egashira, Mark Vero, Jasper Dekoninck, Florian E. Dorner, Robin Staab, Martin Vechev

专题命中 推理与问题求解 :LLM(abstract_cn,comments);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究探究系统性验证错误对RLVR的影响,发现系统性误报会引发次优平台期或性能崩溃,验证器质量需结合错误模式而非仅样本级错误率评估。

Comments COLM 2026. Code: https://github.com/eth-sri/llm-verifier-noise

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12700 2026-08-19 cs.LG cs.AR cs.DC 版本更新 79%

A Contract-Grade Verifier for LLM-Generated GPU Kernels, and a Native Blackwell Backward for the Gated-Linear-Recurrence Family

面向大语言模型生成的GPU内核的契约级验证器,以及门控线性循环(GDN)族的原生Blackward反向传播算法

Rishi Shah, Rishav Shrestha

机构 * E3A Healthcare(E3A医疗公司)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.LG

AI总结 本文提出契约级GPU内核验证器,发现公开系统接受的2638个机器生成内核中39.5%存在无法修复的错误,还构建了GDN族的原生Blackwell反向传播算法,指出现有内核生成正确性信号被高估。

Comments 20 pages, 3 figures. Also archived at doi:10.5281/zenodo.21563213

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08748 2026-08-19 cs.RO cs.AI 版本更新 79%

Visual Prompting for Robotic Manipulation with Annotation-Guided Pick-and-Place Using ACT

面向机器人操作的视觉提示:采用带标注引导的拾取与放置方法,基于ACT算法

Muhammad A. Muttaqien, Tomohiro Motoda, Ryo Hanai, Yukiyasu Domae

机构 * Embodied AI Research Team(具身人工智能研究团队) National Institute of AIST(国家信息与系统技术研究所)

专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.AI

AI总结 针对便利店机器人拾取放置任务的挑战,提出带标注引导视觉提示的感知-行动流水线,采用ACT算法实现自适应操作,提升了零售环境下的抓取精度与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03988 2026-08-18 cs.AI 版本更新 79%

Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models

想象感知标记增强多模态语言模型的空间推理能力

Mahtab Bigverdi, Linjie Li, Weikai Huang, Yiming Liu, Jaemin Cho, Tuhin Kundu, Chris Dongjoo Kim, Zelun Luo, Jieyu Zhang, Linda Shapiro, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for AI(Allen人工智能研究所) Microsoft(微软) OpenAI(开放人工智能研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 提出想象感知标记(IPT)作为中间感知表征,通过监督学习提升多模态语言模型在不可见视角推理、遮挡路径追踪等空间推理任务上的性能,在三个新构建的数据集上优于文本思维链训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21576 2026-08-18 cs.CL 版本更新 79%

Vision Language Models Cannot Plan, but Can They Formalize?

视觉语言模型(VLMs)无法规划,但它们能进行形式化吗?

Muyu He, Yuxi Zheng, Yuchen Liu, Zijian An, Bill Cai, Jiani Huang, Lifeng Zhou, Feng Liu, Ziyang Li, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本研究提出5种VLM作为形式化器的流水线,评估后发现其表现优于端到端规划生成,较弱VLMs的瓶颈为物体关系视觉grounding,较强模型已克服该限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24396 2026-08-11 cs.AI 版本更新 79%

Understanding and Mitigating Premature Confidence for Better LLM Reasoning

理解并缓解过早自信以提升大语言模型推理能力

Jingchu Gai, Guanning Zeng, Christina Baek, Chen Wu, J. Zico Kolter, Andrej Risteski, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :LLM(title);language model(abstract);分类 cs.AI

AI总结 针对大语言模型长思维链中逻辑跳跃和过早自信问题,提出渐进式自信塑造强化学习目标,无需外部标签或奖励模型,通过奖励逐步自信增长并惩罚过早承诺,显著提升推理准确性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10119 2026-08-11 cs.AI 版本更新 79%

Intelligence Foundation Model: A New Perspective to Approach Artificial General Intelligence

智能基础模型:一种新视角来实现通用人工智能

Borui Cai, Yao Zhao

机构 * Hangzhou International Innovation Institute, Beihang University, China(北京航空航天大学杭州国际创新研究院) Victoria University, Melbourne, Australia(墨尔本维多利亚大学)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出智能基础模型,通过模拟生物神经系统的动态过程和神经元输出预测,为实现通用人工智能提供新的视角和方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13502 2026-08-05 cs.CL 版本更新 79%

BOW: Training Language Models to Reason Over Plausible Next Words

BOW:训练语言模型对合理的下一个单词进行推理

Ming Shen, Zhikun Xu, Jacob Dineen, Xiao Ye, Ben Zhou

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 BOW是一种RL框架,通过训练语言模型生成合理下一个单词空间的全面描述,在10个推理基准上表现优于部分基线,BOW-Reg还能提升SharedRef正确率并降低单义崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14686 2026-08-04 cs.CV cs.AI 版本更新 79%

MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model

MVHOI: 通过3D基础模型桥接多视角条件与复杂人-物体交互视频重现

Jinguang Tong, Jinbo Wu, Kaisiyuan Wang, Zhelun Shen, Xuan Huang, Mochu Xiang, Xuesong Li, Yingying Li, Haocheng Feng, Chen Zhao, Hang Zhou, Wei He, Chuong Nguyen, Jingdong Wang, Hongdong Li

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出MVHOI框架,通过3D基础模型结合多视角参考条件,生成复杂人-物体交互视频,提升了长时视频生成的性能。

Comments Project page: https://mvhoi.hirotong.fun

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06828 2026-08-03 cs.CV cs.AI 版本更新 79%

Step-Level Visual Grounding Faithfulness Predicts Out-of-Distribution Generalization in Long-Horizon Vision-Language Models

步级视觉 grounding 信念预测长视界视觉语言模型的分布外泛化

Md Ashikur Rahman, Md Arifur Rahman, Niamul Hassan Samin, Abdullah Ibne Hanif Arean, Juena Ahmed Noshin

机构 * The KOW Company(KOW公司) University of Dhaka(达卡大学) American International University - Bangladesh (AIUB)(孟加拉国美国国际大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 研究发现长视界视觉语言模型中,步级视觉接地信念预测分布外泛化能力,揭示了模型中间推理与视觉状态的一致性对鲁棒性的影响。

Comments Following the initial submission, we conducted additional experiments that materially changed our understanding of the problem. These new results do not support the central claim of the current manuscript. To avoid disseminating conclusions that we no longer consider adequately supported, we are withdrawing this version while we reassess the findings and prepare a substantially revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏