arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 1658 篇

2608.09682 2026-08-11 cs.CV 新提交 50%

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning

用工具思考,而非用像素思考:工具调用作为视觉推理的文本支架

Jiahao Shao, Yuanbo Yang, Yiyi Liao, Yujun Shen, Ceyuan Yang, Yinghao Xu

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究提出工具调用支架假设,引入TextCall方法验证返回图像冗余,仅用结构化文本支架即可实现视觉推理,降低延迟并消除工具API调用,结论适用于现有相关基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09333 2026-08-11 cs.RO 新提交 50%

DH-VLM: Dual-Horizon Cooperative Latent Reasoning for Autonomous Driving

DH-VLM:面向自动驾驶的双时域协同隐层推理框架

Ziyi Song, Chen Xia, Hang Yu, Sheng Zhou, Zhisheng Niu

机构 * Tsinghua University(清华大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出DH-VLM双时域协同隐层推理框架,结合基础设施与自车实现非对称语义协同,构建协同QA数据集支撑推理,在规划性能、通信成本等指标上优于现有方法,为协同自动驾驶提供实用鲁棒范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08053 2026-08-11 cs.RO cs.CV 新提交 50%

PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets

PhysX-CoT:从单张图像生成可用于仿真的3D资产的结构化物理推理

Jie Huang, Xiaohe Li, Jiahao Li, Fangli Mou, Chen Qian, Yuqiang Fang, Junhao Fan, Kaixin Zhang, Zide Fan

机构 * Space Engineering University(航天工程大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 PhysX-CoT将单张图像生成仿真3D资产视为显式结构化物理推理过程,通过分解部件级状态轨迹优化相关指标,在多方面优于基线,生成资产在Unreal Engine 5中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07742 2026-08-11 cs.CV 新提交 50%

BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning

BRUCE:面向科学视觉-语言推理的污染升级下鲁棒性基准测试

Saim Rehman, Muhammad Shafique

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校)

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究提出BRUCE基准测试框架,通过RCI与T-RCI指标分析VLMs在科学视觉-语言推理任务中随污染升级的鲁棒性退化,实现可解释的失败分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06060 2026-08-07 cs.CV 新提交 50%

Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval

从失败中学习:基于难负例的以检索为中心的思维链用于统一多模态检索

Zelong Sun, Jun Wang, Kaicheng Yang, Tiancheng Gu, Ziyong Feng, Zhiwu Lu

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究提出UniME-R1框架,通过基于难负例的以检索为中心的思维链(RC-CoT)学习从检索失败中优化,在多模态检索基准上提升了性能。

Comments 26 pages,10 figures,14 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05757 2026-08-07 cs.CV 新提交 50%

Beyond Relevance: Bayesian Evidence Acquisition for Agentic Whole-Slide Image Reasoning

超越相关性:面向智能体的全切片图像推理的贝叶斯证据获取

Bryan Wong, Xun Xu, Huazhu Fu, Nancy F. Chen, Mun Yong Yi

机构 * A*STAR(新加坡科技研究局)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本研究提出BEACON框架,将WSI推理建模为贝叶斯证据获取问题,通过最大化预期信息增益减少诊断不确定性,在五个WSI-VQA基准的零样本实验中,其性能优于同类无训练智能体框架,提升了证据获取效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05369 2026-08-07 cs.RO cs.CV 新提交 50%

World-to-Wrist: Task-Conditioned Future Wrist Modeling for Fine-Grained Robot Manipulation

世界到手腕:面向精细机器人操作的任务条件未来手腕建模

Yuhao Pan, Haosong Peng, Zhengshen Zhang, Zhengyang Yan, Yalun Dai, Fushuo Huo, Chujie Wang, Tianyu Qi, Xiucheng Wang, Nan Cheng, Wenchao Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Wuhan University(武汉大学) Sun Yat-sen University(中山大学) Xidian University(西安电子科技大学) Southeast University(东南大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本研究提出W2-VLA模型,通过任务条件未来手腕建模结合W2-CoT辅助监督,在LIBERO等数据集及真实任务中提升了机器人精细接触敏感操作能力,动作生成速率超80Hz。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04385 2026-08-06 cs.CV 新提交 50%

ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination

ReGround:通过自诊断与视觉重检验恢复多步推理中的视觉接地

Lei Peng, Shuai Lv, Wei Hu

机构 * University of Science and Technology of China(中国科学技术大学) School of Artificial Intelligence and Data Science(人工智能与数据科学学院) State Key Laboratory of Precision and Intelligent Chemistry(精准与智能化学国家重点实验室)

专题命中 推理与问题求解 :language model(abstract)

AI总结 ReGround是无需架构修改或外部工具的两阶段框架,通过自诊断与视觉重检验解决VLMs多步推理中的视觉接地丢失问题,在八个基准上获一致增益且推理开销适度。

Comments Accepted to ACM Multimedia 2026 (MM '26). 8 pages main text, 4 figures, plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04166 2026-08-06 cs.HC 新提交 50%

Enacting Constructive Conflicts with AI Agents to Enhance Reconsideration among Novice Interaction Designers

借助AI智能体构建建设性冲突以提升新手交互设计师的重新考量能力

Howard Ziyu Han, Nikolas Martelaro

专题命中 推理与问题求解 :prompting(abstract)

AI总结 该研究构建受对抗性设计理论启发的AI智能体,通过45名设计学生的实验发现,该智能体实施的建设性冲突可提升新手交互设计师的重新考量能力,推动设计改进与创意拓展。

Comments 8 pages, 4 figures, conditionally accepted to Human-Agent Interaction 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03084 2026-08-05 cs.CV 新提交 50%

SUV: Future Scene Understanding as Video Generation for End-to-End Driving

SUV:将未来场景理解建模为视频生成的端到端驾驶

Yibo Yuan, Jiacheng Fu, Jiangtong Zhu, Yi Li, Jianhua Han, Meng Tian, Zhuohan Liu, Zhiwei Xiong, Hang Xu, Jianwu Fang, Jianru Xue

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 SUV是将未来场景理解建模为视频生成的端到端驾驶框架,其在NAVSIM-v2和WOD-E2E基准上优于近期SOTA方法,实现了更优的轨迹规划性能。

Comments 16 pages, 5 figures. Code: https://github.com/ASH-2046/SUV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01783 2026-08-04 cs.SD cs.HC stat.AP 新提交 50%

Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses: Single-Pass Deployment, Repeatability, and Strategy-Specific Bias

GPT-4o-mini与教师平均评分在音乐分析回答自动评分中的比较验证:单次部署、可重复性及策略特异性偏差

Baicheng Lin, Lingxi Jin, Kyung-Seok Min

机构 * Sejong University(世宗大学) Ewha Womans University(梨花女子大学)

专题命中 推理与问题求解 :prompting(abstract)

AI总结 本研究以教师平均评分为基准,评估GPT-4o-mini对音乐分析回答的自动评分能力,发现Fs+CoT策略与教师评分一致性最强,不同策略评分特征不同,实际应用需针对性校准与人工监督。

Comments Proceedings of the International Meeting of the Psychometric Society: The 91st Annual Meeting, Seoul, Republic of Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01201 2026-08-04 cs.RO cs.CV 新提交 50%

PRISM: Privileged Probabilistic Latent Supervision for End-to-End Autonomous Driving Motion Planning

PRISM:面向端到端自动驾驶运动规划的特权概率潜在监督

Volodymyr Havrylov, Faris Janjoš, Andreas Look, Jürgen Mathes, Andreas Geiger

机构 * University of Tübingen(蒂宾根大学) Bosch Center for Artificial Intelligence(博世人工智能中心) Coburg University(科堡大学) Tübingen AI Center(蒂宾根人工智能中心)

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究针对端到端自动驾驶模型梯度微弱问题,提出基于真实值的概率潜在监督框架,在 nuScenes 数据集上实现规划 L2 误差降 8%、碰撞率降 3%,且计算开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01119 2026-08-04 cs.SD 新提交 50%

JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents

JoyAI-Talker:面向共情语音智能体的全双工语音交互大模型

Yinhao Bai, Jinming Chen, Yafeng Chen, Wei Deng, Boya Dong, Nan Duan, Yu Gu, Weisheng Han, Yankun Huang, Ming Ke, Hao Li, Jingdong Li, Xiangyu Liang, Ning Liu, Yuan Liu, Ji Miao, Jiaqi Wang, Qi Wang, Wenchao Wang, Yuxuan Wang, Zhenfang Wang, Zhangyu Xiao, Chao Xue, Hongfei Xue, Fan Yu, Tianyi Zhang, Yuan Zhang, Yuqi Zhang, Lin Zhu

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 JoyAI-Talker采用Thinker-Talker架构等技术,实现兼具强推理能力与共情交互的全双工语音对话系统,在基准测试及用户打断、背景语音场景下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00975 2026-08-04 cs.CV 新提交 50%

MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

MonitorVLM-v2:用于实时安全违规检测的已部署视觉-语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) The Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算传感与机器人实验室)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出MonitorVLM-v2框架,将VLM安全评估转化为有限符号空间概率推理,结合SymPO算法与熵驱动分类机制,在地下矿部署中实现19.45倍提速,确认违规量达人工检查的2.78倍,满足实时可审计工业监控需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00540 2026-08-04 cs.CV 新提交 50%

DiffuseAgent-MI: Distributionally-Grounded,Tool-Integrated Self-Evolving Agents for Faithful Visual Reasoning

DiffuseAgent-MI:用于忠实视觉推理的基于分布、集成工具的自进化智能体

An Lanji, Dawei Liu, Jin Li, Haoran Xu, Mei Chen, Yu Tian

专题命中 推理与问题求解 :language agent(abstract)

AI总结 DiffuseAgent-MI是基于分布、集成工具的自进化视觉推理智能体,通过KL最小能量模型与轨迹级验证器提升忠实性,在多数据集上准确率及相关指标表现优于现有模型。

Comments 11 pages, 9 figures, accepted by ICML 2026 manitrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00518 2026-08-04 cs.CV 新提交 50%

GuideGround: VLM-guided Semantic Understanding and Viewpoint-aware Reasoning for 3D Visual Grounding

GuideGround:用于3D视觉定位的VLM引导语义理解与视点感知推理

Yiwen Wang, Yuyang Deng, Yihao Long, Xi Zhao

专题命中 推理与问题求解 :language model(abstract)

AI总结 GuideGround是一种VLM引导的3D视觉定位框架,用VLM生成的语义描述替代闭集分类、逐视图保留假设并经VLM验证,在ReferIt3D基准上性能优于现有SOTA。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29374 2026-08-03 cs.RO 新提交 50%

SAGP: Semantic Affordance-Guided Grasp Planning via Coarse-Zone VLM Reasoning

SAGP:基于粗区域VLM推理的语义 affordance 引导抓取规划

Muhayy Ud Din, Irfan Hussain

机构 * Khalifa University(哈利法大学) KU Center for Autonomous Robotic Systems (KUCARS)(KU自主机器人系统中心(KUCARS))

专题命中 推理与问题求解 :language model(abstract)

AI总结 SAGP是一种无训练的抓取规划框架,通过粗区域抽象层结合VLM推理与几何规划,在保持纯几何抓取高成功率的同时,提升了抓取的功能适用性,尤其适用于非对称带把手物体。

Comments Accepted in ICAME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29045 2026-08-03 cs.CV 新提交 50%

Adaptive Emotional Video Captioning via Affective Heterogeneous Graph Reasoning and Multi-task Joint Learning

基于情感异质图推理与多任务联合学习的自适应情感视频描述

Junbo Wang, Liangyu Fu, Yuke Li, Xuecheng Wu, Zhiyong Wang

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Computer Science, The University of Sydney(悉尼大学计算机学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 针对现有情感视频描述方法情感先验处理的缺陷,提出基于情感异质图与多任务联合学习的SAGML框架,实现了更鲁棒的情感视频描述性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27823 2026-07-31 cs.CV 新提交 50%

Hallucinations Leave a Grounding Signature:Verifier-Guided Decoding for Selective Object Correction

幻觉留下 grounding 特征:用于选择性对象修正的验证器引导解码

Lei Yang, Xinze Liu, Dayan Wu, Ding Wang, Hengjie Zhu, Zihao Zhang, Tianzhu Hu, Hanqi Wu, Peng Fu, Zheng Lin

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究针对大型视觉语言模型的对象幻觉问题,提出基于内在 grounding 特征(IGS)的验证器引导解码(VGD)框架,在保留视觉理解和对象覆盖率的同时,实现了最先进的对象幻觉缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27564 2026-07-31 cs.CV 新提交 50%

Inference-Time Agentic Decision Rules Beat Longer Evolving Search for Multi-Image Medical Reasoning

推理时代理决策规则在多图像医学推理任务中优于更长的进化搜索

Site Li, Jianyi Hao, Xiaofeng Liu

机构 * Yale University(耶鲁大学)

专题命中 推理与问题求解 :language agent(abstract)

AI总结 本研究对比5种推理时代理策略,发现多图像医学推理中,顺序投票决策规则比扩展进化搜索预算的影响更大,其最终测试准确率显著优于基线及复杂变体。

Comments Presented at the CVPR 2026 Workshop on Multi-Modal Reasoning for Agentic Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26579 2026-07-30 cs.RO cs.CV 新提交 50%

ContactFlow: A video action conditioning that transfers across embodiments

ContactFlow:一种可跨 embodiment 迁移的视频动作条件模型

Sami Azirar, Enrico Pallotta, Jan Nogga, Jürgen Gall, Sven Behnke, Hermann Blum

机构 * University of Bonn(波恩大学) Lamarr Institute(拉马尔研究所)

专题命中 推理与问题求解 :language model(abstract)

AI总结 Contact Flow 是一种与 embodiment 无关的动作表示,可跨人类演示与不同机器人 embodiment 迁移,用于构建能预测合理操纵结果的世界模型,集成到 pipeline 后在相关任务上表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23916 2026-07-28 math.NA cs.NA 新提交 50%

Recursive Governance: A Graph-Theoretic Framework for Risk Propagation and Drift Detection in Agentic AI Systems

递归治理:智能体人工智能系统中风险传播与漂移检测的图论框架

Sriram Nagaraj, Advaith Nila Narayanan

专题命中 推理与问题求解 :LLM(abstract)

AI总结 针对金融机构模型风险管理问题,提出动态IaC治理循环,贡献包括引入校准DoA得分、构建DAG定义算法、开发轨迹监测协议及解决版本变化等实际复杂性问题,用于智能体人工智能系统风险传播与漂移检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22076 2026-07-27 cs.CR cs.SE 新提交 50%

PoCEvolve: Generating Proof-of-Concept Exploits from Security Patches with Vulnerability-Aware Prompt Evolution

PoCEvolve:通过漏洞感知提示进化从安全补丁生成概念验证漏洞利用程序

Duc Manh Tran, Ratnadira Widyasari, Ivana Clairine Irsan, Huihui Huang, Ting Zhang, Shar Lwin Khin, Ouh Eng Lieh, Hong Jin Kang, David Lo

专题命中 推理与问题求解 :LLM(abstract)

AI总结 研究修复提交与详细漏洞报告可用性的延迟问题,提出PoCEvolve框架,可从漏洞修复提交直接生成概念验证漏洞利用程序,通过评估相关上下文指导提示进化,在不同模型上有不同成功率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21857 2026-07-27 cs.SD 新提交 50%

SoundscapeAgent: Agentic Soundscape Construction for Controllable Synthesis and Scalable Audio-Language Supervision

SoundscapeAgent:用于可控合成和可扩展音频-语言监督的智能音景构建

Hao Zhang, Yiwen Zhao, Yixuan Zhang, Yiwen Shao, Steve Yves

机构 * Tencent(腾讯)

专题命中 推理与问题求解 :LLM(abstract)

AI总结 提出智能音景构建框架SoundscapeAgent,基于大语言模型的智能体将用户意图转化为场景计划,经多步骤实现可控音频合成与可扩展音频-语言数据构建,在生成性能及下游音频推理方面表现出色。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21725 2026-07-27 cs.RO 新提交 50%

Addressing the Orchestration Gap in Generalist Robots via Physical Agency

通过物理智能解决通用机器人中的编排差距

Liane Galanti, Dhruv Shah, Tri Dao

机构 * Princeton University(普林斯顿大学) Together AI(联合人工智能)

专题命中 推理与问题求解 :post-training(abstract)

AI总结 研究通用机器人行动推理问题,提出将相关能力分解为语言条件策略/控制智能体与高级智能体管理器/编排器,构建物理智能体编排器Pigey,经评估其在模拟和实际任务中性能显著提升,缩小了编排差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21906 2026-07-27 physics.soc-ph 新提交 50%

A Knowledge-Grounded Behavioral Reasoning Framework for Training-Free Urban Healthcare OD Prediction

一种用于无训练城市医疗保健 OD 预测的知识驱动行为推理框架

Linzhen Yang, Xueliang Liu, Chengbo Zhang, Meng Meng

专题命中 推理与问题求解 :LLM(abstract)

AI总结 研究城市医疗保健 OD 预测问题,提出基于知识驱动行为推理的无训练框架,将异构城市信息组织成知识图谱,通过多智能体推理实现预测。实验表明该框架性能优于传统深度学习基线,凸显城市智能在医疗保健出行建模上从数据拟合到知识驱动推理的潜力。

Comments 16 pages, 9 figures. Submitted to the 4th International Conference on Urban Science and Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21025 2026-07-24 cs.RO 新提交 50%

ZONDA: Zero-shot Object Navigation with Dynamic Avoidance in Multi-floor Environments

ZONDA:多楼层环境中具有动态避障功能的零样本目标导航

Shaomin Liang, Xuanhong Liao, Shiyao Zhang

机构 * Southern University of Science and Technology(南方科技大学) Guangdong Direct Drive Technology Limited(广东直驱技术有限公司) South China University of Technology(华南理工大学) Great Bay University(大湾区大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 研究针对目标导航任务中现有方法局限,提出ZONDA框架,集成启发式多楼层规划、多视图目标验证、动态行人避障三个核心组件,通过真实机器人及模拟测试取得显著改进结果,在动态基准测试中表现优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20207 2026-07-23 cs.RO 新提交 50%

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

SeededGrasp:复杂场景中多实体语言引导抓取

Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of British Columbia(英属哥伦比亚大学) Google Deepmind(谷歌DeepMind)

专题命中 推理与问题求解 :language model(abstract)

AI总结 针对复杂场景中机器人抓取问题,提出 SeededGrasp 框架,通过 VLM 预测种子点,结合轻量级抓取生成模型,解耦语义与几何执行,无需端到端训练,发布多实体数据集,实验证明该方法优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19790 2026-07-23 cs.CV 新提交 50%

Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning

Trace:一种用于多领域视觉推理的分类法引导环境

Md Tanvirul Alam

机构 * Rochester Institute of Technology(罗彻斯特理工学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 针对视觉语言模型缺乏合适训练数据的问题,提出Trace分类法引导环境,将任务构建分解,通过共享语义状态确定相关元素,在该环境上的RLVR提升了模型在外部基准测试中的表现,证明训练可迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19547 2026-07-23 cs.CV eess.IV 新提交 50%

ChronoStitch: Training-Free Composition of Visual KV Memories for Long-Horizon Temporal Reasoning

ChronoStitch:用于长时程时间推理的视觉键值记忆的免训练组合

Santiram Tiwari, Nishant Sinha, Kunal Kislay

机构 * KGraph AI Solutions Pvt. Ltd.(KGraph人工智能解决方案私人有限公司)

专题命中 推理与问题求解 :language model(abstract)

AI总结 针对长视频问答中视觉KV记忆组合问题,ChronoStitch提出免训练方法,先将键值重基于全局坐标系,解决几何不一致问题,再处理残余内容差距,通过选择性重新计算部分视觉令牌,提升事件排序准确性且运行速度更快。

Comments 6 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏