arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 725 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 92 篇

2605.04227 2026-08-04 cs.AI cs.HC 版本更新 70%

Pro$^2$Assist: Continuous Step-aware Proactive Assistance with Multi-modal Egocentric Perception for Long-horizon Procedural Tasks

Pro²Assist:面向长程流程任务的、基于多模态自我中心感知的步骤感知主动式辅助系统

Lilin Xu, Bufang Yang, Siyang Jiang, Kaiwei Liu, Kaiyuan Hou, Yuang Fan, Hongkai Chen, Zhenyu Yan, Xiaofan Jiang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出Pro²Assist,一种基于多模态自我中心感知的步骤感知主动式辅助系统,通过AR眼镜感知与持续推理提升长程流程任务辅助效果,在动作理解与主动时机准确率上优于基线,获多数用户认可。

Comments To appear in IMWUT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02295 2026-08-04 cs.AI cs.LO 新提交 70%

MechGeo: Autoformalizing and Proving Euclidean Geometry in Lean 4

MechGeo:在Lean 4中自动形式化与证明欧几里得几何

Hao Shen, Junyu Guo, Tian Cui, Yuxuan Xiao, Lihong Zhi

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 MechGeo是基于Mathlib的智能体框架,可在Lean 4中自动形式化欧几里得几何问题并构造认证证明,在43道IMO几何题及Lean-IMO-Bbench上取得显著成果,为可信形式几何提供实用基础。

Comments 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01980 2026-08-04 cs.CV cs.AI 新提交 70%

AdaThinkV: Adaptive Thinking for Token-Efficient Video Reasoning

AdaThinkV:面向令牌高效视频推理的自适应思维

Jingqi Tian, Haoji Zhang, Lin Chen, Hongbo Jin, Haonan Xu, Tianrui Zhu, Xingming Shui, Shilin Ma, Wenjing Yang, Yansong Tang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出AdaThinkV自适应视频推理框架,通过ThinkGain与VRPO解决CoT推理的令牌浪费问题,在视频推理任务中以更少令牌实现优于最强自适应基线的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01827 2026-08-04 cs.CV cs.AI 新提交 70%

DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents

DeepVoyager-VL:为长视野多模态智能体激励视觉在环搜索

Huanyao Zhang, Jiepeng Zhou, Runhao Zhao, Yanzhe Shan, Jiaoyang Chen, Bowen Zhou, Bo Li, Fang Wang, Jialong Wu, Zhengwei Tao, Lang Mei, Xiaohan Yu, Liyan Liu, Chong Chen, Wentao Zhang

机构 * PKU(北京大学) HKUST(GZ)(香港科技大学(广州)) NUDT(中国人民解放军国防科技大学) OUC(中国海洋大学) HITSZ(哈尔滨工业大学(深圳)) Huawei Cloud BU(华为云业务部)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有多模态深度搜索忽视视觉中间推理作用的局限,提出DeepVoyager-VL框架,构建多模态事件图合成数据,设计智能体框架实现主动视觉获取,经10个基准实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01664 2026-08-04 cs.CV cs.LG 新提交 70%

FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering

FAU参加2026年ImageCLEF多模态推理任务:鲁棒候选评分与简洁多语种视觉问答

Mohamed Basem, Vincent Christlein

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔兰根-纽伦堡大学)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.LG

AI总结 FAU提交的多模态推理系统,未做任务特定模型训练,在2026年ImageCLEF竞赛中,获Visual MCQ第三名、Visual OpenQA第一名,凸显推理工程的实用价值。

Comments 16 pages, 3 figures, 7 tables. CLEF 2026 Working Notes, ImageCLEF 2026 Multimodal Reasoning Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01358 2026-08-04 cs.CL 新提交 70%

HopRefusalBench: Diagnosing Refusal Failures in Search-Augmented Agents for Multi-Hop Reasoning

HopRefusalBench:面向多跳推理的搜索增强智能体的弃权失败诊断基准

Jianan Xie, Xin Sun, Zhongqi Chen, Xing Zheng, Qiang Liu, Bowen Song

机构 * Ant Group(蚂蚁集团) NLPR, MAIS, CASIA(中国科学院自动化研究所模式识别国家重点实验室、多模态人工智能系统实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对多跳搜索增强智能体的弃权问题,构建首个可控基准HopRefusalBench,经实验发现前沿模型弃权能力存在显著不足,为相关可靠性改进提供基础。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00937 2026-08-04 cs.CR cs.AI cs.MA 新提交 70%

Neuro-Symbolic Participation Governance for Verifiable AI Agents in Open Digital Twin Ecosystems

开放数字孪生生态中可验证AI智能体的神经符号参与治理

Juan Li, Wei Cai, Yan Bai

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对开放数字孪生生态中AI智能体的验证需求,提出神经符号去中心化治理框架,结合神经推理与制度治理,通过区块链智能合约实现可审计参与,经原型验证可管控开销下保障合规协作。

Comments Accepted at the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC 2026), Bellevue, WA, USA, October 4-7, 2026. 7 pages, 1 figure, 5 tables. Code: https://github.com/weicaiuw/verigov-ai (DOI: 10.5281/zenodo.21706699)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00605 2026-08-04 cs.AI 新提交 70%

Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs

逃离置信陷阱:扩散大语言模型数学推理的进化解码

Zhenhong Sun, Hanqing Zhao, Yatao Bian, Rongcheng Tu, Liuyue Xie, Xu Zhang, Jue Wang, Davide Modolo, Daoyi Dong, Dacheng Tao

机构 * Australian National University(澳大利亚国立大学) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊) University of Technology Sydney(悉尼科技大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对扩散大语言模型数学推理的置信陷阱,提出无训练的进化解码框架,通过逐步选择与分块变异提升LLaDA 2.0的数学推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01095 2026-08-04 cs.CV cs.LG 版本更新 70%

NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding

NarrativeTrack: 评估实体中心推理在叙事理解中的表现

Hyeonjeong Ha, Jinjin Ge, Bo Feng, Kaixin Ma, Gargi Chakraborty

机构 * Apple(苹果公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 NarrativeTrack通过细粒度实体中心推理评估多模态大语言模型的叙事理解能力,揭示了感知接地与时间推理之间的根本权衡。

Comments Project Page: https://github.com/apple/ml-NarrativeTrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06090 2026-08-04 cs.SE cs.AI cs.CV 版本更新 70%

SVRepair: Structured Visual Reasoning for Automated Program Repair

SVRepair: 结构化视觉推理用于自动化程序修复

Jincheng Wang, Liwei Luo, Xiaoxuan Tang, Jingxuan Xu, Sheng Zhou, Dajun Chen, Wei Jiang, Yong Li

机构 * Ant Group(蚂蚁集团) Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems(浙江可感知智能系统重点实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SVRepair 通过结构化视觉表示框架,结合多模态信息提升程序修复的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21600 2026-08-04 cs.AI 版本更新 70%

CORE: Collaborative Reasoning via Cross Teaching

CORE:通过交叉教学实现协同推理

Kshitij Mishra, Mirat Aubakirov, Martin Takac, Nils Lukas, Salem Lahlou

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CORE通过交叉教学实现协同推理,利用模型互补性提升推理性能,无需扩大模型规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22069 2026-08-04 cs.PL cs.AI 70%

A Compute-Matched Re-Evaluation of TroVE on MATH

Tobias Sesterhenn, Ian Berlot-Attwell, Janis Zenkner, Christian Bartelt

机构 * Clausthal University of Technology, Clausthal, Germany(克莱斯特哈尔技术大学) Vector Institute, University of Toronto, Toronto, Canada(向量研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

Journal ref 2nd AI for Math Workshop at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02449 2026-08-04 cs.CV cs.RO 新提交 67%

MoRAL: Sensor-Grounded BEV Reasoning for Compact VLMs toward Edge-Oriented Autonomous Driving

MoRAL:面向边缘自动驾驶的紧凑型视觉语言模型的传感器接地鸟瞰图推理

Ambarish Govindarajulu Kaliamurthi, Kaikai Liu

专题命中 推理与问题求解 :language model(abstract,abstract_cn)

AI总结 MoRAL是一种两阶段微调流水线,指导Cosmos-Reason2-2B基于物理编码的BEV表示进行驾驶决策,在参数仅为零样本基准四分之一的情况下,在8类驾驶问题中7类胜出,紧急制动召回率提升至47.8%,可在消费级8GB GPU高效运行。

Comments 7 pages, 5 figures, 6 tables. Accepted to the 14th IEEE International Conference on Intelligent Mobile Computing (IEEE IMC 2026), Fukuoka, Japan, July 27-30, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01954 2026-08-04 cs.CV 新提交 67%

StyleForge: Indoor Furniture Styling by Counterfactual Reasoning in a Hypergraph Field

StyleForge:基于超图场中反事实推理的室内家具风格生成

Lingwei Dang, Shishuo Shang, Pan Liu, Jiajia Cheng, Ziyan Qiu, Zhenhao Zhang, Yufei Zhu, Shenghui Huang, Qingxin Xiao, Yun Hao, Juntong Li, Qingyao Wu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 StyleForge是基于动态超图风格场的室内家具风格生成框架,通过反事实风格偏好学习解决固定布局家具的风格冲突,在3D-FRONT数据集上实现了优于基线的家具检索和场景风格一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01522 2026-08-04 cs.LG cs.AI cs.CL 新提交 67%

Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics

问题催生问题:面向竞赛数学强化微调的自演进课程

Longtian Bao, Jianyou Wang, Yang Zhang, Youze Zheng, Ramamohan Paturi

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对竞赛数学强化微调的三大困难,提出Question-begets-Question(QbQ)方法及自演进课程,使Qwen2.5-Math-7B的AIME任务pass@1从5.6%提升至16.5%,且能解决更难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01113 2026-08-04 cs.CV 新提交 67%

CoT-Edit: Let CoT Guide Instruction Video Editing

CoT-Edit:让思维链(CoT)指导指令视频编辑

Sen Liang, Fengbin Guan, Youliang Zhang, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出CoT-Edit的plan--guide--edit框架,以CoT增强的MLLM为规划器生成空间先验,结合扩散编辑器实现高保真指令视频编辑,性能优于多个基准方法

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00066 2026-08-04 cs.CV 新提交 67%

PhysAgent: A Multi-Agent Framework for Reliable Remote Heart Rate Estimation

PhysAgent:用于可靠远程心率估计的多智能体框架

Yehui Yang, Bo Zhao, Junzhe Cao, Hui Ma, Yue Sun, Wenjin Wang, Zitong Yu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 PhysAgent是一种推理时多智能体候选验证框架,以多个基础rPPG估计器输出为待验证生理假设,结合Qwen3-VL-4B多模态大语言模型推理与确定性融合,提升远程心率估计的稳定性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29009 2026-08-04 cs.RO 版本更新 67%

D-VLC: Decentralized Vision-Language Collaboration for Heterogeneous Embodied Multi-Robot Systems in Unknown Environments

D-VLC:面向未知环境中异构具身多机器人系统的去中心化视觉-语言协作框架

Yuan Zhou, Ruitong Lin, Shen Wang, Weiqi Gai, Mo Zhu, Xin Zhou, Yuze Wu, Fei Gao

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 本文提出D-VLC框架,结合去中心化异步推理等技术,让通用VLM生成机器人特定动作,多场景实验显示其任务成功率超70%,完成时间较几何贪心基线最多缩短55.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31986 2026-08-04 cs.CV 版本更新 67%

CoLT: Teaching Multi-Modal Models to Think with Chain of Latent Thoughts

CoLT: 教会多模态模型通过潜在思维链进行思考

Lianyu Hu, Shengqian Qin, Zeqin Liao, Qing Guo, Liang Wan, Wei Feng, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) NKIARI AAIS & VCIP, Nankai University(南开大学AAIS & VCIP) Tianjin University(天津大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出CoLT框架,用潜在思维链代替文本推理,通过前向和后向解码器监督及内部监督实现高效多模态推理,在8个基准上优于现有方法,推理时间减少10.1倍。

Comments Accepted by ECCV2026. Code is available at https://github.com/hulianyuyy/CoLT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11385 2026-08-04 cs.CV 版本更新 67%

DeceptionX: From Multimodal Evidence to Explainable Deception Detection

DeceptionX: 基于多模态大语言模型的可解释欺骗检测

Jiayu Zhang, Shuo Ye, Jiajian Huang, Yawen Cui, Taorui Wang, Wei Xia, Zeheng Wang, Haowen Tang, Yelin Wang, Hui Ma, Zitong Yu

机构 * Great Bay University(大湾区大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出DeceptionX框架,将欺骗检测从黑箱分类转变为可解释的观察-思考-总结推理过程,通过构建DeceptChain数据集和三阶段训练管道,在标准基准上超越现有方法,同时提供专家级可解释推理路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01017 2026-08-04 cs.CL cs.AI 新提交 62%

Why LLMs Give In: Conversational Factors and Reasoning Behind Medical Sycophancy

大模型为何妥协:医学谄媚背后的对话因素与推理

Kaike Ping, Buse Çarık, Caleb Wohn, Xiaohan Ding, Tongshuai Wang, Eugenia Rho

机构 * Virginia Tech(弗吉尼亚理工大学) Shanghai Tongren Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属同仁医院) Emory University(埃默里大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现医学谄媚是对话属性而非模型属性,通过5个开放权重模型和500个MedQuAD问题的120万次试验,揭示了对话因素对医学谄媚的影响及思维链轨迹的解释。

Comments 21 pages, 7 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05158 2026-08-04 cs.CL cs.AI cs.MA 版本更新 62%

Streaming Communication in Multi-Agent Reasoning

多智能体推理中的流式通信

Zhen Yang, Xiaogang Xu, Wen Wang, Cong Chen, Xander Xu, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) ZJU(浙江大学) HKUST(香港科技大学)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出流式多智能体推理系统StreamMA,通过将推理步骤实时流式传输给下游智能体来降低延迟,并意外地提升了效果,同时首次给出流式、串行和单协议三种模式的闭式联合分析。

Comments project page: https://zhenyangcs.github.io/StreamMA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01930 2026-08-04 cs.CV cs.AI 新提交 57%

Recompute or Reuse? Diagnosing and Mitigating Textual Shortcuts in VLM Self-Reflection

重新计算还是复用?诊断与缓解视觉语言模型自反思中的文本捷径

Wenxiao Fan, Jingling Fu, Fang Li, Luohang Liu, Yu He, Lichen Ma, Zhiyang Yu, Weishan Bi, Junshi Huang, Yan Li, Gu Simiu, Kan Li

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 该研究针对VLM自反思中存在的文本捷径问题,通过反事实分析诊断其特性,提出无需训练的FSAF干预,显著提升视觉更新率、降低先前答案率,为缓解VLM的文本复用偏差提供了有效方案。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01112 2026-08-04 cs.AI 新提交 57%

Fighting Fire with Fire: On the Feasibility of Protecting Exercises Against AI Cheating

以毒攻毒:利用对抗机器学习保护练习题抵御AI作弊的可行性研究

Tobias Braun, Jonas Grebe, Louis Rethfeld, Marcus Rohrbach

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本研究探究利用对抗机器学习,通过在多模态选择题视觉组件添加扰动引导AI作弊者给出固定错误答案,再以统计检验检测作弊,以保护教育练习题抵御AI作弊的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08340 2026-08-04 cs.CV cs.AI 版本更新 57%

Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time

PokeGym: 一种以视觉驱动的长周期基准用于视觉-语言模型

Ruizhi Zhang, Ye Huang, Yuangang Pan, Chuanfu Shen, Zhilin Liu, Ting Xie, Haijun Lei, Lixin Duan

机构 * SIAS, UESTC(电子科技大学深圳高等研究院) CFAR/IHPC A*STAR(新加坡科技研究局高性能计算研究所)

专题命中 推理与问题求解 :language agent(abstract);分类 cs.AI

AI总结 PokeGym通过复杂的3D开放世界游戏评估视觉-语言模型在长周期任务中的表现,揭示了物理死锁恢复是当前模型的主要瓶颈,并发现高级模型存在元认知分歧。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03270 2026-08-04 cs.RO cs.AI 版本更新 57%

Grounded Vision-Language Interpreter for Long-Horizon Bimanual Task and Motion Planning

用于长 horizon 双臂任务与运动规划的接地视觉语言解释器

Jeremy Siburian, Keisuke Shirai, Cristian C. Beltran-Hernandez, Masashi Hamaya, Michael Görner, Atsushi Hashimoto

机构 * OMRON SINIC X Corporation(OMRON SINIC X公司) The University of Tokyo(东京大学) University of Hamburg(汉堡大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对现有视觉语言机器人规划框架的黑箱缺陷与双臂任务探索不足问题,提出混合规划框架 ViLaIn-TAMP,经烹饪领域任务及实际双臂机器人系统验证,其性能优于基准方法。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01783 2026-08-04 cs.SD cs.HC stat.AP 新提交 50%

Comparative Validation of GPT-4o-mini and Teacher Mean Scores for Automated Scoring of Music Analysis Responses: Single-Pass Deployment, Repeatability, and Strategy-Specific Bias

GPT-4o-mini与教师平均评分在音乐分析回答自动评分中的比较验证:单次部署、可重复性及策略特异性偏差

Baicheng Lin, Lingxi Jin, Kyung-Seok Min

机构 * Sejong University(世宗大学) Ewha Womans University(梨花女子大学)

专题命中 推理与问题求解 :prompting(abstract)

AI总结 本研究以教师平均评分为基准,评估GPT-4o-mini对音乐分析回答的自动评分能力,发现Fs+CoT策略与教师评分一致性最强,不同策略评分特征不同,实际应用需针对性校准与人工监督。

Comments Proceedings of the International Meeting of the Psychometric Society: The 91st Annual Meeting, Seoul, Republic of Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01201 2026-08-04 cs.RO cs.CV 新提交 50%

PRISM: Privileged Probabilistic Latent Supervision for End-to-End Autonomous Driving Motion Planning

PRISM:面向端到端自动驾驶运动规划的特权概率潜在监督

Volodymyr Havrylov, Faris Janjoš, Andreas Look, Jürgen Mathes, Andreas Geiger

机构 * University of Tübingen(蒂宾根大学) Bosch Center for Artificial Intelligence(博世人工智能中心) Coburg University(科堡大学) Tübingen AI Center(蒂宾根人工智能中心)

专题命中 推理与问题求解 :language model(abstract)

AI总结 该研究针对端到端自动驾驶模型梯度微弱问题,提出基于真实值的概率潜在监督框架,在 nuScenes 数据集上实现规划 L2 误差降 8%、碰撞率降 3%,且计算开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01119 2026-08-04 cs.SD 新提交 50%

JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents

JoyAI-Talker:面向共情语音智能体的全双工语音交互大模型

Yinhao Bai, Jinming Chen, Yafeng Chen, Wei Deng, Boya Dong, Nan Duan, Yu Gu, Weisheng Han, Yankun Huang, Ming Ke, Hao Li, Jingdong Li, Xiangyu Liang, Ning Liu, Yuan Liu, Ji Miao, Jiaqi Wang, Qi Wang, Wenchao Wang, Yuxuan Wang, Zhenfang Wang, Zhangyu Xiao, Chao Xue, Hongfei Xue, Fan Yu, Tianyi Zhang, Yuan Zhang, Yuqi Zhang, Lin Zhu

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 JoyAI-Talker采用Thinker-Talker架构等技术,实现兼具强推理能力与共情交互的全双工语音对话系统,在基准测试及用户打断、背景语音场景下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00975 2026-08-04 cs.CV 新提交 50%

MonitorVLM-v2: A Deployed Vision-Language Framework for Real-Time Safety Violation Detection

MonitorVLM-v2:用于实时安全违规检测的已部署视觉-语言框架

Jiang Wu, Sichao Wu, Yinsong Ma, Lifang Zheng, Jingliang Duan

机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) The Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算传感与机器人实验室)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出MonitorVLM-v2框架,将VLM安全评估转化为有限符号空间概率推理,结合SymPO算法与熵驱动分类机制,在地下矿部署中实现19.45倍提速,确认违规量达人工检查的2.78倍,满足实时可审计工业监控需求。

详情

展开后加载摘要…

URL PDF HTML 收藏