arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-28 至 2026-07-28 共收录 209 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 14 篇

2602.05387 2026-07-28 cs.CV cs.LG 版本更新 79%

Parallel Swin Transformer-Enhanced 3D MRI-to-CT Synthesis for MRI-Only Radiotherapy Planning

并行Swin Transformer增强的3D MRI到CT合成用于仅MRI放疗规划

Zolnamar Dorjsembe, Hung-Yi Chen, Furen Xiao, Hsing-Kuo Pao

专题命中 视觉空间推理 :planning(title,abstract);分类 cs.LG

AI总结 本文提出并行Swin Transformer增强的Med2Transformer架构,通过结合卷积编码与双Swin Transformer分支,提高MRI到CT合成的图像质量和几何精度,实现仅MRI的放疗规划。

Comments This preprint has been accepted for publication in the proceedings of the IEEE 23rd International Symposium on Biomedical Imaging (ISBI 2026). The final published version is available at https://doi.org/10.1109/ISBI61048.2026.11515734. The copyright for this work has been transferred to IEEE

Journal ref Proceedings of the 23rd IEEE International Symposium on Biomedical Imaging (ISBI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22864 2026-07-28 cs.CV cs.AI 新提交 77%

Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

空间智商:通过分层能力测试解构空间智能

Patrick Rim, Tom Long, Ekta Prashnani, Ruth Rosenholtz, Ben Boudaoud, Peter Xenopoulos, Alex Wong, Joohwan Kim, Jae-Hyun Jung

机构 * NVIDIA Research(英伟达研究院) Yale University(耶鲁大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24586 2026-07-28 cs.CL cs.AI 新提交 62%

D-Score: A Spectral Hidden-State Signal for Hallucination Detection in Large Language Models

D分数:一种用于大语言模型中幻觉检测的谱隐藏状态信号

Bianca Raimondi, Davide Evangelista, Maurizio Gabbrielli, Elena Loli Piccolomini

机构 * Department of Computer Science and Engineering, University of Bologna(博洛尼亚大学计算机科学与工程系)

专题命中 视觉空间推理 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型幻觉检测,提出基于隐藏激活几何结构的D分数,通过单次前向传播计算,用作幻觉分数。经实验验证,该分数是强大的隐藏状态信号,检测时无需外部验证器等,为幻觉检测提供新方法。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23944 2026-07-28 cs.AI 新提交 57%

DICA: Dual-Indicator Guided Contrastive Alignment in Multimodal Large Language Models

DICA:多模态大语言模型中的双指标引导对比对齐

Hao Yang, Jin Wang, Xuejie Zhang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型的问题,提出双指标引导对比对齐方法(DICA),通过跟踪视觉注意力熵和输出图像相关性两个指标,根据异常情况触发对比对齐,实验证明该方法能提升模型可靠性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23899 2026-07-28 cs.RO cs.AI 新提交 57%

Embodied GPT-5.1: Evidence of a World Model?

具身化GPT-5.1:世界模型的证据?

Roberto Spinelli, Thiago C. Martins

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探索无实体化训练的GPT-5.1能否控制物理移动机器人,通过低分辨率图像和离散动作集执行任务。它展现出空间推理等新兴能力,但也有效率和感知局限。结果挑战传统观点,促使深入研究大语言模型中物理理解相关问题。

Comments 6 pages, 16 figures. Published in the 2026 Brazilian Conference on Robotics (CROS)

Journal ref R. Spinelli and T. C. Martins, "Embodied GPT-5.1: Evidence of a World Model?," 2026 Brazilian Conference on Robotics (CROS), pp. 394-399, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23491 2026-07-28 cs.CV cs.CL 新提交 57%

PlanCraft: Sketch, Refine, and Furnish for Architect-Inspired Progressive 3D Residential Scene Generation

PlanCraft:用于受建筑师启发的渐进式3D住宅场景生成的草图绘制、细化和布置

Pengyu Zeng, Yuqin Dai, Jun Yin, Ziyang Han, Ng Cheuk Hei, Jing Zhong, Chaoyang Shi, ZhanXiang Jin, Maowei Jiang, Yuxing Han, Shuai Lu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 研究针对自动住宅平面图生成中忽视的设计渐进性及二维平面图重要性问题,提出PlanCraft,通过SketchPlan提供训练信号,PlanCraft-Diff细化草图,PlanCraft-Agent布置场景,实验显示其在FID及空间合理性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22721 2026-07-28 cs.CV cs.AI 新提交 57%

An Interactive Vision Language Platform for Cognitive Remediation in Schizophrenia

用于精神分裂症认知康复的交互式视觉语言平台

Nassira Ait Mehdi, Milissa Temmam, Slimane Larabi

机构 * Computer Science Faculty, USTHB University(USTHB大学计算机科学学院) RIIMA Laboratory(RIIMA实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 针对精神分裂症患者认知康复任务中动作评估依赖人工观察的问题,提出基于视觉语言模型的自动化框架,通过分析视频和微调模型验证动作,收集数据集评估,有效连接物理与临床反馈,提供可扩展客观方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15476 2026-07-28 cs.RO 版本更新 50%

FARM: Find Anything using Relational Spatial Memory

FARM: 使用关系空间记忆找到任何物体

Siming He, Leo Huang, Adam Lilja, Fabio Huebel, Jonas Frey, Marco Pavone, S. Shankar Sastry, Jitendra Malik, Claire Tomlin

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出FARM系统,通过实时构建包含几何、视觉语言描述和视角证据的开放词汇物体级记忆,并利用VLM解析查询和显式空间约束,在44k语言查询中Recall@5和Recall@10分别提升164%和224%,Accuracy@1提升35%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03316 2026-07-28 cs.CV 版本更新 50%

When Sinks Help or Hurt: Unified Framework for Attention Sink in Large Vision-Language Models

当汇点帮助或伤害:面向大视觉-语言模型的注意力汇点统一框架

Jiho Choi, Jaemin Kim, Sanghwan Kim, Seunghoon Hong, Jin-Hwi Park

机构 * KAIST(韩国科学技术院) Chung-Ang University(中央大学) Technical University of Munich(慕尼黑工业大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究了大视觉-语言模型中注意力汇点的影响,提出统一框架分析其作为冗余 artifacts 或全局先验的作用,并通过 Layer-wise Sink Gating 模块平衡全局推理与局部证据。

Comments Acknowledgments updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14807 2026-07-28 cs.CV cs.RO 版本更新 50%

HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System

HiMemVLN:通过分层记忆系统增强开源零样本视觉-语言导航的可靠性

Kailin Lyu, Kangyi Wu, Pengna Li, Xiuyu Hu, Qingyi Si, Cui Miao, Ning Yang, Zihang Wang, Long Xiao, Lianyu Hu, Jingyuan Sun, Ce Hao

专题命中 视觉空间推理 :CoT(abstract)

AI总结 本文提出HiMemVLN,通过分层记忆系统提升开源零样本视觉-语言导航的可靠性,解决导航遗忘问题,实现实验环境下的性能提升。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00288 2026-07-28 cs.RO cs.CV 版本更新 50%

UAV-ON: A Benchmark for Open-World Object Goal Navigation with Aerial Agents

UAV-ON:用于空中智能体的开放世界目标导航基准测试

Jianqiang Xiao, Yuexuan Sun, Yixin Shao, Boxi Gan, Rongqiang Liu, Yanjin Wu, Weili Guan, Xiang Deng

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 介绍用于空中智能体开放世界目标导航的UAV-ON基准测试,含14个环境及1270个目标对象,通过实例级指令编码。实现多种基线方法评估,结果凸显空中导航和语义目标基础的复合挑战,推动复杂环境下无人机可扩展自主性研究。

Comments Accepted to ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 13 篇

2607.24617 2026-07-28 cs.IR 新提交 87%

LaRec: Unleashing LLM-based Latent Reasoning for Generative Recommendation

LaRec:释放基于大语言模型的生成式推荐中的潜在推理能力

Yu Xia, Zihan Lin, Wei Yang, Rui Zhong, Cheng Chen, Huan Ren, Yao Hu

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 研究针对LLMs在推荐中现有方法的问题,提出LaRec框架。核心方法是通过潜在预训练赋予潜在推理能力,用个性化强化学习调整引导遍历多样推理路径。主要贡献是在多数据集实验中,以相当效率显著超越现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23771 2026-07-28 cs.AI 新提交 77%

Training Language Models to Cooperate with Inference-Time Controllers

训练语言模型以与推理时控制器协作

Moumita Choudhury, Vanshaj Khattar, Jing Liu, Toshiaki Koike-Akino, Ankush Chakrabarty, Shlomo Zilberstein, Ye Wang

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.AI

AI总结 研究LLM性能依赖推理时控制器的问题,提出CALM框架,将其表述为多任务强化学习,通过模块级分解研究训练策略,评估显示该框架能提升推理时工作流程的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24937 2026-07-28 cs.AI cs.CL cs.IR cs.LG 版本更新 75%

The Hitchhiker's Guide to Agentic AI: From Foundations to Systems

《智能体AI的搭车指南:从基础到系统》

Haggai Roitman

机构 * Haggai Roitman

专题命中 测试时计算 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文为构建自主AI系统提供全面实践参考,覆盖从Transformer架构、训练优化到对齐、推理、检索增强生成、记忆系统、智能体设计模式及多智能体协调的完整技术栈。

Comments version 1.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15263 2026-07-28 cs.CR cs.AI 版本更新 70%

Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents

超越成功率:攻防安全代理的成本感知评估

Paul Kassianik, Blaine Nelson, Yaron Singer

专题命中 测试时计算 :reasoning(abstract);test-time compute(abstract);分类 cs.AI

AI总结 研究通过成本-成功率视角评估语言模型安全代理,在攻防挑战中比较固定成本下模型性能,发现红蓝队任务扩展模式不同,进攻性CTF性能与测试时计算量有关,防御性SOC调查更依赖工具使用等,强调安全代理基准应考量经济效率与运营契合度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22962 2026-07-28 cs.AI cs.CL 新提交 62%

ConsistencyGate: Preventing Memory Contamination in LLM Agents via Self-Consistency Admission Control

一致性门控:通过自一致性准入控制防止大语言模型智能体中的内存污染

Yan Zhang, Shibo Li

机构 * Florida State University(佛罗里达州立大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型智能体内存污染问题,提出一致性门控方法,在提交候选事实前向模型查询K次获软支持分数,超阈值才准入。该机制与模型无关、无需微调,经实验在四个模型主干上减少了污染,还发布了相关基准和实现。

Comments 24 pages, 2 figures, 6 tables, 1 algorithm; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22083 2026-07-28 cs.AI cs.CL 版本更新 62%

Nanbeige4.2-3B: Unlocking Agentic Capabilities in a Compact Model

南贝格4.2 - 3B:以紧凑模式解锁智能体能力

Nanbeige Lab, :, Chen Yang, Chengrui Huang, Fufeng Lan, Hanhui Chen, Hao Zhou, Huatong Song, Jiaqi Cao, Jiaying Zhu, Jinlin Niu, Kai Wang, Lisheng Huang, Qiliang Liang, Ran Le, Ruixiang Feng, Shuang Sun, Tao Gu, Tao Zhang, Tianyu Luo, Yang Song, Yun Xing, Yuntao Wen, Ziyao Xu, Zongchao Chen, Zongqiang Li

机构 * Nanbeige LLM Lab(南北贝大语言模型实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 介绍南贝格4.2 - 3B紧凑通用智能体模型,通过特定预训练方式构建,利用多种强化学习方法提升质量与效率,在多任务和基准测试中表现出色,优于更大模型,有潜力成为紧凑本地个人助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29758 2026-07-28 cs.LG cs.AI 版本更新 62%

PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

PS-PPO: 用于无评论者RLHF的前缀采样PPO

Doo Hwan Hwang, Kee-Eung Kim

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出PS-PPO方法,通过前缀采样和重要性加权修正,在无评论者RLHF中减少训练计算和内存,保持准确率。

Journal ref ICML 2026 published

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24300 2026-07-28 cs.CL cs.MA 新提交 57%

Self-Authored Verification Is Unreliable in Heuristic Self-Improving Agents

在启发式自我改进智能体中自我编写的验证不可靠

Diandian Guo, Cong Cao, Fangfang Yuan, Yingqi Wang, Yueshan Wang, Dakui Wang

专题命中 测试时计算 :verifier(abstract);分类 cs.CL

AI总结 研究启发式自我改进智能体中自我编写验证不可靠的问题,引入密封外部接受循环(SEAL)方法,通过实验发现该问题在启发式学习中常现,自我验证失败按能力分层,SEAL性能优于无保护基线。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23273 2026-07-28 cs.IR cs.AI cs.ET 新提交 57%

Statistically Supported LLM Ingredient and Recipe Data Collection in Computational Nutrition

计算营养中统计支持的大语言模型成分与食谱数据收集

James Izzard, Hassan Eshkiki, Fabio Caraffini

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究针对计算营养中成分数据问题,提出结合统计估计、不变性检查和网络获取的大语言模型管道。通过该管道可获取精确数据,在参考集上实现高匹配度并大幅降低误差,将大语言模型辅助数据库构建变为可控流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22602 2026-07-28 cs.AI 新提交 57%

DeepLook: Deeper Thinking with Lookahead

DeepLook:通过前瞻进行更深入思考

Tingxin Yang, Zefeng Wang, Mengyue Wang, Xingcheng Zhou, Yunpu Ma

机构 * Technical University of Munich(慕尼黑工业大学) LMU Munich(慕尼黑大学) MCML, LMU, MemAgents Lab(慕尼黑大学机器学习中心、记忆代理实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在改进大语言模型推理,提出无需训练的DeepLook框架,通过将前瞻计算集中在不确定性瓶颈处,聚合令牌级置信度为段级信号并排序投票。在四个数学基准测试中,该方法改变准确率与令牌成本的帕累托前沿,提升准确率并减少令牌生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22556 2026-07-28 cs.AI 新提交 57%

MIITA: Memory-Induced Inference-Time Adaptation for Continual Learning with Small Language Models

MIITA:用于小语言模型持续学习的内存诱导推理时间自适应

Dong Li, Yanchi Liu, Xujiang Zhao, Wei Cheng, Zhengzhang Chen, Xintao Wu, Zhong Chen, Chen Zhao, Haifeng Chen

机构 * Baylor University(贝勒大学) NEC Laboratories America(美国 NEC 实验室) University of Arkansas(阿肯色大学) Southern Illinois University(南伊利诺伊大学)

专题命中 测试时计算 :reasoning(abstract);分类 cs.AI

AI总结 针对小语言模型持续学习中参数更新致灾难性遗忘及内存不足问题,提出MIITA框架,它通过存储校正方向原型并在推理时检索应用,结合理论分析,在多种设置实验中提升性能并减轻遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09771 2026-07-28 cs.CV 50%

STORM: Segment, Track, and Object Re-Localization from a Single Image

STORM:从单张图像进行片段、跟踪和目标重定位

Yu Deng, Teng Cao, Hikaru Shindo, Quentin Delfosse, Jiahong Xue, Kristian Kersting

机构 * Department of Computer Science, Technical University of Darmstadt, Darmstadt, Hesse, Germany(德累斯顿技术大学计算机科学系) Hessian Center for Artificial Intelligence (hessian.AI), Darmstadt, Hesse, Germany(黑森人工智能中心(hessian.AI)) German Research Center for Artificial Intelligence (DFKI), Darmstadt, Hesse, Germany(德国人工智能研究中心(DFKI)) Centre for Cognitive Science, Technical University of Darmstadt, Darmstadt, Hesse, Germany(德累斯顿技术大学认知科学中心) Google Intrinsic AI Research, Germany. † Work done while at the AIML research lab, now working at Intrinsic, Google.(谷歌Intrinsic AI研究)

专题命中 测试时计算 :verifier(abstract)

AI总结 STORM提出一种统一框架,通过单张参考图像实现6D跟踪,减少人工干预并提升鲁棒性,实验显示其在无标注姿态跟踪和严重遮挡场景中表现优异。

Comments 21 pages. Accepted at the 43rd International Conference on Machine Learning (ICML 2026); camera-ready version

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), PMLR, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00575 2026-07-28 cs.RO 版本更新 50%

Agentic Reward Modeling: Verifying GUI Agent via Progressive Trajectory-Grounded Interaction

代理奖励建模:通过在线主动交互验证GUI代理

Chaoqun Cui, Jing Huang, Shijing Wang, Liming Zheng, Qingchao Kong, Zhixiong Zeng

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences School of Artificial Intelligence, University of Chinese Academy of Sciences School of Computer Science \& Technology, Beijing Jiaotong University

专题命中 测试时计算 :verifier(abstract)

AI总结 VAGEN通过引入代理交互验证范式,解决GUI代理评估中的视觉限制问题,提升评估准确性与性能。

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 16 篇

2607.22713 2026-07-28 cs.AI 新提交 79%

SEGRA: Structured Experience-Guided Graph Reasoning Agent for Gremlin Based Question Answering

SEGRA:用于基于Gremlin的问答的结构化经验引导图推理代理

Saiyue Lyu, Mariam Dundua, Vishaal Kapoor, Sarthak Ahuja, Neda Kordjazi, Evren Yortucboylu, Harsh Amin, Rebecca Steinert

机构 * University of British Columbia(英属哥伦比亚大学) Amazon(亚马逊)

专题命中 复杂问题求解 :reasoning(title);chain-of-thought(abstract);分类 cs.AI

AI总结 针对企业文本到Gremlin问答难题,SEGRA引入经验引导代理,集成多种技术,包括意图路由、查询生成等。在企业IT支持基准测试中成绩出色,平均评判分数大幅提高,技能库还降低了成本,提升了企业图问答的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13751 2026-07-28 cs.CL 版本更新 79%

Which Models Perform Better in Inheritance Reasoning?

哪些模型在继承推理中表现更好?

Mohammed Amine Mouhoub, Chahinez Bouchekif

机构 * Paris Dauphine University(巴黎多芬纳大学) University of Abou Bekr Belkaïd(阿布·贝克尔·贝尔卡伊德大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文比较了商业和开源大语言模型在伊斯兰继承推理任务中的表现,发现商业模型在识别继承人、应用排除规则和保持推理一致性方面更优,其中Gemini 2.5 Flash表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03021 2026-07-28 cs.CL 版本更新 79%

Hint-Guided Diversified Policy Optimization for LLM Reasoning

提示引导的多样化策略优化用于大语言模型推理

Zhiyu Cao, Kaixin Wu, Mingjie Zhong, Peifeng Li, Can Ye, Qiaoming Zhu

机构 * School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 提出提示引导的多样化策略优化(HDPO),通过“提出-选择-思考”轨迹激励模型生成多样且可靠的解决方案,提升推理能力、候选方案多样性和可靠方案识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24407 2026-07-28 cs.CV 新提交 78%

Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

思想令牌混合:统一感知与推理以实现自由形式多模态基础定位

Tianyi Gao, Han Fang, Tianyi Ding, Hao Li, Xin Wei, Hongbo Sun, Xiaodong Dong, Ye Yuan, Jinglin Xu, Kongming Liang, Hao Sun, Jingmin Xin

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 研究旨在统一多模态基础定位中的感知与推理。提出思想令牌混合(Motto)方法,通过空间接地思想令牌化及上下文自适应令牌链实现,构建PR-Bench基准,实验证明该方法在自由形式接地任务中达领先性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22902 2026-07-28 cs.AI cs.SE 新提交 70%

How Well Can AI Generate Backlogs from App Mockups?

人工智能从应用程序原型生成待办事项列表的效果如何?

Andrea Lezcano Airaldi, Lourdes Romera, Walid Maalej

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究人工智能从应用程序原型生成待办事项列表的效果,提出多模态方法,评估三种提示策略,发现结合架构上下文的混合提示有帮助,结果因项目类型而异,还提出新度量,强调开发人员监督必要。

Comments Accepted at the AIRE Workshop, IEEE 34th International Requirements Engineering Conference (RE) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21013 2026-07-28 cs.AI cs.CV 版本更新 70%

EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization

EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解

Lihuang Fang, Yuchen Zou, kebing Jin, Jinghui Qin

机构 * Guangdong University of Technology(广东工业大学) Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究针对现有多模态情感识别方法忽视情感源动态性和复杂性的问题,提出基于强化学习的动态智能体专业化框架EmoAgent-R1,采用冷启动策略和两步智能体工作流程训练,并用P-GRPO优化,实验证明其在情感推理性能和优化稳定性上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏