EgoVITA: Learning to Plan and Verify for Egocentric Video Reasoning
EgoVITA:学习规划与验证以实现自我中心视频推理
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 提出EgoVITA框架,通过先规划自我中心动作序列再以第三方视角验证时空一致性的方法,提升自我中心视频推理的准确性。
Comments ECCV 2026
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
EgoVITA:学习规划与验证以实现自我中心视频推理
专题命中 复杂问题求解 :reasoning(title,abstract)
AI总结 提出EgoVITA框架,通过先规划自我中心动作序列再以第三方视角验证时空一致性的方法,提升自我中心视频推理的准确性。
Comments ECCV 2026
图任务算法推理中Transformer的深度-宽度权衡
机构 * Courant Institute of Mathematical Sciences, New York University(纽约大学应用数学科学研究所) ; Google Research(谷歌研究) ; Meta AI ; Bar-Ilan University(巴伊兰大学) ; Department of Bio-Medical Engineering, Edmond J. Safra Center for Bioinformatics, Tel-Aviv University(生物医学工程系,埃德蒙·J·萨法中心,特拉维夫大学) ; Tel Aviv University(特拉维夫大学)
专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI、cs.LG
AI总结 研究Transformer在图算法任务中深度与宽度的权衡,发现线性宽度下常数深度足以解决许多图问题,而某些问题需要二次宽度,实验验证了宽模型在保持精度的同时训练和推理更快。
Comments Updated ISF grant number
具有记忆增强的强化学习代理的CAD生成
机构 * Zhejiang University(浙江大学)
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);self-correction(abstract);分类 cs.AI
AI总结 本文提出了一种记忆增强的强化学习框架,用于生成CAD模型,通过引入强化学习进行检索和策略优化,有效避免了检索陷阱,提高了复杂CAD模型生成的成功率和几何一致性。
Comments We are withdrawing this manuscript because we have identified issues in the current analysis that require substantial revision. Until these issues are resolved, we do not consider the present version suitable for citation
GRIP:通过微调大语言模型进行参数内图推理
机构 * Washington University in Saint Louis(华盛顿大学圣路易斯分校) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)
专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI
AI总结 研究如何让大语言模型适应结构数据,提出GRIP方法,通过微调任务将图关系知识内化到模型参数,存储于轻量级LoRA模块,实验表明该方法在处理大图时优于基线,处理小图时以低推理成本达可比性能。
DeALOG: 去中心化多智能体日志中介推理框架
机构 * Arizona State University(亚利桑那州立大学)
专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI
AI总结 提出去中心化多智能体框架DeALOG,通过共享自然语言日志实现多模态问答,各专业智能体协作检测和验证错误,无需中央控制,提升鲁棒性。
BioProVLA-Agent:一种经济实惠、基于协议、视觉增强的VLA启用的具身多智能体系统,具备闭环推理能力,用于生物实验室操作
机构 * Key Laboratory of Smart Manufacturing in Energy Chemical Process Ministry of Education, East China University of Science and Technology, Shanghai, CN(能源化工过程智能制造教育部重点实验室,东华大学,上海,中国) ; Department of Computer Science and Engineering, East China University of Science and Technology, Shanghai, CN(东华大学计算机科学与工程系,上海,中国) ; Department of Laboratory Medicine, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, Shanghai, CN(复旦大学附属瑞金医院检验医学科,上海,中国) ; School of Information Science and Technology, Shihezi University, Shihezi, CN(石河子大学信息科学与技术学院,石河子,中国)
专题命中 复杂问题求解 :reasoning(title);分类 cs.AI
AI总结 本文提出BioProVLA-Agent,通过协议驱动和视觉增强,实现生物实验室操作中的具身多智能体系统,具备闭环推理能力,提升在湿实验室环境中的执行稳定性。
Comments 17 pages, 10 figures
MemSifter: 通过结果驱动的代理推理卸载LLM记忆检索
机构 * Gaoling School of Artificial Intelligence Renmin University of China Beijing China(中国人民大学朝阳学校人工智能 北京 中国) ; Renmin University of China(中国人民大学)
专题命中 复杂问题求解 :reasoning(title);分类 cs.AI
AI总结 提出MemSifter框架,用小模型代理替代主LLM进行记忆检索,通过强化学习优化检索结果,在8个基准上达到或超越现有方法。
Comments Code and datasets are available at https://github.com/plageon/MemSifter
REMAC:用于长时程机器人操作的自反思与自进化多智能体协作框架
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出REMAC自适应多智能体规划框架,通过自反思与自进化实现多机器人长时程任务规划,在RoboCasa基准测试中使任务平均成功率提升40%、执行效率提升52.7%。
Comments 24 pages, 8 figures
面向网络安全专家的小型语言模型
机构 * IBM Research(IBM研究院)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
AI总结 针对网络安全领域缺乏高质量领域模型和训练数据的问题,提出CyberPal 2.0系列小型语言模型(4B-20B参数),通过SecKnowledge 2.0管道生成增强的思维链指令数据集,在多项网络安全基准测试中超越基线并匹配或超越前沿模型。
知止:用于减少过度思考的片段级信用分配
机构 * Capital One(第一资本)
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL
AI总结 提出DASH方法,通过将推理轨迹中的最终答案候选与真实值比较,实现片段级信用分配,减少推理语言模型过度思考行为,在AIME25上准确率达50.8%。
LLMAR:一种适用于稀疏且文本丰富的工业领域的无调优推荐框架
机构 * Hitachi, Ltd. Research and Development Group(日立株式会社研发部门) ; Hitachi Power Solutions Co., Ltd.(日立电力解决方案公司)
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL
AI总结 LLMAR通过无调优框架整合大语言模型推理,捕捉用户潜在动机,解决工业领域数据稀疏问题,提升推荐准确率和效率。
Comments 10 pages, 3 figures
EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解
机构 * Guangdong University of Technology(广东工业大学) ; Southern University of Science and Technology(南方科技大学) ; Xi’an Jiaotong University(西安交通大学) ; Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 研究针对现有多模态情感识别方法忽视情感源动态性和复杂性的问题,提出基于强化学习的动态智能体专业化框架EmoAgent-R1,采用冷启动策略和两步智能体工作流程训练,并用P-GRPO优化,实验证明其在情感推理性能和优化稳定性上更优。
HVR-Met:一种用于极端天气诊断的假设验证-重新规划智能系统
专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI
AI总结 针对深度学习天气预报难以应对极端天气诊断的挑战,提出HVR-Met多智能体气象诊断系统,其核心是假设验证-重新规划闭环机制,引入新基准测试,实验证明该系统在复杂诊断场景中表现出色。
CLEANER:自我净化轨迹助力智能强化学习
机构 * Peking University(北京大学) ; NTU, Singapore(新加坡国立大学)
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.LG
AI总结 研究参数受限模型探索阶段因执行失败产生噪声轨迹影响策略优化的问题,提出CLEANER,利用模型自我纠错能力净化轨迹,其SAAR机制提升平均准确率,减少训练步骤。
改善人机编码对齐:心理学构念识别中提示工程的实证评估
机构 * Department of Educational Psychology, Neag School of Education, University of Connecticut(教育心理学系,教育学院,康涅狄格大学) ; Department of Psychological Sciences, College of Liberal Arts and Sciences, University of Connecticut(心理学系,文理学院,康涅狄格大学)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL
AI总结 本研究提出一个实证框架,通过提示工程优化大语言模型在心理学文本中识别构念的性能。实验评估五种提示策略,发现构念定义和任务框架最关键,结合代码簿引导和自动提示工程的少样本方法最接近专家判断。
Comments 22 pages, 2 figures
TraceSafe: 对LLM在多步骤工具调用轨迹上的安全护栏的系统评估
机构 * CyCraft AI Lab, Taiwan(CyCraft AI实验室(台湾)) ; National Taiwan University(国立台湾大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出TraceSafe-Bench,首个评估中间轨迹安全的综合基准,发现安全护栏效果更依赖结构数据能力而非语义安全对齐,通用模型在轨迹分析中表现更优,且准确性随执行步骤增加而提升。
Comments Accepted to Conference on Language Modeling (COLM) 2026
Kimi K2.5:视觉代理智能
机构 * Kimi Team(Kimi 团队)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Kimi K2.5通过联合优化文本和视觉模态,提出Agent Swarm框架,实现多模态代理智能的先进性能和高效任务处理。
Comments Kimi K2.5 tech report
DeepImagine: 通过连续反事实想象学习生物医学推理
机构 * Laboratory for Emerging Intelligence, University of California, San Diego(新兴智能实验室,加州大学圣地亚哥分校) ; Department of Dermatology, University of California, San Diego(皮肤科系,加州大学圣地亚哥分校) ; University of Chicago(芝加哥大学) ; Elsevier(艾尔斯特出版社)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出DeepImagine框架,通过连续反事实想象训练语言模型进行生物医学推理,利用反事实对偶和强化学习提升临床试验预测性能,展示模型在生物医学领域的可解释性改进。
Comments Preprint
大型语言模型中层级情感组织的涌现
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; University of Tokyo(东京大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 受情感轮理论启发,分析大型语言模型输出中情感状态间的概率依赖关系,发现模型自然形成与人类心理模型一致的层级情感树,且更大模型发展出更复杂的层级结构,同时揭示社会经济角色在情感识别中的系统性偏差。
Comments ICML 2026
并非双关:结合对比学习与音义嵌入的多智能体双关语翻译方法,用于CLEF JOKER 2025任务2
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Peoples' Friendship University of Russia (RUDN University)(俄罗斯人民友谊大学) ; Joint Institute for Nuclear Research(联合核子研究中心) ; Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; University of Skövde(斯德哥尔摩大学)
专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究针对跨语言双关语翻译难题,提出结合对比学习、音义嵌入与多智能体生成器-判别器框架的三阶段方法,在CLEF JOKER 2025任务2竞赛中获第一、第二名,推动了双关语翻译研究。
Journal ref CEUR Workshop Proceedings, Vol-4038, pp. 2870-2888, 2025
Lil: 在长解码阶段应用后训练稀疏注意力算法时,少即是少
机构 * SCS, Peking University, Beijing, China(北京大学信息科学与技术学院,北京,中国) ; Key Lab of HCST (PKU), MOE, Beijing, China(高等教育出版社HCST重点实验室(PKU),北京,中国) ; State Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国) ; Tencent, Shenzhen, China(腾讯,深圳,中国) ; Beijing Tongming Lake Information Technology Application Innovation Center, Beijing, China(北京 Tongming Lake 信息技术应用创新中心,北京,中国)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文研究了在长解码阶段应用稀疏注意力算法时,信息丢失导致序列变长的问题,提出早停算法减少token消耗并降低精度损失。
STAC:当无害工具形成危险链以劫持LLM代理
机构 * AWS AI Labs(AWS人工智能实验室) ; UC Berkeley(伯克利大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 STAC通过多轮工具链攻击揭示LLM代理的安全漏洞,提出基于推理的防御策略,显著降低攻击成功率。
Comments Long version with 15 pages in main draft and a total of 39 pages including references and appendix. Data and code \url{https://github.com/amazon-science/MultiTurnAgentAttack}
从回顾到前瞻:面向知识驱动视觉问答的自我鼓励回顾蒸馏
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract)
AI总结 本文提出HinD框架,通过知识鼓励偏好优化提升多模态大语言模型的知识推理能力,实验表明其在OK-VQA和A-OKVQA上表现优异。
OmniGAIA:迈向原生全模态AI代理
机构 * Renmin University of China(中国人民大学) ; Xiaohongshu Inc.(小红书公司) ; Peking University(北京大学) ; Southeast University(东南大学) ; Tsinghua University(清华大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出OmniGAIA基准和OmniAtlas代理,通过全模态事件图和后见引导树探索策略,实现跨视频、音频和图像的深度推理与工具使用。
通过可扩展归因图分解从十亿参数语言模型中提取分层稀疏电路
机构 * Department of CSE, Muffakham Jah College of Engineering and Technology (MJCET)(计算机科学与工程系,穆法卡姆·贾赫工程与技术学院(MJCET))
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出分层归因图分解(HAGD)方法,通过跨层编码器训练、谱粗化、GNN引导分层遍历和因果干预验证,将电路提取复杂度降至O(n² log n),在多个大模型上实现高行为保留。
学习面向延迟的并行多智能体系统编排
机构 * University of Central Florida(中央佛罗里达大学)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出LAMaS框架,通过显式优化关键路径降低多智能体系统并行执行的延迟,提升效率和性能。
Comments Preprint. Previously this version appeared as arXiv:2607.13359 which was submitted as a new work by accident
VDC-Agent:当视频详细描述器通过代理自我反思而自我进化
机构 * Xi’an Jiaotong University(西安交通大学) ; Kuaishou Technology(快手科技) ; Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中 复杂问题求解 :chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 VDC-Agent通过自我反思机制实现视频详细描述的自我进化,利用自动生成的(描述,评分)对提升描述准确性与评分表现。
Comments Accepted to ECCV 2026. Project Page: https://vdcagent.github.io
涌现不变性:从符号化思维到结构控制
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究形式化了语言为核心的智能的限制,提出动态边界控制框架,通过DeepSeek V4-Flash实验验证其可提升大语言模型的推理性能,组织了大语言模型的涌现限制。
Comments 51 pages, 3 figures
DRIFT: 基于难度路由的自我蒸馏与节奏门控探索及成功缓冲训练
机构 * Tsinghua University(清华大学) ; ENS Paris-Saclay(巴黎-萨克雷大学) ; Beike Language and Intelligence(贝克语言与智能)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 提出DRIFT框架,通过难度路由和节奏门控动态分配自蒸馏与强化学习信号,结合成功缓冲和两阶段课程学习,提升大模型在复杂推理任务中的自我进化稳定性,在五个基准上平均得分79.5%,超越GRPO和SDPO。
LF²AR:考虑分层动态以改进语言模型的多模态适配
机构 * Université de Toulon, Aix-Marseille Université, CNRS, LIS, France(法国图卢兹大学、马赛大学、CNRS、LIS) ; Department of Engineering, University of Cambridge, UK(剑桥大学工程系) ; Mitsubishi Electric Research Laboratories (MERL), Cambridge, MA, USA(三菱电机研究实验室(MERL)) ; LIA, Avignon Université, France(法国阿维尼翁大学LIA) ; LIUM, Le Mans Université, France(法国勒芒大学LIUM) ; Zenidoc, Marseille, France(法国马赛Zenidoc)
专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出LF²AR架构,通过分层抽象-细化动态设计适配机制,在文本转图像、语音模态上提升语言模型性能,支持1.9倍生成加速。
Comments Published as a conference paper at COLM 2026