Scientific Reasoning: Assessment of Multimodal Generative LLMs
专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI
专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI
专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI
Comments ISMB 2024
专题命中 复杂问题求解 :reasoning(title);分类 cs.CL、cs.AI
Comments GitHub: https://github.com/danielabd/Apollo-Cap
CHARLIE:用于法医学证据推理的本地多智能体检索增强生成系统
机构 * Forensic Institute, Civil Police of Federal District, Brazil(巴西联邦区刑事研究所) ; University of Brasília, Brazil(巴西巴西利亚大学)
专题命中 复杂问题求解 :reasoning(title,comments);分类 cs.AI
AI总结 介绍用于法医学证据推理的本地多智能体检索增强生成系统CHARLIE,通过结合多种机制应对取证挑战,在机构内运行维护数据主权等,经案例研究验证其能支持证据工作流程,为高风险取证环境部署AI系统提供蓝图。
Comments 10 pages, 1 figure. Archival version of a paper presented at RELAF 2026: 1st Workshop on Reasoning with Evidence in Law Enforcement and Forensics, co-located with ICAIL 2026, Singapore, June 2026
OmniOPSD:面向情感计算的理性特权在线自蒸馏
机构 * Shenzhen University(深圳大学) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学) ; Shenzhen Technology University(深圳技术大学) ; Tongji University(同济大学) ; Huawei(华为)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。
STARE: 基于惊讶度的令牌级优势重加权以实现策略熵稳定性
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Tencent Hunyuan(腾讯 Hunyuan)
专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对GRPO等RL算法中策略熵崩溃问题,提出STARE方法,通过惊讶度分位数识别熵关键令牌并重加权其优势,结合目标熵闭环门控稳定熵,在1.5B-32B模型和多种任务上实现稳定训练,AIME24/25准确率提升4%-8%。
Comments LLM, Reinforcement Learning
Step-Audio-R1.5 技术报告
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 本文提出 Step-Audio-R1.5,通过从强化学习验证奖励转向基于人类反馈的强化学习,解决了音频大语言模型在客观基准上表现优异但牺牲真实对话自然度的问题,实现了分析推理与沉浸式交互体验的平衡。
I2E: 从图像像素到可操作的交互环境:用于文本引导的图像编辑
机构 * Huazhong University of Science and Technology(华中科技大学) ; Kuaishou Technology(快手科技) ; Central China Normal University(华中师范大学) ; Tsinghua University(清华大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);planning(abstract)
AI总结 I2E提出一种'分解-然后-行动'范式,通过分解器将无结构图像转换为可操作的对象层,并利用物理感知的视觉-语言-行动代理进行复杂指令解析,同时构建I2E-Bench基准测试集,实验表明其在处理复杂组合指令和保持物理合理性方面优于现有方法。
深入而非冗长:用于组合泛化的深度递归变压器
机构 * Computer Science and Information Engineering National Central University(计算机科学与信息工程国家中央大学)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出深度递归变压器,通过在潜在空间中迭代应用共享权重的Transformer块,使模型在推理时能通过增加推理步骤来实现更深层次的推理。在三个组合推理领域中,该方法展示了计算前沿和不同泛化行为。
MiroThinker-1.7 与 H1:通过验证实现重型研究代理
机构 * MiroMind Team(MiroMind团队)
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出MiroThinker-1.7和H1,通过结构化规划和验证机制提升多步推理能力,在复杂任务中实现高效可靠的研究代理。
Comments 23 pages
EmoOmni:弥合情感理解与表达在多模态大语言模型中的鸿沟
机构 * Northwestern Polytechnical University, Xi'an, China(西北工业大学,西安,中国) ; University of Surrey, Guildford, United Kingdom(萨里大学,Guildford,英国)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 EmoOmni通过引入情感链式思维机制,提升多模态情感对话中的理解与表达能力,构建了评估基准并验证了其有效性。
分解与对齐:提升声明验证的Distill和Align分解
专题命中 复杂问题求解 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一种基于强化学习的分解与对齐方法,通过优化分解质量和验证器对齐,提升声明验证性能,达到71.75%的宏F1,优于现有方法。
Comments EACL Findings 2026
SRVAU-R1: 通过反射感知学习增强视频异常理解
机构 * The University of Iowa(艾奥瓦大学) ; Knox College(克诺克斯学院)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)
AI总结 SRVAU-R1通过引入反射感知学习框架,提升视频异常理解的推理能力和准确性。
优化多模态大语言模型以实现视角视频理解:HD-EPIC VQA挑战的解决方案
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 本文提出一种优化多模态大语言模型的方法,通过预处理、微调和时间链式思考提示,在HD-EPIC VQA挑战中实现了41.6%的准确率。
Comments 4 pages, 1 figure, CVPR 2025 EgoVis Workshop, 2nd Place in HD-EPIC Challenge
ThinkGen: 用于视觉生成的通用思考
机构 * Beijing Jiaotong University(北京交通大学) ; Bytedance Home(字节跳动)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 ThinkGen通过结合预训练的大语言模型和扩散变换器,提出了一种基于思考的视觉生成框架,实现了在多种生成任务中的高效推理和高质量图像生成。
AI委员会:一种多智能体框架,用于自动验证和修复网络来源的数据
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)
AI总结 AI委员会是一种多智能体框架,通过自动化验证和修复网络数据集,提升数据质量和准确性。
PAACE:一种计划感知的自动代理上下文工程框架
机构 * Kamer Ali Yuksel(独立研究者)
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 PAACE通过计划感知的上下文工程框架提升LLM代理的准确性并减少上下文负载,实现高效多步骤任务处理。
图像生成链:迈向可监控和可控的图像生成
机构 * Duke University(杜克大学) ; Princeton University(普林斯顿大学) ; Universidad Católica del Uruguay(乌拉圭天主教大学) ; Apple(苹果公司)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 CoIG框架通过将图像生成过程分解为可监控的步骤,提升图像生成的可控性和可解释性。
Comments 19 pages, 13 figures
AutoPatch:多智能体框架用于修补现实世界中的CVE漏洞
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
AI总结 AutoPatch通过多智能体框架高效修补LLM生成代码中的CVE漏洞,实现高准确率和低成本的漏洞修复
Comments 19 pages, double column, 9 figures. Under submission
关于基于大型语言模型的统计与数据科学代理的综述
机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) ; Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文综述了基于大型语言模型的数据科学代理的发展、能力和应用,探讨了其设计趋势及实际应用,并提出了未来研究方向。
Journal ref Am. Statist. (2025) 1-14
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
机构 * Université de Montréal(蒙特利尔大学) ; Mila(Mila研究所) ; Technical University of Munich(慕尼黑技术大学) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 15 pages, 6 figures
机构 * Princeton University(普林斯顿大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; ByteDance Seed(字节跳动种子)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
Comments NeurIPS 2025. Project: https://github.com/Gen-Verse/MMaDA
机构 * Alibaba Group(阿里巴巴集团)
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 复杂问题求解 :reasoning(abstract);math reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; City University of Hong Kong(香港城市大学) ; University of Waterloo(多伦多大学) ; Apple(苹果公司)
专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);self-correction(abstract)
Comments 2025 IEEE International Symposium on Performance Analysis of Systems and Software (ISPASS)
专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)
Comments 6 pages, 4 figures, 4 tables