One Agent to Serve All: a Lite-Adaptive Stylized AI Assistant for Millions of Multi-Style Official Accounts
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments 7 pages
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments 7 pages
机构 * ByteDance(字节跳动)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
机构 * Portland State University(波特兰州立大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
机构 * Dalian University of Technology(大连理工大学) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments 69 pages, 66 figures, accepted by ACL 2025
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments accepted to IJCAI 2025
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments 20 pages, 6 figures
机构 * Texas A&M University(德克萨斯大学) ; KAIST(韩国科学技术院) ; University of Utah(犹他大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Journal ref CVPRW 2025
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);planning(abstract);分类 cs.CL、cs.AI
Comments Under review
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments Accepted in COLING 2025
专题命中 推理评测 :reasoning(abstract);planning(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments EMNLP 2024 Findings
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI
PathoArgus:推进千兆像素全切片与多切片病例语境下基于证据的长上下文视觉推理
机构 * The Hong Kong University of Science and Technology(香港科技大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 研究针对病理视觉推理的证据基础评估缺口,构建PathoArgus-Bench基准与ESG受控集,发现现有模型准确率高但证据基础弱,提出PathoArgus阅读器,呼吁转向证据导向的评估。
ChainSpace:面向空间智能的链式推理范式
机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) ; Li Auto Inc.(理想汽车有限公司)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 针对现有空间推理方法的缺陷,提出ChainSpace链式推理范式,构建对应基准与训练框架,相关模型在基准上表现最优且可迁移至多类外部基准,为空间智能评估与学习提供有效方案。
AeroGround:用于空-地协同推理的综合基准
机构 * Shanghai Innovation Institute(上海创新研究院) ; College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) ; College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ; Chongqing Technology and Business University(重庆工商大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出AeroGround基准,针对现有VLMs在空-地协同场景推理能力的研究空白,构建含29000组多模态观测与2250个问答实例的数据集,实验发现模型与人类表现差距显著,为相关系统开发提供基础。
RingMo-Agent: 多平台多模态遥感基础模型
机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院 aerospace information research institute) ; School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Key Laboratory of Target Cognition and Application Technology (TCAT)(目标认知与应用技术重点实验室)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 RingMo-Agent是一种多平台多模态遥感基础模型,通过大规模数据集和任务特定标记提升遥感图像的感知与推理能力。
Comments 24 pages, 5 figures, 20 tables
ChartProbe:通过感知、定位与简单推理开展视觉推理的诊断研究
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出诊断框架ChartProbe,发现视觉-语言模型可通过单独监督感知、定位等简单技能,在无需复杂推理数据的情况下提升复杂图表推理能力。
基础模型在纵向MRI疾病进展推理中的表现如何?
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Department of Health Abu Dhabi(阿布扎比卫生部) ; Fatima College of Health Sciences(法蒂玛健康科学学院) ; Linköping University(林雪平大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 该研究推出Time-Aware Multi-View MRI基准,评估16个视觉-语言模型在纵向MRI疾病进展推理中的表现,发现模型在变化方向识别等方面存在缺陷,多视角输入对模型性能有特定影响。
Comments Accepted at MICCAI 2026 (Early Accept). 11 pages, 3 figures, 2 tables
Pseudo2CodeQA:面向基于大语言模型的代码生成中结构化算法推理的基准测试
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本文提出Pseudo2Code基准测试及Pseudo2Code Agentic Framework,实验表明该框架性能优于现有基线,验证了结构化伪代码对代码生成的提升作用。
Comments 8 pages, 3 figures
ExpertVerse:知识密集型视觉合成中专家级推理的通用基准
专题命中 推理评测 :reasoning(title,abstract)
AI总结 研究针对多模态生成模型在知识密集型生成的不足,开发ExpertVerse基准,涵盖多种认知能力和专家学科,生成相关数据集,训练KnowThinker并提出BPPO优化方法,揭示模型推理缺陷,强调知识密集型基准对下一代视觉生成的重要性。
Comments 14 pages, 6 figures
GraphVerse:面向多模态大语言模型的综合性视觉图推理基准
机构 * New York University(纽约大学) ; Sensetime Research(商汤科技研究院) ; Tsinghua University(清华大学) ; New York University Shanghai(上海纽约大学) ; University of Georgia(佐治亚大学) ; The Hong Kong Polytechnic University(香港理工大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 针对现有多模态大语言模型(MLLMs)评估缺乏结构化视觉推理测试的问题,提出GraphVerse基准,通过以图为中心的图像编辑(GIE)策略和VGR-Score指标,评估MLLMs在单/配对图像场景下的视觉图推理能力,揭示其相关局限并验证方法有效性。
Comments 33 pages, 16 figures
OneEmo:用于情感感知、理解与交互的统一多模态推理模型
专题命中 推理评测 :reasoning(title,abstract)
AI总结 针对现有情感智能多模态模型忽略任务协同的问题,研究人员提出统一多模态情感模型OneEmo,构建EmoWorld-130K数据集并采用Emo-Chord强化学习策略,其性能优于同规模基线模型,参数远少于商业模型且结果具竞争力。
超越相关性:面向智能体的全切片图像推理的贝叶斯证据获取
机构 * A*STAR(新加坡科技研究局)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本研究提出BEACON框架,将WSI推理建模为贝叶斯证据获取问题,通过最大化预期信息增益减少诊断不确定性,在五个WSI-VQA基准的零样本实验中,其性能优于同类无训练智能体框架,提升了证据获取效率。
基于双加工推理风险的多智能体AI课堂:面向未来物理教师的试点研究
专题命中 推理评测 :reasoning(title,abstract)
AI总结 本研究构建基于双加工理论风险框架的多智能体AI模拟课堂,用于培养未来物理教师回应学生推理的能力,发现其能显著提升诊断分数,且可揭示教师知与行的发展差距,为物理教师培养提供支持。
Comments 16 pages, 4 figures, 3 tables