From Chaos to Clarity: Claim Normalization to Empower Fact-Checking
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments Accepted at Findings EMNLP2023
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments Accepted at Findings EMNLP2023
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments Work in progress
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments EMNLP 2023. Code and dataset can be found here: https://hyunw.kim/fantom
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments EMNLP 2023
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments Preprint, 18 pages, 6 figures, 6 tables
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments 12 pages, 1 figure
专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract);分类 cs.CL、cs.LG
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG
专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI
Comments Project page: https://otter-ntu.github.io/ Dataset & code: https://github.com/Luodian/otter Initial release, work in progress
专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.LG
Comments Public checkpoints: https://huggingface.co/docs/transformers/model_doc/flan-t5
机构 * ARC Lab, Tencent PCG(腾讯PCG部门ARC实验室) ; Shanghai Jiao Tong University(上海交通大学) ; University of Macau(澳门大学) ; Dalian University of Technology(大连理工大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 推理评测 :reasoning(abstract,comments);planning(abstract);分类 cs.AI
Comments a comprehensive visual spatial reasoning evaluation tool, 25 pages, 16 figures
PDE-Agents: 一种基于知识图谱增强推理的LLM编排多智能体框架,用于自动化有限元模拟
专题命中 推理评测 :reasoning(title)
AI总结 提出PDE-Agents多智能体系统,通过LLM编排实现偏微分方程/有限元模拟全流程自动化,采用GraphRAG知识图谱增强,在50个任务消融实验中KG Smart模式达100%成功率,并验证了二阶空间收敛性。
Comments 19 pages, 9 figures, 10 tables, 1 algorithm. Code and evaluation artifacts: https://github.com/MatPro-IFE/pde-agents
通过证据感知多智能体推理实现忠实的情感图像字幕生成
专题命中 推理评测 :reasoning(title)
AI总结 研究情感图像字幕生成中平衡情感表达与视觉保真度的问题,提出SEA-Cap系统,通过情感证据挖掘器提取线索,利用多智能体协作工作流程,依视觉证据审核完善字幕,有效减轻幻觉并达最优性能。
MAViE:用于细粒度视觉感知和高效多模态推理的多尺度自适应视觉编码器
专题命中 推理评测 :reasoning(title)
AI总结 研究针对视觉语言模型问题,提出多尺度自适应视觉编码器MAViE,通过融合多层特征、进行令牌路由及引入相关策略,在统一框架下实验,减少视觉令牌数量,提升多任务分数并降低处理时间,还给出模型设计与评估协议。
Comments 10 pages
面向儿童的AIGC视频风险审查:一个基准和知识支持的迭代推理框架
机构 * Shandong University(山东大学) ; Fudan University(复旦大学) ; Beijing Jiaotong University(北京交通大学)
专题命中 推理评测 :reasoning(title)
AI总结 研究面向儿童的AIGC视频审查问题,构建CAVSR基准和分层风险分类法,提出结合多智能体协作与知识经验的QVRS-E框架,实验证明该方法能增强儿童相关风险审查,产生更可靠报告。
大语言模型真的能恢复微服务故障吗?对诊断到行动推理的恢复感知评估
专题命中 推理评测 :reasoning(title)
AI总结 研究大语言模型在云原生微服务系统中恢复故障的能力,提出R2Act框架,定义相关内容并实例化为基准数据集,评估多种方法,发现恢复失败多因难以将诊断证据转化为有效恢复行动。
EgoIntrospect: 一个用于用户中心内部状态推理的注视数据集和基准
机构 * Tsinghua University(清华大学) ; Tongji University(同济大学) ; Renmin University of China(中国人民大学) ; The University of Tokyo(东京大学) ; Lenovo Group(联想集团) ; Peking University(北京大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Shanghai Qi Zhi Institute(上海启智研究院)
专题命中 推理评测 :reasoning(title)
AI总结 本文提出EgoIntrospect数据集,用于研究用户中心内部状态推理,通过自注释揭示用户与AI助手的交互意图,评估多模态大语言模型在从注视观察中推理用户内部状态的能力。
大语言模型能否进行视觉说服推理?评估推理的有效性与忠实性
机构 * Seoul National University(首尔国立大学)
专题命中 推理评测 :reasoning(title)
AI总结 本文研究大语言模型在视觉说服推理中的有效性与忠实性,提出通过多样化的教师生成推理进行监督微调以提升预测性能,并引入三维忠实性评估框架。
推理以关注:尝试理解<SEG>标记的作用
专题命中 推理评测 :reasoning(title)
AI总结 本文研究了<SEG>标记在多模态模型中的作用,通过可视化相似性图揭示其在图像-文本对中的语义相似性贡献,并提出READ方法提升模型的推理能力。
Comments This work has been accepted to CVPR 2025, please refer to https://github.com/rui-qian/READ
从感知到行动:一个交互式基准测试用于视觉推理
机构 * Singapore University of Technology(新加坡科技设计大学) ; Singapore Management University (SMU), Singapore(新加坡管理学院) ; Nanyang Technological University (NTU), Singapore(南洋理工大学) ; University of Science(科学大学)
专题命中 推理评测 :reasoning(title)
AI总结 CHAIN基准测试通过交互式3D物理驱动环境,评估模型在动态环境中理解、规划和执行基于物理约束的结构化动作序列的能力。
Comments Work in processing. Website: https://social-ai-studio.github.io/CHAIN/
STVG-R1: 通过强化学习激励视频中实例级推理与 grounding
机构 * Xidian University(西电大学) ; State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) ; Beijing Institute of Technology(北京理工大学)
专题命中 推理评测 :reasoning(title)
AI总结 STVG-R1通过强化学习框架提升视频中实例级推理与 grounding 的准确性,实现显著的性能提升和泛化能力。
使用可达性分析和混合容积集进行基于度量时序逻辑的运动规划
专题命中 推理评测 :planning(title)
AI总结 本文提出了一种基于可达性分析和混合容积集的运动规划方法,用于满足时间依赖任务需求,展示了其在处理动态环境和多智能体协调方面的优势。
大语言模型中的个性化安全:一个基准和基于规划的代理方法
专题命中 推理评测 :planning(title)
AI总结 本文提出个性化安全框架PENGUIN和RAISE,通过获取用户背景信息提升LLM的安全性,实验显示安全评分提升达31.6%。
解释未见的:多模态视觉-语言推理用于地下矿难中的情境感知
机构 * Missouri University of Science and Technology(密苏里科学与技术大学) ; Washington State University(华盛顿州立大学)
专题命中 推理评测 :reasoning(title)
AI总结 本文提出MDSE框架,通过多模态视觉-语言推理提升地下矿难情境感知能力,实现更准确的描述生成。
MoReGen:基于代码领域的文本到视频合成多智能体运动-推理引擎
机构 * Northeastern University(东北大学) ; University of Oxford(牛津大学) ; Microsoft Research(微软研究院)
专题命中 推理评测 :reasoning(title)
AI总结 MoReGen通过整合多智能体大语言模型、物理模拟器和渲染器,实现了基于代码领域的文本到视频合成,强调物理精度和运动一致性,为生成符合物理原理的视频提供了一种新的方法。
专题命中 推理评测 :reasoning(title)
Comments Change the method and experimentation
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室)
专题命中 推理评测 :reasoning(title)
Comments ICCV 2025; Project page: https://zhangyuanhan-ai.github.io/video-tt/
专题命中 推理评测 :reasoning(title)
Comments 21 pages
机构 * Zhejiang University, Hangzhou, China(浙江大学) ; National University of Singapore, Kent Ridge, Singapore(新加坡国立大学)
专题命中 推理评测 :reasoning(title)
Comments Home page is available at https://dcd-ant-similar.github.io