MedReason: Eliciting Factual Medical Reasoning Steps in LLMs via Knowledge Graphs
专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
Comments 18 pages, 11 figures, 6 tables. Project page: https://github.com/UCSC-VLAA/MedReason
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI
Comments 18 pages, 11 figures, 6 tables. Project page: https://github.com/UCSC-VLAA/MedReason
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments NeurIPS 2024 camera ready
专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG
Comments 10 pages
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
Comments Accepted at EMNLP 2024 Main
专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI
专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments Project website: https://www.llm-reasoners.net/
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
Comments 38 pages, 44 figures
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments Findings of ACL 2024. Project website: https://xxxiaol.github.io/QRData/
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
Comments NeurIPS
专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI
Comments Working in Progress, 17 pages, 16 figures
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments Camera-Ready version for AAAI 2024
专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.AI、cs.LG
Comments 71 pages, 29 figures
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI
Comments 45 pages, AACL 2023
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments Accepted at EMNLP 2023 (main conference, long paper)
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments 9 figures, 11 tables
专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI
Comments 10 pages
专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI、cs.LG
Comments 37 pages, 17 figures, 5 tables
ROM:通过流式检测和干预实时抑制过度思考
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract_cn);self-correction(abstract)
AI总结 ROM通过流式检测和干预框架减少大推理模型的过度思考,提升准确率并缩短响应长度,在多个数据集上均取得显著效果。
Comments Code is available at https://github.com/SaFo-Lab/ROM
当提示误导:多模态大语言模型中的文本主导与诊断偏差
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)
AI总结 研究揭示在医学多模态大语言模型中,文本提示会主导视觉线索,导致诊断偏差,即使模型具备空间定位能力,提示策略仍可能不安全。
Comments Accepted to the CVPR 2026 MMFM-BIOMED Workshop
LLM何时推理?基于熵相变的动力系统视角
机构 * Samsung Research(三星研究院) ; State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(通用人工智能国家重点实验室,北京理工大学)
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过早期解码熵动态检测LLM的推理状态,提出轻量级无训练路由框架EDRM,自适应选择推理策略,在减少token消耗的同时提升准确率。
RoadTones: 从道路事件视频生成可调节语气的文本
机构 * CVIT & iHub-Data, IIIT Hyderabad, India(CVIT与iHub-Data,IIIT海得拉巴,印度)
专题命中 推理评测 :CoT(summary_cn,abstract);chain-of-thought(abstract)
AI总结 本文提出RoadTones-51K数据集和RoadTones-VL-CoT模型,通过生成语气条件的推理草稿提升可解释性,并引入RoadTones-Eval评估体系,共同为上下文敏感的可调节视频描述奠定基础。
Comments Accepted at CVPR Findings 2026. Project page: https://roadtones.github.io/
通过时间聆听:为长音频理解实现精确的时间意识
专题命中 推理评测 :chain-of-thought(abstract,abstract_cn);CoT(abstract,abstract_cn);reasoning(abstract)
AI总结 本文提出LAT-Audio模型,通过构建长音频数据集和基准测试,解决长音频时间意识任务中的性能下降问题,提升模型对长音频的鲁棒性。
机构 * University of Maryland(马里兰大学) ; Fudan University(复旦大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);planning(abstract)
Comments Our benchmark dataset is available at https://huggingface.co/datasets/binxingao/extrem-bench
机构 * Georgia Institute of Technology(佐治亚理工学院) ; The Hebrew University of Jerusalem(特拉维夫大学)
专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);math reasoning(abstract)
Comments ACL 2025 main conference
机构 * Bert S. Turner Department of Construction Management, Louisiana State University, Baton Rouge, LA 70803(伯特·S·特纳建设管理系,路易斯安那州立大学,巴吞鲁日,LA 70803)
专题命中 推理评测 :reasoning(title);chain-of-thought(title)
专题命中 推理评测 :reasoning(abstract);CoT(abstract);planning(abstract);logical reasoning(abstract)
Comments Technical Report (In Progress); Code released at: https://github.com/TencentARC/SEED-Bench-R1
专题命中 推理评测 :reasoning(title);chain-of-thought(title)