DeepInsight II: One Trace from Benchmark to Robot
DeepInsight II:从基准测试到机器人的单条轨迹
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 DeepInsight II量化具身层,复现基准结果、通过MotionBench实现仿真到真实机器人的原生迁移,并扩展轨迹定位至带修复动作的交接标签,提供从基准到机器人的经验连续性。
科学与医疗
医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。
DeepInsight II:从基准测试到机器人的单条轨迹
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 DeepInsight II量化具身层,复现基准结果、通过MotionBench实现仿真到真实机器人的原生迁移,并扩展轨迹定位至带修复动作的交接标签,提供从基准到机器人的经验连续性。
LongRCA Bench:诊断长 horizon 智能体失败中的责任角色与根本原因
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) ; Chongqing University(重庆大学) ; Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) ; Singapore Management University(新加坡管理大学) ; Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) ; Tsinghua University(清华大学)
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 LongRCA Bench 是含1140条失败轨迹的长 horizon 智能体失败诊断基准,本文提出无需训练的 RCTA 方法,在责任角色归因和根本步骤定位上优于现有基线,表明需将二者作为独立评估目标。
Comments 17 pages, 5 figures. Yunfei Zhang and Boyu Feng contributed equally. Changhua Pei is the corresponding author
TRACE-BN:将孟加拉语-英语辅导行为迁移至参数量小于10亿的离线语言模型
机构 * North South University(北南大学)
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 本文提出TRACE-BN数据集,将其辅导行为通过LoRA迁移至Qwen3-0.6B模型,在资源受限离线部署下,相关指标及多维度辅导效果均获显著提升。
当智能体执行失败时:从遥测数据中检测和定位运行时故障
机构 * University of Toronto(多伦多大学)
专题命中 医学数据与评测 :diagnosis(abstract)
AI总结 该研究提出 AGENTCHAOSBENCH 基准,在智能体系统遥测数据中检测定位运行时故障,实验显示现有 LLM 基线对该任务的解决效果仍远未达标。