ContextWeave: A Real-World Workflow Benchmark
ContextWeave:一个真实世界工作流基准测试
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; ByteDance(字节跳动)
AI总结 该研究推出ContextWeave工作流基准测试,通过实验发现可操作的经验记忆能提升智能体工作流性能,为优化记忆系统提供了依据。
高校专区
ContextWeave:一个真实世界工作流基准测试
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; ByteDance(字节跳动)
AI总结 该研究推出ContextWeave工作流基准测试,通过实验发现可操作的经验记忆能提升智能体工作流性能,为优化记忆系统提供了依据。
技能使用:智能体框架中的大语言模型(LLM)真的能使用技能吗?
机构 * East China Normal University(华东师范大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Fudan University(复旦大学) ; Tencent Hunyuan(腾讯混元)
AI总结 本研究推出Skill-Use基准,评估智能体在渐进式披露下的技能使用,发现8个LLM在两个框架下的SU分数仅0.613,技能使用是依赖框架的能力。
用于视觉-语言-动作模型长程规划的显式语言记忆
机构 * Fudan University(复旦大学)
AI总结 该研究针对视觉-语言-动作模型长程规划的挑战,提出带显式语言记忆模块的分层架构,经仿真与实机实验验证,可提升复杂长程任务的成功率、鲁棒性与决策可解释性。
Comments 11 pages, 4 figures
Talk2Sensors:基于传感器自适应物理线索匹配的自动驾驶3D视觉 grounding
机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能学域) ; MMLab, CUHK(香港中文大学MMLab) ; School of Transportation Science and Engineering, Harbin Institute of Technology(哈尔滨工业大学交通科学与工程学院) ; School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西交利物浦大学先进技术学院) ; School of Electronics and Computer Science, University of Southampton(南安普顿大学电子与计算机科学学院) ; School of Intelligent Manufacturing and Smart Transportation, Suzhou City University(苏州城市学院智能制造与智能交通学院) ; Qingdao University of Science and Technology(青岛科技大学) ; Institute for Math & AI, Wuhan University(武汉大学数学与人工智能研究院) ; Institute of Big Data, Fudan University(复旦大学大数据研究院)
AI总结 针对现有室外3D视觉 grounding 未充分利用多传感器互补物理属性的问题,提出首个多传感器数据集Talk2Sensors及TSFormer框架,在相关基准上实现了最优性能。
Comments 14 pages, 12 figures
蒸馏前先前瞻:智能体策略内蒸馏中教师指导的未来轨迹验证
机构 * Meituan LongCat Interaction(美团龙猫交互) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Peking University(北京大学) ; Nanjing University(南京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Jilin University(吉林大学) ; University of Science and Technology of China(中国科学技术大学) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 该研究针对策略内蒸馏的学生轨迹偏差问题,提出FutureBridge-OPD方法,在多任务基准上显著优于现有方法,代码公开可用。
Comments 15 pages, 5 figures
MyoCardBench:用于评估临床真实心血管护理场景中大型语言模型的真实世界数据基准
机构 * Shanghai Institute of Cardiovascular Diseases(上海市心血管病研究所) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Minhang Hospital, Fudan University(复旦大学附属闵行医院)
AI总结 该研究开发MyoCardBench真实世界基准评估大语言模型在心血管护理场景的性能,涵盖多任务数据集,经专家注释审核。7个模型在零样本设置下输出,GPT-5.4表现最佳。此基准为评估模型提供框架,助于发现优势与不足。
训练后能否将大语言模型转变为因果推理者?
机构 * Shanghai Artificial Intelligence Library(上海人工智能图书馆) ; Fudan University(复旦大学) ; Tongji University(同济大学)
AI总结 本文通过CauGym数据集评估了训练后方法对LLM因果推理能力的提升,发现适当训练可使小型模型在因果推理任务中超越大模型。