JFTA-Bench: Evaluate LLM's Ability of Tracking and Analyzing Malfunctions Using Fault Trees
JFTA-Bench:评估LLM在跟踪和分析故障中的能力
机构 * Fudan University(复旦大学)
AI总结 本文提出JFTA-Bench基准,用于评估LLM在复杂环境中的故障跟踪与分析能力,包含3130条记录,每条记录平均40.75轮对话,通过模拟用户错误场景评估模型任务跟踪与错误恢复能力。
高校专区
JFTA-Bench:评估LLM在跟踪和分析故障中的能力
机构 * Fudan University(复旦大学)
AI总结 本文提出JFTA-Bench基准,用于评估LLM在复杂环境中的故障跟踪与分析能力,包含3130条记录,每条记录平均40.75轮对话,通过模拟用户错误场景评估模型任务跟踪与错误恢复能力。
ScaleEdit-12M:通过多智能体框架实现开源图像编辑数据生成的规模化
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; CUHK MMLab(香港中文大学多模态实验室) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Xiamen University(厦门大学)
AI总结 本文提出ScaleEditor框架,通过多智能体方法构建大规模高质量图像编辑数据集,生成ScaleEdit-12M,涵盖23类任务,提升多种编辑模型性能。
对LLM代理的行为一致性验证:通过股票市场模拟分析交易风格切换
机构 * Fudan University(复旦大学) ; Wuhan University(武汉大学) ; BNP Paribas(BNP巴黎银行) ; Oxford University(牛津大学) ; Haven
AI总结 本文通过股票市场模拟分析交易风格切换,评估LLM代理策略切换与金融理论的一致性,提出四个行为金融驱动因素作为性格特质,并通过Mann-Whitney U检验比较策略切换行为与理论的一致性。
重新思考熵在优化大语言模型代理工具使用行为中的作用
机构 * Fudan University(复旦大学) ; University of Edinburgh(爱丁堡大学) ; Southern University of Science and Technology(南方科技大学) ; Oxford University(牛津大学) ; Haven
AI总结 本文通过熵基实验发现熵减与高质量工具调用正相关,提出两种奖励策略优化工具使用行为,实验表明熵减可提升代理适应性。
U4D:从LiDAR序列中构建不确定性感知的4D世界模型
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学) ; S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; Nanjing University of Posts and Telecommunications(南京邮电大学) ; SKL-TI
AI总结 本文提出U4D框架,通过估计空间不确定性图和分阶段生成方法,提升LiDAR序列的几何精度和时间一致性,推动自动驾驶感知与模拟的可靠性。
Comments CVPR 2026; 20 pages, 7 figures, 11 tables; Code at https://github.com/worldbench/U4D
RedTopic:迈向大语言模型的课题多样化红队测试
机构 * Fudan University(复旦大学) ; City University of Hong Kong(香港城市大学) ; Deakin University(德克萨斯大学) ; Hon Hai Research Institute(鸿海研究室) ; Hong Kong University of Science and Technology(香港理工大学)
AI总结 本文提出RedTopic框架,通过上下文生成管道、聚合奖励设计和多目标RL训练循环,生成多样化对抗提示,提升红队测试的适应性和课题多样性。