Predicting Future Behaviors in Reasoning Models Enables Better Steering
推理模型中预测未来行为以实现更好的引导
机构 * Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所) ; Northeastern University(东北大学) ; KAIST(韩国科学技术院)
AI总结 通过训练激活探针预测推理模型未来行为,提出未来探针控制生成(FPCG)方法,在多个评估中实现几乎无质量下降的引导。
高校专区
推理模型中预测未来行为以实现更好的引导
机构 * Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所) ; Northeastern University(东北大学) ; KAIST(韩国科学技术院)
AI总结 通过训练激活探针预测推理模型未来行为,提出未来探针控制生成(FPCG)方法,在多个评估中实现几乎无质量下降的引导。
JOIN:通过对抗、推理和导航实现基于锚点抓取条件的双臂辅助操作连接
机构 * Northeastern University(东北大学)
AI总结 提出一种异构按需双臂系统JOIN,通过锚点臂与移动补臂的条件性连接,结合视觉语言模型和几何工具,解决代表性双臂日常生活任务,在实验中成功率更高且需更少人工修正。
Comments Xiang Zhi Tan and Taşkın Padır share equal advising
ZODS-RS -- 面向遥感的零训练目标检测与分割
机构 * Northeastern University, China(东北大学)
AI总结 提出一种无需训练的封闭式管道ZODS-RS,通过原型纯化、旋转尺度等变匹配和不确定性感知像素合并,统一了遥感图像的水平框检测与实例分割,在多个数据集上取得优异性能。
面向智能金融系统的统一多模态框架:整合强化学习、高频交易和博弈论方法与跨模态情感分析
机构 * Henan University, International Eurasia College(河南大学,国际欧亚学院) ; City University of Hong Kong, College of Business(香港城市大学,商学院) ; Northeastern University, School of Electronic and Information Engineering(东北大学,电子与信息工程学院)
AI总结 提出统一框架整合PPO、高频预测、上下文学习、博弈论和跨模态情感分析,在多个金融任务上平均提升20%以上性能。
使用LoRA和NEFTune对DeepSeek-R1-8B模型进行指令微调
机构 * University of Hong Kong(香港大学) ; Northeastern University(东北大学)
AI总结 本研究结合LoRA和NEFTune微调DeepSeek-R1-8B模型,用于金融命名实体识别,在七类实体上达到0.912的微F1分数,优于多个基线模型。
LMT: 制造系统中文本告警记录的因果发现贝叶斯框架
机构 * Department of Mechanical & Industrial Engineering, Northeastern University, Boston, MA, USA(东北大学机械与工业工程系) ; College of Integrative Studies, Singapore Management University, Singapore(新加坡国立大学整合研究学院) ; Department of Industrial Engineering and Management Sciences, Department of Mechanical Engineering, Northwestern University, IL, USA(西北大学工业工程与管理科学系、机械工程系)
AI总结 提出LMT框架,结合大语言模型提取的语义信号和基于泊松过程的时间证据,通过贝叶斯方法从文本告警记录中发现因果图,在小样本场景下表现优异。
Comments 19 pages