vlmrl

用JAX编写的视觉语言模型强化学习实验环境,可接入不同环境和模型并用PPO训练。

分享到 X许可证: Apache-2.0

概述

vlm-gym是一个用JAX编写的视觉语言模型强化学习环境,目前处于实验阶段。它的思路是接入任意环境和模型,并用PPO进行训练。项目自带GeoGuessr、NLVR2和图像描述等环境,以及可从Hugging Face转换为JAX的参考模型Qwen3-VL-4B-Instruct。训练器、推理和评估工具放在core目录,GeoGuessr训练采用分阶段的课程。

主要特点

  • 可替换的视觉环境:GeoGuessr、NLVR2、图像描述
  • 面向视觉语言模型的PPO训练器
  • 推理引擎,并与Hugging Face基线对比评估
  • 将Qwen3-VL-4B-Instruct从Hugging Face转为JAX

适用场景

适合想用JAX对视觉语言模型做强化学习实验的研究者。README标明其状态为实验性。

上游仓库
sdan/vlm-gym
GitHub 上的 fork
Guo-astro/vlmrl
上游 Star 数
149
分类
AI 智能体与大模型工具
编程语言
Python
许可证
Apache-2.0
Fork 时间
2025-10-14
同步状态
已同步上次同步 2026-09-29