vlmrl

JAXで書かれた、視覚言語モデル向けの実験的な強化学習ジムです。環境とモデルを差し替えてPPOで学習できます。

Xで共有ライセンス: Apache-2.0

概要

vlm-gymは、視覚言語モデル向けの強化学習ジムで、JAXで書かれた実験的なプロジェクトです。任意の環境とモデルを組み込み、PPOで学習させることを想定しています。GeoGuessr、NLVR2、キャプション生成といった環境と、Hugging FaceからJAXへ変換できる参照モデルQwen3-VL-4B-Instructが含まれます。学習、ロールアウト、評価の機能はcoreフォルダにあり、GeoGuessrの学習は段階的なカリキュラムで進みます。

主な特長

  • GeoGuessr、NLVR2、キャプションなど差し替え可能な環境
  • 視覚言語モデル向けのPPOトレーナー
  • ロールアウトとHugging Face基準との評価
  • Qwen3-VL-4B-InstructをJAXへ変換

こんな人・用途に

JAXで視覚言語モデルの強化学習を試したい研究者向け。READMEでは状態が実験的とされています。

アップストリーム
sdan/vlm-gym
GitHubのフォーク
Guo-astro/vlmrl
アップストリームのスター数
149
カテゴリ
AIエージェントとLLMツール
言語
Python
ライセンス
Apache-2.0
フォーク日
2025-10-14
同期状態
同期済み最終同期 2026-09-29