GLM-OCR

複雑な文書を読み取り、画像内の文字をテキストに変換するマルチモーダルOCRモデル。正確さと速さを重視しています。

Xで共有ライセンス: Apache-2.0

概要

GLM-OCRは、複雑な文書を理解するためのマルチモーダルOCRモデルです。視覚エンコーダー、軽量な接続部、GLM-0.5B言語デコーダーを組み合わせ、レイアウト解析の後に並列で認識する2段階のパイプラインを使います。数式や表を含む文書画像をテキスト化でき、vLLM、SGLang、Ollamaで動かせます。

主な特長

  • レイアウト解析と並列認識の2段階構成
  • 数式、表、情報抽出に対応
  • パラメータ数は0.9Bのみ
  • vLLM、SGLang、Ollamaで展開可能
  • 複雑な表、コード多めの文書、印影を想定

こんな人・用途に

現実の複雑な文書をテキストに変換したく、自前で運用できるコンパクトなモデルを探しているチーム向けです。

アップストリーム
zai-org/GLM-OCR
GitHubのフォーク
Guo-astro/GLM-OCR
アップストリームのスター数
7.5k
カテゴリ
ドキュメント・メディア・コンテンツ
言語
Python
ライセンス
Apache-2.0
フォーク日
2026-03-17
同期状態
同期済み最終同期 2026-09-29