GLM-OCR
複雑な文書を読み取り、画像内の文字をテキストに変換するマルチモーダルOCRモデル。正確さと速さを重視しています。
Xで共有ライセンス: Apache-2.0
概要
GLM-OCRは、複雑な文書を理解するためのマルチモーダルOCRモデルです。視覚エンコーダー、軽量な接続部、GLM-0.5B言語デコーダーを組み合わせ、レイアウト解析の後に並列で認識する2段階のパイプラインを使います。数式や表を含む文書画像をテキスト化でき、vLLM、SGLang、Ollamaで動かせます。
主な特長
- レイアウト解析と並列認識の2段階構成
- 数式、表、情報抽出に対応
- パラメータ数は0.9Bのみ
- vLLM、SGLang、Ollamaで展開可能
- 複雑な表、コード多めの文書、印影を想定
こんな人・用途に
現実の複雑な文書をテキストに変換したく、自前で運用できるコンパクトなモデルを探しているチーム向けです。
- アップストリーム
- zai-org/GLM-OCR
- GitHubのフォーク
- Guo-astro/GLM-OCR
- アップストリームのスター数
- 7.5k
- カテゴリ
- ドキュメント・メディア・コンテンツ
- 言語
- Python
- ライセンス
- Apache-2.0
- フォーク日
- 2026-03-17
- 同期状態
- 同期済み最終同期 2026-09-29
同じカテゴリ: ドキュメント・メディア・コンテンツ
Markdownを拡張し、論文、スライド、Webサイト、書籍、ナレッジベースを作れる組版システムです。
フォーク日 2026-09-28最終同期 2026-09-29ライセンス: GPL-3.0ドキュメント・メディア・コンテンツGitHub
Word、PowerPoint、Excel、PDFなど各種文書をきれいなMarkdownに変換する高速ライブラリです。Node.jsとPythonから使えます。
フォーク日 2026-09-28最終同期 2026-09-29ライセンス: MITドキュメント・メディア・コンテンツGitHub
Astro製のドキュメントサイト一式を編集可能なファイルとしてリポジトリに生成するツールで、人にもエージェントにも使いやすい文書を目指します。
フォーク日 2026-09-28最終同期 2026-09-29ライセンス: MITドキュメント・メディア・コンテンツGitHub
スライド全体が1つのHTMLファイルに収まるPowerPoint代替です。閲覧、発表、編集の機能を内蔵し、どのブラウザでも使えます。
フォーク日 2026-09-26最終同期 2026-09-29ライセンス: MITドキュメント・メディア・コンテンツGitHub