GLM-OCR
複雑な文書を読み取り、画像内の文字をテキストに変換するマルチモーダルOCRモデル。正確さと速さを重視しています。
Xで共有ライセンス: Apache-2.0
概要
GLM-OCRは、複雑な文書を理解するためのマルチモーダルOCRモデルです。視覚エンコーダー、軽量な接続部、GLM-0.5B言語デコーダーを組み合わせ、レイアウト解析の後に並列で認識する2段階のパイプラインを使います。数式や表を含む文書画像をテキスト化でき、vLLM、SGLang、Ollamaで動かせます。
主な特長
- レイアウト解析と並列認識の2段階構成
- 数式、表、情報抽出に対応
- パラメータ数は0.9Bのみ
- vLLM、SGLang、Ollamaで展開可能
- 複雑な表、コード多めの文書、印影を想定
こんな人・用途に
現実の複雑な文書をテキストに変換したく、自前で運用できるコンパクトなモデルを探しているチーム向けです。
- アップストリーム
- zai-org/GLM-OCR
- GitHubのフォーク
- Guo-astro/GLM-OCR
- アップストリームのスター数
- 7.5k
- カテゴリ
- ドキュメント・メディア・コンテンツ
- 言語
- Python
- ライセンス
- Apache-2.0
- フォーク日
- 2026-03-17
- 同期状態
- 同期済み最終同期 2026-10-11
同じカテゴリ: ドキュメント・メディア・コンテンツ
PhotoCraftは、レイヤー画像やPhotoshopのPSDをオフラインで編集できるRust製の画像編集アプリです。編集内容はPSDで保存できます。
フォーク日 2026-10-10最終同期 2026-10-11ライセンス: Apache-2.0ドキュメント・メディア・コンテンツGitHub
Pocket TTSは、GPUや音声生成Web APIを使わず、CPU上でテキストから音声を作る軽量なPython音声合成ツールです。Python APIまたはCLIから利用できます。
フォーク日 2026-10-09最終同期 2026-10-11ライセンス: MITドキュメント・メディア・コンテンツGitHub
動画や音声をローカルで編集・確認できるFFmpegツールキットです。コーディングエージェントからも直接利用でき、メディアのアップロードやAPIキーは不要です。
フォーク日 2026-10-04最終同期 2026-10-11ライセンス: MITドキュメント・メディア・コンテンツGitHub
深層学習の教科書を中国語で読むための資料で、読者の修正提案を集めて正確さを高めます。
フォーク日 2026-10-04最終同期 2026-10-11ライセンス表記なしドキュメント・メディア・コンテンツGitHub