GLM-OCR
面向复杂文档理解的多模态OCR模型,可把图片中的文字转换为文本,强调准确与快速。
分享到 X许可证: Apache-2.0
概述
GLM-OCR 是面向复杂文档理解的多模态 OCR 模型。它结合视觉编码器、轻量跨模态连接器和 GLM-0.5B 语言解码器,采用先版面分析、再并行识别的两阶段流程。可把含公式和表格的文档图像转成文本,并支持用 vLLM、SGLang 或 Ollama 部署。
主要特点
- 版面分析加并行识别的两阶段流程
- 支持公式、表格和信息抽取
- 仅 0.9B 参数
- 可用 vLLM、SGLang、Ollama 部署
- 面向复杂表格、代码类文档和印章
适用场景
适合需要把真实复杂文档转成文本、又想自行部署小体量模型的团队。
- 上游仓库
- zai-org/GLM-OCR
- GitHub 上的 fork
- Guo-astro/GLM-OCR
- 上游 Star 数
- 7.5k
- 分类
- 文档、媒体与内容
- 编程语言
- Python
- 许可证
- Apache-2.0
- Fork 时间
- 2026-03-17
- 同步状态
- 已同步上次同步 2026-10-11
同分类更多: 文档、媒体与内容
PhotoCraft是一款用Rust编写的开源图像编辑器,可在离线桌面应用中编辑图层图像和Photoshop PSD文件,并保存为PSD。
Fork 时间 2026-10-10上次同步 2026-10-11许可证: Apache-2.0文档、媒体与内容GitHub
Pocket TTS 是一款轻量级 Python 语音合成工具,可在 CPU 上将文本转为语音,无需 GPU 或语音生成 Web API;可通过 Python API 或命令行使用。
这是一套本地 FFmpeg 工具,可通过编程代理或直接编辑和检查视频、音频,无需上传媒体或使用 API 密钥。
中文译本帮助读者阅读深度学习教材,并通过社区反馈持续修正内容。