vlmrl
用JAX编写的视觉语言模型强化学习实验环境,可接入不同环境和模型并用PPO训练。
分享到 X许可证: Apache-2.0
概述
vlm-gym是一个用JAX编写的视觉语言模型强化学习环境,目前处于实验阶段。它的思路是接入任意环境和模型,并用PPO进行训练。项目自带GeoGuessr、NLVR2和图像描述等环境,以及可从Hugging Face转换为JAX的参考模型Qwen3-VL-4B-Instruct。训练器、推理和评估工具放在core目录,GeoGuessr训练采用分阶段的课程。
主要特点
- 可替换的视觉环境:GeoGuessr、NLVR2、图像描述
- 面向视觉语言模型的PPO训练器
- 推理引擎,并与Hugging Face基线对比评估
- 将Qwen3-VL-4B-Instruct从Hugging Face转为JAX
适用场景
适合想用JAX对视觉语言模型做强化学习实验的研究者。README标明其状态为实验性。
- 上游仓库
- sdan/vlm-gym
- GitHub 上的 fork
- Guo-astro/vlmrl
- 上游 Star 数
- 150
- 分类
- AI 智能体与大模型工具
- 编程语言
- Python
- 许可证
- Apache-2.0
- Fork 时间
- 2025-10-14
- 同步状态
- 已同步上次同步 2026-10-11
同分类更多: AI 智能体与大模型工具
Hello-Agents是学习智能体原理与实践的教程,带领读者从基础知识入门,逐步构建智能体系统和应用。
Fork 时间 2026-10-10上次同步 2026-10-11自定义许可证(见仓库)AI 智能体与大模型工具GitHub
OpenSRE 是一个开源框架,用于构建 AI 智能体,借助你的基础设施工具和工作流调查生产事故。
Fork 时间 2026-10-10上次同步 2026-10-11许可证: Apache-2.0AI 智能体与大模型工具GitHub
Context Mode帮助AI编程代理减少上下文占用,并在对话压缩后延续工作。它通过MCP和钩子处理工具输出、会话记忆,并在支持的平台间进行路由。
Fork 时间 2026-10-10上次同步 2026-10-11自定义许可证(见仓库)AI 智能体与大模型工具GitHub
ARTEX 是一款用于资产探索和测试过程审查的自托管 AI 渗透测试系统。它在一个界面中呈现任务、发现结果、资产数据和审批流程。
Fork 时间 2026-10-10上次同步 2026-10-11许可证: AGPL-3.0AI 智能体与大模型工具GitHub