从零训练的中英双语小模型。这里在线运行公开的 0.51B SFT checkpoint。
自动使用训练时的思维协议;普通聊天建议关闭。
多模态权重已发布在 tinyLLM-0.51B-VLM。ARC GRPO 和 IFEval OPD LoRA 也可单独下载。完整图片演示建议使用 GitHub 中的本地 Demo;这个免费 Space 主要用于快速验证文本基座。