{
  "id": "ducnh279/grpo-train-reasoning-model",
  "id_no": 76371246,
  "title": "grpo_train_reasoning_model",
  "code_file": "grpo-train-reasoning-model.ipynb",
  "language": "python",
  "kernel_type": "notebook",
  "is_private": false,
  "enable_gpu": false,
  "enable_tpu": false,
  "enable_internet": false,
  "keywords": [],
  "dataset_sources": [],
  "kernel_sources": [],
  "competition_sources": [
    "ai-mathematical-olympiad-progress-prize-2",
    "konwinski-prize",
    "llms-you-cant-please-them-all"
  ],
  "model_sources": [
    "qwen-lm/qwen2.5/Transformers/1.5b/1",
    "qwen-lm/qwen2.5/Transformers/0.5b/1"
  ],
  "docker_image": "gcr.io/kaggle-images/python@sha256:df5bb865ba69fd6ef584de23ddc655e1ea6958c60ceb02eb5eed0459fa2819a2",
  "machine_shape": "None"
}