ZyKNvice Huangmr0719

😴

Sleepy

Sterben werd ich, um zu leben!

Huangmr0719 / grpo_demo.py

Created February 28, 2025 06:58 — forked from willccbb/grpo_demo.py

GRPO Llama-1B

	# train_grpo.py
	#
	# See https://github.com/willccbb/verifiers for ongoing developments
	#
	import re
	import torch
	from datasets import load_dataset, Dataset
	from transformers import AutoTokenizer, AutoModelForCausalLM
	from peft import LoraConfig
	from trl import GRPOConfig, GRPOTrainer