How to use from the
Use from the
Transformers library
# Use a pipeline as a high-level helper
from transformers import pipeline

pipe = pipeline("text-generation", model="Likhith003/dpo-llmjudge-lora-adapter")
# Load model directly
from transformers import AutoTokenizer, AutoModelForCausalLM

tokenizer = AutoTokenizer.from_pretrained("Likhith003/dpo-llmjudge-lora-adapter")
model = AutoModelForCausalLM.from_pretrained("Likhith003/dpo-llmjudge-lora-adapter", device_map="auto")
Quick Links

DPO Fine-Tuned Adapter - LLM Judge Dataset

🧠 Model

  • Base: meta-llama/Llama-3.2-1B-Instruct
  • Fine-tuned using TRL's DPOTrainer with the LLM Judge preference dataset (50 pairs)

βš™οΈ Training Parameters

Parameter Value
Learning Rate 5e-5
Batch Size 4
Epochs 3
Beta (DPO regularizer) 0.1
Max Input Length 1024 tokens
Max Prompt Length 512 tokens
Padding Token eos_token

πŸ“¦ Dataset

  • Source: llm_judge_preferences.csv
  • Size: 50 human-labeled pairs with prompt, chosen, and rejected columns

πŸ“‚ Output

  • Adapter saved and uploaded as Likhith003/dpo-llmjudge-lora-adapter
Downloads last month
9
Safetensors
Model size
1B params
Tensor type
BF16
Β·
Inference Providers NEW
This model isn't deployed by any Inference Provider. πŸ™‹ Ask for provider support