🎙️ Whisper Medium Urdu: LoRA Fine-Tuned

This model is a high-performance Automatic Speech Recognition (ASR) system for Urdu (Pakistan). It utilizes LoRA (Low-Rank Adaptation) to fine-tune the openai/whisper-medium backbone, achieving significant accuracy improvements on regional accents and vocabulary while remaining computationally efficient.

⚙️ Technical Specifications

  • Base Architecture: Transformer Encoder-Decoder (Whisper)
  • Adaptation Method: PEFT/LoRA ($r=32$, $\alpha=64$)
  • Precision: float16
  • Inference Speed: ~7.7 samples/sec on RTX 4060 Ti

📊 Training Environment & Results

Developed in a specialized Ubuntu environment designed for Urdu NLP tasks.

Parameter Value
Hardware NVIDIA GeForce RTX 4060 Ti 16 GB
Dataset Google FLEURS (ur_pk)
Epochs 15
Final Train Loss 0.33
Final Eval Loss 0.40

🚀 Deployment

from transformers import pipeline
import torch

pipe = pipeline(
    "automatic-speech-recognition", 
    model="Khurram123/whisper-medium-urdu-fleurs", 
    device=0, 
    torch_dtype=torch.float16
)

# Example: Transcribing Urdu audio
output = pipe("path_to_audio.wav", generate_kwargs={"language": "urdu"})
print(output["text"])
Downloads last month
6
Inference Examples
Political Slogan (Karachi Context)

اب کس کی باری، آصف زرداری۔

This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for Khurram123/whisper-medium-urdu-fleurs

Adapter
(134)
this model

Evaluation results