⚠️ Luna-Protocol-1.5B-Discord-Dialogues-200k-base-v2 — EXPÉRIMENTAL / INSTABLE

Ce modèle n'est pas recommandé pour un usage en production. Il s'agit d'une itération corrective sur 200k-base, toujours basée sur la variante base (non-Instruct) de Qwen2.5-1.5B. Voir Luna-Protocol-1.5B-Discord-Dialogues (basé sur Qwen2.5-1.5B-Instruct) pour une version plus stable.

Ce qui change par rapport à la v1 (200k-base)

Suite au rapport qualitatif sur la v1, deux ajustements ont été apportés :

  1. Rôle assistant → luna : le mot "assistant" porte une forte connotation IA-serviable dans les poids pré-entraînés, ce qui va à l'encontre de l'objectif de Luna Protocol (un modèle confondu avec un humain sur Discord, pas un assistant IA). Le dataset a été retraité pour renommer chaque tour <|im_start|>assistant en <|im_start|>luna, et le prompt de génération se termine désormais par <|im_start|>luna\n plutôt que <|im_start|>assistant\n.
  2. Nouveau repo, pas de reprise de checkpoint : pour ne pas hériter d'un checkpoint entraîné avec l'ancien rôle assistant, l'entraînement est reparti de zéro sur ce nouveau repo, avec un dataset préprocessé distinct (Discord-Dialogues-Preprocessed-Luna-Protocol-role-luna).

Le reste de la configuration est inchangé par rapport à la v1 : QLoRA r=16/lora_alpha=16, ~200 000 exemples filtrés 8–512 tokens, template ChatML configuré manuellement (le modèle base n'a ni chat_template ni EOS de conversation natifs).

❌ Problème connu : le renommage de rôle n'a pas résolu la non-terminaison

Malgré la correction du rôle, le problème de génération infinie/instable observé en v1 persiste. Le renommage assistant → luna corrige un biais de ton (moins de réponses "IA-serviable" génériques), mais n'agit pas sur la cause racine : un modèle base n'a jamais été entraîné à reconnaître la fin d'un tour de conversation, et 200k exemples en LoRA (1.5 epoch) ne suffisent pas à faire émerger ce comportement de façon fiable à partir de zéro.

Conclusion de cette série d'expériences

L'hypothèse initiale (repartir d'un modèle base pour un style Discord plus marqué) n'a pas été validée dans des conditions utilisables : le gain de ton, s'il existe, ne compense pas l'instabilité de génération. Le développement reprend donc sur une base Instruct, qui a déjà un comportement d'arrêt fiable avant même le fine-tuning — voir le notebook et le repo 200k-instruct.

Statut

Conservé à titre de trace expérimentale / comparaison. Non recommandé pour un usage réel.

Crédits

Downloads last month
648
GGUF
Model size
2B params
Architecture
qwen2
Hardware compatibility
Log In to add your hardware

2-bit

3-bit

4-bit

5-bit

6-bit

8-bit

Inference Providers NEW
This model isn't deployed by any Inference Provider. 🙋 Ask for provider support

Model tree for fox3000foxy/Luna-Protocol-1.5B-Discord-Dialogues-200k-base-v2

Adapter
(6)
this model

Dataset used to train fox3000foxy/Luna-Protocol-1.5B-Discord-Dialogues-200k-base-v2

Collection including fox3000foxy/Luna-Protocol-1.5B-Discord-Dialogues-200k-base-v2