albertvillanova HF Staff commited on
Commit
5cc89a4
·
verified ·
1 Parent(s): ec17b8e

Upload NemotronHForCausalLM

Browse files
Files changed (2) hide show
  1. config.json +9 -6
  2. model.safetensors +2 -2
config.json CHANGED
@@ -26,14 +26,14 @@
26
  "mamba_num_heads": 8,
27
  "mamba_proj_bias": false,
28
  "mamba_ssm_cache_dtype": "float32",
29
- "max_position_embeddings": 4096,
30
  "mlp_bias": false,
31
  "mlp_hidden_act": "relu2",
32
  "model_type": "nemotron_h",
33
  "moe_intermediate_size": 32,
34
- "moe_latent_size": null,
35
  "moe_shared_expert_intermediate_size": 32,
36
- "moe_shared_expert_overlap": true,
37
  "mtp_layers_block_type": [
38
  "attention",
39
  "moe"
@@ -42,16 +42,19 @@
42
  "n_groups": 1,
43
  "n_routed_experts": 4,
44
  "n_shared_experts": 1,
 
45
  "norm_topk_prob": true,
46
  "num_attention_heads": 4,
47
  "num_experts_per_tok": 2,
48
  "num_key_value_heads": 2,
49
  "num_logits_to_keep": 1,
50
- "num_nextn_predict_layers": 0,
51
  "pad_token_id": 0,
 
52
  "rescale_prenorm_residual": true,
53
  "residual_in_fp32": false,
54
- "routed_scaling_factor": 1.0,
 
55
  "sliding_window": null,
56
  "ssm_state_size": 16,
57
  "tie_word_embeddings": false,
@@ -69,6 +72,6 @@
69
  "use_bias": false,
70
  "use_cache": true,
71
  "use_conv_bias": true,
72
- "use_mamba_kernels": false,
73
  "vocab_size": 131072
74
  }
 
26
  "mamba_num_heads": 8,
27
  "mamba_proj_bias": false,
28
  "mamba_ssm_cache_dtype": "float32",
29
+ "max_position_embeddings": 262144,
30
  "mlp_bias": false,
31
  "mlp_hidden_act": "relu2",
32
  "model_type": "nemotron_h",
33
  "moe_intermediate_size": 32,
34
+ "moe_latent_size": 32,
35
  "moe_shared_expert_intermediate_size": 32,
36
+ "moe_shared_expert_overlap": false,
37
  "mtp_layers_block_type": [
38
  "attention",
39
  "moe"
 
42
  "n_groups": 1,
43
  "n_routed_experts": 4,
44
  "n_shared_experts": 1,
45
+ "norm_eps": 1e-05,
46
  "norm_topk_prob": true,
47
  "num_attention_heads": 4,
48
  "num_experts_per_tok": 2,
49
  "num_key_value_heads": 2,
50
  "num_logits_to_keep": 1,
51
+ "num_nextn_predict_layers": 1,
52
  "pad_token_id": 0,
53
+ "partial_rotary_factor": 1.0,
54
  "rescale_prenorm_residual": true,
55
  "residual_in_fp32": false,
56
+ "rope_theta": 10000,
57
+ "routed_scaling_factor": 5.0,
58
  "sliding_window": null,
59
  "ssm_state_size": 16,
60
  "tie_word_embeddings": false,
 
72
  "use_bias": false,
73
  "use_cache": true,
74
  "use_conv_bias": true,
75
+ "use_mamba_kernels": true,
76
  "vocab_size": 131072
77
  }
model.safetensors CHANGED
@@ -1,3 +1,3 @@
1
  version https://git-lfs.github.com/spec/v1
2
- oid sha256:3e6da51206e53bb7a78a6d37c01ed7e340b057274466cefaa21283de22040a9d
3
- size 8456608
 
1
  version https://git-lfs.github.com/spec/v1
2
+ oid sha256:28045fd1aa7046f6cc4473d029f2c37891bc8144d70cb1a9e3d81c014c3ef3ab
3
+ size 8467080