daviddongdong commited on
Commit
306c4d3
·
verified ·
1 Parent(s): 2eea2da

Upload 8 files

Browse files
adapter_config.json ADDED
@@ -0,0 +1,37 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "alpha_pattern": {},
3
+ "auto_mapping": null,
4
+ "base_model_name_or_path": "Qwen2.5-32B-Instruct",
5
+ "bias": "none",
6
+ "eva_config": null,
7
+ "exclude_modules": null,
8
+ "fan_in_fan_out": false,
9
+ "inference_mode": true,
10
+ "init_lora_weights": true,
11
+ "layer_replication": null,
12
+ "layers_pattern": null,
13
+ "layers_to_transform": null,
14
+ "loftq_config": {},
15
+ "lora_alpha": 32,
16
+ "lora_bias": false,
17
+ "lora_dropout": 0.0,
18
+ "megatron_config": null,
19
+ "megatron_core": "megatron.core",
20
+ "modules_to_save": null,
21
+ "peft_type": "LORA",
22
+ "r": 16,
23
+ "rank_pattern": {},
24
+ "revision": null,
25
+ "target_modules": [
26
+ "q_proj",
27
+ "up_proj",
28
+ "k_proj",
29
+ "o_proj",
30
+ "gate_proj",
31
+ "down_proj",
32
+ "v_proj"
33
+ ],
34
+ "task_type": "CAUSAL_LM",
35
+ "use_dora": false,
36
+ "use_rslora": false
37
+ }
adapter_model.safetensors ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:f07bba4c7af6aee9fc3ae96d9ad58ab8a96f35477a25c20e5acb115200364f2e
3
+ size 536991984
additional_config.json ADDED
@@ -0,0 +1 @@
 
 
1
+ {"lora_dtype": null, "lorap_lr_ratio": null, "lorap_emb_lr": 1e-06}
optimizer.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:4b01ce863f589f77a7037018bbf8cd42f4aaf0d9b106655f95db8129103f89e7
3
+ size 1074499986
rng_state.pth ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:e3e5d946241df2516b06d7074d8779088eae7607173ad780df56583910a9589b
3
+ size 14244
scheduler.pt ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:5414b7afe4dad39d837a6989445b96e11d5b91381e5d3d286fcfc6c89949500f
3
+ size 1064
trainer_state.json ADDED
@@ -0,0 +1,2181 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_metric": 0.58375472,
3
+ "best_model_checkpoint": "/export/home2/zli/kc/mm_rag/Qwen2.5-32B-Instruct_lora/checkpoint-1026",
4
+ "epoch": 0.9997563946406821,
5
+ "eval_steps": 100,
6
+ "global_step": 1026,
7
+ "is_hyper_param_search": false,
8
+ "is_local_process_zero": true,
9
+ "is_world_process_zero": true,
10
+ "log_history": [
11
+ {
12
+ "epoch": 0.00097442143727162,
13
+ "grad_norm": 0.8529725074768066,
14
+ "learning_rate": 1.9230769230769234e-06,
15
+ "loss": 0.9744532108306885,
16
+ "memory(GiB)": 255.29,
17
+ "step": 1,
18
+ "token_acc": 0.7235609103078983,
19
+ "train_speed(iter/s)": 0.048136
20
+ },
21
+ {
22
+ "epoch": 0.0048721071863581,
23
+ "grad_norm": 0.9313930869102478,
24
+ "learning_rate": 9.615384615384616e-06,
25
+ "loss": 0.7735831141471863,
26
+ "memory(GiB)": 307.13,
27
+ "step": 5,
28
+ "token_acc": 0.7883002659030477,
29
+ "train_speed(iter/s)": 0.052895
30
+ },
31
+ {
32
+ "epoch": 0.0097442143727162,
33
+ "grad_norm": 0.5147601962089539,
34
+ "learning_rate": 1.923076923076923e-05,
35
+ "loss": 0.8932640075683593,
36
+ "memory(GiB)": 357.61,
37
+ "step": 10,
38
+ "token_acc": 0.7670103092783506,
39
+ "train_speed(iter/s)": 0.055392
40
+ },
41
+ {
42
+ "epoch": 0.014616321559074299,
43
+ "grad_norm": 0.3254891037940979,
44
+ "learning_rate": 2.8846153846153845e-05,
45
+ "loss": 0.7951784610748291,
46
+ "memory(GiB)": 357.63,
47
+ "step": 15,
48
+ "token_acc": 0.7827709279688514,
49
+ "train_speed(iter/s)": 0.058176
50
+ },
51
+ {
52
+ "epoch": 0.0194884287454324,
53
+ "grad_norm": 0.5581763982772827,
54
+ "learning_rate": 3.846153846153846e-05,
55
+ "loss": 0.956171703338623,
56
+ "memory(GiB)": 357.63,
57
+ "step": 20,
58
+ "token_acc": 0.7419072615923009,
59
+ "train_speed(iter/s)": 0.05832
60
+ },
61
+ {
62
+ "epoch": 0.024360535931790498,
63
+ "grad_norm": 0.3584084212779999,
64
+ "learning_rate": 4.8076923076923084e-05,
65
+ "loss": 0.8373254776000977,
66
+ "memory(GiB)": 357.64,
67
+ "step": 25,
68
+ "token_acc": 0.7718067293892521,
69
+ "train_speed(iter/s)": 0.057013
70
+ },
71
+ {
72
+ "epoch": 0.029232643118148598,
73
+ "grad_norm": 0.43336302042007446,
74
+ "learning_rate": 5.769230769230769e-05,
75
+ "loss": 0.7370581150054931,
76
+ "memory(GiB)": 357.64,
77
+ "step": 30,
78
+ "token_acc": 0.7800821355236139,
79
+ "train_speed(iter/s)": 0.057318
80
+ },
81
+ {
82
+ "epoch": 0.0341047503045067,
83
+ "grad_norm": 0.6522459983825684,
84
+ "learning_rate": 6.730769230769232e-05,
85
+ "loss": 0.8316493988037109,
86
+ "memory(GiB)": 357.64,
87
+ "step": 35,
88
+ "token_acc": 0.7533095188064719,
89
+ "train_speed(iter/s)": 0.0583
90
+ },
91
+ {
92
+ "epoch": 0.0389768574908648,
93
+ "grad_norm": 0.2728117108345032,
94
+ "learning_rate": 7.692307692307693e-05,
95
+ "loss": 0.7739034652709961,
96
+ "memory(GiB)": 357.64,
97
+ "step": 40,
98
+ "token_acc": 0.7733619763694952,
99
+ "train_speed(iter/s)": 0.058058
100
+ },
101
+ {
102
+ "epoch": 0.0438489646772229,
103
+ "grad_norm": 0.5565893054008484,
104
+ "learning_rate": 8.653846153846155e-05,
105
+ "loss": 0.664579200744629,
106
+ "memory(GiB)": 357.64,
107
+ "step": 45,
108
+ "token_acc": 0.7940859054608245,
109
+ "train_speed(iter/s)": 0.058044
110
+ },
111
+ {
112
+ "epoch": 0.048721071863580996,
113
+ "grad_norm": 0.8710922002792358,
114
+ "learning_rate": 9.615384615384617e-05,
115
+ "loss": 0.6327468872070312,
116
+ "memory(GiB)": 378.13,
117
+ "step": 50,
118
+ "token_acc": 0.8048907388137357,
119
+ "train_speed(iter/s)": 0.057666
120
+ },
121
+ {
122
+ "epoch": 0.0535931790499391,
123
+ "grad_norm": 0.5048324465751648,
124
+ "learning_rate": 9.999765921804365e-05,
125
+ "loss": 0.7563381671905518,
126
+ "memory(GiB)": 378.13,
127
+ "step": 55,
128
+ "token_acc": 0.7769541778975741,
129
+ "train_speed(iter/s)": 0.056465
130
+ },
131
+ {
132
+ "epoch": 0.058465286236297195,
133
+ "grad_norm": 0.4348597824573517,
134
+ "learning_rate": 9.998335523311734e-05,
135
+ "loss": 0.6969810009002686,
136
+ "memory(GiB)": 378.13,
137
+ "step": 60,
138
+ "token_acc": 0.7881806108897742,
139
+ "train_speed(iter/s)": 0.056264
140
+ },
141
+ {
142
+ "epoch": 0.06333739342265529,
143
+ "grad_norm": 0.3995300233364105,
144
+ "learning_rate": 9.995605141340247e-05,
145
+ "loss": 0.6338334083557129,
146
+ "memory(GiB)": 378.13,
147
+ "step": 65,
148
+ "token_acc": 0.8006442376521117,
149
+ "train_speed(iter/s)": 0.056356
150
+ },
151
+ {
152
+ "epoch": 0.0682095006090134,
153
+ "grad_norm": 0.25958451628685,
154
+ "learning_rate": 9.991575486016592e-05,
155
+ "loss": 0.7143070697784424,
156
+ "memory(GiB)": 378.13,
157
+ "step": 70,
158
+ "token_acc": 0.7797544920832592,
159
+ "train_speed(iter/s)": 0.056342
160
+ },
161
+ {
162
+ "epoch": 0.0730816077953715,
163
+ "grad_norm": 0.3476051688194275,
164
+ "learning_rate": 9.986247605386727e-05,
165
+ "loss": 0.6742859840393066,
166
+ "memory(GiB)": 378.13,
167
+ "step": 75,
168
+ "token_acc": 0.7907263751763046,
169
+ "train_speed(iter/s)": 0.056661
170
+ },
171
+ {
172
+ "epoch": 0.0779537149817296,
173
+ "grad_norm": 0.3681824505329132,
174
+ "learning_rate": 9.979622885143301e-05,
175
+ "loss": 0.5565629959106445,
176
+ "memory(GiB)": 378.13,
177
+ "step": 80,
178
+ "token_acc": 0.8259753593429158,
179
+ "train_speed(iter/s)": 0.056802
180
+ },
181
+ {
182
+ "epoch": 0.0828258221680877,
183
+ "grad_norm": 0.4626450836658478,
184
+ "learning_rate": 9.97170304826526e-05,
185
+ "loss": 0.6965714931488037,
186
+ "memory(GiB)": 378.13,
187
+ "step": 85,
188
+ "token_acc": 0.7883802169516455,
189
+ "train_speed(iter/s)": 0.057068
190
+ },
191
+ {
192
+ "epoch": 0.0876979293544458,
193
+ "grad_norm": 0.6139679551124573,
194
+ "learning_rate": 9.962490154569727e-05,
195
+ "loss": 0.670227336883545,
196
+ "memory(GiB)": 378.13,
197
+ "step": 90,
198
+ "token_acc": 0.7868181818181819,
199
+ "train_speed(iter/s)": 0.056985
200
+ },
201
+ {
202
+ "epoch": 0.0925700365408039,
203
+ "grad_norm": 0.3063270151615143,
204
+ "learning_rate": 9.95198660017628e-05,
205
+ "loss": 0.6900132179260254,
206
+ "memory(GiB)": 378.13,
207
+ "step": 95,
208
+ "token_acc": 0.7969001610305958,
209
+ "train_speed(iter/s)": 0.056931
210
+ },
211
+ {
212
+ "epoch": 0.09744214372716199,
213
+ "grad_norm": 0.6139111518859863,
214
+ "learning_rate": 9.940195116883755e-05,
215
+ "loss": 0.6138424396514892,
216
+ "memory(GiB)": 378.13,
217
+ "step": 100,
218
+ "token_acc": 0.8159609120521173,
219
+ "train_speed(iter/s)": 0.056746
220
+ },
221
+ {
222
+ "epoch": 0.09744214372716199,
223
+ "eval_loss": 0.7148731350898743,
224
+ "eval_runtime": 6.1133,
225
+ "eval_samples_per_second": 0.654,
226
+ "eval_steps_per_second": 0.654,
227
+ "step": 100
228
+ },
229
+ {
230
+ "epoch": 0.1023142509135201,
231
+ "grad_norm": 0.2960892617702484,
232
+ "learning_rate": 9.927118771459763e-05,
233
+ "loss": 0.7610847473144531,
234
+ "memory(GiB)": 378.13,
235
+ "step": 105,
236
+ "token_acc": 0.767438173747622,
237
+ "train_speed(iter/s)": 0.055274
238
+ },
239
+ {
240
+ "epoch": 0.1071863580998782,
241
+ "grad_norm": 0.35161978006362915,
242
+ "learning_rate": 9.91276096484306e-05,
243
+ "loss": 0.553467845916748,
244
+ "memory(GiB)": 378.13,
245
+ "step": 110,
246
+ "token_acc": 0.8268870335661953,
247
+ "train_speed(iter/s)": 0.055276
248
+ },
249
+ {
250
+ "epoch": 0.1120584652862363,
251
+ "grad_norm": 0.412120521068573,
252
+ "learning_rate": 9.897125431259033e-05,
253
+ "loss": 0.634190034866333,
254
+ "memory(GiB)": 378.13,
255
+ "step": 115,
256
+ "token_acc": 0.8068276436303081,
257
+ "train_speed(iter/s)": 0.055265
258
+ },
259
+ {
260
+ "epoch": 0.11693057247259439,
261
+ "grad_norm": 0.458766907453537,
262
+ "learning_rate": 9.880216237248481e-05,
263
+ "loss": 0.5070098400115967,
264
+ "memory(GiB)": 383.55,
265
+ "step": 120,
266
+ "token_acc": 0.8488372093023255,
267
+ "train_speed(iter/s)": 0.055088
268
+ },
269
+ {
270
+ "epoch": 0.1218026796589525,
271
+ "grad_norm": 0.26979780197143555,
272
+ "learning_rate": 9.862037780609986e-05,
273
+ "loss": 0.6117064476013183,
274
+ "memory(GiB)": 383.55,
275
+ "step": 125,
276
+ "token_acc": 0.8204016064257028,
277
+ "train_speed(iter/s)": 0.055201
278
+ },
279
+ {
280
+ "epoch": 0.12667478684531058,
281
+ "grad_norm": 0.33145567774772644,
282
+ "learning_rate": 9.842594789256103e-05,
283
+ "loss": 0.6480350017547607,
284
+ "memory(GiB)": 383.55,
285
+ "step": 130,
286
+ "token_acc": 0.7939520333680917,
287
+ "train_speed(iter/s)": 0.055341
288
+ },
289
+ {
290
+ "epoch": 0.1315468940316687,
291
+ "grad_norm": 0.29335150122642517,
292
+ "learning_rate": 9.821892319983726e-05,
293
+ "loss": 0.6102027893066406,
294
+ "memory(GiB)": 383.55,
295
+ "step": 135,
296
+ "token_acc": 0.8075084115459537,
297
+ "train_speed(iter/s)": 0.055381
298
+ },
299
+ {
300
+ "epoch": 0.1364190012180268,
301
+ "grad_norm": 0.34363335371017456,
302
+ "learning_rate": 9.799935757158891e-05,
303
+ "loss": 0.6652801513671875,
304
+ "memory(GiB)": 383.55,
305
+ "step": 140,
306
+ "token_acc": 0.7967960995995125,
307
+ "train_speed(iter/s)": 0.055397
308
+ },
309
+ {
310
+ "epoch": 0.14129110840438489,
311
+ "grad_norm": 1.3419567346572876,
312
+ "learning_rate": 9.776730811316394e-05,
313
+ "loss": 0.6267284393310547,
314
+ "memory(GiB)": 383.55,
315
+ "step": 145,
316
+ "token_acc": 0.8041536400178652,
317
+ "train_speed(iter/s)": 0.055716
318
+ },
319
+ {
320
+ "epoch": 0.146163215590743,
321
+ "grad_norm": 0.32478609681129456,
322
+ "learning_rate": 9.752283517674575e-05,
323
+ "loss": 0.5990486145019531,
324
+ "memory(GiB)": 383.55,
325
+ "step": 150,
326
+ "token_acc": 0.80878414568827,
327
+ "train_speed(iter/s)": 0.055975
328
+ },
329
+ {
330
+ "epoch": 0.1510353227771011,
331
+ "grad_norm": 0.33393779397010803,
332
+ "learning_rate": 9.72660023456566e-05,
333
+ "loss": 0.6312044143676758,
334
+ "memory(GiB)": 383.55,
335
+ "step": 155,
336
+ "token_acc": 0.8099249502220861,
337
+ "train_speed(iter/s)": 0.055469
338
+ },
339
+ {
340
+ "epoch": 0.1559074299634592,
341
+ "grad_norm": 0.39661872386932373,
342
+ "learning_rate": 9.699687641782067e-05,
343
+ "loss": 0.727474308013916,
344
+ "memory(GiB)": 383.55,
345
+ "step": 160,
346
+ "token_acc": 0.7668711656441718,
347
+ "train_speed(iter/s)": 0.055534
348
+ },
349
+ {
350
+ "epoch": 0.1607795371498173,
351
+ "grad_norm": 0.3174588978290558,
352
+ "learning_rate": 9.671552738839099e-05,
353
+ "loss": 0.7284453868865967,
354
+ "memory(GiB)": 383.55,
355
+ "step": 165,
356
+ "token_acc": 0.7788385043754972,
357
+ "train_speed(iter/s)": 0.055621
358
+ },
359
+ {
360
+ "epoch": 0.1656516443361754,
361
+ "grad_norm": 0.3508811891078949,
362
+ "learning_rate": 9.642202843154491e-05,
363
+ "loss": 0.6260187149047851,
364
+ "memory(GiB)": 383.55,
365
+ "step": 170,
366
+ "token_acc": 0.8036006546644845,
367
+ "train_speed(iter/s)": 0.055841
368
+ },
369
+ {
370
+ "epoch": 0.1705237515225335,
371
+ "grad_norm": 0.35121622681617737,
372
+ "learning_rate": 9.611645588145272e-05,
373
+ "loss": 0.6979084968566894,
374
+ "memory(GiB)": 383.55,
375
+ "step": 175,
376
+ "token_acc": 0.784981684981685,
377
+ "train_speed(iter/s)": 0.055902
378
+ },
379
+ {
380
+ "epoch": 0.1753958587088916,
381
+ "grad_norm": 0.41958293318748474,
382
+ "learning_rate": 9.579888921242439e-05,
383
+ "loss": 0.6360678195953369,
384
+ "memory(GiB)": 383.55,
385
+ "step": 180,
386
+ "token_acc": 0.8010867455850961,
387
+ "train_speed(iter/s)": 0.05597
388
+ },
389
+ {
390
+ "epoch": 0.18026796589524968,
391
+ "grad_norm": 0.4557216763496399,
392
+ "learning_rate": 9.546941101823963e-05,
393
+ "loss": 0.7268210411071777,
394
+ "memory(GiB)": 383.55,
395
+ "step": 185,
396
+ "token_acc": 0.780511811023622,
397
+ "train_speed(iter/s)": 0.056032
398
+ },
399
+ {
400
+ "epoch": 0.1851400730816078,
401
+ "grad_norm": 0.44287464022636414,
402
+ "learning_rate": 9.512810699066667e-05,
403
+ "loss": 0.6450634479522706,
404
+ "memory(GiB)": 383.55,
405
+ "step": 190,
406
+ "token_acc": 0.8003896563939072,
407
+ "train_speed(iter/s)": 0.056127
408
+ },
409
+ {
410
+ "epoch": 0.1900121802679659,
411
+ "grad_norm": 0.2944161593914032,
412
+ "learning_rate": 9.477506589717518e-05,
413
+ "loss": 0.5534649848937988,
414
+ "memory(GiB)": 383.55,
415
+ "step": 195,
416
+ "token_acc": 0.8173982442138866,
417
+ "train_speed(iter/s)": 0.056116
418
+ },
419
+ {
420
+ "epoch": 0.19488428745432398,
421
+ "grad_norm": 0.3743175268173218,
422
+ "learning_rate": 9.441037955784944e-05,
423
+ "loss": 0.7282295227050781,
424
+ "memory(GiB)": 383.55,
425
+ "step": 200,
426
+ "token_acc": 0.7695568400770713,
427
+ "train_speed(iter/s)": 0.05619
428
+ },
429
+ {
430
+ "epoch": 0.19488428745432398,
431
+ "eval_loss": 0.6866188049316406,
432
+ "eval_runtime": 6.0764,
433
+ "eval_samples_per_second": 0.658,
434
+ "eval_steps_per_second": 0.658,
435
+ "step": 200
436
+ },
437
+ {
438
+ "epoch": 0.1997563946406821,
439
+ "grad_norm": 0.397987425327301,
440
+ "learning_rate": 9.403414282150738e-05,
441
+ "loss": 0.6911158561706543,
442
+ "memory(GiB)": 383.55,
443
+ "step": 205,
444
+ "token_acc": 0.7807744462859726,
445
+ "train_speed(iter/s)": 0.055478
446
+ },
447
+ {
448
+ "epoch": 0.2046285018270402,
449
+ "grad_norm": 0.852430522441864,
450
+ "learning_rate": 9.364645354103206e-05,
451
+ "loss": 0.7203257560729981,
452
+ "memory(GiB)": 383.55,
453
+ "step": 210,
454
+ "token_acc": 0.7839163822525598,
455
+ "train_speed(iter/s)": 0.055538
456
+ },
457
+ {
458
+ "epoch": 0.2095006090133983,
459
+ "grad_norm": 0.36566832661628723,
460
+ "learning_rate": 9.324741254792171e-05,
461
+ "loss": 0.5751584529876709,
462
+ "memory(GiB)": 383.55,
463
+ "step": 215,
464
+ "token_acc": 0.8120177310786406,
465
+ "train_speed(iter/s)": 0.055665
466
+ },
467
+ {
468
+ "epoch": 0.2143727161997564,
469
+ "grad_norm": 0.5105158090591431,
470
+ "learning_rate": 9.28371236260652e-05,
471
+ "loss": 0.5958977699279785,
472
+ "memory(GiB)": 383.55,
473
+ "step": 220,
474
+ "token_acc": 0.8228462471832206,
475
+ "train_speed(iter/s)": 0.055807
476
+ },
477
+ {
478
+ "epoch": 0.2192448233861145,
479
+ "grad_norm": 0.48028162121772766,
480
+ "learning_rate": 9.241569348474954e-05,
481
+ "loss": 0.7106984615325928,
482
+ "memory(GiB)": 383.55,
483
+ "step": 225,
484
+ "token_acc": 0.7828740844087897,
485
+ "train_speed(iter/s)": 0.055858
486
+ },
487
+ {
488
+ "epoch": 0.2241169305724726,
489
+ "grad_norm": 0.32592424750328064,
490
+ "learning_rate": 9.198323173090663e-05,
491
+ "loss": 0.5898131847381591,
492
+ "memory(GiB)": 383.55,
493
+ "step": 230,
494
+ "token_acc": 0.8189450340567084,
495
+ "train_speed(iter/s)": 0.055995
496
+ },
497
+ {
498
+ "epoch": 0.2289890377588307,
499
+ "grad_norm": 0.44794151186943054,
500
+ "learning_rate": 9.153985084060623e-05,
501
+ "loss": 0.6042355060577392,
502
+ "memory(GiB)": 383.55,
503
+ "step": 235,
504
+ "token_acc": 0.810122224134963,
505
+ "train_speed(iter/s)": 0.056057
506
+ },
507
+ {
508
+ "epoch": 0.23386114494518878,
509
+ "grad_norm": 0.3204025328159332,
510
+ "learning_rate": 9.108566612980298e-05,
511
+ "loss": 0.5558523654937744,
512
+ "memory(GiB)": 383.55,
513
+ "step": 240,
514
+ "token_acc": 0.8260869565217391,
515
+ "train_speed(iter/s)": 0.056072
516
+ },
517
+ {
518
+ "epoch": 0.2387332521315469,
519
+ "grad_norm": 0.31540507078170776,
520
+ "learning_rate": 9.062079572434448e-05,
521
+ "loss": 0.6237210273742676,
522
+ "memory(GiB)": 383.55,
523
+ "step": 245,
524
+ "token_acc": 0.8021445866482186,
525
+ "train_speed(iter/s)": 0.056086
526
+ },
527
+ {
528
+ "epoch": 0.243605359317905,
529
+ "grad_norm": 0.619088888168335,
530
+ "learning_rate": 9.014536052924883e-05,
531
+ "loss": 0.664583158493042,
532
+ "memory(GiB)": 383.55,
533
+ "step": 250,
534
+ "token_acc": 0.793002915451895,
535
+ "train_speed(iter/s)": 0.056116
536
+ },
537
+ {
538
+ "epoch": 0.24847746650426308,
539
+ "grad_norm": 0.6715230345726013,
540
+ "learning_rate": 8.965948419725922e-05,
541
+ "loss": 0.5711063861846923,
542
+ "memory(GiB)": 383.55,
543
+ "step": 255,
544
+ "token_acc": 0.8185620394343757,
545
+ "train_speed(iter/s)": 0.055175
546
+ },
547
+ {
548
+ "epoch": 0.25334957369062117,
549
+ "grad_norm": 0.4514237642288208,
550
+ "learning_rate": 8.916329309668397e-05,
551
+ "loss": 0.721324348449707,
552
+ "memory(GiB)": 383.55,
553
+ "step": 260,
554
+ "token_acc": 0.7792865828942035,
555
+ "train_speed(iter/s)": 0.055266
556
+ },
557
+ {
558
+ "epoch": 0.2582216808769793,
559
+ "grad_norm": 0.5026947855949402,
560
+ "learning_rate": 8.865691627853013e-05,
561
+ "loss": 0.6661148548126221,
562
+ "memory(GiB)": 383.55,
563
+ "step": 265,
564
+ "token_acc": 0.7951268025857782,
565
+ "train_speed(iter/s)": 0.05533
566
+ },
567
+ {
568
+ "epoch": 0.2630937880633374,
569
+ "grad_norm": 0.3138331174850464,
570
+ "learning_rate": 8.814048544293965e-05,
571
+ "loss": 0.6717385292053223,
572
+ "memory(GiB)": 383.55,
573
+ "step": 270,
574
+ "token_acc": 0.7904462355022607,
575
+ "train_speed(iter/s)": 0.055296
576
+ },
577
+ {
578
+ "epoch": 0.2679658952496955,
579
+ "grad_norm": 0.3270625174045563,
580
+ "learning_rate": 8.76141349049362e-05,
581
+ "loss": 0.6027359008789063,
582
+ "memory(GiB)": 383.55,
583
+ "step": 275,
584
+ "token_acc": 0.8082101806239738,
585
+ "train_speed(iter/s)": 0.05525
586
+ },
587
+ {
588
+ "epoch": 0.2728380024360536,
589
+ "grad_norm": 0.4341810941696167,
590
+ "learning_rate": 8.707800155949217e-05,
591
+ "loss": 0.6553579330444336,
592
+ "memory(GiB)": 383.55,
593
+ "step": 280,
594
+ "token_acc": 0.797032640949555,
595
+ "train_speed(iter/s)": 0.055271
596
+ },
597
+ {
598
+ "epoch": 0.2777101096224117,
599
+ "grad_norm": 0.37805306911468506,
600
+ "learning_rate": 8.653222484592458e-05,
601
+ "loss": 0.6515018463134765,
602
+ "memory(GiB)": 383.55,
603
+ "step": 285,
604
+ "token_acc": 0.794751477233229,
605
+ "train_speed(iter/s)": 0.05524
606
+ },
607
+ {
608
+ "epoch": 0.28258221680876977,
609
+ "grad_norm": 0.38902854919433594,
610
+ "learning_rate": 8.597694671162921e-05,
611
+ "loss": 0.592349624633789,
612
+ "memory(GiB)": 383.55,
613
+ "step": 290,
614
+ "token_acc": 0.815828677839851,
615
+ "train_speed(iter/s)": 0.05519
616
+ },
617
+ {
618
+ "epoch": 0.2874543239951279,
619
+ "grad_norm": 0.3007030487060547,
620
+ "learning_rate": 8.541231157516247e-05,
621
+ "loss": 0.6616343021392822,
622
+ "memory(GiB)": 383.55,
623
+ "step": 295,
624
+ "token_acc": 0.7961879284400601,
625
+ "train_speed(iter/s)": 0.05519
626
+ },
627
+ {
628
+ "epoch": 0.292326431181486,
629
+ "grad_norm": 0.43431806564331055,
630
+ "learning_rate": 8.483846628868055e-05,
631
+ "loss": 0.6408910751342773,
632
+ "memory(GiB)": 383.55,
633
+ "step": 300,
634
+ "token_acc": 0.7999295526593871,
635
+ "train_speed(iter/s)": 0.055286
636
+ },
637
+ {
638
+ "epoch": 0.292326431181486,
639
+ "eval_loss": 0.6525390148162842,
640
+ "eval_runtime": 6.2823,
641
+ "eval_samples_per_second": 0.637,
642
+ "eval_steps_per_second": 0.637,
643
+ "step": 300
644
+ },
645
+ {
646
+ "epoch": 0.2971985383678441,
647
+ "grad_norm": 0.4932222068309784,
648
+ "learning_rate": 8.425556009974566e-05,
649
+ "loss": 0.6335715770721435,
650
+ "memory(GiB)": 383.55,
651
+ "step": 305,
652
+ "token_acc": 0.8036400066789113,
653
+ "train_speed(iter/s)": 0.054583
654
+ },
655
+ {
656
+ "epoch": 0.3020706455542022,
657
+ "grad_norm": 0.27842646837234497,
658
+ "learning_rate": 8.366374461250916e-05,
659
+ "loss": 0.570946216583252,
660
+ "memory(GiB)": 383.55,
661
+ "step": 310,
662
+ "token_acc": 0.8238350381555447,
663
+ "train_speed(iter/s)": 0.054659
664
+ },
665
+ {
666
+ "epoch": 0.30694275274056027,
667
+ "grad_norm": 0.7104659080505371,
668
+ "learning_rate": 8.306317374828194e-05,
669
+ "loss": 0.566010570526123,
670
+ "memory(GiB)": 383.55,
671
+ "step": 315,
672
+ "token_acc": 0.8189669219488349,
673
+ "train_speed(iter/s)": 0.054662
674
+ },
675
+ {
676
+ "epoch": 0.3118148599269184,
677
+ "grad_norm": 0.8684744834899902,
678
+ "learning_rate": 8.245400370550198e-05,
679
+ "loss": 0.677960729598999,
680
+ "memory(GiB)": 383.55,
681
+ "step": 320,
682
+ "token_acc": 0.7772163527790538,
683
+ "train_speed(iter/s)": 0.054794
684
+ },
685
+ {
686
+ "epoch": 0.3166869671132765,
687
+ "grad_norm": 0.3846539258956909,
688
+ "learning_rate": 8.183639291910987e-05,
689
+ "loss": 0.5622167587280273,
690
+ "memory(GiB)": 383.55,
691
+ "step": 325,
692
+ "token_acc": 0.830480089318943,
693
+ "train_speed(iter/s)": 0.054821
694
+ },
695
+ {
696
+ "epoch": 0.3215590742996346,
697
+ "grad_norm": 0.34010785818099976,
698
+ "learning_rate": 8.121050201934235e-05,
699
+ "loss": 0.5877705574035644,
700
+ "memory(GiB)": 383.55,
701
+ "step": 330,
702
+ "token_acc": 0.8287964389659305,
703
+ "train_speed(iter/s)": 0.054899
704
+ },
705
+ {
706
+ "epoch": 0.3264311814859927,
707
+ "grad_norm": 0.3751339912414551,
708
+ "learning_rate": 8.057649378995526e-05,
709
+ "loss": 0.5179604053497314,
710
+ "memory(GiB)": 383.55,
711
+ "step": 335,
712
+ "token_acc": 0.8402439024390244,
713
+ "train_speed(iter/s)": 0.054839
714
+ },
715
+ {
716
+ "epoch": 0.3313032886723508,
717
+ "grad_norm": 0.3137739896774292,
718
+ "learning_rate": 7.993453312588607e-05,
719
+ "loss": 0.5339327335357666,
720
+ "memory(GiB)": 383.55,
721
+ "step": 340,
722
+ "token_acc": 0.8365357839042049,
723
+ "train_speed(iter/s)": 0.054764
724
+ },
725
+ {
726
+ "epoch": 0.33617539585870887,
727
+ "grad_norm": 0.5746834874153137,
728
+ "learning_rate": 7.928478699036755e-05,
729
+ "loss": 0.6346034049987793,
730
+ "memory(GiB)": 383.55,
731
+ "step": 345,
732
+ "token_acc": 0.7972016183412003,
733
+ "train_speed(iter/s)": 0.054713
734
+ },
735
+ {
736
+ "epoch": 0.341047503045067,
737
+ "grad_norm": 0.3580325245857239,
738
+ "learning_rate": 7.862742437150336e-05,
739
+ "loss": 0.6608481884002686,
740
+ "memory(GiB)": 383.55,
741
+ "step": 350,
742
+ "token_acc": 0.7929736511919699,
743
+ "train_speed(iter/s)": 0.054762
744
+ },
745
+ {
746
+ "epoch": 0.3459196102314251,
747
+ "grad_norm": 0.4622519612312317,
748
+ "learning_rate": 7.796261623831713e-05,
749
+ "loss": 0.562419080734253,
750
+ "memory(GiB)": 383.55,
751
+ "step": 355,
752
+ "token_acc": 0.8190336211647988,
753
+ "train_speed(iter/s)": 0.054396
754
+ },
755
+ {
756
+ "epoch": 0.3507917174177832,
757
+ "grad_norm": 0.5616739392280579,
758
+ "learning_rate": 7.729053549628622e-05,
759
+ "loss": 0.5495719909667969,
760
+ "memory(GiB)": 383.55,
761
+ "step": 360,
762
+ "token_acc": 0.8339377743844245,
763
+ "train_speed(iter/s)": 0.054442
764
+ },
765
+ {
766
+ "epoch": 0.3556638246041413,
767
+ "grad_norm": 0.7364129424095154,
768
+ "learning_rate": 7.661135694237198e-05,
769
+ "loss": 0.4548810958862305,
770
+ "memory(GiB)": 387.42,
771
+ "step": 365,
772
+ "token_acc": 0.8370827285921626,
773
+ "train_speed(iter/s)": 0.054383
774
+ },
775
+ {
776
+ "epoch": 0.36053593179049936,
777
+ "grad_norm": 0.44831952452659607,
778
+ "learning_rate": 7.592525721955786e-05,
779
+ "loss": 0.5882142066955567,
780
+ "memory(GiB)": 387.42,
781
+ "step": 370,
782
+ "token_acc": 0.8161894662424886,
783
+ "train_speed(iter/s)": 0.054337
784
+ },
785
+ {
786
+ "epoch": 0.3654080389768575,
787
+ "grad_norm": 0.37750759720802307,
788
+ "learning_rate": 7.523241477090763e-05,
789
+ "loss": 0.6884512901306152,
790
+ "memory(GiB)": 387.42,
791
+ "step": 375,
792
+ "token_acc": 0.7952127659574468,
793
+ "train_speed(iter/s)": 0.054385
794
+ },
795
+ {
796
+ "epoch": 0.3702801461632156,
797
+ "grad_norm": 0.5074845552444458,
798
+ "learning_rate": 7.45330097931553e-05,
799
+ "loss": 0.5458427906036377,
800
+ "memory(GiB)": 387.42,
801
+ "step": 380,
802
+ "token_acc": 0.8217197924388436,
803
+ "train_speed(iter/s)": 0.054354
804
+ },
805
+ {
806
+ "epoch": 0.3751522533495737,
807
+ "grad_norm": 0.6083484292030334,
808
+ "learning_rate": 7.382722418983892e-05,
809
+ "loss": 0.5680232048034668,
810
+ "memory(GiB)": 387.42,
811
+ "step": 385,
812
+ "token_acc": 0.8248374239563667,
813
+ "train_speed(iter/s)": 0.054329
814
+ },
815
+ {
816
+ "epoch": 0.3800243605359318,
817
+ "grad_norm": 0.39138278365135193,
818
+ "learning_rate": 7.311524152399054e-05,
819
+ "loss": 0.7077183246612548,
820
+ "memory(GiB)": 387.42,
821
+ "step": 390,
822
+ "token_acc": 0.7912014292094686,
823
+ "train_speed(iter/s)": 0.054329
824
+ },
825
+ {
826
+ "epoch": 0.3848964677222899,
827
+ "grad_norm": 0.4244479238986969,
828
+ "learning_rate": 7.239724697039457e-05,
829
+ "loss": 0.6999778270721435,
830
+ "memory(GiB)": 387.42,
831
+ "step": 395,
832
+ "token_acc": 0.7828650029475339,
833
+ "train_speed(iter/s)": 0.054413
834
+ },
835
+ {
836
+ "epoch": 0.38976857490864797,
837
+ "grad_norm": 0.3658107817173004,
838
+ "learning_rate": 7.167342726742685e-05,
839
+ "loss": 0.5321448802947998,
840
+ "memory(GiB)": 387.42,
841
+ "step": 400,
842
+ "token_acc": 0.8257604205782951,
843
+ "train_speed(iter/s)": 0.054414
844
+ },
845
+ {
846
+ "epoch": 0.38976857490864797,
847
+ "eval_loss": 0.647614598274231,
848
+ "eval_runtime": 6.1299,
849
+ "eval_samples_per_second": 0.653,
850
+ "eval_steps_per_second": 0.653,
851
+ "step": 400
852
+ },
853
+ {
854
+ "epoch": 0.3946406820950061,
855
+ "grad_norm": 0.4579378068447113,
856
+ "learning_rate": 7.094397066848716e-05,
857
+ "loss": 0.6339591979980469,
858
+ "memory(GiB)": 387.42,
859
+ "step": 405,
860
+ "token_acc": 0.7953757225433526,
861
+ "train_speed(iter/s)": 0.054198
862
+ },
863
+ {
864
+ "epoch": 0.3995127892813642,
865
+ "grad_norm": 0.41108816862106323,
866
+ "learning_rate": 7.020906689303766e-05,
867
+ "loss": 0.6498037338256836,
868
+ "memory(GiB)": 387.42,
869
+ "step": 410,
870
+ "token_acc": 0.8013311819281969,
871
+ "train_speed(iter/s)": 0.054274
872
+ },
873
+ {
874
+ "epoch": 0.4043848964677223,
875
+ "grad_norm": 0.3730790615081787,
876
+ "learning_rate": 6.946890707726004e-05,
877
+ "loss": 0.6224189281463623,
878
+ "memory(GiB)": 387.42,
879
+ "step": 415,
880
+ "token_acc": 0.8109767441860465,
881
+ "train_speed(iter/s)": 0.054342
882
+ },
883
+ {
884
+ "epoch": 0.4092570036540804,
885
+ "grad_norm": 0.41862693428993225,
886
+ "learning_rate": 6.872368372434416e-05,
887
+ "loss": 0.6285569190979003,
888
+ "memory(GiB)": 387.42,
889
+ "step": 420,
890
+ "token_acc": 0.793915399041467,
891
+ "train_speed(iter/s)": 0.054335
892
+ },
893
+ {
894
+ "epoch": 0.41412911084043846,
895
+ "grad_norm": 0.4861293435096741,
896
+ "learning_rate": 6.797359065442117e-05,
897
+ "loss": 0.5771468162536622,
898
+ "memory(GiB)": 387.42,
899
+ "step": 425,
900
+ "token_acc": 0.8196579720158922,
901
+ "train_speed(iter/s)": 0.054339
902
+ },
903
+ {
904
+ "epoch": 0.4190012180267966,
905
+ "grad_norm": 0.30941805243492126,
906
+ "learning_rate": 6.721882295415425e-05,
907
+ "loss": 0.5844586372375489,
908
+ "memory(GiB)": 387.42,
909
+ "step": 430,
910
+ "token_acc": 0.814694173000362,
911
+ "train_speed(iter/s)": 0.05432
912
+ },
913
+ {
914
+ "epoch": 0.4238733252131547,
915
+ "grad_norm": 0.3820112645626068,
916
+ "learning_rate": 6.645957692599969e-05,
917
+ "loss": 0.5823289394378662,
918
+ "memory(GiB)": 387.42,
919
+ "step": 435,
920
+ "token_acc": 0.8027565654684299,
921
+ "train_speed(iter/s)": 0.054382
922
+ },
923
+ {
924
+ "epoch": 0.4287454323995128,
925
+ "grad_norm": 0.3910198509693146,
926
+ "learning_rate": 6.569605003715201e-05,
927
+ "loss": 0.561509084701538,
928
+ "memory(GiB)": 387.42,
929
+ "step": 440,
930
+ "token_acc": 0.8264751552795031,
931
+ "train_speed(iter/s)": 0.054462
932
+ },
933
+ {
934
+ "epoch": 0.4336175395858709,
935
+ "grad_norm": 0.3805302381515503,
936
+ "learning_rate": 6.492844086818599e-05,
937
+ "loss": 0.558375883102417,
938
+ "memory(GiB)": 387.42,
939
+ "step": 445,
940
+ "token_acc": 0.8262056414922657,
941
+ "train_speed(iter/s)": 0.05444
942
+ },
943
+ {
944
+ "epoch": 0.438489646772229,
945
+ "grad_norm": 0.6036235690116882,
946
+ "learning_rate": 6.41569490614092e-05,
947
+ "loss": 0.6268420696258545,
948
+ "memory(GiB)": 387.42,
949
+ "step": 450,
950
+ "token_acc": 0.8061224489795918,
951
+ "train_speed(iter/s)": 0.054446
952
+ },
953
+ {
954
+ "epoch": 0.44336175395858707,
955
+ "grad_norm": 0.4275857210159302,
956
+ "learning_rate": 6.338177526893836e-05,
957
+ "loss": 0.5441042423248291,
958
+ "memory(GiB)": 387.42,
959
+ "step": 455,
960
+ "token_acc": 0.8360881542699724,
961
+ "train_speed(iter/s)": 0.05418
962
+ },
963
+ {
964
+ "epoch": 0.4482338611449452,
965
+ "grad_norm": 0.4830683469772339,
966
+ "learning_rate": 6.260312110051312e-05,
967
+ "loss": 0.606513261795044,
968
+ "memory(GiB)": 387.42,
969
+ "step": 460,
970
+ "token_acc": 0.8049238864875023,
971
+ "train_speed(iter/s)": 0.054224
972
+ },
973
+ {
974
+ "epoch": 0.4531059683313033,
975
+ "grad_norm": 0.35629284381866455,
976
+ "learning_rate": 6.182118907106068e-05,
977
+ "loss": 0.538546371459961,
978
+ "memory(GiB)": 387.42,
979
+ "step": 465,
980
+ "token_acc": 0.8373831775700935,
981
+ "train_speed(iter/s)": 0.054204
982
+ },
983
+ {
984
+ "epoch": 0.4579780755176614,
985
+ "grad_norm": 0.46749940514564514,
986
+ "learning_rate": 6.103618254802511e-05,
987
+ "loss": 0.5923898696899415,
988
+ "memory(GiB)": 387.42,
989
+ "step": 470,
990
+ "token_acc": 0.8042936553574851,
991
+ "train_speed(iter/s)": 0.054261
992
+ },
993
+ {
994
+ "epoch": 0.4628501827040195,
995
+ "grad_norm": 0.6278035044670105,
996
+ "learning_rate": 6.024830569847477e-05,
997
+ "loss": 0.5971939086914062,
998
+ "memory(GiB)": 387.42,
999
+ "step": 475,
1000
+ "token_acc": 0.8176121372031663,
1001
+ "train_speed(iter/s)": 0.054245
1002
+ },
1003
+ {
1004
+ "epoch": 0.46772228989037756,
1005
+ "grad_norm": 0.3572694957256317,
1006
+ "learning_rate": 5.945776343600207e-05,
1007
+ "loss": 0.5843085765838623,
1008
+ "memory(GiB)": 387.42,
1009
+ "step": 480,
1010
+ "token_acc": 0.8212882953652789,
1011
+ "train_speed(iter/s)": 0.054246
1012
+ },
1013
+ {
1014
+ "epoch": 0.4725943970767357,
1015
+ "grad_norm": 0.5189170241355896,
1016
+ "learning_rate": 5.866476136742862e-05,
1017
+ "loss": 0.5234210968017579,
1018
+ "memory(GiB)": 387.42,
1019
+ "step": 485,
1020
+ "token_acc": 0.8463819691577699,
1021
+ "train_speed(iter/s)": 0.05426
1022
+ },
1023
+ {
1024
+ "epoch": 0.4774665042630938,
1025
+ "grad_norm": 0.41832658648490906,
1026
+ "learning_rate": 5.7869505739330546e-05,
1027
+ "loss": 0.6695927619934082,
1028
+ "memory(GiB)": 387.42,
1029
+ "step": 490,
1030
+ "token_acc": 0.7924812030075188,
1031
+ "train_speed(iter/s)": 0.05433
1032
+ },
1033
+ {
1034
+ "epoch": 0.4823386114494519,
1035
+ "grad_norm": 4.011805534362793,
1036
+ "learning_rate": 5.7072203384397064e-05,
1037
+ "loss": 0.5814547538757324,
1038
+ "memory(GiB)": 387.42,
1039
+ "step": 495,
1040
+ "token_acc": 0.8110627719080175,
1041
+ "train_speed(iter/s)": 0.054376
1042
+ },
1043
+ {
1044
+ "epoch": 0.48721071863581,
1045
+ "grad_norm": 0.31671130657196045,
1046
+ "learning_rate": 5.627306166763684e-05,
1047
+ "loss": 0.5855265617370605,
1048
+ "memory(GiB)": 387.42,
1049
+ "step": 500,
1050
+ "token_acc": 0.8094142629623076,
1051
+ "train_speed(iter/s)": 0.054362
1052
+ },
1053
+ {
1054
+ "epoch": 0.48721071863581,
1055
+ "eval_loss": 0.6302051544189453,
1056
+ "eval_runtime": 6.1545,
1057
+ "eval_samples_per_second": 0.65,
1058
+ "eval_steps_per_second": 0.65,
1059
+ "step": 500
1060
+ },
1061
+ {
1062
+ "epoch": 0.4920828258221681,
1063
+ "grad_norm": 0.3875284194946289,
1064
+ "learning_rate": 5.5472288432445774e-05,
1065
+ "loss": 0.59937744140625,
1066
+ "memory(GiB)": 387.42,
1067
+ "step": 505,
1068
+ "token_acc": 0.7988918837975442,
1069
+ "train_speed(iter/s)": 0.05424
1070
+ },
1071
+ {
1072
+ "epoch": 0.49695493300852617,
1073
+ "grad_norm": 0.4411413371562958,
1074
+ "learning_rate": 5.467009194655045e-05,
1075
+ "loss": 0.5820174217224121,
1076
+ "memory(GiB)": 387.42,
1077
+ "step": 510,
1078
+ "token_acc": 0.8234812510234157,
1079
+ "train_speed(iter/s)": 0.054197
1080
+ },
1081
+ {
1082
+ "epoch": 0.5018270401948843,
1083
+ "grad_norm": 0.5111451148986816,
1084
+ "learning_rate": 5.386668084784112e-05,
1085
+ "loss": 0.5154130935668946,
1086
+ "memory(GiB)": 387.42,
1087
+ "step": 515,
1088
+ "token_acc": 0.8397686998694274,
1089
+ "train_speed(iter/s)": 0.05426
1090
+ },
1091
+ {
1092
+ "epoch": 0.5066991473812423,
1093
+ "grad_norm": 0.29832109808921814,
1094
+ "learning_rate": 5.306226409010855e-05,
1095
+ "loss": 0.5672587394714356,
1096
+ "memory(GiB)": 387.42,
1097
+ "step": 520,
1098
+ "token_acc": 0.8263521756811713,
1099
+ "train_speed(iter/s)": 0.054274
1100
+ },
1101
+ {
1102
+ "epoch": 0.5115712545676004,
1103
+ "grad_norm": 0.42139527201652527,
1104
+ "learning_rate": 5.22570508886986e-05,
1105
+ "loss": 0.5327470302581787,
1106
+ "memory(GiB)": 387.42,
1107
+ "step": 525,
1108
+ "token_acc": 0.8310478199718706,
1109
+ "train_speed(iter/s)": 0.054332
1110
+ },
1111
+ {
1112
+ "epoch": 0.5164433617539586,
1113
+ "grad_norm": 0.34750285744667053,
1114
+ "learning_rate": 5.145125066609877e-05,
1115
+ "loss": 0.61210618019104,
1116
+ "memory(GiB)": 387.42,
1117
+ "step": 530,
1118
+ "token_acc": 0.8104413702239789,
1119
+ "train_speed(iter/s)": 0.054325
1120
+ },
1121
+ {
1122
+ "epoch": 0.5213154689403167,
1123
+ "grad_norm": 0.5557289123535156,
1124
+ "learning_rate": 5.0645072997471e-05,
1125
+ "loss": 0.5486731052398681,
1126
+ "memory(GiB)": 387.42,
1127
+ "step": 535,
1128
+ "token_acc": 0.8223992502343018,
1129
+ "train_speed(iter/s)": 0.054295
1130
+ },
1131
+ {
1132
+ "epoch": 0.5261875761266748,
1133
+ "grad_norm": 1.370209813117981,
1134
+ "learning_rate": 4.983872755614461e-05,
1135
+ "loss": 0.6499679565429688,
1136
+ "memory(GiB)": 387.42,
1137
+ "step": 540,
1138
+ "token_acc": 0.7975866095757104,
1139
+ "train_speed(iter/s)": 0.054348
1140
+ },
1141
+ {
1142
+ "epoch": 0.5310596833130329,
1143
+ "grad_norm": 0.4371365010738373,
1144
+ "learning_rate": 4.9032424059083774e-05,
1145
+ "loss": 0.43409147262573244,
1146
+ "memory(GiB)": 387.42,
1147
+ "step": 545,
1148
+ "token_acc": 0.8684942391736193,
1149
+ "train_speed(iter/s)": 0.054321
1150
+ },
1151
+ {
1152
+ "epoch": 0.535931790499391,
1153
+ "grad_norm": 0.4735865890979767,
1154
+ "learning_rate": 4.8226372212343726e-05,
1155
+ "loss": 0.5776564598083496,
1156
+ "memory(GiB)": 387.42,
1157
+ "step": 550,
1158
+ "token_acc": 0.8255653883972468,
1159
+ "train_speed(iter/s)": 0.054368
1160
+ },
1161
+ {
1162
+ "epoch": 0.5408038976857491,
1163
+ "grad_norm": 0.6005700826644897,
1164
+ "learning_rate": 4.742078165652958e-05,
1165
+ "loss": 0.5744057178497315,
1166
+ "memory(GiB)": 387.42,
1167
+ "step": 555,
1168
+ "token_acc": 0.8105436573311368,
1169
+ "train_speed(iter/s)": 0.054325
1170
+ },
1171
+ {
1172
+ "epoch": 0.5456760048721072,
1173
+ "grad_norm": 0.4128513038158417,
1174
+ "learning_rate": 4.661586191227247e-05,
1175
+ "loss": 0.5321125030517578,
1176
+ "memory(GiB)": 387.42,
1177
+ "step": 560,
1178
+ "token_acc": 0.8245080500894454,
1179
+ "train_speed(iter/s)": 0.054305
1180
+ },
1181
+ {
1182
+ "epoch": 0.5505481120584653,
1183
+ "grad_norm": 0.4688722491264343,
1184
+ "learning_rate": 4.581182232573658e-05,
1185
+ "loss": 0.5235236167907715,
1186
+ "memory(GiB)": 387.42,
1187
+ "step": 565,
1188
+ "token_acc": 0.8205183122724352,
1189
+ "train_speed(iter/s)": 0.054352
1190
+ },
1191
+ {
1192
+ "epoch": 0.5554202192448234,
1193
+ "grad_norm": 0.4604549705982208,
1194
+ "learning_rate": 4.500887201417187e-05,
1195
+ "loss": 0.6571295261383057,
1196
+ "memory(GiB)": 387.42,
1197
+ "step": 570,
1198
+ "token_acc": 0.8019607843137255,
1199
+ "train_speed(iter/s)": 0.054361
1200
+ },
1201
+ {
1202
+ "epoch": 0.5602923264311814,
1203
+ "grad_norm": 0.48336780071258545,
1204
+ "learning_rate": 4.4207219811526056e-05,
1205
+ "loss": 0.5963138580322266,
1206
+ "memory(GiB)": 387.42,
1207
+ "step": 575,
1208
+ "token_acc": 0.8077416987708678,
1209
+ "train_speed(iter/s)": 0.054409
1210
+ },
1211
+ {
1212
+ "epoch": 0.5651644336175395,
1213
+ "grad_norm": 0.5700681805610657,
1214
+ "learning_rate": 4.3407074214130446e-05,
1215
+ "loss": 0.6309503555297852,
1216
+ "memory(GiB)": 387.42,
1217
+ "step": 580,
1218
+ "token_acc": 0.7960770454143842,
1219
+ "train_speed(iter/s)": 0.054412
1220
+ },
1221
+ {
1222
+ "epoch": 0.5700365408038977,
1223
+ "grad_norm": 0.40493443608283997,
1224
+ "learning_rate": 4.2608643326473496e-05,
1225
+ "loss": 0.5265829563140869,
1226
+ "memory(GiB)": 387.42,
1227
+ "step": 585,
1228
+ "token_acc": 0.8364477970169724,
1229
+ "train_speed(iter/s)": 0.054419
1230
+ },
1231
+ {
1232
+ "epoch": 0.5749086479902558,
1233
+ "grad_norm": 0.42441654205322266,
1234
+ "learning_rate": 4.181213480707637e-05,
1235
+ "loss": 0.5463868618011475,
1236
+ "memory(GiB)": 387.42,
1237
+ "step": 590,
1238
+ "token_acc": 0.8250831178426302,
1239
+ "train_speed(iter/s)": 0.054415
1240
+ },
1241
+ {
1242
+ "epoch": 0.5797807551766139,
1243
+ "grad_norm": 0.5273870825767517,
1244
+ "learning_rate": 4.1017755814484374e-05,
1245
+ "loss": 0.6219929218292236,
1246
+ "memory(GiB)": 387.42,
1247
+ "step": 595,
1248
+ "token_acc": 0.8101965601965602,
1249
+ "train_speed(iter/s)": 0.054492
1250
+ },
1251
+ {
1252
+ "epoch": 0.584652862362972,
1253
+ "grad_norm": 0.5027340650558472,
1254
+ "learning_rate": 4.0225712953388494e-05,
1255
+ "loss": 0.47921223640441896,
1256
+ "memory(GiB)": 387.42,
1257
+ "step": 600,
1258
+ "token_acc": 0.8507462686567164,
1259
+ "train_speed(iter/s)": 0.054456
1260
+ },
1261
+ {
1262
+ "epoch": 0.584652862362972,
1263
+ "eval_loss": 0.5931864976882935,
1264
+ "eval_runtime": 6.2202,
1265
+ "eval_samples_per_second": 0.643,
1266
+ "eval_steps_per_second": 0.643,
1267
+ "step": 600
1268
+ },
1269
+ {
1270
+ "epoch": 0.5895249695493301,
1271
+ "grad_norm": 0.7974056005477905,
1272
+ "learning_rate": 3.943621222089102e-05,
1273
+ "loss": 0.5052922248840332,
1274
+ "memory(GiB)": 387.42,
1275
+ "step": 605,
1276
+ "token_acc": 0.8312937062937062,
1277
+ "train_speed(iter/s)": 0.054258
1278
+ },
1279
+ {
1280
+ "epoch": 0.5943970767356882,
1281
+ "grad_norm": 0.38420093059539795,
1282
+ "learning_rate": 3.864945895292908e-05,
1283
+ "loss": 0.5411774635314941,
1284
+ "memory(GiB)": 387.42,
1285
+ "step": 610,
1286
+ "token_acc": 0.8309124767225325,
1287
+ "train_speed(iter/s)": 0.054201
1288
+ },
1289
+ {
1290
+ "epoch": 0.5992691839220463,
1291
+ "grad_norm": 0.9411633014678955,
1292
+ "learning_rate": 3.786565777087022e-05,
1293
+ "loss": 0.6929959297180176,
1294
+ "memory(GiB)": 387.42,
1295
+ "step": 615,
1296
+ "token_acc": 0.7847842261904762,
1297
+ "train_speed(iter/s)": 0.05425
1298
+ },
1299
+ {
1300
+ "epoch": 0.6041412911084044,
1301
+ "grad_norm": 0.35226595401763916,
1302
+ "learning_rate": 3.708501252829386e-05,
1303
+ "loss": 0.5966301918029785,
1304
+ "memory(GiB)": 387.42,
1305
+ "step": 620,
1306
+ "token_acc": 0.8161076443057722,
1307
+ "train_speed(iter/s)": 0.054233
1308
+ },
1309
+ {
1310
+ "epoch": 0.6090133982947625,
1311
+ "grad_norm": 0.4208815097808838,
1312
+ "learning_rate": 3.6307726257972255e-05,
1313
+ "loss": 0.5394818782806396,
1314
+ "memory(GiB)": 387.42,
1315
+ "step": 625,
1316
+ "token_acc": 0.8257628294036061,
1317
+ "train_speed(iter/s)": 0.054209
1318
+ },
1319
+ {
1320
+ "epoch": 0.6138855054811205,
1321
+ "grad_norm": 0.445925772190094,
1322
+ "learning_rate": 3.553400111906523e-05,
1323
+ "loss": 0.6164620399475098,
1324
+ "memory(GiB)": 387.42,
1325
+ "step": 630,
1326
+ "token_acc": 0.8090881366270204,
1327
+ "train_speed(iter/s)": 0.054222
1328
+ },
1329
+ {
1330
+ "epoch": 0.6187576126674786,
1331
+ "grad_norm": 0.5922476649284363,
1332
+ "learning_rate": 3.476403834454183e-05,
1333
+ "loss": 0.5115623474121094,
1334
+ "memory(GiB)": 387.42,
1335
+ "step": 635,
1336
+ "token_acc": 0.8346325167037862,
1337
+ "train_speed(iter/s)": 0.054244
1338
+ },
1339
+ {
1340
+ "epoch": 0.6236297198538368,
1341
+ "grad_norm": 0.5026776790618896,
1342
+ "learning_rate": 3.399803818884311e-05,
1343
+ "loss": 0.5328683853149414,
1344
+ "memory(GiB)": 387.42,
1345
+ "step": 640,
1346
+ "token_acc": 0.8462420173571311,
1347
+ "train_speed(iter/s)": 0.054264
1348
+ },
1349
+ {
1350
+ "epoch": 0.6285018270401949,
1351
+ "grad_norm": 0.45468801259994507,
1352
+ "learning_rate": 3.323619987579914e-05,
1353
+ "loss": 0.6177504062652588,
1354
+ "memory(GiB)": 387.42,
1355
+ "step": 645,
1356
+ "token_acc": 0.80891932520461,
1357
+ "train_speed(iter/s)": 0.054261
1358
+ },
1359
+ {
1360
+ "epoch": 0.633373934226553,
1361
+ "grad_norm": 0.6319808959960938,
1362
+ "learning_rate": 3.247872154681439e-05,
1363
+ "loss": 0.5958673000335694,
1364
+ "memory(GiB)": 387.42,
1365
+ "step": 650,
1366
+ "token_acc": 0.8096597145993414,
1367
+ "train_speed(iter/s)": 0.054221
1368
+ },
1369
+ {
1370
+ "epoch": 0.6382460414129111,
1371
+ "grad_norm": 0.4812871217727661,
1372
+ "learning_rate": 3.172580020933442e-05,
1373
+ "loss": 0.5768674850463867,
1374
+ "memory(GiB)": 387.42,
1375
+ "step": 655,
1376
+ "token_acc": 0.8165027102991367,
1377
+ "train_speed(iter/s)": 0.054185
1378
+ },
1379
+ {
1380
+ "epoch": 0.6431181485992692,
1381
+ "grad_norm": 0.9395345449447632,
1382
+ "learning_rate": 3.097763168560741e-05,
1383
+ "loss": 0.674397611618042,
1384
+ "memory(GiB)": 387.42,
1385
+ "step": 660,
1386
+ "token_acc": 0.7806563039723662,
1387
+ "train_speed(iter/s)": 0.054211
1388
+ },
1389
+ {
1390
+ "epoch": 0.6479902557856273,
1391
+ "grad_norm": 0.5097836852073669,
1392
+ "learning_rate": 3.0234410561754257e-05,
1393
+ "loss": 0.5154216766357422,
1394
+ "memory(GiB)": 387.42,
1395
+ "step": 665,
1396
+ "token_acc": 0.8327868852459016,
1397
+ "train_speed(iter/s)": 0.054197
1398
+ },
1399
+ {
1400
+ "epoch": 0.6528623629719854,
1401
+ "grad_norm": 0.3545515239238739,
1402
+ "learning_rate": 2.949633013715982e-05,
1403
+ "loss": 0.5994223117828369,
1404
+ "memory(GiB)": 387.42,
1405
+ "step": 670,
1406
+ "token_acc": 0.8076275080410477,
1407
+ "train_speed(iter/s)": 0.054247
1408
+ },
1409
+ {
1410
+ "epoch": 0.6577344701583435,
1411
+ "grad_norm": 0.9892140030860901,
1412
+ "learning_rate": 2.8763582374199126e-05,
1413
+ "loss": 0.5891304969787597,
1414
+ "memory(GiB)": 387.42,
1415
+ "step": 675,
1416
+ "token_acc": 0.8036573628488932,
1417
+ "train_speed(iter/s)": 0.054243
1418
+ },
1419
+ {
1420
+ "epoch": 0.6626065773447016,
1421
+ "grad_norm": 0.5605654716491699,
1422
+ "learning_rate": 2.8036357848311012e-05,
1423
+ "loss": 0.5478427410125732,
1424
+ "memory(GiB)": 387.42,
1425
+ "step": 680,
1426
+ "token_acc": 0.8287547623821937,
1427
+ "train_speed(iter/s)": 0.054281
1428
+ },
1429
+ {
1430
+ "epoch": 0.6674786845310596,
1431
+ "grad_norm": 0.4100501239299774,
1432
+ "learning_rate": 2.7314845698432805e-05,
1433
+ "loss": 0.6083401203155517,
1434
+ "memory(GiB)": 387.42,
1435
+ "step": 685,
1436
+ "token_acc": 0.7989271180170181,
1437
+ "train_speed(iter/s)": 0.054288
1438
+ },
1439
+ {
1440
+ "epoch": 0.6723507917174177,
1441
+ "grad_norm": 0.4639231562614441,
1442
+ "learning_rate": 2.659923357780828e-05,
1443
+ "loss": 0.5717390060424805,
1444
+ "memory(GiB)": 387.42,
1445
+ "step": 690,
1446
+ "token_acc": 0.8201791448369106,
1447
+ "train_speed(iter/s)": 0.054301
1448
+ },
1449
+ {
1450
+ "epoch": 0.6772228989037758,
1451
+ "grad_norm": 0.30558013916015625,
1452
+ "learning_rate": 2.5889707605182347e-05,
1453
+ "loss": 0.4964598178863525,
1454
+ "memory(GiB)": 387.42,
1455
+ "step": 695,
1456
+ "token_acc": 0.8518634024637455,
1457
+ "train_speed(iter/s)": 0.054314
1458
+ },
1459
+ {
1460
+ "epoch": 0.682095006090134,
1461
+ "grad_norm": 0.490887314081192,
1462
+ "learning_rate": 2.518645231639457e-05,
1463
+ "loss": 0.6779924392700195,
1464
+ "memory(GiB)": 387.42,
1465
+ "step": 700,
1466
+ "token_acc": 0.7798953662182362,
1467
+ "train_speed(iter/s)": 0.054375
1468
+ },
1469
+ {
1470
+ "epoch": 0.682095006090134,
1471
+ "eval_loss": 0.587890625,
1472
+ "eval_runtime": 6.016,
1473
+ "eval_samples_per_second": 0.665,
1474
+ "eval_steps_per_second": 0.665,
1475
+ "step": 700
1476
+ },
1477
+ {
1478
+ "epoch": 0.6869671132764921,
1479
+ "grad_norm": 0.9540379047393799,
1480
+ "learning_rate": 2.4489650616384507e-05,
1481
+ "loss": 0.5919107437133789,
1482
+ "memory(GiB)": 387.42,
1483
+ "step": 705,
1484
+ "token_acc": 0.8063427800269906,
1485
+ "train_speed(iter/s)": 0.054286
1486
+ },
1487
+ {
1488
+ "epoch": 0.6918392204628502,
1489
+ "grad_norm": 0.4385371208190918,
1490
+ "learning_rate": 2.3799483731621237e-05,
1491
+ "loss": 0.5554671287536621,
1492
+ "memory(GiB)": 387.42,
1493
+ "step": 710,
1494
+ "token_acc": 0.8227891742802965,
1495
+ "train_speed(iter/s)": 0.054309
1496
+ },
1497
+ {
1498
+ "epoch": 0.6967113276492083,
1499
+ "grad_norm": 0.37225764989852905,
1500
+ "learning_rate": 2.311613116296929e-05,
1501
+ "loss": 0.5223379611968995,
1502
+ "memory(GiB)": 387.42,
1503
+ "step": 715,
1504
+ "token_acc": 0.8422697368421053,
1505
+ "train_speed(iter/s)": 0.054303
1506
+ },
1507
+ {
1508
+ "epoch": 0.7015834348355664,
1509
+ "grad_norm": 0.6227976083755493,
1510
+ "learning_rate": 2.2439770639003627e-05,
1511
+ "loss": 0.5609029769897461,
1512
+ "memory(GiB)": 387.42,
1513
+ "step": 720,
1514
+ "token_acc": 0.8244803695150116,
1515
+ "train_speed(iter/s)": 0.054309
1516
+ },
1517
+ {
1518
+ "epoch": 0.7064555420219245,
1519
+ "grad_norm": 0.4218509793281555,
1520
+ "learning_rate": 2.177057806978522e-05,
1521
+ "loss": 0.5789398193359375,
1522
+ "memory(GiB)": 387.42,
1523
+ "step": 725,
1524
+ "token_acc": 0.8195275590551181,
1525
+ "train_speed(iter/s)": 0.054317
1526
+ },
1527
+ {
1528
+ "epoch": 0.7113276492082826,
1529
+ "grad_norm": 0.5081908106803894,
1530
+ "learning_rate": 2.110872750110996e-05,
1531
+ "loss": 0.49318413734436034,
1532
+ "memory(GiB)": 387.42,
1533
+ "step": 730,
1534
+ "token_acc": 0.8306063522617901,
1535
+ "train_speed(iter/s)": 0.05436
1536
+ },
1537
+ {
1538
+ "epoch": 0.7161997563946407,
1539
+ "grad_norm": 0.6738778352737427,
1540
+ "learning_rate": 2.045439106924217e-05,
1541
+ "loss": 0.55146803855896,
1542
+ "memory(GiB)": 387.42,
1543
+ "step": 735,
1544
+ "token_acc": 0.8200392927308447,
1545
+ "train_speed(iter/s)": 0.054367
1546
+ },
1547
+ {
1548
+ "epoch": 0.7210718635809987,
1549
+ "grad_norm": 0.43147921562194824,
1550
+ "learning_rate": 1.980773895614481e-05,
1551
+ "loss": 0.574643898010254,
1552
+ "memory(GiB)": 387.42,
1553
+ "step": 740,
1554
+ "token_acc": 0.8172221384406575,
1555
+ "train_speed(iter/s)": 0.054386
1556
+ },
1557
+ {
1558
+ "epoch": 0.7259439707673568,
1559
+ "grad_norm": 0.5750350952148438,
1560
+ "learning_rate": 1.9168939345218095e-05,
1561
+ "loss": 0.5682173728942871,
1562
+ "memory(GiB)": 387.42,
1563
+ "step": 745,
1564
+ "token_acc": 0.8214421252371916,
1565
+ "train_speed(iter/s)": 0.054395
1566
+ },
1567
+ {
1568
+ "epoch": 0.730816077953715,
1569
+ "grad_norm": 0.461907297372818,
1570
+ "learning_rate": 1.8538158377557702e-05,
1571
+ "loss": 0.5272111415863037,
1572
+ "memory(GiB)": 387.42,
1573
+ "step": 750,
1574
+ "token_acc": 0.8257032542746828,
1575
+ "train_speed(iter/s)": 0.054421
1576
+ },
1577
+ {
1578
+ "epoch": 0.7356881851400731,
1579
+ "grad_norm": 0.794235348701477,
1580
+ "learning_rate": 1.791556010874434e-05,
1581
+ "loss": 0.6292970180511475,
1582
+ "memory(GiB)": 387.42,
1583
+ "step": 755,
1584
+ "token_acc": 0.810012836970475,
1585
+ "train_speed(iter/s)": 0.054353
1586
+ },
1587
+ {
1588
+ "epoch": 0.7405602923264312,
1589
+ "grad_norm": 0.6189777851104736,
1590
+ "learning_rate": 1.7301306466175533e-05,
1591
+ "loss": 0.5557656288146973,
1592
+ "memory(GiB)": 387.42,
1593
+ "step": 760,
1594
+ "token_acc": 0.8259242957746479,
1595
+ "train_speed(iter/s)": 0.054349
1596
+ },
1597
+ {
1598
+ "epoch": 0.7454323995127893,
1599
+ "grad_norm": 0.4845249056816101,
1600
+ "learning_rate": 1.6695557206951144e-05,
1601
+ "loss": 0.49696760177612304,
1602
+ "memory(GiB)": 389.68,
1603
+ "step": 765,
1604
+ "token_acc": 0.8422638261243813,
1605
+ "train_speed(iter/s)": 0.054323
1606
+ },
1607
+ {
1608
+ "epoch": 0.7503045066991474,
1609
+ "grad_norm": 0.4710843563079834,
1610
+ "learning_rate": 1.6098469876323093e-05,
1611
+ "loss": 0.47034273147583006,
1612
+ "memory(GiB)": 389.68,
1613
+ "step": 770,
1614
+ "token_acc": 0.8487571701720842,
1615
+ "train_speed(iter/s)": 0.05434
1616
+ },
1617
+ {
1618
+ "epoch": 0.7551766138855055,
1619
+ "grad_norm": 0.45380252599716187,
1620
+ "learning_rate": 1.551019976672058e-05,
1621
+ "loss": 0.5777853488922119,
1622
+ "memory(GiB)": 389.68,
1623
+ "step": 775,
1624
+ "token_acc": 0.8110020910406949,
1625
+ "train_speed(iter/s)": 0.054377
1626
+ },
1627
+ {
1628
+ "epoch": 0.7600487210718636,
1629
+ "grad_norm": 0.5304797291755676,
1630
+ "learning_rate": 1.4930899877361015e-05,
1631
+ "loss": 0.5180749416351318,
1632
+ "memory(GiB)": 389.68,
1633
+ "step": 780,
1634
+ "token_acc": 0.8334659769200159,
1635
+ "train_speed(iter/s)": 0.05443
1636
+ },
1637
+ {
1638
+ "epoch": 0.7649208282582217,
1639
+ "grad_norm": 0.447553426027298,
1640
+ "learning_rate": 1.4360720874457607e-05,
1641
+ "loss": 0.5336573123931885,
1642
+ "memory(GiB)": 389.68,
1643
+ "step": 785,
1644
+ "token_acc": 0.8346641615782058,
1645
+ "train_speed(iter/s)": 0.054438
1646
+ },
1647
+ {
1648
+ "epoch": 0.7697929354445798,
1649
+ "grad_norm": 0.5468970537185669,
1650
+ "learning_rate": 1.3799811052033467e-05,
1651
+ "loss": 0.6092133522033691,
1652
+ "memory(GiB)": 389.68,
1653
+ "step": 790,
1654
+ "token_acc": 0.7997620261771206,
1655
+ "train_speed(iter/s)": 0.054456
1656
+ },
1657
+ {
1658
+ "epoch": 0.7746650426309378,
1659
+ "grad_norm": 0.6424246430397034,
1660
+ "learning_rate": 1.3248316293352946e-05,
1661
+ "loss": 0.6084504127502441,
1662
+ "memory(GiB)": 389.68,
1663
+ "step": 795,
1664
+ "token_acc": 0.8091853471842537,
1665
+ "train_speed(iter/s)": 0.05451
1666
+ },
1667
+ {
1668
+ "epoch": 0.7795371498172959,
1669
+ "grad_norm": 0.5339289903640747,
1670
+ "learning_rate": 1.2706380032979691e-05,
1671
+ "loss": 0.535353136062622,
1672
+ "memory(GiB)": 389.68,
1673
+ "step": 800,
1674
+ "token_acc": 0.8231229847996315,
1675
+ "train_speed(iter/s)": 0.054509
1676
+ },
1677
+ {
1678
+ "epoch": 0.7795371498172959,
1679
+ "eval_loss": 0.587626039981842,
1680
+ "eval_runtime": 6.1485,
1681
+ "eval_samples_per_second": 0.651,
1682
+ "eval_steps_per_second": 0.651,
1683
+ "step": 800
1684
+ },
1685
+ {
1686
+ "epoch": 0.784409257003654,
1687
+ "grad_norm": 0.47259068489074707,
1688
+ "learning_rate": 1.2174143219471878e-05,
1689
+ "loss": 0.6263217449188232,
1690
+ "memory(GiB)": 389.68,
1691
+ "step": 805,
1692
+ "token_acc": 0.7991557070953077,
1693
+ "train_speed(iter/s)": 0.054434
1694
+ },
1695
+ {
1696
+ "epoch": 0.7892813641900122,
1697
+ "grad_norm": 0.5547453761100769,
1698
+ "learning_rate": 1.1651744278723687e-05,
1699
+ "loss": 0.5090929985046386,
1700
+ "memory(GiB)": 389.68,
1701
+ "step": 810,
1702
+ "token_acc": 0.8354404976921533,
1703
+ "train_speed(iter/s)": 0.054448
1704
+ },
1705
+ {
1706
+ "epoch": 0.7941534713763703,
1707
+ "grad_norm": 0.4848991930484772,
1708
+ "learning_rate": 1.1139319077963178e-05,
1709
+ "loss": 0.5273432254791259,
1710
+ "memory(GiB)": 389.68,
1711
+ "step": 815,
1712
+ "token_acc": 0.8295368261199696,
1713
+ "train_speed(iter/s)": 0.054475
1714
+ },
1715
+ {
1716
+ "epoch": 0.7990255785627284,
1717
+ "grad_norm": 0.5590830445289612,
1718
+ "learning_rate": 1.0637000890415388e-05,
1719
+ "loss": 0.6279808044433594,
1720
+ "memory(GiB)": 389.68,
1721
+ "step": 820,
1722
+ "token_acc": 0.8061934585942937,
1723
+ "train_speed(iter/s)": 0.054494
1724
+ },
1725
+ {
1726
+ "epoch": 0.8038976857490865,
1727
+ "grad_norm": 1.119874358177185,
1728
+ "learning_rate": 1.0144920360640303e-05,
1729
+ "loss": 0.6255881309509277,
1730
+ "memory(GiB)": 389.68,
1731
+ "step": 825,
1732
+ "token_acc": 0.8063498323802012,
1733
+ "train_speed(iter/s)": 0.0545
1734
+ },
1735
+ {
1736
+ "epoch": 0.8087697929354446,
1737
+ "grad_norm": 0.4502837359905243,
1738
+ "learning_rate": 9.663205470554276e-06,
1739
+ "loss": 0.5530724048614502,
1740
+ "memory(GiB)": 389.68,
1741
+ "step": 830,
1742
+ "token_acc": 0.8286991062562066,
1743
+ "train_speed(iter/s)": 0.054498
1744
+ },
1745
+ {
1746
+ "epoch": 0.8136419001218027,
1747
+ "grad_norm": 0.47327640652656555,
1748
+ "learning_rate": 9.19198150614417e-06,
1749
+ "loss": 0.6426435470581054,
1750
+ "memory(GiB)": 389.68,
1751
+ "step": 835,
1752
+ "token_acc": 0.7995495495495496,
1753
+ "train_speed(iter/s)": 0.054482
1754
+ },
1755
+ {
1756
+ "epoch": 0.8185140073081608,
1757
+ "grad_norm": 0.45425912737846375,
1758
+ "learning_rate": 8.73137102488249e-06,
1759
+ "loss": 0.5113016128540039,
1760
+ "memory(GiB)": 389.68,
1761
+ "step": 840,
1762
+ "token_acc": 0.8368200836820083,
1763
+ "train_speed(iter/s)": 0.054528
1764
+ },
1765
+ {
1766
+ "epoch": 0.8233861144945189,
1767
+ "grad_norm": 0.5594798922538757,
1768
+ "learning_rate": 8.28149382385231e-06,
1769
+ "loss": 0.5977861881256104,
1770
+ "memory(GiB)": 389.68,
1771
+ "step": 845,
1772
+ "token_acc": 0.8159670164917541,
1773
+ "train_speed(iter/s)": 0.054545
1774
+ },
1775
+ {
1776
+ "epoch": 0.8282582216808769,
1777
+ "grad_norm": 0.38594865798950195,
1778
+ "learning_rate": 7.842466908590006e-06,
1779
+ "loss": 0.5546538829803467,
1780
+ "memory(GiB)": 389.68,
1781
+ "step": 850,
1782
+ "token_acc": 0.8362763915547025,
1783
+ "train_speed(iter/s)": 0.05454
1784
+ },
1785
+ {
1786
+ "epoch": 0.833130328867235,
1787
+ "grad_norm": 0.6128694415092468,
1788
+ "learning_rate": 7.414404462654051e-06,
1789
+ "loss": 0.5578857898712158,
1790
+ "memory(GiB)": 389.68,
1791
+ "step": 855,
1792
+ "token_acc": 0.8173973075595443,
1793
+ "train_speed(iter/s)": 0.054466
1794
+ },
1795
+ {
1796
+ "epoch": 0.8380024360535931,
1797
+ "grad_norm": 0.5973862409591675,
1798
+ "learning_rate": 6.997417817927865e-06,
1799
+ "loss": 0.6116644382476807,
1800
+ "memory(GiB)": 389.68,
1801
+ "step": 860,
1802
+ "token_acc": 0.8100558659217877,
1803
+ "train_speed(iter/s)": 0.054467
1804
+ },
1805
+ {
1806
+ "epoch": 0.8428745432399513,
1807
+ "grad_norm": 0.5695779323577881,
1808
+ "learning_rate": 6.591615425664144e-06,
1809
+ "loss": 0.6063879013061524,
1810
+ "memory(GiB)": 389.68,
1811
+ "step": 865,
1812
+ "token_acc": 0.8113871180479226,
1813
+ "train_speed(iter/s)": 0.054502
1814
+ },
1815
+ {
1816
+ "epoch": 0.8477466504263094,
1817
+ "grad_norm": 0.37414440512657166,
1818
+ "learning_rate": 6.197102828278611e-06,
1819
+ "loss": 0.5134734153747559,
1820
+ "memory(GiB)": 389.68,
1821
+ "step": 870,
1822
+ "token_acc": 0.8304152076038019,
1823
+ "train_speed(iter/s)": 0.054524
1824
+ },
1825
+ {
1826
+ "epoch": 0.8526187576126675,
1827
+ "grad_norm": 0.8222331404685974,
1828
+ "learning_rate": 5.813982631900122e-06,
1829
+ "loss": 0.5653984069824218,
1830
+ "memory(GiB)": 389.68,
1831
+ "step": 875,
1832
+ "token_acc": 0.8229976496112819,
1833
+ "train_speed(iter/s)": 0.054534
1834
+ },
1835
+ {
1836
+ "epoch": 0.8574908647990256,
1837
+ "grad_norm": 0.3609310984611511,
1838
+ "learning_rate": 5.442354479684558e-06,
1839
+ "loss": 0.49175424575805665,
1840
+ "memory(GiB)": 389.68,
1841
+ "step": 880,
1842
+ "token_acc": 0.8409646976581615,
1843
+ "train_speed(iter/s)": 0.054533
1844
+ },
1845
+ {
1846
+ "epoch": 0.8623629719853837,
1847
+ "grad_norm": 0.6293960213661194,
1848
+ "learning_rate": 5.082315025899315e-06,
1849
+ "loss": 0.604953384399414,
1850
+ "memory(GiB)": 389.68,
1851
+ "step": 885,
1852
+ "token_acc": 0.8073544433094995,
1853
+ "train_speed(iter/s)": 0.05455
1854
+ },
1855
+ {
1856
+ "epoch": 0.8672350791717418,
1857
+ "grad_norm": 0.4242098331451416,
1858
+ "learning_rate": 4.733957910785114e-06,
1859
+ "loss": 0.4986411571502686,
1860
+ "memory(GiB)": 389.68,
1861
+ "step": 890,
1862
+ "token_acc": 0.8444040036396724,
1863
+ "train_speed(iter/s)": 0.054562
1864
+ },
1865
+ {
1866
+ "epoch": 0.8721071863580999,
1867
+ "grad_norm": 0.5025205612182617,
1868
+ "learning_rate": 4.397373736201782e-06,
1869
+ "loss": 0.5355000495910645,
1870
+ "memory(GiB)": 389.68,
1871
+ "step": 895,
1872
+ "token_acc": 0.8340460526315789,
1873
+ "train_speed(iter/s)": 0.054564
1874
+ },
1875
+ {
1876
+ "epoch": 0.876979293544458,
1877
+ "grad_norm": 0.42587506771087646,
1878
+ "learning_rate": 4.072650042064174e-06,
1879
+ "loss": 0.6113440513610839,
1880
+ "memory(GiB)": 389.68,
1881
+ "step": 900,
1882
+ "token_acc": 0.8042306924765515,
1883
+ "train_speed(iter/s)": 0.054571
1884
+ },
1885
+ {
1886
+ "epoch": 0.876979293544458,
1887
+ "eval_loss": 0.5867875814437866,
1888
+ "eval_runtime": 6.1618,
1889
+ "eval_samples_per_second": 0.649,
1890
+ "eval_steps_per_second": 0.649,
1891
+ "step": 900
1892
+ },
1893
+ {
1894
+ "epoch": 0.881851400730816,
1895
+ "grad_norm": 0.6062163710594177,
1896
+ "learning_rate": 3.759871283574562e-06,
1897
+ "loss": 0.5853659629821777,
1898
+ "memory(GiB)": 389.68,
1899
+ "step": 905,
1900
+ "token_acc": 0.8163235076284995,
1901
+ "train_speed(iter/s)": 0.054495
1902
+ },
1903
+ {
1904
+ "epoch": 0.8867235079171741,
1905
+ "grad_norm": 0.5810290575027466,
1906
+ "learning_rate": 3.4591188092571893e-06,
1907
+ "loss": 0.5189132213592529,
1908
+ "memory(GiB)": 389.68,
1909
+ "step": 910,
1910
+ "token_acc": 0.848421052631579,
1911
+ "train_speed(iter/s)": 0.054517
1912
+ },
1913
+ {
1914
+ "epoch": 0.8915956151035322,
1915
+ "grad_norm": 0.5703849196434021,
1916
+ "learning_rate": 3.1704708398009486e-06,
1917
+ "loss": 0.5976828575134278,
1918
+ "memory(GiB)": 389.68,
1919
+ "step": 915,
1920
+ "token_acc": 0.808837066584842,
1921
+ "train_speed(iter/s)": 0.05451
1922
+ },
1923
+ {
1924
+ "epoch": 0.8964677222898904,
1925
+ "grad_norm": 0.5777165293693542,
1926
+ "learning_rate": 2.894002447715399e-06,
1927
+ "loss": 0.5165195465087891,
1928
+ "memory(GiB)": 389.68,
1929
+ "step": 920,
1930
+ "token_acc": 0.8424015009380863,
1931
+ "train_speed(iter/s)": 0.054567
1932
+ },
1933
+ {
1934
+ "epoch": 0.9013398294762485,
1935
+ "grad_norm": 0.48375067114830017,
1936
+ "learning_rate": 2.6297855378057623e-06,
1937
+ "loss": 0.46347522735595703,
1938
+ "memory(GiB)": 389.68,
1939
+ "step": 925,
1940
+ "token_acc": 0.8408729585200173,
1941
+ "train_speed(iter/s)": 0.054561
1942
+ },
1943
+ {
1944
+ "epoch": 0.9062119366626066,
1945
+ "grad_norm": 0.4930781126022339,
1946
+ "learning_rate": 2.3778888284716193e-06,
1947
+ "loss": 0.6031323909759522,
1948
+ "memory(GiB)": 389.68,
1949
+ "step": 930,
1950
+ "token_acc": 0.8058429701765064,
1951
+ "train_speed(iter/s)": 0.054553
1952
+ },
1953
+ {
1954
+ "epoch": 0.9110840438489647,
1955
+ "grad_norm": 0.42932575941085815,
1956
+ "learning_rate": 2.138377833834404e-06,
1957
+ "loss": 0.5199082851409912,
1958
+ "memory(GiB)": 389.68,
1959
+ "step": 935,
1960
+ "token_acc": 0.837616269903831,
1961
+ "train_speed(iter/s)": 0.054552
1962
+ },
1963
+ {
1964
+ "epoch": 0.9159561510353228,
1965
+ "grad_norm": 0.6615188717842102,
1966
+ "learning_rate": 1.9113148466983254e-06,
1967
+ "loss": 0.6138844013214111,
1968
+ "memory(GiB)": 389.68,
1969
+ "step": 940,
1970
+ "token_acc": 0.8027118644067797,
1971
+ "train_speed(iter/s)": 0.054582
1972
+ },
1973
+ {
1974
+ "epoch": 0.9208282582216809,
1975
+ "grad_norm": 0.41028302907943726,
1976
+ "learning_rate": 1.696758922348979e-06,
1977
+ "loss": 0.5526364803314209,
1978
+ "memory(GiB)": 389.68,
1979
+ "step": 945,
1980
+ "token_acc": 0.8190247252747253,
1981
+ "train_speed(iter/s)": 0.054578
1982
+ },
1983
+ {
1984
+ "epoch": 0.925700365408039,
1985
+ "grad_norm": 0.48014047741889954,
1986
+ "learning_rate": 1.4947658631941309e-06,
1987
+ "loss": 0.49515771865844727,
1988
+ "memory(GiB)": 389.68,
1989
+ "step": 950,
1990
+ "token_acc": 0.832800851970181,
1991
+ "train_speed(iter/s)": 0.054557
1992
+ },
1993
+ {
1994
+ "epoch": 0.9305724725943971,
1995
+ "grad_norm": 0.6173512935638428,
1996
+ "learning_rate": 1.3053882042503796e-06,
1997
+ "loss": 0.5243947505950928,
1998
+ "memory(GiB)": 389.68,
1999
+ "step": 955,
2000
+ "token_acc": 0.8282737560625112,
2001
+ "train_speed(iter/s)": 0.054472
2002
+ },
2003
+ {
2004
+ "epoch": 0.9354445797807551,
2005
+ "grad_norm": 0.6899262070655823,
2006
+ "learning_rate": 1.1286751994797284e-06,
2007
+ "loss": 0.636317253112793,
2008
+ "memory(GiB)": 389.68,
2009
+ "step": 960,
2010
+ "token_acc": 0.8041509433962264,
2011
+ "train_speed(iter/s)": 0.05449
2012
+ },
2013
+ {
2014
+ "epoch": 0.9403166869671132,
2015
+ "grad_norm": 0.538864016532898,
2016
+ "learning_rate": 9.646728089794167e-07,
2017
+ "loss": 0.5281119823455811,
2018
+ "memory(GiB)": 389.68,
2019
+ "step": 965,
2020
+ "token_acc": 0.828132906054984,
2021
+ "train_speed(iter/s)": 0.054472
2022
+ },
2023
+ {
2024
+ "epoch": 0.9451887941534713,
2025
+ "grad_norm": 0.7353665828704834,
2026
+ "learning_rate": 8.134236870284861e-07,
2027
+ "loss": 0.6087577819824219,
2028
+ "memory(GiB)": 389.68,
2029
+ "step": 970,
2030
+ "token_acc": 0.8098674274207082,
2031
+ "train_speed(iter/s)": 0.054485
2032
+ },
2033
+ {
2034
+ "epoch": 0.9500609013398295,
2035
+ "grad_norm": 0.7473301887512207,
2036
+ "learning_rate": 6.749671709941008e-07,
2037
+ "loss": 0.6141918182373047,
2038
+ "memory(GiB)": 389.68,
2039
+ "step": 975,
2040
+ "token_acc": 0.8016149752248118,
2041
+ "train_speed(iter/s)": 0.054518
2042
+ },
2043
+ {
2044
+ "epoch": 0.9549330085261876,
2045
+ "grad_norm": 0.6487853527069092,
2046
+ "learning_rate": 5.493392711005796e-07,
2047
+ "loss": 0.5959615707397461,
2048
+ "memory(GiB)": 389.68,
2049
+ "step": 980,
2050
+ "token_acc": 0.8156642881413524,
2051
+ "train_speed(iter/s)": 0.054561
2052
+ },
2053
+ {
2054
+ "epoch": 0.9598051157125457,
2055
+ "grad_norm": 0.678453803062439,
2056
+ "learning_rate": 4.365726610637222e-07,
2057
+ "loss": 0.5411821842193604,
2058
+ "memory(GiB)": 389.68,
2059
+ "step": 985,
2060
+ "token_acc": 0.8313556274721323,
2061
+ "train_speed(iter/s)": 0.054544
2062
+ },
2063
+ {
2064
+ "epoch": 0.9646772228989038,
2065
+ "grad_norm": 0.5119591355323792,
2066
+ "learning_rate": 3.366966695929119e-07,
2067
+ "loss": 0.49676513671875,
2068
+ "memory(GiB)": 389.68,
2069
+ "step": 990,
2070
+ "token_acc": 0.8351805505899178,
2071
+ "train_speed(iter/s)": 0.054553
2072
+ },
2073
+ {
2074
+ "epoch": 0.9695493300852619,
2075
+ "grad_norm": 0.6289726495742798,
2076
+ "learning_rate": 2.4973727276323965e-07,
2077
+ "loss": 0.60072922706604,
2078
+ "memory(GiB)": 389.68,
2079
+ "step": 995,
2080
+ "token_acc": 0.8124610591900312,
2081
+ "train_speed(iter/s)": 0.054575
2082
+ },
2083
+ {
2084
+ "epoch": 0.97442143727162,
2085
+ "grad_norm": 0.5490319132804871,
2086
+ "learning_rate": 1.7571708725953596e-07,
2087
+ "loss": 0.5364939212799072,
2088
+ "memory(GiB)": 389.68,
2089
+ "step": 1000,
2090
+ "token_acc": 0.8235892221657346,
2091
+ "train_speed(iter/s)": 0.054556
2092
+ },
2093
+ {
2094
+ "epoch": 0.97442143727162,
2095
+ "eval_loss": 0.5838146805763245,
2096
+ "eval_runtime": 6.1207,
2097
+ "eval_samples_per_second": 0.654,
2098
+ "eval_steps_per_second": 0.654,
2099
+ "step": 1000
2100
+ },
2101
+ {
2102
+ "epoch": 0.9792935444579781,
2103
+ "grad_norm": 0.4941563010215759,
2104
+ "learning_rate": 1.1465536449415393e-07,
2105
+ "loss": 0.5735920906066895,
2106
+ "memory(GiB)": 389.68,
2107
+ "step": 1005,
2108
+ "token_acc": 0.8156670746634027,
2109
+ "train_speed(iter/s)": 0.054474
2110
+ },
2111
+ {
2112
+ "epoch": 0.9841656516443362,
2113
+ "grad_norm": 0.5679388046264648,
2114
+ "learning_rate": 6.656798560001343e-08,
2115
+ "loss": 0.5337845325469971,
2116
+ "memory(GiB)": 389.68,
2117
+ "step": 1010,
2118
+ "token_acc": 0.8183527641970666,
2119
+ "train_speed(iter/s)": 0.054492
2120
+ },
2121
+ {
2122
+ "epoch": 0.9890377588306942,
2123
+ "grad_norm": 0.43481603264808655,
2124
+ "learning_rate": 3.146745730015499e-08,
2125
+ "loss": 0.5338433265686036,
2126
+ "memory(GiB)": 389.68,
2127
+ "step": 1015,
2128
+ "token_acc": 0.8283907544701264,
2129
+ "train_speed(iter/s)": 0.054525
2130
+ },
2131
+ {
2132
+ "epoch": 0.9939098660170523,
2133
+ "grad_norm": 0.44339102506637573,
2134
+ "learning_rate": 9.362908654986235e-09,
2135
+ "loss": 0.5187356472015381,
2136
+ "memory(GiB)": 389.68,
2137
+ "step": 1020,
2138
+ "token_acc": 0.8316270566727605,
2139
+ "train_speed(iter/s)": 0.054538
2140
+ },
2141
+ {
2142
+ "epoch": 0.9987819732034104,
2143
+ "grad_norm": 0.7172895669937134,
2144
+ "learning_rate": 2.6008868793114817e-10,
2145
+ "loss": 0.5243105888366699,
2146
+ "memory(GiB)": 389.68,
2147
+ "step": 1025,
2148
+ "token_acc": 0.8462152666879591,
2149
+ "train_speed(iter/s)": 0.054564
2150
+ },
2151
+ {
2152
+ "epoch": 0.9997563946406821,
2153
+ "eval_loss": 0.5837547183036804,
2154
+ "eval_runtime": 6.0694,
2155
+ "eval_samples_per_second": 0.659,
2156
+ "eval_steps_per_second": 0.659,
2157
+ "step": 1026
2158
+ }
2159
+ ],
2160
+ "logging_steps": 5,
2161
+ "max_steps": 1026,
2162
+ "num_input_tokens_seen": 0,
2163
+ "num_train_epochs": 1,
2164
+ "save_steps": 50,
2165
+ "stateful_callbacks": {
2166
+ "TrainerControl": {
2167
+ "args": {
2168
+ "should_epoch_stop": false,
2169
+ "should_evaluate": false,
2170
+ "should_log": false,
2171
+ "should_save": true,
2172
+ "should_training_stop": true
2173
+ },
2174
+ "attributes": {}
2175
+ }
2176
+ },
2177
+ "total_flos": 3.095035636732416e+18,
2178
+ "train_batch_size": 1,
2179
+ "trial_name": null,
2180
+ "trial_params": null
2181
+ }
training_args.bin ADDED
@@ -0,0 +1,3 @@
 
 
 
 
1
+ version https://git-lfs.github.com/spec/v1
2
+ oid sha256:150b5a257bdebe994b2e6dfa0c759ef57d68e9a51667b3ba02bf53aa8b0f4ea9
3
+ size 5816