kobzaond commited on
Commit
081f651
·
verified ·
1 Parent(s): 69bc00a

Upload trainer_state.json with huggingface_hub

Browse files
Files changed (1) hide show
  1. trainer_state.json +799 -0
trainer_state.json ADDED
@@ -0,0 +1,799 @@
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
1
+ {
2
+ "best_global_step": null,
3
+ "best_metric": null,
4
+ "best_model_checkpoint": null,
5
+ "epoch": 4.0,
6
+ "eval_steps": 500,
7
+ "global_step": 516,
8
+ "is_hyper_param_search": false,
9
+ "is_local_process_zero": true,
10
+ "is_world_process_zero": true,
11
+ "log_history": [
12
+ {
13
+ "epoch": 0.07782101167315175,
14
+ "grad_norm": 309.9635314941406,
15
+ "learning_rate": 3.461538461538461e-07,
16
+ "logits/chosen": 2.9046390056610107,
17
+ "logits/rejected": 2.998429775238037,
18
+ "logps/chosen": -250.68215942382812,
19
+ "logps/rejected": -271.45562744140625,
20
+ "loss": 0.8341,
21
+ "rewards/accuracies": 0.534375011920929,
22
+ "rewards/chosen": 0.07394347339868546,
23
+ "rewards/margins": 0.05555616691708565,
24
+ "rewards/rejected": 0.018387287855148315,
25
+ "step": 10
26
+ },
27
+ {
28
+ "epoch": 0.1556420233463035,
29
+ "grad_norm": 180.70631408691406,
30
+ "learning_rate": 7.307692307692307e-07,
31
+ "logits/chosen": 2.893648386001587,
32
+ "logits/rejected": 2.9738540649414062,
33
+ "logps/chosen": -255.9049835205078,
34
+ "logps/rejected": -271.83197021484375,
35
+ "loss": 0.6594,
36
+ "rewards/accuracies": 0.6656249761581421,
37
+ "rewards/chosen": 0.6080068349838257,
38
+ "rewards/margins": 0.7042483687400818,
39
+ "rewards/rejected": -0.09624147415161133,
40
+ "step": 20
41
+ },
42
+ {
43
+ "epoch": 0.23346303501945526,
44
+ "grad_norm": 152.26849365234375,
45
+ "learning_rate": 1.1153846153846154e-06,
46
+ "logits/chosen": 2.938114643096924,
47
+ "logits/rejected": 2.979564666748047,
48
+ "logps/chosen": -260.2184143066406,
49
+ "logps/rejected": -274.0084228515625,
50
+ "loss": 0.4358,
51
+ "rewards/accuracies": 0.78125,
52
+ "rewards/chosen": 2.1423935890197754,
53
+ "rewards/margins": 2.729647159576416,
54
+ "rewards/rejected": -0.5872532725334167,
55
+ "step": 30
56
+ },
57
+ {
58
+ "epoch": 0.311284046692607,
59
+ "grad_norm": 61.16145324707031,
60
+ "learning_rate": 1.5e-06,
61
+ "logits/chosen": 2.962891101837158,
62
+ "logits/rejected": 3.0372633934020996,
63
+ "logps/chosen": -264.4953918457031,
64
+ "logps/rejected": -278.98541259765625,
65
+ "loss": 0.2424,
66
+ "rewards/accuracies": 0.8843749761581421,
67
+ "rewards/chosen": 3.3210906982421875,
68
+ "rewards/margins": 5.616915225982666,
69
+ "rewards/rejected": -2.2958242893218994,
70
+ "step": 40
71
+ },
72
+ {
73
+ "epoch": 0.38910505836575876,
74
+ "grad_norm": 72.79554748535156,
75
+ "learning_rate": 1.8846153846153845e-06,
76
+ "logits/chosen": 2.916743278503418,
77
+ "logits/rejected": 2.9901554584503174,
78
+ "logps/chosen": -242.43307495117188,
79
+ "logps/rejected": -276.2446594238281,
80
+ "loss": 0.0823,
81
+ "rewards/accuracies": 0.9671875238418579,
82
+ "rewards/chosen": 4.046940803527832,
83
+ "rewards/margins": 9.120622634887695,
84
+ "rewards/rejected": -5.0736823081970215,
85
+ "step": 50
86
+ },
87
+ {
88
+ "epoch": 0.4669260700389105,
89
+ "grad_norm": 51.30080795288086,
90
+ "learning_rate": 1.998877080632712e-06,
91
+ "logits/chosen": 2.911020517349243,
92
+ "logits/rejected": 2.9875214099884033,
93
+ "logps/chosen": -252.1035614013672,
94
+ "logps/rejected": -278.92047119140625,
95
+ "loss": 0.0745,
96
+ "rewards/accuracies": 0.973437488079071,
97
+ "rewards/chosen": 3.5658841133117676,
98
+ "rewards/margins": 11.655838966369629,
99
+ "rewards/rejected": -8.089953422546387,
100
+ "step": 60
101
+ },
102
+ {
103
+ "epoch": 0.5447470817120622,
104
+ "grad_norm": 69.88111877441406,
105
+ "learning_rate": 1.9933831375786213e-06,
106
+ "logits/chosen": 2.9574735164642334,
107
+ "logits/rejected": 3.0135583877563477,
108
+ "logps/chosen": -250.85684204101562,
109
+ "logps/rejected": -278.03582763671875,
110
+ "loss": 0.0516,
111
+ "rewards/accuracies": 0.981249988079071,
112
+ "rewards/chosen": 2.9169883728027344,
113
+ "rewards/margins": 13.218663215637207,
114
+ "rewards/rejected": -10.301675796508789,
115
+ "step": 70
116
+ },
117
+ {
118
+ "epoch": 0.622568093385214,
119
+ "grad_norm": 16.288284301757812,
120
+ "learning_rate": 1.9833370645493046e-06,
121
+ "logits/chosen": 2.9377493858337402,
122
+ "logits/rejected": 3.007570743560791,
123
+ "logps/chosen": -253.7940216064453,
124
+ "logps/rejected": -284.8679504394531,
125
+ "loss": 0.0387,
126
+ "rewards/accuracies": 0.987500011920929,
127
+ "rewards/chosen": 3.284533977508545,
128
+ "rewards/margins": 16.070585250854492,
129
+ "rewards/rejected": -12.786050796508789,
130
+ "step": 80
131
+ },
132
+ {
133
+ "epoch": 0.7003891050583657,
134
+ "grad_norm": 8.968023300170898,
135
+ "learning_rate": 1.9687848971864386e-06,
136
+ "logits/chosen": 2.9306931495666504,
137
+ "logits/rejected": 2.964722156524658,
138
+ "logps/chosen": -252.9971160888672,
139
+ "logps/rejected": -275.87188720703125,
140
+ "loss": 0.0492,
141
+ "rewards/accuracies": 0.987500011920929,
142
+ "rewards/chosen": 3.5943214893341064,
143
+ "rewards/margins": 17.51387596130371,
144
+ "rewards/rejected": -13.9195556640625,
145
+ "step": 90
146
+ },
147
+ {
148
+ "epoch": 0.7782101167315175,
149
+ "grad_norm": 2.590059757232666,
150
+ "learning_rate": 1.9497933200901047e-06,
151
+ "logits/chosen": 2.9647717475891113,
152
+ "logits/rejected": 3.0007081031799316,
153
+ "logps/chosen": -267.41375732421875,
154
+ "logps/rejected": -281.07513427734375,
155
+ "loss": 0.0337,
156
+ "rewards/accuracies": 0.9937499761581421,
157
+ "rewards/chosen": 4.1861348152160645,
158
+ "rewards/margins": 18.587297439575195,
159
+ "rewards/rejected": -14.401159286499023,
160
+ "step": 100
161
+ },
162
+ {
163
+ "epoch": 0.8560311284046692,
164
+ "grad_norm": 77.77639770507812,
165
+ "learning_rate": 1.926449361239848e-06,
166
+ "logits/chosen": 2.8810315132141113,
167
+ "logits/rejected": 2.9851112365722656,
168
+ "logps/chosen": -253.496337890625,
169
+ "logps/rejected": -284.06610107421875,
170
+ "loss": 0.0533,
171
+ "rewards/accuracies": 0.987500011920929,
172
+ "rewards/chosen": 4.9546074867248535,
173
+ "rewards/margins": 20.860849380493164,
174
+ "rewards/rejected": -15.906242370605469,
175
+ "step": 110
176
+ },
177
+ {
178
+ "epoch": 0.933852140077821,
179
+ "grad_norm": 127.29902648925781,
180
+ "learning_rate": 1.8988599931931866e-06,
181
+ "logits/chosen": 2.8698949813842773,
182
+ "logits/rejected": 2.943873405456543,
183
+ "logps/chosen": -246.2525177001953,
184
+ "logps/rejected": -279.6893310546875,
185
+ "loss": 0.0179,
186
+ "rewards/accuracies": 0.995312511920929,
187
+ "rewards/chosen": 3.602506160736084,
188
+ "rewards/margins": 21.305601119995117,
189
+ "rewards/rejected": -17.703094482421875,
190
+ "step": 120
191
+ },
192
+ {
193
+ "epoch": 1.0077821011673151,
194
+ "grad_norm": 0.10526127368211746,
195
+ "learning_rate": 1.8671516428890646e-06,
196
+ "logits/chosen": 2.960531711578369,
197
+ "logits/rejected": 3.0081727504730225,
198
+ "logps/chosen": -251.44546508789062,
199
+ "logps/rejected": -297.5830383300781,
200
+ "loss": 0.0043,
201
+ "rewards/accuracies": 0.9983552694320679,
202
+ "rewards/chosen": 5.055600166320801,
203
+ "rewards/margins": 22.011268615722656,
204
+ "rewards/rejected": -16.955669403076172,
205
+ "step": 130
206
+ },
207
+ {
208
+ "epoch": 1.0856031128404668,
209
+ "grad_norm": 3.8229660987854004,
210
+ "learning_rate": 1.8314696123025452e-06,
211
+ "logits/chosen": 2.9409918785095215,
212
+ "logits/rejected": 2.994568109512329,
213
+ "logps/chosen": -251.5284423828125,
214
+ "logps/rejected": -283.5034484863281,
215
+ "loss": 0.002,
216
+ "rewards/accuracies": 0.9984375238418579,
217
+ "rewards/chosen": 5.045574188232422,
218
+ "rewards/margins": 24.76313591003418,
219
+ "rewards/rejected": -19.717559814453125,
220
+ "step": 140
221
+ },
222
+ {
223
+ "epoch": 1.1634241245136188,
224
+ "grad_norm": 0.1067415103316307,
225
+ "learning_rate": 1.7919774126055671e-06,
226
+ "logits/chosen": 2.9014945030212402,
227
+ "logits/rejected": 3.0171058177948,
228
+ "logps/chosen": -244.58154296875,
229
+ "logps/rejected": -300.16827392578125,
230
+ "loss": 0.0005,
231
+ "rewards/accuracies": 1.0,
232
+ "rewards/chosen": 5.922303199768066,
233
+ "rewards/margins": 27.960514068603516,
234
+ "rewards/rejected": -22.038206100463867,
235
+ "step": 150
236
+ },
237
+ {
238
+ "epoch": 1.2412451361867705,
239
+ "grad_norm": 0.11893969029188156,
240
+ "learning_rate": 1.7488560148849425e-06,
241
+ "logits/chosen": 2.930441379547119,
242
+ "logits/rejected": 2.9720261096954346,
243
+ "logps/chosen": -257.78741455078125,
244
+ "logps/rejected": -283.66986083984375,
245
+ "loss": 0.0044,
246
+ "rewards/accuracies": 0.9984375238418579,
247
+ "rewards/chosen": 4.894805908203125,
248
+ "rewards/margins": 27.222713470458984,
249
+ "rewards/rejected": -22.32790756225586,
250
+ "step": 160
251
+ },
252
+ {
253
+ "epoch": 1.3190661478599222,
254
+ "grad_norm": 0.019848737865686417,
255
+ "learning_rate": 1.7023030208511418e-06,
256
+ "logits/chosen": 2.9215731620788574,
257
+ "logits/rejected": 2.998058795928955,
258
+ "logps/chosen": -257.8537902832031,
259
+ "logps/rejected": -300.69781494140625,
260
+ "loss": 0.0005,
261
+ "rewards/accuracies": 1.0,
262
+ "rewards/chosen": 4.8431878089904785,
263
+ "rewards/margins": 27.765335083007812,
264
+ "rewards/rejected": -22.92214584350586,
265
+ "step": 170
266
+ },
267
+ {
268
+ "epoch": 1.3968871595330739,
269
+ "grad_norm": 0.013338716700673103,
270
+ "learning_rate": 1.6525317573380523e-06,
271
+ "logits/chosen": 2.905754566192627,
272
+ "logits/rejected": 2.9750256538391113,
273
+ "logps/chosen": -256.52801513671875,
274
+ "logps/rejected": -292.92559814453125,
275
+ "loss": 0.0002,
276
+ "rewards/accuracies": 1.0,
277
+ "rewards/chosen": 5.072903633117676,
278
+ "rewards/margins": 28.44639015197754,
279
+ "rewards/rejected": -23.373485565185547,
280
+ "step": 180
281
+ },
282
+ {
283
+ "epoch": 1.4747081712062258,
284
+ "grad_norm": 1.3543317317962646,
285
+ "learning_rate": 1.5997702987431278e-06,
286
+ "logits/chosen": 2.8545498847961426,
287
+ "logits/rejected": 2.93253755569458,
288
+ "logps/chosen": -249.04165649414062,
289
+ "logps/rejected": -290.2785949707031,
290
+ "loss": 0.0001,
291
+ "rewards/accuracies": 1.0,
292
+ "rewards/chosen": 4.263331413269043,
293
+ "rewards/margins": 29.8680362701416,
294
+ "rewards/rejected": -25.604705810546875,
295
+ "step": 190
296
+ },
297
+ {
298
+ "epoch": 1.5525291828793775,
299
+ "grad_norm": 0.0023172160144895315,
300
+ "learning_rate": 1.5442604218875369e-06,
301
+ "logits/chosen": 2.8726515769958496,
302
+ "logits/rejected": 2.96691632270813,
303
+ "logps/chosen": -235.4767608642578,
304
+ "logps/rejected": -299.6068420410156,
305
+ "loss": 0.0174,
306
+ "rewards/accuracies": 0.9984375238418579,
307
+ "rewards/chosen": 4.076581001281738,
308
+ "rewards/margins": 29.738256454467773,
309
+ "rewards/rejected": -25.661672592163086,
310
+ "step": 200
311
+ },
312
+ {
313
+ "epoch": 1.6303501945525292,
314
+ "grad_norm": 0.12606221437454224,
315
+ "learning_rate": 1.4862564980856257e-06,
316
+ "logits/chosen": 2.866564989089966,
317
+ "logits/rejected": 2.9289443492889404,
318
+ "logps/chosen": -251.0595245361328,
319
+ "logps/rejected": -291.28009033203125,
320
+ "loss": 0.0002,
321
+ "rewards/accuracies": 1.0,
322
+ "rewards/chosen": 2.828310012817383,
323
+ "rewards/margins": 29.65151023864746,
324
+ "rewards/rejected": -26.823205947875977,
325
+ "step": 210
326
+ },
327
+ {
328
+ "epoch": 1.708171206225681,
329
+ "grad_norm": 1.1696350574493408,
330
+ "learning_rate": 1.4260243275007265e-06,
331
+ "logits/chosen": 2.876115083694458,
332
+ "logits/rejected": 2.9629712104797363,
333
+ "logps/chosen": -252.755126953125,
334
+ "logps/rejected": -293.724609375,
335
+ "loss": 0.0001,
336
+ "rewards/accuracies": 1.0,
337
+ "rewards/chosen": 2.9194681644439697,
338
+ "rewards/margins": 30.779850006103516,
339
+ "rewards/rejected": -27.86037826538086,
340
+ "step": 220
341
+ },
342
+ {
343
+ "epoch": 1.7859922178988326,
344
+ "grad_norm": 0.7943425178527832,
345
+ "learning_rate": 1.3638399211288185e-06,
346
+ "logits/chosen": 2.853001356124878,
347
+ "logits/rejected": 2.91581392288208,
348
+ "logps/chosen": -248.50790405273438,
349
+ "logps/rejected": -303.24749755859375,
350
+ "loss": 0.0009,
351
+ "rewards/accuracies": 1.0,
352
+ "rewards/chosen": 3.9409661293029785,
353
+ "rewards/margins": 31.501480102539062,
354
+ "rewards/rejected": -27.560516357421875,
355
+ "step": 230
356
+ },
357
+ {
358
+ "epoch": 1.8638132295719845,
359
+ "grad_norm": 22.544157028198242,
360
+ "learning_rate": 1.2999882359915478e-06,
361
+ "logits/chosen": 2.838768482208252,
362
+ "logits/rejected": 2.8869760036468506,
363
+ "logps/chosen": -257.80755615234375,
364
+ "logps/rejected": -301.2661437988281,
365
+ "loss": 0.0009,
366
+ "rewards/accuracies": 1.0,
367
+ "rewards/chosen": 4.118237018585205,
368
+ "rewards/margins": 31.00071144104004,
369
+ "rewards/rejected": -26.882476806640625,
370
+ "step": 240
371
+ },
372
+ {
373
+ "epoch": 1.9416342412451362,
374
+ "grad_norm": 0.08505785465240479,
375
+ "learning_rate": 1.2347618693345148e-06,
376
+ "logits/chosen": 2.8469579219818115,
377
+ "logits/rejected": 2.91058349609375,
378
+ "logps/chosen": -274.753173828125,
379
+ "logps/rejected": -310.84820556640625,
380
+ "loss": 0.0097,
381
+ "rewards/accuracies": 0.996874988079071,
382
+ "rewards/chosen": 3.213207960128784,
383
+ "rewards/margins": 32.35531234741211,
384
+ "rewards/rejected": -29.142101287841797,
385
+ "step": 250
386
+ },
387
+ {
388
+ "epoch": 2.0155642023346303,
389
+ "grad_norm": 0.15910857915878296,
390
+ "learning_rate": 1.1684597178146115e-06,
391
+ "logits/chosen": 2.820605516433716,
392
+ "logits/rejected": 2.9221818447113037,
393
+ "logps/chosen": -240.77276611328125,
394
+ "logps/rejected": -284.52947998046875,
395
+ "loss": 0.0095,
396
+ "rewards/accuracies": 1.0,
397
+ "rewards/chosen": 4.895946979522705,
398
+ "rewards/margins": 31.758358001708984,
399
+ "rewards/rejected": -26.862411499023438,
400
+ "step": 260
401
+ },
402
+ {
403
+ "epoch": 2.093385214007782,
404
+ "grad_norm": 0.036736179143190384,
405
+ "learning_rate": 1.1013856078206078e-06,
406
+ "logits/chosen": 2.7885546684265137,
407
+ "logits/rejected": 2.9099419116973877,
408
+ "logps/chosen": -255.7447509765625,
409
+ "logps/rejected": -300.6316223144531,
410
+ "loss": 0.0,
411
+ "rewards/accuracies": 1.0,
412
+ "rewards/chosen": 4.1806111335754395,
413
+ "rewards/margins": 32.345706939697266,
414
+ "rewards/rejected": -28.16509437561035,
415
+ "step": 270
416
+ },
417
+ {
418
+ "epoch": 2.1712062256809337,
419
+ "grad_norm": 0.010115005075931549,
420
+ "learning_rate": 1.0338469032034844e-06,
421
+ "logits/chosen": 2.880408763885498,
422
+ "logits/rejected": 2.913715124130249,
423
+ "logps/chosen": -244.33837890625,
424
+ "logps/rejected": -284.74456787109375,
425
+ "loss": 0.0,
426
+ "rewards/accuracies": 1.0,
427
+ "rewards/chosen": 5.522616386413574,
428
+ "rewards/margins": 32.65098571777344,
429
+ "rewards/rejected": -27.128368377685547,
430
+ "step": 280
431
+ },
432
+ {
433
+ "epoch": 2.2490272373540856,
434
+ "grad_norm": 0.0006411768263205886,
435
+ "learning_rate": 9.661530967965155e-07,
436
+ "logits/chosen": 2.8637478351593018,
437
+ "logits/rejected": 2.8776774406433105,
438
+ "logps/chosen": -251.5993194580078,
439
+ "logps/rejected": -285.7321472167969,
440
+ "loss": 0.0,
441
+ "rewards/accuracies": 1.0,
442
+ "rewards/chosen": 5.7556328773498535,
443
+ "rewards/margins": 32.75992202758789,
444
+ "rewards/rejected": -27.004287719726562,
445
+ "step": 290
446
+ },
447
+ {
448
+ "epoch": 2.3268482490272375,
449
+ "grad_norm": 0.010583557188510895,
450
+ "learning_rate": 8.986143921793921e-07,
451
+ "logits/chosen": 2.8255324363708496,
452
+ "logits/rejected": 2.884343385696411,
453
+ "logps/chosen": -256.0443115234375,
454
+ "logps/rejected": -298.6083068847656,
455
+ "loss": 0.0,
456
+ "rewards/accuracies": 1.0,
457
+ "rewards/chosen": 4.289700984954834,
458
+ "rewards/margins": 32.55815887451172,
459
+ "rewards/rejected": -28.26845359802246,
460
+ "step": 300
461
+ },
462
+ {
463
+ "epoch": 2.404669260700389,
464
+ "grad_norm": 0.05514160171151161,
465
+ "learning_rate": 8.315402821853885e-07,
466
+ "logits/chosen": 2.8168251514434814,
467
+ "logits/rejected": 2.911100387573242,
468
+ "logps/chosen": -242.12930297851562,
469
+ "logps/rejected": -311.6902770996094,
470
+ "loss": 0.0,
471
+ "rewards/accuracies": 1.0,
472
+ "rewards/chosen": 4.304950714111328,
473
+ "rewards/margins": 33.0163459777832,
474
+ "rewards/rejected": -28.71139144897461,
475
+ "step": 310
476
+ },
477
+ {
478
+ "epoch": 2.482490272373541,
479
+ "grad_norm": 0.0014977785758674145,
480
+ "learning_rate": 7.65238130665485e-07,
481
+ "logits/chosen": 2.8739066123962402,
482
+ "logits/rejected": 2.9437661170959473,
483
+ "logps/chosen": -254.6911163330078,
484
+ "logps/rejected": -298.3764953613281,
485
+ "loss": 0.0,
486
+ "rewards/accuracies": 1.0,
487
+ "rewards/chosen": 4.761944770812988,
488
+ "rewards/margins": 32.24135208129883,
489
+ "rewards/rejected": -27.479406356811523,
490
+ "step": 320
491
+ },
492
+ {
493
+ "epoch": 2.5603112840466924,
494
+ "grad_norm": 0.003176012309268117,
495
+ "learning_rate": 7.000117640084525e-07,
496
+ "logits/chosen": 2.849517822265625,
497
+ "logits/rejected": 2.9144535064697266,
498
+ "logps/chosen": -253.174560546875,
499
+ "logps/rejected": -302.97296142578125,
500
+ "loss": 0.0,
501
+ "rewards/accuracies": 1.0,
502
+ "rewards/chosen": 5.072056770324707,
503
+ "rewards/margins": 33.25294876098633,
504
+ "rewards/rejected": -28.180889129638672,
505
+ "step": 330
506
+ },
507
+ {
508
+ "epoch": 2.6381322957198443,
509
+ "grad_norm": 0.007333577610552311,
510
+ "learning_rate": 6.361600788711815e-07,
511
+ "logits/chosen": 2.801302671432495,
512
+ "logits/rejected": 2.9121482372283936,
513
+ "logps/chosen": -259.02398681640625,
514
+ "logps/rejected": -303.2242431640625,
515
+ "loss": 0.0,
516
+ "rewards/accuracies": 1.0,
517
+ "rewards/chosen": 4.999932289123535,
518
+ "rewards/margins": 32.66350555419922,
519
+ "rewards/rejected": -27.66357421875,
520
+ "step": 340
521
+ },
522
+ {
523
+ "epoch": 2.7159533073929962,
524
+ "grad_norm": 0.0016177126672118902,
525
+ "learning_rate": 5.739756724992736e-07,
526
+ "logits/chosen": 2.85249662399292,
527
+ "logits/rejected": 2.9361824989318848,
528
+ "logps/chosen": -244.018310546875,
529
+ "logps/rejected": -286.9032897949219,
530
+ "loss": 0.0,
531
+ "rewards/accuracies": 1.0,
532
+ "rewards/chosen": 4.892648220062256,
533
+ "rewards/margins": 32.217613220214844,
534
+ "rewards/rejected": -27.324966430664062,
535
+ "step": 350
536
+ },
537
+ {
538
+ "epoch": 2.7937743190661477,
539
+ "grad_norm": 0.3721546530723572,
540
+ "learning_rate": 5.137435019143744e-07,
541
+ "logits/chosen": 2.801509141921997,
542
+ "logits/rejected": 2.8811545372009277,
543
+ "logps/chosen": -257.4078063964844,
544
+ "logps/rejected": -306.99542236328125,
545
+ "loss": 0.0001,
546
+ "rewards/accuracies": 1.0,
547
+ "rewards/chosen": 4.106388092041016,
548
+ "rewards/margins": 33.20668411254883,
549
+ "rewards/rejected": -29.100292205810547,
550
+ "step": 360
551
+ },
552
+ {
553
+ "epoch": 2.8715953307392996,
554
+ "grad_norm": 0.004263872280716896,
555
+ "learning_rate": 4.557395781124631e-07,
556
+ "logits/chosen": 2.853585958480835,
557
+ "logits/rejected": 2.9362740516662598,
558
+ "logps/chosen": -265.7266845703125,
559
+ "logps/rejected": -301.75091552734375,
560
+ "loss": 0.0,
561
+ "rewards/accuracies": 1.0,
562
+ "rewards/chosen": 4.696002960205078,
563
+ "rewards/margins": 32.666351318359375,
564
+ "rewards/rejected": -27.9703426361084,
565
+ "step": 370
566
+ },
567
+ {
568
+ "epoch": 2.9494163424124515,
569
+ "grad_norm": 6.243278503417969,
570
+ "learning_rate": 4.0022970125687217e-07,
571
+ "logits/chosen": 2.8308067321777344,
572
+ "logits/rejected": 2.924168586730957,
573
+ "logps/chosen": -253.6175537109375,
574
+ "logps/rejected": -304.56488037109375,
575
+ "loss": 0.0001,
576
+ "rewards/accuracies": 1.0,
577
+ "rewards/chosen": 4.487698554992676,
578
+ "rewards/margins": 33.75385284423828,
579
+ "rewards/rejected": -29.26615333557129,
580
+ "step": 380
581
+ },
582
+ {
583
+ "epoch": 3.0233463035019454,
584
+ "grad_norm": 0.010610430501401424,
585
+ "learning_rate": 3.474682426619474e-07,
586
+ "logits/chosen": 2.86039662361145,
587
+ "logits/rejected": 2.955193042755127,
588
+ "logps/chosen": -244.86038208007812,
589
+ "logps/rejected": -298.5942077636719,
590
+ "loss": 0.0,
591
+ "rewards/accuracies": 1.0,
592
+ "rewards/chosen": 5.364467144012451,
593
+ "rewards/margins": 33.471588134765625,
594
+ "rewards/rejected": -28.107120513916016,
595
+ "step": 390
596
+ },
597
+ {
598
+ "epoch": 3.1011673151750974,
599
+ "grad_norm": 0.0002077793178614229,
600
+ "learning_rate": 2.976969791488586e-07,
601
+ "logits/chosen": 2.794825792312622,
602
+ "logits/rejected": 2.913062572479248,
603
+ "logps/chosen": -249.8114471435547,
604
+ "logps/rejected": -304.4586181640625,
605
+ "loss": 0.0,
606
+ "rewards/accuracies": 1.0,
607
+ "rewards/chosen": 4.951796054840088,
608
+ "rewards/margins": 33.71596908569336,
609
+ "rewards/rejected": -28.764175415039062,
610
+ "step": 400
611
+ },
612
+ {
613
+ "epoch": 3.178988326848249,
614
+ "grad_norm": 0.0018190924311056733,
615
+ "learning_rate": 2.511439851150573e-07,
616
+ "logits/chosen": 2.846440076828003,
617
+ "logits/rejected": 2.9116950035095215,
618
+ "logps/chosen": -245.32241821289062,
619
+ "logps/rejected": -299.29278564453125,
620
+ "loss": 0.0,
621
+ "rewards/accuracies": 1.0,
622
+ "rewards/chosen": 4.315257549285889,
623
+ "rewards/margins": 33.424171447753906,
624
+ "rewards/rejected": -29.10890769958496,
625
+ "step": 410
626
+ },
627
+ {
628
+ "epoch": 3.2568093385214008,
629
+ "grad_norm": 0.0022656808141618967,
630
+ "learning_rate": 2.080225873944328e-07,
631
+ "logits/chosen": 2.8200035095214844,
632
+ "logits/rejected": 2.9111595153808594,
633
+ "logps/chosen": -258.51519775390625,
634
+ "logps/rejected": -303.6025390625,
635
+ "loss": 0.0,
636
+ "rewards/accuracies": 1.0,
637
+ "rewards/chosen": 4.961642265319824,
638
+ "rewards/margins": 33.01478958129883,
639
+ "rewards/rejected": -28.053142547607422,
640
+ "step": 420
641
+ },
642
+ {
643
+ "epoch": 3.3346303501945527,
644
+ "grad_norm": 0.006798978429287672,
645
+ "learning_rate": 1.6853038769745465e-07,
646
+ "logits/chosen": 2.8389997482299805,
647
+ "logits/rejected": 2.8933396339416504,
648
+ "logps/chosen": -245.7606658935547,
649
+ "logps/rejected": -295.68115234375,
650
+ "loss": 0.0,
651
+ "rewards/accuracies": 1.0,
652
+ "rewards/chosen": 4.181079387664795,
653
+ "rewards/margins": 32.27184295654297,
654
+ "rewards/rejected": -28.090763092041016,
655
+ "step": 430
656
+ },
657
+ {
658
+ "epoch": 3.412451361867704,
659
+ "grad_norm": 0.00100744201336056,
660
+ "learning_rate": 1.3284835711093535e-07,
661
+ "logits/chosen": 2.8530194759368896,
662
+ "logits/rejected": 2.9206631183624268,
663
+ "logps/chosen": -258.67431640625,
664
+ "logps/rejected": -298.80755615234375,
665
+ "loss": 0.0,
666
+ "rewards/accuracies": 1.0,
667
+ "rewards/chosen": 4.105883598327637,
668
+ "rewards/margins": 32.130775451660156,
669
+ "rewards/rejected": -28.024892807006836,
670
+ "step": 440
671
+ },
672
+ {
673
+ "epoch": 3.490272373540856,
674
+ "grad_norm": 0.0001550566521473229,
675
+ "learning_rate": 1.0114000680681356e-07,
676
+ "logits/chosen": 2.81189227104187,
677
+ "logits/rejected": 2.925079107284546,
678
+ "logps/chosen": -253.63217163085938,
679
+ "logps/rejected": -299.74273681640625,
680
+ "loss": 0.0,
681
+ "rewards/accuracies": 1.0,
682
+ "rewards/chosen": 6.281905174255371,
683
+ "rewards/margins": 33.87714385986328,
684
+ "rewards/rejected": -27.595239639282227,
685
+ "step": 450
686
+ },
687
+ {
688
+ "epoch": 3.5680933852140075,
689
+ "grad_norm": 0.01041385531425476,
690
+ "learning_rate": 7.355063876015199e-08,
691
+ "logits/chosen": 2.877830982208252,
692
+ "logits/rejected": 2.9270596504211426,
693
+ "logps/chosen": -277.89544677734375,
694
+ "logps/rejected": -303.5425109863281,
695
+ "loss": 0.0,
696
+ "rewards/accuracies": 1.0,
697
+ "rewards/chosen": 5.2588934898376465,
698
+ "rewards/margins": 32.801124572753906,
699
+ "rewards/rejected": -27.5422306060791,
700
+ "step": 460
701
+ },
702
+ {
703
+ "epoch": 3.6459143968871595,
704
+ "grad_norm": 0.01067538931965828,
705
+ "learning_rate": 5.020667990989525e-08,
706
+ "logits/chosen": 2.8863813877105713,
707
+ "logits/rejected": 2.9612936973571777,
708
+ "logps/chosen": -259.4737854003906,
709
+ "logps/rejected": -296.72637939453125,
710
+ "loss": 0.0,
711
+ "rewards/accuracies": 1.0,
712
+ "rewards/chosen": 4.224932670593262,
713
+ "rewards/margins": 32.182594299316406,
714
+ "rewards/rejected": -27.957666397094727,
715
+ "step": 470
716
+ },
717
+ {
718
+ "epoch": 3.7237354085603114,
719
+ "grad_norm": 0.004288141615688801,
720
+ "learning_rate": 3.121510281356143e-08,
721
+ "logits/chosen": 2.824970245361328,
722
+ "logits/rejected": 2.8980326652526855,
723
+ "logps/chosen": -251.7251434326172,
724
+ "logps/rejected": -293.5643615722656,
725
+ "loss": 0.0,
726
+ "rewards/accuracies": 1.0,
727
+ "rewards/chosen": 5.086753845214844,
728
+ "rewards/margins": 32.74205780029297,
729
+ "rewards/rejected": -27.65530776977539,
730
+ "step": 480
731
+ },
732
+ {
733
+ "epoch": 3.801556420233463,
734
+ "grad_norm": 9.263599349651486e-05,
735
+ "learning_rate": 1.6662935450695416e-08,
736
+ "logits/chosen": 2.7916643619537354,
737
+ "logits/rejected": 2.8788905143737793,
738
+ "logps/chosen": -239.5885467529297,
739
+ "logps/rejected": -293.6639099121094,
740
+ "loss": 0.0,
741
+ "rewards/accuracies": 1.0,
742
+ "rewards/chosen": 5.8184919357299805,
743
+ "rewards/margins": 32.92034912109375,
744
+ "rewards/rejected": -27.101858139038086,
745
+ "step": 490
746
+ },
747
+ {
748
+ "epoch": 3.8793774319066148,
749
+ "grad_norm": 0.003024149453267455,
750
+ "learning_rate": 6.6168624213784885e-09,
751
+ "logits/chosen": 2.828496217727661,
752
+ "logits/rejected": 2.8872532844543457,
753
+ "logps/chosen": -242.9530792236328,
754
+ "logps/rejected": -291.443359375,
755
+ "loss": 0.0,
756
+ "rewards/accuracies": 1.0,
757
+ "rewards/chosen": 4.576481342315674,
758
+ "rewards/margins": 31.855998992919922,
759
+ "rewards/rejected": -27.279516220092773,
760
+ "step": 500
761
+ },
762
+ {
763
+ "epoch": 3.9571984435797667,
764
+ "grad_norm": 0.003526742337271571,
765
+ "learning_rate": 1.1229193672881444e-09,
766
+ "logits/chosen": 2.8279409408569336,
767
+ "logits/rejected": 2.9110004901885986,
768
+ "logps/chosen": -243.04946899414062,
769
+ "logps/rejected": -305.1340026855469,
770
+ "loss": 0.0,
771
+ "rewards/accuracies": 1.0,
772
+ "rewards/chosen": 4.348401069641113,
773
+ "rewards/margins": 32.896034240722656,
774
+ "rewards/rejected": -28.547632217407227,
775
+ "step": 510
776
+ }
777
+ ],
778
+ "logging_steps": 10,
779
+ "max_steps": 516,
780
+ "num_input_tokens_seen": 0,
781
+ "num_train_epochs": 4,
782
+ "save_steps": 500,
783
+ "stateful_callbacks": {
784
+ "TrainerControl": {
785
+ "args": {
786
+ "should_epoch_stop": false,
787
+ "should_evaluate": false,
788
+ "should_log": false,
789
+ "should_save": true,
790
+ "should_training_stop": true
791
+ },
792
+ "attributes": {}
793
+ }
794
+ },
795
+ "total_flos": 0.0,
796
+ "train_batch_size": 2,
797
+ "trial_name": null,
798
+ "trial_params": null
799
+ }