{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9573958831977023, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.011967448539971278, "grad_norm": 16.159290313720703, "learning_rate": 2.964e-05, "loss": 2.393221130371094, "step": 25 }, { "epoch": 0.023934897079942556, "grad_norm": 11.983283996582031, "learning_rate": 2.9265000000000002e-05, "loss": 1.6306124877929689, "step": 50 }, { "epoch": 0.03590234561991384, "grad_norm": 10.964775085449219, "learning_rate": 2.889e-05, "loss": 1.488197021484375, "step": 75 }, { "epoch": 0.04786979415988511, "grad_norm": 10.419496536254883, "learning_rate": 2.8515e-05, "loss": 1.3718760681152344, "step": 100 }, { "epoch": 0.059837242699856394, "grad_norm": 9.781177520751953, "learning_rate": 2.8139999999999998e-05, "loss": 1.2721688079833984, "step": 125 }, { "epoch": 0.07180469123982768, "grad_norm": 8.892899513244629, "learning_rate": 2.7765e-05, "loss": 1.212474594116211, "step": 150 }, { "epoch": 0.08377213977979894, "grad_norm": 8.198054313659668, "learning_rate": 2.739e-05, "loss": 1.1640670776367188, "step": 175 }, { "epoch": 0.09573958831977022, "grad_norm": 14.760664939880371, "learning_rate": 2.7015e-05, "loss": 1.122880630493164, "step": 200 }, { "epoch": 0.1077070368597415, "grad_norm": 8.657957077026367, "learning_rate": 2.6640000000000002e-05, "loss": 1.0792572784423828, "step": 225 }, { "epoch": 0.11967448539971279, "grad_norm": 9.582183837890625, "learning_rate": 2.6265e-05, "loss": 0.946361083984375, "step": 250 }, { "epoch": 0.13164193393968407, "grad_norm": 9.90124225616455, "learning_rate": 2.589e-05, "loss": 0.7015521240234375, "step": 275 }, { "epoch": 0.14360938247965535, "grad_norm": 6.0904927253723145, "learning_rate": 2.5515000000000002e-05, "loss": 0.5619692611694336, "step": 300 }, { "epoch": 0.1555768310196266, "grad_norm": 6.307363510131836, "learning_rate": 2.514e-05, "loss": 0.5397976303100586, "step": 325 }, { "epoch": 0.1675442795595979, "grad_norm": 6.347323417663574, "learning_rate": 2.4765e-05, "loss": 0.45329193115234373, "step": 350 }, { "epoch": 0.17951172809956917, "grad_norm": 4.2150092124938965, "learning_rate": 2.439e-05, "loss": 0.43831916809082033, "step": 375 }, { "epoch": 0.19147917663954045, "grad_norm": 6.442485332489014, "learning_rate": 2.4015e-05, "loss": 0.4092135238647461, "step": 400 }, { "epoch": 0.20344662517951173, "grad_norm": 6.235575199127197, "learning_rate": 2.364e-05, "loss": 0.41996471405029295, "step": 425 }, { "epoch": 0.215414073719483, "grad_norm": 4.805295944213867, "learning_rate": 2.3265e-05, "loss": 0.37865653991699216, "step": 450 }, { "epoch": 0.2273815222594543, "grad_norm": 4.641193389892578, "learning_rate": 2.289e-05, "loss": 0.38615558624267576, "step": 475 }, { "epoch": 0.23934897079942558, "grad_norm": 4.975593566894531, "learning_rate": 2.2515e-05, "loss": 0.3595850372314453, "step": 500 }, { "epoch": 0.25131641933939686, "grad_norm": 4.641961574554443, "learning_rate": 2.214e-05, "loss": 0.3625198745727539, "step": 525 }, { "epoch": 0.26328386787936814, "grad_norm": 3.975968837738037, "learning_rate": 2.1765000000000003e-05, "loss": 0.41111274719238283, "step": 550 }, { "epoch": 0.2752513164193394, "grad_norm": 2.668240547180176, "learning_rate": 2.139e-05, "loss": 0.32781185150146486, "step": 575 }, { "epoch": 0.2872187649593107, "grad_norm": 3.3640079498291016, "learning_rate": 2.1015e-05, "loss": 0.31779170989990235, "step": 600 }, { "epoch": 0.29918621349928193, "grad_norm": 4.217093467712402, "learning_rate": 2.064e-05, "loss": 0.3358059310913086, "step": 625 }, { "epoch": 0.3111536620392532, "grad_norm": 8.076043128967285, "learning_rate": 2.0265e-05, "loss": 0.3440943908691406, "step": 650 }, { "epoch": 0.3231211105792245, "grad_norm": 4.453291416168213, "learning_rate": 1.989e-05, "loss": 0.3261558151245117, "step": 675 }, { "epoch": 0.3350885591191958, "grad_norm": 5.208756923675537, "learning_rate": 1.9515e-05, "loss": 0.32787994384765623, "step": 700 }, { "epoch": 0.34705600765916705, "grad_norm": 4.408796310424805, "learning_rate": 1.914e-05, "loss": 0.30166456222534177, "step": 725 }, { "epoch": 0.35902345619913834, "grad_norm": 3.7778923511505127, "learning_rate": 1.8764999999999997e-05, "loss": 0.33025398254394533, "step": 750 }, { "epoch": 0.3709909047391096, "grad_norm": 3.9224133491516113, "learning_rate": 1.8390000000000002e-05, "loss": 0.30546653747558594, "step": 775 }, { "epoch": 0.3829583532790809, "grad_norm": 4.24598503112793, "learning_rate": 1.8015000000000003e-05, "loss": 0.3084229278564453, "step": 800 }, { "epoch": 0.3949258018190522, "grad_norm": 3.883857250213623, "learning_rate": 1.764e-05, "loss": 0.30587684631347656, "step": 825 }, { "epoch": 0.40689325035902346, "grad_norm": 2.9970357418060303, "learning_rate": 1.7265e-05, "loss": 0.26069087982177735, "step": 850 }, { "epoch": 0.41886069889899474, "grad_norm": 3.904029130935669, "learning_rate": 1.689e-05, "loss": 0.3135500717163086, "step": 875 }, { "epoch": 0.430828147438966, "grad_norm": 4.558609962463379, "learning_rate": 1.6515e-05, "loss": 0.30924333572387697, "step": 900 }, { "epoch": 0.4427955959789373, "grad_norm": 2.483649253845215, "learning_rate": 1.614e-05, "loss": 0.28861886978149415, "step": 925 }, { "epoch": 0.4547630445189086, "grad_norm": 3.368525981903076, "learning_rate": 1.5765e-05, "loss": 0.27014717102050784, "step": 950 }, { "epoch": 0.46673049305887987, "grad_norm": 4.169050216674805, "learning_rate": 1.539e-05, "loss": 0.3167378234863281, "step": 975 }, { "epoch": 0.47869794159885115, "grad_norm": 3.039638042449951, "learning_rate": 1.5015e-05, "loss": 0.30757768630981447, "step": 1000 }, { "epoch": 0.4906653901388224, "grad_norm": 3.8224575519561768, "learning_rate": 1.464e-05, "loss": 0.257368278503418, "step": 1025 }, { "epoch": 0.5026328386787937, "grad_norm": 4.447447776794434, "learning_rate": 1.4265e-05, "loss": 0.2711064910888672, "step": 1050 }, { "epoch": 0.5146002872187649, "grad_norm": 2.7556653022766113, "learning_rate": 1.389e-05, "loss": 0.29430915832519533, "step": 1075 }, { "epoch": 0.5265677357587363, "grad_norm": 3.6120786666870117, "learning_rate": 1.3515e-05, "loss": 0.25948652267456057, "step": 1100 }, { "epoch": 0.5385351842987075, "grad_norm": 3.0165789127349854, "learning_rate": 1.314e-05, "loss": 0.2648066329956055, "step": 1125 }, { "epoch": 0.5505026328386788, "grad_norm": 2.395517349243164, "learning_rate": 1.2765e-05, "loss": 0.28498870849609376, "step": 1150 }, { "epoch": 0.5624700813786501, "grad_norm": 3.056443691253662, "learning_rate": 1.239e-05, "loss": 0.28835039138793944, "step": 1175 }, { "epoch": 0.5744375299186214, "grad_norm": 3.4160618782043457, "learning_rate": 1.2015000000000001e-05, "loss": 0.2601981735229492, "step": 1200 }, { "epoch": 0.5864049784585926, "grad_norm": 3.4843311309814453, "learning_rate": 1.164e-05, "loss": 0.25075761795043944, "step": 1225 }, { "epoch": 0.5983724269985639, "grad_norm": 2.3877573013305664, "learning_rate": 1.1265e-05, "loss": 0.2595806121826172, "step": 1250 }, { "epoch": 0.6103398755385352, "grad_norm": 3.865945339202881, "learning_rate": 1.089e-05, "loss": 0.30072870254516604, "step": 1275 }, { "epoch": 0.6223073240785064, "grad_norm": 3.270880937576294, "learning_rate": 1.0515e-05, "loss": 0.26188276290893553, "step": 1300 }, { "epoch": 0.6342747726184778, "grad_norm": 4.212886333465576, "learning_rate": 1.0140000000000001e-05, "loss": 0.2598790168762207, "step": 1325 }, { "epoch": 0.646242221158449, "grad_norm": 2.603821039199829, "learning_rate": 9.765e-06, "loss": 0.2566701126098633, "step": 1350 }, { "epoch": 0.6582096696984203, "grad_norm": 3.567640781402588, "learning_rate": 9.39e-06, "loss": 0.23227554321289062, "step": 1375 }, { "epoch": 0.6701771182383915, "grad_norm": 3.0411109924316406, "learning_rate": 9.015e-06, "loss": 0.254827938079834, "step": 1400 }, { "epoch": 0.6821445667783629, "grad_norm": 2.4146523475646973, "learning_rate": 8.64e-06, "loss": 0.24793487548828125, "step": 1425 }, { "epoch": 0.6941120153183341, "grad_norm": 3.1589515209198, "learning_rate": 8.265000000000001e-06, "loss": 0.23845375061035157, "step": 1450 }, { "epoch": 0.7060794638583054, "grad_norm": 2.8087363243103027, "learning_rate": 7.89e-06, "loss": 0.2550558662414551, "step": 1475 }, { "epoch": 0.7180469123982767, "grad_norm": 2.8838937282562256, "learning_rate": 7.515e-06, "loss": 0.25409133911132814, "step": 1500 }, { "epoch": 0.730014360938248, "grad_norm": 2.770642042160034, "learning_rate": 7.14e-06, "loss": 0.23834611892700194, "step": 1525 }, { "epoch": 0.7419818094782192, "grad_norm": 2.3907296657562256, "learning_rate": 6.7650000000000005e-06, "loss": 0.23956525802612305, "step": 1550 }, { "epoch": 0.7539492580181906, "grad_norm": 2.288137197494507, "learning_rate": 6.39e-06, "loss": 0.23735124588012696, "step": 1575 }, { "epoch": 0.7659167065581618, "grad_norm": 3.3936712741851807, "learning_rate": 6.015000000000001e-06, "loss": 0.24709955215454102, "step": 1600 }, { "epoch": 0.777884155098133, "grad_norm": 2.605344772338867, "learning_rate": 5.64e-06, "loss": 0.23129446029663087, "step": 1625 }, { "epoch": 0.7898516036381044, "grad_norm": 2.9431045055389404, "learning_rate": 5.2649999999999996e-06, "loss": 0.241181640625, "step": 1650 }, { "epoch": 0.8018190521780756, "grad_norm": 3.2949025630950928, "learning_rate": 4.890000000000001e-06, "loss": 0.24215137481689453, "step": 1675 }, { "epoch": 0.8137865007180469, "grad_norm": 3.0328359603881836, "learning_rate": 4.515e-06, "loss": 0.2238747787475586, "step": 1700 }, { "epoch": 0.8257539492580181, "grad_norm": 3.025641679763794, "learning_rate": 4.14e-06, "loss": 0.2663035774230957, "step": 1725 }, { "epoch": 0.8377213977979895, "grad_norm": 2.0968775749206543, "learning_rate": 3.765e-06, "loss": 0.22664173126220702, "step": 1750 }, { "epoch": 0.8496888463379607, "grad_norm": 2.3551278114318848, "learning_rate": 3.39e-06, "loss": 0.24346946716308593, "step": 1775 }, { "epoch": 0.861656294877932, "grad_norm": 2.2398862838745117, "learning_rate": 3.0150000000000004e-06, "loss": 0.22162725448608397, "step": 1800 }, { "epoch": 0.8736237434179033, "grad_norm": 2.8981614112854004, "learning_rate": 2.6399999999999997e-06, "loss": 0.2262067985534668, "step": 1825 }, { "epoch": 0.8855911919578746, "grad_norm": 2.4004294872283936, "learning_rate": 2.265e-06, "loss": 0.26730960845947266, "step": 1850 }, { "epoch": 0.8975586404978458, "grad_norm": 2.969921112060547, "learning_rate": 1.8900000000000001e-06, "loss": 0.21616565704345703, "step": 1875 }, { "epoch": 0.9095260890378172, "grad_norm": 2.837693452835083, "learning_rate": 1.5150000000000001e-06, "loss": 0.23662687301635743, "step": 1900 }, { "epoch": 0.9214935375777884, "grad_norm": 2.973127841949463, "learning_rate": 1.14e-06, "loss": 0.22590934753417968, "step": 1925 }, { "epoch": 0.9334609861177597, "grad_norm": 3.1667377948760986, "learning_rate": 7.65e-07, "loss": 0.2051544952392578, "step": 1950 }, { "epoch": 0.945428434657731, "grad_norm": 2.8789992332458496, "learning_rate": 3.8999999999999997e-07, "loss": 0.22102611541748046, "step": 1975 }, { "epoch": 0.9573958831977023, "grad_norm": 2.393117904663086, "learning_rate": 1.5000000000000002e-08, "loss": 0.21713571548461913, "step": 2000 } ], "logging_steps": 25, "max_steps": 2000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 4.61736640512e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }