{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 8.0, "eval_steps": 500, "global_step": 29352, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.0396083772182465, "epoch": 0.002725538293813028, "grad_norm": 5.405938148498535, "learning_rate": 3.2703488372093024e-07, "loss": 1.8885, "mean_token_accuracy": 0.6852266788482666, "num_tokens": 711886.0, "step": 10 }, { "entropy": 1.0463788136839867, "epoch": 0.005451076587626056, "grad_norm": 5.517510890960693, "learning_rate": 6.904069767441861e-07, "loss": 1.8765, "mean_token_accuracy": 0.680418786406517, "num_tokens": 1416062.0, "step": 20 }, { "entropy": 1.0476338595151902, "epoch": 0.008176614881439084, "grad_norm": 1.9664850234985352, "learning_rate": 1.0537790697674419e-06, "loss": 1.7861, "mean_token_accuracy": 0.6949809923768043, "num_tokens": 2149938.0, "step": 30 }, { "entropy": 1.0441522210836411, "epoch": 0.010902153175252113, "grad_norm": 0.7536147832870483, "learning_rate": 1.4171511627906977e-06, "loss": 1.7475, "mean_token_accuracy": 0.6960390791296959, "num_tokens": 2859500.0, "step": 40 }, { "entropy": 1.020177149772644, "epoch": 0.01362769146906514, "grad_norm": 0.7229697108268738, "learning_rate": 1.7805232558139537e-06, "loss": 1.6856, "mean_token_accuracy": 0.7006200030446053, "num_tokens": 3568762.0, "step": 50 }, { "entropy": 1.0083495900034904, "epoch": 0.016353229762878167, "grad_norm": 0.5624799728393555, "learning_rate": 2.1438953488372095e-06, "loss": 1.6417, "mean_token_accuracy": 0.7085390493273735, "num_tokens": 4288749.0, "step": 60 }, { "entropy": 1.0113003820180893, "epoch": 0.019078768056691196, "grad_norm": 0.4210813045501709, "learning_rate": 2.5072674418604653e-06, "loss": 1.6123, "mean_token_accuracy": 0.7114065825939179, "num_tokens": 5021234.0, "step": 70 }, { "entropy": 1.0052868500351906, "epoch": 0.021804306350504225, "grad_norm": 0.642890214920044, "learning_rate": 2.870639534883721e-06, "loss": 1.5838, "mean_token_accuracy": 0.7120683744549752, "num_tokens": 5739006.0, "step": 80 }, { "entropy": 1.009394559264183, "epoch": 0.024529844644317254, "grad_norm": 0.47518935799598694, "learning_rate": 3.2340116279069773e-06, "loss": 1.5737, "mean_token_accuracy": 0.722443425655365, "num_tokens": 6477781.0, "step": 90 }, { "entropy": 1.0062545910477638, "epoch": 0.02725538293813028, "grad_norm": 0.5360950231552124, "learning_rate": 3.597383720930233e-06, "loss": 1.5498, "mean_token_accuracy": 0.7235137611627579, "num_tokens": 7213793.0, "step": 100 }, { "entropy": 1.0027928322553634, "epoch": 0.02998092123194331, "grad_norm": 0.7297307252883911, "learning_rate": 3.960755813953489e-06, "loss": 1.5363, "mean_token_accuracy": 0.7214894682168961, "num_tokens": 7936928.0, "step": 110 }, { "entropy": 1.0116635337471962, "epoch": 0.032706459525756335, "grad_norm": 0.5194182991981506, "learning_rate": 4.324127906976744e-06, "loss": 1.5155, "mean_token_accuracy": 0.7188240200281143, "num_tokens": 8650197.0, "step": 120 }, { "entropy": 1.0116185247898102, "epoch": 0.035431997819569364, "grad_norm": 0.6806616187095642, "learning_rate": 4.6875000000000004e-06, "loss": 1.5082, "mean_token_accuracy": 0.7230221316218376, "num_tokens": 9375831.0, "step": 130 }, { "entropy": 1.001607432961464, "epoch": 0.03815753611338239, "grad_norm": 0.6176725029945374, "learning_rate": 5.050872093023256e-06, "loss": 1.4882, "mean_token_accuracy": 0.7240102514624596, "num_tokens": 10093736.0, "step": 140 }, { "entropy": 1.0051208674907683, "epoch": 0.04088307440719542, "grad_norm": 0.6676029562950134, "learning_rate": 5.414244186046512e-06, "loss": 1.4921, "mean_token_accuracy": 0.7243235290050507, "num_tokens": 10817100.0, "step": 150 }, { "entropy": 1.0007067069411277, "epoch": 0.04360861270100845, "grad_norm": 0.578899621963501, "learning_rate": 5.777616279069767e-06, "loss": 1.4764, "mean_token_accuracy": 0.7260746091604233, "num_tokens": 11528126.0, "step": 160 }, { "entropy": 1.001201516389847, "epoch": 0.04633415099482148, "grad_norm": 0.5769525170326233, "learning_rate": 6.140988372093024e-06, "loss": 1.4712, "mean_token_accuracy": 0.7269342973828316, "num_tokens": 12260702.0, "step": 170 }, { "entropy": 1.0025376126170158, "epoch": 0.04905968928863451, "grad_norm": 0.6673255562782288, "learning_rate": 6.50436046511628e-06, "loss": 1.4798, "mean_token_accuracy": 0.7271475344896317, "num_tokens": 12983673.0, "step": 180 }, { "entropy": 0.9962176263332367, "epoch": 0.05178522758244753, "grad_norm": 0.8359505534172058, "learning_rate": 6.867732558139535e-06, "loss": 1.4674, "mean_token_accuracy": 0.725401483476162, "num_tokens": 13688416.0, "step": 190 }, { "entropy": 0.9942928344011307, "epoch": 0.05451076587626056, "grad_norm": 0.6369069814682007, "learning_rate": 7.231104651162791e-06, "loss": 1.4617, "mean_token_accuracy": 0.7302308842539788, "num_tokens": 14403522.0, "step": 200 }, { "entropy": 0.9998625546693802, "epoch": 0.05723630417007359, "grad_norm": 0.9715228080749512, "learning_rate": 7.594476744186047e-06, "loss": 1.4703, "mean_token_accuracy": 0.7334344819188118, "num_tokens": 15133763.0, "step": 210 }, { "entropy": 0.9997459784150123, "epoch": 0.05996184246388662, "grad_norm": 0.7882207036018372, "learning_rate": 7.957848837209303e-06, "loss": 1.462, "mean_token_accuracy": 0.727087727189064, "num_tokens": 15854077.0, "step": 220 }, { "entropy": 0.9903041675686837, "epoch": 0.06268738075769964, "grad_norm": 0.8622173070907593, "learning_rate": 8.321220930232558e-06, "loss": 1.461, "mean_token_accuracy": 0.7340906202793122, "num_tokens": 16577544.0, "step": 230 }, { "entropy": 1.0018442422151566, "epoch": 0.06541291905151267, "grad_norm": 0.8568950891494751, "learning_rate": 8.684593023255814e-06, "loss": 1.4658, "mean_token_accuracy": 0.7301117062568665, "num_tokens": 17310778.0, "step": 240 }, { "entropy": 0.9931416124105453, "epoch": 0.0681384573453257, "grad_norm": 0.7365680932998657, "learning_rate": 9.04796511627907e-06, "loss": 1.461, "mean_token_accuracy": 0.7339939594268798, "num_tokens": 18037717.0, "step": 250 }, { "entropy": 0.9978902578353882, "epoch": 0.07086399563913873, "grad_norm": 0.5008879899978638, "learning_rate": 9.411337209302326e-06, "loss": 1.4587, "mean_token_accuracy": 0.7276411607861519, "num_tokens": 18740674.0, "step": 260 }, { "entropy": 1.0006747156381608, "epoch": 0.07358953393295176, "grad_norm": 0.6403897404670715, "learning_rate": 9.77470930232558e-06, "loss": 1.4539, "mean_token_accuracy": 0.729505018889904, "num_tokens": 19469047.0, "step": 270 }, { "entropy": 0.999770636856556, "epoch": 0.07631507222676479, "grad_norm": 0.640429675579071, "learning_rate": 1.0138081395348837e-05, "loss": 1.4655, "mean_token_accuracy": 0.7282736241817475, "num_tokens": 20178240.0, "step": 280 }, { "entropy": 0.9961532056331635, "epoch": 0.07904061052057781, "grad_norm": 0.5266719460487366, "learning_rate": 1.0501453488372095e-05, "loss": 1.4558, "mean_token_accuracy": 0.7296340927481652, "num_tokens": 20889492.0, "step": 290 }, { "entropy": 0.9954295739531517, "epoch": 0.08176614881439084, "grad_norm": 0.8393326997756958, "learning_rate": 1.086482558139535e-05, "loss": 1.4485, "mean_token_accuracy": 0.7313675001263619, "num_tokens": 21612600.0, "step": 300 }, { "entropy": 0.9983824446797371, "epoch": 0.08449168710820387, "grad_norm": 0.5021800994873047, "learning_rate": 1.1228197674418606e-05, "loss": 1.456, "mean_token_accuracy": 0.7298679947853088, "num_tokens": 22331792.0, "step": 310 }, { "entropy": 0.9956601366400719, "epoch": 0.0872172254020169, "grad_norm": 0.48453429341316223, "learning_rate": 1.159156976744186e-05, "loss": 1.4574, "mean_token_accuracy": 0.7311487272381783, "num_tokens": 23042188.0, "step": 320 }, { "entropy": 0.9930527314543725, "epoch": 0.08994276369582993, "grad_norm": 0.5262903571128845, "learning_rate": 1.1954941860465118e-05, "loss": 1.4524, "mean_token_accuracy": 0.7352466434240341, "num_tokens": 23767525.0, "step": 330 }, { "entropy": 1.0016896530985833, "epoch": 0.09266830198964296, "grad_norm": 0.5496646761894226, "learning_rate": 1.2318313953488372e-05, "loss": 1.4541, "mean_token_accuracy": 0.7287753179669381, "num_tokens": 24484817.0, "step": 340 }, { "entropy": 0.9894623726606369, "epoch": 0.09539384028345599, "grad_norm": 0.4871159791946411, "learning_rate": 1.2681686046511629e-05, "loss": 1.4469, "mean_token_accuracy": 0.7348430410027504, "num_tokens": 25215335.0, "step": 350 }, { "entropy": 0.9919575676321983, "epoch": 0.09811937857726902, "grad_norm": 0.5147045850753784, "learning_rate": 1.3045058139534885e-05, "loss": 1.4484, "mean_token_accuracy": 0.7358337089419364, "num_tokens": 25947042.0, "step": 360 }, { "entropy": 0.997435276210308, "epoch": 0.10084491687108203, "grad_norm": 0.5011497139930725, "learning_rate": 1.340843023255814e-05, "loss": 1.4594, "mean_token_accuracy": 0.7311121672391891, "num_tokens": 26657723.0, "step": 370 }, { "entropy": 0.9983295291662216, "epoch": 0.10357045516489506, "grad_norm": 0.7181002497673035, "learning_rate": 1.3771802325581396e-05, "loss": 1.4636, "mean_token_accuracy": 0.7269156962633133, "num_tokens": 27371239.0, "step": 380 }, { "entropy": 1.0010447755455971, "epoch": 0.10629599345870809, "grad_norm": 0.5289329290390015, "learning_rate": 1.4135174418604652e-05, "loss": 1.4527, "mean_token_accuracy": 0.7297766819596291, "num_tokens": 28080993.0, "step": 390 }, { "entropy": 1.0036471426486968, "epoch": 0.10902153175252112, "grad_norm": 0.5319470167160034, "learning_rate": 1.4498546511627908e-05, "loss": 1.4658, "mean_token_accuracy": 0.7272291526198387, "num_tokens": 28788262.0, "step": 400 }, { "entropy": 0.9968745350837708, "epoch": 0.11174707004633415, "grad_norm": 0.9511128067970276, "learning_rate": 1.4861918604651163e-05, "loss": 1.4558, "mean_token_accuracy": 0.7349012956023216, "num_tokens": 29521970.0, "step": 410 }, { "entropy": 0.9982865825295448, "epoch": 0.11447260834014718, "grad_norm": 0.44772422313690186, "learning_rate": 1.5225290697674419e-05, "loss": 1.4502, "mean_token_accuracy": 0.7337453439831734, "num_tokens": 30246421.0, "step": 420 }, { "entropy": 1.0040655449032783, "epoch": 0.1171981466339602, "grad_norm": 0.41664543747901917, "learning_rate": 1.5588662790697675e-05, "loss": 1.4619, "mean_token_accuracy": 0.7275902599096298, "num_tokens": 30948758.0, "step": 430 }, { "entropy": 0.9926177501678467, "epoch": 0.11992368492777324, "grad_norm": 0.4886620044708252, "learning_rate": 1.595203488372093e-05, "loss": 1.4539, "mean_token_accuracy": 0.7322545900940896, "num_tokens": 31651728.0, "step": 440 }, { "entropy": 0.9997780650854111, "epoch": 0.12264922322158626, "grad_norm": 0.4385494887828827, "learning_rate": 1.6315406976744187e-05, "loss": 1.4608, "mean_token_accuracy": 0.7317872077226639, "num_tokens": 32363433.0, "step": 450 }, { "entropy": 0.9970521241426468, "epoch": 0.12537476151539928, "grad_norm": 0.42223232984542847, "learning_rate": 1.667877906976744e-05, "loss": 1.4553, "mean_token_accuracy": 0.7333403721451759, "num_tokens": 33077842.0, "step": 460 }, { "entropy": 1.00070518553257, "epoch": 0.1281002998092123, "grad_norm": 0.3606317639350891, "learning_rate": 1.70421511627907e-05, "loss": 1.4565, "mean_token_accuracy": 0.7299782425165177, "num_tokens": 33790314.0, "step": 470 }, { "entropy": 0.9955750495195389, "epoch": 0.13082583810302534, "grad_norm": 0.5059699416160583, "learning_rate": 1.7405523255813956e-05, "loss": 1.4453, "mean_token_accuracy": 0.7349987089633941, "num_tokens": 34520367.0, "step": 480 }, { "entropy": 0.9910548433661461, "epoch": 0.13355137639683837, "grad_norm": 0.3608299493789673, "learning_rate": 1.7768895348837212e-05, "loss": 1.4486, "mean_token_accuracy": 0.7293318182229995, "num_tokens": 35227706.0, "step": 490 }, { "entropy": 0.9997168734669686, "epoch": 0.1362769146906514, "grad_norm": 0.4888944923877716, "learning_rate": 1.8132267441860465e-05, "loss": 1.4487, "mean_token_accuracy": 0.7292981430888176, "num_tokens": 35943623.0, "step": 500 }, { "entropy": 0.9843390792608261, "epoch": 0.13900245298446443, "grad_norm": 0.44995641708374023, "learning_rate": 1.849563953488372e-05, "loss": 1.4392, "mean_token_accuracy": 0.7392399966716766, "num_tokens": 36675247.0, "step": 510 }, { "entropy": 0.9930981233716011, "epoch": 0.14172799127827745, "grad_norm": 0.6165155172348022, "learning_rate": 1.8859011627906978e-05, "loss": 1.4444, "mean_token_accuracy": 0.7339754477143288, "num_tokens": 37402108.0, "step": 520 }, { "entropy": 0.9964079529047012, "epoch": 0.14445352957209048, "grad_norm": 0.5399088859558105, "learning_rate": 1.9222383720930234e-05, "loss": 1.4563, "mean_token_accuracy": 0.7294779628515243, "num_tokens": 38109593.0, "step": 530 }, { "entropy": 0.984428557753563, "epoch": 0.1471790678659035, "grad_norm": 0.6215316653251648, "learning_rate": 1.9585755813953487e-05, "loss": 1.4321, "mean_token_accuracy": 0.737668377161026, "num_tokens": 38836506.0, "step": 540 }, { "entropy": 0.9932869285345077, "epoch": 0.14990460615971654, "grad_norm": 1.7897403240203857, "learning_rate": 1.9949127906976743e-05, "loss": 1.4469, "mean_token_accuracy": 0.7332193359732628, "num_tokens": 39552077.0, "step": 550 }, { "entropy": 0.9968496710062027, "epoch": 0.15263014445352957, "grad_norm": 0.7561520934104919, "learning_rate": 2.0312500000000002e-05, "loss": 1.4546, "mean_token_accuracy": 0.7331880688667297, "num_tokens": 40276845.0, "step": 560 }, { "entropy": 0.9941284239292145, "epoch": 0.1553556827473426, "grad_norm": 0.5177472829818726, "learning_rate": 2.067587209302326e-05, "loss": 1.4509, "mean_token_accuracy": 0.7373390078544617, "num_tokens": 40999687.0, "step": 570 }, { "entropy": 0.995505753159523, "epoch": 0.15808122104115563, "grad_norm": 0.384387731552124, "learning_rate": 2.1039244186046515e-05, "loss": 1.4522, "mean_token_accuracy": 0.7329975292086601, "num_tokens": 41709294.0, "step": 580 }, { "entropy": 0.9965997755527496, "epoch": 0.16080675933496866, "grad_norm": 0.4045581817626953, "learning_rate": 2.1402616279069768e-05, "loss": 1.4433, "mean_token_accuracy": 0.7339462488889694, "num_tokens": 42431630.0, "step": 590 }, { "entropy": 0.986753125488758, "epoch": 0.1635322976287817, "grad_norm": 0.3861728310585022, "learning_rate": 2.1765988372093024e-05, "loss": 1.4383, "mean_token_accuracy": 0.7369671985507011, "num_tokens": 43156812.0, "step": 600 }, { "entropy": 0.9907051742076873, "epoch": 0.16625783592259472, "grad_norm": 0.3145368695259094, "learning_rate": 2.212936046511628e-05, "loss": 1.4497, "mean_token_accuracy": 0.7377771839499474, "num_tokens": 43878714.0, "step": 610 }, { "entropy": 0.9945615753531456, "epoch": 0.16898337421640774, "grad_norm": 0.4484099745750427, "learning_rate": 2.2492732558139536e-05, "loss": 1.4465, "mean_token_accuracy": 0.732744038105011, "num_tokens": 44596974.0, "step": 620 }, { "entropy": 0.9958405807614327, "epoch": 0.17170891251022077, "grad_norm": 0.31601184606552124, "learning_rate": 2.285610465116279e-05, "loss": 1.4523, "mean_token_accuracy": 0.7347798213362694, "num_tokens": 45317391.0, "step": 630 }, { "entropy": 0.9867362692952156, "epoch": 0.1744344508040338, "grad_norm": 0.4932362139225006, "learning_rate": 2.321947674418605e-05, "loss": 1.4267, "mean_token_accuracy": 0.7379182651638985, "num_tokens": 46043618.0, "step": 640 }, { "entropy": 0.9920970141887665, "epoch": 0.17715998909784683, "grad_norm": 0.3708631098270416, "learning_rate": 2.3582848837209305e-05, "loss": 1.4486, "mean_token_accuracy": 0.7326340481638909, "num_tokens": 46759967.0, "step": 650 }, { "entropy": 0.989774090051651, "epoch": 0.17988552739165986, "grad_norm": 0.3645494878292084, "learning_rate": 2.394622093023256e-05, "loss": 1.4442, "mean_token_accuracy": 0.732268339395523, "num_tokens": 47473139.0, "step": 660 }, { "entropy": 0.9853468403220177, "epoch": 0.1826110656854729, "grad_norm": 0.32583683729171753, "learning_rate": 2.4309593023255814e-05, "loss": 1.4319, "mean_token_accuracy": 0.737530317902565, "num_tokens": 48201841.0, "step": 670 }, { "entropy": 0.9894756719470024, "epoch": 0.18533660397928592, "grad_norm": 0.3289868235588074, "learning_rate": 2.467296511627907e-05, "loss": 1.4426, "mean_token_accuracy": 0.7325257658958435, "num_tokens": 48908078.0, "step": 680 }, { "entropy": 0.98998514264822, "epoch": 0.18806214227309895, "grad_norm": 0.36332690715789795, "learning_rate": 2.5036337209302323e-05, "loss": 1.4361, "mean_token_accuracy": 0.7376216873526573, "num_tokens": 49638103.0, "step": 690 }, { "entropy": 0.9941335126757622, "epoch": 0.19078768056691198, "grad_norm": 0.34593939781188965, "learning_rate": 2.539970930232558e-05, "loss": 1.4457, "mean_token_accuracy": 0.7329727828502655, "num_tokens": 50354451.0, "step": 700 }, { "entropy": 0.9875242754817009, "epoch": 0.193513218860725, "grad_norm": 0.4945123493671417, "learning_rate": 2.5763081395348836e-05, "loss": 1.4405, "mean_token_accuracy": 0.7297769740223885, "num_tokens": 51051389.0, "step": 710 }, { "entropy": 0.9995409071445465, "epoch": 0.19623875715453803, "grad_norm": 0.38803181052207947, "learning_rate": 2.6126453488372095e-05, "loss": 1.4599, "mean_token_accuracy": 0.7296995922923089, "num_tokens": 51753445.0, "step": 720 }, { "entropy": 0.9887203484773636, "epoch": 0.19896429544835104, "grad_norm": 0.3487159013748169, "learning_rate": 2.648982558139535e-05, "loss": 1.447, "mean_token_accuracy": 0.732439212501049, "num_tokens": 52465342.0, "step": 730 }, { "entropy": 0.9897234991192818, "epoch": 0.20168983374216407, "grad_norm": 0.36995023488998413, "learning_rate": 2.6853197674418608e-05, "loss": 1.4405, "mean_token_accuracy": 0.732276639342308, "num_tokens": 53170427.0, "step": 740 }, { "entropy": 0.9915264055132866, "epoch": 0.2044153720359771, "grad_norm": 0.853056013584137, "learning_rate": 2.7216569767441864e-05, "loss": 1.437, "mean_token_accuracy": 0.7340640306472779, "num_tokens": 53889451.0, "step": 750 }, { "entropy": 0.9999772995710373, "epoch": 0.20714091032979012, "grad_norm": 0.38552534580230713, "learning_rate": 2.757994186046512e-05, "loss": 1.4522, "mean_token_accuracy": 0.7337017595767975, "num_tokens": 54615816.0, "step": 760 }, { "entropy": 0.9884057164192199, "epoch": 0.20986644862360315, "grad_norm": 0.5651298761367798, "learning_rate": 2.7943313953488376e-05, "loss": 1.4318, "mean_token_accuracy": 0.7341745033860206, "num_tokens": 55333318.0, "step": 770 }, { "entropy": 0.9878245323896409, "epoch": 0.21259198691741618, "grad_norm": 0.4521214962005615, "learning_rate": 2.8306686046511626e-05, "loss": 1.4445, "mean_token_accuracy": 0.7352827414870262, "num_tokens": 56063608.0, "step": 780 }, { "entropy": 0.9913873270153999, "epoch": 0.2153175252112292, "grad_norm": 0.3069559633731842, "learning_rate": 2.8670058139534882e-05, "loss": 1.4367, "mean_token_accuracy": 0.7377872183918953, "num_tokens": 56790304.0, "step": 790 }, { "entropy": 0.994021512567997, "epoch": 0.21804306350504224, "grad_norm": 0.3060591220855713, "learning_rate": 2.9033430232558138e-05, "loss": 1.4443, "mean_token_accuracy": 0.7326282814145089, "num_tokens": 57505532.0, "step": 800 }, { "entropy": 0.986484457552433, "epoch": 0.22076860179885527, "grad_norm": 0.31218984723091125, "learning_rate": 2.9396802325581398e-05, "loss": 1.4372, "mean_token_accuracy": 0.7342789217829704, "num_tokens": 58220392.0, "step": 810 }, { "entropy": 0.9901561468839646, "epoch": 0.2234941400926683, "grad_norm": 0.3456006944179535, "learning_rate": 2.9760174418604654e-05, "loss": 1.4398, "mean_token_accuracy": 0.7340988770127297, "num_tokens": 58949816.0, "step": 820 }, { "entropy": 0.9948469802737236, "epoch": 0.22621967838648133, "grad_norm": 0.32412171363830566, "learning_rate": 3.012354651162791e-05, "loss": 1.4511, "mean_token_accuracy": 0.7328571319580078, "num_tokens": 59666066.0, "step": 830 }, { "entropy": 0.9963825002312661, "epoch": 0.22894521668029436, "grad_norm": 1.0188618898391724, "learning_rate": 3.0486918604651166e-05, "loss": 1.4426, "mean_token_accuracy": 0.730763690173626, "num_tokens": 60371355.0, "step": 840 }, { "entropy": 0.9887682050466537, "epoch": 0.23167075497410738, "grad_norm": 0.3284507095813751, "learning_rate": 3.085029069767442e-05, "loss": 1.4462, "mean_token_accuracy": 0.7367573201656341, "num_tokens": 61085148.0, "step": 850 }, { "entropy": 0.9956839889287948, "epoch": 0.2343962932679204, "grad_norm": 0.25505349040031433, "learning_rate": 3.121366279069768e-05, "loss": 1.4404, "mean_token_accuracy": 0.7327555000782013, "num_tokens": 61814554.0, "step": 860 }, { "entropy": 0.9931179091334343, "epoch": 0.23712183156173344, "grad_norm": 0.3233283460140228, "learning_rate": 3.157703488372093e-05, "loss": 1.4413, "mean_token_accuracy": 0.7317927330732346, "num_tokens": 62530557.0, "step": 870 }, { "entropy": 0.9981883198022843, "epoch": 0.23984736985554647, "grad_norm": 0.32246145606040955, "learning_rate": 3.1940406976744184e-05, "loss": 1.4506, "mean_token_accuracy": 0.7342352598905564, "num_tokens": 63245409.0, "step": 880 }, { "entropy": 0.995264945924282, "epoch": 0.2425729081493595, "grad_norm": 0.3850777745246887, "learning_rate": 3.2303779069767444e-05, "loss": 1.4388, "mean_token_accuracy": 0.7324204593896866, "num_tokens": 63960114.0, "step": 890 }, { "entropy": 0.9954063668847084, "epoch": 0.24529844644317253, "grad_norm": 0.22569897770881653, "learning_rate": 3.26671511627907e-05, "loss": 1.4422, "mean_token_accuracy": 0.7323945328593254, "num_tokens": 64684427.0, "step": 900 }, { "entropy": 0.9864580750465393, "epoch": 0.24802398473698556, "grad_norm": 0.20401442050933838, "learning_rate": 3.3030523255813956e-05, "loss": 1.4299, "mean_token_accuracy": 0.7411849647760391, "num_tokens": 65428854.0, "step": 910 }, { "entropy": 0.9876022458076477, "epoch": 0.25074952303079856, "grad_norm": 0.29853373765945435, "learning_rate": 3.339389534883721e-05, "loss": 1.4353, "mean_token_accuracy": 0.7375764057040215, "num_tokens": 66153399.0, "step": 920 }, { "entropy": 0.999330484867096, "epoch": 0.2534750613246116, "grad_norm": 0.2890157699584961, "learning_rate": 3.375726744186047e-05, "loss": 1.4528, "mean_token_accuracy": 0.7318306133151055, "num_tokens": 66862350.0, "step": 930 }, { "entropy": 0.9852076366543769, "epoch": 0.2562005996184246, "grad_norm": 0.2660386860370636, "learning_rate": 3.412063953488372e-05, "loss": 1.4284, "mean_token_accuracy": 0.7362406551837921, "num_tokens": 67585898.0, "step": 940 }, { "entropy": 0.9841386467218399, "epoch": 0.2589261379122377, "grad_norm": 0.4517176151275635, "learning_rate": 3.4484011627906975e-05, "loss": 1.4237, "mean_token_accuracy": 0.7396635293960572, "num_tokens": 68315323.0, "step": 950 }, { "entropy": 0.9917329683899879, "epoch": 0.2616516762060507, "grad_norm": 0.23541152477264404, "learning_rate": 3.4847383720930234e-05, "loss": 1.442, "mean_token_accuracy": 0.729252065718174, "num_tokens": 69017614.0, "step": 960 }, { "entropy": 0.9919871062040329, "epoch": 0.26437721449986373, "grad_norm": 0.26427310705184937, "learning_rate": 3.521075581395349e-05, "loss": 1.4444, "mean_token_accuracy": 0.7352699220180512, "num_tokens": 69740747.0, "step": 970 }, { "entropy": 0.9945264115929604, "epoch": 0.26710275279367673, "grad_norm": 0.3032136559486389, "learning_rate": 3.5574127906976747e-05, "loss": 1.4425, "mean_token_accuracy": 0.7310560792684555, "num_tokens": 70457628.0, "step": 980 }, { "entropy": 0.9931428045034408, "epoch": 0.2698282910874898, "grad_norm": 0.32616934180259705, "learning_rate": 3.59375e-05, "loss": 1.4412, "mean_token_accuracy": 0.7312234610319137, "num_tokens": 71172680.0, "step": 990 }, { "entropy": 0.9885409861803055, "epoch": 0.2725538293813028, "grad_norm": 0.48906901478767395, "learning_rate": 3.630087209302326e-05, "loss": 1.4289, "mean_token_accuracy": 0.7374913066625595, "num_tokens": 71893680.0, "step": 1000 }, { "entropy": 0.9969916045665741, "epoch": 0.27527936767511585, "grad_norm": 0.24646152555942535, "learning_rate": 3.666424418604651e-05, "loss": 1.4385, "mean_token_accuracy": 0.7325153753161431, "num_tokens": 72614213.0, "step": 1010 }, { "entropy": 0.9937289983034134, "epoch": 0.27800490596892885, "grad_norm": 0.4907693862915039, "learning_rate": 3.702761627906977e-05, "loss": 1.439, "mean_token_accuracy": 0.7257880479097366, "num_tokens": 73312163.0, "step": 1020 }, { "entropy": 0.9726315110921859, "epoch": 0.2807304442627419, "grad_norm": 0.3276204466819763, "learning_rate": 3.7390988372093024e-05, "loss": 1.4218, "mean_token_accuracy": 0.7396723493933678, "num_tokens": 74032914.0, "step": 1030 }, { "entropy": 0.9983386799693108, "epoch": 0.2834559825565549, "grad_norm": 0.29827114939689636, "learning_rate": 3.775436046511628e-05, "loss": 1.4417, "mean_token_accuracy": 0.7349489763379097, "num_tokens": 74750343.0, "step": 1040 }, { "entropy": 0.9868063226342201, "epoch": 0.28618152085036797, "grad_norm": 0.2375505566596985, "learning_rate": 3.811773255813954e-05, "loss": 1.4362, "mean_token_accuracy": 0.7375910192728042, "num_tokens": 75472802.0, "step": 1050 }, { "entropy": 0.9938691481947899, "epoch": 0.28890705914418097, "grad_norm": 0.2215590924024582, "learning_rate": 3.848110465116279e-05, "loss": 1.4346, "mean_token_accuracy": 0.7330907583236694, "num_tokens": 76195299.0, "step": 1060 }, { "entropy": 0.9908524438738823, "epoch": 0.291632597437994, "grad_norm": 0.21515017747879028, "learning_rate": 3.884447674418605e-05, "loss": 1.4348, "mean_token_accuracy": 0.7335933834314347, "num_tokens": 76915756.0, "step": 1070 }, { "entropy": 0.9933411166071892, "epoch": 0.294358135731807, "grad_norm": 0.2014913111925125, "learning_rate": 3.92078488372093e-05, "loss": 1.4381, "mean_token_accuracy": 0.7324068695306778, "num_tokens": 77624920.0, "step": 1080 }, { "entropy": 0.9938898369669914, "epoch": 0.2970836740256201, "grad_norm": 0.41872668266296387, "learning_rate": 3.957122093023256e-05, "loss": 1.4394, "mean_token_accuracy": 0.7363974317908287, "num_tokens": 78354545.0, "step": 1090 }, { "entropy": 0.9886097267270089, "epoch": 0.2998092123194331, "grad_norm": 0.4530754089355469, "learning_rate": 3.9934593023255814e-05, "loss": 1.432, "mean_token_accuracy": 0.740429712831974, "num_tokens": 79097138.0, "step": 1100 }, { "entropy": 0.9957090765237808, "epoch": 0.30253475061324614, "grad_norm": 0.29355210065841675, "learning_rate": 4.0297965116279074e-05, "loss": 1.4452, "mean_token_accuracy": 0.7312169045209884, "num_tokens": 79802002.0, "step": 1110 }, { "entropy": 0.9857747182250023, "epoch": 0.30526028890705914, "grad_norm": 0.2174595147371292, "learning_rate": 4.066133720930233e-05, "loss": 1.4273, "mean_token_accuracy": 0.7381820440292358, "num_tokens": 80529799.0, "step": 1120 }, { "entropy": 0.9758066356182098, "epoch": 0.3079858272008722, "grad_norm": 0.26723766326904297, "learning_rate": 4.102470930232558e-05, "loss": 1.4239, "mean_token_accuracy": 0.7377608880400658, "num_tokens": 81251980.0, "step": 1130 }, { "entropy": 0.9935255914926528, "epoch": 0.3107113654946852, "grad_norm": 0.21104010939598083, "learning_rate": 4.138808139534884e-05, "loss": 1.4367, "mean_token_accuracy": 0.7398475959897042, "num_tokens": 81996411.0, "step": 1140 }, { "entropy": 0.9991440311074257, "epoch": 0.31343690378849826, "grad_norm": 0.28874218463897705, "learning_rate": 4.175145348837209e-05, "loss": 1.4452, "mean_token_accuracy": 0.7331483393907547, "num_tokens": 82707313.0, "step": 1150 }, { "entropy": 0.9936499938368797, "epoch": 0.31616244208231126, "grad_norm": 0.22870078682899475, "learning_rate": 4.211482558139535e-05, "loss": 1.4373, "mean_token_accuracy": 0.7290183573961257, "num_tokens": 83410115.0, "step": 1160 }, { "entropy": 0.984348925948143, "epoch": 0.31888798037612426, "grad_norm": 0.4662875831127167, "learning_rate": 4.2478197674418604e-05, "loss": 1.4237, "mean_token_accuracy": 0.739226421713829, "num_tokens": 84141229.0, "step": 1170 }, { "entropy": 0.9941943392157555, "epoch": 0.3216135186699373, "grad_norm": 0.2791188061237335, "learning_rate": 4.2841569767441864e-05, "loss": 1.4402, "mean_token_accuracy": 0.7304043978452682, "num_tokens": 84853257.0, "step": 1180 }, { "entropy": 0.9998081073164939, "epoch": 0.3243390569637503, "grad_norm": 0.523344874382019, "learning_rate": 4.320494186046512e-05, "loss": 1.4393, "mean_token_accuracy": 0.7313911184668541, "num_tokens": 85569444.0, "step": 1190 }, { "entropy": 0.9841462850570679, "epoch": 0.3270645952575634, "grad_norm": 0.2346402406692505, "learning_rate": 4.3568313953488377e-05, "loss": 1.4256, "mean_token_accuracy": 0.7391437903046608, "num_tokens": 86301942.0, "step": 1200 }, { "entropy": 0.9866098940372467, "epoch": 0.3297901335513764, "grad_norm": 0.28725212812423706, "learning_rate": 4.393168604651163e-05, "loss": 1.4348, "mean_token_accuracy": 0.7339578330516815, "num_tokens": 87021466.0, "step": 1210 }, { "entropy": 0.9928266644477844, "epoch": 0.33251567184518943, "grad_norm": 0.2333146333694458, "learning_rate": 4.429505813953488e-05, "loss": 1.4294, "mean_token_accuracy": 0.7346134960651398, "num_tokens": 87750906.0, "step": 1220 }, { "entropy": 0.9935041859745979, "epoch": 0.33524121013900243, "grad_norm": 0.2144048660993576, "learning_rate": 4.465843023255814e-05, "loss": 1.4372, "mean_token_accuracy": 0.7343584313988686, "num_tokens": 88468886.0, "step": 1230 }, { "entropy": 0.9863809257745743, "epoch": 0.3379667484328155, "grad_norm": 0.19342583417892456, "learning_rate": 4.5021802325581395e-05, "loss": 1.4381, "mean_token_accuracy": 0.7397785291075707, "num_tokens": 89192372.0, "step": 1240 }, { "entropy": 0.9911041915416717, "epoch": 0.3406922867266285, "grad_norm": 0.1899794638156891, "learning_rate": 4.5385174418604654e-05, "loss": 1.4318, "mean_token_accuracy": 0.7350430831313133, "num_tokens": 89919594.0, "step": 1250 }, { "entropy": 0.9816926836967468, "epoch": 0.34341782502044155, "grad_norm": 0.24096062779426575, "learning_rate": 4.574854651162791e-05, "loss": 1.428, "mean_token_accuracy": 0.7362191364169121, "num_tokens": 90637594.0, "step": 1260 }, { "entropy": 0.9869430780410766, "epoch": 0.34614336331425455, "grad_norm": 0.1929672807455063, "learning_rate": 4.611191860465117e-05, "loss": 1.4318, "mean_token_accuracy": 0.7313936963677407, "num_tokens": 91349032.0, "step": 1270 }, { "entropy": 0.9814235389232635, "epoch": 0.3488689016080676, "grad_norm": 0.20565539598464966, "learning_rate": 4.6475290697674426e-05, "loss": 1.4309, "mean_token_accuracy": 0.7382841348648072, "num_tokens": 92082961.0, "step": 1280 }, { "entropy": 0.985702796280384, "epoch": 0.3515944399018806, "grad_norm": 0.21981583535671234, "learning_rate": 4.683866279069768e-05, "loss": 1.4291, "mean_token_accuracy": 0.7318273842334747, "num_tokens": 92786151.0, "step": 1290 }, { "entropy": 0.9794762969017029, "epoch": 0.35431997819569366, "grad_norm": 0.4361553192138672, "learning_rate": 4.720203488372093e-05, "loss": 1.4314, "mean_token_accuracy": 0.7368942067027092, "num_tokens": 93503082.0, "step": 1300 }, { "entropy": 0.9880231067538261, "epoch": 0.35704551648950666, "grad_norm": 0.30570775270462036, "learning_rate": 4.7565406976744185e-05, "loss": 1.4348, "mean_token_accuracy": 0.7372220605611801, "num_tokens": 94222464.0, "step": 1310 }, { "entropy": 0.991027458012104, "epoch": 0.3597710547833197, "grad_norm": 0.34112071990966797, "learning_rate": 4.7928779069767444e-05, "loss": 1.4406, "mean_token_accuracy": 0.7324920043349266, "num_tokens": 94925147.0, "step": 1320 }, { "entropy": 0.9888468325138092, "epoch": 0.3624965930771327, "grad_norm": 0.27501174807548523, "learning_rate": 4.82921511627907e-05, "loss": 1.4418, "mean_token_accuracy": 0.7304517835378647, "num_tokens": 95625988.0, "step": 1330 }, { "entropy": 0.9956190213561058, "epoch": 0.3652221313709458, "grad_norm": 0.4416481852531433, "learning_rate": 4.865552325581396e-05, "loss": 1.4316, "mean_token_accuracy": 0.7305059120059013, "num_tokens": 96336107.0, "step": 1340 }, { "entropy": 0.9966611221432686, "epoch": 0.3679476696647588, "grad_norm": 0.5676621794700623, "learning_rate": 4.901889534883721e-05, "loss": 1.4485, "mean_token_accuracy": 0.7301196932792664, "num_tokens": 97043941.0, "step": 1350 }, { "entropy": 0.9922414407134056, "epoch": 0.37067320795857184, "grad_norm": 0.23170824348926544, "learning_rate": 4.938226744186047e-05, "loss": 1.4427, "mean_token_accuracy": 0.733326929807663, "num_tokens": 97755541.0, "step": 1360 }, { "entropy": 0.9969855561852455, "epoch": 0.37339874625238484, "grad_norm": 0.2700681984424591, "learning_rate": 4.974563953488373e-05, "loss": 1.4381, "mean_token_accuracy": 0.7339515954256057, "num_tokens": 98488746.0, "step": 1370 }, { "entropy": 0.9885864198207855, "epoch": 0.3761242845461979, "grad_norm": 0.24769966304302216, "learning_rate": 5.0109011627906975e-05, "loss": 1.4445, "mean_token_accuracy": 0.7381105780601501, "num_tokens": 99213305.0, "step": 1380 }, { "entropy": 0.9947968870401382, "epoch": 0.3788498228400109, "grad_norm": 0.24572551250457764, "learning_rate": 5.047238372093024e-05, "loss": 1.4379, "mean_token_accuracy": 0.7360276535153389, "num_tokens": 99935486.0, "step": 1390 }, { "entropy": 0.9968233689665794, "epoch": 0.38157536113382395, "grad_norm": 0.2169007509946823, "learning_rate": 5.083575581395349e-05, "loss": 1.4434, "mean_token_accuracy": 0.7335814267396927, "num_tokens": 100649239.0, "step": 1400 }, { "entropy": 0.9841761410236358, "epoch": 0.38430089942763695, "grad_norm": 0.28508707880973816, "learning_rate": 5.1199127906976754e-05, "loss": 1.426, "mean_token_accuracy": 0.730169078707695, "num_tokens": 101355919.0, "step": 1410 }, { "entropy": 0.9974832609295845, "epoch": 0.38702643772145, "grad_norm": 0.21387140452861786, "learning_rate": 5.15625e-05, "loss": 1.4303, "mean_token_accuracy": 0.7316822305321693, "num_tokens": 102074622.0, "step": 1420 }, { "entropy": 0.9878896534442901, "epoch": 0.389751976015263, "grad_norm": 0.21567605435848236, "learning_rate": 5.192587209302325e-05, "loss": 1.4277, "mean_token_accuracy": 0.7342279896140098, "num_tokens": 102801841.0, "step": 1430 }, { "entropy": 0.9944760173559188, "epoch": 0.39247751430907607, "grad_norm": 0.2036101371049881, "learning_rate": 5.228924418604651e-05, "loss": 1.4236, "mean_token_accuracy": 0.7351288288831711, "num_tokens": 103529636.0, "step": 1440 }, { "entropy": 0.9866831496357917, "epoch": 0.39520305260288907, "grad_norm": 0.28441524505615234, "learning_rate": 5.2652616279069765e-05, "loss": 1.4264, "mean_token_accuracy": 0.7344724372029304, "num_tokens": 104243246.0, "step": 1450 }, { "entropy": 0.9766260460019112, "epoch": 0.3979285908967021, "grad_norm": 0.23722435534000397, "learning_rate": 5.301598837209303e-05, "loss": 1.4239, "mean_token_accuracy": 0.7368274286389351, "num_tokens": 104948989.0, "step": 1460 }, { "entropy": 0.984954971075058, "epoch": 0.40065412919051513, "grad_norm": 0.31182342767715454, "learning_rate": 5.337936046511628e-05, "loss": 1.4304, "mean_token_accuracy": 0.734859699010849, "num_tokens": 105658858.0, "step": 1470 }, { "entropy": 0.9924835756421089, "epoch": 0.40337966748432813, "grad_norm": 0.2507476508617401, "learning_rate": 5.3742732558139544e-05, "loss": 1.436, "mean_token_accuracy": 0.7331453621387481, "num_tokens": 106382663.0, "step": 1480 }, { "entropy": 0.9932640939950943, "epoch": 0.4061052057781412, "grad_norm": 0.19360320270061493, "learning_rate": 5.410610465116279e-05, "loss": 1.4326, "mean_token_accuracy": 0.7340785205364228, "num_tokens": 107100337.0, "step": 1490 }, { "entropy": 0.9841107860207557, "epoch": 0.4088307440719542, "grad_norm": 0.18797026574611664, "learning_rate": 5.4469476744186056e-05, "loss": 1.4328, "mean_token_accuracy": 0.7359195277094841, "num_tokens": 107815259.0, "step": 1500 }, { "entropy": 0.9935507267713547, "epoch": 0.41155628236576725, "grad_norm": 0.1644987165927887, "learning_rate": 5.48328488372093e-05, "loss": 1.4347, "mean_token_accuracy": 0.7332268089056015, "num_tokens": 108526347.0, "step": 1510 }, { "entropy": 0.9960081830620766, "epoch": 0.41428182065958025, "grad_norm": 0.15973089635372162, "learning_rate": 5.5196220930232555e-05, "loss": 1.4446, "mean_token_accuracy": 0.7294234141707421, "num_tokens": 109227786.0, "step": 1520 }, { "entropy": 0.9813835769891739, "epoch": 0.4170073589533933, "grad_norm": 0.2454165369272232, "learning_rate": 5.555959302325582e-05, "loss": 1.4188, "mean_token_accuracy": 0.7327255427837371, "num_tokens": 109943464.0, "step": 1530 }, { "entropy": 0.9830124020576477, "epoch": 0.4197328972472063, "grad_norm": 0.300631582736969, "learning_rate": 5.592296511627907e-05, "loss": 1.429, "mean_token_accuracy": 0.7393194779753685, "num_tokens": 110673065.0, "step": 1540 }, { "entropy": 0.9851121515035629, "epoch": 0.42245843554101936, "grad_norm": 0.310230553150177, "learning_rate": 5.6286337209302334e-05, "loss": 1.4265, "mean_token_accuracy": 0.7327947586774826, "num_tokens": 111373253.0, "step": 1550 }, { "entropy": 0.9851061567664147, "epoch": 0.42518397383483236, "grad_norm": 0.2734837830066681, "learning_rate": 5.664970930232558e-05, "loss": 1.4317, "mean_token_accuracy": 0.7363707885146141, "num_tokens": 112084685.0, "step": 1560 }, { "entropy": 0.9825420245528221, "epoch": 0.4279095121286454, "grad_norm": 0.1628209948539734, "learning_rate": 5.7013081395348846e-05, "loss": 1.4338, "mean_token_accuracy": 0.7380750298500061, "num_tokens": 112808068.0, "step": 1570 }, { "entropy": 0.9882109865546227, "epoch": 0.4306350504224584, "grad_norm": 0.19374525547027588, "learning_rate": 5.737645348837209e-05, "loss": 1.4334, "mean_token_accuracy": 0.7342119246721268, "num_tokens": 113515057.0, "step": 1580 }, { "entropy": 0.984755776822567, "epoch": 0.4333605887162715, "grad_norm": 0.2155279815196991, "learning_rate": 5.773982558139536e-05, "loss": 1.4251, "mean_token_accuracy": 0.7343093782663346, "num_tokens": 114232069.0, "step": 1590 }, { "entropy": 0.9929274395108223, "epoch": 0.4360861270100845, "grad_norm": 0.4078405797481537, "learning_rate": 5.8103197674418605e-05, "loss": 1.4327, "mean_token_accuracy": 0.7307331010699272, "num_tokens": 114938908.0, "step": 1600 }, { "entropy": 0.9821958124637604, "epoch": 0.43881166530389754, "grad_norm": 0.2290513664484024, "learning_rate": 5.846656976744186e-05, "loss": 1.4327, "mean_token_accuracy": 0.7371584936976433, "num_tokens": 115652920.0, "step": 1610 }, { "entropy": 0.9950265571475029, "epoch": 0.44153720359771054, "grad_norm": 0.2519257068634033, "learning_rate": 5.8829941860465124e-05, "loss": 1.435, "mean_token_accuracy": 0.7324141755700111, "num_tokens": 116363475.0, "step": 1620 }, { "entropy": 0.9973052412271499, "epoch": 0.4442627418915236, "grad_norm": 0.2373785674571991, "learning_rate": 5.919331395348837e-05, "loss": 1.4325, "mean_token_accuracy": 0.7327213540673256, "num_tokens": 117091157.0, "step": 1630 }, { "entropy": 0.9813062354922295, "epoch": 0.4469882801853366, "grad_norm": 0.2199847549200058, "learning_rate": 5.9556686046511636e-05, "loss": 1.4201, "mean_token_accuracy": 0.7371037125587463, "num_tokens": 117809062.0, "step": 1640 }, { "entropy": 0.9898816034197807, "epoch": 0.44971381847914965, "grad_norm": 0.31303584575653076, "learning_rate": 5.992005813953488e-05, "loss": 1.4323, "mean_token_accuracy": 0.7392094865441322, "num_tokens": 118544540.0, "step": 1650 }, { "entropy": 0.9923418626189232, "epoch": 0.45243935677296265, "grad_norm": 0.21581219136714935, "learning_rate": 6.028343023255815e-05, "loss": 1.4337, "mean_token_accuracy": 0.7334046080708504, "num_tokens": 119258189.0, "step": 1660 }, { "entropy": 0.9849744439125061, "epoch": 0.4551648950667757, "grad_norm": 0.2109210193157196, "learning_rate": 6.0646802325581395e-05, "loss": 1.4271, "mean_token_accuracy": 0.7396485283970833, "num_tokens": 119982024.0, "step": 1670 }, { "entropy": 0.9821529731154441, "epoch": 0.4578904333605887, "grad_norm": 0.22036734223365784, "learning_rate": 6.101017441860465e-05, "loss": 1.4222, "mean_token_accuracy": 0.7384767159819603, "num_tokens": 120707990.0, "step": 1680 }, { "entropy": 0.9901896312832832, "epoch": 0.46061597165440177, "grad_norm": 0.19113869965076447, "learning_rate": 6.137354651162791e-05, "loss": 1.4303, "mean_token_accuracy": 0.731666874885559, "num_tokens": 121427857.0, "step": 1690 }, { "entropy": 0.9816726014018059, "epoch": 0.46334150994821477, "grad_norm": 0.20121638476848602, "learning_rate": 6.173691860465116e-05, "loss": 1.4286, "mean_token_accuracy": 0.7375072449445724, "num_tokens": 122141315.0, "step": 1700 }, { "entropy": 0.9800962820649147, "epoch": 0.4660670482420278, "grad_norm": 0.27943041920661926, "learning_rate": 6.210029069767442e-05, "loss": 1.4289, "mean_token_accuracy": 0.735170379281044, "num_tokens": 122845583.0, "step": 1710 }, { "entropy": 0.9852249696850777, "epoch": 0.4687925865358408, "grad_norm": 0.25668081641197205, "learning_rate": 6.246366279069768e-05, "loss": 1.4333, "mean_token_accuracy": 0.7355706915259361, "num_tokens": 123566283.0, "step": 1720 }, { "entropy": 0.9883533254265785, "epoch": 0.4715181248296539, "grad_norm": 0.18696428835391998, "learning_rate": 6.282703488372094e-05, "loss": 1.4323, "mean_token_accuracy": 0.7344200700521469, "num_tokens": 124278516.0, "step": 1730 }, { "entropy": 0.9870807081460953, "epoch": 0.4742436631234669, "grad_norm": 0.19319681823253632, "learning_rate": 6.319040697674419e-05, "loss": 1.4277, "mean_token_accuracy": 0.7365616247057915, "num_tokens": 125010952.0, "step": 1740 }, { "entropy": 0.9897187322378158, "epoch": 0.4769692014172799, "grad_norm": 0.3825794756412506, "learning_rate": 6.355377906976744e-05, "loss": 1.4341, "mean_token_accuracy": 0.7344249919056892, "num_tokens": 125735883.0, "step": 1750 }, { "entropy": 0.9973450332880021, "epoch": 0.47969473971109294, "grad_norm": 0.20322610437870026, "learning_rate": 6.39171511627907e-05, "loss": 1.4361, "mean_token_accuracy": 0.7336152747273446, "num_tokens": 126457176.0, "step": 1760 }, { "entropy": 0.9879305228590965, "epoch": 0.48242027800490594, "grad_norm": 0.16834957897663116, "learning_rate": 6.428052325581395e-05, "loss": 1.4297, "mean_token_accuracy": 0.7342620983719825, "num_tokens": 127178073.0, "step": 1770 }, { "entropy": 0.9840679958462715, "epoch": 0.485145816298719, "grad_norm": 0.38834550976753235, "learning_rate": 6.464389534883721e-05, "loss": 1.4318, "mean_token_accuracy": 0.7370759963989257, "num_tokens": 127898699.0, "step": 1780 }, { "entropy": 0.9803714036941529, "epoch": 0.487871354592532, "grad_norm": 0.2102237194776535, "learning_rate": 6.500726744186047e-05, "loss": 1.4293, "mean_token_accuracy": 0.735047759115696, "num_tokens": 128612251.0, "step": 1790 }, { "entropy": 0.9915691018104553, "epoch": 0.49059689288634506, "grad_norm": 0.16007673740386963, "learning_rate": 6.537063953488373e-05, "loss": 1.4371, "mean_token_accuracy": 0.7352234482765198, "num_tokens": 129329003.0, "step": 1800 }, { "entropy": 0.9829947292804718, "epoch": 0.49332243118015806, "grad_norm": 0.1799066960811615, "learning_rate": 6.573401162790698e-05, "loss": 1.4235, "mean_token_accuracy": 0.7371339723467827, "num_tokens": 130049818.0, "step": 1810 }, { "entropy": 0.9902053967118263, "epoch": 0.4960479694739711, "grad_norm": 0.18206138908863068, "learning_rate": 6.609738372093023e-05, "loss": 1.4363, "mean_token_accuracy": 0.7356316760182381, "num_tokens": 130770612.0, "step": 1820 }, { "entropy": 0.981654267013073, "epoch": 0.4987735077677841, "grad_norm": 0.288813978433609, "learning_rate": 6.64607558139535e-05, "loss": 1.429, "mean_token_accuracy": 0.7381418347358704, "num_tokens": 131489428.0, "step": 1830 }, { "entropy": 0.9810149937868118, "epoch": 0.5014990460615971, "grad_norm": 0.1831810176372528, "learning_rate": 6.682412790697675e-05, "loss": 1.422, "mean_token_accuracy": 0.7390474632382393, "num_tokens": 132211947.0, "step": 1840 }, { "entropy": 0.9969974964857101, "epoch": 0.5042245843554102, "grad_norm": 0.24637824296951294, "learning_rate": 6.71875e-05, "loss": 1.4378, "mean_token_accuracy": 0.7319372579455375, "num_tokens": 132922541.0, "step": 1850 }, { "entropy": 0.9870500966906548, "epoch": 0.5069501226492232, "grad_norm": 0.2491854578256607, "learning_rate": 6.755087209302326e-05, "loss": 1.4254, "mean_token_accuracy": 0.7341958448290825, "num_tokens": 133643346.0, "step": 1860 }, { "entropy": 0.9897508502006531, "epoch": 0.5096756609430363, "grad_norm": 0.18362078070640564, "learning_rate": 6.791424418604652e-05, "loss": 1.4282, "mean_token_accuracy": 0.7369514137506485, "num_tokens": 134373792.0, "step": 1870 }, { "entropy": 0.9835589408874512, "epoch": 0.5124011992368492, "grad_norm": 0.21839305758476257, "learning_rate": 6.827761627906977e-05, "loss": 1.4232, "mean_token_accuracy": 0.738610865175724, "num_tokens": 135095994.0, "step": 1880 }, { "entropy": 0.9815672129392624, "epoch": 0.5151267375306623, "grad_norm": 0.21944372355937958, "learning_rate": 6.864098837209302e-05, "loss": 1.424, "mean_token_accuracy": 0.7349463656544686, "num_tokens": 135804246.0, "step": 1890 }, { "entropy": 0.9870554804801941, "epoch": 0.5178522758244753, "grad_norm": 0.18906302750110626, "learning_rate": 6.900436046511628e-05, "loss": 1.4238, "mean_token_accuracy": 0.7398572236299514, "num_tokens": 136536781.0, "step": 1900 }, { "entropy": 0.9853287354111672, "epoch": 0.5205778141182884, "grad_norm": 0.18919885158538818, "learning_rate": 6.936773255813954e-05, "loss": 1.428, "mean_token_accuracy": 0.7393600136041641, "num_tokens": 137266151.0, "step": 1910 }, { "entropy": 0.9780439928174018, "epoch": 0.5233033524121014, "grad_norm": 0.1842227280139923, "learning_rate": 6.973110465116279e-05, "loss": 1.4242, "mean_token_accuracy": 0.7379230797290802, "num_tokens": 137975510.0, "step": 1920 }, { "entropy": 0.9827481582760811, "epoch": 0.5260288907059144, "grad_norm": 0.2542431056499481, "learning_rate": 7.009447674418605e-05, "loss": 1.4187, "mean_token_accuracy": 0.7364926964044571, "num_tokens": 138699820.0, "step": 1930 }, { "entropy": 0.983500225841999, "epoch": 0.5287544289997275, "grad_norm": 0.16537941992282867, "learning_rate": 7.045784883720931e-05, "loss": 1.4253, "mean_token_accuracy": 0.7361272245645523, "num_tokens": 139421211.0, "step": 1940 }, { "entropy": 0.9835821121931076, "epoch": 0.5314799672935405, "grad_norm": 0.1662430763244629, "learning_rate": 7.082122093023256e-05, "loss": 1.4259, "mean_token_accuracy": 0.7393700927495956, "num_tokens": 140143156.0, "step": 1950 }, { "entropy": 0.9743385061621666, "epoch": 0.5342055055873535, "grad_norm": 0.1770647168159485, "learning_rate": 7.118459302325582e-05, "loss": 1.4193, "mean_token_accuracy": 0.7395164668560028, "num_tokens": 140864472.0, "step": 1960 }, { "entropy": 0.9933014005422592, "epoch": 0.5369310438811665, "grad_norm": 0.17968490719795227, "learning_rate": 7.154796511627907e-05, "loss": 1.4407, "mean_token_accuracy": 0.7328062981367112, "num_tokens": 141571085.0, "step": 1970 }, { "entropy": 0.9851297155022621, "epoch": 0.5396565821749796, "grad_norm": 0.17354978621006012, "learning_rate": 7.191133720930233e-05, "loss": 1.4192, "mean_token_accuracy": 0.7395014494657517, "num_tokens": 142303250.0, "step": 1980 }, { "entropy": 0.9806404992938041, "epoch": 0.5423821204687926, "grad_norm": 0.15029194951057434, "learning_rate": 7.227470930232558e-05, "loss": 1.4173, "mean_token_accuracy": 0.7421912506222725, "num_tokens": 143047352.0, "step": 1990 }, { "entropy": 0.9813976526260376, "epoch": 0.5451076587626056, "grad_norm": 0.1776154786348343, "learning_rate": 7.263808139534884e-05, "loss": 1.4225, "mean_token_accuracy": 0.7393262058496475, "num_tokens": 143760780.0, "step": 2000 }, { "entropy": 0.9802085116505623, "epoch": 0.5478331970564186, "grad_norm": 0.14664503931999207, "learning_rate": 7.30014534883721e-05, "loss": 1.4155, "mean_token_accuracy": 0.7426095440983772, "num_tokens": 144497473.0, "step": 2010 }, { "entropy": 0.9769001394510269, "epoch": 0.5505587353502317, "grad_norm": 0.15867289900779724, "learning_rate": 7.336482558139536e-05, "loss": 1.4173, "mean_token_accuracy": 0.7400016963481904, "num_tokens": 145230194.0, "step": 2020 }, { "entropy": 0.9801029890775681, "epoch": 0.5532842736440446, "grad_norm": 0.2603178322315216, "learning_rate": 7.37281976744186e-05, "loss": 1.4156, "mean_token_accuracy": 0.7437982723116875, "num_tokens": 145967549.0, "step": 2030 }, { "entropy": 0.9902677729725837, "epoch": 0.5560098119378577, "grad_norm": 0.17806479334831238, "learning_rate": 7.409156976744186e-05, "loss": 1.4317, "mean_token_accuracy": 0.734989982843399, "num_tokens": 146689707.0, "step": 2040 }, { "entropy": 0.9883522406220436, "epoch": 0.5587353502316708, "grad_norm": 0.19524773955345154, "learning_rate": 7.445494186046512e-05, "loss": 1.4274, "mean_token_accuracy": 0.7380678072571755, "num_tokens": 147399527.0, "step": 2050 }, { "entropy": 0.9826523959636688, "epoch": 0.5614608885254838, "grad_norm": 0.18622492253780365, "learning_rate": 7.481831395348837e-05, "loss": 1.4259, "mean_token_accuracy": 0.739601357281208, "num_tokens": 148129697.0, "step": 2060 }, { "entropy": 0.9859274953603745, "epoch": 0.5641864268192968, "grad_norm": 0.23375269770622253, "learning_rate": 7.518168604651163e-05, "loss": 1.4272, "mean_token_accuracy": 0.739434064924717, "num_tokens": 148858960.0, "step": 2070 }, { "entropy": 0.9859586983919144, "epoch": 0.5669119651131098, "grad_norm": 0.16675522923469543, "learning_rate": 7.554505813953489e-05, "loss": 1.4265, "mean_token_accuracy": 0.7352262407541275, "num_tokens": 149585854.0, "step": 2080 }, { "entropy": 0.9837883651256562, "epoch": 0.5696375034069229, "grad_norm": 0.2244209200143814, "learning_rate": 7.590843023255815e-05, "loss": 1.421, "mean_token_accuracy": 0.7335263103246689, "num_tokens": 150305785.0, "step": 2090 }, { "entropy": 0.9847618371248246, "epoch": 0.5723630417007359, "grad_norm": 0.2683162987232208, "learning_rate": 7.62718023255814e-05, "loss": 1.4176, "mean_token_accuracy": 0.7359615460038185, "num_tokens": 151023546.0, "step": 2100 }, { "entropy": 0.9798925578594208, "epoch": 0.5750885799945489, "grad_norm": 0.18732650578022003, "learning_rate": 7.663517441860465e-05, "loss": 1.4222, "mean_token_accuracy": 0.7367407724261283, "num_tokens": 151738755.0, "step": 2110 }, { "entropy": 0.9841523870825768, "epoch": 0.5778141182883619, "grad_norm": 0.17274878919124603, "learning_rate": 7.699854651162791e-05, "loss": 1.4206, "mean_token_accuracy": 0.736824955046177, "num_tokens": 152459628.0, "step": 2120 }, { "entropy": 0.9872769743204117, "epoch": 0.580539656582175, "grad_norm": 0.22543658316135406, "learning_rate": 7.736191860465116e-05, "loss": 1.4305, "mean_token_accuracy": 0.7352962151169777, "num_tokens": 153179643.0, "step": 2130 }, { "entropy": 0.9773565545678139, "epoch": 0.583265194875988, "grad_norm": 0.1713961362838745, "learning_rate": 7.772529069767442e-05, "loss": 1.4141, "mean_token_accuracy": 0.7409474954009057, "num_tokens": 153898819.0, "step": 2140 }, { "entropy": 0.9789120152592659, "epoch": 0.585990733169801, "grad_norm": 0.5829377174377441, "learning_rate": 7.808866279069768e-05, "loss": 1.4283, "mean_token_accuracy": 0.7368653923273086, "num_tokens": 154607747.0, "step": 2150 }, { "entropy": 0.9918661847710609, "epoch": 0.588716271463614, "grad_norm": 0.18343167006969452, "learning_rate": 7.845203488372094e-05, "loss": 1.4353, "mean_token_accuracy": 0.733272735774517, "num_tokens": 155331252.0, "step": 2160 }, { "entropy": 0.9797570928931236, "epoch": 0.5914418097574271, "grad_norm": 0.16955235600471497, "learning_rate": 7.881540697674419e-05, "loss": 1.4191, "mean_token_accuracy": 0.7337436139583587, "num_tokens": 156039176.0, "step": 2170 }, { "entropy": 0.9858640789985657, "epoch": 0.5941673480512402, "grad_norm": 0.14670498669147491, "learning_rate": 7.917877906976744e-05, "loss": 1.4148, "mean_token_accuracy": 0.7360583290457725, "num_tokens": 156768336.0, "step": 2180 }, { "entropy": 0.9773233219981193, "epoch": 0.5968928863450531, "grad_norm": 0.2751343250274658, "learning_rate": 7.95421511627907e-05, "loss": 1.4145, "mean_token_accuracy": 0.7375390321016312, "num_tokens": 157477191.0, "step": 2190 }, { "entropy": 0.9836308777332305, "epoch": 0.5996184246388662, "grad_norm": 0.16778914630413055, "learning_rate": 7.990552325581395e-05, "loss": 1.4319, "mean_token_accuracy": 0.7302121177315712, "num_tokens": 158171395.0, "step": 2200 }, { "entropy": 0.9806986883282661, "epoch": 0.6023439629326792, "grad_norm": 0.21272782981395721, "learning_rate": 8.026889534883721e-05, "loss": 1.4204, "mean_token_accuracy": 0.7391786813735962, "num_tokens": 158900598.0, "step": 2210 }, { "entropy": 0.9803844973444938, "epoch": 0.6050695012264923, "grad_norm": 0.21859610080718994, "learning_rate": 8.063226744186047e-05, "loss": 1.4211, "mean_token_accuracy": 0.7387867569923401, "num_tokens": 159624174.0, "step": 2220 }, { "entropy": 0.9872574612498284, "epoch": 0.6077950395203052, "grad_norm": 0.24079576134681702, "learning_rate": 8.099563953488373e-05, "loss": 1.4164, "mean_token_accuracy": 0.7402409985661507, "num_tokens": 160352725.0, "step": 2230 }, { "entropy": 0.9936911195516587, "epoch": 0.6105205778141183, "grad_norm": 0.2104625403881073, "learning_rate": 8.135901162790698e-05, "loss": 1.4254, "mean_token_accuracy": 0.7338799551129341, "num_tokens": 161070338.0, "step": 2240 }, { "entropy": 0.9814269945025444, "epoch": 0.6132461161079313, "grad_norm": 0.12204383313655853, "learning_rate": 8.172238372093024e-05, "loss": 1.422, "mean_token_accuracy": 0.7419388547539711, "num_tokens": 161808253.0, "step": 2250 }, { "entropy": 0.9859389901161194, "epoch": 0.6159716544017444, "grad_norm": 0.2447647750377655, "learning_rate": 8.20857558139535e-05, "loss": 1.4288, "mean_token_accuracy": 0.7386970460414887, "num_tokens": 162526434.0, "step": 2260 }, { "entropy": 0.9854311719536781, "epoch": 0.6186971926955573, "grad_norm": 0.22936969995498657, "learning_rate": 8.244912790697675e-05, "loss": 1.4248, "mean_token_accuracy": 0.73409523665905, "num_tokens": 163247416.0, "step": 2270 }, { "entropy": 0.9888584405183792, "epoch": 0.6214227309893704, "grad_norm": 0.1381879299879074, "learning_rate": 8.28125e-05, "loss": 1.4374, "mean_token_accuracy": 0.7325819313526154, "num_tokens": 163951723.0, "step": 2280 }, { "entropy": 0.9800671771168709, "epoch": 0.6241482692831835, "grad_norm": 0.137205109000206, "learning_rate": 8.317587209302326e-05, "loss": 1.4241, "mean_token_accuracy": 0.7337846279144287, "num_tokens": 164650972.0, "step": 2290 }, { "entropy": 0.9876679092645645, "epoch": 0.6268738075769965, "grad_norm": 0.1826333999633789, "learning_rate": 8.353924418604652e-05, "loss": 1.4297, "mean_token_accuracy": 0.7341669753193856, "num_tokens": 165361994.0, "step": 2300 }, { "entropy": 0.9780210003256797, "epoch": 0.6295993458708095, "grad_norm": 0.24412642419338226, "learning_rate": 8.390261627906977e-05, "loss": 1.4136, "mean_token_accuracy": 0.7400619566440583, "num_tokens": 166092061.0, "step": 2310 }, { "entropy": 0.9783180683851243, "epoch": 0.6323248841646225, "grad_norm": 0.26498180627822876, "learning_rate": 8.426598837209303e-05, "loss": 1.4203, "mean_token_accuracy": 0.7401160180568696, "num_tokens": 166813871.0, "step": 2320 }, { "entropy": 0.9865237712860108, "epoch": 0.6350504224584356, "grad_norm": 0.3049558103084564, "learning_rate": 8.462936046511628e-05, "loss": 1.4243, "mean_token_accuracy": 0.7345960304141045, "num_tokens": 167527305.0, "step": 2330 }, { "entropy": 0.9801740884780884, "epoch": 0.6377759607522485, "grad_norm": 0.33257248997688293, "learning_rate": 8.499273255813954e-05, "loss": 1.4164, "mean_token_accuracy": 0.7419341236352921, "num_tokens": 168256549.0, "step": 2340 }, { "entropy": 0.9854059845209122, "epoch": 0.6405014990460616, "grad_norm": 0.15806418657302856, "learning_rate": 8.535610465116279e-05, "loss": 1.4275, "mean_token_accuracy": 0.7322300463914871, "num_tokens": 168957455.0, "step": 2350 }, { "entropy": 0.9823917403817177, "epoch": 0.6432270373398746, "grad_norm": 0.21669892966747284, "learning_rate": 8.571947674418605e-05, "loss": 1.419, "mean_token_accuracy": 0.7398874923586846, "num_tokens": 169689713.0, "step": 2360 }, { "entropy": 0.9831691041588784, "epoch": 0.6459525756336877, "grad_norm": 0.3539750874042511, "learning_rate": 8.608284883720931e-05, "loss": 1.4203, "mean_token_accuracy": 0.7360575824975968, "num_tokens": 170413913.0, "step": 2370 }, { "entropy": 0.9930136293172837, "epoch": 0.6486781139275006, "grad_norm": 0.6360985040664673, "learning_rate": 8.644622093023256e-05, "loss": 1.4363, "mean_token_accuracy": 0.7349853679537773, "num_tokens": 171125900.0, "step": 2380 }, { "entropy": 0.980540269613266, "epoch": 0.6514036522213137, "grad_norm": 0.3049725294113159, "learning_rate": 8.680959302325582e-05, "loss": 1.4163, "mean_token_accuracy": 0.7372217386960983, "num_tokens": 171847267.0, "step": 2390 }, { "entropy": 0.9860322341322899, "epoch": 0.6541291905151267, "grad_norm": 0.21088938415050507, "learning_rate": 8.717296511627907e-05, "loss": 1.4273, "mean_token_accuracy": 0.7365284189581871, "num_tokens": 172575435.0, "step": 2400 }, { "entropy": 0.9814476162195206, "epoch": 0.6568547288089398, "grad_norm": 0.17495831847190857, "learning_rate": 8.753633720930233e-05, "loss": 1.4252, "mean_token_accuracy": 0.7373342961072922, "num_tokens": 173287782.0, "step": 2410 }, { "entropy": 0.9866706624627113, "epoch": 0.6595802671027527, "grad_norm": 0.15505193173885345, "learning_rate": 8.789970930232558e-05, "loss": 1.4261, "mean_token_accuracy": 0.7357053935527802, "num_tokens": 174003727.0, "step": 2420 }, { "entropy": 0.9791345074772835, "epoch": 0.6623058053965658, "grad_norm": 0.13619117438793182, "learning_rate": 8.826308139534884e-05, "loss": 1.4148, "mean_token_accuracy": 0.7366743147373199, "num_tokens": 174706233.0, "step": 2430 }, { "entropy": 0.9816969931125641, "epoch": 0.6650313436903789, "grad_norm": 0.23116159439086914, "learning_rate": 8.86264534883721e-05, "loss": 1.4232, "mean_token_accuracy": 0.7392698466777802, "num_tokens": 175429248.0, "step": 2440 }, { "entropy": 0.9880701199173927, "epoch": 0.6677568819841919, "grad_norm": 0.14319849014282227, "learning_rate": 8.898982558139536e-05, "loss": 1.4379, "mean_token_accuracy": 0.7343179911375046, "num_tokens": 176139796.0, "step": 2450 }, { "entropy": 0.9857257276773452, "epoch": 0.6704824202780049, "grad_norm": 0.2317603975534439, "learning_rate": 8.93531976744186e-05, "loss": 1.4275, "mean_token_accuracy": 0.7344384148716927, "num_tokens": 176850673.0, "step": 2460 }, { "entropy": 0.9848071858286858, "epoch": 0.6732079585718179, "grad_norm": 0.17459312081336975, "learning_rate": 8.971656976744187e-05, "loss": 1.4287, "mean_token_accuracy": 0.7325173929333687, "num_tokens": 177563599.0, "step": 2470 }, { "entropy": 0.9801058009266853, "epoch": 0.675933496865631, "grad_norm": 0.16312763094902039, "learning_rate": 9.007994186046512e-05, "loss": 1.4318, "mean_token_accuracy": 0.7353872433304787, "num_tokens": 178263299.0, "step": 2480 }, { "entropy": 0.9788572788238525, "epoch": 0.678659035159444, "grad_norm": 0.19579234719276428, "learning_rate": 9.044331395348837e-05, "loss": 1.4239, "mean_token_accuracy": 0.7329365327954293, "num_tokens": 178971882.0, "step": 2490 }, { "entropy": 0.9752021312713623, "epoch": 0.681384573453257, "grad_norm": 0.15345396101474762, "learning_rate": 9.080668604651163e-05, "loss": 1.4224, "mean_token_accuracy": 0.7376372799277305, "num_tokens": 179678144.0, "step": 2500 }, { "entropy": 0.9790006041526794, "epoch": 0.68411011174707, "grad_norm": 0.13730672001838684, "learning_rate": 9.117005813953489e-05, "loss": 1.4215, "mean_token_accuracy": 0.7365571096539497, "num_tokens": 180396043.0, "step": 2510 }, { "entropy": 0.9847607880830764, "epoch": 0.6868356500408831, "grad_norm": 0.17317773401737213, "learning_rate": 9.153343023255815e-05, "loss": 1.4241, "mean_token_accuracy": 0.7385125055909156, "num_tokens": 181124232.0, "step": 2520 }, { "entropy": 0.9774447113275528, "epoch": 0.6895611883346962, "grad_norm": 0.21009580790996552, "learning_rate": 9.18968023255814e-05, "loss": 1.4204, "mean_token_accuracy": 0.737717455625534, "num_tokens": 181837654.0, "step": 2530 }, { "entropy": 0.984051650762558, "epoch": 0.6922867266285091, "grad_norm": 0.12575000524520874, "learning_rate": 9.226017441860466e-05, "loss": 1.4247, "mean_token_accuracy": 0.7335541769862175, "num_tokens": 182539820.0, "step": 2540 }, { "entropy": 0.9811558112502098, "epoch": 0.6950122649223222, "grad_norm": 0.1522400677204132, "learning_rate": 9.262354651162791e-05, "loss": 1.4148, "mean_token_accuracy": 0.7406320959329605, "num_tokens": 183264633.0, "step": 2550 }, { "entropy": 0.9774328708648682, "epoch": 0.6977378032161352, "grad_norm": 0.13843339681625366, "learning_rate": 9.298691860465116e-05, "loss": 1.4128, "mean_token_accuracy": 0.7441829890012741, "num_tokens": 184000840.0, "step": 2560 }, { "entropy": 0.9893192529678345, "epoch": 0.7004633415099483, "grad_norm": 0.15118694305419922, "learning_rate": 9.335029069767442e-05, "loss": 1.4272, "mean_token_accuracy": 0.7330075368285179, "num_tokens": 184709055.0, "step": 2570 }, { "entropy": 0.982662744820118, "epoch": 0.7031888798037612, "grad_norm": 0.1605202555656433, "learning_rate": 9.371366279069768e-05, "loss": 1.4238, "mean_token_accuracy": 0.7381146803498269, "num_tokens": 185426684.0, "step": 2580 }, { "entropy": 0.9822832211852074, "epoch": 0.7059144180975743, "grad_norm": 0.1687488704919815, "learning_rate": 9.407703488372094e-05, "loss": 1.4203, "mean_token_accuracy": 0.7379755496978759, "num_tokens": 186154172.0, "step": 2590 }, { "entropy": 0.9851330190896987, "epoch": 0.7086399563913873, "grad_norm": 0.13439348340034485, "learning_rate": 9.444040697674419e-05, "loss": 1.422, "mean_token_accuracy": 0.7387931779026985, "num_tokens": 186872408.0, "step": 2600 }, { "entropy": 0.9774848327040673, "epoch": 0.7113654946852003, "grad_norm": 0.18168923258781433, "learning_rate": 9.480377906976745e-05, "loss": 1.4232, "mean_token_accuracy": 0.7363077029585838, "num_tokens": 187586232.0, "step": 2610 }, { "entropy": 0.9839216858148575, "epoch": 0.7140910329790133, "grad_norm": 0.20491938292980194, "learning_rate": 9.51671511627907e-05, "loss": 1.4205, "mean_token_accuracy": 0.7323327973484993, "num_tokens": 188296851.0, "step": 2620 }, { "entropy": 0.9769590377807618, "epoch": 0.7168165712728264, "grad_norm": 0.1636561155319214, "learning_rate": 9.553052325581395e-05, "loss": 1.4122, "mean_token_accuracy": 0.7377440124750138, "num_tokens": 189013028.0, "step": 2630 }, { "entropy": 0.9832702308893204, "epoch": 0.7195421095666394, "grad_norm": 0.16413764655590057, "learning_rate": 9.589389534883721e-05, "loss": 1.4179, "mean_token_accuracy": 0.7364308670163154, "num_tokens": 189735349.0, "step": 2640 }, { "entropy": 0.9838227599859237, "epoch": 0.7222676478604524, "grad_norm": 0.18721725046634674, "learning_rate": 9.625726744186047e-05, "loss": 1.4213, "mean_token_accuracy": 0.7334291443228722, "num_tokens": 190432817.0, "step": 2650 }, { "entropy": 0.9814351618289947, "epoch": 0.7249931861542654, "grad_norm": 0.2767001688480377, "learning_rate": 9.662063953488373e-05, "loss": 1.4214, "mean_token_accuracy": 0.7366883307695389, "num_tokens": 191152964.0, "step": 2660 }, { "entropy": 0.9793224886059761, "epoch": 0.7277187244480785, "grad_norm": 0.1260397583246231, "learning_rate": 9.698401162790698e-05, "loss": 1.4216, "mean_token_accuracy": 0.7355253770947456, "num_tokens": 191864985.0, "step": 2670 }, { "entropy": 0.9775992184877396, "epoch": 0.7304442627418916, "grad_norm": 0.2061127871274948, "learning_rate": 9.734738372093024e-05, "loss": 1.42, "mean_token_accuracy": 0.7358565747737884, "num_tokens": 192582457.0, "step": 2680 }, { "entropy": 0.9830930635333062, "epoch": 0.7331698010357045, "grad_norm": 0.3281489610671997, "learning_rate": 9.77107558139535e-05, "loss": 1.4132, "mean_token_accuracy": 0.7400453820824623, "num_tokens": 193317939.0, "step": 2690 }, { "entropy": 0.9811283275485039, "epoch": 0.7358953393295176, "grad_norm": 0.18330809473991394, "learning_rate": 9.807412790697675e-05, "loss": 1.4198, "mean_token_accuracy": 0.7413364306092263, "num_tokens": 194045484.0, "step": 2700 }, { "entropy": 0.9767220064997673, "epoch": 0.7386208776233306, "grad_norm": 0.14695248007774353, "learning_rate": 9.84375e-05, "loss": 1.4279, "mean_token_accuracy": 0.7368486255407334, "num_tokens": 194750844.0, "step": 2710 }, { "entropy": 0.9996407404541969, "epoch": 0.7413464159171437, "grad_norm": 0.612859845161438, "learning_rate": 9.880087209302326e-05, "loss": 1.4393, "mean_token_accuracy": 0.7321041479706765, "num_tokens": 195469343.0, "step": 2720 }, { "entropy": 0.9824164986610413, "epoch": 0.7440719542109566, "grad_norm": 0.14814876019954681, "learning_rate": 9.916424418604652e-05, "loss": 1.4261, "mean_token_accuracy": 0.7364200308918953, "num_tokens": 196180730.0, "step": 2730 }, { "entropy": 0.9753024950623512, "epoch": 0.7467974925047697, "grad_norm": 0.3339892029762268, "learning_rate": 9.952761627906977e-05, "loss": 1.4118, "mean_token_accuracy": 0.7415054902434349, "num_tokens": 196917912.0, "step": 2740 }, { "entropy": 0.9833664178848267, "epoch": 0.7495230307985827, "grad_norm": 0.20620104670524597, "learning_rate": 9.989098837209303e-05, "loss": 1.4262, "mean_token_accuracy": 0.7400285750627518, "num_tokens": 197653923.0, "step": 2750 }, { "entropy": 0.989758312702179, "epoch": 0.7522485690923958, "grad_norm": 0.22599183022975922, "learning_rate": 9.99999955770215e-05, "loss": 1.4285, "mean_token_accuracy": 0.7386189118027687, "num_tokens": 198371819.0, "step": 2760 }, { "entropy": 0.9875634372234344, "epoch": 0.7549741073862087, "grad_norm": 0.1541522741317749, "learning_rate": 9.999997391345519e-05, "loss": 1.4323, "mean_token_accuracy": 0.7380873292684555, "num_tokens": 199082702.0, "step": 2770 }, { "entropy": 0.9855502024292946, "epoch": 0.7576996456800218, "grad_norm": 0.22785435616970062, "learning_rate": 9.999993419692509e-05, "loss": 1.4248, "mean_token_accuracy": 0.7359795659780503, "num_tokens": 199803798.0, "step": 2780 }, { "entropy": 0.9827453017234802, "epoch": 0.7604251839738349, "grad_norm": 0.15170662105083466, "learning_rate": 9.999987642744555e-05, "loss": 1.4129, "mean_token_accuracy": 0.7355940371751786, "num_tokens": 200523338.0, "step": 2790 }, { "entropy": 0.9769548758864403, "epoch": 0.7631507222676479, "grad_norm": 0.12554454803466797, "learning_rate": 9.99998006050374e-05, "loss": 1.427, "mean_token_accuracy": 0.7395160034298897, "num_tokens": 201243243.0, "step": 2800 }, { "entropy": 0.9889974981546402, "epoch": 0.7658762605614609, "grad_norm": 0.26222726702690125, "learning_rate": 9.999970672972803e-05, "loss": 1.422, "mean_token_accuracy": 0.736335052549839, "num_tokens": 201958044.0, "step": 2810 }, { "entropy": 0.9788802176713943, "epoch": 0.7686017988552739, "grad_norm": 0.19049885869026184, "learning_rate": 9.999959480155133e-05, "loss": 1.4169, "mean_token_accuracy": 0.7363810062408447, "num_tokens": 202664706.0, "step": 2820 }, { "entropy": 0.9821498796343804, "epoch": 0.771327337149087, "grad_norm": 0.161302387714386, "learning_rate": 9.999946482054772e-05, "loss": 1.4135, "mean_token_accuracy": 0.7354164943099022, "num_tokens": 203377268.0, "step": 2830 }, { "entropy": 0.9805738747119903, "epoch": 0.7740528754429, "grad_norm": 0.14993034303188324, "learning_rate": 9.999931678676413e-05, "loss": 1.4167, "mean_token_accuracy": 0.7371671542525291, "num_tokens": 204103306.0, "step": 2840 }, { "entropy": 0.98235704600811, "epoch": 0.776778413736713, "grad_norm": 0.22030942142009735, "learning_rate": 9.999915070025401e-05, "loss": 1.4179, "mean_token_accuracy": 0.7383449390530586, "num_tokens": 204825853.0, "step": 2850 }, { "entropy": 0.9786477074027061, "epoch": 0.779503952030526, "grad_norm": 0.15327267348766327, "learning_rate": 9.999896656107732e-05, "loss": 1.4213, "mean_token_accuracy": 0.7358534723520279, "num_tokens": 205535796.0, "step": 2860 }, { "entropy": 0.9758807629346847, "epoch": 0.7822294903243391, "grad_norm": 0.1187690794467926, "learning_rate": 9.999876436930056e-05, "loss": 1.4095, "mean_token_accuracy": 0.7400936737656594, "num_tokens": 206259558.0, "step": 2870 }, { "entropy": 0.9861981242895126, "epoch": 0.7849550286181521, "grad_norm": 0.13627082109451294, "learning_rate": 9.999854412499671e-05, "loss": 1.4272, "mean_token_accuracy": 0.7323023781180382, "num_tokens": 206970708.0, "step": 2880 }, { "entropy": 0.9836017206311226, "epoch": 0.7876805669119651, "grad_norm": 0.1861530840396881, "learning_rate": 9.999830582824532e-05, "loss": 1.4224, "mean_token_accuracy": 0.7317949622869492, "num_tokens": 207679412.0, "step": 2890 }, { "entropy": 0.9812063500285149, "epoch": 0.7904061052057781, "grad_norm": 0.2150312066078186, "learning_rate": 9.999804947913241e-05, "loss": 1.4233, "mean_token_accuracy": 0.740932235121727, "num_tokens": 208405196.0, "step": 2900 }, { "entropy": 0.9819123685359955, "epoch": 0.7931316434995912, "grad_norm": 0.5197040438652039, "learning_rate": 9.999777507775053e-05, "loss": 1.4179, "mean_token_accuracy": 0.7384748071432113, "num_tokens": 209134642.0, "step": 2910 }, { "entropy": 0.9714388608932495, "epoch": 0.7958571817934041, "grad_norm": 0.14457683265209198, "learning_rate": 9.999748262419877e-05, "loss": 1.4181, "mean_token_accuracy": 0.7427984416484833, "num_tokens": 209852921.0, "step": 2920 }, { "entropy": 0.9837919026613235, "epoch": 0.7985827200872172, "grad_norm": 0.18511174619197845, "learning_rate": 9.999717211858272e-05, "loss": 1.4216, "mean_token_accuracy": 0.7332604169845581, "num_tokens": 210559025.0, "step": 2930 }, { "entropy": 0.9797424361109733, "epoch": 0.8013082583810303, "grad_norm": 0.13574282824993134, "learning_rate": 9.999684356101448e-05, "loss": 1.4209, "mean_token_accuracy": 0.7408635228872299, "num_tokens": 211276251.0, "step": 2940 }, { "entropy": 0.9871427044272423, "epoch": 0.8040337966748433, "grad_norm": 0.1565672755241394, "learning_rate": 9.999649695161271e-05, "loss": 1.4225, "mean_token_accuracy": 0.734562648832798, "num_tokens": 211993021.0, "step": 2950 }, { "entropy": 0.984888119995594, "epoch": 0.8067593349686563, "grad_norm": 0.14846067130565643, "learning_rate": 9.999613229050252e-05, "loss": 1.4228, "mean_token_accuracy": 0.7389271706342697, "num_tokens": 212718426.0, "step": 2960 }, { "entropy": 0.9810102090239525, "epoch": 0.8094848732624693, "grad_norm": 0.14860044419765472, "learning_rate": 9.999574957781558e-05, "loss": 1.4162, "mean_token_accuracy": 0.7347591191530227, "num_tokens": 213438304.0, "step": 2970 }, { "entropy": 0.9810490146279335, "epoch": 0.8122104115562824, "grad_norm": 0.19743232429027557, "learning_rate": 9.999534881369011e-05, "loss": 1.4206, "mean_token_accuracy": 0.739751273393631, "num_tokens": 214165613.0, "step": 2980 }, { "entropy": 0.9807188436388969, "epoch": 0.8149359498500954, "grad_norm": 0.1587584763765335, "learning_rate": 9.999492999827077e-05, "loss": 1.4276, "mean_token_accuracy": 0.7378657341003418, "num_tokens": 214876982.0, "step": 2990 }, { "entropy": 0.9837844550609589, "epoch": 0.8176614881439084, "grad_norm": 0.11708062142133713, "learning_rate": 9.999449313170879e-05, "loss": 1.4225, "mean_token_accuracy": 0.7384473770856858, "num_tokens": 215594732.0, "step": 3000 }, { "entropy": 0.9751689925789833, "epoch": 0.8203870264377214, "grad_norm": 0.14906936883926392, "learning_rate": 9.99940382141619e-05, "loss": 1.4111, "mean_token_accuracy": 0.736640265583992, "num_tokens": 216309994.0, "step": 3010 }, { "entropy": 0.974778625369072, "epoch": 0.8231125647315345, "grad_norm": 0.20057159662246704, "learning_rate": 9.999356524579435e-05, "loss": 1.4122, "mean_token_accuracy": 0.7381565615534782, "num_tokens": 217017050.0, "step": 3020 }, { "entropy": 0.9723775506019592, "epoch": 0.8258381030253475, "grad_norm": 0.2575012445449829, "learning_rate": 9.999307422677692e-05, "loss": 1.4062, "mean_token_accuracy": 0.7382101267576218, "num_tokens": 217738934.0, "step": 3030 }, { "entropy": 0.9816832140088081, "epoch": 0.8285636413191605, "grad_norm": 0.13900838792324066, "learning_rate": 9.99925651572869e-05, "loss": 1.4224, "mean_token_accuracy": 0.7348329618573188, "num_tokens": 218453524.0, "step": 3040 }, { "entropy": 0.982389472424984, "epoch": 0.8312891796129735, "grad_norm": 0.15657106041908264, "learning_rate": 9.99920380375081e-05, "loss": 1.4253, "mean_token_accuracy": 0.7420304551720619, "num_tokens": 219187154.0, "step": 3050 }, { "entropy": 0.9812181010842324, "epoch": 0.8340147179067866, "grad_norm": 0.189975768327713, "learning_rate": 9.99914928676308e-05, "loss": 1.4113, "mean_token_accuracy": 0.7373171448707581, "num_tokens": 219910460.0, "step": 3060 }, { "entropy": 0.9803787097334862, "epoch": 0.8367402562005997, "grad_norm": 0.14406999945640564, "learning_rate": 9.999092964785189e-05, "loss": 1.4144, "mean_token_accuracy": 0.7389702558517456, "num_tokens": 220638772.0, "step": 3070 }, { "entropy": 0.978831271827221, "epoch": 0.8394657944944126, "grad_norm": 0.12598539888858795, "learning_rate": 9.999034837837469e-05, "loss": 1.4097, "mean_token_accuracy": 0.7423653185367585, "num_tokens": 221364839.0, "step": 3080 }, { "entropy": 0.977126270532608, "epoch": 0.8421913327882257, "grad_norm": 0.1539270281791687, "learning_rate": 9.998974905940907e-05, "loss": 1.4135, "mean_token_accuracy": 0.7419637933373451, "num_tokens": 222096513.0, "step": 3090 }, { "entropy": 0.9715770184993744, "epoch": 0.8449168710820387, "grad_norm": 0.16594548523426056, "learning_rate": 9.998913169117146e-05, "loss": 1.4097, "mean_token_accuracy": 0.7437430068850517, "num_tokens": 222826039.0, "step": 3100 }, { "entropy": 0.9744135066866875, "epoch": 0.8476424093758518, "grad_norm": 0.12864826619625092, "learning_rate": 9.998849627388473e-05, "loss": 1.409, "mean_token_accuracy": 0.7474918752908707, "num_tokens": 223570545.0, "step": 3110 }, { "entropy": 0.9805658519268036, "epoch": 0.8503679476696647, "grad_norm": 0.1582091897726059, "learning_rate": 9.998784280777834e-05, "loss": 1.4142, "mean_token_accuracy": 0.7373319238424301, "num_tokens": 224288940.0, "step": 3120 }, { "entropy": 0.974412453174591, "epoch": 0.8530934859634778, "grad_norm": 0.1336938887834549, "learning_rate": 9.998717129308818e-05, "loss": 1.4103, "mean_token_accuracy": 0.7408842518925667, "num_tokens": 225023171.0, "step": 3130 }, { "entropy": 0.9713442757725715, "epoch": 0.8558190242572908, "grad_norm": 0.10065404325723648, "learning_rate": 9.998648173005674e-05, "loss": 1.4072, "mean_token_accuracy": 0.7376281142234802, "num_tokens": 225729545.0, "step": 3140 }, { "entropy": 0.9841649621725083, "epoch": 0.8585445625511039, "grad_norm": 0.15625248849391937, "learning_rate": 9.998577411893299e-05, "loss": 1.4234, "mean_token_accuracy": 0.7346471220254898, "num_tokens": 226444810.0, "step": 3150 }, { "entropy": 0.9743556290864944, "epoch": 0.8612701008449168, "grad_norm": 0.15847258269786835, "learning_rate": 9.99850484599724e-05, "loss": 1.4183, "mean_token_accuracy": 0.7372889712452888, "num_tokens": 227162826.0, "step": 3160 }, { "entropy": 0.9804324865341186, "epoch": 0.8639956391387299, "grad_norm": 0.12864305078983307, "learning_rate": 9.998430475343701e-05, "loss": 1.4199, "mean_token_accuracy": 0.7350202083587647, "num_tokens": 227869180.0, "step": 3170 }, { "entropy": 0.9829505577683448, "epoch": 0.866721177432543, "grad_norm": 0.14491578936576843, "learning_rate": 9.998354299959534e-05, "loss": 1.4187, "mean_token_accuracy": 0.7396857485175132, "num_tokens": 228596762.0, "step": 3180 }, { "entropy": 0.9742689624428749, "epoch": 0.8694467157263559, "grad_norm": 0.1269872784614563, "learning_rate": 9.998276319872238e-05, "loss": 1.4101, "mean_token_accuracy": 0.7371434390544891, "num_tokens": 229303562.0, "step": 3190 }, { "entropy": 0.9751578256487846, "epoch": 0.872172254020169, "grad_norm": 0.21285098791122437, "learning_rate": 9.998196535109973e-05, "loss": 1.4199, "mean_token_accuracy": 0.736963638663292, "num_tokens": 230007345.0, "step": 3200 }, { "entropy": 0.9789491593837738, "epoch": 0.874897792313982, "grad_norm": 0.26488471031188965, "learning_rate": 9.998114945701544e-05, "loss": 1.4277, "mean_token_accuracy": 0.735780592262745, "num_tokens": 230705545.0, "step": 3210 }, { "entropy": 0.9745857268571854, "epoch": 0.8776233306077951, "grad_norm": 0.1784295290708542, "learning_rate": 9.998031551676413e-05, "loss": 1.412, "mean_token_accuracy": 0.7361106410622597, "num_tokens": 231420484.0, "step": 3220 }, { "entropy": 0.993267172574997, "epoch": 0.880348868901608, "grad_norm": 0.17070242762565613, "learning_rate": 9.997946353064685e-05, "loss": 1.4232, "mean_token_accuracy": 0.7339597791433334, "num_tokens": 232141626.0, "step": 3230 }, { "entropy": 0.9836523786187172, "epoch": 0.8830744071954211, "grad_norm": 0.15658451616764069, "learning_rate": 9.997859349897125e-05, "loss": 1.4325, "mean_token_accuracy": 0.737040302157402, "num_tokens": 232854333.0, "step": 3240 }, { "entropy": 0.9760024771094322, "epoch": 0.8857999454892341, "grad_norm": 0.19112402200698853, "learning_rate": 9.997770542205144e-05, "loss": 1.4119, "mean_token_accuracy": 0.7414720132946968, "num_tokens": 233590794.0, "step": 3250 }, { "entropy": 0.9777669444680214, "epoch": 0.8885254837830472, "grad_norm": 0.11839189380407333, "learning_rate": 9.997679930020811e-05, "loss": 1.4153, "mean_token_accuracy": 0.734228539466858, "num_tokens": 234295557.0, "step": 3260 }, { "entropy": 0.9728788286447525, "epoch": 0.8912510220768601, "grad_norm": 0.10589392483234406, "learning_rate": 9.99758751337684e-05, "loss": 1.4056, "mean_token_accuracy": 0.7415377557277679, "num_tokens": 235025124.0, "step": 3270 }, { "entropy": 0.971225069463253, "epoch": 0.8939765603706732, "grad_norm": 0.21799670159816742, "learning_rate": 9.997493292306596e-05, "loss": 1.4112, "mean_token_accuracy": 0.7429666057229042, "num_tokens": 235760710.0, "step": 3280 }, { "entropy": 0.9753315597772598, "epoch": 0.8967020986644862, "grad_norm": 0.19039765000343323, "learning_rate": 9.997397266844104e-05, "loss": 1.4069, "mean_token_accuracy": 0.7381700858473778, "num_tokens": 236483738.0, "step": 3290 }, { "entropy": 0.9832386106252671, "epoch": 0.8994276369582993, "grad_norm": 0.13938450813293457, "learning_rate": 9.997299437024032e-05, "loss": 1.4236, "mean_token_accuracy": 0.7357633501291275, "num_tokens": 237194525.0, "step": 3300 }, { "entropy": 0.9810293108224869, "epoch": 0.9021531752521122, "grad_norm": 0.17831286787986755, "learning_rate": 9.9971998028817e-05, "loss": 1.4156, "mean_token_accuracy": 0.7319070100784302, "num_tokens": 237900874.0, "step": 3310 }, { "entropy": 0.9783111020922661, "epoch": 0.9048787135459253, "grad_norm": 0.1969386339187622, "learning_rate": 9.997098364453087e-05, "loss": 1.4194, "mean_token_accuracy": 0.7367761194705963, "num_tokens": 238608497.0, "step": 3320 }, { "entropy": 0.9764347687363625, "epoch": 0.9076042518397384, "grad_norm": 0.14776062965393066, "learning_rate": 9.996995121774814e-05, "loss": 1.4232, "mean_token_accuracy": 0.7391286328434944, "num_tokens": 239326913.0, "step": 3330 }, { "entropy": 0.9870787173509598, "epoch": 0.9103297901335514, "grad_norm": 0.14292185008525848, "learning_rate": 9.99689007488416e-05, "loss": 1.4188, "mean_token_accuracy": 0.7383605018258095, "num_tokens": 240060814.0, "step": 3340 }, { "entropy": 0.978061044216156, "epoch": 0.9130553284273644, "grad_norm": 0.14178350567817688, "learning_rate": 9.996783223819053e-05, "loss": 1.4168, "mean_token_accuracy": 0.7363059341907501, "num_tokens": 240779526.0, "step": 3350 }, { "entropy": 0.9764518067240715, "epoch": 0.9157808667211774, "grad_norm": 0.272127628326416, "learning_rate": 9.996674568618072e-05, "loss": 1.4192, "mean_token_accuracy": 0.7388992846012116, "num_tokens": 241495307.0, "step": 3360 }, { "entropy": 0.974106739461422, "epoch": 0.9185064050149905, "grad_norm": 0.1740814596414566, "learning_rate": 9.996564109320448e-05, "loss": 1.4103, "mean_token_accuracy": 0.7449988663196564, "num_tokens": 242230783.0, "step": 3370 }, { "entropy": 0.9787409767508507, "epoch": 0.9212319433088035, "grad_norm": 0.10566773265600204, "learning_rate": 9.996451845966064e-05, "loss": 1.4163, "mean_token_accuracy": 0.7380370870232582, "num_tokens": 242940041.0, "step": 3380 }, { "entropy": 0.9847319096326828, "epoch": 0.9239574816026165, "grad_norm": 0.10505988448858261, "learning_rate": 9.996337778595453e-05, "loss": 1.4133, "mean_token_accuracy": 0.7361453324556351, "num_tokens": 243665358.0, "step": 3390 }, { "entropy": 0.9767900019884109, "epoch": 0.9266830198964295, "grad_norm": 0.12417960166931152, "learning_rate": 9.996221907249799e-05, "loss": 1.4147, "mean_token_accuracy": 0.7380743145942688, "num_tokens": 244394333.0, "step": 3400 }, { "entropy": 0.9792727619409561, "epoch": 0.9294085581902426, "grad_norm": 0.11050882935523987, "learning_rate": 9.996104231970942e-05, "loss": 1.4155, "mean_token_accuracy": 0.7417500883340835, "num_tokens": 245124365.0, "step": 3410 }, { "entropy": 0.9754124477505683, "epoch": 0.9321340964840557, "grad_norm": 0.11477773636579514, "learning_rate": 9.995984752801367e-05, "loss": 1.4135, "mean_token_accuracy": 0.7388074770569801, "num_tokens": 245835476.0, "step": 3420 }, { "entropy": 0.9770966023206711, "epoch": 0.9348596347778686, "grad_norm": 0.33463749289512634, "learning_rate": 9.995863469784213e-05, "loss": 1.4192, "mean_token_accuracy": 0.7341749802231788, "num_tokens": 246545852.0, "step": 3430 }, { "entropy": 0.9832690536975861, "epoch": 0.9375851730716817, "grad_norm": 0.13229504227638245, "learning_rate": 9.995740382963272e-05, "loss": 1.4156, "mean_token_accuracy": 0.7382375612854958, "num_tokens": 247261964.0, "step": 3440 }, { "entropy": 0.9732533872127533, "epoch": 0.9403107113654947, "grad_norm": 0.3632689118385315, "learning_rate": 9.995615492382983e-05, "loss": 1.4205, "mean_token_accuracy": 0.7353919863700866, "num_tokens": 247959080.0, "step": 3450 }, { "entropy": 0.9803975969552994, "epoch": 0.9430362496593078, "grad_norm": 0.16551385819911957, "learning_rate": 9.995488798088442e-05, "loss": 1.4225, "mean_token_accuracy": 0.7330883577466011, "num_tokens": 248657170.0, "step": 3460 }, { "entropy": 0.971314737200737, "epoch": 0.9457617879531207, "grad_norm": 0.10738106071949005, "learning_rate": 9.995360300125392e-05, "loss": 1.4166, "mean_token_accuracy": 0.7408865720033646, "num_tokens": 249385976.0, "step": 3470 }, { "entropy": 0.9782015651464462, "epoch": 0.9484873262469338, "grad_norm": 0.1215008944272995, "learning_rate": 9.995229998540228e-05, "loss": 1.4229, "mean_token_accuracy": 0.7396703884005547, "num_tokens": 250105086.0, "step": 3480 }, { "entropy": 0.9830413952469825, "epoch": 0.9512128645407468, "grad_norm": 0.11202839761972427, "learning_rate": 9.995097893379997e-05, "loss": 1.4209, "mean_token_accuracy": 0.7345697537064553, "num_tokens": 250830736.0, "step": 3490 }, { "entropy": 0.9833935052156448, "epoch": 0.9539384028345598, "grad_norm": 0.12974119186401367, "learning_rate": 9.994963984692395e-05, "loss": 1.4154, "mean_token_accuracy": 0.7403559491038323, "num_tokens": 251562656.0, "step": 3500 }, { "entropy": 0.9744713872671127, "epoch": 0.9566639411283728, "grad_norm": 0.13219153881072998, "learning_rate": 9.994828272525774e-05, "loss": 1.4123, "mean_token_accuracy": 0.7411713972687721, "num_tokens": 252286064.0, "step": 3510 }, { "entropy": 0.9831308081746102, "epoch": 0.9593894794221859, "grad_norm": 0.14877712726593018, "learning_rate": 9.994690756929132e-05, "loss": 1.4207, "mean_token_accuracy": 0.7395951136946678, "num_tokens": 252998169.0, "step": 3520 }, { "entropy": 0.9759589090943337, "epoch": 0.9621150177159989, "grad_norm": 0.17554226517677307, "learning_rate": 9.994551437952123e-05, "loss": 1.4155, "mean_token_accuracy": 0.7382798790931702, "num_tokens": 253721062.0, "step": 3530 }, { "entropy": 0.9726287558674812, "epoch": 0.9648405560098119, "grad_norm": 0.12672601640224457, "learning_rate": 9.994410315645047e-05, "loss": 1.4139, "mean_token_accuracy": 0.7368972420692443, "num_tokens": 254433375.0, "step": 3540 }, { "entropy": 0.9700451165437698, "epoch": 0.967566094303625, "grad_norm": 0.1541493982076645, "learning_rate": 9.994267390058858e-05, "loss": 1.4172, "mean_token_accuracy": 0.7434371784329414, "num_tokens": 255160255.0, "step": 3550 }, { "entropy": 0.9721565470099449, "epoch": 0.970291632597438, "grad_norm": 0.15291433036327362, "learning_rate": 9.994122661245159e-05, "loss": 1.4109, "mean_token_accuracy": 0.7407122254371643, "num_tokens": 255883769.0, "step": 3560 }, { "entropy": 0.9811560899019242, "epoch": 0.9730171708912511, "grad_norm": 0.10619845241308212, "learning_rate": 9.993976129256209e-05, "loss": 1.4204, "mean_token_accuracy": 0.7353764981031418, "num_tokens": 256598991.0, "step": 3570 }, { "entropy": 0.9756833255290985, "epoch": 0.975742709185064, "grad_norm": 0.12091992795467377, "learning_rate": 9.993827794144914e-05, "loss": 1.419, "mean_token_accuracy": 0.7370814487338067, "num_tokens": 257306705.0, "step": 3580 }, { "entropy": 0.9844296738505364, "epoch": 0.9784682474788771, "grad_norm": 0.12438544631004333, "learning_rate": 9.99367765596483e-05, "loss": 1.4184, "mean_token_accuracy": 0.7343698784708976, "num_tokens": 258013773.0, "step": 3590 }, { "entropy": 0.9808205753564835, "epoch": 0.9811937857726901, "grad_norm": 0.1304776519536972, "learning_rate": 9.993525714770166e-05, "loss": 1.413, "mean_token_accuracy": 0.736425158381462, "num_tokens": 258731029.0, "step": 3600 }, { "entropy": 0.9760351404547691, "epoch": 0.9839193240665032, "grad_norm": 0.1096147745847702, "learning_rate": 9.993371970615785e-05, "loss": 1.4177, "mean_token_accuracy": 0.7411983251571655, "num_tokens": 259459979.0, "step": 3610 }, { "entropy": 0.9712781876325607, "epoch": 0.9866448623603161, "grad_norm": 0.14058972895145416, "learning_rate": 9.993216423557194e-05, "loss": 1.4085, "mean_token_accuracy": 0.7394808471202851, "num_tokens": 260180085.0, "step": 3620 }, { "entropy": 0.9717079535126686, "epoch": 0.9893704006541292, "grad_norm": 0.11068553477525711, "learning_rate": 9.993059073650556e-05, "loss": 1.4056, "mean_token_accuracy": 0.7396122291684151, "num_tokens": 260907071.0, "step": 3630 }, { "entropy": 0.9745209664106369, "epoch": 0.9920959389479422, "grad_norm": 0.12133318185806274, "learning_rate": 9.992899920952683e-05, "loss": 1.4106, "mean_token_accuracy": 0.7415842488408089, "num_tokens": 261639149.0, "step": 3640 }, { "entropy": 0.9628227591514588, "epoch": 0.9948214772417553, "grad_norm": 0.3034980297088623, "learning_rate": 9.992738965521041e-05, "loss": 1.4096, "mean_token_accuracy": 0.7393161743879318, "num_tokens": 262346251.0, "step": 3650 }, { "entropy": 0.9788528263568879, "epoch": 0.9975470155355682, "grad_norm": 0.12548959255218506, "learning_rate": 9.992576207413741e-05, "loss": 1.4125, "mean_token_accuracy": 0.7384046420454979, "num_tokens": 263065815.0, "step": 3660 }, { "entropy": 0.9772783532738686, "epoch": 1.0002725538293813, "grad_norm": 0.13550417125225067, "learning_rate": 9.992411646689552e-05, "loss": 1.4132, "mean_token_accuracy": 0.7365165814757347, "num_tokens": 263772518.0, "step": 3670 }, { "entropy": 0.97506842315197, "epoch": 1.0029980921231942, "grad_norm": 0.12043224275112152, "learning_rate": 9.992245283407888e-05, "loss": 1.4098, "mean_token_accuracy": 0.7382272049784661, "num_tokens": 264486665.0, "step": 3680 }, { "entropy": 0.9778215289115906, "epoch": 1.0057236304170074, "grad_norm": 0.12420505285263062, "learning_rate": 9.992077117628817e-05, "loss": 1.4161, "mean_token_accuracy": 0.7353036567568779, "num_tokens": 265187611.0, "step": 3690 }, { "entropy": 0.969636894762516, "epoch": 1.0084491687108204, "grad_norm": 0.1205442026257515, "learning_rate": 9.991907149413055e-05, "loss": 1.411, "mean_token_accuracy": 0.7377049684524536, "num_tokens": 265896405.0, "step": 3700 }, { "entropy": 0.9737311184406281, "epoch": 1.0111747070046335, "grad_norm": 0.11289207637310028, "learning_rate": 9.991735378821973e-05, "loss": 1.4059, "mean_token_accuracy": 0.7394744753837585, "num_tokens": 266622529.0, "step": 3710 }, { "entropy": 0.9757361307740211, "epoch": 1.0139002452984465, "grad_norm": 0.12090495973825455, "learning_rate": 9.991561805917591e-05, "loss": 1.4122, "mean_token_accuracy": 0.7386458143591881, "num_tokens": 267335050.0, "step": 3720 }, { "entropy": 0.964876189827919, "epoch": 1.0166257835922594, "grad_norm": 0.26090943813323975, "learning_rate": 9.991386430762574e-05, "loss": 1.4113, "mean_token_accuracy": 0.7410697713494301, "num_tokens": 268058316.0, "step": 3730 }, { "entropy": 0.9755144536495208, "epoch": 1.0193513218860726, "grad_norm": 0.1461142748594284, "learning_rate": 9.99120925342025e-05, "loss": 1.4123, "mean_token_accuracy": 0.7343229576945305, "num_tokens": 268762648.0, "step": 3740 }, { "entropy": 0.9748295471072197, "epoch": 1.0220768601798855, "grad_norm": 0.11366649717092514, "learning_rate": 9.991030273954585e-05, "loss": 1.4121, "mean_token_accuracy": 0.7391687527298927, "num_tokens": 269489178.0, "step": 3750 }, { "entropy": 0.9809691607952118, "epoch": 1.0248023984736985, "grad_norm": 0.11171828955411911, "learning_rate": 9.990849492430203e-05, "loss": 1.411, "mean_token_accuracy": 0.7341507405042649, "num_tokens": 270199618.0, "step": 3760 }, { "entropy": 0.9676360934972763, "epoch": 1.0275279367675116, "grad_norm": 0.2335195094347, "learning_rate": 9.990666908912376e-05, "loss": 1.4024, "mean_token_accuracy": 0.7410795643925667, "num_tokens": 270911991.0, "step": 3770 }, { "entropy": 0.9800814092159271, "epoch": 1.0302534750613246, "grad_norm": 0.21199901401996613, "learning_rate": 9.990482523467031e-05, "loss": 1.417, "mean_token_accuracy": 0.7395343884825707, "num_tokens": 271632431.0, "step": 3780 }, { "entropy": 0.979529619216919, "epoch": 1.0329790133551375, "grad_norm": 0.15840569138526917, "learning_rate": 9.990296336160739e-05, "loss": 1.4118, "mean_token_accuracy": 0.7357161551713943, "num_tokens": 272349165.0, "step": 3790 }, { "entropy": 0.9744057133793831, "epoch": 1.0357045516489507, "grad_norm": 0.15760374069213867, "learning_rate": 9.990108347060723e-05, "loss": 1.416, "mean_token_accuracy": 0.7330457016825676, "num_tokens": 273045577.0, "step": 3800 }, { "entropy": 0.9722929179668427, "epoch": 1.0384300899427636, "grad_norm": 0.14145927131175995, "learning_rate": 9.989918556234864e-05, "loss": 1.4064, "mean_token_accuracy": 0.7408761292695999, "num_tokens": 273769311.0, "step": 3810 }, { "entropy": 0.9685794860124588, "epoch": 1.0411556282365768, "grad_norm": 0.1353922039270401, "learning_rate": 9.989726963751682e-05, "loss": 1.4061, "mean_token_accuracy": 0.7405291020870208, "num_tokens": 274490053.0, "step": 3820 }, { "entropy": 0.9852296590805054, "epoch": 1.0438811665303898, "grad_norm": 0.1262388378381729, "learning_rate": 9.989533569680356e-05, "loss": 1.4211, "mean_token_accuracy": 0.737436780333519, "num_tokens": 275211918.0, "step": 3830 }, { "entropy": 0.9729504108428955, "epoch": 1.0466067048242027, "grad_norm": 0.11301837861537933, "learning_rate": 9.989338374090713e-05, "loss": 1.4085, "mean_token_accuracy": 0.7369310811161995, "num_tokens": 275929181.0, "step": 3840 }, { "entropy": 0.9741118997335434, "epoch": 1.0493322431180159, "grad_norm": 0.13260625302791595, "learning_rate": 9.98914137705323e-05, "loss": 1.4143, "mean_token_accuracy": 0.7391919955611229, "num_tokens": 276653068.0, "step": 3850 }, { "entropy": 0.9720348879694939, "epoch": 1.0520577814118288, "grad_norm": 0.13643941283226013, "learning_rate": 9.988942578639034e-05, "loss": 1.4084, "mean_token_accuracy": 0.7384933397173882, "num_tokens": 277379115.0, "step": 3860 }, { "entropy": 0.9685726597905159, "epoch": 1.0547833197056418, "grad_norm": 0.14767953753471375, "learning_rate": 9.988741978919902e-05, "loss": 1.4046, "mean_token_accuracy": 0.7400298252701759, "num_tokens": 278095326.0, "step": 3870 }, { "entropy": 0.9742128312587738, "epoch": 1.057508857999455, "grad_norm": 0.10921667516231537, "learning_rate": 9.988539577968265e-05, "loss": 1.403, "mean_token_accuracy": 0.737097255885601, "num_tokens": 278815900.0, "step": 3880 }, { "entropy": 0.9724373623728753, "epoch": 1.0602343962932679, "grad_norm": 0.1891479641199112, "learning_rate": 9.9883353758572e-05, "loss": 1.4082, "mean_token_accuracy": 0.7374177858233452, "num_tokens": 279524148.0, "step": 3890 }, { "entropy": 0.9676162213087082, "epoch": 1.062959934587081, "grad_norm": 0.2643381655216217, "learning_rate": 9.988129372660437e-05, "loss": 1.4054, "mean_token_accuracy": 0.7386135622859001, "num_tokens": 280232785.0, "step": 3900 }, { "entropy": 0.9662006422877312, "epoch": 1.065685472880894, "grad_norm": 0.13425377011299133, "learning_rate": 9.987921568452356e-05, "loss": 1.4007, "mean_token_accuracy": 0.7396600037813187, "num_tokens": 280953294.0, "step": 3910 }, { "entropy": 0.9768855273723602, "epoch": 1.068411011174707, "grad_norm": 0.12102607637643814, "learning_rate": 9.987711963307984e-05, "loss": 1.408, "mean_token_accuracy": 0.7410584643483162, "num_tokens": 281684292.0, "step": 3920 }, { "entropy": 0.9696345388889313, "epoch": 1.07113654946852, "grad_norm": 0.12390506267547607, "learning_rate": 9.987500557303004e-05, "loss": 1.4078, "mean_token_accuracy": 0.7363270789384841, "num_tokens": 282397535.0, "step": 3930 }, { "entropy": 0.9763494119048118, "epoch": 1.073862087762333, "grad_norm": 0.15260037779808044, "learning_rate": 9.987287350513743e-05, "loss": 1.4212, "mean_token_accuracy": 0.7359601497650147, "num_tokens": 283106427.0, "step": 3940 }, { "entropy": 0.9774065673351288, "epoch": 1.076587626056146, "grad_norm": 0.16525544226169586, "learning_rate": 9.987072343017185e-05, "loss": 1.4055, "mean_token_accuracy": 0.7404107555747033, "num_tokens": 283837403.0, "step": 3950 }, { "entropy": 0.9703848645091057, "epoch": 1.0793131643499592, "grad_norm": 0.13805174827575684, "learning_rate": 9.986855534890957e-05, "loss": 1.4112, "mean_token_accuracy": 0.7389624550938606, "num_tokens": 284548634.0, "step": 3960 }, { "entropy": 0.9771598130464554, "epoch": 1.082038702643772, "grad_norm": 0.11810410022735596, "learning_rate": 9.986636926213341e-05, "loss": 1.4055, "mean_token_accuracy": 0.7352323740720749, "num_tokens": 285256203.0, "step": 3970 }, { "entropy": 0.9775662258267402, "epoch": 1.0847642409375853, "grad_norm": 0.11807934939861298, "learning_rate": 9.986416517063271e-05, "loss": 1.4211, "mean_token_accuracy": 0.7364842385053635, "num_tokens": 285961891.0, "step": 3980 }, { "entropy": 0.9697574928402901, "epoch": 1.0874897792313982, "grad_norm": 0.10679399967193604, "learning_rate": 9.986194307520323e-05, "loss": 1.4063, "mean_token_accuracy": 0.7410814076662063, "num_tokens": 286672644.0, "step": 3990 }, { "entropy": 0.967772725224495, "epoch": 1.0902153175252112, "grad_norm": 0.1722603440284729, "learning_rate": 9.985970297664728e-05, "loss": 1.4025, "mean_token_accuracy": 0.7408358335494996, "num_tokens": 287393348.0, "step": 4000 }, { "entropy": 0.967395193874836, "epoch": 1.0929408558190243, "grad_norm": 0.1754252314567566, "learning_rate": 9.98574448757737e-05, "loss": 1.4075, "mean_token_accuracy": 0.7433686286211014, "num_tokens": 288124634.0, "step": 4010 }, { "entropy": 0.9791459232568741, "epoch": 1.0956663941128373, "grad_norm": 0.13418108224868774, "learning_rate": 9.985516877339778e-05, "loss": 1.4096, "mean_token_accuracy": 0.7463141262531281, "num_tokens": 288875900.0, "step": 4020 }, { "entropy": 0.966758668422699, "epoch": 1.0983919324066502, "grad_norm": 0.10789959132671356, "learning_rate": 9.985287467034133e-05, "loss": 1.4133, "mean_token_accuracy": 0.7402540147304535, "num_tokens": 289579323.0, "step": 4030 }, { "entropy": 0.9771617695689201, "epoch": 1.1011174707004634, "grad_norm": 0.24271731078624725, "learning_rate": 9.985056256743266e-05, "loss": 1.4102, "mean_token_accuracy": 0.7404718190431595, "num_tokens": 290304508.0, "step": 4040 }, { "entropy": 0.9759747684001923, "epoch": 1.1038430089942763, "grad_norm": 0.13188596069812775, "learning_rate": 9.984823246550659e-05, "loss": 1.411, "mean_token_accuracy": 0.740820249915123, "num_tokens": 291030812.0, "step": 4050 }, { "entropy": 0.9823436632752418, "epoch": 1.1065685472880893, "grad_norm": 0.13854913413524628, "learning_rate": 9.984588436540438e-05, "loss": 1.4271, "mean_token_accuracy": 0.7301308572292328, "num_tokens": 291727243.0, "step": 4060 }, { "entropy": 0.9707790210843086, "epoch": 1.1092940855819025, "grad_norm": 0.15856264531612396, "learning_rate": 9.984351826797389e-05, "loss": 1.4069, "mean_token_accuracy": 0.7377354234457016, "num_tokens": 292445092.0, "step": 4070 }, { "entropy": 0.9699542596936226, "epoch": 1.1120196238757154, "grad_norm": 0.15144968032836914, "learning_rate": 9.984113417406939e-05, "loss": 1.4128, "mean_token_accuracy": 0.7451657593250275, "num_tokens": 293179588.0, "step": 4080 }, { "entropy": 0.9735559523105621, "epoch": 1.1147451621695286, "grad_norm": 0.2099827527999878, "learning_rate": 9.98387320845517e-05, "loss": 1.4082, "mean_token_accuracy": 0.7413778752088547, "num_tokens": 293902990.0, "step": 4090 }, { "entropy": 0.9711895674467087, "epoch": 1.1174707004633415, "grad_norm": 0.30111899971961975, "learning_rate": 9.983631200028808e-05, "loss": 1.4069, "mean_token_accuracy": 0.7399752870202064, "num_tokens": 294628257.0, "step": 4100 }, { "entropy": 0.967848864197731, "epoch": 1.1201962387571545, "grad_norm": 0.14860115945339203, "learning_rate": 9.983387392215238e-05, "loss": 1.4035, "mean_token_accuracy": 0.7399855732917786, "num_tokens": 295343589.0, "step": 4110 }, { "entropy": 0.9747548431158066, "epoch": 1.1229217770509676, "grad_norm": 0.15380148589611053, "learning_rate": 9.983141785102483e-05, "loss": 1.4168, "mean_token_accuracy": 0.7410910993814468, "num_tokens": 296066401.0, "step": 4120 }, { "entropy": 0.9697711855173111, "epoch": 1.1256473153447806, "grad_norm": 0.12143965810537338, "learning_rate": 9.982894378779226e-05, "loss": 1.4141, "mean_token_accuracy": 0.7393874973058701, "num_tokens": 296784664.0, "step": 4130 }, { "entropy": 0.970097741484642, "epoch": 1.1283728536385937, "grad_norm": 0.11673377454280853, "learning_rate": 9.982645173334794e-05, "loss": 1.4089, "mean_token_accuracy": 0.7406289339065552, "num_tokens": 297499538.0, "step": 4140 }, { "entropy": 0.9692523866891861, "epoch": 1.1310983919324067, "grad_norm": 0.1403290182352066, "learning_rate": 9.982394168859164e-05, "loss": 1.4131, "mean_token_accuracy": 0.7348797231912613, "num_tokens": 298199689.0, "step": 4150 }, { "entropy": 0.9668681174516678, "epoch": 1.1338239302262196, "grad_norm": 0.1316184103488922, "learning_rate": 9.982141365442966e-05, "loss": 1.4069, "mean_token_accuracy": 0.7375933572649955, "num_tokens": 298910195.0, "step": 4160 }, { "entropy": 0.9702906340360642, "epoch": 1.1365494685200328, "grad_norm": 0.12228190153837204, "learning_rate": 9.981886763177476e-05, "loss": 1.4151, "mean_token_accuracy": 0.7387032642960548, "num_tokens": 299620451.0, "step": 4170 }, { "entropy": 0.9716745302081108, "epoch": 1.1392750068138457, "grad_norm": 0.1245054379105568, "learning_rate": 9.98163036215462e-05, "loss": 1.4065, "mean_token_accuracy": 0.7411650583148003, "num_tokens": 300344107.0, "step": 4180 }, { "entropy": 0.9720513239502907, "epoch": 1.1420005451076587, "grad_norm": 0.15862545371055603, "learning_rate": 9.981372162466973e-05, "loss": 1.4124, "mean_token_accuracy": 0.7386313796043396, "num_tokens": 301061829.0, "step": 4190 }, { "entropy": 0.9701609164476395, "epoch": 1.1447260834014719, "grad_norm": 0.18401804566383362, "learning_rate": 9.981112164207763e-05, "loss": 1.4042, "mean_token_accuracy": 0.7445456832647324, "num_tokens": 301792603.0, "step": 4200 }, { "entropy": 0.9677683159708976, "epoch": 1.1474516216952848, "grad_norm": 0.12356293946504593, "learning_rate": 9.980850367470863e-05, "loss": 1.399, "mean_token_accuracy": 0.7404949709773063, "num_tokens": 302512106.0, "step": 4210 }, { "entropy": 0.9647759571671486, "epoch": 1.1501771599890978, "grad_norm": 0.13986940681934357, "learning_rate": 9.980586772350798e-05, "loss": 1.3967, "mean_token_accuracy": 0.7414400741457939, "num_tokens": 303239734.0, "step": 4220 }, { "entropy": 0.9754222020506859, "epoch": 1.152902698282911, "grad_norm": 0.1358058601617813, "learning_rate": 9.980321378942741e-05, "loss": 1.4137, "mean_token_accuracy": 0.7352504953742027, "num_tokens": 303949407.0, "step": 4230 }, { "entropy": 0.9723289042711258, "epoch": 1.1556282365767239, "grad_norm": 0.1265636384487152, "learning_rate": 9.980054187342516e-05, "loss": 1.4089, "mean_token_accuracy": 0.7384456306695938, "num_tokens": 304662945.0, "step": 4240 }, { "entropy": 0.974214768409729, "epoch": 1.158353774870537, "grad_norm": 0.12341339141130447, "learning_rate": 9.979785197646593e-05, "loss": 1.413, "mean_token_accuracy": 0.7399124011397362, "num_tokens": 305380069.0, "step": 4250 }, { "entropy": 0.9702006042003631, "epoch": 1.16107931316435, "grad_norm": 0.1514752358198166, "learning_rate": 9.979514409952096e-05, "loss": 1.412, "mean_token_accuracy": 0.7410535365343094, "num_tokens": 306097964.0, "step": 4260 }, { "entropy": 0.9635045930743218, "epoch": 1.163804851458163, "grad_norm": 0.09730468690395355, "learning_rate": 9.979241824356791e-05, "loss": 1.4014, "mean_token_accuracy": 0.7407137379050255, "num_tokens": 306810361.0, "step": 4270 }, { "entropy": 0.9600163742899894, "epoch": 1.166530389751976, "grad_norm": 0.19360746443271637, "learning_rate": 9.978967440959101e-05, "loss": 1.3968, "mean_token_accuracy": 0.7477250754833221, "num_tokens": 307552298.0, "step": 4280 }, { "entropy": 0.9812612414360047, "epoch": 1.169255928045789, "grad_norm": 0.09811007231473923, "learning_rate": 9.978691259858097e-05, "loss": 1.4168, "mean_token_accuracy": 0.7393087267875671, "num_tokens": 308269441.0, "step": 4290 }, { "entropy": 0.9744583383202553, "epoch": 1.171981466339602, "grad_norm": 0.1087038516998291, "learning_rate": 9.978413281153491e-05, "loss": 1.4132, "mean_token_accuracy": 0.7385753050446511, "num_tokens": 308987989.0, "step": 4300 }, { "entropy": 0.9722009614109993, "epoch": 1.1747070046334152, "grad_norm": 0.25121307373046875, "learning_rate": 9.978133504945655e-05, "loss": 1.406, "mean_token_accuracy": 0.7378881454467774, "num_tokens": 309705847.0, "step": 4310 }, { "entropy": 0.9756908550858497, "epoch": 1.177432542927228, "grad_norm": 0.14021795988082886, "learning_rate": 9.977851931335602e-05, "loss": 1.4008, "mean_token_accuracy": 0.7398674771189689, "num_tokens": 310432150.0, "step": 4320 }, { "entropy": 0.9696485593914985, "epoch": 1.180158081221041, "grad_norm": 0.13773490488529205, "learning_rate": 9.977568560424997e-05, "loss": 1.4141, "mean_token_accuracy": 0.7451538845896721, "num_tokens": 311161749.0, "step": 4330 }, { "entropy": 0.9696112379431725, "epoch": 1.1828836195148542, "grad_norm": 0.11383041739463806, "learning_rate": 9.977283392316154e-05, "loss": 1.4009, "mean_token_accuracy": 0.741061507165432, "num_tokens": 311887750.0, "step": 4340 }, { "entropy": 0.9739535748958588, "epoch": 1.1856091578086672, "grad_norm": 0.14352960884571075, "learning_rate": 9.976996427112036e-05, "loss": 1.4172, "mean_token_accuracy": 0.7372234463691711, "num_tokens": 312602425.0, "step": 4350 }, { "entropy": 0.9777967765927315, "epoch": 1.1883346961024803, "grad_norm": 0.14844806492328644, "learning_rate": 9.976707664916254e-05, "loss": 1.4069, "mean_token_accuracy": 0.7373544290661812, "num_tokens": 313332944.0, "step": 4360 }, { "entropy": 0.973545515537262, "epoch": 1.1910602343962933, "grad_norm": 0.1698267161846161, "learning_rate": 9.97641710583307e-05, "loss": 1.4068, "mean_token_accuracy": 0.7357580438256264, "num_tokens": 314046985.0, "step": 4370 }, { "entropy": 0.9729410991072655, "epoch": 1.1937857726901062, "grad_norm": 0.21367119252681732, "learning_rate": 9.976124749967391e-05, "loss": 1.4061, "mean_token_accuracy": 0.7449333608150482, "num_tokens": 314784201.0, "step": 4380 }, { "entropy": 0.9695119127631188, "epoch": 1.1965113109839194, "grad_norm": 0.1914973258972168, "learning_rate": 9.975830597424777e-05, "loss": 1.398, "mean_token_accuracy": 0.7413497671484948, "num_tokens": 315515584.0, "step": 4390 }, { "entropy": 0.9745991230010986, "epoch": 1.1992368492777323, "grad_norm": 0.09760070592164993, "learning_rate": 9.97553464831143e-05, "loss": 1.4097, "mean_token_accuracy": 0.7376661255955697, "num_tokens": 316231773.0, "step": 4400 }, { "entropy": 0.9677482321858406, "epoch": 1.2019623875715455, "grad_norm": 0.1391540765762329, "learning_rate": 9.975236902734213e-05, "loss": 1.4046, "mean_token_accuracy": 0.7410488307476044, "num_tokens": 316959973.0, "step": 4410 }, { "entropy": 0.9732399925589561, "epoch": 1.2046879258653584, "grad_norm": 0.11403980106115341, "learning_rate": 9.974937360800622e-05, "loss": 1.4102, "mean_token_accuracy": 0.736595906317234, "num_tokens": 317668555.0, "step": 4420 }, { "entropy": 0.9660505890846253, "epoch": 1.2074134641591714, "grad_norm": 0.09890380501747131, "learning_rate": 9.974636022618813e-05, "loss": 1.4028, "mean_token_accuracy": 0.7411175265908241, "num_tokens": 318391002.0, "step": 4430 }, { "entropy": 0.9746992096304894, "epoch": 1.2101390024529846, "grad_norm": 0.1454600989818573, "learning_rate": 9.974332888297589e-05, "loss": 1.4015, "mean_token_accuracy": 0.742490966618061, "num_tokens": 319121319.0, "step": 4440 }, { "entropy": 0.9703999727964401, "epoch": 1.2128645407467975, "grad_norm": 0.14531758427619934, "learning_rate": 9.974027957946394e-05, "loss": 1.4077, "mean_token_accuracy": 0.7393903106451034, "num_tokens": 319844030.0, "step": 4450 }, { "entropy": 0.9730675384402275, "epoch": 1.2155900790406104, "grad_norm": 0.09914612770080566, "learning_rate": 9.973721231675331e-05, "loss": 1.4034, "mean_token_accuracy": 0.7403646603226661, "num_tokens": 320571272.0, "step": 4460 }, { "entropy": 0.9742552965879441, "epoch": 1.2183156173344236, "grad_norm": 0.1258276253938675, "learning_rate": 9.973412709595144e-05, "loss": 1.4077, "mean_token_accuracy": 0.7421027988195419, "num_tokens": 321297398.0, "step": 4470 }, { "entropy": 0.9606939122080803, "epoch": 1.2210411556282366, "grad_norm": 0.11029420793056488, "learning_rate": 9.97310239181723e-05, "loss": 1.3993, "mean_token_accuracy": 0.7463144496083259, "num_tokens": 322035012.0, "step": 4480 }, { "entropy": 0.9743346512317658, "epoch": 1.2237666939220495, "grad_norm": 0.13282760977745056, "learning_rate": 9.97279027845363e-05, "loss": 1.4117, "mean_token_accuracy": 0.7394008815288544, "num_tokens": 322759503.0, "step": 4490 }, { "entropy": 0.9749991357326507, "epoch": 1.2264922322158627, "grad_norm": 0.30340775847435, "learning_rate": 9.972476369617036e-05, "loss": 1.4215, "mean_token_accuracy": 0.7399731442332268, "num_tokens": 323471760.0, "step": 4500 }, { "entropy": 0.9715635746717453, "epoch": 1.2292177705096756, "grad_norm": 0.19635392725467682, "learning_rate": 9.972160665420788e-05, "loss": 1.411, "mean_token_accuracy": 0.738856740295887, "num_tokens": 324191070.0, "step": 4510 }, { "entropy": 0.9710773929953576, "epoch": 1.2319433088034888, "grad_norm": 0.16573446989059448, "learning_rate": 9.971843165978873e-05, "loss": 1.3998, "mean_token_accuracy": 0.7402691707015038, "num_tokens": 324915048.0, "step": 4520 }, { "entropy": 0.9762237891554832, "epoch": 1.2346688470973017, "grad_norm": 0.1468210071325302, "learning_rate": 9.97152387140593e-05, "loss": 1.4127, "mean_token_accuracy": 0.7367881044745446, "num_tokens": 325626112.0, "step": 4530 }, { "entropy": 0.9673715129494667, "epoch": 1.2373943853911147, "grad_norm": 0.15306654572486877, "learning_rate": 9.97120278181724e-05, "loss": 1.4068, "mean_token_accuracy": 0.7392708584666252, "num_tokens": 326349540.0, "step": 4540 }, { "entropy": 0.9674241647124291, "epoch": 1.2401199236849278, "grad_norm": 0.14154525101184845, "learning_rate": 9.970879897328738e-05, "loss": 1.4022, "mean_token_accuracy": 0.739752496778965, "num_tokens": 327070191.0, "step": 4550 }, { "entropy": 0.9727215856313706, "epoch": 1.2428454619787408, "grad_norm": 0.11445024609565735, "learning_rate": 9.970555218057002e-05, "loss": 1.4128, "mean_token_accuracy": 0.7393271207809449, "num_tokens": 327785310.0, "step": 4560 }, { "entropy": 0.9723274782299995, "epoch": 1.2455710002725537, "grad_norm": 0.138005793094635, "learning_rate": 9.970228744119264e-05, "loss": 1.4137, "mean_token_accuracy": 0.7351332068443298, "num_tokens": 328491172.0, "step": 4570 }, { "entropy": 0.9660980984568596, "epoch": 1.248296538566367, "grad_norm": 0.13529391586780548, "learning_rate": 9.969900475633395e-05, "loss": 1.4026, "mean_token_accuracy": 0.7479706987738609, "num_tokens": 329232744.0, "step": 4580 }, { "entropy": 0.9704912841320038, "epoch": 1.2510220768601799, "grad_norm": 0.162317156791687, "learning_rate": 9.969570412717925e-05, "loss": 1.4057, "mean_token_accuracy": 0.7417619049549102, "num_tokens": 329966706.0, "step": 4590 }, { "entropy": 0.9835660576820373, "epoch": 1.2537476151539928, "grad_norm": 0.11597214639186859, "learning_rate": 9.969238555492025e-05, "loss": 1.4146, "mean_token_accuracy": 0.7364133894443512, "num_tokens": 330682714.0, "step": 4600 }, { "entropy": 0.9688590139150619, "epoch": 1.256473153447806, "grad_norm": 0.12225977331399918, "learning_rate": 9.968904904075511e-05, "loss": 1.4072, "mean_token_accuracy": 0.7402441427111626, "num_tokens": 331401822.0, "step": 4610 }, { "entropy": 0.9649090647697449, "epoch": 1.259198691741619, "grad_norm": 0.10383719950914383, "learning_rate": 9.968569458588857e-05, "loss": 1.3949, "mean_token_accuracy": 0.7428733959794045, "num_tokens": 332125457.0, "step": 4620 }, { "entropy": 0.9636820971965789, "epoch": 1.261924230035432, "grad_norm": 0.2340947836637497, "learning_rate": 9.968232219153175e-05, "loss": 1.3969, "mean_token_accuracy": 0.7443041607737542, "num_tokens": 332857765.0, "step": 4630 }, { "entropy": 0.9748477324843406, "epoch": 1.264649768329245, "grad_norm": 0.1700190305709839, "learning_rate": 9.967893185890232e-05, "loss": 1.4128, "mean_token_accuracy": 0.7405909344553947, "num_tokens": 333578614.0, "step": 4640 }, { "entropy": 0.9795809105038643, "epoch": 1.267375306623058, "grad_norm": 0.1715494692325592, "learning_rate": 9.967552358922434e-05, "loss": 1.4232, "mean_token_accuracy": 0.7324912399053574, "num_tokens": 334268107.0, "step": 4650 }, { "entropy": 0.9613471925258636, "epoch": 1.2701008449168711, "grad_norm": 0.11859522014856339, "learning_rate": 9.967209738372845e-05, "loss": 1.4037, "mean_token_accuracy": 0.7405437037348748, "num_tokens": 334974099.0, "step": 4660 }, { "entropy": 0.9693601042032242, "epoch": 1.272826383210684, "grad_norm": 0.12638618052005768, "learning_rate": 9.966865324365167e-05, "loss": 1.3971, "mean_token_accuracy": 0.7439545139670372, "num_tokens": 335712163.0, "step": 4670 }, { "entropy": 0.9626713693141937, "epoch": 1.2755519215044973, "grad_norm": 0.13341055810451508, "learning_rate": 9.966519117023756e-05, "loss": 1.4017, "mean_token_accuracy": 0.7433236762881279, "num_tokens": 336432921.0, "step": 4680 }, { "entropy": 0.9728736892342568, "epoch": 1.2782774597983102, "grad_norm": 0.14286339282989502, "learning_rate": 9.966171116473614e-05, "loss": 1.404, "mean_token_accuracy": 0.7400946334004402, "num_tokens": 337153765.0, "step": 4690 }, { "entropy": 0.9666111811995506, "epoch": 1.2810029980921231, "grad_norm": 0.14786115288734436, "learning_rate": 9.96582132284039e-05, "loss": 1.3987, "mean_token_accuracy": 0.7426782041788101, "num_tokens": 337881884.0, "step": 4700 }, { "entropy": 0.9663512572646141, "epoch": 1.283728536385936, "grad_norm": 0.11639788001775742, "learning_rate": 9.965469736250377e-05, "loss": 1.4023, "mean_token_accuracy": 0.7427395194768905, "num_tokens": 338610104.0, "step": 4710 }, { "entropy": 0.9779267340898514, "epoch": 1.2864540746797493, "grad_norm": 0.09598447382450104, "learning_rate": 9.965116356830523e-05, "loss": 1.4148, "mean_token_accuracy": 0.7342917695641518, "num_tokens": 339318927.0, "step": 4720 }, { "entropy": 0.9727552771568299, "epoch": 1.2891796129735622, "grad_norm": 0.10459399223327637, "learning_rate": 9.964761184708418e-05, "loss": 1.4069, "mean_token_accuracy": 0.7402333587408065, "num_tokens": 340037954.0, "step": 4730 }, { "entropy": 0.970164880156517, "epoch": 1.2919051512673754, "grad_norm": 0.14718195796012878, "learning_rate": 9.964404220012298e-05, "loss": 1.4051, "mean_token_accuracy": 0.7438466176390648, "num_tokens": 340769677.0, "step": 4740 }, { "entropy": 0.9741303488612175, "epoch": 1.2946306895611883, "grad_norm": 0.10659249126911163, "learning_rate": 9.96404546287105e-05, "loss": 1.4108, "mean_token_accuracy": 0.7378978326916694, "num_tokens": 341482922.0, "step": 4750 }, { "entropy": 0.964579838514328, "epoch": 1.2973562278550013, "grad_norm": 0.10390475392341614, "learning_rate": 9.963684913414208e-05, "loss": 1.3923, "mean_token_accuracy": 0.7442897364497185, "num_tokens": 342224002.0, "step": 4760 }, { "entropy": 0.9747483864426613, "epoch": 1.3000817661488144, "grad_norm": 0.24640607833862305, "learning_rate": 9.963322571771949e-05, "loss": 1.4091, "mean_token_accuracy": 0.7386063888669014, "num_tokens": 342936013.0, "step": 4770 }, { "entropy": 0.9741189420223236, "epoch": 1.3028073044426274, "grad_norm": 0.11026379466056824, "learning_rate": 9.9629584380751e-05, "loss": 1.4077, "mean_token_accuracy": 0.7361203297972679, "num_tokens": 343651597.0, "step": 4780 }, { "entropy": 0.9651884615421296, "epoch": 1.3055328427364405, "grad_norm": 0.18231336772441864, "learning_rate": 9.962592512455138e-05, "loss": 1.4015, "mean_token_accuracy": 0.7450736105442047, "num_tokens": 344387553.0, "step": 4790 }, { "entropy": 0.961803525686264, "epoch": 1.3082583810302535, "grad_norm": 0.10563954710960388, "learning_rate": 9.962224795044184e-05, "loss": 1.3941, "mean_token_accuracy": 0.7397433206439018, "num_tokens": 345102338.0, "step": 4800 }, { "entropy": 0.9752078264951706, "epoch": 1.3109839193240664, "grad_norm": 0.08828509598970413, "learning_rate": 9.961855285975001e-05, "loss": 1.4062, "mean_token_accuracy": 0.7382546260952949, "num_tokens": 345815930.0, "step": 4810 }, { "entropy": 0.974830986559391, "epoch": 1.3137094576178796, "grad_norm": 0.14658141136169434, "learning_rate": 9.961483985381009e-05, "loss": 1.4154, "mean_token_accuracy": 0.7359081193804741, "num_tokens": 346522652.0, "step": 4820 }, { "entropy": 0.9659509539604187, "epoch": 1.3164349959116926, "grad_norm": 0.11177151650190353, "learning_rate": 9.961110893396263e-05, "loss": 1.3946, "mean_token_accuracy": 0.7395478710532188, "num_tokens": 347233138.0, "step": 4830 }, { "entropy": 0.9693713441491127, "epoch": 1.3191605342055057, "grad_norm": 0.158463716506958, "learning_rate": 9.96073601015548e-05, "loss": 1.4044, "mean_token_accuracy": 0.7397462442517281, "num_tokens": 347951579.0, "step": 4840 }, { "entropy": 0.9697089105844497, "epoch": 1.3218860724993187, "grad_norm": 0.1285538375377655, "learning_rate": 9.96035933579401e-05, "loss": 1.402, "mean_token_accuracy": 0.7475307866930961, "num_tokens": 348693113.0, "step": 4850 }, { "entropy": 0.9771092981100082, "epoch": 1.3246116107931316, "grad_norm": 0.1073615625500679, "learning_rate": 9.959980870447854e-05, "loss": 1.4112, "mean_token_accuracy": 0.7395440816879273, "num_tokens": 349420285.0, "step": 4860 }, { "entropy": 0.9649139031767845, "epoch": 1.3273371490869446, "grad_norm": 0.11734608560800552, "learning_rate": 9.959600614253663e-05, "loss": 1.409, "mean_token_accuracy": 0.7405727341771126, "num_tokens": 350135291.0, "step": 4870 }, { "entropy": 0.9652960941195488, "epoch": 1.3300626873807577, "grad_norm": 0.10706183314323425, "learning_rate": 9.959218567348732e-05, "loss": 1.3983, "mean_token_accuracy": 0.7411574274301529, "num_tokens": 350851336.0, "step": 4880 }, { "entropy": 0.9691098436713219, "epoch": 1.3327882256745707, "grad_norm": 0.12964962422847748, "learning_rate": 9.958834729871002e-05, "loss": 1.4151, "mean_token_accuracy": 0.7378066569566727, "num_tokens": 351555913.0, "step": 4890 }, { "entropy": 0.9715841427445412, "epoch": 1.3355137639683838, "grad_norm": 0.10759638249874115, "learning_rate": 9.95844910195906e-05, "loss": 1.4039, "mean_token_accuracy": 0.7350040569901466, "num_tokens": 352269755.0, "step": 4900 }, { "entropy": 0.974685150384903, "epoch": 1.3382393022621968, "grad_norm": 0.1167893037199974, "learning_rate": 9.958061683752143e-05, "loss": 1.4088, "mean_token_accuracy": 0.7382029041647911, "num_tokens": 352996391.0, "step": 4910 }, { "entropy": 0.9621032327413559, "epoch": 1.3409648405560097, "grad_norm": 0.10185514390468597, "learning_rate": 9.957672475390129e-05, "loss": 1.3953, "mean_token_accuracy": 0.7431463569402694, "num_tokens": 353717924.0, "step": 4920 }, { "entropy": 0.9662080585956574, "epoch": 1.343690378849823, "grad_norm": 0.11236744374036789, "learning_rate": 9.957281477013548e-05, "loss": 1.4055, "mean_token_accuracy": 0.7385106563568116, "num_tokens": 354429863.0, "step": 4930 }, { "entropy": 0.9646960616111755, "epoch": 1.3464159171436358, "grad_norm": 0.10907775908708572, "learning_rate": 9.956888688763573e-05, "loss": 1.3959, "mean_token_accuracy": 0.7475621044635773, "num_tokens": 355175867.0, "step": 4940 }, { "entropy": 0.9851981371641159, "epoch": 1.349141455437449, "grad_norm": 0.23139843344688416, "learning_rate": 9.956494110782022e-05, "loss": 1.4173, "mean_token_accuracy": 0.7367147475481033, "num_tokens": 355898678.0, "step": 4950 }, { "entropy": 0.972486612200737, "epoch": 1.351866993731262, "grad_norm": 0.10554983466863632, "learning_rate": 9.956097743211363e-05, "loss": 1.4046, "mean_token_accuracy": 0.7401088133454323, "num_tokens": 356631902.0, "step": 4960 }, { "entropy": 0.9727440178394318, "epoch": 1.354592532025075, "grad_norm": 0.15384016931056976, "learning_rate": 9.95569958619471e-05, "loss": 1.4044, "mean_token_accuracy": 0.7396053314208985, "num_tokens": 357348213.0, "step": 4970 }, { "entropy": 0.9753688693046569, "epoch": 1.3573180703188878, "grad_norm": 0.11177823692560196, "learning_rate": 9.955299639875818e-05, "loss": 1.4169, "mean_token_accuracy": 0.736075484752655, "num_tokens": 358047933.0, "step": 4980 }, { "entropy": 0.9673207774758339, "epoch": 1.360043608612701, "grad_norm": 0.09317687153816223, "learning_rate": 9.954897904399093e-05, "loss": 1.4044, "mean_token_accuracy": 0.7369695752859116, "num_tokens": 358762622.0, "step": 4990 }, { "entropy": 0.9734054937958717, "epoch": 1.362769146906514, "grad_norm": 0.17638979852199554, "learning_rate": 9.954494379909585e-05, "loss": 1.4028, "mean_token_accuracy": 0.7384358510375023, "num_tokens": 359480737.0, "step": 5000 }, { "entropy": 0.97704269438982, "epoch": 1.3654946852003271, "grad_norm": 0.11890945583581924, "learning_rate": 9.954089066552991e-05, "loss": 1.4066, "mean_token_accuracy": 0.7409640535712242, "num_tokens": 360205405.0, "step": 5010 }, { "entropy": 0.9697741746902466, "epoch": 1.36822022349414, "grad_norm": 0.21392837166786194, "learning_rate": 9.953681964475652e-05, "loss": 1.4084, "mean_token_accuracy": 0.737616577744484, "num_tokens": 360916851.0, "step": 5020 }, { "entropy": 0.9659984797239304, "epoch": 1.370945761787953, "grad_norm": 0.10474559664726257, "learning_rate": 9.953273073824557e-05, "loss": 1.3971, "mean_token_accuracy": 0.74130250364542, "num_tokens": 361639152.0, "step": 5030 }, { "entropy": 0.9709238648414612, "epoch": 1.3736713000817662, "grad_norm": 0.1659403145313263, "learning_rate": 9.95286239474734e-05, "loss": 1.4007, "mean_token_accuracy": 0.7374826833605767, "num_tokens": 362347888.0, "step": 5040 }, { "entropy": 0.9627052456140518, "epoch": 1.3763968383755791, "grad_norm": 0.12752042710781097, "learning_rate": 9.95244992739228e-05, "loss": 1.4015, "mean_token_accuracy": 0.7374019876122475, "num_tokens": 363055074.0, "step": 5050 }, { "entropy": 0.9730372503399849, "epoch": 1.3791223766693923, "grad_norm": 0.10037846863269806, "learning_rate": 9.952035671908302e-05, "loss": 1.4055, "mean_token_accuracy": 0.7396304190158844, "num_tokens": 363770036.0, "step": 5060 }, { "entropy": 0.9712066382169724, "epoch": 1.3818479149632052, "grad_norm": 0.13504239916801453, "learning_rate": 9.951619628444977e-05, "loss": 1.4064, "mean_token_accuracy": 0.7389048680663108, "num_tokens": 364480178.0, "step": 5070 }, { "entropy": 0.9749246120452881, "epoch": 1.3845734532570182, "grad_norm": 0.13781282305717468, "learning_rate": 9.951201797152523e-05, "loss": 1.4065, "mean_token_accuracy": 0.7400273680686951, "num_tokens": 365187178.0, "step": 5080 }, { "entropy": 0.971899363398552, "epoch": 1.3872989915508314, "grad_norm": 0.1477481722831726, "learning_rate": 9.9507821781818e-05, "loss": 1.4158, "mean_token_accuracy": 0.730982817709446, "num_tokens": 365883898.0, "step": 5090 }, { "entropy": 0.966162946820259, "epoch": 1.3900245298446443, "grad_norm": 0.1793452352285385, "learning_rate": 9.950360771684316e-05, "loss": 1.403, "mean_token_accuracy": 0.7393653288483619, "num_tokens": 366602829.0, "step": 5100 }, { "entropy": 0.9741988733410836, "epoch": 1.3927500681384575, "grad_norm": 0.1578950583934784, "learning_rate": 9.949937577812223e-05, "loss": 1.4071, "mean_token_accuracy": 0.7414002895355225, "num_tokens": 367316769.0, "step": 5110 }, { "entropy": 0.9581542372703552, "epoch": 1.3954756064322704, "grad_norm": 0.1000090092420578, "learning_rate": 9.949512596718323e-05, "loss": 1.3946, "mean_token_accuracy": 0.7404720976948738, "num_tokens": 368032771.0, "step": 5120 }, { "entropy": 0.9679626032710076, "epoch": 1.3982011447260834, "grad_norm": 0.108095683157444, "learning_rate": 9.949085828556053e-05, "loss": 1.4133, "mean_token_accuracy": 0.735573785007, "num_tokens": 368734920.0, "step": 5130 }, { "entropy": 0.9785879150032997, "epoch": 1.4009266830198963, "grad_norm": 0.1070920005440712, "learning_rate": 9.948657273479507e-05, "loss": 1.4184, "mean_token_accuracy": 0.73294368237257, "num_tokens": 369438117.0, "step": 5140 }, { "entropy": 0.9624388098716736, "epoch": 1.4036522213137095, "grad_norm": 0.11080455034971237, "learning_rate": 9.948226931643417e-05, "loss": 1.3899, "mean_token_accuracy": 0.7419885486364365, "num_tokens": 370169171.0, "step": 5150 }, { "entropy": 0.9686688229441642, "epoch": 1.4063777596075224, "grad_norm": 0.11958616226911545, "learning_rate": 9.94779480320316e-05, "loss": 1.402, "mean_token_accuracy": 0.7391363710165024, "num_tokens": 370885893.0, "step": 5160 }, { "entropy": 0.9716649666428566, "epoch": 1.4091032979013356, "grad_norm": 0.26983004808425903, "learning_rate": 9.947360888314765e-05, "loss": 1.4, "mean_token_accuracy": 0.7359407395124435, "num_tokens": 371592228.0, "step": 5170 }, { "entropy": 0.9631922513246536, "epoch": 1.4118288361951485, "grad_norm": 0.08574482053518295, "learning_rate": 9.946925187134897e-05, "loss": 1.4038, "mean_token_accuracy": 0.7413485586643219, "num_tokens": 372304040.0, "step": 5180 }, { "entropy": 0.9777448117733002, "epoch": 1.4145543744889615, "grad_norm": 0.12568679451942444, "learning_rate": 9.94648769982087e-05, "loss": 1.4055, "mean_token_accuracy": 0.7402204349637032, "num_tokens": 373032183.0, "step": 5190 }, { "entropy": 0.9667919337749481, "epoch": 1.4172799127827747, "grad_norm": 0.10519536584615707, "learning_rate": 9.946048426530646e-05, "loss": 1.4047, "mean_token_accuracy": 0.7366608127951622, "num_tokens": 373740579.0, "step": 5200 }, { "entropy": 0.9548894897103309, "epoch": 1.4200054510765876, "grad_norm": 0.13211771845817566, "learning_rate": 9.945607367422825e-05, "loss": 1.4001, "mean_token_accuracy": 0.7390782698988915, "num_tokens": 374439723.0, "step": 5210 }, { "entropy": 0.9750136703252792, "epoch": 1.4227309893704008, "grad_norm": 0.12971355020999908, "learning_rate": 9.945164522656659e-05, "loss": 1.4114, "mean_token_accuracy": 0.7375137954950333, "num_tokens": 375151408.0, "step": 5220 }, { "entropy": 0.9739547118544578, "epoch": 1.4254565276642137, "grad_norm": 0.14966237545013428, "learning_rate": 9.944719892392038e-05, "loss": 1.4142, "mean_token_accuracy": 0.7377022936940193, "num_tokens": 375870416.0, "step": 5230 }, { "entropy": 0.9648297607898713, "epoch": 1.4281820659580267, "grad_norm": 0.36714956164360046, "learning_rate": 9.944273476789503e-05, "loss": 1.3945, "mean_token_accuracy": 0.7440789759159088, "num_tokens": 376599833.0, "step": 5240 }, { "entropy": 0.9652238085865974, "epoch": 1.4309076042518396, "grad_norm": 0.1441311538219452, "learning_rate": 9.943825276010235e-05, "loss": 1.4013, "mean_token_accuracy": 0.740245969593525, "num_tokens": 377316609.0, "step": 5250 }, { "entropy": 0.9736945912241936, "epoch": 1.4336331425456528, "grad_norm": 0.10831708461046219, "learning_rate": 9.943375290216061e-05, "loss": 1.4042, "mean_token_accuracy": 0.7386852309107781, "num_tokens": 378040595.0, "step": 5260 }, { "entropy": 0.970636373758316, "epoch": 1.4363586808394657, "grad_norm": 0.1145075187087059, "learning_rate": 9.942923519569454e-05, "loss": 1.4026, "mean_token_accuracy": 0.738807100057602, "num_tokens": 378756915.0, "step": 5270 }, { "entropy": 0.9653542131185532, "epoch": 1.4390842191332789, "grad_norm": 0.08687466382980347, "learning_rate": 9.94246996423353e-05, "loss": 1.407, "mean_token_accuracy": 0.7391152828931808, "num_tokens": 379472941.0, "step": 5280 }, { "entropy": 0.9694831103086472, "epoch": 1.4418097574270918, "grad_norm": 0.11827920377254486, "learning_rate": 9.942014624372047e-05, "loss": 1.403, "mean_token_accuracy": 0.7402864143252372, "num_tokens": 380199359.0, "step": 5290 }, { "entropy": 0.970561794936657, "epoch": 1.4445352957209048, "grad_norm": 0.09290741384029388, "learning_rate": 9.941557500149413e-05, "loss": 1.4052, "mean_token_accuracy": 0.7417319104075432, "num_tokens": 380929340.0, "step": 5300 }, { "entropy": 0.9641054213047028, "epoch": 1.447260834014718, "grad_norm": 0.10711231082677841, "learning_rate": 9.941098591730674e-05, "loss": 1.3992, "mean_token_accuracy": 0.7469957336783409, "num_tokens": 381668119.0, "step": 5310 }, { "entropy": 0.9665979817509651, "epoch": 1.449986372308531, "grad_norm": 0.09660854190587997, "learning_rate": 9.940637899281524e-05, "loss": 1.3924, "mean_token_accuracy": 0.7366364017128945, "num_tokens": 382384316.0, "step": 5320 }, { "entropy": 0.9691758647561073, "epoch": 1.452711910602344, "grad_norm": 0.11617083102464676, "learning_rate": 9.940175422968301e-05, "loss": 1.4093, "mean_token_accuracy": 0.7422058954834938, "num_tokens": 383106882.0, "step": 5330 }, { "entropy": 0.9698209255933762, "epoch": 1.455437448896157, "grad_norm": 0.10751962661743164, "learning_rate": 9.939711162957987e-05, "loss": 1.4099, "mean_token_accuracy": 0.7434906512498856, "num_tokens": 383833471.0, "step": 5340 }, { "entropy": 0.9739046230912208, "epoch": 1.45816298718997, "grad_norm": 0.11743414402008057, "learning_rate": 9.939245119418207e-05, "loss": 1.4089, "mean_token_accuracy": 0.7343879967927933, "num_tokens": 384534098.0, "step": 5350 }, { "entropy": 0.9686474457383156, "epoch": 1.4608885254837831, "grad_norm": 0.14783485233783722, "learning_rate": 9.93877729251723e-05, "loss": 1.401, "mean_token_accuracy": 0.7399002060294151, "num_tokens": 385258205.0, "step": 5360 }, { "entropy": 0.9598215714097023, "epoch": 1.463614063777596, "grad_norm": 0.1309163123369217, "learning_rate": 9.938307682423971e-05, "loss": 1.3964, "mean_token_accuracy": 0.7428989082574844, "num_tokens": 385970916.0, "step": 5370 }, { "entropy": 0.9654551208019256, "epoch": 1.4663396020714092, "grad_norm": 0.13030365109443665, "learning_rate": 9.937836289307984e-05, "loss": 1.3981, "mean_token_accuracy": 0.7449974194169044, "num_tokens": 386698694.0, "step": 5380 }, { "entropy": 0.9749439135193825, "epoch": 1.4690651403652222, "grad_norm": 0.12305283546447754, "learning_rate": 9.937363113339473e-05, "loss": 1.41, "mean_token_accuracy": 0.7381033584475517, "num_tokens": 387422483.0, "step": 5390 }, { "entropy": 0.9733576580882073, "epoch": 1.4717906786590351, "grad_norm": 0.09393591433763504, "learning_rate": 9.93688815468928e-05, "loss": 1.4129, "mean_token_accuracy": 0.741550774872303, "num_tokens": 388141107.0, "step": 5400 }, { "entropy": 0.9604296833276749, "epoch": 1.474516216952848, "grad_norm": 0.1078701913356781, "learning_rate": 9.936411413528897e-05, "loss": 1.3978, "mean_token_accuracy": 0.7392246812582016, "num_tokens": 388844094.0, "step": 5410 }, { "entropy": 0.9643611937761307, "epoch": 1.4772417552466612, "grad_norm": 0.15664558112621307, "learning_rate": 9.93593289003045e-05, "loss": 1.4017, "mean_token_accuracy": 0.7436071097850799, "num_tokens": 389562699.0, "step": 5420 }, { "entropy": 0.9653159961104393, "epoch": 1.4799672935404742, "grad_norm": 0.09632451087236404, "learning_rate": 9.935452584366722e-05, "loss": 1.3946, "mean_token_accuracy": 0.7428557753562928, "num_tokens": 390288273.0, "step": 5430 }, { "entropy": 0.9551640048623085, "epoch": 1.4826928318342874, "grad_norm": 0.2352782040834427, "learning_rate": 9.934970496711126e-05, "loss": 1.3917, "mean_token_accuracy": 0.74396021515131, "num_tokens": 391025526.0, "step": 5440 }, { "entropy": 0.9665898457169533, "epoch": 1.4854183701281003, "grad_norm": 0.09772990643978119, "learning_rate": 9.934486627237727e-05, "loss": 1.3924, "mean_token_accuracy": 0.7391120627522468, "num_tokens": 391742015.0, "step": 5450 }, { "entropy": 0.971962533891201, "epoch": 1.4881439084219132, "grad_norm": 0.11168727278709412, "learning_rate": 9.93400097612123e-05, "loss": 1.408, "mean_token_accuracy": 0.73693887591362, "num_tokens": 392451387.0, "step": 5460 }, { "entropy": 0.9676396638154984, "epoch": 1.4908694467157264, "grad_norm": 0.1342191994190216, "learning_rate": 9.933513543536983e-05, "loss": 1.3999, "mean_token_accuracy": 0.7422311305999756, "num_tokens": 393168640.0, "step": 5470 }, { "entropy": 0.9660815089941025, "epoch": 1.4935949850095394, "grad_norm": 0.12180179357528687, "learning_rate": 9.933024329660979e-05, "loss": 1.3996, "mean_token_accuracy": 0.7436567828059196, "num_tokens": 393908125.0, "step": 5480 }, { "entropy": 0.972677831351757, "epoch": 1.4963205233033525, "grad_norm": 0.10382014513015747, "learning_rate": 9.932533334669854e-05, "loss": 1.4067, "mean_token_accuracy": 0.7402523458003998, "num_tokens": 394635518.0, "step": 5490 }, { "entropy": 0.9680842772126198, "epoch": 1.4990460615971655, "grad_norm": 0.10213375091552734, "learning_rate": 9.932040558740885e-05, "loss": 1.4052, "mean_token_accuracy": 0.7380674108862877, "num_tokens": 395347447.0, "step": 5500 }, { "entropy": 0.9674480229616165, "epoch": 1.5017715998909784, "grad_norm": 0.12802939116954803, "learning_rate": 9.931546002051995e-05, "loss": 1.4073, "mean_token_accuracy": 0.7389767229557037, "num_tokens": 396055746.0, "step": 5510 }, { "entropy": 0.9710396826267242, "epoch": 1.5044971381847914, "grad_norm": 0.08243096619844437, "learning_rate": 9.931049664781747e-05, "loss": 1.4058, "mean_token_accuracy": 0.7372735366225243, "num_tokens": 396772954.0, "step": 5520 }, { "entropy": 0.9651833549141884, "epoch": 1.5072226764786045, "grad_norm": 0.09641161561012268, "learning_rate": 9.930551547109349e-05, "loss": 1.3999, "mean_token_accuracy": 0.7431214168667793, "num_tokens": 397504248.0, "step": 5530 }, { "entropy": 0.9655771732330323, "epoch": 1.5099482147724177, "grad_norm": 0.11606141179800034, "learning_rate": 9.930051649214651e-05, "loss": 1.3927, "mean_token_accuracy": 0.7424632519483566, "num_tokens": 398237963.0, "step": 5540 }, { "entropy": 0.9724524304270744, "epoch": 1.5126737530662306, "grad_norm": 0.1653359979391098, "learning_rate": 9.929549971278145e-05, "loss": 1.413, "mean_token_accuracy": 0.7393404498696328, "num_tokens": 398958498.0, "step": 5550 }, { "entropy": 0.9636167198419571, "epoch": 1.5153992913600436, "grad_norm": 0.1128481924533844, "learning_rate": 9.929046513480969e-05, "loss": 1.3985, "mean_token_accuracy": 0.74527777582407, "num_tokens": 399699606.0, "step": 5560 }, { "entropy": 0.9632746115326881, "epoch": 1.5181248296538565, "grad_norm": 0.10375374555587769, "learning_rate": 9.928541276004898e-05, "loss": 1.4044, "mean_token_accuracy": 0.736094568669796, "num_tokens": 400392077.0, "step": 5570 }, { "entropy": 0.9567220598459244, "epoch": 1.5208503679476697, "grad_norm": 0.1052614077925682, "learning_rate": 9.928034259032355e-05, "loss": 1.4038, "mean_token_accuracy": 0.7380430907011032, "num_tokens": 401088565.0, "step": 5580 }, { "entropy": 0.9652064919471741, "epoch": 1.5235759062414826, "grad_norm": 0.10507596284151077, "learning_rate": 9.927525462746403e-05, "loss": 1.4056, "mean_token_accuracy": 0.7403815686702728, "num_tokens": 401796270.0, "step": 5590 }, { "entropy": 0.9617900848388672, "epoch": 1.5263014445352958, "grad_norm": 0.09780077636241913, "learning_rate": 9.927014887330746e-05, "loss": 1.396, "mean_token_accuracy": 0.7425020396709442, "num_tokens": 402518111.0, "step": 5600 }, { "entropy": 0.9614929288625718, "epoch": 1.5290269828291088, "grad_norm": 0.11462049186229706, "learning_rate": 9.926502532969733e-05, "loss": 1.393, "mean_token_accuracy": 0.7415044978260994, "num_tokens": 403237289.0, "step": 5610 }, { "entropy": 0.9667704716324806, "epoch": 1.5317525211229217, "grad_norm": 0.09767358005046844, "learning_rate": 9.925988399848356e-05, "loss": 1.4032, "mean_token_accuracy": 0.7394060298800469, "num_tokens": 403952367.0, "step": 5620 }, { "entropy": 0.9641389414668083, "epoch": 1.5344780594167347, "grad_norm": 0.09655015915632248, "learning_rate": 9.925472488152245e-05, "loss": 1.399, "mean_token_accuracy": 0.7387663036584854, "num_tokens": 404658573.0, "step": 5630 }, { "entropy": 0.961449071764946, "epoch": 1.5372035977105478, "grad_norm": 0.11892081052064896, "learning_rate": 9.924954798067678e-05, "loss": 1.3976, "mean_token_accuracy": 0.7416116803884506, "num_tokens": 405381932.0, "step": 5640 }, { "entropy": 0.9588605925440788, "epoch": 1.539929136004361, "grad_norm": 0.19503852725028992, "learning_rate": 9.92443532978157e-05, "loss": 1.3907, "mean_token_accuracy": 0.7447726503014565, "num_tokens": 406116856.0, "step": 5650 }, { "entropy": 0.9709116160869599, "epoch": 1.542654674298174, "grad_norm": 0.1104922741651535, "learning_rate": 9.923914083481479e-05, "loss": 1.4042, "mean_token_accuracy": 0.7398681297898293, "num_tokens": 406830266.0, "step": 5660 }, { "entropy": 0.9636844545602798, "epoch": 1.5453802125919869, "grad_norm": 0.11828241497278214, "learning_rate": 9.923391059355607e-05, "loss": 1.3935, "mean_token_accuracy": 0.7442167580127717, "num_tokens": 407558738.0, "step": 5670 }, { "entropy": 0.9672845751047134, "epoch": 1.5481057508857998, "grad_norm": 0.10549341887235641, "learning_rate": 9.922866257592798e-05, "loss": 1.4058, "mean_token_accuracy": 0.7364004850387573, "num_tokens": 408259142.0, "step": 5680 }, { "entropy": 0.974950310587883, "epoch": 1.550831289179613, "grad_norm": 0.170731320977211, "learning_rate": 9.922339678382533e-05, "loss": 1.4041, "mean_token_accuracy": 0.7417920991778374, "num_tokens": 408985495.0, "step": 5690 }, { "entropy": 0.9687897503376007, "epoch": 1.5535568274734262, "grad_norm": 0.2253672182559967, "learning_rate": 9.921811321914943e-05, "loss": 1.3978, "mean_token_accuracy": 0.738481967151165, "num_tokens": 409705454.0, "step": 5700 }, { "entropy": 0.9635434374213219, "epoch": 1.556282365767239, "grad_norm": 0.10949309915304184, "learning_rate": 9.921281188380793e-05, "loss": 1.3972, "mean_token_accuracy": 0.7424033030867576, "num_tokens": 410425656.0, "step": 5710 }, { "entropy": 0.9592582941055298, "epoch": 1.559007904061052, "grad_norm": 0.10131136327981949, "learning_rate": 9.920749277971493e-05, "loss": 1.3983, "mean_token_accuracy": 0.7419530689716339, "num_tokens": 411136750.0, "step": 5720 }, { "entropy": 0.964599272608757, "epoch": 1.561733442354865, "grad_norm": 0.10109210014343262, "learning_rate": 9.920215590879097e-05, "loss": 1.3875, "mean_token_accuracy": 0.7396992966532707, "num_tokens": 411854916.0, "step": 5730 }, { "entropy": 0.9645843416452408, "epoch": 1.5644589806486782, "grad_norm": 0.11004949361085892, "learning_rate": 9.919680127296294e-05, "loss": 1.3946, "mean_token_accuracy": 0.7357957765460015, "num_tokens": 412563819.0, "step": 5740 }, { "entropy": 0.9718684017658233, "epoch": 1.5671845189424911, "grad_norm": 0.18444311618804932, "learning_rate": 9.919142887416419e-05, "loss": 1.4041, "mean_token_accuracy": 0.7369261845946312, "num_tokens": 413265824.0, "step": 5750 }, { "entropy": 0.9655459359288215, "epoch": 1.5699100572363043, "grad_norm": 0.10114146769046783, "learning_rate": 9.91860387143345e-05, "loss": 1.405, "mean_token_accuracy": 0.741586534678936, "num_tokens": 413987806.0, "step": 5760 }, { "entropy": 0.9581871777772903, "epoch": 1.5726355955301172, "grad_norm": 0.13442564010620117, "learning_rate": 9.918063079542002e-05, "loss": 1.393, "mean_token_accuracy": 0.7415242746472359, "num_tokens": 414707107.0, "step": 5770 }, { "entropy": 0.9689536958932876, "epoch": 1.5753611338239302, "grad_norm": 0.0971767008304596, "learning_rate": 9.917520511937332e-05, "loss": 1.4018, "mean_token_accuracy": 0.7420008212327958, "num_tokens": 415445511.0, "step": 5780 }, { "entropy": 0.9681785985827446, "epoch": 1.5780866721177431, "grad_norm": 0.11754272133111954, "learning_rate": 9.916976168815343e-05, "loss": 1.4046, "mean_token_accuracy": 0.7410356238484382, "num_tokens": 416168666.0, "step": 5790 }, { "entropy": 0.9686637595295906, "epoch": 1.5808122104115563, "grad_norm": 0.10621481388807297, "learning_rate": 9.916430050372572e-05, "loss": 1.4034, "mean_token_accuracy": 0.7380057781934738, "num_tokens": 416880509.0, "step": 5800 }, { "entropy": 0.9566580340266228, "epoch": 1.5835377487053695, "grad_norm": 0.10499605536460876, "learning_rate": 9.9158821568062e-05, "loss": 1.3917, "mean_token_accuracy": 0.7416859939694405, "num_tokens": 417590181.0, "step": 5810 }, { "entropy": 0.9609494879841805, "epoch": 1.5862632869991824, "grad_norm": 0.09360944479703903, "learning_rate": 9.915332488314051e-05, "loss": 1.3986, "mean_token_accuracy": 0.7389409273862839, "num_tokens": 418301686.0, "step": 5820 }, { "entropy": 0.9661891669034958, "epoch": 1.5889888252929953, "grad_norm": 0.20693224668502808, "learning_rate": 9.914781045094586e-05, "loss": 1.4011, "mean_token_accuracy": 0.7356569826602936, "num_tokens": 419002077.0, "step": 5830 }, { "entropy": 0.963114646077156, "epoch": 1.5917143635868083, "grad_norm": 0.09767451137304306, "learning_rate": 9.91422782734691e-05, "loss": 1.3977, "mean_token_accuracy": 0.7400422096252441, "num_tokens": 419715019.0, "step": 5840 }, { "entropy": 0.9726824536919594, "epoch": 1.5944399018806215, "grad_norm": 0.21406540274620056, "learning_rate": 9.913672835270768e-05, "loss": 1.4095, "mean_token_accuracy": 0.7354395866394043, "num_tokens": 420422138.0, "step": 5850 }, { "entropy": 0.9589616864919662, "epoch": 1.5971654401744344, "grad_norm": 0.20524220168590546, "learning_rate": 9.913116069066544e-05, "loss": 1.3899, "mean_token_accuracy": 0.745594210922718, "num_tokens": 421158979.0, "step": 5860 }, { "entropy": 0.9652955681085587, "epoch": 1.5998909784682476, "grad_norm": 0.10461007803678513, "learning_rate": 9.912557528935265e-05, "loss": 1.4065, "mean_token_accuracy": 0.7428195431828499, "num_tokens": 421876794.0, "step": 5870 }, { "entropy": 0.9643538653850555, "epoch": 1.6026165167620605, "grad_norm": 0.10991375148296356, "learning_rate": 9.911997215078595e-05, "loss": 1.3987, "mean_token_accuracy": 0.7403149724006652, "num_tokens": 422592919.0, "step": 5880 }, { "entropy": 0.9613830238580704, "epoch": 1.6053420550558735, "grad_norm": 0.10263770073652267, "learning_rate": 9.911435127698843e-05, "loss": 1.3917, "mean_token_accuracy": 0.7438402488827706, "num_tokens": 423316339.0, "step": 5890 }, { "entropy": 0.9703504428267479, "epoch": 1.6080675933496864, "grad_norm": 0.10847967118024826, "learning_rate": 9.910871266998955e-05, "loss": 1.4044, "mean_token_accuracy": 0.7379203736782074, "num_tokens": 424030583.0, "step": 5900 }, { "entropy": 0.9544369623064994, "epoch": 1.6107931316434996, "grad_norm": 0.08858538419008255, "learning_rate": 9.910305633182518e-05, "loss": 1.3887, "mean_token_accuracy": 0.7420952394604683, "num_tokens": 424760848.0, "step": 5910 }, { "entropy": 0.9609884187579155, "epoch": 1.6135186699373127, "grad_norm": 0.11026997119188309, "learning_rate": 9.90973822645376e-05, "loss": 1.3998, "mean_token_accuracy": 0.7414646327495575, "num_tokens": 425475990.0, "step": 5920 }, { "entropy": 0.9604142621159554, "epoch": 1.6162442082311257, "grad_norm": 0.10348739475011826, "learning_rate": 9.909169047017548e-05, "loss": 1.3938, "mean_token_accuracy": 0.7371267721056938, "num_tokens": 426181074.0, "step": 5930 }, { "entropy": 0.9558591157197952, "epoch": 1.6189697465249386, "grad_norm": 0.10191468149423599, "learning_rate": 9.90859809507939e-05, "loss": 1.3941, "mean_token_accuracy": 0.7403875023126603, "num_tokens": 426902746.0, "step": 5940 }, { "entropy": 0.9646698012948036, "epoch": 1.6216952848187516, "grad_norm": 0.13848857581615448, "learning_rate": 9.908025370845436e-05, "loss": 1.4027, "mean_token_accuracy": 0.7376966655254364, "num_tokens": 427616308.0, "step": 5950 }, { "entropy": 0.9594425529241561, "epoch": 1.6244208231125647, "grad_norm": 0.1576535850763321, "learning_rate": 9.907450874522467e-05, "loss": 1.3931, "mean_token_accuracy": 0.7456508308649064, "num_tokens": 428339961.0, "step": 5960 }, { "entropy": 0.9645897924900055, "epoch": 1.627146361406378, "grad_norm": 0.1390545815229416, "learning_rate": 9.906874606317917e-05, "loss": 1.3985, "mean_token_accuracy": 0.7383797079324722, "num_tokens": 429060230.0, "step": 5970 }, { "entropy": 0.9663798242807389, "epoch": 1.6298718997001909, "grad_norm": 0.11118265241384506, "learning_rate": 9.906296566439848e-05, "loss": 1.3904, "mean_token_accuracy": 0.7435512930154801, "num_tokens": 429800540.0, "step": 5980 }, { "entropy": 0.9650408774614334, "epoch": 1.6325974379940038, "grad_norm": 0.18296988308429718, "learning_rate": 9.905716755096972e-05, "loss": 1.3985, "mean_token_accuracy": 0.7394289910793305, "num_tokens": 430519468.0, "step": 5990 }, { "entropy": 0.9720285251736641, "epoch": 1.6353229762878168, "grad_norm": 0.10560684651136398, "learning_rate": 9.905135172498629e-05, "loss": 1.4026, "mean_token_accuracy": 0.7365751951932907, "num_tokens": 431231969.0, "step": 6000 }, { "entropy": 0.9789033398032189, "epoch": 1.63804851458163, "grad_norm": 0.12759380042552948, "learning_rate": 9.904551818854813e-05, "loss": 1.4076, "mean_token_accuracy": 0.7391931042075157, "num_tokens": 431959887.0, "step": 6010 }, { "entropy": 0.9748961210250855, "epoch": 1.6407740528754429, "grad_norm": 0.10689742118120193, "learning_rate": 9.90396669437614e-05, "loss": 1.4072, "mean_token_accuracy": 0.7423317298293114, "num_tokens": 432679926.0, "step": 6020 }, { "entropy": 0.9654077455401421, "epoch": 1.643499591169256, "grad_norm": 0.13345809280872345, "learning_rate": 9.903379799273884e-05, "loss": 1.3972, "mean_token_accuracy": 0.7388819694519043, "num_tokens": 433407084.0, "step": 6030 }, { "entropy": 0.9621516212821006, "epoch": 1.646225129463069, "grad_norm": 0.10782342404127121, "learning_rate": 9.902791133759943e-05, "loss": 1.3989, "mean_token_accuracy": 0.741086582839489, "num_tokens": 434120698.0, "step": 6040 }, { "entropy": 0.9617944195866585, "epoch": 1.648950667756882, "grad_norm": 0.1336713284254074, "learning_rate": 9.902200698046861e-05, "loss": 1.3966, "mean_token_accuracy": 0.7426715821027756, "num_tokens": 434839891.0, "step": 6050 }, { "entropy": 0.9621335521340371, "epoch": 1.6516762060506949, "grad_norm": 0.10524009168148041, "learning_rate": 9.901608492347823e-05, "loss": 1.3959, "mean_token_accuracy": 0.740611945092678, "num_tokens": 435563923.0, "step": 6060 }, { "entropy": 0.9668157532811165, "epoch": 1.654401744344508, "grad_norm": 0.11039511114358902, "learning_rate": 9.901014516876647e-05, "loss": 1.4006, "mean_token_accuracy": 0.73515605032444, "num_tokens": 436259278.0, "step": 6070 }, { "entropy": 0.9718721225857735, "epoch": 1.6571272826383212, "grad_norm": 0.09918174147605896, "learning_rate": 9.900418771847794e-05, "loss": 1.4074, "mean_token_accuracy": 0.737083688378334, "num_tokens": 436969331.0, "step": 6080 }, { "entropy": 0.9646610051393509, "epoch": 1.6598528209321342, "grad_norm": 0.21766789257526398, "learning_rate": 9.899821257476368e-05, "loss": 1.4036, "mean_token_accuracy": 0.7371485099196434, "num_tokens": 437680886.0, "step": 6090 }, { "entropy": 0.9628597944974899, "epoch": 1.662578359225947, "grad_norm": 0.11657141149044037, "learning_rate": 9.899221973978101e-05, "loss": 1.3985, "mean_token_accuracy": 0.7447718888521194, "num_tokens": 438408284.0, "step": 6100 }, { "entropy": 0.9702211692929268, "epoch": 1.66530389751976, "grad_norm": 0.10765881091356277, "learning_rate": 9.898620921569375e-05, "loss": 1.4011, "mean_token_accuracy": 0.7367077067494392, "num_tokens": 439119517.0, "step": 6110 }, { "entropy": 0.9642821982502937, "epoch": 1.6680294358135732, "grad_norm": 0.115221306681633, "learning_rate": 9.898018100467202e-05, "loss": 1.391, "mean_token_accuracy": 0.7378931477665901, "num_tokens": 439838100.0, "step": 6120 }, { "entropy": 0.9640056222677231, "epoch": 1.6707549741073862, "grad_norm": 0.10090425610542297, "learning_rate": 9.897413510889237e-05, "loss": 1.395, "mean_token_accuracy": 0.7464444503188133, "num_tokens": 440584180.0, "step": 6130 }, { "entropy": 0.9658372700214386, "epoch": 1.6734805124011993, "grad_norm": 0.14596357941627502, "learning_rate": 9.896807153053775e-05, "loss": 1.4041, "mean_token_accuracy": 0.7407622843980789, "num_tokens": 441299995.0, "step": 6140 }, { "entropy": 0.9652875065803528, "epoch": 1.6762060506950123, "grad_norm": 0.09758126735687256, "learning_rate": 9.896199027179744e-05, "loss": 1.4041, "mean_token_accuracy": 0.7378090232610702, "num_tokens": 442012383.0, "step": 6150 }, { "entropy": 0.9647507712244987, "epoch": 1.6789315889888252, "grad_norm": 0.09823904931545258, "learning_rate": 9.895589133486718e-05, "loss": 1.3992, "mean_token_accuracy": 0.7413588866591454, "num_tokens": 442725868.0, "step": 6160 }, { "entropy": 0.9591943696141243, "epoch": 1.6816571272826382, "grad_norm": 0.08996161073446274, "learning_rate": 9.894977472194899e-05, "loss": 1.3935, "mean_token_accuracy": 0.7463259294629097, "num_tokens": 443459707.0, "step": 6170 }, { "entropy": 0.9753120169043541, "epoch": 1.6843826655764513, "grad_norm": 0.0981547012925148, "learning_rate": 9.89436404352514e-05, "loss": 1.4098, "mean_token_accuracy": 0.7384630024433136, "num_tokens": 444177670.0, "step": 6180 }, { "entropy": 0.9743504494428634, "epoch": 1.6871082038702645, "grad_norm": 0.09443812817335129, "learning_rate": 9.893748847698918e-05, "loss": 1.4043, "mean_token_accuracy": 0.7386202126741409, "num_tokens": 444885869.0, "step": 6190 }, { "entropy": 0.9678167894482612, "epoch": 1.6898337421640774, "grad_norm": 0.09067999571561813, "learning_rate": 9.89313188493836e-05, "loss": 1.3993, "mean_token_accuracy": 0.7457887947559356, "num_tokens": 445608265.0, "step": 6200 }, { "entropy": 0.9639017432928085, "epoch": 1.6925592804578904, "grad_norm": 0.09365516901016235, "learning_rate": 9.892513155466226e-05, "loss": 1.3901, "mean_token_accuracy": 0.7453442245721817, "num_tokens": 446340573.0, "step": 6210 }, { "entropy": 0.9653544202446938, "epoch": 1.6952848187517033, "grad_norm": 0.11369942128658295, "learning_rate": 9.891892659505912e-05, "loss": 1.398, "mean_token_accuracy": 0.7398279547691345, "num_tokens": 447053800.0, "step": 6220 }, { "entropy": 0.9619206324219703, "epoch": 1.6980103570455165, "grad_norm": 0.12091006338596344, "learning_rate": 9.891270397281456e-05, "loss": 1.3958, "mean_token_accuracy": 0.7467226952314376, "num_tokens": 447789811.0, "step": 6230 }, { "entropy": 0.9610428914427758, "epoch": 1.7007358953393297, "grad_norm": 0.09831788390874863, "learning_rate": 9.89064636901753e-05, "loss": 1.395, "mean_token_accuracy": 0.7400000631809235, "num_tokens": 448499789.0, "step": 6240 }, { "entropy": 0.9735107973217965, "epoch": 1.7034614336331426, "grad_norm": 0.14642998576164246, "learning_rate": 9.890020574939447e-05, "loss": 1.4133, "mean_token_accuracy": 0.7345815241336823, "num_tokens": 449200840.0, "step": 6250 }, { "entropy": 0.9719688981771469, "epoch": 1.7061869719269556, "grad_norm": 0.09600794315338135, "learning_rate": 9.889393015273153e-05, "loss": 1.4037, "mean_token_accuracy": 0.741492660343647, "num_tokens": 449918387.0, "step": 6260 }, { "entropy": 0.9581882610917092, "epoch": 1.7089125102207685, "grad_norm": 0.168635755777359, "learning_rate": 9.88876369024524e-05, "loss": 1.3885, "mean_token_accuracy": 0.7411158233880997, "num_tokens": 450633441.0, "step": 6270 }, { "entropy": 0.9636551678180695, "epoch": 1.7116380485145817, "grad_norm": 0.11920435726642609, "learning_rate": 9.888132600082925e-05, "loss": 1.3973, "mean_token_accuracy": 0.7420587435364723, "num_tokens": 451351442.0, "step": 6280 }, { "entropy": 0.9653368249535561, "epoch": 1.7143635868083946, "grad_norm": 0.09253939986228943, "learning_rate": 9.887499745014074e-05, "loss": 1.4022, "mean_token_accuracy": 0.7385347485542297, "num_tokens": 452063526.0, "step": 6290 }, { "entropy": 0.9632287070155143, "epoch": 1.7170891251022078, "grad_norm": 0.09013763070106506, "learning_rate": 9.886865125267182e-05, "loss": 1.4012, "mean_token_accuracy": 0.7379551649093627, "num_tokens": 452776328.0, "step": 6300 }, { "entropy": 0.9703898221254349, "epoch": 1.7198146633960207, "grad_norm": 0.09758932888507843, "learning_rate": 9.886228741071386e-05, "loss": 1.404, "mean_token_accuracy": 0.7333473935723305, "num_tokens": 453477490.0, "step": 6310 }, { "entropy": 0.9641054153442383, "epoch": 1.7225402016898337, "grad_norm": 0.0950767919421196, "learning_rate": 9.88559059265646e-05, "loss": 1.395, "mean_token_accuracy": 0.7399653360247612, "num_tokens": 454186713.0, "step": 6320 }, { "entropy": 0.9593479320406914, "epoch": 1.7252657399836466, "grad_norm": 0.10654161125421524, "learning_rate": 9.884950680252811e-05, "loss": 1.3914, "mean_token_accuracy": 0.7454151093959809, "num_tokens": 454921296.0, "step": 6330 }, { "entropy": 0.9649859368801117, "epoch": 1.7279912782774598, "grad_norm": 0.09915610402822495, "learning_rate": 9.884309004091486e-05, "loss": 1.393, "mean_token_accuracy": 0.742953984439373, "num_tokens": 455646589.0, "step": 6340 }, { "entropy": 0.955434288084507, "epoch": 1.730716816571273, "grad_norm": 0.10013002157211304, "learning_rate": 9.88366556440417e-05, "loss": 1.3938, "mean_token_accuracy": 0.7451090395450592, "num_tokens": 456373347.0, "step": 6350 }, { "entropy": 0.9591516688466072, "epoch": 1.733442354865086, "grad_norm": 0.13232626020908356, "learning_rate": 9.883020361423181e-05, "loss": 1.3895, "mean_token_accuracy": 0.7457116171717644, "num_tokens": 457106997.0, "step": 6360 }, { "entropy": 0.9609716460108757, "epoch": 1.7361678931588989, "grad_norm": 0.1084350049495697, "learning_rate": 9.882373395381474e-05, "loss": 1.3985, "mean_token_accuracy": 0.7440847963094711, "num_tokens": 457828350.0, "step": 6370 }, { "entropy": 0.9553082630038261, "epoch": 1.7388934314527118, "grad_norm": 0.19414696097373962, "learning_rate": 9.881724666512649e-05, "loss": 1.3913, "mean_token_accuracy": 0.7422837510704994, "num_tokens": 458539762.0, "step": 6380 }, { "entropy": 0.9681574374437332, "epoch": 1.741618969746525, "grad_norm": 0.1206468790769577, "learning_rate": 9.881074175050928e-05, "loss": 1.4007, "mean_token_accuracy": 0.7423367232084275, "num_tokens": 459265674.0, "step": 6390 }, { "entropy": 0.9651200860738754, "epoch": 1.744344508040338, "grad_norm": 0.100550577044487, "learning_rate": 9.880421921231181e-05, "loss": 1.3992, "mean_token_accuracy": 0.7399113595485687, "num_tokens": 459981436.0, "step": 6400 }, { "entropy": 0.9738900408148765, "epoch": 1.747070046334151, "grad_norm": 0.11466038227081299, "learning_rate": 9.87976790528891e-05, "loss": 1.4032, "mean_token_accuracy": 0.7395287618041039, "num_tokens": 460703872.0, "step": 6410 }, { "entropy": 0.9619228363037109, "epoch": 1.749795584627964, "grad_norm": 0.253574401140213, "learning_rate": 9.879112127460253e-05, "loss": 1.3961, "mean_token_accuracy": 0.7430710151791573, "num_tokens": 461431665.0, "step": 6420 }, { "entropy": 0.9635621175169945, "epoch": 1.752521122921777, "grad_norm": 0.1853688359260559, "learning_rate": 9.878454587981986e-05, "loss": 1.3921, "mean_token_accuracy": 0.7350759491324425, "num_tokens": 462132961.0, "step": 6430 }, { "entropy": 0.9640910357236863, "epoch": 1.75524666121559, "grad_norm": 0.21477222442626953, "learning_rate": 9.877795287091518e-05, "loss": 1.4078, "mean_token_accuracy": 0.7383334547281265, "num_tokens": 462844968.0, "step": 6440 }, { "entropy": 0.9733558312058449, "epoch": 1.757972199509403, "grad_norm": 0.11411593854427338, "learning_rate": 9.877134225026899e-05, "loss": 1.4044, "mean_token_accuracy": 0.7368480548262596, "num_tokens": 463557302.0, "step": 6450 }, { "entropy": 0.9664992153644562, "epoch": 1.7606977378032163, "grad_norm": 0.11985015124082565, "learning_rate": 9.876471402026806e-05, "loss": 1.4048, "mean_token_accuracy": 0.7415119394659996, "num_tokens": 464277878.0, "step": 6460 }, { "entropy": 0.9565216213464737, "epoch": 1.7634232760970292, "grad_norm": 0.132217139005661, "learning_rate": 9.875806818330565e-05, "loss": 1.3892, "mean_token_accuracy": 0.7427519276738167, "num_tokens": 464996856.0, "step": 6470 }, { "entropy": 0.9655373767018318, "epoch": 1.7661488143908421, "grad_norm": 0.18020625412464142, "learning_rate": 9.875140474178123e-05, "loss": 1.3953, "mean_token_accuracy": 0.7430418714880943, "num_tokens": 465723298.0, "step": 6480 }, { "entropy": 0.9673853784799575, "epoch": 1.768874352684655, "grad_norm": 0.10827246308326721, "learning_rate": 9.874472369810074e-05, "loss": 1.403, "mean_token_accuracy": 0.7388443365693093, "num_tokens": 466436406.0, "step": 6490 }, { "entropy": 0.9671308323740959, "epoch": 1.7715998909784683, "grad_norm": 0.11639074981212616, "learning_rate": 9.873802505467645e-05, "loss": 1.4035, "mean_token_accuracy": 0.7438584089279174, "num_tokens": 467165032.0, "step": 6500 }, { "entropy": 0.9688264280557632, "epoch": 1.7743254292722814, "grad_norm": 0.11113184690475464, "learning_rate": 9.873130881392692e-05, "loss": 1.4027, "mean_token_accuracy": 0.7402560353279114, "num_tokens": 467894491.0, "step": 6510 }, { "entropy": 0.9632213458418846, "epoch": 1.7770509675660944, "grad_norm": 0.10491864383220673, "learning_rate": 9.872457497827713e-05, "loss": 1.399, "mean_token_accuracy": 0.7420696586370468, "num_tokens": 468611446.0, "step": 6520 }, { "entropy": 0.9695285797119141, "epoch": 1.7797765058599073, "grad_norm": 0.10571157187223434, "learning_rate": 9.871782355015842e-05, "loss": 1.4076, "mean_token_accuracy": 0.739043866097927, "num_tokens": 469326557.0, "step": 6530 }, { "entropy": 0.9691705301403999, "epoch": 1.7825020441537203, "grad_norm": 0.27469053864479065, "learning_rate": 9.871105453200842e-05, "loss": 1.4023, "mean_token_accuracy": 0.74033163189888, "num_tokens": 470044902.0, "step": 6540 }, { "entropy": 0.9612185657024384, "epoch": 1.7852275824475334, "grad_norm": 0.19587138295173645, "learning_rate": 9.870426792627118e-05, "loss": 1.3876, "mean_token_accuracy": 0.7447293937206269, "num_tokens": 470778600.0, "step": 6550 }, { "entropy": 0.9602941289544106, "epoch": 1.7879531207413464, "grad_norm": 0.18141105771064758, "learning_rate": 9.869746373539707e-05, "loss": 1.3949, "mean_token_accuracy": 0.7409106940031052, "num_tokens": 471495060.0, "step": 6560 }, { "entropy": 0.9630383446812629, "epoch": 1.7906786590351595, "grad_norm": 0.12980099022388458, "learning_rate": 9.869064196184277e-05, "loss": 1.3965, "mean_token_accuracy": 0.7366779312491417, "num_tokens": 472214771.0, "step": 6570 }, { "entropy": 0.9666449546813964, "epoch": 1.7934041973289725, "grad_norm": 0.14541658759117126, "learning_rate": 9.868380260807137e-05, "loss": 1.4007, "mean_token_accuracy": 0.7406311452388763, "num_tokens": 472925946.0, "step": 6580 }, { "entropy": 0.9566129818558693, "epoch": 1.7961297356227854, "grad_norm": 0.11099447309970856, "learning_rate": 9.86769456765523e-05, "loss": 1.3948, "mean_token_accuracy": 0.7459923014044761, "num_tokens": 473657532.0, "step": 6590 }, { "entropy": 0.97569060921669, "epoch": 1.7988552739165984, "grad_norm": 0.10148832947015762, "learning_rate": 9.867007116976128e-05, "loss": 1.411, "mean_token_accuracy": 0.7368429720401763, "num_tokens": 474371122.0, "step": 6600 }, { "entropy": 0.9582658961415291, "epoch": 1.8015808122104116, "grad_norm": 0.1217406615614891, "learning_rate": 9.866317909018046e-05, "loss": 1.3888, "mean_token_accuracy": 0.7450990483164788, "num_tokens": 475096902.0, "step": 6610 }, { "entropy": 0.967861394584179, "epoch": 1.8043063505042247, "grad_norm": 0.10424516350030899, "learning_rate": 9.865626944029825e-05, "loss": 1.3986, "mean_token_accuracy": 0.740696033835411, "num_tokens": 475810807.0, "step": 6620 }, { "entropy": 0.9663902729749679, "epoch": 1.8070318887980377, "grad_norm": 0.0985787957906723, "learning_rate": 9.864934222260946e-05, "loss": 1.4122, "mean_token_accuracy": 0.7326736062765121, "num_tokens": 476500759.0, "step": 6630 }, { "entropy": 0.9576504468917847, "epoch": 1.8097574270918506, "grad_norm": 0.10975080728530884, "learning_rate": 9.864239743961526e-05, "loss": 1.3921, "mean_token_accuracy": 0.7430121034383774, "num_tokens": 477217083.0, "step": 6640 }, { "entropy": 0.9580236986279488, "epoch": 1.8124829653856636, "grad_norm": 0.12971186637878418, "learning_rate": 9.863543509382306e-05, "loss": 1.388, "mean_token_accuracy": 0.7417103409767151, "num_tokens": 477929836.0, "step": 6650 }, { "entropy": 0.9550999134778977, "epoch": 1.8152085036794767, "grad_norm": 0.11257505416870117, "learning_rate": 9.862845518774675e-05, "loss": 1.3906, "mean_token_accuracy": 0.7463659942150116, "num_tokens": 478663354.0, "step": 6660 }, { "entropy": 0.9664853855967521, "epoch": 1.8179340419732897, "grad_norm": 0.15594874322414398, "learning_rate": 9.862145772390646e-05, "loss": 1.4018, "mean_token_accuracy": 0.7420924484729767, "num_tokens": 479385914.0, "step": 6670 }, { "entropy": 0.9597770988941192, "epoch": 1.8206595802671028, "grad_norm": 0.0977451428771019, "learning_rate": 9.861444270482868e-05, "loss": 1.3907, "mean_token_accuracy": 0.7440643236041069, "num_tokens": 480110862.0, "step": 6680 }, { "entropy": 0.9581946909427643, "epoch": 1.8233851185609158, "grad_norm": 0.19408464431762695, "learning_rate": 9.860741013304626e-05, "loss": 1.4026, "mean_token_accuracy": 0.7428516134619713, "num_tokens": 480828950.0, "step": 6690 }, { "entropy": 0.9585664570331573, "epoch": 1.8261106568547287, "grad_norm": 0.10100160539150238, "learning_rate": 9.860036001109839e-05, "loss": 1.3887, "mean_token_accuracy": 0.7387926205992699, "num_tokens": 481542639.0, "step": 6700 }, { "entropy": 0.9834058821201325, "epoch": 1.8288361951485417, "grad_norm": 0.09401005506515503, "learning_rate": 9.859329234153056e-05, "loss": 1.4225, "mean_token_accuracy": 0.7341606616973877, "num_tokens": 482246841.0, "step": 6710 }, { "entropy": 0.9572040036320686, "epoch": 1.8315617334423548, "grad_norm": 0.17733122408390045, "learning_rate": 9.858620712689464e-05, "loss": 1.386, "mean_token_accuracy": 0.7434762373566628, "num_tokens": 482975640.0, "step": 6720 }, { "entropy": 0.9656352862715721, "epoch": 1.834287271736168, "grad_norm": 0.1350366473197937, "learning_rate": 9.85791043697488e-05, "loss": 1.4004, "mean_token_accuracy": 0.7439049080014228, "num_tokens": 483706489.0, "step": 6730 }, { "entropy": 0.9673403173685073, "epoch": 1.837012810029981, "grad_norm": 0.10896478593349457, "learning_rate": 9.857198407265757e-05, "loss": 1.3988, "mean_token_accuracy": 0.7389033928513526, "num_tokens": 484413613.0, "step": 6740 }, { "entropy": 0.9576301813125611, "epoch": 1.839738348323794, "grad_norm": 0.09817972779273987, "learning_rate": 9.856484623819177e-05, "loss": 1.3967, "mean_token_accuracy": 0.7377318128943443, "num_tokens": 485121971.0, "step": 6750 }, { "entropy": 0.9576287031173706, "epoch": 1.8424638866176068, "grad_norm": 0.08615750819444656, "learning_rate": 9.855769086892863e-05, "loss": 1.3934, "mean_token_accuracy": 0.7438340544700622, "num_tokens": 485844189.0, "step": 6760 }, { "entropy": 0.965782268345356, "epoch": 1.84518942491142, "grad_norm": 0.0871151015162468, "learning_rate": 9.855051796745163e-05, "loss": 1.4058, "mean_token_accuracy": 0.7387169077992439, "num_tokens": 486551935.0, "step": 6770 }, { "entropy": 0.9585666686296463, "epoch": 1.8479149632052332, "grad_norm": 0.09674597531557083, "learning_rate": 9.854332753635063e-05, "loss": 1.3932, "mean_token_accuracy": 0.7405648306012154, "num_tokens": 487268612.0, "step": 6780 }, { "entropy": 0.965125958621502, "epoch": 1.8506405014990461, "grad_norm": 0.12495724111795425, "learning_rate": 9.853611957822177e-05, "loss": 1.3854, "mean_token_accuracy": 0.7433117389678955, "num_tokens": 487996867.0, "step": 6790 }, { "entropy": 0.9590855464339256, "epoch": 1.853366039792859, "grad_norm": 0.11312315613031387, "learning_rate": 9.852889409566761e-05, "loss": 1.3957, "mean_token_accuracy": 0.746566678583622, "num_tokens": 488725261.0, "step": 6800 }, { "entropy": 0.9670864477753639, "epoch": 1.856091578086672, "grad_norm": 0.2885074019432068, "learning_rate": 9.852165109129693e-05, "loss": 1.4026, "mean_token_accuracy": 0.742882926762104, "num_tokens": 489451203.0, "step": 6810 }, { "entropy": 0.9638143733143807, "epoch": 1.8588171163804852, "grad_norm": 0.1008826196193695, "learning_rate": 9.85143905677249e-05, "loss": 1.3971, "mean_token_accuracy": 0.742574380338192, "num_tokens": 490162571.0, "step": 6820 }, { "entropy": 0.9604418158531189, "epoch": 1.8615426546742981, "grad_norm": 0.11003129184246063, "learning_rate": 9.8507112527573e-05, "loss": 1.4072, "mean_token_accuracy": 0.7377557650208473, "num_tokens": 490867938.0, "step": 6830 }, { "entropy": 0.9772702425718307, "epoch": 1.8642681929681113, "grad_norm": 0.11208124458789825, "learning_rate": 9.849981697346905e-05, "loss": 1.4098, "mean_token_accuracy": 0.7375947162508965, "num_tokens": 491576129.0, "step": 6840 }, { "entropy": 0.9600740447640419, "epoch": 1.8669937312619242, "grad_norm": 0.09464003145694733, "learning_rate": 9.849250390804716e-05, "loss": 1.3939, "mean_token_accuracy": 0.7422061085700988, "num_tokens": 492307063.0, "step": 6850 }, { "entropy": 0.968334223330021, "epoch": 1.8697192695557372, "grad_norm": 0.0899537205696106, "learning_rate": 9.848517333394778e-05, "loss": 1.3974, "mean_token_accuracy": 0.7402063041925431, "num_tokens": 493034976.0, "step": 6860 }, { "entropy": 0.9650499865412712, "epoch": 1.8724448078495501, "grad_norm": 0.12556807696819305, "learning_rate": 9.847782525381771e-05, "loss": 1.3854, "mean_token_accuracy": 0.7403883025050163, "num_tokens": 493751088.0, "step": 6870 }, { "entropy": 0.9697022259235382, "epoch": 1.8751703461433633, "grad_norm": 0.0861344039440155, "learning_rate": 9.847045967031e-05, "loss": 1.4043, "mean_token_accuracy": 0.7371412217617035, "num_tokens": 494470261.0, "step": 6880 }, { "entropy": 0.9598774820566177, "epoch": 1.8778958844371765, "grad_norm": 0.2520541548728943, "learning_rate": 9.846307658608411e-05, "loss": 1.3922, "mean_token_accuracy": 0.7408092856407166, "num_tokens": 495185157.0, "step": 6890 }, { "entropy": 0.9653854072093964, "epoch": 1.8806214227309894, "grad_norm": 0.09129787236452103, "learning_rate": 9.845567600380577e-05, "loss": 1.4025, "mean_token_accuracy": 0.7407778039574623, "num_tokens": 495901658.0, "step": 6900 }, { "entropy": 0.9657075956463814, "epoch": 1.8833469610248024, "grad_norm": 0.11199197173118591, "learning_rate": 9.844825792614698e-05, "loss": 1.3948, "mean_token_accuracy": 0.7429806426167488, "num_tokens": 496613845.0, "step": 6910 }, { "entropy": 0.9662411883473396, "epoch": 1.8860724993186153, "grad_norm": 0.10727035999298096, "learning_rate": 9.844082235578613e-05, "loss": 1.4028, "mean_token_accuracy": 0.7396739244461059, "num_tokens": 497323165.0, "step": 6920 }, { "entropy": 0.9622104436159133, "epoch": 1.8887980376124285, "grad_norm": 0.09176908433437347, "learning_rate": 9.843336929540794e-05, "loss": 1.3901, "mean_token_accuracy": 0.7427182823419571, "num_tokens": 498051189.0, "step": 6930 }, { "entropy": 0.9555501505732537, "epoch": 1.8915235759062414, "grad_norm": 0.0917062908411026, "learning_rate": 9.842589874770336e-05, "loss": 1.3965, "mean_token_accuracy": 0.7373476296663284, "num_tokens": 498746121.0, "step": 6940 }, { "entropy": 0.9639024570584297, "epoch": 1.8942491142000546, "grad_norm": 0.11429794877767563, "learning_rate": 9.841841071536973e-05, "loss": 1.3835, "mean_token_accuracy": 0.7447345286607743, "num_tokens": 499477793.0, "step": 6950 }, { "entropy": 0.9644086465239525, "epoch": 1.8969746524938675, "grad_norm": 0.11062592267990112, "learning_rate": 9.841090520111067e-05, "loss": 1.3984, "mean_token_accuracy": 0.7412375822663307, "num_tokens": 500197918.0, "step": 6960 }, { "entropy": 0.963076826930046, "epoch": 1.8997001907876805, "grad_norm": 0.10753937810659409, "learning_rate": 9.84033822076361e-05, "loss": 1.3964, "mean_token_accuracy": 0.7429899856448173, "num_tokens": 500926447.0, "step": 6970 }, { "entropy": 0.9709880262613296, "epoch": 1.9024257290814934, "grad_norm": 0.10585269331932068, "learning_rate": 9.83958417376623e-05, "loss": 1.4053, "mean_token_accuracy": 0.7401735603809356, "num_tokens": 501640460.0, "step": 6980 }, { "entropy": 0.9630426838994026, "epoch": 1.9051512673753066, "grad_norm": 0.10134958475828171, "learning_rate": 9.838828379391181e-05, "loss": 1.3888, "mean_token_accuracy": 0.7396430373191833, "num_tokens": 502365090.0, "step": 6990 }, { "entropy": 0.9591939330101014, "epoch": 1.9078768056691198, "grad_norm": 0.09174404293298721, "learning_rate": 9.838070837911348e-05, "loss": 1.3952, "mean_token_accuracy": 0.7454899072647094, "num_tokens": 503084759.0, "step": 7000 }, { "entropy": 0.9618557408452034, "epoch": 1.9106023439629327, "grad_norm": 0.09564127027988434, "learning_rate": 9.837311549600249e-05, "loss": 1.4034, "mean_token_accuracy": 0.7399124518036843, "num_tokens": 503798396.0, "step": 7010 }, { "entropy": 0.96431335657835, "epoch": 1.9133278822567457, "grad_norm": 0.10930278897285461, "learning_rate": 9.836550514732037e-05, "loss": 1.4017, "mean_token_accuracy": 0.7392303958535195, "num_tokens": 504497386.0, "step": 7020 }, { "entropy": 0.9633992880582809, "epoch": 1.9160534205505586, "grad_norm": 0.1634802371263504, "learning_rate": 9.835787733581486e-05, "loss": 1.3977, "mean_token_accuracy": 0.7398845091462135, "num_tokens": 505215846.0, "step": 7030 }, { "entropy": 0.9664142698049545, "epoch": 1.9187789588443718, "grad_norm": 0.09212366491556168, "learning_rate": 9.835023206424005e-05, "loss": 1.3979, "mean_token_accuracy": 0.7405804008245468, "num_tokens": 505943557.0, "step": 7040 }, { "entropy": 0.9642082065343857, "epoch": 1.921504497138185, "grad_norm": 0.09991949796676636, "learning_rate": 9.834256933535637e-05, "loss": 1.4027, "mean_token_accuracy": 0.7385505959391594, "num_tokens": 506652597.0, "step": 7050 }, { "entropy": 0.9579337358474731, "epoch": 1.9242300354319979, "grad_norm": 0.08951427787542343, "learning_rate": 9.833488915193049e-05, "loss": 1.3837, "mean_token_accuracy": 0.745193175971508, "num_tokens": 507385479.0, "step": 7060 }, { "entropy": 0.9568658128380776, "epoch": 1.9269555737258108, "grad_norm": 0.18916438519954681, "learning_rate": 9.832719151673545e-05, "loss": 1.3848, "mean_token_accuracy": 0.7461760938167572, "num_tokens": 508128269.0, "step": 7070 }, { "entropy": 0.95683603733778, "epoch": 1.9296811120196238, "grad_norm": 0.12292623519897461, "learning_rate": 9.831947643255053e-05, "loss": 1.3861, "mean_token_accuracy": 0.7436719551682472, "num_tokens": 508847491.0, "step": 7080 }, { "entropy": 0.9681815043091774, "epoch": 1.932406650313437, "grad_norm": 0.12597902119159698, "learning_rate": 9.831174390216131e-05, "loss": 1.3973, "mean_token_accuracy": 0.7405972227454185, "num_tokens": 509565726.0, "step": 7090 }, { "entropy": 0.9576827391982079, "epoch": 1.93513218860725, "grad_norm": 0.13779397308826447, "learning_rate": 9.830399392835974e-05, "loss": 1.3894, "mean_token_accuracy": 0.744329534471035, "num_tokens": 510287077.0, "step": 7100 }, { "entropy": 0.9657632574439049, "epoch": 1.937857726901063, "grad_norm": 0.1731322556734085, "learning_rate": 9.829622651394399e-05, "loss": 1.4007, "mean_token_accuracy": 0.739681999385357, "num_tokens": 511002391.0, "step": 7110 }, { "entropy": 0.9532843604683876, "epoch": 1.940583265194876, "grad_norm": 0.11684025079011917, "learning_rate": 9.828844166171858e-05, "loss": 1.3901, "mean_token_accuracy": 0.745066399872303, "num_tokens": 511722117.0, "step": 7120 }, { "entropy": 0.9625393569469451, "epoch": 1.943308803488689, "grad_norm": 0.09408530592918396, "learning_rate": 9.828063937449428e-05, "loss": 1.3974, "mean_token_accuracy": 0.7381411388516426, "num_tokens": 512430728.0, "step": 7130 }, { "entropy": 0.9637985542416573, "epoch": 1.946034341782502, "grad_norm": 0.09656120091676712, "learning_rate": 9.827281965508821e-05, "loss": 1.3921, "mean_token_accuracy": 0.7378409832715989, "num_tokens": 513136482.0, "step": 7140 }, { "entropy": 0.9575431600213051, "epoch": 1.948759880076315, "grad_norm": 0.122360460460186, "learning_rate": 9.826498250632373e-05, "loss": 1.3869, "mean_token_accuracy": 0.7458069577813149, "num_tokens": 513856276.0, "step": 7150 }, { "entropy": 0.9583240255713463, "epoch": 1.9514854183701282, "grad_norm": 0.12442438304424286, "learning_rate": 9.82571279310305e-05, "loss": 1.3951, "mean_token_accuracy": 0.7432518944144249, "num_tokens": 514579908.0, "step": 7160 }, { "entropy": 0.9575931891798973, "epoch": 1.9542109566639412, "grad_norm": 0.11884919553995132, "learning_rate": 9.824925593204455e-05, "loss": 1.3841, "mean_token_accuracy": 0.7429573744535446, "num_tokens": 515296332.0, "step": 7170 }, { "entropy": 0.9661365717649459, "epoch": 1.9569364949577541, "grad_norm": 0.11476761847734451, "learning_rate": 9.824136651220807e-05, "loss": 1.3997, "mean_token_accuracy": 0.7430660113692283, "num_tokens": 516010205.0, "step": 7180 }, { "entropy": 0.956727659702301, "epoch": 1.959662033251567, "grad_norm": 0.10957435518503189, "learning_rate": 9.823345967436967e-05, "loss": 1.3944, "mean_token_accuracy": 0.7411398693919182, "num_tokens": 516731302.0, "step": 7190 }, { "entropy": 0.9655549123883247, "epoch": 1.9623875715453802, "grad_norm": 0.09681804478168488, "learning_rate": 9.822553542138415e-05, "loss": 1.3992, "mean_token_accuracy": 0.7471737802028656, "num_tokens": 517470113.0, "step": 7200 }, { "entropy": 0.9667171403765679, "epoch": 1.9651131098391934, "grad_norm": 0.0997747853398323, "learning_rate": 9.821759375611263e-05, "loss": 1.403, "mean_token_accuracy": 0.737883883714676, "num_tokens": 518174523.0, "step": 7210 }, { "entropy": 0.9553831577301025, "epoch": 1.9678386481330064, "grad_norm": 0.11053860187530518, "learning_rate": 9.820963468142257e-05, "loss": 1.3945, "mean_token_accuracy": 0.7452098578214645, "num_tokens": 518902470.0, "step": 7220 }, { "entropy": 0.9650885179638863, "epoch": 1.9705641864268193, "grad_norm": 0.2715238630771637, "learning_rate": 9.820165820018762e-05, "loss": 1.3949, "mean_token_accuracy": 0.7417281478643417, "num_tokens": 519633955.0, "step": 7230 }, { "entropy": 0.9656887158751488, "epoch": 1.9732897247206322, "grad_norm": 0.1260688304901123, "learning_rate": 9.819366431528778e-05, "loss": 1.3988, "mean_token_accuracy": 0.7414224296808243, "num_tokens": 520353696.0, "step": 7240 }, { "entropy": 0.9694205418229103, "epoch": 1.9760152630144452, "grad_norm": 0.10043631494045258, "learning_rate": 9.818565302960933e-05, "loss": 1.4004, "mean_token_accuracy": 0.738286642730236, "num_tokens": 521068351.0, "step": 7250 }, { "entropy": 0.9686072587966919, "epoch": 1.9787408013082584, "grad_norm": 0.10541510581970215, "learning_rate": 9.817762434604481e-05, "loss": 1.3909, "mean_token_accuracy": 0.7393988057971, "num_tokens": 521795139.0, "step": 7260 }, { "entropy": 0.9675464764237404, "epoch": 1.9814663396020715, "grad_norm": 0.11267922073602676, "learning_rate": 9.816957826749307e-05, "loss": 1.3967, "mean_token_accuracy": 0.7457544431090355, "num_tokens": 522520008.0, "step": 7270 }, { "entropy": 0.9636656671762467, "epoch": 1.9841918778958845, "grad_norm": 0.21923284232616425, "learning_rate": 9.816151479685918e-05, "loss": 1.408, "mean_token_accuracy": 0.7386617347598076, "num_tokens": 523232215.0, "step": 7280 }, { "entropy": 0.9583509057760239, "epoch": 1.9869174161896974, "grad_norm": 0.10762002319097519, "learning_rate": 9.815343393705458e-05, "loss": 1.3984, "mean_token_accuracy": 0.7422628074884414, "num_tokens": 523954702.0, "step": 7290 }, { "entropy": 0.9607061296701431, "epoch": 1.9896429544835104, "grad_norm": 0.150059774518013, "learning_rate": 9.814533569099691e-05, "loss": 1.4031, "mean_token_accuracy": 0.7383078336715698, "num_tokens": 524655836.0, "step": 7300 }, { "entropy": 0.9600534334778785, "epoch": 1.9923684927773235, "grad_norm": 0.14201506972312927, "learning_rate": 9.813722006161013e-05, "loss": 1.3871, "mean_token_accuracy": 0.743747016787529, "num_tokens": 525384534.0, "step": 7310 }, { "entropy": 0.9653302758932114, "epoch": 1.9950940310711367, "grad_norm": 0.14192071557044983, "learning_rate": 9.812908705182447e-05, "loss": 1.4038, "mean_token_accuracy": 0.7368806630373002, "num_tokens": 526086698.0, "step": 7320 }, { "entropy": 0.9466646060347557, "epoch": 1.9978195693649496, "grad_norm": 0.10055558383464813, "learning_rate": 9.81209366645764e-05, "loss": 1.3775, "mean_token_accuracy": 0.7499463304877281, "num_tokens": 526816365.0, "step": 7330 }, { "entropy": 0.9586656853556633, "epoch": 2.0005451076587626, "grad_norm": 0.10854324698448181, "learning_rate": 9.811276890280874e-05, "loss": 1.3988, "mean_token_accuracy": 0.7433884471654892, "num_tokens": 527542733.0, "step": 7340 }, { "entropy": 0.9561543703079224, "epoch": 2.0032706459525755, "grad_norm": 0.1269897073507309, "learning_rate": 9.810458376947052e-05, "loss": 1.387, "mean_token_accuracy": 0.7402018457651138, "num_tokens": 528249256.0, "step": 7350 }, { "entropy": 0.9542464792728425, "epoch": 2.0059961842463885, "grad_norm": 0.15228229761123657, "learning_rate": 9.809638126751703e-05, "loss": 1.3788, "mean_token_accuracy": 0.7452547445893287, "num_tokens": 528984076.0, "step": 7360 }, { "entropy": 0.960684311389923, "epoch": 2.008721722540202, "grad_norm": 0.17953327298164368, "learning_rate": 9.80881613999099e-05, "loss": 1.3918, "mean_token_accuracy": 0.7386097416281701, "num_tokens": 529690825.0, "step": 7370 }, { "entropy": 0.963483664393425, "epoch": 2.011447260834015, "grad_norm": 0.13395299017429352, "learning_rate": 9.8079924169617e-05, "loss": 1.3908, "mean_token_accuracy": 0.7427313566207886, "num_tokens": 530403055.0, "step": 7380 }, { "entropy": 0.9560441017150879, "epoch": 2.0141727991278278, "grad_norm": 0.09408120065927505, "learning_rate": 9.807166957961241e-05, "loss": 1.3893, "mean_token_accuracy": 0.745306758582592, "num_tokens": 531136596.0, "step": 7390 }, { "entropy": 0.951741099357605, "epoch": 2.0168983374216407, "grad_norm": 0.14150190353393555, "learning_rate": 9.806339763287656e-05, "loss": 1.3837, "mean_token_accuracy": 0.7447185799479484, "num_tokens": 531852880.0, "step": 7400 }, { "entropy": 0.9562306642532349, "epoch": 2.0196238757154537, "grad_norm": 0.10243608802556992, "learning_rate": 9.805510833239612e-05, "loss": 1.3934, "mean_token_accuracy": 0.741636997461319, "num_tokens": 532563052.0, "step": 7410 }, { "entropy": 0.9499559327960014, "epoch": 2.022349414009267, "grad_norm": 0.10605795681476593, "learning_rate": 9.8046801681164e-05, "loss": 1.3769, "mean_token_accuracy": 0.7456878125667572, "num_tokens": 533291538.0, "step": 7420 }, { "entropy": 0.9550616160035134, "epoch": 2.02507495230308, "grad_norm": 0.10388023406267166, "learning_rate": 9.803847768217941e-05, "loss": 1.383, "mean_token_accuracy": 0.7446332737803459, "num_tokens": 534021094.0, "step": 7430 }, { "entropy": 0.9521099284291268, "epoch": 2.027800490596893, "grad_norm": 0.08860861510038376, "learning_rate": 9.80301363384478e-05, "loss": 1.3937, "mean_token_accuracy": 0.7413805097341537, "num_tokens": 534732981.0, "step": 7440 }, { "entropy": 0.9576058641076088, "epoch": 2.030526028890706, "grad_norm": 0.10883308202028275, "learning_rate": 9.802177765298091e-05, "loss": 1.3906, "mean_token_accuracy": 0.7408022314310074, "num_tokens": 535446088.0, "step": 7450 }, { "entropy": 0.9478833019733429, "epoch": 2.033251567184519, "grad_norm": 0.12634532153606415, "learning_rate": 9.801340162879669e-05, "loss": 1.3839, "mean_token_accuracy": 0.7444364428520203, "num_tokens": 536164628.0, "step": 7460 }, { "entropy": 0.9460383102297782, "epoch": 2.0359771054783318, "grad_norm": 0.09973424673080444, "learning_rate": 9.800500826891941e-05, "loss": 1.38, "mean_token_accuracy": 0.7519521161913871, "num_tokens": 536907046.0, "step": 7470 }, { "entropy": 0.966365572810173, "epoch": 2.038702643772145, "grad_norm": 0.08847790956497192, "learning_rate": 9.799659757637956e-05, "loss": 1.3919, "mean_token_accuracy": 0.7421518012881279, "num_tokens": 537631637.0, "step": 7480 }, { "entropy": 0.9592581987380981, "epoch": 2.041428182065958, "grad_norm": 0.09009517729282379, "learning_rate": 9.798816955421389e-05, "loss": 1.3882, "mean_token_accuracy": 0.7410011321306229, "num_tokens": 538358781.0, "step": 7490 }, { "entropy": 0.9531476750969887, "epoch": 2.044153720359771, "grad_norm": 0.09477727115154266, "learning_rate": 9.797972420546544e-05, "loss": 1.3776, "mean_token_accuracy": 0.7424200236797333, "num_tokens": 539067922.0, "step": 7500 }, { "entropy": 0.9474761784076691, "epoch": 2.046879258653584, "grad_norm": 0.09691348671913147, "learning_rate": 9.797126153318348e-05, "loss": 1.3829, "mean_token_accuracy": 0.7442451179027557, "num_tokens": 539778951.0, "step": 7510 }, { "entropy": 0.9564800217747689, "epoch": 2.049604796947397, "grad_norm": 0.09522726386785507, "learning_rate": 9.796278154042353e-05, "loss": 1.3926, "mean_token_accuracy": 0.7425307676196098, "num_tokens": 540497847.0, "step": 7520 }, { "entropy": 0.9547890648245811, "epoch": 2.0523303352412103, "grad_norm": 0.14827516674995422, "learning_rate": 9.795428423024736e-05, "loss": 1.3885, "mean_token_accuracy": 0.7409161731600762, "num_tokens": 541210115.0, "step": 7530 }, { "entropy": 0.9494491994380951, "epoch": 2.0550558735350233, "grad_norm": 0.10479316115379333, "learning_rate": 9.794576960572302e-05, "loss": 1.3885, "mean_token_accuracy": 0.739873006939888, "num_tokens": 541913200.0, "step": 7540 }, { "entropy": 0.9518936529755593, "epoch": 2.0577814118288362, "grad_norm": 0.1043408066034317, "learning_rate": 9.793723766992479e-05, "loss": 1.3808, "mean_token_accuracy": 0.7446469202637672, "num_tokens": 542633892.0, "step": 7550 }, { "entropy": 0.9660930693149566, "epoch": 2.060506950122649, "grad_norm": 0.11151346564292908, "learning_rate": 9.792868842593322e-05, "loss": 1.3953, "mean_token_accuracy": 0.7388115391135216, "num_tokens": 543356038.0, "step": 7560 }, { "entropy": 0.9554453119635582, "epoch": 2.063232488416462, "grad_norm": 0.10359987616539001, "learning_rate": 9.792012187683508e-05, "loss": 1.3899, "mean_token_accuracy": 0.7420963943004608, "num_tokens": 544074279.0, "step": 7570 }, { "entropy": 0.9530102029442787, "epoch": 2.065958026710275, "grad_norm": 0.09132084995508194, "learning_rate": 9.791153802572341e-05, "loss": 1.3793, "mean_token_accuracy": 0.7419965401291847, "num_tokens": 544789242.0, "step": 7580 }, { "entropy": 0.9550965338945389, "epoch": 2.0686835650040885, "grad_norm": 0.11602402478456497, "learning_rate": 9.790293687569749e-05, "loss": 1.3875, "mean_token_accuracy": 0.744350166618824, "num_tokens": 545518112.0, "step": 7590 }, { "entropy": 0.9603171899914742, "epoch": 2.0714091032979014, "grad_norm": 0.09773866832256317, "learning_rate": 9.789431842986284e-05, "loss": 1.3864, "mean_token_accuracy": 0.742016325891018, "num_tokens": 546243638.0, "step": 7600 }, { "entropy": 0.9539955139160157, "epoch": 2.0741346415917143, "grad_norm": 0.08773192763328552, "learning_rate": 9.788568269133123e-05, "loss": 1.3974, "mean_token_accuracy": 0.740584197640419, "num_tokens": 546965403.0, "step": 7610 }, { "entropy": 0.9547247931361198, "epoch": 2.0768601798855273, "grad_norm": 0.09583528339862823, "learning_rate": 9.78770296632207e-05, "loss": 1.3866, "mean_token_accuracy": 0.7411746963858604, "num_tokens": 547670412.0, "step": 7620 }, { "entropy": 0.9567594841122627, "epoch": 2.0795857181793402, "grad_norm": 0.11080870777368546, "learning_rate": 9.786835934865547e-05, "loss": 1.3937, "mean_token_accuracy": 0.7380332082509995, "num_tokens": 548367187.0, "step": 7630 }, { "entropy": 0.9504744604229927, "epoch": 2.0823112564731536, "grad_norm": 0.09894076734781265, "learning_rate": 9.785967175076607e-05, "loss": 1.3794, "mean_token_accuracy": 0.7484308660030365, "num_tokens": 549096345.0, "step": 7640 }, { "entropy": 0.9536508589982986, "epoch": 2.0850367947669666, "grad_norm": 0.09449561685323715, "learning_rate": 9.785096687268922e-05, "loss": 1.3866, "mean_token_accuracy": 0.7422194197773934, "num_tokens": 549813610.0, "step": 7650 }, { "entropy": 0.9630085244774819, "epoch": 2.0877623330607795, "grad_norm": 0.09821897745132446, "learning_rate": 9.784224471756791e-05, "loss": 1.4001, "mean_token_accuracy": 0.7393027573823929, "num_tokens": 550530533.0, "step": 7660 }, { "entropy": 0.9556149289011955, "epoch": 2.0904878713545925, "grad_norm": 0.09654974937438965, "learning_rate": 9.783350528855135e-05, "loss": 1.3932, "mean_token_accuracy": 0.7444974467158317, "num_tokens": 551255269.0, "step": 7670 }, { "entropy": 0.9613713935017586, "epoch": 2.0932134096484054, "grad_norm": 0.18773193657398224, "learning_rate": 9.7824748588795e-05, "loss": 1.3952, "mean_token_accuracy": 0.7414082109928131, "num_tokens": 551972535.0, "step": 7680 }, { "entropy": 0.9504840761423111, "epoch": 2.095938947942219, "grad_norm": 0.11335001140832901, "learning_rate": 9.781597462146055e-05, "loss": 1.3852, "mean_token_accuracy": 0.7465856090188027, "num_tokens": 552696476.0, "step": 7690 }, { "entropy": 0.9493086948990822, "epoch": 2.0986644862360317, "grad_norm": 0.10688840597867966, "learning_rate": 9.780718338971591e-05, "loss": 1.375, "mean_token_accuracy": 0.7483811944723129, "num_tokens": 553431306.0, "step": 7700 }, { "entropy": 0.9577390864491463, "epoch": 2.1013900245298447, "grad_norm": 0.08685535937547684, "learning_rate": 9.779837489673524e-05, "loss": 1.3937, "mean_token_accuracy": 0.7411364555358887, "num_tokens": 554157846.0, "step": 7710 }, { "entropy": 0.9565280213952064, "epoch": 2.1041155628236576, "grad_norm": 0.1284785121679306, "learning_rate": 9.778954914569896e-05, "loss": 1.3894, "mean_token_accuracy": 0.7396746635437011, "num_tokens": 554874935.0, "step": 7720 }, { "entropy": 0.9480376198887825, "epoch": 2.1068411011174706, "grad_norm": 0.09406908601522446, "learning_rate": 9.778070613979367e-05, "loss": 1.3807, "mean_token_accuracy": 0.7440237000584602, "num_tokens": 555595323.0, "step": 7730 }, { "entropy": 0.9471285820007325, "epoch": 2.1095666394112835, "grad_norm": 0.08738315850496292, "learning_rate": 9.77718458822122e-05, "loss": 1.3817, "mean_token_accuracy": 0.7418400928378105, "num_tokens": 556305735.0, "step": 7740 }, { "entropy": 0.949717079102993, "epoch": 2.112292177705097, "grad_norm": 0.11823268979787827, "learning_rate": 9.776296837615366e-05, "loss": 1.3871, "mean_token_accuracy": 0.7410406544804573, "num_tokens": 557020720.0, "step": 7750 }, { "entropy": 0.9500510856509209, "epoch": 2.11501771599891, "grad_norm": 0.09941519796848297, "learning_rate": 9.775407362482333e-05, "loss": 1.3845, "mean_token_accuracy": 0.7463141173124314, "num_tokens": 557741196.0, "step": 7760 }, { "entropy": 0.9501587927341462, "epoch": 2.117743254292723, "grad_norm": 0.10654324293136597, "learning_rate": 9.774516163143279e-05, "loss": 1.3857, "mean_token_accuracy": 0.7417897716164589, "num_tokens": 558452076.0, "step": 7770 }, { "entropy": 0.9522027879953384, "epoch": 2.1204687925865358, "grad_norm": 0.10403914749622345, "learning_rate": 9.773623239919974e-05, "loss": 1.3913, "mean_token_accuracy": 0.7401172786951065, "num_tokens": 559162091.0, "step": 7780 }, { "entropy": 0.9494891196489335, "epoch": 2.1231943308803487, "grad_norm": 0.09638772904872894, "learning_rate": 9.772728593134821e-05, "loss": 1.3753, "mean_token_accuracy": 0.7422588348388672, "num_tokens": 559888464.0, "step": 7790 }, { "entropy": 0.9565345466136932, "epoch": 2.125919869174162, "grad_norm": 0.09932591766119003, "learning_rate": 9.771832223110839e-05, "loss": 1.389, "mean_token_accuracy": 0.7491851806640625, "num_tokens": 560628399.0, "step": 7800 }, { "entropy": 0.9565155878663063, "epoch": 2.128645407467975, "grad_norm": 0.11492311209440231, "learning_rate": 9.77093413017167e-05, "loss": 1.3851, "mean_token_accuracy": 0.7480335250496865, "num_tokens": 561365171.0, "step": 7810 }, { "entropy": 0.9638590782880783, "epoch": 2.131370945761788, "grad_norm": 0.09567680209875107, "learning_rate": 9.770034314641581e-05, "loss": 1.3951, "mean_token_accuracy": 0.742455905675888, "num_tokens": 562086384.0, "step": 7820 }, { "entropy": 0.9431756198406219, "epoch": 2.134096484055601, "grad_norm": 0.09787328541278839, "learning_rate": 9.769132776845457e-05, "loss": 1.3748, "mean_token_accuracy": 0.7439287409186364, "num_tokens": 562800406.0, "step": 7830 }, { "entropy": 0.9539495810866356, "epoch": 2.136822022349414, "grad_norm": 0.12535595893859863, "learning_rate": 9.768229517108808e-05, "loss": 1.3917, "mean_token_accuracy": 0.7411072447896003, "num_tokens": 563509873.0, "step": 7840 }, { "entropy": 0.9599957779049874, "epoch": 2.1395475606432273, "grad_norm": 0.10500151664018631, "learning_rate": 9.767324535757765e-05, "loss": 1.3928, "mean_token_accuracy": 0.7441463723778725, "num_tokens": 564231965.0, "step": 7850 }, { "entropy": 0.9541016072034836, "epoch": 2.14227309893704, "grad_norm": 0.1107301414012909, "learning_rate": 9.766417833119078e-05, "loss": 1.3872, "mean_token_accuracy": 0.7417415857315064, "num_tokens": 564952531.0, "step": 7860 }, { "entropy": 0.9564834281802177, "epoch": 2.144998637230853, "grad_norm": 0.11248789727687836, "learning_rate": 9.765509409520122e-05, "loss": 1.387, "mean_token_accuracy": 0.7449320316314697, "num_tokens": 565673147.0, "step": 7870 }, { "entropy": 0.9606180742383004, "epoch": 2.147724175524666, "grad_norm": 0.08661828190088272, "learning_rate": 9.764599265288891e-05, "loss": 1.3914, "mean_token_accuracy": 0.7435157239437103, "num_tokens": 566393949.0, "step": 7880 }, { "entropy": 0.9510576590895653, "epoch": 2.150449713818479, "grad_norm": 0.09758838266134262, "learning_rate": 9.763687400754003e-05, "loss": 1.3943, "mean_token_accuracy": 0.7448127523064614, "num_tokens": 567104089.0, "step": 7890 }, { "entropy": 0.958026398718357, "epoch": 2.153175252112292, "grad_norm": 0.09131457656621933, "learning_rate": 9.762773816244694e-05, "loss": 1.3917, "mean_token_accuracy": 0.7430487379431725, "num_tokens": 567820065.0, "step": 7900 }, { "entropy": 0.9543215349316597, "epoch": 2.1559007904061054, "grad_norm": 0.11335130780935287, "learning_rate": 9.761858512090823e-05, "loss": 1.3888, "mean_token_accuracy": 0.7397184625267983, "num_tokens": 568526861.0, "step": 7910 }, { "entropy": 0.9609607473015785, "epoch": 2.1586263286999183, "grad_norm": 0.09940949082374573, "learning_rate": 9.760941488622868e-05, "loss": 1.3922, "mean_token_accuracy": 0.7399792060256004, "num_tokens": 569241225.0, "step": 7920 }, { "entropy": 0.9489357486367226, "epoch": 2.1613518669937313, "grad_norm": 0.11543278396129608, "learning_rate": 9.760022746171929e-05, "loss": 1.38, "mean_token_accuracy": 0.7419973850250244, "num_tokens": 569951679.0, "step": 7930 }, { "entropy": 0.9497444748878479, "epoch": 2.164077405287544, "grad_norm": 0.11987430602312088, "learning_rate": 9.759102285069728e-05, "loss": 1.3892, "mean_token_accuracy": 0.747117954492569, "num_tokens": 570678338.0, "step": 7940 }, { "entropy": 0.9563957571983337, "epoch": 2.166802943581357, "grad_norm": 0.1401757448911667, "learning_rate": 9.758180105648605e-05, "loss": 1.3864, "mean_token_accuracy": 0.7415750741958618, "num_tokens": 571394973.0, "step": 7950 }, { "entropy": 0.9495481014251709, "epoch": 2.1695284818751706, "grad_norm": 0.09080668538808823, "learning_rate": 9.757256208241523e-05, "loss": 1.3858, "mean_token_accuracy": 0.7434554889798164, "num_tokens": 572109622.0, "step": 7960 }, { "entropy": 0.9519291743636131, "epoch": 2.1722540201689835, "grad_norm": 0.16083116829395294, "learning_rate": 9.756330593182064e-05, "loss": 1.3884, "mean_token_accuracy": 0.7435447379946709, "num_tokens": 572809934.0, "step": 7970 }, { "entropy": 0.9475197449326516, "epoch": 2.1749795584627964, "grad_norm": 0.18879470229148865, "learning_rate": 9.755403260804427e-05, "loss": 1.3833, "mean_token_accuracy": 0.7451119691133499, "num_tokens": 573522270.0, "step": 7980 }, { "entropy": 0.9591574087738991, "epoch": 2.1777050967566094, "grad_norm": 0.09684582054615021, "learning_rate": 9.754474211443438e-05, "loss": 1.3985, "mean_token_accuracy": 0.7412367045879364, "num_tokens": 574229904.0, "step": 7990 }, { "entropy": 0.9530527293682098, "epoch": 2.1804306350504223, "grad_norm": 0.20667783915996552, "learning_rate": 9.753543445434536e-05, "loss": 1.3917, "mean_token_accuracy": 0.7400659859180451, "num_tokens": 574933233.0, "step": 8000 }, { "entropy": 0.9602208435535431, "epoch": 2.1831561733442353, "grad_norm": 0.13707610964775085, "learning_rate": 9.752610963113785e-05, "loss": 1.3933, "mean_token_accuracy": 0.7446024715900421, "num_tokens": 575657448.0, "step": 8010 }, { "entropy": 0.953098563849926, "epoch": 2.1858817116380487, "grad_norm": 0.09681950509548187, "learning_rate": 9.751676764817866e-05, "loss": 1.3707, "mean_token_accuracy": 0.7434972569346427, "num_tokens": 576382959.0, "step": 8020 }, { "entropy": 0.9519978165626526, "epoch": 2.1886072499318616, "grad_norm": 0.10283658653497696, "learning_rate": 9.75074085088408e-05, "loss": 1.386, "mean_token_accuracy": 0.7427999630570412, "num_tokens": 577099498.0, "step": 8030 }, { "entropy": 0.9588069602847099, "epoch": 2.1913327882256746, "grad_norm": 0.167690247297287, "learning_rate": 9.749803221650347e-05, "loss": 1.3794, "mean_token_accuracy": 0.7452961578965187, "num_tokens": 577831077.0, "step": 8040 }, { "entropy": 0.9571497112512588, "epoch": 2.1940583265194875, "grad_norm": 0.09857787936925888, "learning_rate": 9.748863877455208e-05, "loss": 1.3995, "mean_token_accuracy": 0.7413436904549598, "num_tokens": 578548664.0, "step": 8050 }, { "entropy": 0.9569678619503975, "epoch": 2.1967838648133005, "grad_norm": 0.12631528079509735, "learning_rate": 9.74792281863782e-05, "loss": 1.3868, "mean_token_accuracy": 0.7428177461028099, "num_tokens": 579269234.0, "step": 8060 }, { "entropy": 0.9517800152301789, "epoch": 2.199509403107114, "grad_norm": 0.11135827004909515, "learning_rate": 9.746980045537964e-05, "loss": 1.3835, "mean_token_accuracy": 0.7433663338422776, "num_tokens": 579995687.0, "step": 8070 }, { "entropy": 0.9407218992710114, "epoch": 2.202234941400927, "grad_norm": 0.10755167156457901, "learning_rate": 9.746035558496037e-05, "loss": 1.3792, "mean_token_accuracy": 0.7451389506459236, "num_tokens": 580707770.0, "step": 8080 }, { "entropy": 0.9514376983046532, "epoch": 2.2049604796947397, "grad_norm": 0.1073494628071785, "learning_rate": 9.745089357853052e-05, "loss": 1.3833, "mean_token_accuracy": 0.744055698812008, "num_tokens": 581430212.0, "step": 8090 }, { "entropy": 0.947685706615448, "epoch": 2.2076860179885527, "grad_norm": 0.11241379380226135, "learning_rate": 9.744141443950647e-05, "loss": 1.3827, "mean_token_accuracy": 0.7359423115849495, "num_tokens": 582131993.0, "step": 8100 }, { "entropy": 0.9549921721220016, "epoch": 2.2104115562823656, "grad_norm": 0.09318625926971436, "learning_rate": 9.743191817131072e-05, "loss": 1.3887, "mean_token_accuracy": 0.7450414016842842, "num_tokens": 582863912.0, "step": 8110 }, { "entropy": 0.9530914172530174, "epoch": 2.2131370945761786, "grad_norm": 0.12051790952682495, "learning_rate": 9.742240477737202e-05, "loss": 1.3893, "mean_token_accuracy": 0.7408110216259957, "num_tokens": 583577159.0, "step": 8120 }, { "entropy": 0.9535427525639534, "epoch": 2.215862632869992, "grad_norm": 0.09240037202835083, "learning_rate": 9.741287426112525e-05, "loss": 1.3882, "mean_token_accuracy": 0.7459387987852096, "num_tokens": 584307922.0, "step": 8130 }, { "entropy": 0.9615517109632492, "epoch": 2.218588171163805, "grad_norm": 0.10400390625, "learning_rate": 9.74033266260115e-05, "loss": 1.3839, "mean_token_accuracy": 0.7364679843187332, "num_tokens": 585015794.0, "step": 8140 }, { "entropy": 0.9512642607092857, "epoch": 2.221313709457618, "grad_norm": 0.1038583517074585, "learning_rate": 9.739376187547804e-05, "loss": 1.3875, "mean_token_accuracy": 0.7438942402601242, "num_tokens": 585733940.0, "step": 8150 }, { "entropy": 0.955040591955185, "epoch": 2.224039247751431, "grad_norm": 0.10395492613315582, "learning_rate": 9.738418001297831e-05, "loss": 1.3847, "mean_token_accuracy": 0.7443490579724312, "num_tokens": 586457898.0, "step": 8160 }, { "entropy": 0.9494217172265053, "epoch": 2.2267647860452437, "grad_norm": 0.11374354362487793, "learning_rate": 9.737458104197192e-05, "loss": 1.3785, "mean_token_accuracy": 0.7407943025231362, "num_tokens": 587176542.0, "step": 8170 }, { "entropy": 0.9520328372716904, "epoch": 2.229490324339057, "grad_norm": 0.09953740239143372, "learning_rate": 9.736496496592468e-05, "loss": 1.3818, "mean_token_accuracy": 0.745783768594265, "num_tokens": 587907654.0, "step": 8180 }, { "entropy": 0.9531142428517342, "epoch": 2.23221586263287, "grad_norm": 0.10314609110355377, "learning_rate": 9.735533178830858e-05, "loss": 1.3901, "mean_token_accuracy": 0.7458554282784462, "num_tokens": 588631537.0, "step": 8190 }, { "entropy": 0.9586337089538575, "epoch": 2.234941400926683, "grad_norm": 0.09111809730529785, "learning_rate": 9.734568151260175e-05, "loss": 1.3924, "mean_token_accuracy": 0.7389423623681068, "num_tokens": 589343536.0, "step": 8200 }, { "entropy": 0.9590684294700622, "epoch": 2.237666939220496, "grad_norm": 0.09666437655687332, "learning_rate": 9.733601414228851e-05, "loss": 1.3875, "mean_token_accuracy": 0.7413570925593376, "num_tokens": 590068091.0, "step": 8210 }, { "entropy": 0.9482115671038628, "epoch": 2.240392477514309, "grad_norm": 0.09807022660970688, "learning_rate": 9.732632968085936e-05, "loss": 1.384, "mean_token_accuracy": 0.7409114748239517, "num_tokens": 590784949.0, "step": 8220 }, { "entropy": 0.955726346373558, "epoch": 2.2431180158081223, "grad_norm": 0.09671087563037872, "learning_rate": 9.731662813181098e-05, "loss": 1.3935, "mean_token_accuracy": 0.7449436247348785, "num_tokens": 591515942.0, "step": 8230 }, { "entropy": 0.9519837841391563, "epoch": 2.2458435541019353, "grad_norm": 0.08974765986204147, "learning_rate": 9.730690949864619e-05, "loss": 1.3817, "mean_token_accuracy": 0.7427958875894547, "num_tokens": 592239233.0, "step": 8240 }, { "entropy": 0.9540391772985458, "epoch": 2.248569092395748, "grad_norm": 0.1783023327589035, "learning_rate": 9.7297173784874e-05, "loss": 1.3845, "mean_token_accuracy": 0.741515402495861, "num_tokens": 592951726.0, "step": 8250 }, { "entropy": 0.9594511583447456, "epoch": 2.251294630689561, "grad_norm": 0.10823407024145126, "learning_rate": 9.728742099400958e-05, "loss": 1.3928, "mean_token_accuracy": 0.7422432124614715, "num_tokens": 593662944.0, "step": 8260 }, { "entropy": 0.9567916959524154, "epoch": 2.254020168983374, "grad_norm": 0.09590677171945572, "learning_rate": 9.727765112957427e-05, "loss": 1.3883, "mean_token_accuracy": 0.7430309951305389, "num_tokens": 594390633.0, "step": 8270 }, { "entropy": 0.9513653293251991, "epoch": 2.2567457072771875, "grad_norm": 0.0891508013010025, "learning_rate": 9.726786419509559e-05, "loss": 1.3903, "mean_token_accuracy": 0.7406950652599334, "num_tokens": 595098083.0, "step": 8280 }, { "entropy": 0.9539126053452491, "epoch": 2.2594712455710004, "grad_norm": 0.11206283420324326, "learning_rate": 9.725806019410717e-05, "loss": 1.3926, "mean_token_accuracy": 0.744379249215126, "num_tokens": 595828744.0, "step": 8290 }, { "entropy": 0.9574821561574935, "epoch": 2.2621967838648134, "grad_norm": 0.11940894275903702, "learning_rate": 9.724823913014884e-05, "loss": 1.3832, "mean_token_accuracy": 0.7377721101045609, "num_tokens": 596546248.0, "step": 8300 }, { "entropy": 0.9533024594187737, "epoch": 2.2649223221586263, "grad_norm": 0.12330570816993713, "learning_rate": 9.723840100676662e-05, "loss": 1.3874, "mean_token_accuracy": 0.741325494647026, "num_tokens": 597259125.0, "step": 8310 }, { "entropy": 0.9586221218109131, "epoch": 2.2676478604524393, "grad_norm": 0.09389526396989822, "learning_rate": 9.722854582751263e-05, "loss": 1.3954, "mean_token_accuracy": 0.7408126696944237, "num_tokens": 597971152.0, "step": 8320 }, { "entropy": 0.9567618697881699, "epoch": 2.270373398746252, "grad_norm": 0.11088203638792038, "learning_rate": 9.72186735959452e-05, "loss": 1.3843, "mean_token_accuracy": 0.7390223950147629, "num_tokens": 598681678.0, "step": 8330 }, { "entropy": 0.9475936159491539, "epoch": 2.2730989370400656, "grad_norm": 0.10596734285354614, "learning_rate": 9.720878431562878e-05, "loss": 1.3836, "mean_token_accuracy": 0.7408780589699745, "num_tokens": 599389846.0, "step": 8340 }, { "entropy": 0.9543149292469024, "epoch": 2.2758244753338785, "grad_norm": 0.1165304109454155, "learning_rate": 9.719887799013398e-05, "loss": 1.3807, "mean_token_accuracy": 0.7443940833210945, "num_tokens": 600107912.0, "step": 8350 }, { "entropy": 0.9515037432312965, "epoch": 2.2785500136276915, "grad_norm": 0.10647770017385483, "learning_rate": 9.718895462303758e-05, "loss": 1.3774, "mean_token_accuracy": 0.7442094996571541, "num_tokens": 600830772.0, "step": 8360 }, { "entropy": 0.9488893762230873, "epoch": 2.2812755519215044, "grad_norm": 0.16339656710624695, "learning_rate": 9.71790142179225e-05, "loss": 1.3851, "mean_token_accuracy": 0.7428596884012222, "num_tokens": 601540728.0, "step": 8370 }, { "entropy": 0.9504873648285865, "epoch": 2.2840010902153174, "grad_norm": 0.10375595092773438, "learning_rate": 9.716905677837782e-05, "loss": 1.3856, "mean_token_accuracy": 0.74285928606987, "num_tokens": 602250882.0, "step": 8380 }, { "entropy": 0.9590310201048851, "epoch": 2.2867266285091308, "grad_norm": 0.09047789126634598, "learning_rate": 9.715908230799878e-05, "loss": 1.3882, "mean_token_accuracy": 0.7422109052538872, "num_tokens": 602977912.0, "step": 8390 }, { "entropy": 0.9537284761667252, "epoch": 2.2894521668029437, "grad_norm": 0.0893293023109436, "learning_rate": 9.714909081038675e-05, "loss": 1.3825, "mean_token_accuracy": 0.7399809136986732, "num_tokens": 603691403.0, "step": 8400 }, { "entropy": 0.9576122686266899, "epoch": 2.2921777050967567, "grad_norm": 0.09539050608873367, "learning_rate": 9.713908228914923e-05, "loss": 1.3842, "mean_token_accuracy": 0.7393251180648803, "num_tokens": 604406280.0, "step": 8410 }, { "entropy": 0.9496517419815064, "epoch": 2.2949032433905696, "grad_norm": 0.09857992827892303, "learning_rate": 9.712905674789992e-05, "loss": 1.3854, "mean_token_accuracy": 0.7475869357585907, "num_tokens": 605145887.0, "step": 8420 }, { "entropy": 0.9548046961426735, "epoch": 2.2976287816843826, "grad_norm": 0.10884623229503632, "learning_rate": 9.711901419025864e-05, "loss": 1.3828, "mean_token_accuracy": 0.7435204699635506, "num_tokens": 605872264.0, "step": 8430 }, { "entropy": 0.9589501142501831, "epoch": 2.3003543199781955, "grad_norm": 0.09740767627954483, "learning_rate": 9.710895461985133e-05, "loss": 1.3953, "mean_token_accuracy": 0.7383265286684036, "num_tokens": 606573504.0, "step": 8440 }, { "entropy": 0.9564507827162743, "epoch": 2.303079858272009, "grad_norm": 0.10725618153810501, "learning_rate": 9.709887804031011e-05, "loss": 1.4054, "mean_token_accuracy": 0.73534354865551, "num_tokens": 607266301.0, "step": 8450 }, { "entropy": 0.955133493244648, "epoch": 2.305805396565822, "grad_norm": 0.09258636087179184, "learning_rate": 9.70887844552732e-05, "loss": 1.3883, "mean_token_accuracy": 0.7400516867637634, "num_tokens": 607974162.0, "step": 8460 }, { "entropy": 0.9519719690084457, "epoch": 2.308530934859635, "grad_norm": 0.0927857905626297, "learning_rate": 9.707867386838502e-05, "loss": 1.3844, "mean_token_accuracy": 0.7410557478666305, "num_tokens": 608684509.0, "step": 8470 }, { "entropy": 0.9564346343278884, "epoch": 2.3112564731534477, "grad_norm": 0.10572093725204468, "learning_rate": 9.706854628329606e-05, "loss": 1.3816, "mean_token_accuracy": 0.7407214358448982, "num_tokens": 609411594.0, "step": 8480 }, { "entropy": 0.9542575821280479, "epoch": 2.3139820114472607, "grad_norm": 0.09347482025623322, "learning_rate": 9.705840170366303e-05, "loss": 1.3843, "mean_token_accuracy": 0.7433892488479614, "num_tokens": 610130934.0, "step": 8490 }, { "entropy": 0.9546264484524727, "epoch": 2.316707549741074, "grad_norm": 0.09801976382732391, "learning_rate": 9.704824013314866e-05, "loss": 1.394, "mean_token_accuracy": 0.7432631969451904, "num_tokens": 610848349.0, "step": 8500 }, { "entropy": 0.9565924733877182, "epoch": 2.319433088034887, "grad_norm": 0.23593464493751526, "learning_rate": 9.703806157542193e-05, "loss": 1.3905, "mean_token_accuracy": 0.7429133981466294, "num_tokens": 611561894.0, "step": 8510 }, { "entropy": 0.953339995443821, "epoch": 2.3221586263287, "grad_norm": 0.1044878363609314, "learning_rate": 9.702786603415787e-05, "loss": 1.386, "mean_token_accuracy": 0.7427751243114471, "num_tokens": 612278810.0, "step": 8520 }, { "entropy": 0.9573228195309639, "epoch": 2.324884164622513, "grad_norm": 0.11448699235916138, "learning_rate": 9.70176535130377e-05, "loss": 1.3952, "mean_token_accuracy": 0.7401854783296585, "num_tokens": 612997260.0, "step": 8530 }, { "entropy": 0.9552780792117119, "epoch": 2.327609702916326, "grad_norm": 0.09680186212062836, "learning_rate": 9.700742401574874e-05, "loss": 1.3954, "mean_token_accuracy": 0.7415038183331489, "num_tokens": 613710583.0, "step": 8540 }, { "entropy": 0.9554706335067749, "epoch": 2.330335241210139, "grad_norm": 0.1076870709657669, "learning_rate": 9.699717754598446e-05, "loss": 1.3928, "mean_token_accuracy": 0.742630822956562, "num_tokens": 614431376.0, "step": 8550 }, { "entropy": 0.9571814581751823, "epoch": 2.333060779503952, "grad_norm": 0.09516485035419464, "learning_rate": 9.698691410744442e-05, "loss": 1.3877, "mean_token_accuracy": 0.7409067109227181, "num_tokens": 615155180.0, "step": 8560 }, { "entropy": 0.955613163113594, "epoch": 2.335786317797765, "grad_norm": 0.09925924986600876, "learning_rate": 9.697663370383435e-05, "loss": 1.388, "mean_token_accuracy": 0.7412252381443978, "num_tokens": 615873451.0, "step": 8570 }, { "entropy": 0.9458952382206917, "epoch": 2.338511856091578, "grad_norm": 0.1026625856757164, "learning_rate": 9.69663363388661e-05, "loss": 1.3794, "mean_token_accuracy": 0.746001347899437, "num_tokens": 616604967.0, "step": 8580 }, { "entropy": 0.9552543684840202, "epoch": 2.341237394385391, "grad_norm": 0.1008027046918869, "learning_rate": 9.695602201625758e-05, "loss": 1.3921, "mean_token_accuracy": 0.7384163230657578, "num_tokens": 617314881.0, "step": 8590 }, { "entropy": 0.9545485526323318, "epoch": 2.343962932679204, "grad_norm": 0.1401461362838745, "learning_rate": 9.694569073973292e-05, "loss": 1.3885, "mean_token_accuracy": 0.7435328722000122, "num_tokens": 618041369.0, "step": 8600 }, { "entropy": 0.9563568353652954, "epoch": 2.3466884709730174, "grad_norm": 0.13621768355369568, "learning_rate": 9.693534251302232e-05, "loss": 1.3934, "mean_token_accuracy": 0.742860633134842, "num_tokens": 618761033.0, "step": 8610 }, { "entropy": 0.9503724902868271, "epoch": 2.3494140092668303, "grad_norm": 0.09177511185407639, "learning_rate": 9.692497733986209e-05, "loss": 1.3889, "mean_token_accuracy": 0.7402893587946892, "num_tokens": 619450232.0, "step": 8620 }, { "entropy": 0.9515706405043602, "epoch": 2.3521395475606433, "grad_norm": 0.1006256714463234, "learning_rate": 9.691459522399469e-05, "loss": 1.3818, "mean_token_accuracy": 0.7391259208321571, "num_tokens": 620154059.0, "step": 8630 }, { "entropy": 0.9457090362906456, "epoch": 2.354865085854456, "grad_norm": 0.10970070958137512, "learning_rate": 9.690419616916866e-05, "loss": 1.3819, "mean_token_accuracy": 0.7459159597754479, "num_tokens": 620879082.0, "step": 8640 }, { "entropy": 0.9572040170431138, "epoch": 2.357590624148269, "grad_norm": 0.11229894310235977, "learning_rate": 9.68937801791387e-05, "loss": 1.4004, "mean_token_accuracy": 0.7371783927083015, "num_tokens": 621574509.0, "step": 8650 }, { "entropy": 0.951557745039463, "epoch": 2.360316162442082, "grad_norm": 0.10168556869029999, "learning_rate": 9.688334725766558e-05, "loss": 1.3761, "mean_token_accuracy": 0.7517162457108497, "num_tokens": 622330268.0, "step": 8660 }, { "entropy": 0.9423753619194031, "epoch": 2.3630417007358955, "grad_norm": 0.11148504912853241, "learning_rate": 9.687289740851622e-05, "loss": 1.3792, "mean_token_accuracy": 0.743215948343277, "num_tokens": 623039876.0, "step": 8670 }, { "entropy": 0.9570816576480865, "epoch": 2.3657672390297084, "grad_norm": 0.11424989998340607, "learning_rate": 9.686243063546363e-05, "loss": 1.3987, "mean_token_accuracy": 0.7437155336141587, "num_tokens": 623770204.0, "step": 8680 }, { "entropy": 0.9582390651106835, "epoch": 2.3684927773235214, "grad_norm": 0.09436160326004028, "learning_rate": 9.685194694228695e-05, "loss": 1.3918, "mean_token_accuracy": 0.7428663671016693, "num_tokens": 624499269.0, "step": 8690 }, { "entropy": 0.950636301934719, "epoch": 2.3712183156173343, "grad_norm": 0.10374874621629715, "learning_rate": 9.68414463327714e-05, "loss": 1.3861, "mean_token_accuracy": 0.7397300824522972, "num_tokens": 625209851.0, "step": 8700 }, { "entropy": 0.9499162703752517, "epoch": 2.3739438539111473, "grad_norm": 0.09510882198810577, "learning_rate": 9.683092881070834e-05, "loss": 1.378, "mean_token_accuracy": 0.7441746711730957, "num_tokens": 625934199.0, "step": 8710 }, { "entropy": 0.9522706657648087, "epoch": 2.3766693922049607, "grad_norm": 0.2338542491197586, "learning_rate": 9.682039437989521e-05, "loss": 1.3807, "mean_token_accuracy": 0.7424178630113601, "num_tokens": 626660854.0, "step": 8720 }, { "entropy": 0.9546517834067345, "epoch": 2.3793949304987736, "grad_norm": 0.11845209449529648, "learning_rate": 9.680984304413556e-05, "loss": 1.3893, "mean_token_accuracy": 0.7413112193346023, "num_tokens": 627380960.0, "step": 8730 }, { "entropy": 0.9508434534072876, "epoch": 2.3821204687925865, "grad_norm": 0.15495479106903076, "learning_rate": 9.679927480723908e-05, "loss": 1.3901, "mean_token_accuracy": 0.7423882052302361, "num_tokens": 628092793.0, "step": 8740 }, { "entropy": 0.9567522183060646, "epoch": 2.3848460070863995, "grad_norm": 0.09430848807096481, "learning_rate": 9.678868967302149e-05, "loss": 1.3809, "mean_token_accuracy": 0.7474494472146034, "num_tokens": 628838020.0, "step": 8750 }, { "entropy": 0.9573053374886513, "epoch": 2.3875715453802124, "grad_norm": 0.09825961291790009, "learning_rate": 9.677808764530467e-05, "loss": 1.3882, "mean_token_accuracy": 0.7434219941496849, "num_tokens": 629564184.0, "step": 8760 }, { "entropy": 0.9534874022006988, "epoch": 2.3902970836740254, "grad_norm": 0.09576196223497391, "learning_rate": 9.67674687279166e-05, "loss": 1.3819, "mean_token_accuracy": 0.7404048323631287, "num_tokens": 630283422.0, "step": 8770 }, { "entropy": 0.9483891680836678, "epoch": 2.3930226219678388, "grad_norm": 0.19279265403747559, "learning_rate": 9.675683292469132e-05, "loss": 1.3778, "mean_token_accuracy": 0.7444525852799415, "num_tokens": 631009693.0, "step": 8780 }, { "entropy": 0.9520395860075951, "epoch": 2.3957481602616517, "grad_norm": 0.19635552167892456, "learning_rate": 9.674618023946898e-05, "loss": 1.3747, "mean_token_accuracy": 0.7479759573936462, "num_tokens": 631747513.0, "step": 8790 }, { "entropy": 0.9492999538779259, "epoch": 2.3984736985554647, "grad_norm": 0.11218266934156418, "learning_rate": 9.673551067609587e-05, "loss": 1.3832, "mean_token_accuracy": 0.7467947244644165, "num_tokens": 632472466.0, "step": 8800 }, { "entropy": 0.9487012833356857, "epoch": 2.4011992368492776, "grad_norm": 0.16144615411758423, "learning_rate": 9.672482423842429e-05, "loss": 1.383, "mean_token_accuracy": 0.7447495311498642, "num_tokens": 633199504.0, "step": 8810 }, { "entropy": 0.9547057762742043, "epoch": 2.403924775143091, "grad_norm": 0.15687504410743713, "learning_rate": 9.671412093031272e-05, "loss": 1.3849, "mean_token_accuracy": 0.7398101285099983, "num_tokens": 633907447.0, "step": 8820 }, { "entropy": 0.9492294996976852, "epoch": 2.406650313436904, "grad_norm": 0.18032611906528473, "learning_rate": 9.670340075562568e-05, "loss": 1.3904, "mean_token_accuracy": 0.7383682012557984, "num_tokens": 634609837.0, "step": 8830 }, { "entropy": 0.9546138554811477, "epoch": 2.409375851730717, "grad_norm": 0.10445669293403625, "learning_rate": 9.669266371823375e-05, "loss": 1.3869, "mean_token_accuracy": 0.7432780593633652, "num_tokens": 635331680.0, "step": 8840 }, { "entropy": 0.950250256061554, "epoch": 2.41210139002453, "grad_norm": 0.100125752389431, "learning_rate": 9.66819098220137e-05, "loss": 1.3895, "mean_token_accuracy": 0.7454440101981163, "num_tokens": 636041368.0, "step": 8850 }, { "entropy": 0.9544099509716034, "epoch": 2.414826928318343, "grad_norm": 0.08421855419874191, "learning_rate": 9.66711390708483e-05, "loss": 1.3886, "mean_token_accuracy": 0.7395869076251984, "num_tokens": 636755977.0, "step": 8860 }, { "entropy": 0.9561598286032676, "epoch": 2.4175524666121557, "grad_norm": 0.16309291124343872, "learning_rate": 9.666035146862642e-05, "loss": 1.3893, "mean_token_accuracy": 0.7409598305821419, "num_tokens": 637477653.0, "step": 8870 }, { "entropy": 0.9585184708237648, "epoch": 2.420278004905969, "grad_norm": 0.10667727142572403, "learning_rate": 9.664954701924304e-05, "loss": 1.3945, "mean_token_accuracy": 0.7412994131445885, "num_tokens": 638189167.0, "step": 8880 }, { "entropy": 0.9481479018926621, "epoch": 2.423003543199782, "grad_norm": 0.1399410516023636, "learning_rate": 9.663872572659921e-05, "loss": 1.3831, "mean_token_accuracy": 0.7428767397999764, "num_tokens": 638909713.0, "step": 8890 }, { "entropy": 0.9509454175829888, "epoch": 2.425729081493595, "grad_norm": 0.10507156699895859, "learning_rate": 9.662788759460205e-05, "loss": 1.376, "mean_token_accuracy": 0.7396516442298889, "num_tokens": 639615575.0, "step": 8900 }, { "entropy": 0.9558164522051811, "epoch": 2.428454619787408, "grad_norm": 0.09864579141139984, "learning_rate": 9.661703262716478e-05, "loss": 1.393, "mean_token_accuracy": 0.7430677577853203, "num_tokens": 640337164.0, "step": 8910 }, { "entropy": 0.9462727442383766, "epoch": 2.431180158081221, "grad_norm": 0.10743077099323273, "learning_rate": 9.660616082820669e-05, "loss": 1.3807, "mean_token_accuracy": 0.7418262407183647, "num_tokens": 641051774.0, "step": 8920 }, { "entropy": 0.9490568324923515, "epoch": 2.4339056963750343, "grad_norm": 0.5460764169692993, "learning_rate": 9.659527220165312e-05, "loss": 1.3784, "mean_token_accuracy": 0.7486709088087082, "num_tokens": 641785779.0, "step": 8930 }, { "entropy": 0.9565368533134461, "epoch": 2.4366312346688472, "grad_norm": 0.1278989315032959, "learning_rate": 9.658436675143555e-05, "loss": 1.3889, "mean_token_accuracy": 0.7437928393483162, "num_tokens": 642509140.0, "step": 8940 }, { "entropy": 0.9486685395240784, "epoch": 2.43935677296266, "grad_norm": 0.1757955104112625, "learning_rate": 9.657344448149146e-05, "loss": 1.3801, "mean_token_accuracy": 0.7438680246472359, "num_tokens": 643235408.0, "step": 8950 }, { "entropy": 0.9519594490528107, "epoch": 2.442082311256473, "grad_norm": 0.11428218334913254, "learning_rate": 9.656250539576445e-05, "loss": 1.3898, "mean_token_accuracy": 0.742796714603901, "num_tokens": 643955009.0, "step": 8960 }, { "entropy": 0.948516134917736, "epoch": 2.444807849550286, "grad_norm": 0.10164281725883484, "learning_rate": 9.655154949820421e-05, "loss": 1.3788, "mean_token_accuracy": 0.7450691372156143, "num_tokens": 644683818.0, "step": 8970 }, { "entropy": 0.9490355685353279, "epoch": 2.447533387844099, "grad_norm": 0.10648229718208313, "learning_rate": 9.654057679276644e-05, "loss": 1.3777, "mean_token_accuracy": 0.746142016351223, "num_tokens": 645424535.0, "step": 8980 }, { "entropy": 0.9564800366759301, "epoch": 2.4502589261379124, "grad_norm": 0.12165772169828415, "learning_rate": 9.652958728341296e-05, "loss": 1.3956, "mean_token_accuracy": 0.7393794029951095, "num_tokens": 646132176.0, "step": 8990 }, { "entropy": 0.956525768339634, "epoch": 2.4529844644317254, "grad_norm": 0.14618892967700958, "learning_rate": 9.65185809741116e-05, "loss": 1.3853, "mean_token_accuracy": 0.743808300793171, "num_tokens": 646859208.0, "step": 9000 }, { "entropy": 0.9516721293330193, "epoch": 2.4557100027255383, "grad_norm": 0.09927177429199219, "learning_rate": 9.650755786883633e-05, "loss": 1.3814, "mean_token_accuracy": 0.7426035419106484, "num_tokens": 647585717.0, "step": 9010 }, { "entropy": 0.9528895154595375, "epoch": 2.4584355410193512, "grad_norm": 0.1371716558933258, "learning_rate": 9.649651797156713e-05, "loss": 1.3915, "mean_token_accuracy": 0.7415006205439567, "num_tokens": 648299102.0, "step": 9020 }, { "entropy": 0.9539487212896347, "epoch": 2.461161079313164, "grad_norm": 0.12393172085285187, "learning_rate": 9.648546128629006e-05, "loss": 1.3872, "mean_token_accuracy": 0.7432716667652131, "num_tokens": 649014355.0, "step": 9030 }, { "entropy": 0.9543512776494026, "epoch": 2.4638866176069776, "grad_norm": 0.0934886708855629, "learning_rate": 9.647438781699725e-05, "loss": 1.3817, "mean_token_accuracy": 0.7445197448134422, "num_tokens": 649738408.0, "step": 9040 }, { "entropy": 0.9564831212162972, "epoch": 2.4666121559007905, "grad_norm": 0.12876413762569427, "learning_rate": 9.646329756768686e-05, "loss": 1.3919, "mean_token_accuracy": 0.7444147065281868, "num_tokens": 650460693.0, "step": 9050 }, { "entropy": 0.95407083183527, "epoch": 2.4693376941946035, "grad_norm": 0.42325589060783386, "learning_rate": 9.645219054236314e-05, "loss": 1.3921, "mean_token_accuracy": 0.7388138264417649, "num_tokens": 651171240.0, "step": 9060 }, { "entropy": 0.9518125399947166, "epoch": 2.4720632324884164, "grad_norm": 0.10088993608951569, "learning_rate": 9.644106674503638e-05, "loss": 1.3839, "mean_token_accuracy": 0.7464907243847847, "num_tokens": 651901415.0, "step": 9070 }, { "entropy": 0.9502801403403283, "epoch": 2.4747887707822294, "grad_norm": 0.09579727053642273, "learning_rate": 9.642992617972297e-05, "loss": 1.3814, "mean_token_accuracy": 0.7473923444747925, "num_tokens": 652632701.0, "step": 9080 }, { "entropy": 0.9594358250498771, "epoch": 2.4775143090760423, "grad_norm": 0.08653602004051208, "learning_rate": 9.641876885044528e-05, "loss": 1.3939, "mean_token_accuracy": 0.7395642042160034, "num_tokens": 653352424.0, "step": 9090 }, { "entropy": 0.9477410703897476, "epoch": 2.4802398473698557, "grad_norm": 0.09166956692934036, "learning_rate": 9.640759476123176e-05, "loss": 1.3947, "mean_token_accuracy": 0.7414721310138702, "num_tokens": 654058073.0, "step": 9100 }, { "entropy": 0.952572925388813, "epoch": 2.4829653856636686, "grad_norm": 0.10699083656072617, "learning_rate": 9.639640391611695e-05, "loss": 1.3882, "mean_token_accuracy": 0.7433302894234657, "num_tokens": 654770000.0, "step": 9110 }, { "entropy": 0.9538148298859597, "epoch": 2.4856909239574816, "grad_norm": 0.132701113820076, "learning_rate": 9.63851963191414e-05, "loss": 1.3892, "mean_token_accuracy": 0.7426132261753082, "num_tokens": 655492183.0, "step": 9120 }, { "entropy": 0.9542162343859673, "epoch": 2.4884164622512945, "grad_norm": 0.12824146449565887, "learning_rate": 9.63739719743517e-05, "loss": 1.3855, "mean_token_accuracy": 0.742797639966011, "num_tokens": 656205921.0, "step": 9130 }, { "entropy": 0.9498761922121048, "epoch": 2.4911420005451075, "grad_norm": 0.093867227435112, "learning_rate": 9.636273088580054e-05, "loss": 1.3866, "mean_token_accuracy": 0.7396522730588913, "num_tokens": 656912518.0, "step": 9140 }, { "entropy": 0.9562533587217331, "epoch": 2.493867538838921, "grad_norm": 0.15160538256168365, "learning_rate": 9.63514730575466e-05, "loss": 1.3845, "mean_token_accuracy": 0.7418175086379051, "num_tokens": 657624221.0, "step": 9150 }, { "entropy": 0.9461548939347267, "epoch": 2.496593077132734, "grad_norm": 0.09553908556699753, "learning_rate": 9.634019849365463e-05, "loss": 1.3816, "mean_token_accuracy": 0.7410569325089454, "num_tokens": 658335159.0, "step": 9160 }, { "entropy": 0.9439819872379303, "epoch": 2.4993186154265468, "grad_norm": 0.1621396392583847, "learning_rate": 9.632890719819543e-05, "loss": 1.3771, "mean_token_accuracy": 0.7506534278392791, "num_tokens": 659067134.0, "step": 9170 }, { "entropy": 0.9528698980808258, "epoch": 2.5020441537203597, "grad_norm": 0.09267479181289673, "learning_rate": 9.631759917524582e-05, "loss": 1.3845, "mean_token_accuracy": 0.7421308100223541, "num_tokens": 659777107.0, "step": 9180 }, { "entropy": 0.9538725689053535, "epoch": 2.5047696920141727, "grad_norm": 0.09763748198747635, "learning_rate": 9.630627442888864e-05, "loss": 1.3961, "mean_token_accuracy": 0.7397515043616295, "num_tokens": 660488201.0, "step": 9190 }, { "entropy": 0.9516035065054893, "epoch": 2.5074952303079856, "grad_norm": 0.08752143383026123, "learning_rate": 9.629493296321284e-05, "loss": 1.3774, "mean_token_accuracy": 0.7428139641880989, "num_tokens": 661208951.0, "step": 9200 }, { "entropy": 0.958625254034996, "epoch": 2.510220768601799, "grad_norm": 0.11285807937383652, "learning_rate": 9.628357478231334e-05, "loss": 1.3825, "mean_token_accuracy": 0.7390116930007935, "num_tokens": 661922597.0, "step": 9210 }, { "entropy": 0.9498637214303016, "epoch": 2.512946306895612, "grad_norm": 0.10862982273101807, "learning_rate": 9.627219989029113e-05, "loss": 1.3894, "mean_token_accuracy": 0.7430294454097748, "num_tokens": 662631760.0, "step": 9220 }, { "entropy": 0.9558670163154602, "epoch": 2.515671845189425, "grad_norm": 0.09293710440397263, "learning_rate": 9.62608082912532e-05, "loss": 1.3845, "mean_token_accuracy": 0.7393468782305718, "num_tokens": 663334315.0, "step": 9230 }, { "entropy": 0.9459223300218582, "epoch": 2.518397383483238, "grad_norm": 0.11126852035522461, "learning_rate": 9.624939998931263e-05, "loss": 1.3843, "mean_token_accuracy": 0.7441275328397751, "num_tokens": 664053780.0, "step": 9240 }, { "entropy": 0.948776651918888, "epoch": 2.521122921777051, "grad_norm": 0.1200125515460968, "learning_rate": 9.623797498858846e-05, "loss": 1.3753, "mean_token_accuracy": 0.7464207157492637, "num_tokens": 664789320.0, "step": 9250 }, { "entropy": 0.9534156277775765, "epoch": 2.523848460070864, "grad_norm": 0.10603691637516022, "learning_rate": 9.622653329320583e-05, "loss": 1.383, "mean_token_accuracy": 0.7419575944542884, "num_tokens": 665512089.0, "step": 9260 }, { "entropy": 0.950544461607933, "epoch": 2.526573998364677, "grad_norm": 0.09827824681997299, "learning_rate": 9.621507490729585e-05, "loss": 1.3873, "mean_token_accuracy": 0.7419786721467971, "num_tokens": 666223704.0, "step": 9270 }, { "entropy": 0.9486217007040978, "epoch": 2.52929953665849, "grad_norm": 0.15562506020069122, "learning_rate": 9.620359983499568e-05, "loss": 1.3748, "mean_token_accuracy": 0.7466563552618026, "num_tokens": 666953383.0, "step": 9280 }, { "entropy": 0.9574059993028641, "epoch": 2.532025074952303, "grad_norm": 0.1290716677904129, "learning_rate": 9.619210808044851e-05, "loss": 1.3924, "mean_token_accuracy": 0.7437079384922981, "num_tokens": 667666243.0, "step": 9290 }, { "entropy": 0.9493744015693665, "epoch": 2.534750613246116, "grad_norm": 0.09293576329946518, "learning_rate": 9.618059964780354e-05, "loss": 1.3787, "mean_token_accuracy": 0.7413115292787552, "num_tokens": 668377955.0, "step": 9300 }, { "entropy": 0.9519496336579323, "epoch": 2.537476151539929, "grad_norm": 0.1295005977153778, "learning_rate": 9.6169074541216e-05, "loss": 1.3893, "mean_token_accuracy": 0.7420684978365898, "num_tokens": 669095589.0, "step": 9310 }, { "entropy": 0.9614164233207703, "epoch": 2.5402016898337423, "grad_norm": 0.10095058381557465, "learning_rate": 9.615753276484715e-05, "loss": 1.3885, "mean_token_accuracy": 0.7394142135977745, "num_tokens": 669800172.0, "step": 9320 }, { "entropy": 0.9443493977189064, "epoch": 2.5429272281275552, "grad_norm": 0.09708225727081299, "learning_rate": 9.614597432286425e-05, "loss": 1.3768, "mean_token_accuracy": 0.7487831532955169, "num_tokens": 670532131.0, "step": 9330 }, { "entropy": 0.954305274784565, "epoch": 2.545652766421368, "grad_norm": 0.08251254260540009, "learning_rate": 9.613439921944056e-05, "loss": 1.395, "mean_token_accuracy": 0.7416146233677864, "num_tokens": 671243931.0, "step": 9340 }, { "entropy": 0.9444291368126869, "epoch": 2.548378304715181, "grad_norm": 0.1446608603000641, "learning_rate": 9.612280745875543e-05, "loss": 1.3709, "mean_token_accuracy": 0.7403537198901177, "num_tokens": 671953439.0, "step": 9350 }, { "entropy": 0.9425195306539536, "epoch": 2.5511038430089945, "grad_norm": 0.11479167640209198, "learning_rate": 9.611119904499413e-05, "loss": 1.3803, "mean_token_accuracy": 0.744185908138752, "num_tokens": 672668357.0, "step": 9360 }, { "entropy": 0.9567700877785683, "epoch": 2.5538293813028075, "grad_norm": 0.09406740963459015, "learning_rate": 9.609957398234801e-05, "loss": 1.3844, "mean_token_accuracy": 0.7394072458148002, "num_tokens": 673379901.0, "step": 9370 }, { "entropy": 0.9458857789635658, "epoch": 2.5565549195966204, "grad_norm": 0.12724296748638153, "learning_rate": 9.608793227501442e-05, "loss": 1.3831, "mean_token_accuracy": 0.7463359922170639, "num_tokens": 674105083.0, "step": 9380 }, { "entropy": 0.9527260407805442, "epoch": 2.5592804578904333, "grad_norm": 0.08779218792915344, "learning_rate": 9.607627392719669e-05, "loss": 1.3894, "mean_token_accuracy": 0.7400561019778251, "num_tokens": 674812501.0, "step": 9390 }, { "entropy": 0.9508476212620736, "epoch": 2.5620059961842463, "grad_norm": 0.11054495722055435, "learning_rate": 9.606459894310416e-05, "loss": 1.3747, "mean_token_accuracy": 0.7446539625525475, "num_tokens": 675537383.0, "step": 9400 }, { "entropy": 0.9514044508337974, "epoch": 2.5647315344780592, "grad_norm": 0.10721174627542496, "learning_rate": 9.605290732695223e-05, "loss": 1.3841, "mean_token_accuracy": 0.7457584992051125, "num_tokens": 676269799.0, "step": 9410 }, { "entropy": 0.9455446422100067, "epoch": 2.567457072771872, "grad_norm": 0.13902905583381653, "learning_rate": 9.604119908296226e-05, "loss": 1.3803, "mean_token_accuracy": 0.7467570066452026, "num_tokens": 676984727.0, "step": 9420 }, { "entropy": 0.9542788952589035, "epoch": 2.5701826110656856, "grad_norm": 0.09337563067674637, "learning_rate": 9.60294742153616e-05, "loss": 1.377, "mean_token_accuracy": 0.7402194425463676, "num_tokens": 677701384.0, "step": 9430 }, { "entropy": 0.9549151852726936, "epoch": 2.5729081493594985, "grad_norm": 0.09679771959781647, "learning_rate": 9.601773272838364e-05, "loss": 1.3864, "mean_token_accuracy": 0.744145430624485, "num_tokens": 678428010.0, "step": 9440 }, { "entropy": 0.9494045555591584, "epoch": 2.5756336876533115, "grad_norm": 0.09665834158658981, "learning_rate": 9.600597462626775e-05, "loss": 1.3814, "mean_token_accuracy": 0.7428949892520904, "num_tokens": 679150837.0, "step": 9450 }, { "entropy": 0.9528696566820145, "epoch": 2.5783592259471244, "grad_norm": 0.12176550924777985, "learning_rate": 9.599419991325933e-05, "loss": 1.3822, "mean_token_accuracy": 0.7424042224884033, "num_tokens": 679871972.0, "step": 9460 }, { "entropy": 0.9489214882254601, "epoch": 2.581084764240938, "grad_norm": 0.1010860800743103, "learning_rate": 9.598240859360972e-05, "loss": 1.3821, "mean_token_accuracy": 0.7403257504105568, "num_tokens": 680571890.0, "step": 9470 }, { "entropy": 0.949827016890049, "epoch": 2.5838103025347507, "grad_norm": 0.08193811774253845, "learning_rate": 9.597060067157629e-05, "loss": 1.3939, "mean_token_accuracy": 0.7420325294137001, "num_tokens": 681290271.0, "step": 9480 }, { "entropy": 0.9546469509601593, "epoch": 2.5865358408285637, "grad_norm": 0.1042378768324852, "learning_rate": 9.595877615142241e-05, "loss": 1.3878, "mean_token_accuracy": 0.7438606515526771, "num_tokens": 682005765.0, "step": 9490 }, { "entropy": 0.9530891895294189, "epoch": 2.5892613791223766, "grad_norm": 0.09580600261688232, "learning_rate": 9.594693503741745e-05, "loss": 1.3861, "mean_token_accuracy": 0.7394726812839508, "num_tokens": 682706989.0, "step": 9500 }, { "entropy": 0.9467429131269455, "epoch": 2.5919869174161896, "grad_norm": 0.08970653265714645, "learning_rate": 9.593507733383673e-05, "loss": 1.3879, "mean_token_accuracy": 0.7434066340327263, "num_tokens": 683420796.0, "step": 9510 }, { "entropy": 0.9422464728355407, "epoch": 2.5947124557100025, "grad_norm": 0.10844879597425461, "learning_rate": 9.592320304496159e-05, "loss": 1.3745, "mean_token_accuracy": 0.7470636069774628, "num_tokens": 684155827.0, "step": 9520 }, { "entropy": 0.9513745456933975, "epoch": 2.597437994003816, "grad_norm": 0.09567851573228836, "learning_rate": 9.591131217507938e-05, "loss": 1.385, "mean_token_accuracy": 0.7429541811347008, "num_tokens": 684872588.0, "step": 9530 }, { "entropy": 0.9407967448234558, "epoch": 2.600163532297629, "grad_norm": 0.11687707901000977, "learning_rate": 9.589940472848338e-05, "loss": 1.3779, "mean_token_accuracy": 0.7470522150397301, "num_tokens": 685600844.0, "step": 9540 }, { "entropy": 0.9530697196722031, "epoch": 2.602889070591442, "grad_norm": 0.10524759441614151, "learning_rate": 9.588748070947289e-05, "loss": 1.3895, "mean_token_accuracy": 0.7454262211918831, "num_tokens": 686340335.0, "step": 9550 }, { "entropy": 0.9604225113987923, "epoch": 2.6056146088852548, "grad_norm": 0.1046706959605217, "learning_rate": 9.58755401223532e-05, "loss": 1.3918, "mean_token_accuracy": 0.7387133181095124, "num_tokens": 687044113.0, "step": 9560 }, { "entropy": 0.9585466727614402, "epoch": 2.6083401471790677, "grad_norm": 0.09597111493349075, "learning_rate": 9.586358297143558e-05, "loss": 1.3922, "mean_token_accuracy": 0.7404394149780273, "num_tokens": 687757839.0, "step": 9570 }, { "entropy": 0.9465219035744667, "epoch": 2.611065685472881, "grad_norm": 0.368947833776474, "learning_rate": 9.585160926103727e-05, "loss": 1.3909, "mean_token_accuracy": 0.7451237291097641, "num_tokens": 688480525.0, "step": 9580 }, { "entropy": 0.9518843427300453, "epoch": 2.613791223766694, "grad_norm": 0.09533551335334778, "learning_rate": 9.583961899548149e-05, "loss": 1.377, "mean_token_accuracy": 0.7444559141993523, "num_tokens": 689211956.0, "step": 9590 }, { "entropy": 0.9531243652105331, "epoch": 2.616516762060507, "grad_norm": 0.18116629123687744, "learning_rate": 9.582761217909742e-05, "loss": 1.3839, "mean_token_accuracy": 0.7390112906694413, "num_tokens": 689925357.0, "step": 9600 }, { "entropy": 0.9519005209207535, "epoch": 2.61924230035432, "grad_norm": 0.11106158792972565, "learning_rate": 9.581558881622023e-05, "loss": 1.3803, "mean_token_accuracy": 0.7452313512563705, "num_tokens": 690648163.0, "step": 9610 }, { "entropy": 0.9523310184478759, "epoch": 2.621967838648133, "grad_norm": 0.11411701887845993, "learning_rate": 9.580354891119111e-05, "loss": 1.3932, "mean_token_accuracy": 0.741227887570858, "num_tokens": 691368788.0, "step": 9620 }, { "entropy": 0.9491930544376374, "epoch": 2.624693376941946, "grad_norm": 0.10222488641738892, "learning_rate": 9.579149246835714e-05, "loss": 1.3753, "mean_token_accuracy": 0.744267588853836, "num_tokens": 692098494.0, "step": 9630 }, { "entropy": 0.9463312938809395, "epoch": 2.627418915235759, "grad_norm": 0.10576868802309036, "learning_rate": 9.577941949207146e-05, "loss": 1.3765, "mean_token_accuracy": 0.7458298191428184, "num_tokens": 692828764.0, "step": 9640 }, { "entropy": 0.9565997913479805, "epoch": 2.630144453529572, "grad_norm": 0.10648185014724731, "learning_rate": 9.576732998669309e-05, "loss": 1.3922, "mean_token_accuracy": 0.7440996661782264, "num_tokens": 693536417.0, "step": 9650 }, { "entropy": 0.952058082818985, "epoch": 2.632869991823385, "grad_norm": 0.09439050406217575, "learning_rate": 9.575522395658707e-05, "loss": 1.3861, "mean_token_accuracy": 0.7394286692142487, "num_tokens": 694243626.0, "step": 9660 }, { "entropy": 0.953196357190609, "epoch": 2.635595530117198, "grad_norm": 0.11707699298858643, "learning_rate": 9.574310140612442e-05, "loss": 1.3827, "mean_token_accuracy": 0.7434344187378883, "num_tokens": 694968647.0, "step": 9670 }, { "entropy": 0.939579950273037, "epoch": 2.6383210684110114, "grad_norm": 0.2158738225698471, "learning_rate": 9.573096233968206e-05, "loss": 1.3704, "mean_token_accuracy": 0.7507406219840049, "num_tokens": 695704102.0, "step": 9680 }, { "entropy": 0.9536104574799538, "epoch": 2.6410466067048244, "grad_norm": 0.13156963884830475, "learning_rate": 9.571880676164293e-05, "loss": 1.3835, "mean_token_accuracy": 0.7448409900069237, "num_tokens": 696426806.0, "step": 9690 }, { "entropy": 0.9547406882047653, "epoch": 2.6437721449986373, "grad_norm": 0.09959427267313004, "learning_rate": 9.570663467639595e-05, "loss": 1.384, "mean_token_accuracy": 0.7404066026210785, "num_tokens": 697150365.0, "step": 9700 }, { "entropy": 0.9502587810158729, "epoch": 2.6464976832924503, "grad_norm": 0.0893438532948494, "learning_rate": 9.569444608833593e-05, "loss": 1.3832, "mean_token_accuracy": 0.7417907059192658, "num_tokens": 697864829.0, "step": 9710 }, { "entropy": 0.9574382051825523, "epoch": 2.649223221586263, "grad_norm": 0.12412620335817337, "learning_rate": 9.568224100186368e-05, "loss": 1.3926, "mean_token_accuracy": 0.7443241059780121, "num_tokens": 698593171.0, "step": 9720 }, { "entropy": 0.9479583531618119, "epoch": 2.651948759880076, "grad_norm": 0.09614630043506622, "learning_rate": 9.567001942138596e-05, "loss": 1.377, "mean_token_accuracy": 0.7478373780846596, "num_tokens": 699328705.0, "step": 9730 }, { "entropy": 0.9494291916489601, "epoch": 2.654674298173889, "grad_norm": 0.21806296706199646, "learning_rate": 9.565778135131551e-05, "loss": 1.3889, "mean_token_accuracy": 0.7439940094947814, "num_tokens": 700046182.0, "step": 9740 }, { "entropy": 0.9508288979530335, "epoch": 2.6573998364677025, "grad_norm": 0.09569336473941803, "learning_rate": 9.5645526796071e-05, "loss": 1.3844, "mean_token_accuracy": 0.7418312415480613, "num_tokens": 700756359.0, "step": 9750 }, { "entropy": 0.9505010828375816, "epoch": 2.6601253747615154, "grad_norm": 0.0998583659529686, "learning_rate": 9.563325576007701e-05, "loss": 1.379, "mean_token_accuracy": 0.7458802133798599, "num_tokens": 701477494.0, "step": 9760 }, { "entropy": 0.9552866011857987, "epoch": 2.6628509130553284, "grad_norm": 0.14993654191493988, "learning_rate": 9.562096824776416e-05, "loss": 1.3876, "mean_token_accuracy": 0.7408042192459107, "num_tokens": 702194293.0, "step": 9770 }, { "entropy": 0.9506648227572441, "epoch": 2.6655764513491413, "grad_norm": 0.09288034588098526, "learning_rate": 9.560866426356894e-05, "loss": 1.3854, "mean_token_accuracy": 0.7435394883155823, "num_tokens": 702911966.0, "step": 9780 }, { "entropy": 0.9530773386359215, "epoch": 2.6683019896429547, "grad_norm": 0.1780327409505844, "learning_rate": 9.559634381193385e-05, "loss": 1.384, "mean_token_accuracy": 0.7413442313671113, "num_tokens": 703621324.0, "step": 9790 }, { "entropy": 0.9432814002037049, "epoch": 2.6710275279367677, "grad_norm": 0.08851876109838486, "learning_rate": 9.558400689730728e-05, "loss": 1.3716, "mean_token_accuracy": 0.7464269071817398, "num_tokens": 704353647.0, "step": 9800 }, { "entropy": 0.950922329723835, "epoch": 2.6737530662305806, "grad_norm": 0.08739480376243591, "learning_rate": 9.557165352414361e-05, "loss": 1.3777, "mean_token_accuracy": 0.7431806236505508, "num_tokens": 705083830.0, "step": 9810 }, { "entropy": 0.9586237475275994, "epoch": 2.6764786045243936, "grad_norm": 0.11277187615633011, "learning_rate": 9.555928369690313e-05, "loss": 1.3908, "mean_token_accuracy": 0.7428459405899048, "num_tokens": 705800066.0, "step": 9820 }, { "entropy": 0.9557994589209556, "epoch": 2.6792041428182065, "grad_norm": 0.08675989508628845, "learning_rate": 9.554689742005209e-05, "loss": 1.3898, "mean_token_accuracy": 0.7398327201604843, "num_tokens": 706506042.0, "step": 9830 }, { "entropy": 0.94582679271698, "epoch": 2.6819296811120195, "grad_norm": 0.2761112153530121, "learning_rate": 9.553449469806266e-05, "loss": 1.3735, "mean_token_accuracy": 0.744458457827568, "num_tokens": 707234275.0, "step": 9840 }, { "entropy": 0.9533609345555305, "epoch": 2.6846552194058324, "grad_norm": 0.15056166052818298, "learning_rate": 9.552207553541296e-05, "loss": 1.3905, "mean_token_accuracy": 0.7413505062460899, "num_tokens": 707939097.0, "step": 9850 }, { "entropy": 0.9512269735336304, "epoch": 2.687380757699646, "grad_norm": 0.10775098949670792, "learning_rate": 9.550963993658708e-05, "loss": 1.3877, "mean_token_accuracy": 0.7441338151693344, "num_tokens": 708662822.0, "step": 9860 }, { "entropy": 0.9576830640435219, "epoch": 2.6901062959934587, "grad_norm": 0.10758344829082489, "learning_rate": 9.549718790607497e-05, "loss": 1.3862, "mean_token_accuracy": 0.7405988663434983, "num_tokens": 709385510.0, "step": 9870 }, { "entropy": 0.9462365791201591, "epoch": 2.6928318342872717, "grad_norm": 0.16311097145080566, "learning_rate": 9.548471944837258e-05, "loss": 1.3817, "mean_token_accuracy": 0.7423205584287643, "num_tokens": 710088991.0, "step": 9880 }, { "entropy": 0.9475960016250611, "epoch": 2.6955573725810846, "grad_norm": 0.09887238591909409, "learning_rate": 9.547223456798175e-05, "loss": 1.3742, "mean_token_accuracy": 0.7462312802672386, "num_tokens": 710812777.0, "step": 9890 }, { "entropy": 0.9553654506802559, "epoch": 2.698282910874898, "grad_norm": 0.14105680584907532, "learning_rate": 9.545973326941026e-05, "loss": 1.3856, "mean_token_accuracy": 0.7394596874713898, "num_tokens": 711522164.0, "step": 9900 }, { "entropy": 0.9541070491075516, "epoch": 2.701008449168711, "grad_norm": 0.10180029273033142, "learning_rate": 9.544721555717183e-05, "loss": 1.3819, "mean_token_accuracy": 0.7387867987155914, "num_tokens": 712232297.0, "step": 9910 }, { "entropy": 0.9523576036095619, "epoch": 2.703733987462524, "grad_norm": 0.11639035493135452, "learning_rate": 9.543468143578612e-05, "loss": 1.3852, "mean_token_accuracy": 0.741235437989235, "num_tokens": 712955332.0, "step": 9920 }, { "entropy": 0.9462679713964463, "epoch": 2.706459525756337, "grad_norm": 0.11618001013994217, "learning_rate": 9.542213090977865e-05, "loss": 1.381, "mean_token_accuracy": 0.7462039306759835, "num_tokens": 713679744.0, "step": 9930 }, { "entropy": 0.9466747432947159, "epoch": 2.70918506405015, "grad_norm": 0.13665929436683655, "learning_rate": 9.540956398368093e-05, "loss": 1.3846, "mean_token_accuracy": 0.7379218608140945, "num_tokens": 714380213.0, "step": 9940 }, { "entropy": 0.948689442873001, "epoch": 2.7119106023439628, "grad_norm": 0.09547930210828781, "learning_rate": 9.539698066203036e-05, "loss": 1.3867, "mean_token_accuracy": 0.7462014019489288, "num_tokens": 715100473.0, "step": 9950 }, { "entropy": 0.9547126933932304, "epoch": 2.7146361406377757, "grad_norm": 0.4112579822540283, "learning_rate": 9.538438094937028e-05, "loss": 1.3794, "mean_token_accuracy": 0.7413916006684304, "num_tokens": 715814075.0, "step": 9960 }, { "entropy": 0.9566810131072998, "epoch": 2.717361678931589, "grad_norm": 0.12511007487773895, "learning_rate": 9.537176485024993e-05, "loss": 1.3916, "mean_token_accuracy": 0.7371821865439415, "num_tokens": 716518360.0, "step": 9970 }, { "entropy": 0.9447938576340675, "epoch": 2.720087217225402, "grad_norm": 0.09474101662635803, "learning_rate": 9.535913236922447e-05, "loss": 1.3746, "mean_token_accuracy": 0.7438409894704818, "num_tokens": 717242082.0, "step": 9980 }, { "entropy": 0.9429836019873619, "epoch": 2.722812755519215, "grad_norm": 0.10164990276098251, "learning_rate": 9.534648351085498e-05, "loss": 1.3712, "mean_token_accuracy": 0.748205628991127, "num_tokens": 717970750.0, "step": 9990 }, { "entropy": 0.9465658456087113, "epoch": 2.725538293813028, "grad_norm": 0.09238191694021225, "learning_rate": 9.533381827970844e-05, "loss": 1.3776, "mean_token_accuracy": 0.7437403619289398, "num_tokens": 718692172.0, "step": 10000 }, { "entropy": 0.9468672856688499, "epoch": 2.7282638321068413, "grad_norm": 0.09535587579011917, "learning_rate": 9.532113668035776e-05, "loss": 1.3827, "mean_token_accuracy": 0.7401351481676102, "num_tokens": 719398745.0, "step": 10010 }, { "entropy": 0.9498398303985596, "epoch": 2.7309893704006543, "grad_norm": 0.09753476083278656, "learning_rate": 9.530843871738175e-05, "loss": 1.375, "mean_token_accuracy": 0.7446337208151818, "num_tokens": 720130026.0, "step": 10020 }, { "entropy": 0.9583035558462143, "epoch": 2.733714908694467, "grad_norm": 0.10755791515111923, "learning_rate": 9.529572439536513e-05, "loss": 1.3865, "mean_token_accuracy": 0.7396931052207947, "num_tokens": 720845902.0, "step": 10030 }, { "entropy": 0.9478771984577179, "epoch": 2.73644044698828, "grad_norm": 0.10072796791791916, "learning_rate": 9.528299371889855e-05, "loss": 1.3793, "mean_token_accuracy": 0.7432537838816643, "num_tokens": 721553882.0, "step": 10040 }, { "entropy": 0.9405006676912308, "epoch": 2.739165985282093, "grad_norm": 0.10096089541912079, "learning_rate": 9.527024669257849e-05, "loss": 1.3742, "mean_token_accuracy": 0.7456749126315116, "num_tokens": 722267845.0, "step": 10050 }, { "entropy": 0.9401244565844535, "epoch": 2.741891523575906, "grad_norm": 0.12743054330348969, "learning_rate": 9.525748332100743e-05, "loss": 1.3716, "mean_token_accuracy": 0.747305279970169, "num_tokens": 722988514.0, "step": 10060 }, { "entropy": 0.9473287984728813, "epoch": 2.7446170618697194, "grad_norm": 0.09784083813428879, "learning_rate": 9.524470360879368e-05, "loss": 1.385, "mean_token_accuracy": 0.744572938978672, "num_tokens": 723702201.0, "step": 10070 }, { "entropy": 0.949025246500969, "epoch": 2.7473426001635324, "grad_norm": 0.10419026017189026, "learning_rate": 9.523190756055147e-05, "loss": 1.3806, "mean_token_accuracy": 0.7432950124144554, "num_tokens": 724418507.0, "step": 10080 }, { "entropy": 0.9548242285847663, "epoch": 2.7500681384573453, "grad_norm": 0.1104128360748291, "learning_rate": 9.521909518090096e-05, "loss": 1.3944, "mean_token_accuracy": 0.7405140653252602, "num_tokens": 725119968.0, "step": 10090 }, { "entropy": 0.9464596956968307, "epoch": 2.7527936767511583, "grad_norm": 0.11928076297044754, "learning_rate": 9.520626647446818e-05, "loss": 1.3753, "mean_token_accuracy": 0.7412620186805725, "num_tokens": 725828274.0, "step": 10100 }, { "entropy": 0.9500831842422486, "epoch": 2.7555192150449717, "grad_norm": 0.08352699130773544, "learning_rate": 9.519342144588503e-05, "loss": 1.384, "mean_token_accuracy": 0.7443070754408836, "num_tokens": 726551641.0, "step": 10110 }, { "entropy": 0.9436436563730239, "epoch": 2.7582447533387846, "grad_norm": 0.0821971595287323, "learning_rate": 9.518056009978935e-05, "loss": 1.3717, "mean_token_accuracy": 0.7473061949014663, "num_tokens": 727282712.0, "step": 10120 }, { "entropy": 0.947759947180748, "epoch": 2.7609702916325976, "grad_norm": 0.09341433644294739, "learning_rate": 9.516768244082486e-05, "loss": 1.3953, "mean_token_accuracy": 0.7413911446928978, "num_tokens": 727987467.0, "step": 10130 }, { "entropy": 0.951104485988617, "epoch": 2.7636958299264105, "grad_norm": 0.08259022235870361, "learning_rate": 9.515478847364112e-05, "loss": 1.3734, "mean_token_accuracy": 0.7434945836663246, "num_tokens": 728712517.0, "step": 10140 }, { "entropy": 0.9454701945185662, "epoch": 2.7664213682202234, "grad_norm": 0.09898059070110321, "learning_rate": 9.514187820289367e-05, "loss": 1.379, "mean_token_accuracy": 0.7465288504958153, "num_tokens": 729438650.0, "step": 10150 }, { "entropy": 0.9487116679549217, "epoch": 2.7691469065140364, "grad_norm": 0.12520450353622437, "learning_rate": 9.512895163324383e-05, "loss": 1.3811, "mean_token_accuracy": 0.7442427203059196, "num_tokens": 730157457.0, "step": 10160 }, { "entropy": 0.9486458107829094, "epoch": 2.7718724448078493, "grad_norm": 0.13923697173595428, "learning_rate": 9.511600876935891e-05, "loss": 1.3778, "mean_token_accuracy": 0.7460005581378937, "num_tokens": 730880143.0, "step": 10170 }, { "entropy": 0.9487900391221047, "epoch": 2.7745979831016627, "grad_norm": 0.10820474475622177, "learning_rate": 9.510304961591203e-05, "loss": 1.3767, "mean_token_accuracy": 0.7412540033459664, "num_tokens": 731596819.0, "step": 10180 }, { "entropy": 0.9560275942087173, "epoch": 2.7773235213954757, "grad_norm": 0.10454489290714264, "learning_rate": 9.509007417758222e-05, "loss": 1.389, "mean_token_accuracy": 0.7426157101988793, "num_tokens": 732324778.0, "step": 10190 }, { "entropy": 0.9486469194293022, "epoch": 2.7800490596892886, "grad_norm": 0.18831004202365875, "learning_rate": 9.50770824590544e-05, "loss": 1.3813, "mean_token_accuracy": 0.7447981432080268, "num_tokens": 733047659.0, "step": 10200 }, { "entropy": 0.9435642853379249, "epoch": 2.7827745979831016, "grad_norm": 0.14489497244358063, "learning_rate": 9.50640744650193e-05, "loss": 1.3731, "mean_token_accuracy": 0.7452139586210251, "num_tokens": 733775297.0, "step": 10210 }, { "entropy": 0.9443108022212983, "epoch": 2.785500136276915, "grad_norm": 0.17383357882499695, "learning_rate": 9.505105020017364e-05, "loss": 1.3758, "mean_token_accuracy": 0.7443449541926384, "num_tokens": 734498209.0, "step": 10220 }, { "entropy": 0.9533507496118545, "epoch": 2.788225674570728, "grad_norm": 0.12784239649772644, "learning_rate": 9.503800966921993e-05, "loss": 1.3855, "mean_token_accuracy": 0.7430297493934631, "num_tokens": 735211652.0, "step": 10230 }, { "entropy": 0.9407243207097054, "epoch": 2.790951212864541, "grad_norm": 0.24755477905273438, "learning_rate": 9.502495287686657e-05, "loss": 1.3791, "mean_token_accuracy": 0.7442964062094688, "num_tokens": 735920070.0, "step": 10240 }, { "entropy": 0.9450778156518936, "epoch": 2.793676751158354, "grad_norm": 0.13384370505809784, "learning_rate": 9.501187982782785e-05, "loss": 1.3728, "mean_token_accuracy": 0.741634002327919, "num_tokens": 736627988.0, "step": 10250 }, { "entropy": 0.943241237103939, "epoch": 2.7964022894521667, "grad_norm": 0.09825392812490463, "learning_rate": 9.499879052682392e-05, "loss": 1.3785, "mean_token_accuracy": 0.7429873079061509, "num_tokens": 737338990.0, "step": 10260 }, { "entropy": 0.9448518842458725, "epoch": 2.7991278277459797, "grad_norm": 0.09042879939079285, "learning_rate": 9.498568497858079e-05, "loss": 1.3715, "mean_token_accuracy": 0.7506170704960823, "num_tokens": 738080465.0, "step": 10270 }, { "entropy": 0.9608897134661675, "epoch": 2.8018533660397926, "grad_norm": 0.09758147597312927, "learning_rate": 9.497256318783033e-05, "loss": 1.3893, "mean_token_accuracy": 0.7390094771981239, "num_tokens": 738792587.0, "step": 10280 }, { "entropy": 0.9479752659797669, "epoch": 2.804578904333606, "grad_norm": 0.12299107015132904, "learning_rate": 9.495942515931032e-05, "loss": 1.3758, "mean_token_accuracy": 0.7490738824009895, "num_tokens": 739524633.0, "step": 10290 }, { "entropy": 0.9539648801088333, "epoch": 2.807304442627419, "grad_norm": 0.09575517475605011, "learning_rate": 9.494627089776431e-05, "loss": 1.3843, "mean_token_accuracy": 0.7454695031046867, "num_tokens": 740252573.0, "step": 10300 }, { "entropy": 0.9500061124563217, "epoch": 2.810029980921232, "grad_norm": 0.11410588026046753, "learning_rate": 9.493310040794183e-05, "loss": 1.3912, "mean_token_accuracy": 0.7406770437955856, "num_tokens": 740963929.0, "step": 10310 }, { "entropy": 0.9521198511123657, "epoch": 2.812755519215045, "grad_norm": 0.09219717234373093, "learning_rate": 9.49199136945982e-05, "loss": 1.3793, "mean_token_accuracy": 0.7472849547863006, "num_tokens": 741697463.0, "step": 10320 }, { "entropy": 0.9477602332830429, "epoch": 2.8154810575088582, "grad_norm": 0.09398355334997177, "learning_rate": 9.490671076249458e-05, "loss": 1.3856, "mean_token_accuracy": 0.7394422218203545, "num_tokens": 742393454.0, "step": 10330 }, { "entropy": 0.9538507401943207, "epoch": 2.818206595802671, "grad_norm": 0.09424974024295807, "learning_rate": 9.489349161639805e-05, "loss": 1.3872, "mean_token_accuracy": 0.7407204285264015, "num_tokens": 743096713.0, "step": 10340 }, { "entropy": 0.9477018043398857, "epoch": 2.820932134096484, "grad_norm": 0.09561866521835327, "learning_rate": 9.488025626108147e-05, "loss": 1.379, "mean_token_accuracy": 0.74570182710886, "num_tokens": 743826659.0, "step": 10350 }, { "entropy": 0.9481017872691154, "epoch": 2.823657672390297, "grad_norm": 0.0974368155002594, "learning_rate": 9.486700470132361e-05, "loss": 1.3836, "mean_token_accuracy": 0.739516082406044, "num_tokens": 744532914.0, "step": 10360 }, { "entropy": 0.9480232343077659, "epoch": 2.82638321068411, "grad_norm": 0.12688322365283966, "learning_rate": 9.485373694190909e-05, "loss": 1.3805, "mean_token_accuracy": 0.7399832800030708, "num_tokens": 745248229.0, "step": 10370 }, { "entropy": 0.9455208957195282, "epoch": 2.829108748977923, "grad_norm": 0.1293535977602005, "learning_rate": 9.484045298762832e-05, "loss": 1.3767, "mean_token_accuracy": 0.744144344329834, "num_tokens": 745971792.0, "step": 10380 }, { "entropy": 0.9517705485224723, "epoch": 2.831834287271736, "grad_norm": 0.18343980610370636, "learning_rate": 9.482715284327762e-05, "loss": 1.3861, "mean_token_accuracy": 0.7427744567394257, "num_tokens": 746698383.0, "step": 10390 }, { "entropy": 0.9489703759551048, "epoch": 2.8345598255655493, "grad_norm": 0.09908950328826904, "learning_rate": 9.481383651365912e-05, "loss": 1.3823, "mean_token_accuracy": 0.7413738742470741, "num_tokens": 747420536.0, "step": 10400 }, { "entropy": 0.9515311121940613, "epoch": 2.8372853638593623, "grad_norm": 0.10469796508550644, "learning_rate": 9.480050400358083e-05, "loss": 1.3776, "mean_token_accuracy": 0.7367751017212868, "num_tokens": 748120021.0, "step": 10410 }, { "entropy": 0.9512437969446182, "epoch": 2.840010902153175, "grad_norm": 0.11225511133670807, "learning_rate": 9.478715531785657e-05, "loss": 1.3863, "mean_token_accuracy": 0.7434330567717552, "num_tokens": 748836539.0, "step": 10420 }, { "entropy": 0.9515815705060959, "epoch": 2.842736440446988, "grad_norm": 0.09097540378570557, "learning_rate": 9.477379046130598e-05, "loss": 1.3875, "mean_token_accuracy": 0.7462526351213455, "num_tokens": 749561315.0, "step": 10430 }, { "entropy": 0.9418442562222481, "epoch": 2.8454619787408015, "grad_norm": 0.10939962416887283, "learning_rate": 9.476040943875462e-05, "loss": 1.3744, "mean_token_accuracy": 0.7481460407376289, "num_tokens": 750278805.0, "step": 10440 }, { "entropy": 0.9443031251430511, "epoch": 2.8481875170346145, "grad_norm": 0.09361743181943893, "learning_rate": 9.474701225503381e-05, "loss": 1.3746, "mean_token_accuracy": 0.7502325609326362, "num_tokens": 751024327.0, "step": 10450 }, { "entropy": 0.9572816222906113, "epoch": 2.8509130553284274, "grad_norm": 0.0918792262673378, "learning_rate": 9.473359891498071e-05, "loss": 1.3801, "mean_token_accuracy": 0.7418233335018158, "num_tokens": 751749132.0, "step": 10460 }, { "entropy": 0.9410624951124191, "epoch": 2.8536385936222404, "grad_norm": 0.09585850685834885, "learning_rate": 9.472016942343836e-05, "loss": 1.3802, "mean_token_accuracy": 0.7431176856160164, "num_tokens": 752454813.0, "step": 10470 }, { "entropy": 0.9494479656219482, "epoch": 2.8563641319160533, "grad_norm": 0.10246778279542923, "learning_rate": 9.470672378525559e-05, "loss": 1.3788, "mean_token_accuracy": 0.7460354894399643, "num_tokens": 753182182.0, "step": 10480 }, { "entropy": 0.9505635082721711, "epoch": 2.8590896702098663, "grad_norm": 0.1411740630865097, "learning_rate": 9.469326200528709e-05, "loss": 1.3752, "mean_token_accuracy": 0.7432245314121246, "num_tokens": 753909834.0, "step": 10490 }, { "entropy": 0.9416063576936722, "epoch": 2.861815208503679, "grad_norm": 0.11739660799503326, "learning_rate": 9.467978408839335e-05, "loss": 1.3799, "mean_token_accuracy": 0.743518528342247, "num_tokens": 754614566.0, "step": 10500 }, { "entropy": 0.9634650573134422, "epoch": 2.8645407467974926, "grad_norm": 0.15798868238925934, "learning_rate": 9.46662900394407e-05, "loss": 1.3984, "mean_token_accuracy": 0.7380047783255577, "num_tokens": 755318065.0, "step": 10510 }, { "entropy": 0.943720032274723, "epoch": 2.8672662850913055, "grad_norm": 0.12477879971265793, "learning_rate": 9.46527798633013e-05, "loss": 1.3745, "mean_token_accuracy": 0.7484955221414566, "num_tokens": 756047541.0, "step": 10520 }, { "entropy": 0.9561996191740036, "epoch": 2.8699918233851185, "grad_norm": 0.10567452013492584, "learning_rate": 9.463925356485313e-05, "loss": 1.3872, "mean_token_accuracy": 0.7468387603759765, "num_tokens": 756779859.0, "step": 10530 }, { "entropy": 0.9433674648404121, "epoch": 2.8727173616789314, "grad_norm": 0.12189490348100662, "learning_rate": 9.462571114897998e-05, "loss": 1.3747, "mean_token_accuracy": 0.7466014489531517, "num_tokens": 757506757.0, "step": 10540 }, { "entropy": 0.9495260760188102, "epoch": 2.875442899972745, "grad_norm": 0.10370657593011856, "learning_rate": 9.461215262057146e-05, "loss": 1.382, "mean_token_accuracy": 0.7441823378205299, "num_tokens": 758236473.0, "step": 10550 }, { "entropy": 0.9483583778142929, "epoch": 2.8781684382665578, "grad_norm": 0.12287358194589615, "learning_rate": 9.459857798452303e-05, "loss": 1.3771, "mean_token_accuracy": 0.7479981765151024, "num_tokens": 758966654.0, "step": 10560 }, { "entropy": 0.9491520434617996, "epoch": 2.8808939765603707, "grad_norm": 0.08995507657527924, "learning_rate": 9.458498724573591e-05, "loss": 1.3908, "mean_token_accuracy": 0.7430084392428398, "num_tokens": 759678929.0, "step": 10570 }, { "entropy": 0.9527735188603401, "epoch": 2.8836195148541837, "grad_norm": 0.1153775081038475, "learning_rate": 9.45713804091172e-05, "loss": 1.3872, "mean_token_accuracy": 0.7407803103327751, "num_tokens": 760381545.0, "step": 10580 }, { "entropy": 0.9517191231250763, "epoch": 2.8863450531479966, "grad_norm": 0.10239632427692413, "learning_rate": 9.455775747957973e-05, "loss": 1.3807, "mean_token_accuracy": 0.7425818264484405, "num_tokens": 761101701.0, "step": 10590 }, { "entropy": 0.9448929950594902, "epoch": 2.8890705914418096, "grad_norm": 0.2964629530906677, "learning_rate": 9.454411846204224e-05, "loss": 1.3881, "mean_token_accuracy": 0.7405307441949844, "num_tokens": 761802896.0, "step": 10600 }, { "entropy": 0.9530297860503196, "epoch": 2.891796129735623, "grad_norm": 0.14000527560710907, "learning_rate": 9.45304633614292e-05, "loss": 1.3876, "mean_token_accuracy": 0.7408836930990219, "num_tokens": 762524473.0, "step": 10610 }, { "entropy": 0.9478141114115715, "epoch": 2.894521668029436, "grad_norm": 0.11951442807912827, "learning_rate": 9.451679218267092e-05, "loss": 1.3801, "mean_token_accuracy": 0.7429118230938911, "num_tokens": 763232538.0, "step": 10620 }, { "entropy": 0.9559646502137185, "epoch": 2.897247206323249, "grad_norm": 0.09150029718875885, "learning_rate": 9.450310493070349e-05, "loss": 1.3882, "mean_token_accuracy": 0.7428459390997887, "num_tokens": 763954109.0, "step": 10630 }, { "entropy": 0.9576432898640632, "epoch": 2.899972744617062, "grad_norm": 0.11356475949287415, "learning_rate": 9.448940161046884e-05, "loss": 1.3928, "mean_token_accuracy": 0.7371211186051368, "num_tokens": 764670941.0, "step": 10640 }, { "entropy": 0.9471401020884513, "epoch": 2.902698282910875, "grad_norm": 0.09661433845758438, "learning_rate": 9.447568222691467e-05, "loss": 1.3802, "mean_token_accuracy": 0.7479994982481003, "num_tokens": 765398023.0, "step": 10650 }, { "entropy": 0.9421188428997993, "epoch": 2.905423821204688, "grad_norm": 0.09525974839925766, "learning_rate": 9.446194678499451e-05, "loss": 1.3724, "mean_token_accuracy": 0.7448062315583229, "num_tokens": 766103654.0, "step": 10660 }, { "entropy": 0.9504467383027076, "epoch": 2.908149359498501, "grad_norm": 0.07963963598012924, "learning_rate": 9.444819528966766e-05, "loss": 1.3795, "mean_token_accuracy": 0.7468686282634736, "num_tokens": 766838816.0, "step": 10670 }, { "entropy": 0.9504798486828804, "epoch": 2.910874897792314, "grad_norm": 0.12807469069957733, "learning_rate": 9.443442774589925e-05, "loss": 1.3799, "mean_token_accuracy": 0.744924345612526, "num_tokens": 767564829.0, "step": 10680 }, { "entropy": 0.9473272353410721, "epoch": 2.913600436086127, "grad_norm": 0.08859226107597351, "learning_rate": 9.442064415866015e-05, "loss": 1.3785, "mean_token_accuracy": 0.7422213032841682, "num_tokens": 768278005.0, "step": 10690 }, { "entropy": 0.9543716087937355, "epoch": 2.91632597437994, "grad_norm": 0.11691927909851074, "learning_rate": 9.440684453292706e-05, "loss": 1.3888, "mean_token_accuracy": 0.7412212237715721, "num_tokens": 768987600.0, "step": 10700 }, { "entropy": 0.9488771393895149, "epoch": 2.919051512673753, "grad_norm": 0.08694035559892654, "learning_rate": 9.439302887368249e-05, "loss": 1.3779, "mean_token_accuracy": 0.7432838320732117, "num_tokens": 769715397.0, "step": 10710 }, { "entropy": 0.9454629391431808, "epoch": 2.9217770509675662, "grad_norm": 0.10040954500436783, "learning_rate": 9.437919718591468e-05, "loss": 1.3793, "mean_token_accuracy": 0.7399373590946198, "num_tokens": 770429390.0, "step": 10720 }, { "entropy": 0.9490958735346794, "epoch": 2.924502589261379, "grad_norm": 0.10891756415367126, "learning_rate": 9.436534947461772e-05, "loss": 1.3774, "mean_token_accuracy": 0.7455389559268951, "num_tokens": 771163171.0, "step": 10730 }, { "entropy": 0.9498210698366165, "epoch": 2.927228127555192, "grad_norm": 0.09342612326145172, "learning_rate": 9.435148574479144e-05, "loss": 1.3779, "mean_token_accuracy": 0.738006317615509, "num_tokens": 771860027.0, "step": 10740 }, { "entropy": 0.9461888819932938, "epoch": 2.929953665849005, "grad_norm": 0.09771758317947388, "learning_rate": 9.43376060014415e-05, "loss": 1.3776, "mean_token_accuracy": 0.7404180765151978, "num_tokens": 772567486.0, "step": 10750 }, { "entropy": 0.9388180360198021, "epoch": 2.9326792041428185, "grad_norm": 0.10150643438100815, "learning_rate": 9.432371024957927e-05, "loss": 1.3753, "mean_token_accuracy": 0.7463704735040665, "num_tokens": 773289854.0, "step": 10760 }, { "entropy": 0.9550876408815384, "epoch": 2.9354047424366314, "grad_norm": 0.09483397006988525, "learning_rate": 9.430979849422196e-05, "loss": 1.3819, "mean_token_accuracy": 0.7382730200886727, "num_tokens": 774003702.0, "step": 10770 }, { "entropy": 0.9492468416690827, "epoch": 2.9381302807304444, "grad_norm": 0.11253222823143005, "learning_rate": 9.429587074039254e-05, "loss": 1.3859, "mean_token_accuracy": 0.7406412959098816, "num_tokens": 774715012.0, "step": 10780 }, { "entropy": 0.9470512971282006, "epoch": 2.9408558190242573, "grad_norm": 0.1132352203130722, "learning_rate": 9.428192699311979e-05, "loss": 1.3757, "mean_token_accuracy": 0.7429844021797181, "num_tokens": 775431299.0, "step": 10790 }, { "entropy": 0.9407175153493881, "epoch": 2.9435813573180702, "grad_norm": 0.11837431788444519, "learning_rate": 9.426796725743818e-05, "loss": 1.3696, "mean_token_accuracy": 0.7453804090619087, "num_tokens": 776162306.0, "step": 10800 }, { "entropy": 0.9463397905230522, "epoch": 2.946306895611883, "grad_norm": 0.14300303161144257, "learning_rate": 9.425399153838804e-05, "loss": 1.3802, "mean_token_accuracy": 0.7406564101576805, "num_tokens": 776875978.0, "step": 10810 }, { "entropy": 0.9498815953731536, "epoch": 2.949032433905696, "grad_norm": 0.1136244460940361, "learning_rate": 9.423999984101542e-05, "loss": 1.3762, "mean_token_accuracy": 0.7416051119565964, "num_tokens": 777590020.0, "step": 10820 }, { "entropy": 0.9428626239299774, "epoch": 2.9517579721995095, "grad_norm": 0.10531148314476013, "learning_rate": 9.422599217037213e-05, "loss": 1.3705, "mean_token_accuracy": 0.74758260846138, "num_tokens": 778321873.0, "step": 10830 }, { "entropy": 0.9489976704120636, "epoch": 2.9544835104933225, "grad_norm": 0.13479472696781158, "learning_rate": 9.421196853151584e-05, "loss": 1.38, "mean_token_accuracy": 0.7459505274891853, "num_tokens": 779049676.0, "step": 10840 }, { "entropy": 0.9520537599921226, "epoch": 2.9572090487871354, "grad_norm": 0.08216880261898041, "learning_rate": 9.419792892950987e-05, "loss": 1.386, "mean_token_accuracy": 0.7429448261857032, "num_tokens": 779775404.0, "step": 10850 }, { "entropy": 0.949109499156475, "epoch": 2.9599345870809484, "grad_norm": 0.1596001535654068, "learning_rate": 9.418387336942335e-05, "loss": 1.3752, "mean_token_accuracy": 0.7430404499173164, "num_tokens": 780497904.0, "step": 10860 }, { "entropy": 0.9505121961236, "epoch": 2.9626601253747618, "grad_norm": 0.11224663257598877, "learning_rate": 9.416980185633117e-05, "loss": 1.3775, "mean_token_accuracy": 0.7451267004013061, "num_tokens": 781217060.0, "step": 10870 }, { "entropy": 0.9447997346520424, "epoch": 2.9653856636685747, "grad_norm": 0.11577615141868591, "learning_rate": 9.415571439531402e-05, "loss": 1.3751, "mean_token_accuracy": 0.744077518582344, "num_tokens": 781931549.0, "step": 10880 }, { "entropy": 0.9436752960085869, "epoch": 2.9681112019623876, "grad_norm": 0.153329536318779, "learning_rate": 9.414161099145828e-05, "loss": 1.3806, "mean_token_accuracy": 0.7423443600535393, "num_tokens": 782623152.0, "step": 10890 }, { "entropy": 0.9503539055585861, "epoch": 2.9708367402562006, "grad_norm": 0.19156911969184875, "learning_rate": 9.412749164985611e-05, "loss": 1.383, "mean_token_accuracy": 0.7420576244592667, "num_tokens": 783346287.0, "step": 10900 }, { "entropy": 0.9467993035912514, "epoch": 2.9735622785500135, "grad_norm": 0.09959796071052551, "learning_rate": 9.411335637560546e-05, "loss": 1.3777, "mean_token_accuracy": 0.7447941780090332, "num_tokens": 784068242.0, "step": 10910 }, { "entropy": 0.9460756421089173, "epoch": 2.9762878168438265, "grad_norm": 0.09663764387369156, "learning_rate": 9.409920517380998e-05, "loss": 1.3829, "mean_token_accuracy": 0.743578876554966, "num_tokens": 784785982.0, "step": 10920 }, { "entropy": 0.9464081883430481, "epoch": 2.9790133551376394, "grad_norm": 0.098046213388443, "learning_rate": 9.408503804957912e-05, "loss": 1.3731, "mean_token_accuracy": 0.7468303069472313, "num_tokens": 785524509.0, "step": 10930 }, { "entropy": 0.9433768823742866, "epoch": 2.981738893431453, "grad_norm": 0.08793983608484268, "learning_rate": 9.407085500802804e-05, "loss": 1.3731, "mean_token_accuracy": 0.7433084145188331, "num_tokens": 786241993.0, "step": 10940 }, { "entropy": 0.9438702210783958, "epoch": 2.9844644317252658, "grad_norm": 0.11304867267608643, "learning_rate": 9.405665605427764e-05, "loss": 1.3808, "mean_token_accuracy": 0.7470975622534752, "num_tokens": 786966806.0, "step": 10950 }, { "entropy": 0.9451516225934029, "epoch": 2.9871899700190787, "grad_norm": 0.09482454508543015, "learning_rate": 9.404244119345462e-05, "loss": 1.3702, "mean_token_accuracy": 0.7435500398278236, "num_tokens": 787685395.0, "step": 10960 }, { "entropy": 0.9512408003211021, "epoch": 2.9899155083128917, "grad_norm": 0.10392162203788757, "learning_rate": 9.402821043069137e-05, "loss": 1.3828, "mean_token_accuracy": 0.7425945445895195, "num_tokens": 788402117.0, "step": 10970 }, { "entropy": 0.9488069012761116, "epoch": 2.992641046606705, "grad_norm": 0.08627504110336304, "learning_rate": 9.401396377112605e-05, "loss": 1.3775, "mean_token_accuracy": 0.7512379825115204, "num_tokens": 789144727.0, "step": 10980 }, { "entropy": 0.9501185655593872, "epoch": 2.995366584900518, "grad_norm": 0.10031311959028244, "learning_rate": 9.399970121990258e-05, "loss": 1.3763, "mean_token_accuracy": 0.7431940719485283, "num_tokens": 789864544.0, "step": 10990 }, { "entropy": 0.9512557774782181, "epoch": 2.998092123194331, "grad_norm": 0.10265135020017624, "learning_rate": 9.398542278217054e-05, "loss": 1.3793, "mean_token_accuracy": 0.7444485172629356, "num_tokens": 790586485.0, "step": 11000 }, { "entropy": 0.9507931903004646, "epoch": 3.000817661488144, "grad_norm": 0.0883914902806282, "learning_rate": 9.39711284630853e-05, "loss": 1.3836, "mean_token_accuracy": 0.745827704668045, "num_tokens": 791321126.0, "step": 11010 }, { "entropy": 0.9451069980859756, "epoch": 3.003543199781957, "grad_norm": 0.09480870515108109, "learning_rate": 9.395681826780798e-05, "loss": 1.3696, "mean_token_accuracy": 0.7437042579054832, "num_tokens": 792042747.0, "step": 11020 }, { "entropy": 0.9346920728683472, "epoch": 3.0062687380757698, "grad_norm": 0.11070021986961365, "learning_rate": 9.394249220150541e-05, "loss": 1.3606, "mean_token_accuracy": 0.750485347211361, "num_tokens": 792774577.0, "step": 11030 }, { "entropy": 0.935794934630394, "epoch": 3.008994276369583, "grad_norm": 0.08571377396583557, "learning_rate": 9.392815026935016e-05, "loss": 1.3649, "mean_token_accuracy": 0.7491550222039223, "num_tokens": 793512462.0, "step": 11040 }, { "entropy": 0.93894032984972, "epoch": 3.011719814663396, "grad_norm": 0.09834165871143341, "learning_rate": 9.39137924765205e-05, "loss": 1.3694, "mean_token_accuracy": 0.7463561862707138, "num_tokens": 794236781.0, "step": 11050 }, { "entropy": 0.9381979539990425, "epoch": 3.014445352957209, "grad_norm": 0.09578172862529755, "learning_rate": 9.389941882820045e-05, "loss": 1.3755, "mean_token_accuracy": 0.7448102459311485, "num_tokens": 794953031.0, "step": 11060 }, { "entropy": 0.9406249284744262, "epoch": 3.017170891251022, "grad_norm": 0.09311778843402863, "learning_rate": 9.388502932957975e-05, "loss": 1.3734, "mean_token_accuracy": 0.7449426963925362, "num_tokens": 795663779.0, "step": 11070 }, { "entropy": 0.9419813230633736, "epoch": 3.019896429544835, "grad_norm": 0.10084322839975357, "learning_rate": 9.38706239858539e-05, "loss": 1.3642, "mean_token_accuracy": 0.7455672308802604, "num_tokens": 796394650.0, "step": 11080 }, { "entropy": 0.9440831586718559, "epoch": 3.0226219678386483, "grad_norm": 0.10120902210474014, "learning_rate": 9.385620280222402e-05, "loss": 1.3681, "mean_token_accuracy": 0.7443292528390885, "num_tokens": 797127106.0, "step": 11090 }, { "entropy": 0.940793713927269, "epoch": 3.0253475061324613, "grad_norm": 0.1022334098815918, "learning_rate": 9.384176578389707e-05, "loss": 1.3745, "mean_token_accuracy": 0.74081010222435, "num_tokens": 797834893.0, "step": 11100 }, { "entropy": 0.9389016404747963, "epoch": 3.0280730444262742, "grad_norm": 0.08720928430557251, "learning_rate": 9.382731293608565e-05, "loss": 1.367, "mean_token_accuracy": 0.7487114503979683, "num_tokens": 798560747.0, "step": 11110 }, { "entropy": 0.9339886143803596, "epoch": 3.030798582720087, "grad_norm": 0.10605648905038834, "learning_rate": 9.38128442640081e-05, "loss": 1.3659, "mean_token_accuracy": 0.746621385216713, "num_tokens": 799276742.0, "step": 11120 }, { "entropy": 0.9361902475357056, "epoch": 3.0335241210139, "grad_norm": 0.0876423716545105, "learning_rate": 9.379835977288847e-05, "loss": 1.3665, "mean_token_accuracy": 0.7457955434918404, "num_tokens": 800002088.0, "step": 11130 }, { "entropy": 0.9462328448891639, "epoch": 3.036249659307713, "grad_norm": 0.09621265530586243, "learning_rate": 9.378385946795654e-05, "loss": 1.3718, "mean_token_accuracy": 0.7416390955448151, "num_tokens": 800711281.0, "step": 11140 }, { "entropy": 0.9392537325620651, "epoch": 3.0389751976015265, "grad_norm": 0.09904195368289948, "learning_rate": 9.376934335444774e-05, "loss": 1.3675, "mean_token_accuracy": 0.7491195678710938, "num_tokens": 801438797.0, "step": 11150 }, { "entropy": 0.9405299961566925, "epoch": 3.0417007358953394, "grad_norm": 0.08887912333011627, "learning_rate": 9.375481143760329e-05, "loss": 1.3805, "mean_token_accuracy": 0.7460344031453132, "num_tokens": 802155484.0, "step": 11160 }, { "entropy": 0.9410595312714577, "epoch": 3.0444262741891523, "grad_norm": 0.11672388762235641, "learning_rate": 9.374026372267008e-05, "loss": 1.379, "mean_token_accuracy": 0.7432695344090462, "num_tokens": 802862801.0, "step": 11170 }, { "entropy": 0.9330152377486229, "epoch": 3.0471518124829653, "grad_norm": 0.10320542007684708, "learning_rate": 9.372570021490067e-05, "loss": 1.3603, "mean_token_accuracy": 0.750064055621624, "num_tokens": 803584098.0, "step": 11180 }, { "entropy": 0.9365206196904182, "epoch": 3.0498773507767782, "grad_norm": 0.10336554795503616, "learning_rate": 9.371112091955337e-05, "loss": 1.3605, "mean_token_accuracy": 0.746023739874363, "num_tokens": 804309097.0, "step": 11190 }, { "entropy": 0.9407736912369729, "epoch": 3.0526028890705916, "grad_norm": 0.09537152200937271, "learning_rate": 9.369652584189216e-05, "loss": 1.3754, "mean_token_accuracy": 0.7431817069649697, "num_tokens": 805020667.0, "step": 11200 }, { "entropy": 0.9329175144433975, "epoch": 3.0553284273644046, "grad_norm": 0.11751585453748703, "learning_rate": 9.368191498718675e-05, "loss": 1.3714, "mean_token_accuracy": 0.7441901594400406, "num_tokens": 805725680.0, "step": 11210 }, { "entropy": 0.942389452457428, "epoch": 3.0580539656582175, "grad_norm": 0.09297958761453629, "learning_rate": 9.36672883607125e-05, "loss": 1.3726, "mean_token_accuracy": 0.7401214390993118, "num_tokens": 806434057.0, "step": 11220 }, { "entropy": 0.9488732665777206, "epoch": 3.0607795039520305, "grad_norm": 0.10751072317361832, "learning_rate": 9.365264596775051e-05, "loss": 1.377, "mean_token_accuracy": 0.7423231542110443, "num_tokens": 807150329.0, "step": 11230 }, { "entropy": 0.9424430325627327, "epoch": 3.0635050422458434, "grad_norm": 0.09440799802541733, "learning_rate": 9.363798781358757e-05, "loss": 1.3729, "mean_token_accuracy": 0.7408807426691055, "num_tokens": 807863155.0, "step": 11240 }, { "entropy": 0.9404341802001, "epoch": 3.0662305805396564, "grad_norm": 0.11174992471933365, "learning_rate": 9.362331390351613e-05, "loss": 1.379, "mean_token_accuracy": 0.7399561330676079, "num_tokens": 808568191.0, "step": 11250 }, { "entropy": 0.9390634030103684, "epoch": 3.0689561188334697, "grad_norm": 0.10013566166162491, "learning_rate": 9.360862424283433e-05, "loss": 1.3762, "mean_token_accuracy": 0.7432549253106118, "num_tokens": 809273011.0, "step": 11260 }, { "entropy": 0.9395414397120476, "epoch": 3.0716816571272827, "grad_norm": 0.21124373376369476, "learning_rate": 9.359391883684603e-05, "loss": 1.3657, "mean_token_accuracy": 0.7475090369582176, "num_tokens": 809997397.0, "step": 11270 }, { "entropy": 0.9396891310811043, "epoch": 3.0744071954210956, "grad_norm": 0.09619201719760895, "learning_rate": 9.357919769086074e-05, "loss": 1.3731, "mean_token_accuracy": 0.743741637468338, "num_tokens": 810701656.0, "step": 11280 }, { "entropy": 0.9452935412526131, "epoch": 3.0771327337149086, "grad_norm": 0.10465989261865616, "learning_rate": 9.356446081019369e-05, "loss": 1.3777, "mean_token_accuracy": 0.7458249852061272, "num_tokens": 811425807.0, "step": 11290 }, { "entropy": 0.9400225415825844, "epoch": 3.0798582720087215, "grad_norm": 0.1047290712594986, "learning_rate": 9.354970820016576e-05, "loss": 1.3673, "mean_token_accuracy": 0.748205590248108, "num_tokens": 812148517.0, "step": 11300 }, { "entropy": 0.9372500717639923, "epoch": 3.082583810302535, "grad_norm": 0.09082084149122238, "learning_rate": 9.353493986610351e-05, "loss": 1.3675, "mean_token_accuracy": 0.7476839691400528, "num_tokens": 812886158.0, "step": 11310 }, { "entropy": 0.9453914582729339, "epoch": 3.085309348596348, "grad_norm": 0.15638625621795654, "learning_rate": 9.35201558133392e-05, "loss": 1.3834, "mean_token_accuracy": 0.7417276456952095, "num_tokens": 813598294.0, "step": 11320 }, { "entropy": 0.9417727872729301, "epoch": 3.088034886890161, "grad_norm": 0.0936673954129219, "learning_rate": 9.350535604721074e-05, "loss": 1.3822, "mean_token_accuracy": 0.7389746978878975, "num_tokens": 814286851.0, "step": 11330 }, { "entropy": 0.9376664489507676, "epoch": 3.0907604251839738, "grad_norm": 0.09966736286878586, "learning_rate": 9.349054057306174e-05, "loss": 1.3723, "mean_token_accuracy": 0.742907702922821, "num_tokens": 815002766.0, "step": 11340 }, { "entropy": 0.9480553328990936, "epoch": 3.0934859634777867, "grad_norm": 0.11020088195800781, "learning_rate": 9.347570939624147e-05, "loss": 1.3777, "mean_token_accuracy": 0.7439572513103485, "num_tokens": 815720988.0, "step": 11350 }, { "entropy": 0.9363390222191811, "epoch": 3.0962115017716, "grad_norm": 0.11631142348051071, "learning_rate": 9.346086252210483e-05, "loss": 1.3608, "mean_token_accuracy": 0.7509266182780265, "num_tokens": 816459846.0, "step": 11360 }, { "entropy": 0.9384995147585868, "epoch": 3.098937040065413, "grad_norm": 0.10329711437225342, "learning_rate": 9.344599995601247e-05, "loss": 1.3635, "mean_token_accuracy": 0.7480807676911354, "num_tokens": 817198078.0, "step": 11370 }, { "entropy": 0.9449541583657265, "epoch": 3.101662578359226, "grad_norm": 0.12069828808307648, "learning_rate": 9.343112170333063e-05, "loss": 1.3711, "mean_token_accuracy": 0.7442483931779862, "num_tokens": 817920801.0, "step": 11380 }, { "entropy": 0.9456265062093735, "epoch": 3.104388116653039, "grad_norm": 0.09198126941919327, "learning_rate": 9.341622776943126e-05, "loss": 1.3784, "mean_token_accuracy": 0.7414027154445648, "num_tokens": 818628643.0, "step": 11390 }, { "entropy": 0.9380450159311294, "epoch": 3.107113654946852, "grad_norm": 0.11404696106910706, "learning_rate": 9.340131815969196e-05, "loss": 1.3688, "mean_token_accuracy": 0.741287750005722, "num_tokens": 819339287.0, "step": 11400 }, { "entropy": 0.9412304505705833, "epoch": 3.109839193240665, "grad_norm": 0.09746160358190536, "learning_rate": 9.338639287949598e-05, "loss": 1.37, "mean_token_accuracy": 0.7421133562922477, "num_tokens": 820052416.0, "step": 11410 }, { "entropy": 0.9427403524518013, "epoch": 3.112564731534478, "grad_norm": 0.13241012394428253, "learning_rate": 9.337145193423222e-05, "loss": 1.375, "mean_token_accuracy": 0.7437486976385117, "num_tokens": 820769288.0, "step": 11420 }, { "entropy": 0.9317566394805908, "epoch": 3.115290269828291, "grad_norm": 0.09343224763870239, "learning_rate": 9.335649532929526e-05, "loss": 1.3608, "mean_token_accuracy": 0.7504123464226723, "num_tokens": 821506352.0, "step": 11430 }, { "entropy": 0.939399915933609, "epoch": 3.118015808122104, "grad_norm": 0.09214864671230316, "learning_rate": 9.334152307008532e-05, "loss": 1.3734, "mean_token_accuracy": 0.7457444086670876, "num_tokens": 822229912.0, "step": 11440 }, { "entropy": 0.9384179800748825, "epoch": 3.120741346415917, "grad_norm": 0.10016916692256927, "learning_rate": 9.332653516200829e-05, "loss": 1.3721, "mean_token_accuracy": 0.7450738236308098, "num_tokens": 822944677.0, "step": 11450 }, { "entropy": 0.9418606579303741, "epoch": 3.12346688470973, "grad_norm": 0.09754331409931183, "learning_rate": 9.331153161047568e-05, "loss": 1.3664, "mean_token_accuracy": 0.7417466431856156, "num_tokens": 823654759.0, "step": 11460 }, { "entropy": 0.9352231919765472, "epoch": 3.1261924230035434, "grad_norm": 0.10757584124803543, "learning_rate": 9.329651242090468e-05, "loss": 1.3668, "mean_token_accuracy": 0.7431150436401367, "num_tokens": 824374173.0, "step": 11470 }, { "entropy": 0.9361462995409966, "epoch": 3.1289179612973563, "grad_norm": 0.1653221696615219, "learning_rate": 9.328147759871809e-05, "loss": 1.3722, "mean_token_accuracy": 0.7468035846948624, "num_tokens": 825083575.0, "step": 11480 }, { "entropy": 0.9438735976815223, "epoch": 3.1316434995911693, "grad_norm": 0.08508539944887161, "learning_rate": 9.326642714934439e-05, "loss": 1.3699, "mean_token_accuracy": 0.7426930829882622, "num_tokens": 825803337.0, "step": 11490 }, { "entropy": 0.9398536905646324, "epoch": 3.1343690378849822, "grad_norm": 0.12729324400424957, "learning_rate": 9.325136107821768e-05, "loss": 1.3646, "mean_token_accuracy": 0.7444761872291565, "num_tokens": 826521775.0, "step": 11500 }, { "entropy": 0.9386954724788665, "epoch": 3.137094576178795, "grad_norm": 0.13203135132789612, "learning_rate": 9.323627939077771e-05, "loss": 1.3716, "mean_token_accuracy": 0.7460088655352592, "num_tokens": 827251356.0, "step": 11510 }, { "entropy": 0.9365203708410264, "epoch": 3.1398201144726086, "grad_norm": 0.11855225265026093, "learning_rate": 9.322118209246987e-05, "loss": 1.3721, "mean_token_accuracy": 0.7442961215972901, "num_tokens": 827958502.0, "step": 11520 }, { "entropy": 0.9445111289620399, "epoch": 3.1425456527664215, "grad_norm": 0.10418067127466202, "learning_rate": 9.320606918874518e-05, "loss": 1.3717, "mean_token_accuracy": 0.7435276076197624, "num_tokens": 828686325.0, "step": 11530 }, { "entropy": 0.9411079570651054, "epoch": 3.1452711910602345, "grad_norm": 0.10798341035842896, "learning_rate": 9.319094068506029e-05, "loss": 1.3664, "mean_token_accuracy": 0.7485539555549622, "num_tokens": 829413364.0, "step": 11540 }, { "entropy": 0.9384330570697784, "epoch": 3.1479967293540474, "grad_norm": 0.09768079966306686, "learning_rate": 9.317579658687749e-05, "loss": 1.3708, "mean_token_accuracy": 0.747562299668789, "num_tokens": 830144904.0, "step": 11550 }, { "entropy": 0.9414130836725235, "epoch": 3.1507222676478603, "grad_norm": 0.10029740631580353, "learning_rate": 9.316063689966472e-05, "loss": 1.3683, "mean_token_accuracy": 0.7410704106092453, "num_tokens": 830857702.0, "step": 11560 }, { "entropy": 0.9360662370920181, "epoch": 3.1534478059416733, "grad_norm": 0.11149334162473679, "learning_rate": 9.314546162889551e-05, "loss": 1.3742, "mean_token_accuracy": 0.7429559230804443, "num_tokens": 831571151.0, "step": 11570 }, { "entropy": 0.9414043292403221, "epoch": 3.1561733442354867, "grad_norm": 0.1495295763015747, "learning_rate": 9.313027078004903e-05, "loss": 1.377, "mean_token_accuracy": 0.7445568561553955, "num_tokens": 832274229.0, "step": 11580 }, { "entropy": 0.9276083469390869, "epoch": 3.1588988825292996, "grad_norm": 0.09622129797935486, "learning_rate": 9.311506435861011e-05, "loss": 1.3577, "mean_token_accuracy": 0.747485676407814, "num_tokens": 832993745.0, "step": 11590 }, { "entropy": 0.9446370765566826, "epoch": 3.1616244208231126, "grad_norm": 0.09544003754854202, "learning_rate": 9.309984237006912e-05, "loss": 1.3857, "mean_token_accuracy": 0.7386672690510749, "num_tokens": 833686366.0, "step": 11600 }, { "entropy": 0.934392660856247, "epoch": 3.1643499591169255, "grad_norm": 0.09902913123369217, "learning_rate": 9.308460481992216e-05, "loss": 1.3726, "mean_token_accuracy": 0.7464862167835236, "num_tokens": 834395460.0, "step": 11610 }, { "entropy": 0.9381388798356056, "epoch": 3.1670754974107385, "grad_norm": 0.10641501098871231, "learning_rate": 9.306935171367086e-05, "loss": 1.3662, "mean_token_accuracy": 0.7477539911866188, "num_tokens": 835116330.0, "step": 11620 }, { "entropy": 0.9438267111778259, "epoch": 3.169801035704552, "grad_norm": 0.09885408729314804, "learning_rate": 9.30540830568225e-05, "loss": 1.3716, "mean_token_accuracy": 0.7419815719127655, "num_tokens": 835823829.0, "step": 11630 }, { "entropy": 0.9350500702857971, "epoch": 3.172526573998365, "grad_norm": 0.09166236221790314, "learning_rate": 9.303879885488998e-05, "loss": 1.3672, "mean_token_accuracy": 0.7425052419304847, "num_tokens": 836526949.0, "step": 11640 }, { "entropy": 0.939009566605091, "epoch": 3.1752521122921777, "grad_norm": 0.09826038032770157, "learning_rate": 9.302349911339179e-05, "loss": 1.3718, "mean_token_accuracy": 0.7404588326811791, "num_tokens": 837230575.0, "step": 11650 }, { "entropy": 0.9326612934470176, "epoch": 3.1779776505859907, "grad_norm": 0.09045529365539551, "learning_rate": 9.300818383785207e-05, "loss": 1.364, "mean_token_accuracy": 0.7500249862670898, "num_tokens": 837960290.0, "step": 11660 }, { "entropy": 0.9376754447817802, "epoch": 3.1807031888798036, "grad_norm": 0.10200121253728867, "learning_rate": 9.299285303380054e-05, "loss": 1.3701, "mean_token_accuracy": 0.7456318408250808, "num_tokens": 838683179.0, "step": 11670 }, { "entropy": 0.9378181710839272, "epoch": 3.1834287271736166, "grad_norm": 0.09331372380256653, "learning_rate": 9.297750670677252e-05, "loss": 1.3738, "mean_token_accuracy": 0.7449145019054413, "num_tokens": 839397651.0, "step": 11680 }, { "entropy": 0.9413901746273041, "epoch": 3.18615426546743, "grad_norm": 0.09418069571256638, "learning_rate": 9.296214486230894e-05, "loss": 1.3697, "mean_token_accuracy": 0.7454806089401245, "num_tokens": 840122308.0, "step": 11690 }, { "entropy": 0.9366207778453827, "epoch": 3.188879803761243, "grad_norm": 0.10092388093471527, "learning_rate": 9.294676750595637e-05, "loss": 1.3642, "mean_token_accuracy": 0.7400210842490196, "num_tokens": 840822855.0, "step": 11700 }, { "entropy": 0.9360883101820946, "epoch": 3.191605342055056, "grad_norm": 0.09489568322896957, "learning_rate": 9.293137464326694e-05, "loss": 1.3606, "mean_token_accuracy": 0.7458364591002464, "num_tokens": 841552929.0, "step": 11710 }, { "entropy": 0.9407029107213021, "epoch": 3.194330880348869, "grad_norm": 0.1279614418745041, "learning_rate": 9.291596627979836e-05, "loss": 1.3689, "mean_token_accuracy": 0.7444825232028961, "num_tokens": 842270506.0, "step": 11720 }, { "entropy": 0.933660639822483, "epoch": 3.1970564186426818, "grad_norm": 0.11487264931201935, "learning_rate": 9.290054242111399e-05, "loss": 1.3626, "mean_token_accuracy": 0.745450496673584, "num_tokens": 842997926.0, "step": 11730 }, { "entropy": 0.9356621518731117, "epoch": 3.199781956936495, "grad_norm": 0.09398036450147629, "learning_rate": 9.288510307278277e-05, "loss": 1.3693, "mean_token_accuracy": 0.7445752680301666, "num_tokens": 843719586.0, "step": 11740 }, { "entropy": 0.9460142493247986, "epoch": 3.202507495230308, "grad_norm": 0.11102558672428131, "learning_rate": 9.28696482403792e-05, "loss": 1.3744, "mean_token_accuracy": 0.743507881462574, "num_tokens": 844445492.0, "step": 11750 }, { "entropy": 0.9449904471635818, "epoch": 3.205233033524121, "grad_norm": 0.1021118238568306, "learning_rate": 9.28541779294834e-05, "loss": 1.3837, "mean_token_accuracy": 0.7422887161374092, "num_tokens": 845162237.0, "step": 11760 }, { "entropy": 0.9379758894443512, "epoch": 3.207958571817934, "grad_norm": 0.08937733620405197, "learning_rate": 9.283869214568108e-05, "loss": 1.3698, "mean_token_accuracy": 0.7471628934144974, "num_tokens": 845891839.0, "step": 11770 }, { "entropy": 0.9340906962752342, "epoch": 3.210684110111747, "grad_norm": 0.11052072793245316, "learning_rate": 9.282319089456353e-05, "loss": 1.3802, "mean_token_accuracy": 0.7459457963705063, "num_tokens": 846594518.0, "step": 11780 }, { "entropy": 0.9423430398106575, "epoch": 3.21340964840556, "grad_norm": 0.09794645756483078, "learning_rate": 9.280767418172762e-05, "loss": 1.3678, "mean_token_accuracy": 0.741601151227951, "num_tokens": 847305573.0, "step": 11790 }, { "entropy": 0.9387161493301391, "epoch": 3.2161351866993733, "grad_norm": 0.1304703652858734, "learning_rate": 9.27921420127758e-05, "loss": 1.3705, "mean_token_accuracy": 0.7438861384987832, "num_tokens": 848019099.0, "step": 11800 }, { "entropy": 0.9368794485926628, "epoch": 3.218860724993186, "grad_norm": 0.10444916784763336, "learning_rate": 9.27765943933161e-05, "loss": 1.3731, "mean_token_accuracy": 0.7477671071887017, "num_tokens": 848736852.0, "step": 11810 }, { "entropy": 0.9384323671460152, "epoch": 3.221586263286999, "grad_norm": 0.10987184941768646, "learning_rate": 9.276103132896214e-05, "loss": 1.3652, "mean_token_accuracy": 0.7445508196949959, "num_tokens": 849453291.0, "step": 11820 }, { "entropy": 0.9372527226805687, "epoch": 3.224311801580812, "grad_norm": 0.09234461933374405, "learning_rate": 9.274545282533313e-05, "loss": 1.3728, "mean_token_accuracy": 0.744299691915512, "num_tokens": 850168016.0, "step": 11830 }, { "entropy": 0.9347311824560165, "epoch": 3.227037339874625, "grad_norm": 0.08843154460191727, "learning_rate": 9.272985888805383e-05, "loss": 1.3616, "mean_token_accuracy": 0.7469219848513603, "num_tokens": 850885861.0, "step": 11840 }, { "entropy": 0.9396131202578545, "epoch": 3.2297628781684384, "grad_norm": 0.09732121229171753, "learning_rate": 9.271424952275456e-05, "loss": 1.3679, "mean_token_accuracy": 0.748391892015934, "num_tokens": 851615694.0, "step": 11850 }, { "entropy": 0.946087296307087, "epoch": 3.2324884164622514, "grad_norm": 0.14983533322811127, "learning_rate": 9.269862473507125e-05, "loss": 1.3732, "mean_token_accuracy": 0.7415955275297165, "num_tokens": 852338796.0, "step": 11860 }, { "entropy": 0.9348750323057174, "epoch": 3.2352139547560643, "grad_norm": 0.11568590998649597, "learning_rate": 9.268298453064537e-05, "loss": 1.3665, "mean_token_accuracy": 0.7486034065485001, "num_tokens": 853061523.0, "step": 11870 }, { "entropy": 0.9446531474590302, "epoch": 3.2379394930498773, "grad_norm": 0.15574434399604797, "learning_rate": 9.266732891512395e-05, "loss": 1.372, "mean_token_accuracy": 0.744923149049282, "num_tokens": 853778037.0, "step": 11880 }, { "entropy": 0.9377698779106141, "epoch": 3.24066503134369, "grad_norm": 0.09689576178789139, "learning_rate": 9.265165789415962e-05, "loss": 1.3722, "mean_token_accuracy": 0.7483894094824791, "num_tokens": 854501956.0, "step": 11890 }, { "entropy": 0.9404146298766136, "epoch": 3.2433905696375036, "grad_norm": 0.1202041283249855, "learning_rate": 9.263597147341052e-05, "loss": 1.3705, "mean_token_accuracy": 0.7417228803038597, "num_tokens": 855210524.0, "step": 11900 }, { "entropy": 0.9327780216932297, "epoch": 3.2461161079313166, "grad_norm": 0.09388814121484756, "learning_rate": 9.262026965854043e-05, "loss": 1.3603, "mean_token_accuracy": 0.7462678134441376, "num_tokens": 855938036.0, "step": 11910 }, { "entropy": 0.9489069446921349, "epoch": 3.2488416462251295, "grad_norm": 0.10653320699930191, "learning_rate": 9.26045524552186e-05, "loss": 1.374, "mean_token_accuracy": 0.7437566295266151, "num_tokens": 856669630.0, "step": 11920 }, { "entropy": 0.9383052349090576, "epoch": 3.2515671845189424, "grad_norm": 0.13587507605552673, "learning_rate": 9.258881986911988e-05, "loss": 1.373, "mean_token_accuracy": 0.7436003983020782, "num_tokens": 857384372.0, "step": 11930 }, { "entropy": 0.9415795043110847, "epoch": 3.2542927228127554, "grad_norm": 0.09867548942565918, "learning_rate": 9.257307190592468e-05, "loss": 1.3788, "mean_token_accuracy": 0.740178307890892, "num_tokens": 858089388.0, "step": 11940 }, { "entropy": 0.9481500625610352, "epoch": 3.257018261106569, "grad_norm": 0.2128295749425888, "learning_rate": 9.255730857131894e-05, "loss": 1.3832, "mean_token_accuracy": 0.7374232366681099, "num_tokens": 858803752.0, "step": 11950 }, { "entropy": 0.9385175615549087, "epoch": 3.2597437994003817, "grad_norm": 0.10609021782875061, "learning_rate": 9.254152987099416e-05, "loss": 1.3639, "mean_token_accuracy": 0.7469068959355354, "num_tokens": 859535472.0, "step": 11960 }, { "entropy": 0.9444188758730888, "epoch": 3.2624693376941947, "grad_norm": 0.14103463292121887, "learning_rate": 9.252573581064741e-05, "loss": 1.3789, "mean_token_accuracy": 0.7409269601106644, "num_tokens": 860247498.0, "step": 11970 }, { "entropy": 0.939168532192707, "epoch": 3.2651948759880076, "grad_norm": 0.09561815857887268, "learning_rate": 9.250992639598127e-05, "loss": 1.3722, "mean_token_accuracy": 0.7489908814430237, "num_tokens": 860973964.0, "step": 11980 }, { "entropy": 0.9405602127313614, "epoch": 3.2679204142818206, "grad_norm": 0.1375446617603302, "learning_rate": 9.249410163270388e-05, "loss": 1.3746, "mean_token_accuracy": 0.7432276397943497, "num_tokens": 861687960.0, "step": 11990 }, { "entropy": 0.9345800951123238, "epoch": 3.2706459525756335, "grad_norm": 0.09133090078830719, "learning_rate": 9.247826152652891e-05, "loss": 1.3644, "mean_token_accuracy": 0.7489025801420212, "num_tokens": 862417292.0, "step": 12000 }, { "entropy": 0.9332168892025947, "epoch": 3.273371490869447, "grad_norm": 0.10458455979824066, "learning_rate": 9.24624060831756e-05, "loss": 1.3626, "mean_token_accuracy": 0.7467944294214248, "num_tokens": 863144584.0, "step": 12010 }, { "entropy": 0.939929710328579, "epoch": 3.27609702916326, "grad_norm": 0.09958841651678085, "learning_rate": 9.244653530836869e-05, "loss": 1.3687, "mean_token_accuracy": 0.7472238644957543, "num_tokens": 863874990.0, "step": 12020 }, { "entropy": 0.935688091814518, "epoch": 3.278822567457073, "grad_norm": 0.10171917825937271, "learning_rate": 9.243064920783848e-05, "loss": 1.3653, "mean_token_accuracy": 0.7491013899445533, "num_tokens": 864608673.0, "step": 12030 }, { "entropy": 0.9424743622541427, "epoch": 3.2815481057508857, "grad_norm": 0.1102117970585823, "learning_rate": 9.241474778732082e-05, "loss": 1.3759, "mean_token_accuracy": 0.745431300997734, "num_tokens": 865331852.0, "step": 12040 }, { "entropy": 0.9367278933525085, "epoch": 3.2842736440446987, "grad_norm": 0.10428949445486069, "learning_rate": 9.239883105255702e-05, "loss": 1.3631, "mean_token_accuracy": 0.7427160575985908, "num_tokens": 866052048.0, "step": 12050 }, { "entropy": 0.9408783093094826, "epoch": 3.286999182338512, "grad_norm": 0.08694595843553543, "learning_rate": 9.238289900929402e-05, "loss": 1.3697, "mean_token_accuracy": 0.7473935082554817, "num_tokens": 866783724.0, "step": 12060 }, { "entropy": 0.936025595664978, "epoch": 3.289724720632325, "grad_norm": 0.12551167607307434, "learning_rate": 9.236695166328419e-05, "loss": 1.3586, "mean_token_accuracy": 0.7464142009615898, "num_tokens": 867514322.0, "step": 12070 }, { "entropy": 0.9376924529671669, "epoch": 3.292450258926138, "grad_norm": 0.10297540575265884, "learning_rate": 9.235098902028549e-05, "loss": 1.3668, "mean_token_accuracy": 0.7453285813331604, "num_tokens": 868233798.0, "step": 12080 }, { "entropy": 0.9396264761686325, "epoch": 3.295175797219951, "grad_norm": 0.11221079528331757, "learning_rate": 9.233501108606139e-05, "loss": 1.3788, "mean_token_accuracy": 0.7407119363546372, "num_tokens": 868931400.0, "step": 12090 }, { "entropy": 0.9314264595508576, "epoch": 3.297901335513764, "grad_norm": 0.12180259823799133, "learning_rate": 9.231901786638087e-05, "loss": 1.3588, "mean_token_accuracy": 0.7533206358551979, "num_tokens": 869673649.0, "step": 12100 }, { "entropy": 0.9336747452616692, "epoch": 3.300626873807577, "grad_norm": 0.0984652042388916, "learning_rate": 9.230300936701843e-05, "loss": 1.3633, "mean_token_accuracy": 0.7461344450712204, "num_tokens": 870392970.0, "step": 12110 }, { "entropy": 0.9405874907970428, "epoch": 3.30335241210139, "grad_norm": 0.10068907588720322, "learning_rate": 9.228698559375409e-05, "loss": 1.3769, "mean_token_accuracy": 0.7446421384811401, "num_tokens": 871119240.0, "step": 12120 }, { "entropy": 0.9353307262063026, "epoch": 3.306077950395203, "grad_norm": 0.08579584211111069, "learning_rate": 9.227094655237338e-05, "loss": 1.3713, "mean_token_accuracy": 0.7481286942958831, "num_tokens": 871843150.0, "step": 12130 }, { "entropy": 0.9327404066920281, "epoch": 3.308803488689016, "grad_norm": 0.09677369147539139, "learning_rate": 9.225489224866737e-05, "loss": 1.3648, "mean_token_accuracy": 0.7528234973549843, "num_tokens": 872575930.0, "step": 12140 }, { "entropy": 0.9381903916597366, "epoch": 3.311529026982829, "grad_norm": 0.11243049800395966, "learning_rate": 9.223882268843259e-05, "loss": 1.3757, "mean_token_accuracy": 0.7431700929999352, "num_tokens": 873293545.0, "step": 12150 }, { "entropy": 0.9382534325122833, "epoch": 3.314254565276642, "grad_norm": 0.08840969949960709, "learning_rate": 9.222273787747112e-05, "loss": 1.366, "mean_token_accuracy": 0.7444361537694931, "num_tokens": 874014084.0, "step": 12160 }, { "entropy": 0.9425742998719215, "epoch": 3.3169801035704554, "grad_norm": 0.11762413382530212, "learning_rate": 9.220663782159054e-05, "loss": 1.3804, "mean_token_accuracy": 0.7423619404435158, "num_tokens": 874719773.0, "step": 12170 }, { "entropy": 0.9365145936608315, "epoch": 3.3197056418642683, "grad_norm": 0.11608080565929413, "learning_rate": 9.219052252660392e-05, "loss": 1.3688, "mean_token_accuracy": 0.7462546646595001, "num_tokens": 875430194.0, "step": 12180 }, { "entropy": 0.9391071319580078, "epoch": 3.3224311801580813, "grad_norm": 0.09551326930522919, "learning_rate": 9.217439199832982e-05, "loss": 1.3701, "mean_token_accuracy": 0.7475197538733482, "num_tokens": 876156104.0, "step": 12190 }, { "entropy": 0.9328495651483536, "epoch": 3.325156718451894, "grad_norm": 0.10556455701589584, "learning_rate": 9.215824624259235e-05, "loss": 1.3674, "mean_token_accuracy": 0.7482963696122169, "num_tokens": 876877994.0, "step": 12200 }, { "entropy": 0.936648765206337, "epoch": 3.327882256745707, "grad_norm": 0.09045548737049103, "learning_rate": 9.214208526522109e-05, "loss": 1.3608, "mean_token_accuracy": 0.746910671889782, "num_tokens": 877606048.0, "step": 12210 }, { "entropy": 0.934162038564682, "epoch": 3.33060779503952, "grad_norm": 0.10036295652389526, "learning_rate": 9.212590907205108e-05, "loss": 1.3626, "mean_token_accuracy": 0.7505731761455536, "num_tokens": 878339534.0, "step": 12220 }, { "entropy": 0.9365512371063233, "epoch": 3.3333333333333335, "grad_norm": 0.15659716725349426, "learning_rate": 9.210971766892291e-05, "loss": 1.3748, "mean_token_accuracy": 0.7418654069304467, "num_tokens": 879043376.0, "step": 12230 }, { "entropy": 0.9365818828344346, "epoch": 3.3360588716271464, "grad_norm": 0.10925443470478058, "learning_rate": 9.209351106168265e-05, "loss": 1.369, "mean_token_accuracy": 0.7447827830910683, "num_tokens": 879761153.0, "step": 12240 }, { "entropy": 0.9344280377030373, "epoch": 3.3387844099209594, "grad_norm": 0.1060609519481659, "learning_rate": 9.207728925618184e-05, "loss": 1.3692, "mean_token_accuracy": 0.7418735533952713, "num_tokens": 880472362.0, "step": 12250 }, { "entropy": 0.9354407399892807, "epoch": 3.3415099482147723, "grad_norm": 0.09413611888885498, "learning_rate": 9.206105225827751e-05, "loss": 1.3643, "mean_token_accuracy": 0.7522047266364098, "num_tokens": 881229725.0, "step": 12260 }, { "entropy": 0.9443309381604195, "epoch": 3.3442354865085853, "grad_norm": 0.09533295035362244, "learning_rate": 9.204480007383218e-05, "loss": 1.3746, "mean_token_accuracy": 0.7469098627567291, "num_tokens": 881961980.0, "step": 12270 }, { "entropy": 0.9417243987321854, "epoch": 3.3469610248023987, "grad_norm": 0.11531821638345718, "learning_rate": 9.202853270871387e-05, "loss": 1.3679, "mean_token_accuracy": 0.7430923923850059, "num_tokens": 882679094.0, "step": 12280 }, { "entropy": 0.9415391772985459, "epoch": 3.3496865630962116, "grad_norm": 0.09958190470933914, "learning_rate": 9.201225016879604e-05, "loss": 1.38, "mean_token_accuracy": 0.74543047696352, "num_tokens": 883399861.0, "step": 12290 }, { "entropy": 0.9387096092104912, "epoch": 3.3524121013900245, "grad_norm": 0.1257648766040802, "learning_rate": 9.19959524599577e-05, "loss": 1.3643, "mean_token_accuracy": 0.7435487121343612, "num_tokens": 884116502.0, "step": 12300 }, { "entropy": 0.941948288679123, "epoch": 3.3551376396838375, "grad_norm": 0.11715131253004074, "learning_rate": 9.197963958808323e-05, "loss": 1.3747, "mean_token_accuracy": 0.7438194438815117, "num_tokens": 884835006.0, "step": 12310 }, { "entropy": 0.9320042371749878, "epoch": 3.3578631779776504, "grad_norm": 0.09540057182312012, "learning_rate": 9.19633115590626e-05, "loss": 1.3681, "mean_token_accuracy": 0.7444098517298698, "num_tokens": 885535322.0, "step": 12320 }, { "entropy": 0.9351300984621048, "epoch": 3.3605887162714634, "grad_norm": 0.10215869545936584, "learning_rate": 9.194696837879118e-05, "loss": 1.377, "mean_token_accuracy": 0.7417103961110115, "num_tokens": 886243121.0, "step": 12330 }, { "entropy": 0.9415004014968872, "epoch": 3.3633142545652768, "grad_norm": 0.09734909236431122, "learning_rate": 9.193061005316981e-05, "loss": 1.374, "mean_token_accuracy": 0.7447368308901787, "num_tokens": 886952902.0, "step": 12340 }, { "entropy": 0.9400848492980003, "epoch": 3.3660397928590897, "grad_norm": 0.10203968733549118, "learning_rate": 9.191423658810486e-05, "loss": 1.3722, "mean_token_accuracy": 0.7438996389508248, "num_tokens": 887663324.0, "step": 12350 }, { "entropy": 0.9361301407217979, "epoch": 3.3687653311529027, "grad_norm": 0.09793830662965775, "learning_rate": 9.189784798950809e-05, "loss": 1.3608, "mean_token_accuracy": 0.7440217867493629, "num_tokens": 888370938.0, "step": 12360 }, { "entropy": 0.9428472727537155, "epoch": 3.3714908694467156, "grad_norm": 0.09535105526447296, "learning_rate": 9.188144426329679e-05, "loss": 1.3808, "mean_token_accuracy": 0.7373283475637435, "num_tokens": 889059887.0, "step": 12370 }, { "entropy": 0.9310889944434166, "epoch": 3.374216407740529, "grad_norm": 0.09437306970357895, "learning_rate": 9.186502541539364e-05, "loss": 1.3552, "mean_token_accuracy": 0.7492224603891373, "num_tokens": 889796454.0, "step": 12380 }, { "entropy": 0.9451030522584916, "epoch": 3.376941946034342, "grad_norm": 0.11006307601928711, "learning_rate": 9.184859145172685e-05, "loss": 1.3699, "mean_token_accuracy": 0.7429471015930176, "num_tokens": 890509477.0, "step": 12390 }, { "entropy": 0.940475769340992, "epoch": 3.379667484328155, "grad_norm": 0.09745632857084274, "learning_rate": 9.183214237823005e-05, "loss": 1.369, "mean_token_accuracy": 0.7450324624776841, "num_tokens": 891225518.0, "step": 12400 }, { "entropy": 0.9360862731933594, "epoch": 3.382393022621968, "grad_norm": 0.10466349124908447, "learning_rate": 9.181567820084234e-05, "loss": 1.3733, "mean_token_accuracy": 0.7460363939404487, "num_tokens": 891946748.0, "step": 12410 }, { "entropy": 0.942741434276104, "epoch": 3.385118560915781, "grad_norm": 0.10499139875173569, "learning_rate": 9.179919892550826e-05, "loss": 1.3775, "mean_token_accuracy": 0.74194056391716, "num_tokens": 892665500.0, "step": 12420 }, { "entropy": 0.9336649075150489, "epoch": 3.3878440992095937, "grad_norm": 0.0979248657822609, "learning_rate": 9.178270455817779e-05, "loss": 1.3603, "mean_token_accuracy": 0.7498516023159028, "num_tokens": 893401884.0, "step": 12430 }, { "entropy": 0.9364969998598098, "epoch": 3.3905696375034067, "grad_norm": 0.10366225987672806, "learning_rate": 9.176619510480642e-05, "loss": 1.3678, "mean_token_accuracy": 0.7454469427466393, "num_tokens": 894121883.0, "step": 12440 }, { "entropy": 0.9303735733032227, "epoch": 3.39329517579722, "grad_norm": 0.09294752031564713, "learning_rate": 9.174967057135501e-05, "loss": 1.3564, "mean_token_accuracy": 0.7494041442871093, "num_tokens": 894849468.0, "step": 12450 }, { "entropy": 0.932018369436264, "epoch": 3.396020714091033, "grad_norm": 0.10084271430969238, "learning_rate": 9.173313096378991e-05, "loss": 1.3702, "mean_token_accuracy": 0.7492056339979172, "num_tokens": 895566986.0, "step": 12460 }, { "entropy": 0.932258027791977, "epoch": 3.398746252384846, "grad_norm": 0.10121307522058487, "learning_rate": 9.17165762880829e-05, "loss": 1.3621, "mean_token_accuracy": 0.7474600434303283, "num_tokens": 896290691.0, "step": 12470 }, { "entropy": 0.9325224250555039, "epoch": 3.401471790678659, "grad_norm": 0.12568046152591705, "learning_rate": 9.170000655021121e-05, "loss": 1.3616, "mean_token_accuracy": 0.7490670397877693, "num_tokens": 897022185.0, "step": 12480 }, { "entropy": 0.9375859543681144, "epoch": 3.4041973289724723, "grad_norm": 0.0965314507484436, "learning_rate": 9.16834217561575e-05, "loss": 1.3769, "mean_token_accuracy": 0.7438808307051659, "num_tokens": 897741744.0, "step": 12490 }, { "entropy": 0.9329176500439644, "epoch": 3.4069228672662852, "grad_norm": 0.10663661360740662, "learning_rate": 9.166682191190986e-05, "loss": 1.3673, "mean_token_accuracy": 0.745447650551796, "num_tokens": 898456811.0, "step": 12500 }, { "entropy": 0.9322167053818703, "epoch": 3.409648405560098, "grad_norm": 0.10179069638252258, "learning_rate": 9.165020702346181e-05, "loss": 1.3663, "mean_token_accuracy": 0.745252838730812, "num_tokens": 899170032.0, "step": 12510 }, { "entropy": 0.9398092135787011, "epoch": 3.412373943853911, "grad_norm": 0.11868678778409958, "learning_rate": 9.163357709681235e-05, "loss": 1.3745, "mean_token_accuracy": 0.7410765290260315, "num_tokens": 899871591.0, "step": 12520 }, { "entropy": 0.9274461969733239, "epoch": 3.415099482147724, "grad_norm": 0.1143931970000267, "learning_rate": 9.161693213796583e-05, "loss": 1.3687, "mean_token_accuracy": 0.7493044048547745, "num_tokens": 900592996.0, "step": 12530 }, { "entropy": 0.9415442749857903, "epoch": 3.417825020441537, "grad_norm": 0.13553395867347717, "learning_rate": 9.160027215293208e-05, "loss": 1.372, "mean_token_accuracy": 0.7440562471747398, "num_tokens": 901302994.0, "step": 12540 }, { "entropy": 0.9388555884361267, "epoch": 3.4205505587353504, "grad_norm": 0.10603881627321243, "learning_rate": 9.158359714772637e-05, "loss": 1.3604, "mean_token_accuracy": 0.7457233399152756, "num_tokens": 902031397.0, "step": 12550 }, { "entropy": 0.9392382368445397, "epoch": 3.4232760970291634, "grad_norm": 0.09645843505859375, "learning_rate": 9.156690712836935e-05, "loss": 1.3786, "mean_token_accuracy": 0.7428862899541855, "num_tokens": 902736615.0, "step": 12560 }, { "entropy": 0.9384090662002563, "epoch": 3.4260016353229763, "grad_norm": 0.09202127903699875, "learning_rate": 9.155020210088711e-05, "loss": 1.367, "mean_token_accuracy": 0.7447908714413642, "num_tokens": 903456864.0, "step": 12570 }, { "entropy": 0.9301142379641533, "epoch": 3.4287271736167892, "grad_norm": 0.09689704328775406, "learning_rate": 9.153348207131115e-05, "loss": 1.3555, "mean_token_accuracy": 0.7492977052927017, "num_tokens": 904179710.0, "step": 12580 }, { "entropy": 0.9400479078292847, "epoch": 3.431452711910602, "grad_norm": 0.10009034723043442, "learning_rate": 9.15167470456784e-05, "loss": 1.3684, "mean_token_accuracy": 0.7443844601511955, "num_tokens": 904896321.0, "step": 12590 }, { "entropy": 0.9228950247168541, "epoch": 3.4341782502044156, "grad_norm": 0.09664631634950638, "learning_rate": 9.149999703003122e-05, "loss": 1.3513, "mean_token_accuracy": 0.7498526141047478, "num_tokens": 905619229.0, "step": 12600 }, { "entropy": 0.9317604154348373, "epoch": 3.4369037884982285, "grad_norm": 0.10724034905433655, "learning_rate": 9.148323203041736e-05, "loss": 1.3644, "mean_token_accuracy": 0.7476500362157822, "num_tokens": 906337838.0, "step": 12610 }, { "entropy": 0.9352495178580285, "epoch": 3.4396293267920415, "grad_norm": 0.08909676223993301, "learning_rate": 9.146645205288993e-05, "loss": 1.3701, "mean_token_accuracy": 0.7471271619200707, "num_tokens": 907062083.0, "step": 12620 }, { "entropy": 0.9326487988233566, "epoch": 3.4423548650858544, "grad_norm": 0.12836824357509613, "learning_rate": 9.144965710350756e-05, "loss": 1.3692, "mean_token_accuracy": 0.740940372645855, "num_tokens": 907756822.0, "step": 12630 }, { "entropy": 0.9410655170679092, "epoch": 3.4450804033796674, "grad_norm": 0.10784759372472763, "learning_rate": 9.14328471883342e-05, "loss": 1.362, "mean_token_accuracy": 0.7482161849737168, "num_tokens": 908488298.0, "step": 12640 }, { "entropy": 0.9392810389399529, "epoch": 3.4478059416734803, "grad_norm": 0.09571303427219391, "learning_rate": 9.141602231343922e-05, "loss": 1.3699, "mean_token_accuracy": 0.7492217555642128, "num_tokens": 909218497.0, "step": 12650 }, { "entropy": 0.9285607561469078, "epoch": 3.4505314799672937, "grad_norm": 0.09034627676010132, "learning_rate": 9.139918248489743e-05, "loss": 1.3608, "mean_token_accuracy": 0.7473503425717354, "num_tokens": 909943537.0, "step": 12660 }, { "entropy": 0.9412695676088333, "epoch": 3.4532570182611066, "grad_norm": 0.11949262022972107, "learning_rate": 9.138232770878898e-05, "loss": 1.3691, "mean_token_accuracy": 0.7450414091348648, "num_tokens": 910658971.0, "step": 12670 }, { "entropy": 0.9309820994734764, "epoch": 3.4559825565549196, "grad_norm": 0.09633857011795044, "learning_rate": 9.136545799119944e-05, "loss": 1.3564, "mean_token_accuracy": 0.7498602598905564, "num_tokens": 911387408.0, "step": 12680 }, { "entropy": 0.926887808740139, "epoch": 3.4587080948487325, "grad_norm": 0.09766601771116257, "learning_rate": 9.134857333821982e-05, "loss": 1.3693, "mean_token_accuracy": 0.7483025774359703, "num_tokens": 912102244.0, "step": 12690 }, { "entropy": 0.9397025138139725, "epoch": 3.4614336331425455, "grad_norm": 0.10852885246276855, "learning_rate": 9.133167375594647e-05, "loss": 1.3586, "mean_token_accuracy": 0.7443624779582023, "num_tokens": 912820952.0, "step": 12700 }, { "entropy": 0.9383267760276794, "epoch": 3.464159171436359, "grad_norm": 0.08960741013288498, "learning_rate": 9.131475925048112e-05, "loss": 1.3673, "mean_token_accuracy": 0.7449337512254715, "num_tokens": 913547512.0, "step": 12710 }, { "entropy": 0.936745609343052, "epoch": 3.466884709730172, "grad_norm": 0.09380835294723511, "learning_rate": 9.129782982793094e-05, "loss": 1.3694, "mean_token_accuracy": 0.7446971386671066, "num_tokens": 914260113.0, "step": 12720 }, { "entropy": 0.9339314952492714, "epoch": 3.4696102480239848, "grad_norm": 0.09022416919469833, "learning_rate": 9.128088549440844e-05, "loss": 1.3694, "mean_token_accuracy": 0.7450258255004882, "num_tokens": 914970537.0, "step": 12730 }, { "entropy": 0.9304733410477638, "epoch": 3.4723357863177977, "grad_norm": 0.10127075761556625, "learning_rate": 9.126392625603153e-05, "loss": 1.3581, "mean_token_accuracy": 0.748434054851532, "num_tokens": 915688174.0, "step": 12740 }, { "entropy": 0.9351843550801278, "epoch": 3.4750613246116107, "grad_norm": 0.09760762006044388, "learning_rate": 9.124695211892354e-05, "loss": 1.3637, "mean_token_accuracy": 0.7453558519482613, "num_tokens": 916404714.0, "step": 12750 }, { "entropy": 0.9345199972391128, "epoch": 3.4777868629054236, "grad_norm": 0.11228025704622269, "learning_rate": 9.122996308921309e-05, "loss": 1.3686, "mean_token_accuracy": 0.7460799053311348, "num_tokens": 917125300.0, "step": 12760 }, { "entropy": 0.9374775588512421, "epoch": 3.480512401199237, "grad_norm": 0.09692800045013428, "learning_rate": 9.121295917303425e-05, "loss": 1.3638, "mean_token_accuracy": 0.7440088778734207, "num_tokens": 917844430.0, "step": 12770 }, { "entropy": 0.9233436644077301, "epoch": 3.48323793949305, "grad_norm": 0.1387101709842682, "learning_rate": 9.119594037652648e-05, "loss": 1.3625, "mean_token_accuracy": 0.7465911999344825, "num_tokens": 918543912.0, "step": 12780 }, { "entropy": 0.9400423854589463, "epoch": 3.485963477786863, "grad_norm": 0.10187558084726334, "learning_rate": 9.117890670583453e-05, "loss": 1.3727, "mean_token_accuracy": 0.7459829822182655, "num_tokens": 919270358.0, "step": 12790 }, { "entropy": 0.9362019613385201, "epoch": 3.488689016080676, "grad_norm": 0.09143900871276855, "learning_rate": 9.116185816710859e-05, "loss": 1.3654, "mean_token_accuracy": 0.7460013523697853, "num_tokens": 919985986.0, "step": 12800 }, { "entropy": 0.9333808422088623, "epoch": 3.4914145543744888, "grad_norm": 0.16597706079483032, "learning_rate": 9.114479476650419e-05, "loss": 1.366, "mean_token_accuracy": 0.7485702648758888, "num_tokens": 920708294.0, "step": 12810 }, { "entropy": 0.9295020744204521, "epoch": 3.494140092668302, "grad_norm": 0.10717319697141647, "learning_rate": 9.112771651018222e-05, "loss": 1.3651, "mean_token_accuracy": 0.7482924610376358, "num_tokens": 921426520.0, "step": 12820 }, { "entropy": 0.9408106982707978, "epoch": 3.496865630962115, "grad_norm": 0.11571063101291656, "learning_rate": 9.111062340430898e-05, "loss": 1.3744, "mean_token_accuracy": 0.7441819131374359, "num_tokens": 922147846.0, "step": 12830 }, { "entropy": 0.93288584202528, "epoch": 3.499591169255928, "grad_norm": 0.09528737515211105, "learning_rate": 9.109351545505607e-05, "loss": 1.365, "mean_token_accuracy": 0.7429381534457207, "num_tokens": 922852434.0, "step": 12840 }, { "entropy": 0.9288337647914886, "epoch": 3.502316707549741, "grad_norm": 0.10257086157798767, "learning_rate": 9.107639266860048e-05, "loss": 1.3665, "mean_token_accuracy": 0.7479848623275757, "num_tokens": 923569534.0, "step": 12850 }, { "entropy": 0.9374867156147957, "epoch": 3.505042245843554, "grad_norm": 0.12302909046411514, "learning_rate": 9.105925505112459e-05, "loss": 1.3666, "mean_token_accuracy": 0.7516830086708068, "num_tokens": 924312732.0, "step": 12860 }, { "entropy": 0.9320302456617355, "epoch": 3.507767784137367, "grad_norm": 0.11141735315322876, "learning_rate": 9.104210260881603e-05, "loss": 1.3757, "mean_token_accuracy": 0.7412846013903618, "num_tokens": 925006320.0, "step": 12870 }, { "entropy": 0.9339482218027115, "epoch": 3.5104933224311803, "grad_norm": 0.13289707899093628, "learning_rate": 9.102493534786791e-05, "loss": 1.3694, "mean_token_accuracy": 0.7464481011033058, "num_tokens": 925723440.0, "step": 12880 }, { "entropy": 0.9333376854658126, "epoch": 3.5132188607249932, "grad_norm": 0.10286711156368256, "learning_rate": 9.10077532744786e-05, "loss": 1.3629, "mean_token_accuracy": 0.7458906590938568, "num_tokens": 926441778.0, "step": 12890 }, { "entropy": 0.9332393199205399, "epoch": 3.515944399018806, "grad_norm": 0.12085429579019547, "learning_rate": 9.099055639485187e-05, "loss": 1.368, "mean_token_accuracy": 0.7435436382889747, "num_tokens": 927157927.0, "step": 12900 }, { "entropy": 0.9383823603391648, "epoch": 3.518669937312619, "grad_norm": 0.09964218735694885, "learning_rate": 9.09733447151968e-05, "loss": 1.3766, "mean_token_accuracy": 0.7474200412631035, "num_tokens": 927874440.0, "step": 12910 }, { "entropy": 0.9362079545855522, "epoch": 3.5213954756064325, "grad_norm": 0.09498178213834763, "learning_rate": 9.095611824172785e-05, "loss": 1.3645, "mean_token_accuracy": 0.7498639911413193, "num_tokens": 928605569.0, "step": 12920 }, { "entropy": 0.926796767115593, "epoch": 3.5241210139002455, "grad_norm": 0.10993527621030807, "learning_rate": 9.09388769806648e-05, "loss": 1.3565, "mean_token_accuracy": 0.7513145238161087, "num_tokens": 929341369.0, "step": 12930 }, { "entropy": 0.9336249455809593, "epoch": 3.5268465521940584, "grad_norm": 0.09894877672195435, "learning_rate": 9.092162093823274e-05, "loss": 1.3683, "mean_token_accuracy": 0.7437681227922439, "num_tokens": 930057958.0, "step": 12940 }, { "entropy": 0.9399918019771576, "epoch": 3.5295720904878713, "grad_norm": 0.09787449240684509, "learning_rate": 9.090435012066214e-05, "loss": 1.3733, "mean_token_accuracy": 0.7445860520005226, "num_tokens": 930771529.0, "step": 12950 }, { "entropy": 0.9386146873235702, "epoch": 3.5322976287816843, "grad_norm": 0.11092506349086761, "learning_rate": 9.088706453418881e-05, "loss": 1.3753, "mean_token_accuracy": 0.7453641518950462, "num_tokens": 931482333.0, "step": 12960 }, { "entropy": 0.9318419069051742, "epoch": 3.5350231670754972, "grad_norm": 0.11447679996490479, "learning_rate": 9.086976418505386e-05, "loss": 1.3583, "mean_token_accuracy": 0.7467338860034942, "num_tokens": 932214332.0, "step": 12970 }, { "entropy": 0.9419029995799064, "epoch": 3.53774870536931, "grad_norm": 0.10076761245727539, "learning_rate": 9.085244907950377e-05, "loss": 1.3798, "mean_token_accuracy": 0.7389994010329246, "num_tokens": 932917557.0, "step": 12980 }, { "entropy": 0.9376365810632705, "epoch": 3.5404742436631236, "grad_norm": 0.1359153538942337, "learning_rate": 9.083511922379027e-05, "loss": 1.3728, "mean_token_accuracy": 0.7453759759664536, "num_tokens": 933632139.0, "step": 12990 }, { "entropy": 0.9354806005954742, "epoch": 3.5431997819569365, "grad_norm": 0.1105719730257988, "learning_rate": 9.081777462417052e-05, "loss": 1.3637, "mean_token_accuracy": 0.7441539481282234, "num_tokens": 934349014.0, "step": 13000 }, { "entropy": 0.9374251648783684, "epoch": 3.5459253202507495, "grad_norm": 0.12063316255807877, "learning_rate": 9.080041528690693e-05, "loss": 1.3637, "mean_token_accuracy": 0.7513807326555252, "num_tokens": 935097758.0, "step": 13010 }, { "entropy": 0.9375441312789917, "epoch": 3.5486508585445624, "grad_norm": 0.09859773516654968, "learning_rate": 9.078304121826724e-05, "loss": 1.3669, "mean_token_accuracy": 0.7448895171284675, "num_tokens": 935816503.0, "step": 13020 }, { "entropy": 0.9408703297376633, "epoch": 3.551376396838376, "grad_norm": 0.18847866356372833, "learning_rate": 9.076565242452455e-05, "loss": 1.3767, "mean_token_accuracy": 0.7430540844798088, "num_tokens": 936524438.0, "step": 13030 }, { "entropy": 0.9380682498216629, "epoch": 3.5541019351321887, "grad_norm": 0.11309590190649033, "learning_rate": 9.074824891195724e-05, "loss": 1.3647, "mean_token_accuracy": 0.7467644423246383, "num_tokens": 937248736.0, "step": 13040 }, { "entropy": 0.931859764456749, "epoch": 3.5568274734260017, "grad_norm": 0.09613960981369019, "learning_rate": 9.0730830686849e-05, "loss": 1.361, "mean_token_accuracy": 0.74162005931139, "num_tokens": 937957425.0, "step": 13050 }, { "entropy": 0.9350968182086945, "epoch": 3.5595530117198146, "grad_norm": 0.11296644061803818, "learning_rate": 9.071339775548886e-05, "loss": 1.3666, "mean_token_accuracy": 0.7488053023815155, "num_tokens": 938676202.0, "step": 13060 }, { "entropy": 0.9332686677575112, "epoch": 3.5622785500136276, "grad_norm": 0.10304231196641922, "learning_rate": 9.069595012417114e-05, "loss": 1.3547, "mean_token_accuracy": 0.7482245922088623, "num_tokens": 939400336.0, "step": 13070 }, { "entropy": 0.9414921462535858, "epoch": 3.5650040883074405, "grad_norm": 0.11928173899650574, "learning_rate": 9.067848779919546e-05, "loss": 1.376, "mean_token_accuracy": 0.7430342525243759, "num_tokens": 940115055.0, "step": 13080 }, { "entropy": 0.9392595738172531, "epoch": 3.5677296266012535, "grad_norm": 0.12385665625333786, "learning_rate": 9.066101078686677e-05, "loss": 1.3773, "mean_token_accuracy": 0.741777703166008, "num_tokens": 940818450.0, "step": 13090 }, { "entropy": 0.941134275496006, "epoch": 3.570455164895067, "grad_norm": 0.11523745208978653, "learning_rate": 9.064351909349531e-05, "loss": 1.3672, "mean_token_accuracy": 0.7461943909525871, "num_tokens": 941552084.0, "step": 13100 }, { "entropy": 0.9355636045336724, "epoch": 3.57318070318888, "grad_norm": 0.1081465482711792, "learning_rate": 9.062601272539662e-05, "loss": 1.3623, "mean_token_accuracy": 0.7465676367282867, "num_tokens": 942269624.0, "step": 13110 }, { "entropy": 0.9370079949498177, "epoch": 3.5759062414826928, "grad_norm": 0.10074573755264282, "learning_rate": 9.060849168889154e-05, "loss": 1.3791, "mean_token_accuracy": 0.7425153732299805, "num_tokens": 942969526.0, "step": 13120 }, { "entropy": 0.933417497575283, "epoch": 3.5786317797765057, "grad_norm": 0.1655840426683426, "learning_rate": 9.05909559903062e-05, "loss": 1.3626, "mean_token_accuracy": 0.7470695838332176, "num_tokens": 943692226.0, "step": 13130 }, { "entropy": 0.9250888034701348, "epoch": 3.581357318070319, "grad_norm": 0.13959792256355286, "learning_rate": 9.057340563597205e-05, "loss": 1.3594, "mean_token_accuracy": 0.7487790286540985, "num_tokens": 944415749.0, "step": 13140 }, { "entropy": 0.9316915094852447, "epoch": 3.584082856364132, "grad_norm": 0.1401204615831375, "learning_rate": 9.055584063222579e-05, "loss": 1.3663, "mean_token_accuracy": 0.7429968804121018, "num_tokens": 945119302.0, "step": 13150 }, { "entropy": 0.9314353331923485, "epoch": 3.586808394657945, "grad_norm": 0.09463392198085785, "learning_rate": 9.053826098540942e-05, "loss": 1.3652, "mean_token_accuracy": 0.7450727388262749, "num_tokens": 945824979.0, "step": 13160 }, { "entropy": 0.9322601348161698, "epoch": 3.589533932951758, "grad_norm": 0.10104291886091232, "learning_rate": 9.05206667018703e-05, "loss": 1.3625, "mean_token_accuracy": 0.7483246713876724, "num_tokens": 946550467.0, "step": 13170 }, { "entropy": 0.9309192970395088, "epoch": 3.592259471245571, "grad_norm": 0.10341756790876389, "learning_rate": 9.050305778796094e-05, "loss": 1.362, "mean_token_accuracy": 0.7465433076024055, "num_tokens": 947271473.0, "step": 13180 }, { "entropy": 0.9290094763040543, "epoch": 3.594985009539384, "grad_norm": 0.09247362613677979, "learning_rate": 9.048543425003923e-05, "loss": 1.3598, "mean_token_accuracy": 0.7471193477511406, "num_tokens": 947997230.0, "step": 13190 }, { "entropy": 0.9424288645386696, "epoch": 3.597710547833197, "grad_norm": 0.09236718714237213, "learning_rate": 9.046779609446834e-05, "loss": 1.3648, "mean_token_accuracy": 0.7454434633255005, "num_tokens": 948727995.0, "step": 13200 }, { "entropy": 0.9284640043973923, "epoch": 3.60043608612701, "grad_norm": 0.10414078086614609, "learning_rate": 9.045014332761665e-05, "loss": 1.3612, "mean_token_accuracy": 0.7465564653277397, "num_tokens": 949445614.0, "step": 13210 }, { "entropy": 0.9378997027873993, "epoch": 3.603161624420823, "grad_norm": 0.12277641892433167, "learning_rate": 9.043247595585789e-05, "loss": 1.3739, "mean_token_accuracy": 0.7436944678425789, "num_tokens": 950156224.0, "step": 13220 }, { "entropy": 0.9347283899784088, "epoch": 3.605887162714636, "grad_norm": 0.09808440506458282, "learning_rate": 9.041479398557102e-05, "loss": 1.363, "mean_token_accuracy": 0.7425682976841926, "num_tokens": 950874203.0, "step": 13230 }, { "entropy": 0.9326068714261055, "epoch": 3.6086127010084494, "grad_norm": 0.10203598439693451, "learning_rate": 9.03970974231403e-05, "loss": 1.357, "mean_token_accuracy": 0.7526075363159179, "num_tokens": 951618096.0, "step": 13240 }, { "entropy": 0.9280758410692215, "epoch": 3.6113382393022624, "grad_norm": 0.11678113788366318, "learning_rate": 9.037938627495521e-05, "loss": 1.3632, "mean_token_accuracy": 0.7487672224640847, "num_tokens": 952333770.0, "step": 13250 }, { "entropy": 0.9286215782165528, "epoch": 3.6140637775960753, "grad_norm": 0.107167087495327, "learning_rate": 9.036166054741055e-05, "loss": 1.3656, "mean_token_accuracy": 0.7437203407287598, "num_tokens": 953043793.0, "step": 13260 }, { "entropy": 0.9332890540361405, "epoch": 3.6167893158898883, "grad_norm": 0.08996494859457016, "learning_rate": 9.034392024690636e-05, "loss": 1.3652, "mean_token_accuracy": 0.7491186946630478, "num_tokens": 953771556.0, "step": 13270 }, { "entropy": 0.9364136576652526, "epoch": 3.6195148541837012, "grad_norm": 0.10558682680130005, "learning_rate": 9.032616537984792e-05, "loss": 1.3694, "mean_token_accuracy": 0.7433787032961845, "num_tokens": 954468628.0, "step": 13280 }, { "entropy": 0.9318516358733178, "epoch": 3.622240392477514, "grad_norm": 0.09815244376659393, "learning_rate": 9.030839595264584e-05, "loss": 1.365, "mean_token_accuracy": 0.7461149856448174, "num_tokens": 955179194.0, "step": 13290 }, { "entropy": 0.9292657166719437, "epoch": 3.624965930771327, "grad_norm": 0.09705313295125961, "learning_rate": 9.029061197171589e-05, "loss": 1.3623, "mean_token_accuracy": 0.7456430450081826, "num_tokens": 955893302.0, "step": 13300 }, { "entropy": 0.9309269085526466, "epoch": 3.6276914690651405, "grad_norm": 0.11863958090543747, "learning_rate": 9.027281344347918e-05, "loss": 1.3595, "mean_token_accuracy": 0.7468349114060402, "num_tokens": 956624858.0, "step": 13310 }, { "entropy": 0.934124930202961, "epoch": 3.6304170073589535, "grad_norm": 0.1297106146812439, "learning_rate": 9.025500037436202e-05, "loss": 1.368, "mean_token_accuracy": 0.7464649736881256, "num_tokens": 957347468.0, "step": 13320 }, { "entropy": 0.932029339671135, "epoch": 3.6331425456527664, "grad_norm": 0.10935456305742264, "learning_rate": 9.0237172770796e-05, "loss": 1.3577, "mean_token_accuracy": 0.7451001316308975, "num_tokens": 958056962.0, "step": 13330 }, { "entropy": 0.938096997141838, "epoch": 3.6358680839465793, "grad_norm": 0.15865057706832886, "learning_rate": 9.021933063921792e-05, "loss": 1.3714, "mean_token_accuracy": 0.7457519054412842, "num_tokens": 958779703.0, "step": 13340 }, { "entropy": 0.9339332118630409, "epoch": 3.6385936222403927, "grad_norm": 0.09937279671430588, "learning_rate": 9.020147398606987e-05, "loss": 1.3697, "mean_token_accuracy": 0.7467718929052353, "num_tokens": 959501476.0, "step": 13350 }, { "entropy": 0.9396980375051498, "epoch": 3.6413191605342057, "grad_norm": 0.11709866672754288, "learning_rate": 9.018360281779916e-05, "loss": 1.3692, "mean_token_accuracy": 0.7415199279785156, "num_tokens": 960208830.0, "step": 13360 }, { "entropy": 0.9336515188217163, "epoch": 3.6440446988280186, "grad_norm": 0.10379207134246826, "learning_rate": 9.016571714085835e-05, "loss": 1.36, "mean_token_accuracy": 0.7475280880928039, "num_tokens": 960936444.0, "step": 13370 }, { "entropy": 0.9317442283034325, "epoch": 3.6467702371218316, "grad_norm": 0.2132408767938614, "learning_rate": 9.014781696170522e-05, "loss": 1.3581, "mean_token_accuracy": 0.7497346103191376, "num_tokens": 961664188.0, "step": 13380 }, { "entropy": 0.9318334341049195, "epoch": 3.6494957754156445, "grad_norm": 0.09681301563978195, "learning_rate": 9.012990228680281e-05, "loss": 1.3658, "mean_token_accuracy": 0.7463125616312027, "num_tokens": 962383028.0, "step": 13390 }, { "entropy": 0.9316603437066078, "epoch": 3.6522213137094575, "grad_norm": 0.0922931507229805, "learning_rate": 9.011197312261938e-05, "loss": 1.3604, "mean_token_accuracy": 0.7499169021844864, "num_tokens": 963118555.0, "step": 13400 }, { "entropy": 0.9345208585262299, "epoch": 3.6549468520032704, "grad_norm": 0.10234454274177551, "learning_rate": 9.009402947562842e-05, "loss": 1.3572, "mean_token_accuracy": 0.7530842050909996, "num_tokens": 963860509.0, "step": 13410 }, { "entropy": 0.9333072051405906, "epoch": 3.657672390297084, "grad_norm": 0.26790082454681396, "learning_rate": 9.007607135230866e-05, "loss": 1.3628, "mean_token_accuracy": 0.7466099947690964, "num_tokens": 964578383.0, "step": 13420 }, { "entropy": 0.9337391629815102, "epoch": 3.6603979285908967, "grad_norm": 0.11218128353357315, "learning_rate": 9.005809875914406e-05, "loss": 1.3629, "mean_token_accuracy": 0.7469859942793846, "num_tokens": 965304208.0, "step": 13430 }, { "entropy": 0.9428641706705093, "epoch": 3.6631234668847097, "grad_norm": 0.10984963923692703, "learning_rate": 9.004011170262377e-05, "loss": 1.3796, "mean_token_accuracy": 0.7463513821363449, "num_tokens": 966032331.0, "step": 13440 }, { "entropy": 0.935543717443943, "epoch": 3.6658490051785226, "grad_norm": 0.1488730013370514, "learning_rate": 9.00221101892422e-05, "loss": 1.3682, "mean_token_accuracy": 0.7450001835823059, "num_tokens": 966741432.0, "step": 13450 }, { "entropy": 0.9354455277323723, "epoch": 3.668574543472336, "grad_norm": 0.09760552644729614, "learning_rate": 9.000409422549897e-05, "loss": 1.3604, "mean_token_accuracy": 0.7469463601708413, "num_tokens": 967463277.0, "step": 13460 }, { "entropy": 0.9351951852440834, "epoch": 3.671300081766149, "grad_norm": 0.09895797818899155, "learning_rate": 8.998606381789891e-05, "loss": 1.3709, "mean_token_accuracy": 0.745685450732708, "num_tokens": 968189722.0, "step": 13470 }, { "entropy": 0.9256167277693749, "epoch": 3.674025620059962, "grad_norm": 0.13834929466247559, "learning_rate": 8.996801897295206e-05, "loss": 1.3558, "mean_token_accuracy": 0.7506679490208625, "num_tokens": 968906248.0, "step": 13480 }, { "entropy": 0.933958075940609, "epoch": 3.676751158353775, "grad_norm": 0.12164489179849625, "learning_rate": 8.99499596971737e-05, "loss": 1.3721, "mean_token_accuracy": 0.7465602666139602, "num_tokens": 969633809.0, "step": 13490 }, { "entropy": 0.9461019173264503, "epoch": 3.679476696647588, "grad_norm": 0.1290566474199295, "learning_rate": 8.99318859970843e-05, "loss": 1.3738, "mean_token_accuracy": 0.7392740756273269, "num_tokens": 970329287.0, "step": 13500 }, { "entropy": 0.9286004945635795, "epoch": 3.6822022349414008, "grad_norm": 0.11958316713571548, "learning_rate": 8.991379787920952e-05, "loss": 1.3624, "mean_token_accuracy": 0.7454740762710571, "num_tokens": 971039204.0, "step": 13510 }, { "entropy": 0.9378550440073014, "epoch": 3.6849277732352137, "grad_norm": 0.12413039058446884, "learning_rate": 8.989569535008027e-05, "loss": 1.3705, "mean_token_accuracy": 0.7478660434484482, "num_tokens": 971767195.0, "step": 13520 }, { "entropy": 0.9414548948407173, "epoch": 3.687653311529027, "grad_norm": 0.1187831312417984, "learning_rate": 8.987757841623263e-05, "loss": 1.3679, "mean_token_accuracy": 0.7386318236589432, "num_tokens": 972477428.0, "step": 13530 }, { "entropy": 0.9377189055085182, "epoch": 3.69037884982284, "grad_norm": 0.10989218950271606, "learning_rate": 8.98594470842079e-05, "loss": 1.3717, "mean_token_accuracy": 0.7464066311717034, "num_tokens": 973195901.0, "step": 13540 }, { "entropy": 0.9250073865056038, "epoch": 3.693104388116653, "grad_norm": 0.11505521088838577, "learning_rate": 8.984130136055256e-05, "loss": 1.3665, "mean_token_accuracy": 0.7527343273162842, "num_tokens": 973919654.0, "step": 13550 }, { "entropy": 0.9378981202840805, "epoch": 3.695829926410466, "grad_norm": 0.10788934677839279, "learning_rate": 8.982314125181828e-05, "loss": 1.3651, "mean_token_accuracy": 0.7484021842479706, "num_tokens": 974654678.0, "step": 13560 }, { "entropy": 0.9401387721300125, "epoch": 3.6985554647042793, "grad_norm": 0.1131954938173294, "learning_rate": 8.980496676456196e-05, "loss": 1.3701, "mean_token_accuracy": 0.7417485862970352, "num_tokens": 975374744.0, "step": 13570 }, { "entropy": 0.926028548181057, "epoch": 3.7012810029980923, "grad_norm": 0.10438834875822067, "learning_rate": 8.978677790534566e-05, "loss": 1.3645, "mean_token_accuracy": 0.7438564658164978, "num_tokens": 976083178.0, "step": 13580 }, { "entropy": 0.9385993152856826, "epoch": 3.704006541291905, "grad_norm": 0.09293225407600403, "learning_rate": 8.976857468073664e-05, "loss": 1.3676, "mean_token_accuracy": 0.7446450099349022, "num_tokens": 976801711.0, "step": 13590 }, { "entropy": 0.9331994846463203, "epoch": 3.706732079585718, "grad_norm": 0.12272260338068008, "learning_rate": 8.975035709730737e-05, "loss": 1.3578, "mean_token_accuracy": 0.7492441236972809, "num_tokens": 977538379.0, "step": 13600 }, { "entropy": 0.9382228672504425, "epoch": 3.709457617879531, "grad_norm": 0.1115153357386589, "learning_rate": 8.973212516163545e-05, "loss": 1.3662, "mean_token_accuracy": 0.7477366283535958, "num_tokens": 978274991.0, "step": 13610 }, { "entropy": 0.9352905541658402, "epoch": 3.712183156173344, "grad_norm": 0.11782050132751465, "learning_rate": 8.971387888030371e-05, "loss": 1.3645, "mean_token_accuracy": 0.7457715913653373, "num_tokens": 978996771.0, "step": 13620 }, { "entropy": 0.9319099530577659, "epoch": 3.714908694467157, "grad_norm": 0.09972216933965683, "learning_rate": 8.969561825990013e-05, "loss": 1.3648, "mean_token_accuracy": 0.7467517778277397, "num_tokens": 979717813.0, "step": 13630 }, { "entropy": 0.9356176108121872, "epoch": 3.7176342327609704, "grad_norm": 0.10494368523359299, "learning_rate": 8.967734330701791e-05, "loss": 1.3601, "mean_token_accuracy": 0.7447285264730453, "num_tokens": 980438185.0, "step": 13640 }, { "entropy": 0.9377966582775116, "epoch": 3.7203597710547833, "grad_norm": 0.09992780536413193, "learning_rate": 8.965905402825536e-05, "loss": 1.3628, "mean_token_accuracy": 0.7456589475274086, "num_tokens": 981161128.0, "step": 13650 }, { "entropy": 0.9311361506581306, "epoch": 3.7230853093485963, "grad_norm": 0.12282440811395645, "learning_rate": 8.9640750430216e-05, "loss": 1.3618, "mean_token_accuracy": 0.7463863477110863, "num_tokens": 981881084.0, "step": 13660 }, { "entropy": 0.9404643461108207, "epoch": 3.725810847642409, "grad_norm": 0.0928298830986023, "learning_rate": 8.962243251950852e-05, "loss": 1.3635, "mean_token_accuracy": 0.7443462312221527, "num_tokens": 982606770.0, "step": 13670 }, { "entropy": 0.9373415976762771, "epoch": 3.7285363859362226, "grad_norm": 0.09752299636602402, "learning_rate": 8.960410030274681e-05, "loss": 1.3663, "mean_token_accuracy": 0.7402950346469879, "num_tokens": 983310616.0, "step": 13680 }, { "entropy": 0.939019364118576, "epoch": 3.7312619242300356, "grad_norm": 0.09725892543792725, "learning_rate": 8.958575378654984e-05, "loss": 1.3708, "mean_token_accuracy": 0.7425294920802117, "num_tokens": 984025069.0, "step": 13690 }, { "entropy": 0.9378419637680053, "epoch": 3.7339874625238485, "grad_norm": 0.1080869808793068, "learning_rate": 8.956739297754182e-05, "loss": 1.3785, "mean_token_accuracy": 0.7412189736962318, "num_tokens": 984727533.0, "step": 13700 }, { "entropy": 0.940848433971405, "epoch": 3.7367130008176614, "grad_norm": 0.0943247526884079, "learning_rate": 8.95490178823521e-05, "loss": 1.3672, "mean_token_accuracy": 0.7435140967369079, "num_tokens": 985456228.0, "step": 13710 }, { "entropy": 0.940029938519001, "epoch": 3.7394385391114744, "grad_norm": 0.09355151653289795, "learning_rate": 8.953062850761515e-05, "loss": 1.3708, "mean_token_accuracy": 0.7490209862589836, "num_tokens": 986183257.0, "step": 13720 }, { "entropy": 0.9465588822960853, "epoch": 3.7421640774052873, "grad_norm": 0.09960291534662247, "learning_rate": 8.951222485997066e-05, "loss": 1.3769, "mean_token_accuracy": 0.7437508583068848, "num_tokens": 986903930.0, "step": 13730 }, { "entropy": 0.9407746538519859, "epoch": 3.7448896156991007, "grad_norm": 0.09473884105682373, "learning_rate": 8.949380694606344e-05, "loss": 1.372, "mean_token_accuracy": 0.7417246505618096, "num_tokens": 987615662.0, "step": 13740 }, { "entropy": 0.938712403178215, "epoch": 3.7476151539929137, "grad_norm": 0.117513507604599, "learning_rate": 8.947537477254344e-05, "loss": 1.3651, "mean_token_accuracy": 0.7487455070018768, "num_tokens": 988348914.0, "step": 13750 }, { "entropy": 0.9397893026471138, "epoch": 3.7503406922867266, "grad_norm": 0.1013086810708046, "learning_rate": 8.945692834606576e-05, "loss": 1.3685, "mean_token_accuracy": 0.7428163930773735, "num_tokens": 989065170.0, "step": 13760 }, { "entropy": 0.9395933210849762, "epoch": 3.7530662305805396, "grad_norm": 0.10276360809803009, "learning_rate": 8.943846767329067e-05, "loss": 1.3702, "mean_token_accuracy": 0.7439565107226371, "num_tokens": 989782054.0, "step": 13770 }, { "entropy": 0.9382280990481376, "epoch": 3.755791768874353, "grad_norm": 0.09564198553562164, "learning_rate": 8.941999276088357e-05, "loss": 1.3649, "mean_token_accuracy": 0.7506726637482644, "num_tokens": 990523711.0, "step": 13780 }, { "entropy": 0.9305368557572364, "epoch": 3.758517307168166, "grad_norm": 0.09616661071777344, "learning_rate": 8.940150361551502e-05, "loss": 1.3535, "mean_token_accuracy": 0.7454472824931144, "num_tokens": 991238524.0, "step": 13790 }, { "entropy": 0.9342294216156006, "epoch": 3.761242845461979, "grad_norm": 0.09664113819599152, "learning_rate": 8.938300024386067e-05, "loss": 1.3686, "mean_token_accuracy": 0.7458544835448265, "num_tokens": 991959601.0, "step": 13800 }, { "entropy": 0.9341562122106553, "epoch": 3.763968383755792, "grad_norm": 0.09050773084163666, "learning_rate": 8.936448265260135e-05, "loss": 1.3635, "mean_token_accuracy": 0.7478775039315224, "num_tokens": 992690565.0, "step": 13810 }, { "entropy": 0.934185953438282, "epoch": 3.7666939220496047, "grad_norm": 0.09130620956420898, "learning_rate": 8.934595084842302e-05, "loss": 1.3651, "mean_token_accuracy": 0.746742396056652, "num_tokens": 993407699.0, "step": 13820 }, { "entropy": 0.9289571881294251, "epoch": 3.7694194603434177, "grad_norm": 0.11175952851772308, "learning_rate": 8.932740483801675e-05, "loss": 1.371, "mean_token_accuracy": 0.7462221279740333, "num_tokens": 994120106.0, "step": 13830 }, { "entropy": 0.9358081087470055, "epoch": 3.7721449986372306, "grad_norm": 0.11956287920475006, "learning_rate": 8.930884462807876e-05, "loss": 1.367, "mean_token_accuracy": 0.7460283309221267, "num_tokens": 994832393.0, "step": 13840 }, { "entropy": 0.9386581629514694, "epoch": 3.774870536931044, "grad_norm": 0.11503902822732925, "learning_rate": 8.92902702253104e-05, "loss": 1.3646, "mean_token_accuracy": 0.74471585303545, "num_tokens": 995559272.0, "step": 13850 }, { "entropy": 0.9225244998931885, "epoch": 3.777596075224857, "grad_norm": 0.09499411284923553, "learning_rate": 8.92716816364181e-05, "loss": 1.3568, "mean_token_accuracy": 0.752425593137741, "num_tokens": 996284236.0, "step": 13860 }, { "entropy": 0.9270935028791427, "epoch": 3.78032161351867, "grad_norm": 0.11209368705749512, "learning_rate": 8.925307886811348e-05, "loss": 1.3545, "mean_token_accuracy": 0.7520903870463371, "num_tokens": 997026655.0, "step": 13870 }, { "entropy": 0.9376581728458404, "epoch": 3.783047151812483, "grad_norm": 0.10614333301782608, "learning_rate": 8.923446192711323e-05, "loss": 1.3647, "mean_token_accuracy": 0.7438096687197685, "num_tokens": 997748050.0, "step": 13880 }, { "entropy": 0.9339435130357743, "epoch": 3.7857726901062962, "grad_norm": 0.11074935644865036, "learning_rate": 8.921583082013917e-05, "loss": 1.3723, "mean_token_accuracy": 0.7464756935834884, "num_tokens": 998459595.0, "step": 13890 }, { "entropy": 0.9401899024844169, "epoch": 3.788498228400109, "grad_norm": 0.11788266897201538, "learning_rate": 8.919718555391825e-05, "loss": 1.371, "mean_token_accuracy": 0.7440694138407707, "num_tokens": 999175251.0, "step": 13900 }, { "entropy": 0.9381234616041183, "epoch": 3.791223766693922, "grad_norm": 0.11436308175325394, "learning_rate": 8.917852613518252e-05, "loss": 1.3626, "mean_token_accuracy": 0.7457627654075623, "num_tokens": 999894200.0, "step": 13910 }, { "entropy": 0.9294078722596169, "epoch": 3.793949304987735, "grad_norm": 0.21421048045158386, "learning_rate": 8.915985257066912e-05, "loss": 1.3555, "mean_token_accuracy": 0.7505694150924682, "num_tokens": 1000616684.0, "step": 13920 }, { "entropy": 0.9338700622320175, "epoch": 3.796674843281548, "grad_norm": 0.10059638321399689, "learning_rate": 8.914116486712034e-05, "loss": 1.3789, "mean_token_accuracy": 0.7447562694549561, "num_tokens": 1001323188.0, "step": 13930 }, { "entropy": 0.9370212912559509, "epoch": 3.799400381575361, "grad_norm": 0.1040932834148407, "learning_rate": 8.912246303128353e-05, "loss": 1.371, "mean_token_accuracy": 0.7461760893464089, "num_tokens": 1002042069.0, "step": 13940 }, { "entropy": 0.9390333220362663, "epoch": 3.802125919869174, "grad_norm": 0.11725642532110214, "learning_rate": 8.910374706991119e-05, "loss": 1.3687, "mean_token_accuracy": 0.7445036932826042, "num_tokens": 1002760744.0, "step": 13950 }, { "entropy": 0.9299334555864334, "epoch": 3.8048514581629873, "grad_norm": 0.09295396506786346, "learning_rate": 8.908501698976087e-05, "loss": 1.3592, "mean_token_accuracy": 0.7487318173050881, "num_tokens": 1003497885.0, "step": 13960 }, { "entropy": 0.933466374874115, "epoch": 3.8075769964568003, "grad_norm": 0.09541443735361099, "learning_rate": 8.906627279759527e-05, "loss": 1.3712, "mean_token_accuracy": 0.7474435135722161, "num_tokens": 1004218492.0, "step": 13970 }, { "entropy": 0.9383569300174713, "epoch": 3.810302534750613, "grad_norm": 0.10156364738941193, "learning_rate": 8.904751450018213e-05, "loss": 1.3726, "mean_token_accuracy": 0.743280728161335, "num_tokens": 1004933440.0, "step": 13980 }, { "entropy": 0.9356719806790352, "epoch": 3.813028073044426, "grad_norm": 0.09579475224018097, "learning_rate": 8.902874210429433e-05, "loss": 1.3691, "mean_token_accuracy": 0.7394178152084351, "num_tokens": 1005627879.0, "step": 13990 }, { "entropy": 0.9362627252936363, "epoch": 3.8157536113382395, "grad_norm": 0.11506523191928864, "learning_rate": 8.900995561670982e-05, "loss": 1.3698, "mean_token_accuracy": 0.7435395658016205, "num_tokens": 1006338691.0, "step": 14000 }, { "entropy": 0.9338663190603256, "epoch": 3.8184791496320525, "grad_norm": 0.11216975748538971, "learning_rate": 8.899115504421163e-05, "loss": 1.3698, "mean_token_accuracy": 0.7448881000280381, "num_tokens": 1007054215.0, "step": 14010 }, { "entropy": 0.9339838832616806, "epoch": 3.8212046879258654, "grad_norm": 0.10040973871946335, "learning_rate": 8.897234039358788e-05, "loss": 1.369, "mean_token_accuracy": 0.7447676122188568, "num_tokens": 1007770956.0, "step": 14020 }, { "entropy": 0.9418065786361695, "epoch": 3.8239302262196784, "grad_norm": 0.13536158204078674, "learning_rate": 8.89535116716318e-05, "loss": 1.3724, "mean_token_accuracy": 0.7403697341680526, "num_tokens": 1008480927.0, "step": 14030 }, { "entropy": 0.9388413935899734, "epoch": 3.8266557645134913, "grad_norm": 0.11635293811559677, "learning_rate": 8.893466888514166e-05, "loss": 1.3625, "mean_token_accuracy": 0.7449570685625077, "num_tokens": 1009204090.0, "step": 14040 }, { "entropy": 0.9321177437901497, "epoch": 3.8293813028073043, "grad_norm": 0.09772279858589172, "learning_rate": 8.891581204092082e-05, "loss": 1.3646, "mean_token_accuracy": 0.7463148146867752, "num_tokens": 1009911598.0, "step": 14050 }, { "entropy": 0.9374329909682274, "epoch": 3.832106841101117, "grad_norm": 0.11084318906068802, "learning_rate": 8.889694114577775e-05, "loss": 1.3661, "mean_token_accuracy": 0.7407725945115089, "num_tokens": 1010621501.0, "step": 14060 }, { "entropy": 0.9294513553380966, "epoch": 3.8348323793949306, "grad_norm": 0.10921177268028259, "learning_rate": 8.887805620652594e-05, "loss": 1.3571, "mean_token_accuracy": 0.7473160177469254, "num_tokens": 1011342256.0, "step": 14070 }, { "entropy": 0.9304768949747085, "epoch": 3.8375579176887435, "grad_norm": 0.10380905121564865, "learning_rate": 8.885915722998397e-05, "loss": 1.3572, "mean_token_accuracy": 0.7482482895255089, "num_tokens": 1012074120.0, "step": 14080 }, { "entropy": 0.9284890264272689, "epoch": 3.8402834559825565, "grad_norm": 0.13911332190036774, "learning_rate": 8.884024422297554e-05, "loss": 1.3566, "mean_token_accuracy": 0.7471239194273949, "num_tokens": 1012793907.0, "step": 14090 }, { "entropy": 0.9393092960119247, "epoch": 3.8430089942763694, "grad_norm": 0.09279873222112656, "learning_rate": 8.882131719232931e-05, "loss": 1.3779, "mean_token_accuracy": 0.7415623143315315, "num_tokens": 1013501994.0, "step": 14100 }, { "entropy": 0.9343925014138221, "epoch": 3.845734532570183, "grad_norm": 0.09034982323646545, "learning_rate": 8.88023761448791e-05, "loss": 1.3649, "mean_token_accuracy": 0.7445397362112999, "num_tokens": 1014218259.0, "step": 14110 }, { "entropy": 0.9327856689691544, "epoch": 3.8484600708639958, "grad_norm": 0.0893806740641594, "learning_rate": 8.878342108746376e-05, "loss": 1.358, "mean_token_accuracy": 0.7467462152242661, "num_tokens": 1014952851.0, "step": 14120 }, { "entropy": 0.9390118673443795, "epoch": 3.8511856091578087, "grad_norm": 0.09976877272129059, "learning_rate": 8.876445202692718e-05, "loss": 1.3802, "mean_token_accuracy": 0.7416260406374932, "num_tokens": 1015654570.0, "step": 14130 }, { "entropy": 0.9356285601854324, "epoch": 3.8539111474516217, "grad_norm": 0.10243332386016846, "learning_rate": 8.87454689701183e-05, "loss": 1.375, "mean_token_accuracy": 0.746172621846199, "num_tokens": 1016358198.0, "step": 14140 }, { "entropy": 0.9294085711240768, "epoch": 3.8566366857454346, "grad_norm": 0.09295210987329483, "learning_rate": 8.872647192389116e-05, "loss": 1.3641, "mean_token_accuracy": 0.7533378571271896, "num_tokens": 1017094863.0, "step": 14150 }, { "entropy": 0.9439266920089722, "epoch": 3.8593622240392476, "grad_norm": 0.09859906136989594, "learning_rate": 8.870746089510483e-05, "loss": 1.3711, "mean_token_accuracy": 0.7427625700831413, "num_tokens": 1017813914.0, "step": 14160 }, { "entropy": 0.9340645805001259, "epoch": 3.8620877623330605, "grad_norm": 0.10231931507587433, "learning_rate": 8.868843589062339e-05, "loss": 1.3664, "mean_token_accuracy": 0.7411572426557541, "num_tokens": 1018514100.0, "step": 14170 }, { "entropy": 0.9348044991493225, "epoch": 3.864813300626874, "grad_norm": 0.14001119136810303, "learning_rate": 8.866939691731602e-05, "loss": 1.3619, "mean_token_accuracy": 0.7476312294602394, "num_tokens": 1019237095.0, "step": 14180 }, { "entropy": 0.9391373217105865, "epoch": 3.867538838920687, "grad_norm": 0.10235296189785004, "learning_rate": 8.865034398205691e-05, "loss": 1.3682, "mean_token_accuracy": 0.7420408949255943, "num_tokens": 1019950758.0, "step": 14190 }, { "entropy": 0.9349862739443779, "epoch": 3.8702643772145, "grad_norm": 0.10233399271965027, "learning_rate": 8.86312770917253e-05, "loss": 1.3654, "mean_token_accuracy": 0.7470587983727455, "num_tokens": 1020674235.0, "step": 14200 }, { "entropy": 0.9225364670157432, "epoch": 3.8729899155083127, "grad_norm": 0.11236976832151413, "learning_rate": 8.86121962532055e-05, "loss": 1.3612, "mean_token_accuracy": 0.7503849059343338, "num_tokens": 1021385267.0, "step": 14210 }, { "entropy": 0.930133692920208, "epoch": 3.875715453802126, "grad_norm": 0.10520965605974197, "learning_rate": 8.859310147338679e-05, "loss": 1.3645, "mean_token_accuracy": 0.7457571759819984, "num_tokens": 1022103810.0, "step": 14220 }, { "entropy": 0.9312554508447647, "epoch": 3.878440992095939, "grad_norm": 0.10042043030261993, "learning_rate": 8.857399275916354e-05, "loss": 1.3684, "mean_token_accuracy": 0.745972464978695, "num_tokens": 1022822815.0, "step": 14230 }, { "entropy": 0.9392946124076843, "epoch": 3.881166530389752, "grad_norm": 0.10241254419088364, "learning_rate": 8.855487011743514e-05, "loss": 1.3663, "mean_token_accuracy": 0.7457096457481385, "num_tokens": 1023545119.0, "step": 14240 }, { "entropy": 0.9372716471552849, "epoch": 3.883892068683565, "grad_norm": 0.09180103242397308, "learning_rate": 8.853573355510599e-05, "loss": 1.3676, "mean_token_accuracy": 0.7435594275593758, "num_tokens": 1024266085.0, "step": 14250 }, { "entropy": 0.9373871505260467, "epoch": 3.886617606977378, "grad_norm": 0.1257672905921936, "learning_rate": 8.851658307908551e-05, "loss": 1.3732, "mean_token_accuracy": 0.7408986300230026, "num_tokens": 1024968778.0, "step": 14260 }, { "entropy": 0.9347392782568932, "epoch": 3.889343145271191, "grad_norm": 0.09383546561002731, "learning_rate": 8.84974186962882e-05, "loss": 1.3648, "mean_token_accuracy": 0.7471752852201462, "num_tokens": 1025696299.0, "step": 14270 }, { "entropy": 0.9265581488609314, "epoch": 3.8920686835650042, "grad_norm": 0.09852515161037445, "learning_rate": 8.84782404136335e-05, "loss": 1.3576, "mean_token_accuracy": 0.7450048893690109, "num_tokens": 1026411311.0, "step": 14280 }, { "entropy": 0.9357007190585136, "epoch": 3.894794221858817, "grad_norm": 0.1034548357129097, "learning_rate": 8.845904823804595e-05, "loss": 1.3628, "mean_token_accuracy": 0.744685959815979, "num_tokens": 1027128276.0, "step": 14290 }, { "entropy": 0.9294277936220169, "epoch": 3.89751976015263, "grad_norm": 0.11570704728364944, "learning_rate": 8.843984217645505e-05, "loss": 1.3566, "mean_token_accuracy": 0.7450615838170052, "num_tokens": 1027849756.0, "step": 14300 }, { "entropy": 0.9366883859038353, "epoch": 3.900245298446443, "grad_norm": 0.09491495043039322, "learning_rate": 8.84206222357953e-05, "loss": 1.3731, "mean_token_accuracy": 0.7437934577465057, "num_tokens": 1028562970.0, "step": 14310 }, { "entropy": 0.929087245464325, "epoch": 3.9029708367402565, "grad_norm": 0.12230154126882553, "learning_rate": 8.840138842300628e-05, "loss": 1.3492, "mean_token_accuracy": 0.7494933113455773, "num_tokens": 1029286997.0, "step": 14320 }, { "entropy": 0.9419739976525306, "epoch": 3.9056963750340694, "grad_norm": 0.09643297642469406, "learning_rate": 8.838214074503254e-05, "loss": 1.368, "mean_token_accuracy": 0.7477216348052025, "num_tokens": 1030011594.0, "step": 14330 }, { "entropy": 0.9315435960888863, "epoch": 3.9084219133278824, "grad_norm": 0.1304415762424469, "learning_rate": 8.836287920882363e-05, "loss": 1.371, "mean_token_accuracy": 0.7494662940502167, "num_tokens": 1030732924.0, "step": 14340 }, { "entropy": 0.9234704539179802, "epoch": 3.9111474516216953, "grad_norm": 0.09431268274784088, "learning_rate": 8.834360382133408e-05, "loss": 1.3556, "mean_token_accuracy": 0.7517325475811958, "num_tokens": 1031456275.0, "step": 14350 }, { "entropy": 0.9329222068190575, "epoch": 3.9138729899155082, "grad_norm": 0.0933113843202591, "learning_rate": 8.832431458952349e-05, "loss": 1.3621, "mean_token_accuracy": 0.7461753979325294, "num_tokens": 1032182540.0, "step": 14360 }, { "entropy": 0.9314815700054169, "epoch": 3.916598528209321, "grad_norm": 0.10339117795228958, "learning_rate": 8.830501152035641e-05, "loss": 1.3678, "mean_token_accuracy": 0.7454869896173477, "num_tokens": 1032893219.0, "step": 14370 }, { "entropy": 0.9356389120221138, "epoch": 3.919324066503134, "grad_norm": 0.09886091947555542, "learning_rate": 8.828569462080238e-05, "loss": 1.361, "mean_token_accuracy": 0.7434762924909591, "num_tokens": 1033612556.0, "step": 14380 }, { "entropy": 0.928038002550602, "epoch": 3.9220496047969475, "grad_norm": 0.12218113988637924, "learning_rate": 8.826636389783598e-05, "loss": 1.3585, "mean_token_accuracy": 0.7478315725922584, "num_tokens": 1034330863.0, "step": 14390 }, { "entropy": 0.9243847489356994, "epoch": 3.9247751430907605, "grad_norm": 0.12371818721294403, "learning_rate": 8.824701935843671e-05, "loss": 1.3626, "mean_token_accuracy": 0.7491337984800339, "num_tokens": 1035061461.0, "step": 14400 }, { "entropy": 0.9274873331189155, "epoch": 3.9275006813845734, "grad_norm": 0.10390947014093399, "learning_rate": 8.822766100958914e-05, "loss": 1.363, "mean_token_accuracy": 0.748525820672512, "num_tokens": 1035778620.0, "step": 14410 }, { "entropy": 0.9319124907255173, "epoch": 3.9302262196783864, "grad_norm": 0.10099514573812485, "learning_rate": 8.820828885828276e-05, "loss": 1.3642, "mean_token_accuracy": 0.7504916310310363, "num_tokens": 1036503749.0, "step": 14420 }, { "entropy": 0.9419459164142608, "epoch": 3.9329517579721998, "grad_norm": 0.10651761293411255, "learning_rate": 8.818890291151207e-05, "loss": 1.3693, "mean_token_accuracy": 0.7400065645575523, "num_tokens": 1037207020.0, "step": 14430 }, { "entropy": 0.9404296949505806, "epoch": 3.9356772962660127, "grad_norm": 0.08996471017599106, "learning_rate": 8.816950317627654e-05, "loss": 1.3738, "mean_token_accuracy": 0.7403483390808105, "num_tokens": 1037918303.0, "step": 14440 }, { "entropy": 0.927625298500061, "epoch": 3.9384028345598256, "grad_norm": 0.09300672262907028, "learning_rate": 8.815008965958066e-05, "loss": 1.3525, "mean_token_accuracy": 0.750341622531414, "num_tokens": 1038643442.0, "step": 14450 }, { "entropy": 0.9373591467738152, "epoch": 3.9411283728536386, "grad_norm": 0.24935375154018402, "learning_rate": 8.813066236843386e-05, "loss": 1.3692, "mean_token_accuracy": 0.7430551409721374, "num_tokens": 1039359616.0, "step": 14460 }, { "entropy": 0.9297406658530235, "epoch": 3.9438539111474515, "grad_norm": 0.11255980283021927, "learning_rate": 8.811122130985052e-05, "loss": 1.3628, "mean_token_accuracy": 0.7447872951626777, "num_tokens": 1040069025.0, "step": 14470 }, { "entropy": 0.9282570093870163, "epoch": 3.9465794494412645, "grad_norm": 0.13645446300506592, "learning_rate": 8.809176649085002e-05, "loss": 1.366, "mean_token_accuracy": 0.7469138681888581, "num_tokens": 1040791355.0, "step": 14480 }, { "entropy": 0.9364361837506294, "epoch": 3.9493049877350774, "grad_norm": 0.113257497549057, "learning_rate": 8.807229791845673e-05, "loss": 1.3644, "mean_token_accuracy": 0.7479927495121956, "num_tokens": 1041520578.0, "step": 14490 }, { "entropy": 0.9375994071364403, "epoch": 3.952030526028891, "grad_norm": 0.09674211591482162, "learning_rate": 8.805281559969995e-05, "loss": 1.3762, "mean_token_accuracy": 0.7408026024699211, "num_tokens": 1042219593.0, "step": 14500 }, { "entropy": 0.933922529220581, "epoch": 3.9547560643227038, "grad_norm": 0.09420154988765717, "learning_rate": 8.803331954161394e-05, "loss": 1.367, "mean_token_accuracy": 0.7458790943026543, "num_tokens": 1042935420.0, "step": 14510 }, { "entropy": 0.9327138379216194, "epoch": 3.9574816026165167, "grad_norm": 0.10313500463962555, "learning_rate": 8.801380975123797e-05, "loss": 1.3548, "mean_token_accuracy": 0.744436514377594, "num_tokens": 1043655200.0, "step": 14520 }, { "entropy": 0.9387291252613068, "epoch": 3.9602071409103297, "grad_norm": 0.09947798401117325, "learning_rate": 8.799428623561621e-05, "loss": 1.3679, "mean_token_accuracy": 0.7460076659917831, "num_tokens": 1044382462.0, "step": 14530 }, { "entropy": 0.9319792449474334, "epoch": 3.962932679204143, "grad_norm": 0.1451663225889206, "learning_rate": 8.797474900179782e-05, "loss": 1.3642, "mean_token_accuracy": 0.7446909591555595, "num_tokens": 1045101795.0, "step": 14540 }, { "entropy": 0.942091529071331, "epoch": 3.965658217497956, "grad_norm": 0.11891796439886093, "learning_rate": 8.79551980568369e-05, "loss": 1.3747, "mean_token_accuracy": 0.7409000471234322, "num_tokens": 1045809786.0, "step": 14550 }, { "entropy": 0.933912581205368, "epoch": 3.968383755791769, "grad_norm": 0.11608613282442093, "learning_rate": 8.793563340779249e-05, "loss": 1.3677, "mean_token_accuracy": 0.745586521923542, "num_tokens": 1046525314.0, "step": 14560 }, { "entropy": 0.9301138669252396, "epoch": 3.971109294085582, "grad_norm": 0.10400774329900742, "learning_rate": 8.791605506172862e-05, "loss": 1.3655, "mean_token_accuracy": 0.7469741970300674, "num_tokens": 1047245749.0, "step": 14570 }, { "entropy": 0.9342464044690132, "epoch": 3.973834832379395, "grad_norm": 0.09617845714092255, "learning_rate": 8.789646302571422e-05, "loss": 1.3648, "mean_token_accuracy": 0.7468957230448723, "num_tokens": 1047970084.0, "step": 14580 }, { "entropy": 0.9341247498989105, "epoch": 3.976560370673208, "grad_norm": 0.0963096171617508, "learning_rate": 8.787685730682319e-05, "loss": 1.3632, "mean_token_accuracy": 0.745309516787529, "num_tokens": 1048689351.0, "step": 14590 }, { "entropy": 0.9294894933700562, "epoch": 3.9792859089670207, "grad_norm": 0.11984711140394211, "learning_rate": 8.785723791213434e-05, "loss": 1.3553, "mean_token_accuracy": 0.7462917998433113, "num_tokens": 1049413825.0, "step": 14600 }, { "entropy": 0.9345215380191803, "epoch": 3.982011447260834, "grad_norm": 0.10306016355752945, "learning_rate": 8.783760484873145e-05, "loss": 1.3705, "mean_token_accuracy": 0.7427061721682549, "num_tokens": 1050109461.0, "step": 14610 }, { "entropy": 0.930073706805706, "epoch": 3.984736985554647, "grad_norm": 0.10596933215856552, "learning_rate": 8.781795812370324e-05, "loss": 1.3646, "mean_token_accuracy": 0.749320738017559, "num_tokens": 1050839057.0, "step": 14620 }, { "entropy": 0.9409649714827537, "epoch": 3.98746252384846, "grad_norm": 0.09791397303342819, "learning_rate": 8.779829774414332e-05, "loss": 1.3768, "mean_token_accuracy": 0.7395751744508743, "num_tokens": 1051546292.0, "step": 14630 }, { "entropy": 0.9307864621281624, "epoch": 3.990188062142273, "grad_norm": 0.10818491876125336, "learning_rate": 8.777862371715026e-05, "loss": 1.3617, "mean_token_accuracy": 0.747245953977108, "num_tokens": 1052263190.0, "step": 14640 }, { "entropy": 0.9333895698189736, "epoch": 3.9929136004360863, "grad_norm": 0.0922565832734108, "learning_rate": 8.775893604982757e-05, "loss": 1.3783, "mean_token_accuracy": 0.7420232683420181, "num_tokens": 1052958401.0, "step": 14650 }, { "entropy": 0.9266951397061348, "epoch": 3.9956391387298993, "grad_norm": 0.09735623747110367, "learning_rate": 8.773923474928365e-05, "loss": 1.3665, "mean_token_accuracy": 0.7441233724355698, "num_tokens": 1053660786.0, "step": 14660 }, { "entropy": 0.9295958206057549, "epoch": 3.9983646770237122, "grad_norm": 0.10819480568170547, "learning_rate": 8.771951982263184e-05, "loss": 1.3557, "mean_token_accuracy": 0.7458764329552651, "num_tokens": 1054374956.0, "step": 14670 }, { "entropy": 0.9250966310501099, "epoch": 4.001090215317525, "grad_norm": 0.10195297002792358, "learning_rate": 8.769979127699044e-05, "loss": 1.3577, "mean_token_accuracy": 0.7487929314374924, "num_tokens": 1055101039.0, "step": 14680 }, { "entropy": 0.9206285730004311, "epoch": 4.003815753611338, "grad_norm": 0.16700603067874908, "learning_rate": 8.768004911948258e-05, "loss": 1.35, "mean_token_accuracy": 0.7485434412956238, "num_tokens": 1055816684.0, "step": 14690 }, { "entropy": 0.9242718994617463, "epoch": 4.006541291905151, "grad_norm": 0.10310090333223343, "learning_rate": 8.766029335723638e-05, "loss": 1.3427, "mean_token_accuracy": 0.7489699482917785, "num_tokens": 1056549268.0, "step": 14700 }, { "entropy": 0.9155981853604317, "epoch": 4.009266830198964, "grad_norm": 0.1116352304816246, "learning_rate": 8.764052399738482e-05, "loss": 1.3476, "mean_token_accuracy": 0.7441306173801422, "num_tokens": 1057243996.0, "step": 14710 }, { "entropy": 0.9187893077731133, "epoch": 4.011992368492777, "grad_norm": 0.10086751729249954, "learning_rate": 8.762074104706585e-05, "loss": 1.343, "mean_token_accuracy": 0.7491327404975892, "num_tokens": 1057971686.0, "step": 14720 }, { "entropy": 0.911608736217022, "epoch": 4.01471790678659, "grad_norm": 0.10362306237220764, "learning_rate": 8.760094451342227e-05, "loss": 1.345, "mean_token_accuracy": 0.7513741493225098, "num_tokens": 1058684405.0, "step": 14730 }, { "entropy": 0.9292451590299606, "epoch": 4.017443445080404, "grad_norm": 0.18069392442703247, "learning_rate": 8.75811344036018e-05, "loss": 1.3595, "mean_token_accuracy": 0.7461284607648849, "num_tokens": 1059403699.0, "step": 14740 }, { "entropy": 0.9293123945593834, "epoch": 4.020168983374217, "grad_norm": 0.10016580671072006, "learning_rate": 8.756131072475708e-05, "loss": 1.3572, "mean_token_accuracy": 0.7432711094617843, "num_tokens": 1060114983.0, "step": 14750 }, { "entropy": 0.9240865737199784, "epoch": 4.02289452166803, "grad_norm": 0.11918074637651443, "learning_rate": 8.754147348404564e-05, "loss": 1.3513, "mean_token_accuracy": 0.7447533890604973, "num_tokens": 1060828912.0, "step": 14760 }, { "entropy": 0.9221337407827377, "epoch": 4.025620059961843, "grad_norm": 0.09770968556404114, "learning_rate": 8.752162268862988e-05, "loss": 1.3521, "mean_token_accuracy": 0.752301150560379, "num_tokens": 1061564270.0, "step": 14770 }, { "entropy": 0.9270030155777931, "epoch": 4.0283455982556555, "grad_norm": 0.10164887458086014, "learning_rate": 8.750175834567715e-05, "loss": 1.3531, "mean_token_accuracy": 0.7463859170675278, "num_tokens": 1062281406.0, "step": 14780 }, { "entropy": 0.928347361087799, "epoch": 4.0310711365494685, "grad_norm": 0.10720933973789215, "learning_rate": 8.748188046235962e-05, "loss": 1.3576, "mean_token_accuracy": 0.7476789802312851, "num_tokens": 1062988575.0, "step": 14790 }, { "entropy": 0.9258315578103066, "epoch": 4.033796674843281, "grad_norm": 0.10308457911014557, "learning_rate": 8.746198904585443e-05, "loss": 1.3606, "mean_token_accuracy": 0.7435396477580071, "num_tokens": 1063688290.0, "step": 14800 }, { "entropy": 0.9214114010334015, "epoch": 4.036522213137094, "grad_norm": 0.09378824383020401, "learning_rate": 8.744208410334353e-05, "loss": 1.3483, "mean_token_accuracy": 0.7454946652054787, "num_tokens": 1064391818.0, "step": 14810 }, { "entropy": 0.9201286911964417, "epoch": 4.039247751430907, "grad_norm": 0.1108425185084343, "learning_rate": 8.742216564201382e-05, "loss": 1.3423, "mean_token_accuracy": 0.7523040413856507, "num_tokens": 1065132210.0, "step": 14820 }, { "entropy": 0.9173980921506881, "epoch": 4.04197328972472, "grad_norm": 0.10384967923164368, "learning_rate": 8.740223366905702e-05, "loss": 1.3471, "mean_token_accuracy": 0.7506538406014442, "num_tokens": 1065850549.0, "step": 14830 }, { "entropy": 0.9249087899923325, "epoch": 4.044698828018534, "grad_norm": 0.10688713192939758, "learning_rate": 8.738228819166979e-05, "loss": 1.3553, "mean_token_accuracy": 0.7454244300723076, "num_tokens": 1066557825.0, "step": 14840 }, { "entropy": 0.9281580656766891, "epoch": 4.047424366312347, "grad_norm": 0.09900780022144318, "learning_rate": 8.736232921705358e-05, "loss": 1.3537, "mean_token_accuracy": 0.7471346974372863, "num_tokens": 1067280883.0, "step": 14850 }, { "entropy": 0.9204226359724998, "epoch": 4.05014990460616, "grad_norm": 0.1197301372885704, "learning_rate": 8.734235675241482e-05, "loss": 1.344, "mean_token_accuracy": 0.7487455755472183, "num_tokens": 1068005115.0, "step": 14860 }, { "entropy": 0.9192662566900254, "epoch": 4.052875442899973, "grad_norm": 0.10520618408918381, "learning_rate": 8.732237080496474e-05, "loss": 1.3424, "mean_token_accuracy": 0.7479520559310913, "num_tokens": 1068729708.0, "step": 14870 }, { "entropy": 0.9146839618682862, "epoch": 4.055600981193786, "grad_norm": 0.09667209535837173, "learning_rate": 8.730237138191944e-05, "loss": 1.3497, "mean_token_accuracy": 0.7494596183300019, "num_tokens": 1069445170.0, "step": 14880 }, { "entropy": 0.922248686850071, "epoch": 4.058326519487599, "grad_norm": 0.10695157200098038, "learning_rate": 8.728235849049992e-05, "loss": 1.358, "mean_token_accuracy": 0.7500324621796608, "num_tokens": 1070172712.0, "step": 14890 }, { "entropy": 0.9240766763687134, "epoch": 4.061052057781412, "grad_norm": 0.09809698164463043, "learning_rate": 8.7262332137932e-05, "loss": 1.3626, "mean_token_accuracy": 0.7443317130208016, "num_tokens": 1070872748.0, "step": 14900 }, { "entropy": 0.9219892278313637, "epoch": 4.063777596075225, "grad_norm": 0.10685938596725464, "learning_rate": 8.724229233144643e-05, "loss": 1.3541, "mean_token_accuracy": 0.7486927181482315, "num_tokens": 1071581000.0, "step": 14910 }, { "entropy": 0.925316508114338, "epoch": 4.066503134369038, "grad_norm": 0.11054862290620804, "learning_rate": 8.722223907827873e-05, "loss": 1.3561, "mean_token_accuracy": 0.7469108149409294, "num_tokens": 1072306023.0, "step": 14920 }, { "entropy": 0.9275324031710624, "epoch": 4.069228672662851, "grad_norm": 0.09480039775371552, "learning_rate": 8.720217238566932e-05, "loss": 1.361, "mean_token_accuracy": 0.745964989066124, "num_tokens": 1073018851.0, "step": 14930 }, { "entropy": 0.9243619382381439, "epoch": 4.0719542109566635, "grad_norm": 0.10341368615627289, "learning_rate": 8.718209226086349e-05, "loss": 1.3491, "mean_token_accuracy": 0.7486465230584145, "num_tokens": 1073730459.0, "step": 14940 }, { "entropy": 0.923155564069748, "epoch": 4.074679749250477, "grad_norm": 0.09840913861989975, "learning_rate": 8.716199871111134e-05, "loss": 1.3464, "mean_token_accuracy": 0.7452421724796295, "num_tokens": 1074448014.0, "step": 14950 }, { "entropy": 0.9233433306217194, "epoch": 4.07740528754429, "grad_norm": 0.09292308986186981, "learning_rate": 8.714189174366785e-05, "loss": 1.3558, "mean_token_accuracy": 0.7448950618505478, "num_tokens": 1075147180.0, "step": 14960 }, { "entropy": 0.9276746451854706, "epoch": 4.080130825838103, "grad_norm": 0.09625004976987839, "learning_rate": 8.712177136579282e-05, "loss": 1.353, "mean_token_accuracy": 0.7442156180739403, "num_tokens": 1075857920.0, "step": 14970 }, { "entropy": 0.9259742245078086, "epoch": 4.082856364131916, "grad_norm": 0.09763691574335098, "learning_rate": 8.710163758475091e-05, "loss": 1.3558, "mean_token_accuracy": 0.7508269518613815, "num_tokens": 1076585194.0, "step": 14980 }, { "entropy": 0.9270025014877319, "epoch": 4.085581902425729, "grad_norm": 0.09863530844449997, "learning_rate": 8.708149040781161e-05, "loss": 1.3524, "mean_token_accuracy": 0.7452347114682197, "num_tokens": 1077297977.0, "step": 14990 }, { "entropy": 0.9185169100761413, "epoch": 4.088307440719542, "grad_norm": 0.11759143322706223, "learning_rate": 8.706132984224926e-05, "loss": 1.3544, "mean_token_accuracy": 0.7505017936229705, "num_tokens": 1078016764.0, "step": 15000 }, { "entropy": 0.9283453524112701, "epoch": 4.091032979013355, "grad_norm": 0.11131831258535385, "learning_rate": 8.7041155895343e-05, "loss": 1.3527, "mean_token_accuracy": 0.7450633034110069, "num_tokens": 1078731211.0, "step": 15010 }, { "entropy": 0.9266245886683464, "epoch": 4.093758517307168, "grad_norm": 0.10359904170036316, "learning_rate": 8.702096857437685e-05, "loss": 1.3593, "mean_token_accuracy": 0.7451131463050842, "num_tokens": 1079442047.0, "step": 15020 }, { "entropy": 0.9161438152194024, "epoch": 4.096484055600981, "grad_norm": 0.1034112200140953, "learning_rate": 8.700076788663961e-05, "loss": 1.3477, "mean_token_accuracy": 0.7492471635341644, "num_tokens": 1080154598.0, "step": 15030 }, { "entropy": 0.9216574400663375, "epoch": 4.099209593894794, "grad_norm": 0.11114446073770523, "learning_rate": 8.698055383942493e-05, "loss": 1.3542, "mean_token_accuracy": 0.7474159732460975, "num_tokens": 1080867093.0, "step": 15040 }, { "entropy": 0.923461177945137, "epoch": 4.101935132188607, "grad_norm": 0.1069541946053505, "learning_rate": 8.696032644003132e-05, "loss": 1.3545, "mean_token_accuracy": 0.7468228310346603, "num_tokens": 1081582715.0, "step": 15050 }, { "entropy": 0.920073664188385, "epoch": 4.104660670482421, "grad_norm": 0.2267809361219406, "learning_rate": 8.694008569576201e-05, "loss": 1.3522, "mean_token_accuracy": 0.7503765150904655, "num_tokens": 1082308456.0, "step": 15060 }, { "entropy": 0.9166083291172982, "epoch": 4.107386208776234, "grad_norm": 0.10917073488235474, "learning_rate": 8.691983161392518e-05, "loss": 1.3392, "mean_token_accuracy": 0.7507751628756523, "num_tokens": 1083039344.0, "step": 15070 }, { "entropy": 0.9270202234387398, "epoch": 4.110111747070047, "grad_norm": 0.10152757167816162, "learning_rate": 8.689956420183371e-05, "loss": 1.3555, "mean_token_accuracy": 0.7467972695827484, "num_tokens": 1083757478.0, "step": 15080 }, { "entropy": 0.919314056634903, "epoch": 4.1128372853638595, "grad_norm": 0.12157361954450607, "learning_rate": 8.687928346680537e-05, "loss": 1.3462, "mean_token_accuracy": 0.7490699544548989, "num_tokens": 1084476929.0, "step": 15090 }, { "entropy": 0.9161649614572525, "epoch": 4.1155628236576725, "grad_norm": 0.10362573713064194, "learning_rate": 8.685898941616269e-05, "loss": 1.3546, "mean_token_accuracy": 0.7478635162115097, "num_tokens": 1085189812.0, "step": 15100 }, { "entropy": 0.9304158881306648, "epoch": 4.118288361951485, "grad_norm": 0.10824136435985565, "learning_rate": 8.683868205723305e-05, "loss": 1.349, "mean_token_accuracy": 0.7461272209882737, "num_tokens": 1085916495.0, "step": 15110 }, { "entropy": 0.9167304843664169, "epoch": 4.121013900245298, "grad_norm": 0.10715682804584503, "learning_rate": 8.681836139734858e-05, "loss": 1.3414, "mean_token_accuracy": 0.7514822587370873, "num_tokens": 1086636334.0, "step": 15120 }, { "entropy": 0.9281087353825569, "epoch": 4.123739438539111, "grad_norm": 0.09745436906814575, "learning_rate": 8.679802744384629e-05, "loss": 1.3502, "mean_token_accuracy": 0.7524097695946693, "num_tokens": 1087383018.0, "step": 15130 }, { "entropy": 0.9187511190772056, "epoch": 4.126464976832924, "grad_norm": 0.12303081154823303, "learning_rate": 8.677768020406792e-05, "loss": 1.3427, "mean_token_accuracy": 0.7529912620782853, "num_tokens": 1088117232.0, "step": 15140 }, { "entropy": 0.9229072242975235, "epoch": 4.129190515126737, "grad_norm": 0.10220523923635483, "learning_rate": 8.675731968536002e-05, "loss": 1.3603, "mean_token_accuracy": 0.7439503133296966, "num_tokens": 1088819662.0, "step": 15150 }, { "entropy": 0.9190058186650276, "epoch": 4.13191605342055, "grad_norm": 0.10615793615579605, "learning_rate": 8.673694589507398e-05, "loss": 1.3538, "mean_token_accuracy": 0.7525135144591332, "num_tokens": 1089546727.0, "step": 15160 }, { "entropy": 0.9210917025804519, "epoch": 4.134641591714364, "grad_norm": 0.09824615716934204, "learning_rate": 8.671655884056595e-05, "loss": 1.3547, "mean_token_accuracy": 0.7447015568614006, "num_tokens": 1090256419.0, "step": 15170 }, { "entropy": 0.9234574690461159, "epoch": 4.137367130008177, "grad_norm": 0.09964392334222794, "learning_rate": 8.669615852919683e-05, "loss": 1.3533, "mean_token_accuracy": 0.750318144261837, "num_tokens": 1090980564.0, "step": 15180 }, { "entropy": 0.9199197620153428, "epoch": 4.14009266830199, "grad_norm": 0.10636098682880402, "learning_rate": 8.667574496833239e-05, "loss": 1.345, "mean_token_accuracy": 0.7478230789303779, "num_tokens": 1091698581.0, "step": 15190 }, { "entropy": 0.9234969943761826, "epoch": 4.142818206595803, "grad_norm": 0.09744471311569214, "learning_rate": 8.665531816534311e-05, "loss": 1.3663, "mean_token_accuracy": 0.7447913825511933, "num_tokens": 1092398547.0, "step": 15200 }, { "entropy": 0.9177030801773072, "epoch": 4.145543744889616, "grad_norm": 0.1044195294380188, "learning_rate": 8.66348781276043e-05, "loss": 1.3466, "mean_token_accuracy": 0.7534613877534866, "num_tokens": 1093129474.0, "step": 15210 }, { "entropy": 0.925013567507267, "epoch": 4.148269283183429, "grad_norm": 0.11116165667772293, "learning_rate": 8.661442486249602e-05, "loss": 1.3572, "mean_token_accuracy": 0.7482627645134926, "num_tokens": 1093854917.0, "step": 15220 }, { "entropy": 0.9209140434861183, "epoch": 4.150994821477242, "grad_norm": 0.10993218421936035, "learning_rate": 8.65939583774031e-05, "loss": 1.3534, "mean_token_accuracy": 0.7482733398675918, "num_tokens": 1094585239.0, "step": 15230 }, { "entropy": 0.9196558341383934, "epoch": 4.153720359771055, "grad_norm": 0.10569615662097931, "learning_rate": 8.65734786797152e-05, "loss": 1.3531, "mean_token_accuracy": 0.7470766916871071, "num_tokens": 1095288938.0, "step": 15240 }, { "entropy": 0.9233587205410003, "epoch": 4.1564458980648675, "grad_norm": 0.10359329730272293, "learning_rate": 8.655298577682664e-05, "loss": 1.3525, "mean_token_accuracy": 0.7450036704540253, "num_tokens": 1096006276.0, "step": 15250 }, { "entropy": 0.9250382363796235, "epoch": 4.1591714363586805, "grad_norm": 0.10726846009492874, "learning_rate": 8.653247967613665e-05, "loss": 1.3464, "mean_token_accuracy": 0.7515286386013031, "num_tokens": 1096741770.0, "step": 15260 }, { "entropy": 0.9240881979465485, "epoch": 4.161896974652494, "grad_norm": 0.10148107260465622, "learning_rate": 8.651196038504911e-05, "loss": 1.3516, "mean_token_accuracy": 0.7479907020926475, "num_tokens": 1097462882.0, "step": 15270 }, { "entropy": 0.9232209980487823, "epoch": 4.164622512946307, "grad_norm": 0.10852691531181335, "learning_rate": 8.649142791097272e-05, "loss": 1.3573, "mean_token_accuracy": 0.7463250428438186, "num_tokens": 1098171286.0, "step": 15280 }, { "entropy": 0.9185991257429122, "epoch": 4.16734805124012, "grad_norm": 0.10770787298679352, "learning_rate": 8.647088226132092e-05, "loss": 1.3545, "mean_token_accuracy": 0.7466697439551353, "num_tokens": 1098874143.0, "step": 15290 }, { "entropy": 0.9250710621476174, "epoch": 4.170073589533933, "grad_norm": 0.10845988243818283, "learning_rate": 8.645032344351191e-05, "loss": 1.3602, "mean_token_accuracy": 0.7440716817975044, "num_tokens": 1099575728.0, "step": 15300 }, { "entropy": 0.9233541503548622, "epoch": 4.172799127827746, "grad_norm": 0.10754302144050598, "learning_rate": 8.642975146496863e-05, "loss": 1.349, "mean_token_accuracy": 0.746393920481205, "num_tokens": 1100286300.0, "step": 15310 }, { "entropy": 0.925643177330494, "epoch": 4.175524666121559, "grad_norm": 0.11739949882030487, "learning_rate": 8.640916633311882e-05, "loss": 1.3605, "mean_token_accuracy": 0.7466436505317688, "num_tokens": 1101007355.0, "step": 15320 }, { "entropy": 0.9255161434412003, "epoch": 4.178250204415372, "grad_norm": 0.10572593659162521, "learning_rate": 8.638856805539492e-05, "loss": 1.3573, "mean_token_accuracy": 0.7447706922888756, "num_tokens": 1101712303.0, "step": 15330 }, { "entropy": 0.9263571187853813, "epoch": 4.180975742709185, "grad_norm": 0.11344701051712036, "learning_rate": 8.636795663923412e-05, "loss": 1.3564, "mean_token_accuracy": 0.7460677474737167, "num_tokens": 1102429425.0, "step": 15340 }, { "entropy": 0.9213182166218757, "epoch": 4.183701281002998, "grad_norm": 0.09633529931306839, "learning_rate": 8.634733209207838e-05, "loss": 1.3533, "mean_token_accuracy": 0.7468613177537918, "num_tokens": 1103142940.0, "step": 15350 }, { "entropy": 0.9199415788054466, "epoch": 4.186426819296811, "grad_norm": 0.08518577367067337, "learning_rate": 8.63266944213744e-05, "loss": 1.3389, "mean_token_accuracy": 0.7497214883565902, "num_tokens": 1103873112.0, "step": 15360 }, { "entropy": 0.9211140155792237, "epoch": 4.189152357590624, "grad_norm": 0.09612301737070084, "learning_rate": 8.630604363457357e-05, "loss": 1.348, "mean_token_accuracy": 0.7492274045944214, "num_tokens": 1104595926.0, "step": 15370 }, { "entropy": 0.9184622243046761, "epoch": 4.191877895884438, "grad_norm": 0.10593047738075256, "learning_rate": 8.62853797391321e-05, "loss": 1.3515, "mean_token_accuracy": 0.7543678924441337, "num_tokens": 1105332142.0, "step": 15380 }, { "entropy": 0.919635309278965, "epoch": 4.1946034341782505, "grad_norm": 0.09958937019109726, "learning_rate": 8.626470274251086e-05, "loss": 1.3517, "mean_token_accuracy": 0.7483934178948403, "num_tokens": 1106054683.0, "step": 15390 }, { "entropy": 0.9255688995122909, "epoch": 4.1973289724720635, "grad_norm": 0.09910338371992111, "learning_rate": 8.624401265217546e-05, "loss": 1.3539, "mean_token_accuracy": 0.7464926168322563, "num_tokens": 1106775141.0, "step": 15400 }, { "entropy": 0.9133437097072601, "epoch": 4.200054510765876, "grad_norm": 0.10686346143484116, "learning_rate": 8.622330947559626e-05, "loss": 1.3387, "mean_token_accuracy": 0.7509348660707473, "num_tokens": 1107500783.0, "step": 15410 }, { "entropy": 0.9259075611829758, "epoch": 4.202780049059689, "grad_norm": 0.10239091515541077, "learning_rate": 8.620259322024837e-05, "loss": 1.3568, "mean_token_accuracy": 0.7503230765461921, "num_tokens": 1108223072.0, "step": 15420 }, { "entropy": 0.9259609490633011, "epoch": 4.205505587353502, "grad_norm": 0.09917110204696655, "learning_rate": 8.618186389361157e-05, "loss": 1.349, "mean_token_accuracy": 0.7449682936072349, "num_tokens": 1108939663.0, "step": 15430 }, { "entropy": 0.9250614657998085, "epoch": 4.208231125647315, "grad_norm": 0.10166233777999878, "learning_rate": 8.616112150317038e-05, "loss": 1.3583, "mean_token_accuracy": 0.7445510044693947, "num_tokens": 1109643749.0, "step": 15440 }, { "entropy": 0.9110371172428131, "epoch": 4.210956663941128, "grad_norm": 0.10801061242818832, "learning_rate": 8.614036605641401e-05, "loss": 1.3493, "mean_token_accuracy": 0.7497808769345283, "num_tokens": 1110353578.0, "step": 15450 }, { "entropy": 0.9236445412039757, "epoch": 4.213682202234941, "grad_norm": 0.106284499168396, "learning_rate": 8.611959756083645e-05, "loss": 1.3523, "mean_token_accuracy": 0.7495973750948906, "num_tokens": 1111078312.0, "step": 15460 }, { "entropy": 0.9197873383760452, "epoch": 4.216407740528754, "grad_norm": 0.1084304079413414, "learning_rate": 8.609881602393632e-05, "loss": 1.3536, "mean_token_accuracy": 0.7510551482439041, "num_tokens": 1111800138.0, "step": 15470 }, { "entropy": 0.9248720005154609, "epoch": 4.219133278822567, "grad_norm": 0.09371249377727509, "learning_rate": 8.607802145321704e-05, "loss": 1.3568, "mean_token_accuracy": 0.7465752214193344, "num_tokens": 1112506023.0, "step": 15480 }, { "entropy": 0.918645641207695, "epoch": 4.221858817116381, "grad_norm": 0.10070053488016129, "learning_rate": 8.605721385618666e-05, "loss": 1.3527, "mean_token_accuracy": 0.7517626136541367, "num_tokens": 1113229056.0, "step": 15490 }, { "entropy": 0.9234529182314872, "epoch": 4.224584355410194, "grad_norm": 0.10140307247638702, "learning_rate": 8.603639324035796e-05, "loss": 1.3529, "mean_token_accuracy": 0.7472596898674965, "num_tokens": 1113939386.0, "step": 15500 }, { "entropy": 0.9218262240290642, "epoch": 4.227309893704007, "grad_norm": 0.11644724756479263, "learning_rate": 8.601555961324844e-05, "loss": 1.3496, "mean_token_accuracy": 0.7462103083729744, "num_tokens": 1114665936.0, "step": 15510 }, { "entropy": 0.9324785009026527, "epoch": 4.23003543199782, "grad_norm": 0.11617831885814667, "learning_rate": 8.599471298238022e-05, "loss": 1.3581, "mean_token_accuracy": 0.743926165997982, "num_tokens": 1115377509.0, "step": 15520 }, { "entropy": 0.9201160460710526, "epoch": 4.232760970291633, "grad_norm": 0.11622854322195053, "learning_rate": 8.597385335528024e-05, "loss": 1.3401, "mean_token_accuracy": 0.7489723354578018, "num_tokens": 1116105358.0, "step": 15530 }, { "entropy": 0.9292018488049507, "epoch": 4.235486508585446, "grad_norm": 0.10608626902103424, "learning_rate": 8.595298073948003e-05, "loss": 1.3552, "mean_token_accuracy": 0.7496816053986549, "num_tokens": 1116836485.0, "step": 15540 }, { "entropy": 0.9256255522370338, "epoch": 4.238212046879259, "grad_norm": 0.11927047371864319, "learning_rate": 8.593209514251587e-05, "loss": 1.3568, "mean_token_accuracy": 0.7435988053679466, "num_tokens": 1117542989.0, "step": 15550 }, { "entropy": 0.9222154036164284, "epoch": 4.2409375851730715, "grad_norm": 0.11140109598636627, "learning_rate": 8.591119657192868e-05, "loss": 1.3539, "mean_token_accuracy": 0.7469932600855828, "num_tokens": 1118253384.0, "step": 15560 }, { "entropy": 0.921469333767891, "epoch": 4.2436631234668845, "grad_norm": 0.10192237049341202, "learning_rate": 8.58902850352641e-05, "loss": 1.3462, "mean_token_accuracy": 0.7476293072104454, "num_tokens": 1118976778.0, "step": 15570 }, { "entropy": 0.9227729007601738, "epoch": 4.246388661760697, "grad_norm": 0.094509556889534, "learning_rate": 8.586936054007243e-05, "loss": 1.3542, "mean_token_accuracy": 0.7453227132558823, "num_tokens": 1119690904.0, "step": 15580 }, { "entropy": 0.9180780068039894, "epoch": 4.24911420005451, "grad_norm": 0.09690500050783157, "learning_rate": 8.584842309390866e-05, "loss": 1.3337, "mean_token_accuracy": 0.7538761734962464, "num_tokens": 1120416660.0, "step": 15590 }, { "entropy": 0.9172228232026101, "epoch": 4.251839738348324, "grad_norm": 0.096047043800354, "learning_rate": 8.582747270433244e-05, "loss": 1.3481, "mean_token_accuracy": 0.748733003437519, "num_tokens": 1121124690.0, "step": 15600 }, { "entropy": 0.917376683652401, "epoch": 4.254565276642137, "grad_norm": 0.09743868559598923, "learning_rate": 8.580650937890814e-05, "loss": 1.3523, "mean_token_accuracy": 0.7458606168627739, "num_tokens": 1121840947.0, "step": 15610 }, { "entropy": 0.9286151498556137, "epoch": 4.25729081493595, "grad_norm": 0.10876942425966263, "learning_rate": 8.578553312520473e-05, "loss": 1.3642, "mean_token_accuracy": 0.7437870189547539, "num_tokens": 1122550011.0, "step": 15620 }, { "entropy": 0.9214182883501053, "epoch": 4.260016353229763, "grad_norm": 0.13369660079479218, "learning_rate": 8.576454395079592e-05, "loss": 1.3448, "mean_token_accuracy": 0.748539000749588, "num_tokens": 1123263873.0, "step": 15630 }, { "entropy": 0.9182384103536606, "epoch": 4.262741891523576, "grad_norm": 0.10016344487667084, "learning_rate": 8.574354186326001e-05, "loss": 1.3527, "mean_token_accuracy": 0.7461849331855774, "num_tokens": 1123977611.0, "step": 15640 }, { "entropy": 0.9246586412191391, "epoch": 4.265467429817389, "grad_norm": 0.09606947004795074, "learning_rate": 8.572252687018003e-05, "loss": 1.3618, "mean_token_accuracy": 0.7431387960910797, "num_tokens": 1124676896.0, "step": 15650 }, { "entropy": 0.9174091562628746, "epoch": 4.268192968111202, "grad_norm": 0.11599027365446091, "learning_rate": 8.570149897914365e-05, "loss": 1.3441, "mean_token_accuracy": 0.7503603219985961, "num_tokens": 1125394167.0, "step": 15660 }, { "entropy": 0.9210040450096131, "epoch": 4.270918506405015, "grad_norm": 0.12634681165218353, "learning_rate": 8.568045819774317e-05, "loss": 1.3536, "mean_token_accuracy": 0.750414302945137, "num_tokens": 1126120943.0, "step": 15670 }, { "entropy": 0.9279288172721862, "epoch": 4.273644044698828, "grad_norm": 0.11021529138088226, "learning_rate": 8.565940453357556e-05, "loss": 1.3602, "mean_token_accuracy": 0.7447734594345092, "num_tokens": 1126837097.0, "step": 15680 }, { "entropy": 0.925048041343689, "epoch": 4.276369582992641, "grad_norm": 0.10797903686761856, "learning_rate": 8.563833799424245e-05, "loss": 1.3567, "mean_token_accuracy": 0.7467201858758926, "num_tokens": 1127556011.0, "step": 15690 }, { "entropy": 0.9306846410036087, "epoch": 4.2790951212864545, "grad_norm": 0.10243770480155945, "learning_rate": 8.561725858735012e-05, "loss": 1.353, "mean_token_accuracy": 0.7427692621946335, "num_tokens": 1128276613.0, "step": 15700 }, { "entropy": 0.919539888203144, "epoch": 4.2818206595802675, "grad_norm": 0.10891085118055344, "learning_rate": 8.55961663205095e-05, "loss": 1.3594, "mean_token_accuracy": 0.743375138938427, "num_tokens": 1128968352.0, "step": 15710 }, { "entropy": 0.9251904681324958, "epoch": 4.28454619787408, "grad_norm": 0.10192779451608658, "learning_rate": 8.557506120133612e-05, "loss": 1.3535, "mean_token_accuracy": 0.7490128025412559, "num_tokens": 1129695155.0, "step": 15720 }, { "entropy": 0.9143778622150421, "epoch": 4.287271736167893, "grad_norm": 0.10731621831655502, "learning_rate": 8.555394323745021e-05, "loss": 1.3479, "mean_token_accuracy": 0.7502439513802528, "num_tokens": 1130414342.0, "step": 15730 }, { "entropy": 0.9239508718252182, "epoch": 4.289997274461706, "grad_norm": 0.10015898197889328, "learning_rate": 8.553281243647661e-05, "loss": 1.3522, "mean_token_accuracy": 0.7509477585554123, "num_tokens": 1131144199.0, "step": 15740 }, { "entropy": 0.9253065183758735, "epoch": 4.292722812755519, "grad_norm": 0.10033026337623596, "learning_rate": 8.551166880604478e-05, "loss": 1.3535, "mean_token_accuracy": 0.7482062309980393, "num_tokens": 1131872682.0, "step": 15750 }, { "entropy": 0.933468659222126, "epoch": 4.295448351049332, "grad_norm": 0.10383269190788269, "learning_rate": 8.549051235378883e-05, "loss": 1.3573, "mean_token_accuracy": 0.7434056118130684, "num_tokens": 1132586135.0, "step": 15760 }, { "entropy": 0.9203952506184578, "epoch": 4.298173889343145, "grad_norm": 0.10781288146972656, "learning_rate": 8.54693430873475e-05, "loss": 1.3545, "mean_token_accuracy": 0.752930548787117, "num_tokens": 1133323703.0, "step": 15770 }, { "entropy": 0.9198941394686699, "epoch": 4.300899427636958, "grad_norm": 0.09412723779678345, "learning_rate": 8.544816101436417e-05, "loss": 1.3517, "mean_token_accuracy": 0.7454964980483055, "num_tokens": 1134030538.0, "step": 15780 }, { "entropy": 0.9307396382093429, "epoch": 4.303624965930771, "grad_norm": 0.09997003525495529, "learning_rate": 8.542696614248682e-05, "loss": 1.3584, "mean_token_accuracy": 0.7488197386264801, "num_tokens": 1134764208.0, "step": 15790 }, { "entropy": 0.9198611840605736, "epoch": 4.306350504224584, "grad_norm": 0.12314765155315399, "learning_rate": 8.540575847936803e-05, "loss": 1.356, "mean_token_accuracy": 0.7507635086774826, "num_tokens": 1135481334.0, "step": 15800 }, { "entropy": 0.9221617951989174, "epoch": 4.309076042518397, "grad_norm": 0.10982570052146912, "learning_rate": 8.538453803266507e-05, "loss": 1.3481, "mean_token_accuracy": 0.7472605004906654, "num_tokens": 1136204421.0, "step": 15810 }, { "entropy": 0.9230554610490799, "epoch": 4.311801580812211, "grad_norm": 0.1046750396490097, "learning_rate": 8.536330481003976e-05, "loss": 1.3513, "mean_token_accuracy": 0.7465279966592788, "num_tokens": 1136924603.0, "step": 15820 }, { "entropy": 0.9156743109226226, "epoch": 4.314527119106024, "grad_norm": 0.10535377264022827, "learning_rate": 8.534205881915857e-05, "loss": 1.3465, "mean_token_accuracy": 0.7513804316520691, "num_tokens": 1137650525.0, "step": 15830 }, { "entropy": 0.9267956629395485, "epoch": 4.317252657399837, "grad_norm": 0.11267965286970139, "learning_rate": 8.532080006769255e-05, "loss": 1.3664, "mean_token_accuracy": 0.7408849030733109, "num_tokens": 1138347900.0, "step": 15840 }, { "entropy": 0.92094816416502, "epoch": 4.31997819569365, "grad_norm": 0.10393417626619339, "learning_rate": 8.529952856331738e-05, "loss": 1.3562, "mean_token_accuracy": 0.7493443578481674, "num_tokens": 1139067471.0, "step": 15850 }, { "entropy": 0.9262821987271309, "epoch": 4.3227037339874625, "grad_norm": 0.10966341197490692, "learning_rate": 8.527824431371332e-05, "loss": 1.3571, "mean_token_accuracy": 0.746008823812008, "num_tokens": 1139784535.0, "step": 15860 }, { "entropy": 0.9217200368642807, "epoch": 4.3254292722812755, "grad_norm": 0.10986848920583725, "learning_rate": 8.525694732656528e-05, "loss": 1.3543, "mean_token_accuracy": 0.7478723704814911, "num_tokens": 1140503723.0, "step": 15870 }, { "entropy": 0.9184869810938835, "epoch": 4.328154810575088, "grad_norm": 0.10071445256471634, "learning_rate": 8.523563760956274e-05, "loss": 1.3477, "mean_token_accuracy": 0.7526082947850228, "num_tokens": 1141233297.0, "step": 15880 }, { "entropy": 0.9309237048029899, "epoch": 4.330880348868901, "grad_norm": 0.11324868351221085, "learning_rate": 8.521431517039975e-05, "loss": 1.3621, "mean_token_accuracy": 0.7441210955381393, "num_tokens": 1141946146.0, "step": 15890 }, { "entropy": 0.9304992854595184, "epoch": 4.333605887162714, "grad_norm": 0.10269147157669067, "learning_rate": 8.5192980016775e-05, "loss": 1.3595, "mean_token_accuracy": 0.7481666520237923, "num_tokens": 1142670652.0, "step": 15900 }, { "entropy": 0.9177383273839951, "epoch": 4.336331425456527, "grad_norm": 0.10282835364341736, "learning_rate": 8.517163215639173e-05, "loss": 1.3519, "mean_token_accuracy": 0.7466689467430114, "num_tokens": 1143374422.0, "step": 15910 }, { "entropy": 0.9125888720154762, "epoch": 4.339056963750341, "grad_norm": 0.09721323847770691, "learning_rate": 8.515027159695781e-05, "loss": 1.3374, "mean_token_accuracy": 0.752588203549385, "num_tokens": 1144103325.0, "step": 15920 }, { "entropy": 0.9269572705030441, "epoch": 4.341782502044154, "grad_norm": 0.10542239248752594, "learning_rate": 8.512889834618564e-05, "loss": 1.3542, "mean_token_accuracy": 0.74549660384655, "num_tokens": 1144822140.0, "step": 15930 }, { "entropy": 0.9246848747134209, "epoch": 4.344508040337967, "grad_norm": 0.09933461248874664, "learning_rate": 8.510751241179226e-05, "loss": 1.3485, "mean_token_accuracy": 0.7489146247506142, "num_tokens": 1145552344.0, "step": 15940 }, { "entropy": 0.9123001664876937, "epoch": 4.34723357863178, "grad_norm": 0.10787799954414368, "learning_rate": 8.508611380149925e-05, "loss": 1.3404, "mean_token_accuracy": 0.7499959483742714, "num_tokens": 1146273413.0, "step": 15950 }, { "entropy": 0.9135029569268227, "epoch": 4.349959116925593, "grad_norm": 0.12957337498664856, "learning_rate": 8.50647025230328e-05, "loss": 1.3445, "mean_token_accuracy": 0.752824242413044, "num_tokens": 1147009846.0, "step": 15960 }, { "entropy": 0.9256454929709435, "epoch": 4.352684655219406, "grad_norm": 0.1090337410569191, "learning_rate": 8.504327858412364e-05, "loss": 1.363, "mean_token_accuracy": 0.7460663363337516, "num_tokens": 1147720111.0, "step": 15970 }, { "entropy": 0.9286524310708046, "epoch": 4.355410193513219, "grad_norm": 0.10183461755514145, "learning_rate": 8.502184199250709e-05, "loss": 1.3548, "mean_token_accuracy": 0.7498515471816063, "num_tokens": 1148447409.0, "step": 15980 }, { "entropy": 0.9260925754904747, "epoch": 4.358135731807032, "grad_norm": 0.0972822979092598, "learning_rate": 8.500039275592302e-05, "loss": 1.3582, "mean_token_accuracy": 0.7439198985695838, "num_tokens": 1149161319.0, "step": 15990 }, { "entropy": 0.9181397452950477, "epoch": 4.360861270100845, "grad_norm": 0.08983498066663742, "learning_rate": 8.497893088211591e-05, "loss": 1.3525, "mean_token_accuracy": 0.7522954598069191, "num_tokens": 1149891062.0, "step": 16000 }, { "entropy": 0.9218356519937515, "epoch": 4.363586808394658, "grad_norm": 0.13123436272144318, "learning_rate": 8.495745637883474e-05, "loss": 1.36, "mean_token_accuracy": 0.7450639083981514, "num_tokens": 1150596816.0, "step": 16010 }, { "entropy": 0.9280581161379814, "epoch": 4.366312346688471, "grad_norm": 0.10914012789726257, "learning_rate": 8.493596925383309e-05, "loss": 1.3494, "mean_token_accuracy": 0.7427716001868248, "num_tokens": 1151303685.0, "step": 16020 }, { "entropy": 0.9174679771065712, "epoch": 4.369037884982284, "grad_norm": 0.10081352293491364, "learning_rate": 8.491446951486912e-05, "loss": 1.344, "mean_token_accuracy": 0.7507496654987336, "num_tokens": 1152024972.0, "step": 16030 }, { "entropy": 0.9233581557869911, "epoch": 4.371763423276097, "grad_norm": 0.11699751764535904, "learning_rate": 8.489295716970549e-05, "loss": 1.3489, "mean_token_accuracy": 0.7476333141326904, "num_tokens": 1152740442.0, "step": 16040 }, { "entropy": 0.9269112601876259, "epoch": 4.37448896156991, "grad_norm": 0.10510966181755066, "learning_rate": 8.487143222610943e-05, "loss": 1.3523, "mean_token_accuracy": 0.7471148818731308, "num_tokens": 1153457678.0, "step": 16050 }, { "entropy": 0.9161120623350143, "epoch": 4.377214499863723, "grad_norm": 0.10543408244848251, "learning_rate": 8.484989469185274e-05, "loss": 1.3473, "mean_token_accuracy": 0.7492431044578552, "num_tokens": 1154176774.0, "step": 16060 }, { "entropy": 0.929962956905365, "epoch": 4.379940038157536, "grad_norm": 0.11497306823730469, "learning_rate": 8.482834457471172e-05, "loss": 1.3654, "mean_token_accuracy": 0.744649438560009, "num_tokens": 1154886531.0, "step": 16070 }, { "entropy": 0.9178838640451431, "epoch": 4.382665576451349, "grad_norm": 0.11396227031946182, "learning_rate": 8.480678188246729e-05, "loss": 1.35, "mean_token_accuracy": 0.7467187210917473, "num_tokens": 1155596124.0, "step": 16080 }, { "entropy": 0.9303081452846527, "epoch": 4.385391114745162, "grad_norm": 0.11013922095298767, "learning_rate": 8.478520662290483e-05, "loss": 1.3514, "mean_token_accuracy": 0.7479231730103493, "num_tokens": 1156315734.0, "step": 16090 }, { "entropy": 0.9267628148198128, "epoch": 4.388116653038975, "grad_norm": 0.10404833406209946, "learning_rate": 8.476361880381432e-05, "loss": 1.3501, "mean_token_accuracy": 0.7476871356368064, "num_tokens": 1157041302.0, "step": 16100 }, { "entropy": 0.9194824427366257, "epoch": 4.390842191332788, "grad_norm": 0.10547439754009247, "learning_rate": 8.47420184329902e-05, "loss": 1.3568, "mean_token_accuracy": 0.7509753480553627, "num_tokens": 1157759040.0, "step": 16110 }, { "entropy": 0.9184313416481018, "epoch": 4.393567729626601, "grad_norm": 0.11044033616781235, "learning_rate": 8.472040551823153e-05, "loss": 1.3452, "mean_token_accuracy": 0.7501204147934913, "num_tokens": 1158489685.0, "step": 16120 }, { "entropy": 0.922398003935814, "epoch": 4.396293267920415, "grad_norm": 0.10849247872829437, "learning_rate": 8.469878006734185e-05, "loss": 1.3504, "mean_token_accuracy": 0.748694671690464, "num_tokens": 1159215721.0, "step": 16130 }, { "entropy": 0.9304196760058403, "epoch": 4.399018806214228, "grad_norm": 0.10773295164108276, "learning_rate": 8.467714208812923e-05, "loss": 1.3597, "mean_token_accuracy": 0.7436440542340279, "num_tokens": 1159928115.0, "step": 16140 }, { "entropy": 0.9251463919878006, "epoch": 4.401744344508041, "grad_norm": 0.09861241281032562, "learning_rate": 8.465549158840626e-05, "loss": 1.3582, "mean_token_accuracy": 0.742143839597702, "num_tokens": 1160630520.0, "step": 16150 }, { "entropy": 0.922368374466896, "epoch": 4.404469882801854, "grad_norm": 0.11731061339378357, "learning_rate": 8.463382857599007e-05, "loss": 1.3534, "mean_token_accuracy": 0.7475259497761726, "num_tokens": 1161345668.0, "step": 16160 }, { "entropy": 0.9281652629375458, "epoch": 4.4071954210956665, "grad_norm": 0.11117558926343918, "learning_rate": 8.461215305870226e-05, "loss": 1.3581, "mean_token_accuracy": 0.747750635445118, "num_tokens": 1162066131.0, "step": 16170 }, { "entropy": 0.9134318038821221, "epoch": 4.4099209593894795, "grad_norm": 0.09772191941738129, "learning_rate": 8.459046504436905e-05, "loss": 1.3446, "mean_token_accuracy": 0.7544653728604317, "num_tokens": 1162798226.0, "step": 16180 }, { "entropy": 0.9234729900956153, "epoch": 4.412646497683292, "grad_norm": 0.1031123474240303, "learning_rate": 8.456876454082103e-05, "loss": 1.3523, "mean_token_accuracy": 0.7496284931898117, "num_tokens": 1163521418.0, "step": 16190 }, { "entropy": 0.915256017446518, "epoch": 4.415372035977105, "grad_norm": 0.12567292153835297, "learning_rate": 8.454705155589341e-05, "loss": 1.34, "mean_token_accuracy": 0.7480539917945862, "num_tokens": 1164233913.0, "step": 16200 }, { "entropy": 0.9199686855077743, "epoch": 4.418097574270918, "grad_norm": 0.10363832116127014, "learning_rate": 8.45253260974259e-05, "loss": 1.3531, "mean_token_accuracy": 0.7477450609207154, "num_tokens": 1164956517.0, "step": 16210 }, { "entropy": 0.9239618211984635, "epoch": 4.420823112564731, "grad_norm": 0.09600310772657394, "learning_rate": 8.45035881732626e-05, "loss": 1.3555, "mean_token_accuracy": 0.7452525213360787, "num_tokens": 1165671996.0, "step": 16220 }, { "entropy": 0.9234343186020851, "epoch": 4.423548650858544, "grad_norm": 0.10287973284721375, "learning_rate": 8.448183779125227e-05, "loss": 1.3539, "mean_token_accuracy": 0.7488687202334404, "num_tokens": 1166400173.0, "step": 16230 }, { "entropy": 0.9195742890238762, "epoch": 4.426274189152357, "grad_norm": 0.11038333922624588, "learning_rate": 8.446007495924805e-05, "loss": 1.3499, "mean_token_accuracy": 0.7471941247582435, "num_tokens": 1167112628.0, "step": 16240 }, { "entropy": 0.9236080378293992, "epoch": 4.428999727446171, "grad_norm": 0.10123874247074127, "learning_rate": 8.443829968510763e-05, "loss": 1.3633, "mean_token_accuracy": 0.7433831810951232, "num_tokens": 1167817908.0, "step": 16250 }, { "entropy": 0.9259242162108421, "epoch": 4.431725265739984, "grad_norm": 0.10518823564052582, "learning_rate": 8.441651197669316e-05, "loss": 1.3514, "mean_token_accuracy": 0.7478140458464623, "num_tokens": 1168537282.0, "step": 16260 }, { "entropy": 0.9266928464174271, "epoch": 4.434450804033797, "grad_norm": 0.12261072546243668, "learning_rate": 8.439471184187133e-05, "loss": 1.3529, "mean_token_accuracy": 0.7518995612859726, "num_tokens": 1169273826.0, "step": 16270 }, { "entropy": 0.9274758994579315, "epoch": 4.43717634232761, "grad_norm": 0.10522782057523727, "learning_rate": 8.437289928851327e-05, "loss": 1.3591, "mean_token_accuracy": 0.7453684002161026, "num_tokens": 1169989086.0, "step": 16280 }, { "entropy": 0.917501051723957, "epoch": 4.439901880621423, "grad_norm": 0.10446923226118088, "learning_rate": 8.435107432449459e-05, "loss": 1.3456, "mean_token_accuracy": 0.7490571230649948, "num_tokens": 1170715609.0, "step": 16290 }, { "entropy": 0.9176990106701851, "epoch": 4.442627418915236, "grad_norm": 0.11490264534950256, "learning_rate": 8.432923695769543e-05, "loss": 1.3471, "mean_token_accuracy": 0.7479099735617638, "num_tokens": 1171439227.0, "step": 16300 }, { "entropy": 0.9271521344780922, "epoch": 4.445352957209049, "grad_norm": 0.10181035101413727, "learning_rate": 8.430738719600035e-05, "loss": 1.3588, "mean_token_accuracy": 0.7459352523088455, "num_tokens": 1172156027.0, "step": 16310 }, { "entropy": 0.9205224305391312, "epoch": 4.448078495502862, "grad_norm": 0.14165246486663818, "learning_rate": 8.428552504729846e-05, "loss": 1.347, "mean_token_accuracy": 0.7521676912903785, "num_tokens": 1172881377.0, "step": 16320 }, { "entropy": 0.9157086759805679, "epoch": 4.4508040337966746, "grad_norm": 0.10163746774196625, "learning_rate": 8.426365051948324e-05, "loss": 1.3508, "mean_token_accuracy": 0.7470083206892013, "num_tokens": 1173594518.0, "step": 16330 }, { "entropy": 0.9186356648802757, "epoch": 4.4535295720904875, "grad_norm": 0.10214592516422272, "learning_rate": 8.424176362045273e-05, "loss": 1.3415, "mean_token_accuracy": 0.7489265576004982, "num_tokens": 1174314989.0, "step": 16340 }, { "entropy": 0.9227355569601059, "epoch": 4.456255110384301, "grad_norm": 0.12574359774589539, "learning_rate": 8.421986435810938e-05, "loss": 1.3541, "mean_token_accuracy": 0.7484306424856186, "num_tokens": 1175048171.0, "step": 16350 }, { "entropy": 0.9171219453215599, "epoch": 4.458980648678114, "grad_norm": 0.11906462907791138, "learning_rate": 8.419795274036015e-05, "loss": 1.3478, "mean_token_accuracy": 0.7481898292899132, "num_tokens": 1175762446.0, "step": 16360 }, { "entropy": 0.9264452278614044, "epoch": 4.461706186971927, "grad_norm": 0.10201243311166763, "learning_rate": 8.41760287751164e-05, "loss": 1.364, "mean_token_accuracy": 0.7468571528792382, "num_tokens": 1176480854.0, "step": 16370 }, { "entropy": 0.9220310509204864, "epoch": 4.46443172526574, "grad_norm": 0.10590444505214691, "learning_rate": 8.415409247029404e-05, "loss": 1.3537, "mean_token_accuracy": 0.7467442423105239, "num_tokens": 1177190511.0, "step": 16380 }, { "entropy": 0.9257250636816025, "epoch": 4.467157263559553, "grad_norm": 0.11154093593358994, "learning_rate": 8.413214383381336e-05, "loss": 1.3552, "mean_token_accuracy": 0.7494167581200599, "num_tokens": 1177920157.0, "step": 16390 }, { "entropy": 0.9163769647479058, "epoch": 4.469882801853366, "grad_norm": 0.10316795855760574, "learning_rate": 8.411018287359908e-05, "loss": 1.3539, "mean_token_accuracy": 0.7508632883429527, "num_tokens": 1178626392.0, "step": 16400 }, { "entropy": 0.91862373650074, "epoch": 4.472608340147179, "grad_norm": 0.10479848831892014, "learning_rate": 8.408820959758046e-05, "loss": 1.3531, "mean_token_accuracy": 0.7483569413423539, "num_tokens": 1179350119.0, "step": 16410 }, { "entropy": 0.9246098041534424, "epoch": 4.475333878440992, "grad_norm": 0.10754341632127762, "learning_rate": 8.406622401369115e-05, "loss": 1.3602, "mean_token_accuracy": 0.7459397271275521, "num_tokens": 1180061482.0, "step": 16420 }, { "entropy": 0.9221455231308937, "epoch": 4.478059416734805, "grad_norm": 0.10532528162002563, "learning_rate": 8.404422612986923e-05, "loss": 1.3549, "mean_token_accuracy": 0.7448075026273727, "num_tokens": 1180768341.0, "step": 16430 }, { "entropy": 0.9203606501221657, "epoch": 4.480784955028618, "grad_norm": 0.11600491404533386, "learning_rate": 8.402221595405728e-05, "loss": 1.3466, "mean_token_accuracy": 0.751039968430996, "num_tokens": 1181502453.0, "step": 16440 }, { "entropy": 0.920854963362217, "epoch": 4.483510493322431, "grad_norm": 0.10823602974414825, "learning_rate": 8.400019349420226e-05, "loss": 1.3483, "mean_token_accuracy": 0.7461565658450127, "num_tokens": 1182212543.0, "step": 16450 }, { "entropy": 0.9236090317368507, "epoch": 4.486236031616245, "grad_norm": 0.11785374581813812, "learning_rate": 8.39781587582556e-05, "loss": 1.3671, "mean_token_accuracy": 0.7461556300520897, "num_tokens": 1182917582.0, "step": 16460 }, { "entropy": 0.9163339242339135, "epoch": 4.488961569910058, "grad_norm": 0.10780960321426392, "learning_rate": 8.395611175417313e-05, "loss": 1.3526, "mean_token_accuracy": 0.7482388079166412, "num_tokens": 1183624007.0, "step": 16470 }, { "entropy": 0.9186526373028755, "epoch": 4.4916871082038705, "grad_norm": 0.10127273947000504, "learning_rate": 8.393405248991515e-05, "loss": 1.347, "mean_token_accuracy": 0.7462329477071762, "num_tokens": 1184337014.0, "step": 16480 }, { "entropy": 0.9266805961728096, "epoch": 4.4944126464976835, "grad_norm": 0.10493501275777817, "learning_rate": 8.391198097344634e-05, "loss": 1.3524, "mean_token_accuracy": 0.7469391375780106, "num_tokens": 1185064509.0, "step": 16490 }, { "entropy": 0.9277998894453049, "epoch": 4.497138184791496, "grad_norm": 0.10381454974412918, "learning_rate": 8.388989721273587e-05, "loss": 1.3546, "mean_token_accuracy": 0.7436658173799515, "num_tokens": 1185775371.0, "step": 16500 }, { "entropy": 0.9154150173068046, "epoch": 4.499863723085309, "grad_norm": 0.10464684665203094, "learning_rate": 8.386780121575726e-05, "loss": 1.3418, "mean_token_accuracy": 0.7563139602541924, "num_tokens": 1186525221.0, "step": 16510 }, { "entropy": 0.9189923197031021, "epoch": 4.502589261379122, "grad_norm": 0.10428628325462341, "learning_rate": 8.384569299048847e-05, "loss": 1.3489, "mean_token_accuracy": 0.7505606949329376, "num_tokens": 1187263881.0, "step": 16520 }, { "entropy": 0.9158635541796685, "epoch": 4.505314799672935, "grad_norm": 0.10386273264884949, "learning_rate": 8.382357254491193e-05, "loss": 1.3484, "mean_token_accuracy": 0.7489606320858002, "num_tokens": 1187982522.0, "step": 16530 }, { "entropy": 0.9306271061301231, "epoch": 4.508040337966748, "grad_norm": 0.1186213418841362, "learning_rate": 8.38014398870144e-05, "loss": 1.3567, "mean_token_accuracy": 0.7450304880738259, "num_tokens": 1188695919.0, "step": 16540 }, { "entropy": 0.925073404610157, "epoch": 4.510765876260561, "grad_norm": 0.10341156274080276, "learning_rate": 8.377929502478707e-05, "loss": 1.3534, "mean_token_accuracy": 0.7464147448539734, "num_tokens": 1189414411.0, "step": 16550 }, { "entropy": 0.9185432195663452, "epoch": 4.513491414554375, "grad_norm": 0.10422544181346893, "learning_rate": 8.37571379662256e-05, "loss": 1.3548, "mean_token_accuracy": 0.7488935604691506, "num_tokens": 1190132422.0, "step": 16560 }, { "entropy": 0.9278983324766159, "epoch": 4.516216952848188, "grad_norm": 0.10178219527006149, "learning_rate": 8.373496871932998e-05, "loss": 1.3594, "mean_token_accuracy": 0.7470879390835762, "num_tokens": 1190857831.0, "step": 16570 }, { "entropy": 0.9227214083075523, "epoch": 4.518942491142001, "grad_norm": 0.1024470180273056, "learning_rate": 8.371278729210461e-05, "loss": 1.3568, "mean_token_accuracy": 0.7462427109479904, "num_tokens": 1191571574.0, "step": 16580 }, { "entropy": 0.9245967090129852, "epoch": 4.521668029435814, "grad_norm": 0.11787084490060806, "learning_rate": 8.369059369255834e-05, "loss": 1.3526, "mean_token_accuracy": 0.7433294966816902, "num_tokens": 1192267504.0, "step": 16590 }, { "entropy": 0.9241783767938614, "epoch": 4.524393567729627, "grad_norm": 0.10807237029075623, "learning_rate": 8.366838792870435e-05, "loss": 1.3475, "mean_token_accuracy": 0.7497042864561081, "num_tokens": 1193000458.0, "step": 16600 }, { "entropy": 0.9186954587697983, "epoch": 4.52711910602344, "grad_norm": 0.10416384041309357, "learning_rate": 8.364617000856025e-05, "loss": 1.3426, "mean_token_accuracy": 0.7473282679915428, "num_tokens": 1193723650.0, "step": 16610 }, { "entropy": 0.9211036786437035, "epoch": 4.529844644317253, "grad_norm": 0.107343390583992, "learning_rate": 8.362393994014805e-05, "loss": 1.3493, "mean_token_accuracy": 0.7486666798591614, "num_tokens": 1194436374.0, "step": 16620 }, { "entropy": 0.9238960713148117, "epoch": 4.532570182611066, "grad_norm": 0.10108114033937454, "learning_rate": 8.360169773149408e-05, "loss": 1.348, "mean_token_accuracy": 0.7451175212860107, "num_tokens": 1195156490.0, "step": 16630 }, { "entropy": 0.9179178893566131, "epoch": 4.5352957209048785, "grad_norm": 0.09835729002952576, "learning_rate": 8.357944339062915e-05, "loss": 1.3473, "mean_token_accuracy": 0.7542638510465622, "num_tokens": 1195902942.0, "step": 16640 }, { "entropy": 0.9226110145449639, "epoch": 4.5380212591986915, "grad_norm": 0.10751954466104507, "learning_rate": 8.355717692558837e-05, "loss": 1.3537, "mean_token_accuracy": 0.7422856971621513, "num_tokens": 1196601758.0, "step": 16650 }, { "entropy": 0.9215986758470536, "epoch": 4.540746797492504, "grad_norm": 0.0961076095700264, "learning_rate": 8.353489834441129e-05, "loss": 1.3435, "mean_token_accuracy": 0.7530729457736015, "num_tokens": 1197337952.0, "step": 16660 }, { "entropy": 0.9258883237838745, "epoch": 4.543472335786317, "grad_norm": 0.10355409979820251, "learning_rate": 8.351260765514175e-05, "loss": 1.3663, "mean_token_accuracy": 0.742791873216629, "num_tokens": 1198035431.0, "step": 16670 }, { "entropy": 0.9232835918664932, "epoch": 4.546197874080131, "grad_norm": 0.1080857664346695, "learning_rate": 8.349030486582805e-05, "loss": 1.3494, "mean_token_accuracy": 0.7489354580640792, "num_tokens": 1198753666.0, "step": 16680 }, { "entropy": 0.9208525791764259, "epoch": 4.548923412373944, "grad_norm": 0.1087987944483757, "learning_rate": 8.346798998452282e-05, "loss": 1.3547, "mean_token_accuracy": 0.7472927644848824, "num_tokens": 1199471906.0, "step": 16690 }, { "entropy": 0.9178042456507682, "epoch": 4.551648950667757, "grad_norm": 0.1054878681898117, "learning_rate": 8.344566301928306e-05, "loss": 1.3456, "mean_token_accuracy": 0.7514221504330635, "num_tokens": 1200189269.0, "step": 16700 }, { "entropy": 0.9227500975131988, "epoch": 4.55437448896157, "grad_norm": 0.10009706020355225, "learning_rate": 8.342332397817011e-05, "loss": 1.3527, "mean_token_accuracy": 0.7442700415849686, "num_tokens": 1200904850.0, "step": 16710 }, { "entropy": 0.9224673196673393, "epoch": 4.557100027255383, "grad_norm": 0.12601953744888306, "learning_rate": 8.340097286924975e-05, "loss": 1.3479, "mean_token_accuracy": 0.748690877854824, "num_tokens": 1201625428.0, "step": 16720 }, { "entropy": 0.9233771145343781, "epoch": 4.559825565549196, "grad_norm": 0.10821715742349625, "learning_rate": 8.337860970059199e-05, "loss": 1.3532, "mean_token_accuracy": 0.7455072551965714, "num_tokens": 1202341734.0, "step": 16730 }, { "entropy": 0.9218176856637001, "epoch": 4.562551103843009, "grad_norm": 0.10075296461582184, "learning_rate": 8.33562344802713e-05, "loss": 1.3556, "mean_token_accuracy": 0.7500150710344314, "num_tokens": 1203076540.0, "step": 16740 }, { "entropy": 0.9333092331886291, "epoch": 4.565276642136822, "grad_norm": 0.10132449865341187, "learning_rate": 8.333384721636646e-05, "loss": 1.3603, "mean_token_accuracy": 0.7441597357392311, "num_tokens": 1203792960.0, "step": 16750 }, { "entropy": 0.9210795417428017, "epoch": 4.568002180430635, "grad_norm": 0.09611700475215912, "learning_rate": 8.331144791696059e-05, "loss": 1.3486, "mean_token_accuracy": 0.7507175087928772, "num_tokens": 1204522218.0, "step": 16760 }, { "entropy": 0.9296272456645965, "epoch": 4.570727718724448, "grad_norm": 0.10803563892841339, "learning_rate": 8.32890365901412e-05, "loss": 1.3538, "mean_token_accuracy": 0.7462391838431358, "num_tokens": 1205239556.0, "step": 16770 }, { "entropy": 0.9215833842754364, "epoch": 4.5734532570182616, "grad_norm": 0.10197755694389343, "learning_rate": 8.326661324400008e-05, "loss": 1.3552, "mean_token_accuracy": 0.7484742417931557, "num_tokens": 1205955974.0, "step": 16780 }, { "entropy": 0.9258045464754104, "epoch": 4.5761787953120745, "grad_norm": 0.10073843598365784, "learning_rate": 8.32441778866334e-05, "loss": 1.3617, "mean_token_accuracy": 0.7447678685188294, "num_tokens": 1206664924.0, "step": 16790 }, { "entropy": 0.9241404712200165, "epoch": 4.5789043336058874, "grad_norm": 0.10945308208465576, "learning_rate": 8.322173052614169e-05, "loss": 1.3563, "mean_token_accuracy": 0.7472848266363143, "num_tokens": 1207376945.0, "step": 16800 }, { "entropy": 0.9194119274616241, "epoch": 4.5816298718997, "grad_norm": 0.10351152718067169, "learning_rate": 8.319927117062973e-05, "loss": 1.3489, "mean_token_accuracy": 0.7491079226136208, "num_tokens": 1208104503.0, "step": 16810 }, { "entropy": 0.9161817282438278, "epoch": 4.584355410193513, "grad_norm": 0.13375310599803925, "learning_rate": 8.317679982820671e-05, "loss": 1.3541, "mean_token_accuracy": 0.752979950606823, "num_tokens": 1208833481.0, "step": 16820 }, { "entropy": 0.9225863084197045, "epoch": 4.587080948487326, "grad_norm": 0.10402826964855194, "learning_rate": 8.315431650698613e-05, "loss": 1.3586, "mean_token_accuracy": 0.7458830237388611, "num_tokens": 1209547234.0, "step": 16830 }, { "entropy": 0.9251091539859772, "epoch": 4.589806486781139, "grad_norm": 0.10585848242044449, "learning_rate": 8.313182121508578e-05, "loss": 1.3532, "mean_token_accuracy": 0.7482419028878212, "num_tokens": 1210267468.0, "step": 16840 }, { "entropy": 0.9181981027126312, "epoch": 4.592532025074952, "grad_norm": 0.10736094415187836, "learning_rate": 8.310931396062782e-05, "loss": 1.35, "mean_token_accuracy": 0.7476749077439309, "num_tokens": 1210981391.0, "step": 16850 }, { "entropy": 0.9191288724541664, "epoch": 4.595257563368765, "grad_norm": 0.11005821079015732, "learning_rate": 8.30867947517387e-05, "loss": 1.3475, "mean_token_accuracy": 0.7482886627316475, "num_tokens": 1211699743.0, "step": 16860 }, { "entropy": 0.9240297868847847, "epoch": 4.597983101662578, "grad_norm": 0.10537801682949066, "learning_rate": 8.306426359654917e-05, "loss": 1.357, "mean_token_accuracy": 0.7482584595680237, "num_tokens": 1212402209.0, "step": 16870 }, { "entropy": 0.9225147813558578, "epoch": 4.600708639956391, "grad_norm": 0.11033676564693451, "learning_rate": 8.304172050319436e-05, "loss": 1.3596, "mean_token_accuracy": 0.7457825124263764, "num_tokens": 1213118934.0, "step": 16880 }, { "entropy": 0.9162515133619309, "epoch": 4.603434178250204, "grad_norm": 0.12636755406856537, "learning_rate": 8.301916547981365e-05, "loss": 1.3517, "mean_token_accuracy": 0.7530664309859276, "num_tokens": 1213843129.0, "step": 16890 }, { "entropy": 0.9205801919102669, "epoch": 4.606159716544018, "grad_norm": 0.11650549620389938, "learning_rate": 8.299659853455074e-05, "loss": 1.354, "mean_token_accuracy": 0.7426133722066879, "num_tokens": 1214554615.0, "step": 16900 }, { "entropy": 0.9172195091843605, "epoch": 4.608885254837831, "grad_norm": 0.09601568430662155, "learning_rate": 8.297401967555362e-05, "loss": 1.3469, "mean_token_accuracy": 0.7458287104964256, "num_tokens": 1215263942.0, "step": 16910 }, { "entropy": 0.9214783206582069, "epoch": 4.611610793131644, "grad_norm": 0.10365541279315948, "learning_rate": 8.295142891097466e-05, "loss": 1.3524, "mean_token_accuracy": 0.7539938539266586, "num_tokens": 1216001651.0, "step": 16920 }, { "entropy": 0.9217340096831321, "epoch": 4.614336331425457, "grad_norm": 0.10575239360332489, "learning_rate": 8.292882624897041e-05, "loss": 1.3543, "mean_token_accuracy": 0.7463909596204757, "num_tokens": 1216711332.0, "step": 16930 }, { "entropy": 0.9175868049263954, "epoch": 4.61706186971927, "grad_norm": 0.11438553035259247, "learning_rate": 8.290621169770179e-05, "loss": 1.3477, "mean_token_accuracy": 0.7449107185006142, "num_tokens": 1217408569.0, "step": 16940 }, { "entropy": 0.916756784915924, "epoch": 4.6197874080130825, "grad_norm": 0.10522891581058502, "learning_rate": 8.288358526533401e-05, "loss": 1.3495, "mean_token_accuracy": 0.7468285739421845, "num_tokens": 1218121983.0, "step": 16950 }, { "entropy": 0.9158628568053245, "epoch": 4.6225129463068955, "grad_norm": 0.1695455014705658, "learning_rate": 8.286094696003655e-05, "loss": 1.3422, "mean_token_accuracy": 0.7501478627324104, "num_tokens": 1218844701.0, "step": 16960 }, { "entropy": 0.9222366034984588, "epoch": 4.625238484600708, "grad_norm": 0.12280505150556564, "learning_rate": 8.283829678998318e-05, "loss": 1.348, "mean_token_accuracy": 0.7487332820892334, "num_tokens": 1219555849.0, "step": 16970 }, { "entropy": 0.9117548048496247, "epoch": 4.627964022894521, "grad_norm": 0.09231628477573395, "learning_rate": 8.281563476335197e-05, "loss": 1.3357, "mean_token_accuracy": 0.751614136993885, "num_tokens": 1220291533.0, "step": 16980 }, { "entropy": 0.9225894793868065, "epoch": 4.630689561188335, "grad_norm": 0.109446220099926, "learning_rate": 8.279296088832525e-05, "loss": 1.3495, "mean_token_accuracy": 0.7509663596749305, "num_tokens": 1221016163.0, "step": 16990 }, { "entropy": 0.9290517643094063, "epoch": 4.633415099482148, "grad_norm": 0.10743549466133118, "learning_rate": 8.277027517308965e-05, "loss": 1.3533, "mean_token_accuracy": 0.7469459012150764, "num_tokens": 1221746578.0, "step": 17000 }, { "entropy": 0.9262382388114929, "epoch": 4.636140637775961, "grad_norm": 0.10961365699768066, "learning_rate": 8.274757762583605e-05, "loss": 1.3579, "mean_token_accuracy": 0.7437677323818207, "num_tokens": 1222447891.0, "step": 17010 }, { "entropy": 0.9256102323532105, "epoch": 4.638866176069774, "grad_norm": 0.17248821258544922, "learning_rate": 8.27248682547596e-05, "loss": 1.3548, "mean_token_accuracy": 0.7464618891477585, "num_tokens": 1223168990.0, "step": 17020 }, { "entropy": 0.9164867550134659, "epoch": 4.641591714363587, "grad_norm": 0.11628459393978119, "learning_rate": 8.270214706805975e-05, "loss": 1.3497, "mean_token_accuracy": 0.7500196889042854, "num_tokens": 1223888373.0, "step": 17030 }, { "entropy": 0.9233259737491608, "epoch": 4.6443172526574, "grad_norm": 0.10588211566209793, "learning_rate": 8.267941407394021e-05, "loss": 1.3546, "mean_token_accuracy": 0.7507358610630035, "num_tokens": 1224617523.0, "step": 17040 }, { "entropy": 0.9266725420951843, "epoch": 4.647042790951213, "grad_norm": 0.09244404733181, "learning_rate": 8.265666928060894e-05, "loss": 1.3634, "mean_token_accuracy": 0.7496835634112358, "num_tokens": 1225339096.0, "step": 17050 }, { "entropy": 0.9150111705064774, "epoch": 4.649768329245026, "grad_norm": 0.10257738083600998, "learning_rate": 8.263391269627814e-05, "loss": 1.3442, "mean_token_accuracy": 0.7501561403274536, "num_tokens": 1226060970.0, "step": 17060 }, { "entropy": 0.9162648782134056, "epoch": 4.652493867538839, "grad_norm": 0.10511647909879684, "learning_rate": 8.261114432916433e-05, "loss": 1.3461, "mean_token_accuracy": 0.7498621806502342, "num_tokens": 1226780834.0, "step": 17070 }, { "entropy": 0.9222771629691124, "epoch": 4.655219405832652, "grad_norm": 0.10543674975633621, "learning_rate": 8.25883641874882e-05, "loss": 1.3545, "mean_token_accuracy": 0.7483288168907165, "num_tokens": 1227494220.0, "step": 17080 }, { "entropy": 0.9159112647175789, "epoch": 4.657944944126465, "grad_norm": 0.1046845093369484, "learning_rate": 8.256557227947475e-05, "loss": 1.3393, "mean_token_accuracy": 0.751229789853096, "num_tokens": 1228228148.0, "step": 17090 }, { "entropy": 0.9199364632368088, "epoch": 4.660670482420278, "grad_norm": 0.10549994558095932, "learning_rate": 8.254276861335322e-05, "loss": 1.3437, "mean_token_accuracy": 0.7498672157526016, "num_tokens": 1228954174.0, "step": 17100 }, { "entropy": 0.9175642892718315, "epoch": 4.6633960207140905, "grad_norm": 0.09940032660961151, "learning_rate": 8.25199531973571e-05, "loss": 1.348, "mean_token_accuracy": 0.7468050643801689, "num_tokens": 1229667994.0, "step": 17110 }, { "entropy": 0.912084773182869, "epoch": 4.666121559007904, "grad_norm": 0.10739535838365555, "learning_rate": 8.249712603972409e-05, "loss": 1.3437, "mean_token_accuracy": 0.7519252315163613, "num_tokens": 1230389211.0, "step": 17120 }, { "entropy": 0.9226089671254158, "epoch": 4.668847097301717, "grad_norm": 0.09731782227754593, "learning_rate": 8.247428714869616e-05, "loss": 1.3479, "mean_token_accuracy": 0.74716587215662, "num_tokens": 1231097082.0, "step": 17130 }, { "entropy": 0.9198968097567558, "epoch": 4.67157263559553, "grad_norm": 0.10072658210992813, "learning_rate": 8.245143653251952e-05, "loss": 1.3422, "mean_token_accuracy": 0.7485209181904793, "num_tokens": 1231808943.0, "step": 17140 }, { "entropy": 0.9217645287513733, "epoch": 4.674298173889343, "grad_norm": 0.09910709410905838, "learning_rate": 8.242857419944459e-05, "loss": 1.3496, "mean_token_accuracy": 0.7481761828064919, "num_tokens": 1232528394.0, "step": 17150 }, { "entropy": 0.9187888920307159, "epoch": 4.677023712183156, "grad_norm": 0.1049736887216568, "learning_rate": 8.240570015772604e-05, "loss": 1.3486, "mean_token_accuracy": 0.7452646285295487, "num_tokens": 1233236436.0, "step": 17160 }, { "entropy": 0.9299355641007423, "epoch": 4.679749250476969, "grad_norm": 0.10277475416660309, "learning_rate": 8.238281441562273e-05, "loss": 1.3641, "mean_token_accuracy": 0.7394877701997757, "num_tokens": 1233939860.0, "step": 17170 }, { "entropy": 0.9240302801132202, "epoch": 4.682474788770782, "grad_norm": 0.1163918524980545, "learning_rate": 8.235991698139783e-05, "loss": 1.3528, "mean_token_accuracy": 0.7462989240884781, "num_tokens": 1234663102.0, "step": 17180 }, { "entropy": 0.9209274545311927, "epoch": 4.685200327064595, "grad_norm": 0.10490309447050095, "learning_rate": 8.23370078633186e-05, "loss": 1.3527, "mean_token_accuracy": 0.7471803933382034, "num_tokens": 1235386239.0, "step": 17190 }, { "entropy": 0.928577084839344, "epoch": 4.687925865358408, "grad_norm": 0.11143554747104645, "learning_rate": 8.231408706965666e-05, "loss": 1.3562, "mean_token_accuracy": 0.7434001788496971, "num_tokens": 1236088357.0, "step": 17200 }, { "entropy": 0.9305694311857223, "epoch": 4.690651403652222, "grad_norm": 0.10430223494768143, "learning_rate": 8.229115460868775e-05, "loss": 1.3588, "mean_token_accuracy": 0.7478098511695862, "num_tokens": 1236814332.0, "step": 17210 }, { "entropy": 0.9143865138292313, "epoch": 4.693376941946035, "grad_norm": 0.09553319960832596, "learning_rate": 8.226821048869184e-05, "loss": 1.3393, "mean_token_accuracy": 0.7473413035273552, "num_tokens": 1237528620.0, "step": 17220 }, { "entropy": 0.916749370098114, "epoch": 4.696102480239848, "grad_norm": 0.09525775164365768, "learning_rate": 8.224525471795317e-05, "loss": 1.3455, "mean_token_accuracy": 0.7485346272587776, "num_tokens": 1238249386.0, "step": 17230 }, { "entropy": 0.921876285970211, "epoch": 4.698828018533661, "grad_norm": 0.10387054085731506, "learning_rate": 8.222228730476009e-05, "loss": 1.3567, "mean_token_accuracy": 0.7456609532237053, "num_tokens": 1238960045.0, "step": 17240 }, { "entropy": 0.919804036617279, "epoch": 4.701553556827474, "grad_norm": 0.11917005479335785, "learning_rate": 8.21993082574052e-05, "loss": 1.3517, "mean_token_accuracy": 0.7492782562971115, "num_tokens": 1239684245.0, "step": 17250 }, { "entropy": 0.926070973277092, "epoch": 4.7042790951212865, "grad_norm": 0.11269728094339371, "learning_rate": 8.217631758418534e-05, "loss": 1.3528, "mean_token_accuracy": 0.7491124123334885, "num_tokens": 1240409991.0, "step": 17260 }, { "entropy": 0.9213026985526085, "epoch": 4.7070046334150994, "grad_norm": 0.10869846493005753, "learning_rate": 8.21533152934015e-05, "loss": 1.3497, "mean_token_accuracy": 0.7475429430603981, "num_tokens": 1241122725.0, "step": 17270 }, { "entropy": 0.9191406026482583, "epoch": 4.709730171708912, "grad_norm": 0.1102442592382431, "learning_rate": 8.213030139335885e-05, "loss": 1.3506, "mean_token_accuracy": 0.7509415715932846, "num_tokens": 1241837856.0, "step": 17280 }, { "entropy": 0.9176264256238937, "epoch": 4.712455710002725, "grad_norm": 0.11132961511611938, "learning_rate": 8.210727589236679e-05, "loss": 1.36, "mean_token_accuracy": 0.7469341784715653, "num_tokens": 1242542396.0, "step": 17290 }, { "entropy": 0.9260061651468277, "epoch": 4.715181248296538, "grad_norm": 0.12213858962059021, "learning_rate": 8.208423879873892e-05, "loss": 1.3524, "mean_token_accuracy": 0.747686205804348, "num_tokens": 1243266256.0, "step": 17300 }, { "entropy": 0.9204802647233009, "epoch": 4.717906786590351, "grad_norm": 0.10788416117429733, "learning_rate": 8.206119012079297e-05, "loss": 1.3562, "mean_token_accuracy": 0.7475770086050033, "num_tokens": 1243985897.0, "step": 17310 }, { "entropy": 0.9188668221235275, "epoch": 4.720632324884164, "grad_norm": 0.1071867048740387, "learning_rate": 8.203812986685088e-05, "loss": 1.3394, "mean_token_accuracy": 0.749122953414917, "num_tokens": 1244707866.0, "step": 17320 }, { "entropy": 0.9235012277960777, "epoch": 4.723357863177978, "grad_norm": 0.10762520134449005, "learning_rate": 8.201505804523879e-05, "loss": 1.3561, "mean_token_accuracy": 0.7462771251797676, "num_tokens": 1245429738.0, "step": 17330 }, { "entropy": 0.9198080718517303, "epoch": 4.726083401471791, "grad_norm": 0.10488855838775635, "learning_rate": 8.199197466428699e-05, "loss": 1.3522, "mean_token_accuracy": 0.7489576727151871, "num_tokens": 1246143218.0, "step": 17340 }, { "entropy": 0.9154806345701217, "epoch": 4.728808939765604, "grad_norm": 0.10319756716489792, "learning_rate": 8.196887973232996e-05, "loss": 1.3449, "mean_token_accuracy": 0.7500908523797989, "num_tokens": 1246862456.0, "step": 17350 }, { "entropy": 0.9225591003894806, "epoch": 4.731534478059417, "grad_norm": 0.11112985759973526, "learning_rate": 8.194577325770634e-05, "loss": 1.3521, "mean_token_accuracy": 0.7449140757322311, "num_tokens": 1247576328.0, "step": 17360 }, { "entropy": 0.9286596611142158, "epoch": 4.73426001635323, "grad_norm": 0.10459794104099274, "learning_rate": 8.192265524875894e-05, "loss": 1.3608, "mean_token_accuracy": 0.7479562908411026, "num_tokens": 1248298945.0, "step": 17370 }, { "entropy": 0.9241178303956985, "epoch": 4.736985554647043, "grad_norm": 0.1349504292011261, "learning_rate": 8.189952571383475e-05, "loss": 1.3501, "mean_token_accuracy": 0.744536454975605, "num_tokens": 1249012614.0, "step": 17380 }, { "entropy": 0.9124541774392128, "epoch": 4.739711092940856, "grad_norm": 0.10812727361917496, "learning_rate": 8.18763846612849e-05, "loss": 1.3422, "mean_token_accuracy": 0.7497065871953964, "num_tokens": 1249711886.0, "step": 17390 }, { "entropy": 0.9234019756317139, "epoch": 4.742436631234669, "grad_norm": 0.12515738606452942, "learning_rate": 8.185323209946465e-05, "loss": 1.3523, "mean_token_accuracy": 0.7470652341842652, "num_tokens": 1250437022.0, "step": 17400 }, { "entropy": 0.9112591460347176, "epoch": 4.745162169528482, "grad_norm": 0.21318070590496063, "learning_rate": 8.18300680367335e-05, "loss": 1.3447, "mean_token_accuracy": 0.7522909045219421, "num_tokens": 1251163833.0, "step": 17410 }, { "entropy": 0.9248941242694855, "epoch": 4.7478877078222945, "grad_norm": 0.10058721154928207, "learning_rate": 8.180689248145503e-05, "loss": 1.3605, "mean_token_accuracy": 0.7427182897925377, "num_tokens": 1251869086.0, "step": 17420 }, { "entropy": 0.9240973278880119, "epoch": 4.750613246116108, "grad_norm": 0.10814929753541946, "learning_rate": 8.178370544199701e-05, "loss": 1.3529, "mean_token_accuracy": 0.7461601093411445, "num_tokens": 1252580434.0, "step": 17430 }, { "entropy": 0.9222966253757476, "epoch": 4.753338784409921, "grad_norm": 0.11058203130960464, "learning_rate": 8.176050692673134e-05, "loss": 1.3509, "mean_token_accuracy": 0.7479978322982788, "num_tokens": 1253310826.0, "step": 17440 }, { "entropy": 0.9145761653780937, "epoch": 4.756064322703734, "grad_norm": 0.1636810302734375, "learning_rate": 8.173729694403404e-05, "loss": 1.3468, "mean_token_accuracy": 0.7477872595191002, "num_tokens": 1254035147.0, "step": 17450 }, { "entropy": 0.9174238905310631, "epoch": 4.758789860997547, "grad_norm": 0.1089249700307846, "learning_rate": 8.171407550228532e-05, "loss": 1.3397, "mean_token_accuracy": 0.7504594132304192, "num_tokens": 1254764538.0, "step": 17460 }, { "entropy": 0.9233099758625031, "epoch": 4.76151539929136, "grad_norm": 0.10400953143835068, "learning_rate": 8.169084260986948e-05, "loss": 1.3541, "mean_token_accuracy": 0.7493297189474106, "num_tokens": 1255487377.0, "step": 17470 }, { "entropy": 0.9232550159096717, "epoch": 4.764240937585173, "grad_norm": 0.11339503526687622, "learning_rate": 8.166759827517498e-05, "loss": 1.3514, "mean_token_accuracy": 0.7459690898656846, "num_tokens": 1256210228.0, "step": 17480 }, { "entropy": 0.9163402050733567, "epoch": 4.766966475878986, "grad_norm": 0.10250867158174515, "learning_rate": 8.164434250659441e-05, "loss": 1.3437, "mean_token_accuracy": 0.748111541569233, "num_tokens": 1256935585.0, "step": 17490 }, { "entropy": 0.9241256102919578, "epoch": 4.769692014172799, "grad_norm": 0.11915501952171326, "learning_rate": 8.16210753125245e-05, "loss": 1.3509, "mean_token_accuracy": 0.7453058168292046, "num_tokens": 1257648523.0, "step": 17500 }, { "entropy": 0.9295717850327492, "epoch": 4.772417552466612, "grad_norm": 0.1178000271320343, "learning_rate": 8.159779670136608e-05, "loss": 1.3574, "mean_token_accuracy": 0.7509691178798675, "num_tokens": 1258375416.0, "step": 17510 }, { "entropy": 0.9127016827464104, "epoch": 4.775143090760425, "grad_norm": 0.11207820475101471, "learning_rate": 8.15745066815241e-05, "loss": 1.3438, "mean_token_accuracy": 0.7531407192349434, "num_tokens": 1259099537.0, "step": 17520 }, { "entropy": 0.924431873857975, "epoch": 4.777868629054238, "grad_norm": 0.10758596658706665, "learning_rate": 8.155120526140766e-05, "loss": 1.3475, "mean_token_accuracy": 0.7530660226941108, "num_tokens": 1259840085.0, "step": 17530 }, { "entropy": 0.9277138888835907, "epoch": 4.780594167348051, "grad_norm": 0.13582734763622284, "learning_rate": 8.152789244942996e-05, "loss": 1.3571, "mean_token_accuracy": 0.7471134886145592, "num_tokens": 1260562448.0, "step": 17540 }, { "entropy": 0.9182221814990044, "epoch": 4.783319705641865, "grad_norm": 0.1102224588394165, "learning_rate": 8.15045682540083e-05, "loss": 1.3433, "mean_token_accuracy": 0.7517937749624253, "num_tokens": 1261289261.0, "step": 17550 }, { "entropy": 0.917127600312233, "epoch": 4.7860452439356775, "grad_norm": 0.10573709011077881, "learning_rate": 8.14812326835641e-05, "loss": 1.3528, "mean_token_accuracy": 0.757950046658516, "num_tokens": 1262033603.0, "step": 17560 }, { "entropy": 0.9341249838471413, "epoch": 4.7887707822294905, "grad_norm": 0.10214850306510925, "learning_rate": 8.145788574652288e-05, "loss": 1.3639, "mean_token_accuracy": 0.7426125407218933, "num_tokens": 1262752998.0, "step": 17570 }, { "entropy": 0.9180441945791245, "epoch": 4.791496320523303, "grad_norm": 0.1256493777036667, "learning_rate": 8.14345274513143e-05, "loss": 1.3409, "mean_token_accuracy": 0.7528748378157616, "num_tokens": 1263483934.0, "step": 17580 }, { "entropy": 0.9169729307293892, "epoch": 4.794221858817116, "grad_norm": 0.098321832716465, "learning_rate": 8.141115780637208e-05, "loss": 1.3517, "mean_token_accuracy": 0.7468766659498215, "num_tokens": 1264203136.0, "step": 17590 }, { "entropy": 0.9212764590978623, "epoch": 4.796947397110929, "grad_norm": 0.11560304462909698, "learning_rate": 8.138777682013403e-05, "loss": 1.3473, "mean_token_accuracy": 0.7478474527597427, "num_tokens": 1264927412.0, "step": 17600 }, { "entropy": 0.916501834988594, "epoch": 4.799672935404742, "grad_norm": 0.10708596557378769, "learning_rate": 8.136438450104212e-05, "loss": 1.3471, "mean_token_accuracy": 0.7494879648089409, "num_tokens": 1265638281.0, "step": 17610 }, { "entropy": 0.9157280281186104, "epoch": 4.802398473698555, "grad_norm": 0.09304467588663101, "learning_rate": 8.134098085754233e-05, "loss": 1.346, "mean_token_accuracy": 0.7529150784015656, "num_tokens": 1266367884.0, "step": 17620 }, { "entropy": 0.9149423062801361, "epoch": 4.805124011992368, "grad_norm": 0.11460596323013306, "learning_rate": 8.131756589808479e-05, "loss": 1.3398, "mean_token_accuracy": 0.7494656577706337, "num_tokens": 1267096886.0, "step": 17630 }, { "entropy": 0.9196400806307793, "epoch": 4.807849550286182, "grad_norm": 0.09922295808792114, "learning_rate": 8.129413963112369e-05, "loss": 1.3484, "mean_token_accuracy": 0.7489532619714737, "num_tokens": 1267815503.0, "step": 17640 }, { "entropy": 0.92071463316679, "epoch": 4.810575088579995, "grad_norm": 0.12019436806440353, "learning_rate": 8.127070206511729e-05, "loss": 1.3439, "mean_token_accuracy": 0.7510943159461021, "num_tokens": 1268547915.0, "step": 17650 }, { "entropy": 0.9236974358558655, "epoch": 4.813300626873808, "grad_norm": 0.11996635049581528, "learning_rate": 8.124725320852796e-05, "loss": 1.3582, "mean_token_accuracy": 0.748077042400837, "num_tokens": 1269267387.0, "step": 17660 }, { "entropy": 0.9122890293598175, "epoch": 4.816026165167621, "grad_norm": 0.11178936809301376, "learning_rate": 8.122379306982213e-05, "loss": 1.3329, "mean_token_accuracy": 0.7529049053788185, "num_tokens": 1270003398.0, "step": 17670 }, { "entropy": 0.9168417230248451, "epoch": 4.818751703461434, "grad_norm": 0.14724519848823547, "learning_rate": 8.12003216574703e-05, "loss": 1.3509, "mean_token_accuracy": 0.749293364584446, "num_tokens": 1270718938.0, "step": 17680 }, { "entropy": 0.914535841345787, "epoch": 4.821477241755247, "grad_norm": 0.10512598603963852, "learning_rate": 8.117683897994704e-05, "loss": 1.345, "mean_token_accuracy": 0.7527642354369164, "num_tokens": 1271443060.0, "step": 17690 }, { "entropy": 0.9209541931748391, "epoch": 4.82420278004906, "grad_norm": 0.1139163002371788, "learning_rate": 8.115334504573101e-05, "loss": 1.3513, "mean_token_accuracy": 0.751273301243782, "num_tokens": 1272171307.0, "step": 17700 }, { "entropy": 0.9186633139848709, "epoch": 4.826928318342873, "grad_norm": 0.09583355486392975, "learning_rate": 8.112983986330491e-05, "loss": 1.3585, "mean_token_accuracy": 0.7448722943663597, "num_tokens": 1272881173.0, "step": 17710 }, { "entropy": 0.9142263114452363, "epoch": 4.829653856636686, "grad_norm": 0.10262507200241089, "learning_rate": 8.11063234411555e-05, "loss": 1.3448, "mean_token_accuracy": 0.7498973265290261, "num_tokens": 1273592477.0, "step": 17720 }, { "entropy": 0.9207109525799752, "epoch": 4.8323793949304985, "grad_norm": 0.11521895229816437, "learning_rate": 8.10827957877736e-05, "loss": 1.3563, "mean_token_accuracy": 0.75123840123415, "num_tokens": 1274318734.0, "step": 17730 }, { "entropy": 0.9218509048223495, "epoch": 4.8351049332243115, "grad_norm": 0.13229934871196747, "learning_rate": 8.105925691165413e-05, "loss": 1.3546, "mean_token_accuracy": 0.7465604782104492, "num_tokens": 1275026553.0, "step": 17740 }, { "entropy": 0.9194739490747452, "epoch": 4.837830471518124, "grad_norm": 0.10044396668672562, "learning_rate": 8.103570682129599e-05, "loss": 1.3457, "mean_token_accuracy": 0.7495238274335861, "num_tokens": 1275753007.0, "step": 17750 }, { "entropy": 0.9178076699376106, "epoch": 4.840556009811938, "grad_norm": 0.19709278643131256, "learning_rate": 8.101214552520216e-05, "loss": 1.3497, "mean_token_accuracy": 0.7485316529870033, "num_tokens": 1276479010.0, "step": 17760 }, { "entropy": 0.9250484704971313, "epoch": 4.843281548105751, "grad_norm": 0.10807700455188751, "learning_rate": 8.09885730318797e-05, "loss": 1.3558, "mean_token_accuracy": 0.7500222280621529, "num_tokens": 1277216478.0, "step": 17770 }, { "entropy": 0.9244115814566612, "epoch": 4.846007086399564, "grad_norm": 0.11148900538682938, "learning_rate": 8.096498934983965e-05, "loss": 1.357, "mean_token_accuracy": 0.7489386513829231, "num_tokens": 1277935610.0, "step": 17780 }, { "entropy": 0.916721199452877, "epoch": 4.848732624693377, "grad_norm": 0.11641812324523926, "learning_rate": 8.094139448759714e-05, "loss": 1.3495, "mean_token_accuracy": 0.7474601671099663, "num_tokens": 1278649268.0, "step": 17790 }, { "entropy": 0.9256363198161125, "epoch": 4.85145816298719, "grad_norm": 0.10508560389280319, "learning_rate": 8.09177884536713e-05, "loss": 1.3573, "mean_token_accuracy": 0.7465876549482345, "num_tokens": 1279367778.0, "step": 17800 }, { "entropy": 0.923135606944561, "epoch": 4.854183701281003, "grad_norm": 0.10860153287649155, "learning_rate": 8.089417125658534e-05, "loss": 1.3525, "mean_token_accuracy": 0.7471994385123253, "num_tokens": 1280084792.0, "step": 17810 }, { "entropy": 0.9226791754364967, "epoch": 4.856909239574816, "grad_norm": 0.13328388333320618, "learning_rate": 8.087054290486647e-05, "loss": 1.3472, "mean_token_accuracy": 0.7541562110185623, "num_tokens": 1280822314.0, "step": 17820 }, { "entropy": 0.918493464589119, "epoch": 4.859634777868629, "grad_norm": 0.10711206495761871, "learning_rate": 8.08469034070459e-05, "loss": 1.354, "mean_token_accuracy": 0.7474129155278206, "num_tokens": 1281535740.0, "step": 17830 }, { "entropy": 0.9164285495877266, "epoch": 4.862360316162442, "grad_norm": 0.10846658051013947, "learning_rate": 8.082325277165889e-05, "loss": 1.3501, "mean_token_accuracy": 0.7508197382092476, "num_tokens": 1282261076.0, "step": 17840 }, { "entropy": 0.9170690849423409, "epoch": 4.865085854456255, "grad_norm": 0.09901037067174911, "learning_rate": 8.079959100724477e-05, "loss": 1.3603, "mean_token_accuracy": 0.7489598989486694, "num_tokens": 1282972515.0, "step": 17850 }, { "entropy": 0.917238111793995, "epoch": 4.867811392750069, "grad_norm": 0.09574832022190094, "learning_rate": 8.077591812234684e-05, "loss": 1.3527, "mean_token_accuracy": 0.7521451890468598, "num_tokens": 1283694638.0, "step": 17860 }, { "entropy": 0.9155911713838577, "epoch": 4.8705369310438815, "grad_norm": 0.10780677199363708, "learning_rate": 8.075223412551237e-05, "loss": 1.3377, "mean_token_accuracy": 0.747342175245285, "num_tokens": 1284407095.0, "step": 17870 }, { "entropy": 0.9142779275774956, "epoch": 4.8732624693376945, "grad_norm": 0.10568727552890778, "learning_rate": 8.072853902529273e-05, "loss": 1.3432, "mean_token_accuracy": 0.7461394801735878, "num_tokens": 1285111455.0, "step": 17880 }, { "entropy": 0.9211603671312332, "epoch": 4.875988007631507, "grad_norm": 0.10505899041891098, "learning_rate": 8.070483283024326e-05, "loss": 1.3515, "mean_token_accuracy": 0.7452557429671287, "num_tokens": 1285819802.0, "step": 17890 }, { "entropy": 0.9161028012633323, "epoch": 4.87871354592532, "grad_norm": 0.09776589274406433, "learning_rate": 8.068111554892329e-05, "loss": 1.3378, "mean_token_accuracy": 0.7473795488476753, "num_tokens": 1286540207.0, "step": 17900 }, { "entropy": 0.9268019363284111, "epoch": 4.881439084219133, "grad_norm": 0.10650679469108582, "learning_rate": 8.065738718989618e-05, "loss": 1.3563, "mean_token_accuracy": 0.7462029054760932, "num_tokens": 1287262389.0, "step": 17910 }, { "entropy": 0.9144074723124505, "epoch": 4.884164622512946, "grad_norm": 0.11430129408836365, "learning_rate": 8.063364776172928e-05, "loss": 1.3382, "mean_token_accuracy": 0.7461496248841286, "num_tokens": 1287964225.0, "step": 17920 }, { "entropy": 0.9132382705807686, "epoch": 4.886890160806759, "grad_norm": 0.10328994691371918, "learning_rate": 8.060989727299392e-05, "loss": 1.3437, "mean_token_accuracy": 0.7519752576947212, "num_tokens": 1288697565.0, "step": 17930 }, { "entropy": 0.9186933055520058, "epoch": 4.889615699100572, "grad_norm": 0.09449103474617004, "learning_rate": 8.058613573226545e-05, "loss": 1.3518, "mean_token_accuracy": 0.7483037784695625, "num_tokens": 1289420743.0, "step": 17940 }, { "entropy": 0.9115293383598327, "epoch": 4.892341237394385, "grad_norm": 0.0965585708618164, "learning_rate": 8.05623631481232e-05, "loss": 1.3454, "mean_token_accuracy": 0.7499361336231232, "num_tokens": 1290150062.0, "step": 17950 }, { "entropy": 0.9113005891442298, "epoch": 4.895066775688198, "grad_norm": 0.10072828084230423, "learning_rate": 8.053857952915049e-05, "loss": 1.3366, "mean_token_accuracy": 0.7560128375887871, "num_tokens": 1290885707.0, "step": 17960 }, { "entropy": 0.9238735303282738, "epoch": 4.897792313982011, "grad_norm": 0.1140623539686203, "learning_rate": 8.051478488393463e-05, "loss": 1.3482, "mean_token_accuracy": 0.7446290031075478, "num_tokens": 1291589482.0, "step": 17970 }, { "entropy": 0.919769535958767, "epoch": 4.900517852275825, "grad_norm": 0.1134912520647049, "learning_rate": 8.049097922106687e-05, "loss": 1.3518, "mean_token_accuracy": 0.7496406942605972, "num_tokens": 1292313088.0, "step": 17980 }, { "entropy": 0.9129861995577813, "epoch": 4.903243390569638, "grad_norm": 0.11114895343780518, "learning_rate": 8.046716254914248e-05, "loss": 1.3437, "mean_token_accuracy": 0.7519585803151131, "num_tokens": 1293035418.0, "step": 17990 }, { "entropy": 0.9183290138840675, "epoch": 4.905968928863451, "grad_norm": 0.1106867641210556, "learning_rate": 8.044333487676072e-05, "loss": 1.3452, "mean_token_accuracy": 0.7493987768888474, "num_tokens": 1293751640.0, "step": 18000 }, { "entropy": 0.918357215821743, "epoch": 4.908694467157264, "grad_norm": 0.10817532241344452, "learning_rate": 8.041949621252478e-05, "loss": 1.3452, "mean_token_accuracy": 0.745792293548584, "num_tokens": 1294454616.0, "step": 18010 }, { "entropy": 0.911582262814045, "epoch": 4.911420005451077, "grad_norm": 0.1894681602716446, "learning_rate": 8.039564656504181e-05, "loss": 1.3403, "mean_token_accuracy": 0.753081364929676, "num_tokens": 1295178063.0, "step": 18020 }, { "entropy": 0.9186591416597366, "epoch": 4.9141455437448895, "grad_norm": 0.10621605813503265, "learning_rate": 8.0371785942923e-05, "loss": 1.355, "mean_token_accuracy": 0.7502840161323547, "num_tokens": 1295903866.0, "step": 18030 }, { "entropy": 0.9134357139468193, "epoch": 4.9168710820387025, "grad_norm": 0.24842919409275055, "learning_rate": 8.034791435478341e-05, "loss": 1.3461, "mean_token_accuracy": 0.7519378915429116, "num_tokens": 1296626622.0, "step": 18040 }, { "entropy": 0.9197294548153877, "epoch": 4.919596620332515, "grad_norm": 0.11456424742937088, "learning_rate": 8.032403180924213e-05, "loss": 1.3572, "mean_token_accuracy": 0.7467811524868011, "num_tokens": 1297338065.0, "step": 18050 }, { "entropy": 0.9246993482112884, "epoch": 4.922322158626328, "grad_norm": 0.11779490858316422, "learning_rate": 8.030013831492218e-05, "loss": 1.3583, "mean_token_accuracy": 0.7469172552227974, "num_tokens": 1298050724.0, "step": 18060 }, { "entropy": 0.9166697457432746, "epoch": 4.925047696920142, "grad_norm": 0.1063537448644638, "learning_rate": 8.027623388045052e-05, "loss": 1.3419, "mean_token_accuracy": 0.7515771239995956, "num_tokens": 1298779329.0, "step": 18070 }, { "entropy": 0.9245874509215355, "epoch": 4.927773235213955, "grad_norm": 0.10378915816545486, "learning_rate": 8.025231851445807e-05, "loss": 1.3544, "mean_token_accuracy": 0.7428726345300675, "num_tokens": 1299492520.0, "step": 18080 }, { "entropy": 0.9091032400727272, "epoch": 4.930498773507768, "grad_norm": 0.10003490000963211, "learning_rate": 8.02283922255797e-05, "loss": 1.3376, "mean_token_accuracy": 0.7529667928814888, "num_tokens": 1300227438.0, "step": 18090 }, { "entropy": 0.9176523268222809, "epoch": 4.933224311801581, "grad_norm": 0.12046157568693161, "learning_rate": 8.020445502245424e-05, "loss": 1.3508, "mean_token_accuracy": 0.7488412380218505, "num_tokens": 1300947339.0, "step": 18100 }, { "entropy": 0.9231064260005951, "epoch": 4.935949850095394, "grad_norm": 0.20513617992401123, "learning_rate": 8.018050691372441e-05, "loss": 1.3635, "mean_token_accuracy": 0.7462878093123436, "num_tokens": 1301649117.0, "step": 18110 }, { "entropy": 0.9169375166296959, "epoch": 4.938675388389207, "grad_norm": 0.12112665176391602, "learning_rate": 8.015654790803694e-05, "loss": 1.3543, "mean_token_accuracy": 0.7494909405708313, "num_tokens": 1302358306.0, "step": 18120 }, { "entropy": 0.9201806411147118, "epoch": 4.94140092668302, "grad_norm": 0.10498200356960297, "learning_rate": 8.013257801404244e-05, "loss": 1.3459, "mean_token_accuracy": 0.7431547686457634, "num_tokens": 1303063658.0, "step": 18130 }, { "entropy": 0.9263772219419479, "epoch": 4.944126464976833, "grad_norm": 0.10871928185224533, "learning_rate": 8.010859724039546e-05, "loss": 1.3562, "mean_token_accuracy": 0.7448802530765534, "num_tokens": 1303775553.0, "step": 18140 }, { "entropy": 0.9173216402530671, "epoch": 4.946852003270646, "grad_norm": 0.10729706287384033, "learning_rate": 8.008460559575448e-05, "loss": 1.3507, "mean_token_accuracy": 0.748846410214901, "num_tokens": 1304501939.0, "step": 18150 }, { "entropy": 0.9160275503993034, "epoch": 4.949577541564459, "grad_norm": 0.10040333122015, "learning_rate": 8.006060308878193e-05, "loss": 1.3359, "mean_token_accuracy": 0.7510499969124794, "num_tokens": 1305233162.0, "step": 18160 }, { "entropy": 0.9199049517512321, "epoch": 4.952303079858272, "grad_norm": 0.10592690855264664, "learning_rate": 8.003658972814414e-05, "loss": 1.3551, "mean_token_accuracy": 0.7488234281539917, "num_tokens": 1305949328.0, "step": 18170 }, { "entropy": 0.9183659970760345, "epoch": 4.955028618152085, "grad_norm": 0.12657269835472107, "learning_rate": 8.001256552251135e-05, "loss": 1.3443, "mean_token_accuracy": 0.7549128860235215, "num_tokens": 1306693379.0, "step": 18180 }, { "entropy": 0.9196929454803466, "epoch": 4.9577541564458985, "grad_norm": 0.10157456994056702, "learning_rate": 7.998853048055772e-05, "loss": 1.3466, "mean_token_accuracy": 0.7506722420454025, "num_tokens": 1307417569.0, "step": 18190 }, { "entropy": 0.9178652420639992, "epoch": 4.960479694739711, "grad_norm": 0.10534054785966873, "learning_rate": 7.996448461096135e-05, "loss": 1.3502, "mean_token_accuracy": 0.7453674659132957, "num_tokens": 1308127786.0, "step": 18200 }, { "entropy": 0.925149618089199, "epoch": 4.963205233033524, "grad_norm": 0.10649655014276505, "learning_rate": 7.994042792240421e-05, "loss": 1.3593, "mean_token_accuracy": 0.7453730344772339, "num_tokens": 1308844093.0, "step": 18210 }, { "entropy": 0.9176445603370667, "epoch": 4.965930771327337, "grad_norm": 0.11317556351423264, "learning_rate": 7.991636042357224e-05, "loss": 1.3465, "mean_token_accuracy": 0.7458223670721054, "num_tokens": 1309565166.0, "step": 18220 }, { "entropy": 0.9187493264675141, "epoch": 4.96865630962115, "grad_norm": 0.13759465515613556, "learning_rate": 7.989228212315516e-05, "loss": 1.352, "mean_token_accuracy": 0.7450497880578041, "num_tokens": 1310275785.0, "step": 18230 }, { "entropy": 0.9150622397661209, "epoch": 4.971381847914963, "grad_norm": 0.110161691904068, "learning_rate": 7.986819302984673e-05, "loss": 1.3584, "mean_token_accuracy": 0.74679996073246, "num_tokens": 1310983551.0, "step": 18240 }, { "entropy": 0.9159223407506942, "epoch": 4.974107386208776, "grad_norm": 0.10151788592338562, "learning_rate": 7.984409315234454e-05, "loss": 1.3443, "mean_token_accuracy": 0.7486445784568787, "num_tokens": 1311706970.0, "step": 18250 }, { "entropy": 0.9219341740012169, "epoch": 4.976832924502589, "grad_norm": 0.09841329604387283, "learning_rate": 7.981998249935004e-05, "loss": 1.3534, "mean_token_accuracy": 0.7474974930286408, "num_tokens": 1312424580.0, "step": 18260 }, { "entropy": 0.9184188976883888, "epoch": 4.979558462796402, "grad_norm": 0.10171353816986084, "learning_rate": 7.979586107956864e-05, "loss": 1.3523, "mean_token_accuracy": 0.7439409390091896, "num_tokens": 1313129730.0, "step": 18270 }, { "entropy": 0.9176041468977928, "epoch": 4.982284001090215, "grad_norm": 0.1016509085893631, "learning_rate": 7.977172890170961e-05, "loss": 1.3523, "mean_token_accuracy": 0.7485899671912193, "num_tokens": 1313844412.0, "step": 18280 }, { "entropy": 0.9199514031410218, "epoch": 4.985009539384029, "grad_norm": 0.10359106212854385, "learning_rate": 7.974758597448608e-05, "loss": 1.3427, "mean_token_accuracy": 0.7483617037534713, "num_tokens": 1314567086.0, "step": 18290 }, { "entropy": 0.9154374852776528, "epoch": 4.987735077677842, "grad_norm": 0.10706379264593124, "learning_rate": 7.97234323066151e-05, "loss": 1.346, "mean_token_accuracy": 0.7493002146482468, "num_tokens": 1315289883.0, "step": 18300 }, { "entropy": 0.9149588719010353, "epoch": 4.990460615971655, "grad_norm": 0.11768409609794617, "learning_rate": 7.969926790681759e-05, "loss": 1.3384, "mean_token_accuracy": 0.750345665216446, "num_tokens": 1316008435.0, "step": 18310 }, { "entropy": 0.9264756590127945, "epoch": 4.993186154265468, "grad_norm": 0.10559073090553284, "learning_rate": 7.96750927838183e-05, "loss": 1.3621, "mean_token_accuracy": 0.7422044023871421, "num_tokens": 1316722462.0, "step": 18320 }, { "entropy": 0.9273223444819451, "epoch": 4.995911692559281, "grad_norm": 0.10167667269706726, "learning_rate": 7.965090694634592e-05, "loss": 1.3559, "mean_token_accuracy": 0.7435720786452293, "num_tokens": 1317433726.0, "step": 18330 }, { "entropy": 0.9213701769709587, "epoch": 4.9986372308530935, "grad_norm": 0.094398133456707, "learning_rate": 7.962671040313297e-05, "loss": 1.3506, "mean_token_accuracy": 0.7460046291351319, "num_tokens": 1318147407.0, "step": 18340 }, { "entropy": 0.9180674225091934, "epoch": 5.0013627691469065, "grad_norm": 0.1045336127281189, "learning_rate": 7.960250316291582e-05, "loss": 1.3457, "mean_token_accuracy": 0.7494631335139275, "num_tokens": 1318866389.0, "step": 18350 }, { "entropy": 0.9117056980729104, "epoch": 5.004088307440719, "grad_norm": 0.10809372365474701, "learning_rate": 7.957828523443473e-05, "loss": 1.3441, "mean_token_accuracy": 0.7481998920440673, "num_tokens": 1319571770.0, "step": 18360 }, { "entropy": 0.9222692921757698, "epoch": 5.006813845734532, "grad_norm": 0.1019110381603241, "learning_rate": 7.955405662643384e-05, "loss": 1.3476, "mean_token_accuracy": 0.7470973148941994, "num_tokens": 1320297544.0, "step": 18370 }, { "entropy": 0.9072718366980552, "epoch": 5.009539384028345, "grad_norm": 0.11654374748468399, "learning_rate": 7.952981734766107e-05, "loss": 1.3293, "mean_token_accuracy": 0.7586778029799461, "num_tokens": 1321046846.0, "step": 18380 }, { "entropy": 0.9028063580393791, "epoch": 5.012264922322158, "grad_norm": 0.10506423562765121, "learning_rate": 7.95055674068683e-05, "loss": 1.3258, "mean_token_accuracy": 0.751988410949707, "num_tokens": 1321773389.0, "step": 18390 }, { "entropy": 0.910191185772419, "epoch": 5.014990460615972, "grad_norm": 0.12120980024337769, "learning_rate": 7.948130681281115e-05, "loss": 1.3397, "mean_token_accuracy": 0.7533672720193862, "num_tokens": 1322502982.0, "step": 18400 }, { "entropy": 0.9012519985437393, "epoch": 5.017715998909785, "grad_norm": 0.11411497741937637, "learning_rate": 7.945703557424916e-05, "loss": 1.3365, "mean_token_accuracy": 0.7553670346736908, "num_tokens": 1323232428.0, "step": 18410 }, { "entropy": 0.9155339032411576, "epoch": 5.020441537203598, "grad_norm": 0.10370244085788727, "learning_rate": 7.94327536999457e-05, "loss": 1.3406, "mean_token_accuracy": 0.7517688021063804, "num_tokens": 1323954276.0, "step": 18420 }, { "entropy": 0.9078729420900344, "epoch": 5.023167075497411, "grad_norm": 0.12481620907783508, "learning_rate": 7.940846119866794e-05, "loss": 1.3351, "mean_token_accuracy": 0.751006792485714, "num_tokens": 1324674401.0, "step": 18430 }, { "entropy": 0.9182976961135865, "epoch": 5.025892613791224, "grad_norm": 0.12291675806045532, "learning_rate": 7.938415807918693e-05, "loss": 1.3463, "mean_token_accuracy": 0.7464212417602539, "num_tokens": 1325386716.0, "step": 18440 }, { "entropy": 0.9183823958039283, "epoch": 5.028618152085037, "grad_norm": 0.1038193628191948, "learning_rate": 7.935984435027756e-05, "loss": 1.3419, "mean_token_accuracy": 0.7476585775613784, "num_tokens": 1326108125.0, "step": 18450 }, { "entropy": 0.909471395611763, "epoch": 5.03134369037885, "grad_norm": 0.10644439607858658, "learning_rate": 7.933552002071851e-05, "loss": 1.3351, "mean_token_accuracy": 0.750180697441101, "num_tokens": 1326826661.0, "step": 18460 }, { "entropy": 0.9158590584993362, "epoch": 5.034069228672663, "grad_norm": 0.11362117528915405, "learning_rate": 7.931118509929231e-05, "loss": 1.3389, "mean_token_accuracy": 0.7460008159279823, "num_tokens": 1327538266.0, "step": 18470 }, { "entropy": 0.8958799347281456, "epoch": 5.036794766966476, "grad_norm": 0.1139308363199234, "learning_rate": 7.928683959478535e-05, "loss": 1.3218, "mean_token_accuracy": 0.7529631853103638, "num_tokens": 1328256807.0, "step": 18480 }, { "entropy": 0.9072618633508682, "epoch": 5.039520305260289, "grad_norm": 0.11525868624448776, "learning_rate": 7.926248351598776e-05, "loss": 1.3404, "mean_token_accuracy": 0.7525811344385147, "num_tokens": 1328975615.0, "step": 18490 }, { "entropy": 0.9116022393107415, "epoch": 5.0422458435541015, "grad_norm": 0.10684821754693985, "learning_rate": 7.923811687169355e-05, "loss": 1.3379, "mean_token_accuracy": 0.7463834941387176, "num_tokens": 1329682884.0, "step": 18500 }, { "entropy": 0.9065963506698609, "epoch": 5.044971381847915, "grad_norm": 0.1166912093758583, "learning_rate": 7.921373967070052e-05, "loss": 1.33, "mean_token_accuracy": 0.7524808749556542, "num_tokens": 1330409855.0, "step": 18510 }, { "entropy": 0.9096634238958359, "epoch": 5.047696920141728, "grad_norm": 0.11363758146762848, "learning_rate": 7.91893519218103e-05, "loss": 1.3413, "mean_token_accuracy": 0.7469534277915955, "num_tokens": 1331119708.0, "step": 18520 }, { "entropy": 0.9015256181359291, "epoch": 5.050422458435541, "grad_norm": 0.11088868230581284, "learning_rate": 7.91649536338283e-05, "loss": 1.3305, "mean_token_accuracy": 0.7513253837823868, "num_tokens": 1331842581.0, "step": 18530 }, { "entropy": 0.9056093961000442, "epoch": 5.053147996729354, "grad_norm": 0.10830790549516678, "learning_rate": 7.914054481556379e-05, "loss": 1.3384, "mean_token_accuracy": 0.751427860558033, "num_tokens": 1332555238.0, "step": 18540 }, { "entropy": 0.8952996760606766, "epoch": 5.055873535023167, "grad_norm": 0.11326909065246582, "learning_rate": 7.911612547582977e-05, "loss": 1.3195, "mean_token_accuracy": 0.7594034299254417, "num_tokens": 1333296230.0, "step": 18550 }, { "entropy": 0.9200844272971154, "epoch": 5.05859907331698, "grad_norm": 0.11373654752969742, "learning_rate": 7.909169562344308e-05, "loss": 1.3413, "mean_token_accuracy": 0.7461709216237068, "num_tokens": 1334003940.0, "step": 18560 }, { "entropy": 0.9090452209115029, "epoch": 5.061324611610793, "grad_norm": 0.12129314243793488, "learning_rate": 7.906725526722436e-05, "loss": 1.3422, "mean_token_accuracy": 0.750136086344719, "num_tokens": 1334713399.0, "step": 18570 }, { "entropy": 0.9078034043312073, "epoch": 5.064050149904606, "grad_norm": 0.10491450875997543, "learning_rate": 7.904280441599801e-05, "loss": 1.3326, "mean_token_accuracy": 0.7513612136244774, "num_tokens": 1335432967.0, "step": 18580 }, { "entropy": 0.8964256376028061, "epoch": 5.066775688198419, "grad_norm": 0.12562423944473267, "learning_rate": 7.901834307859228e-05, "loss": 1.3241, "mean_token_accuracy": 0.7554881185293197, "num_tokens": 1336158037.0, "step": 18590 }, { "entropy": 0.911538377404213, "epoch": 5.069501226492232, "grad_norm": 0.11411541700363159, "learning_rate": 7.899387126383913e-05, "loss": 1.3378, "mean_token_accuracy": 0.7462952226400376, "num_tokens": 1336867959.0, "step": 18600 }, { "entropy": 0.9089008331298828, "epoch": 5.072226764786045, "grad_norm": 0.12004344910383224, "learning_rate": 7.896938898057435e-05, "loss": 1.3371, "mean_token_accuracy": 0.7475906565785408, "num_tokens": 1337572400.0, "step": 18610 }, { "entropy": 0.9116697743535042, "epoch": 5.074952303079859, "grad_norm": 0.12836812436580658, "learning_rate": 7.894489623763753e-05, "loss": 1.3405, "mean_token_accuracy": 0.7458344906568527, "num_tokens": 1338281950.0, "step": 18620 }, { "entropy": 0.9137950226664543, "epoch": 5.077677841373672, "grad_norm": 0.13870224356651306, "learning_rate": 7.892039304387195e-05, "loss": 1.338, "mean_token_accuracy": 0.749837937951088, "num_tokens": 1339003188.0, "step": 18630 }, { "entropy": 0.9065858721733093, "epoch": 5.080403379667485, "grad_norm": 0.149013489484787, "learning_rate": 7.889587940812477e-05, "loss": 1.3362, "mean_token_accuracy": 0.7499426275491714, "num_tokens": 1339715479.0, "step": 18640 }, { "entropy": 0.9157001972198486, "epoch": 5.0831289179612975, "grad_norm": 0.2263483703136444, "learning_rate": 7.887135533924683e-05, "loss": 1.3412, "mean_token_accuracy": 0.7490920692682266, "num_tokens": 1340428244.0, "step": 18650 }, { "entropy": 0.9115339174866677, "epoch": 5.0858544562551105, "grad_norm": 0.1228538453578949, "learning_rate": 7.884682084609282e-05, "loss": 1.3426, "mean_token_accuracy": 0.744776040315628, "num_tokens": 1341133482.0, "step": 18660 }, { "entropy": 0.9042779088020325, "epoch": 5.088579994548923, "grad_norm": 0.11652397364377975, "learning_rate": 7.882227593752112e-05, "loss": 1.3357, "mean_token_accuracy": 0.7493279471993446, "num_tokens": 1341846045.0, "step": 18670 }, { "entropy": 0.9101129621267319, "epoch": 5.091305532842736, "grad_norm": 0.11319631338119507, "learning_rate": 7.879772062239392e-05, "loss": 1.3366, "mean_token_accuracy": 0.7525549560785294, "num_tokens": 1342571187.0, "step": 18680 }, { "entropy": 0.90872992426157, "epoch": 5.094031071136549, "grad_norm": 0.11274012178182602, "learning_rate": 7.877315490957714e-05, "loss": 1.3427, "mean_token_accuracy": 0.7483867600560188, "num_tokens": 1343278501.0, "step": 18690 }, { "entropy": 0.9083260744810104, "epoch": 5.096756609430362, "grad_norm": 0.1183522492647171, "learning_rate": 7.874857880794046e-05, "loss": 1.3385, "mean_token_accuracy": 0.7478100255131721, "num_tokens": 1343993725.0, "step": 18700 }, { "entropy": 0.9029194608330726, "epoch": 5.099482147724175, "grad_norm": 0.11869072169065475, "learning_rate": 7.872399232635731e-05, "loss": 1.3314, "mean_token_accuracy": 0.7562534168362618, "num_tokens": 1344730125.0, "step": 18710 }, { "entropy": 0.9123732477426529, "epoch": 5.102207686017988, "grad_norm": 0.11277887225151062, "learning_rate": 7.869939547370489e-05, "loss": 1.3319, "mean_token_accuracy": 0.7512045651674271, "num_tokens": 1345458796.0, "step": 18720 }, { "entropy": 0.9051063165068627, "epoch": 5.104933224311802, "grad_norm": 0.11701159179210663, "learning_rate": 7.86747882588641e-05, "loss": 1.3336, "mean_token_accuracy": 0.750642716884613, "num_tokens": 1346171647.0, "step": 18730 }, { "entropy": 0.9102186009287834, "epoch": 5.107658762605615, "grad_norm": 0.10872722417116165, "learning_rate": 7.865017069071964e-05, "loss": 1.3351, "mean_token_accuracy": 0.7451282486319541, "num_tokens": 1346885311.0, "step": 18740 }, { "entropy": 0.9089977607131005, "epoch": 5.110384300899428, "grad_norm": 0.22637620568275452, "learning_rate": 7.86255427781599e-05, "loss": 1.341, "mean_token_accuracy": 0.7501268580555915, "num_tokens": 1347610287.0, "step": 18750 }, { "entropy": 0.9072558596730232, "epoch": 5.113109839193241, "grad_norm": 0.12592224776744843, "learning_rate": 7.8600904530077e-05, "loss": 1.3343, "mean_token_accuracy": 0.7507593974471092, "num_tokens": 1348329760.0, "step": 18760 }, { "entropy": 0.9108141466975213, "epoch": 5.115835377487054, "grad_norm": 0.1176564022898674, "learning_rate": 7.857625595536685e-05, "loss": 1.3366, "mean_token_accuracy": 0.7493161335587502, "num_tokens": 1349043593.0, "step": 18770 }, { "entropy": 0.907894492149353, "epoch": 5.118560915780867, "grad_norm": 0.11292760074138641, "learning_rate": 7.855159706292903e-05, "loss": 1.3312, "mean_token_accuracy": 0.7481828153133392, "num_tokens": 1349756028.0, "step": 18780 }, { "entropy": 0.9055081680417061, "epoch": 5.12128645407468, "grad_norm": 0.10565032064914703, "learning_rate": 7.852692786166688e-05, "loss": 1.3384, "mean_token_accuracy": 0.753260900080204, "num_tokens": 1350472891.0, "step": 18790 }, { "entropy": 0.899952945113182, "epoch": 5.124011992368493, "grad_norm": 0.1228262260556221, "learning_rate": 7.850224836048742e-05, "loss": 1.3287, "mean_token_accuracy": 0.7540143489837646, "num_tokens": 1351189567.0, "step": 18800 }, { "entropy": 0.9097656950354576, "epoch": 5.1267375306623055, "grad_norm": 0.11419453471899033, "learning_rate": 7.847755856830146e-05, "loss": 1.3434, "mean_token_accuracy": 0.7453598141670227, "num_tokens": 1351886225.0, "step": 18810 }, { "entropy": 0.9096739515662193, "epoch": 5.1294630689561185, "grad_norm": 0.11032206565141678, "learning_rate": 7.845285849402344e-05, "loss": 1.3323, "mean_token_accuracy": 0.7500687360763549, "num_tokens": 1352610800.0, "step": 18820 }, { "entropy": 0.9082689002156258, "epoch": 5.132188607249931, "grad_norm": 0.12134139239788055, "learning_rate": 7.842814814657158e-05, "loss": 1.3315, "mean_token_accuracy": 0.7526320442557335, "num_tokens": 1353335250.0, "step": 18830 }, { "entropy": 0.9058627471327781, "epoch": 5.134914145543745, "grad_norm": 0.12179207056760788, "learning_rate": 7.840342753486778e-05, "loss": 1.3355, "mean_token_accuracy": 0.7513252019882202, "num_tokens": 1354051481.0, "step": 18840 }, { "entropy": 0.9101318687200546, "epoch": 5.137639683837558, "grad_norm": 0.10935749858617783, "learning_rate": 7.837869666783766e-05, "loss": 1.3398, "mean_token_accuracy": 0.7486051961779594, "num_tokens": 1354754677.0, "step": 18850 }, { "entropy": 0.9036993905901909, "epoch": 5.140365222131371, "grad_norm": 0.11682439595460892, "learning_rate": 7.835395555441051e-05, "loss": 1.3364, "mean_token_accuracy": 0.7515853494405746, "num_tokens": 1355465373.0, "step": 18860 }, { "entropy": 0.8975047558546067, "epoch": 5.143090760425184, "grad_norm": 0.11143290996551514, "learning_rate": 7.832920420351937e-05, "loss": 1.3299, "mean_token_accuracy": 0.7522084057331085, "num_tokens": 1356175972.0, "step": 18870 }, { "entropy": 0.9004489123821259, "epoch": 5.145816298718997, "grad_norm": 0.10541433840990067, "learning_rate": 7.830444262410093e-05, "loss": 1.3291, "mean_token_accuracy": 0.7541014179587364, "num_tokens": 1356898950.0, "step": 18880 }, { "entropy": 0.9021969020366669, "epoch": 5.14854183701281, "grad_norm": 0.10437975078821182, "learning_rate": 7.82796708250956e-05, "loss": 1.3341, "mean_token_accuracy": 0.7506950855255127, "num_tokens": 1357601726.0, "step": 18890 }, { "entropy": 0.912436631321907, "epoch": 5.151267375306623, "grad_norm": 0.1150716245174408, "learning_rate": 7.825488881544748e-05, "loss": 1.3452, "mean_token_accuracy": 0.7441218435764313, "num_tokens": 1358305410.0, "step": 18900 }, { "entropy": 0.9159964561462403, "epoch": 5.153992913600436, "grad_norm": 0.12094953656196594, "learning_rate": 7.823009660410434e-05, "loss": 1.347, "mean_token_accuracy": 0.7476379483938217, "num_tokens": 1359013224.0, "step": 18910 }, { "entropy": 0.9071477174758911, "epoch": 5.156718451894249, "grad_norm": 0.11563536524772644, "learning_rate": 7.820529420001763e-05, "loss": 1.3357, "mean_token_accuracy": 0.7493469908833503, "num_tokens": 1359721073.0, "step": 18920 }, { "entropy": 0.9029750868678093, "epoch": 5.159443990188062, "grad_norm": 0.11280180513858795, "learning_rate": 7.818048161214253e-05, "loss": 1.3255, "mean_token_accuracy": 0.7580265924334526, "num_tokens": 1360460944.0, "step": 18930 }, { "entropy": 0.9054033905267715, "epoch": 5.162169528481876, "grad_norm": 0.11178267002105713, "learning_rate": 7.815565884943782e-05, "loss": 1.3372, "mean_token_accuracy": 0.750056803226471, "num_tokens": 1361166446.0, "step": 18940 }, { "entropy": 0.9099515557289124, "epoch": 5.1648950667756885, "grad_norm": 0.10570986568927765, "learning_rate": 7.8130825920866e-05, "loss": 1.3349, "mean_token_accuracy": 0.7498923137784004, "num_tokens": 1361890170.0, "step": 18950 }, { "entropy": 0.9100850179791451, "epoch": 5.1676206050695015, "grad_norm": 0.12696321308612823, "learning_rate": 7.810598283539328e-05, "loss": 1.3329, "mean_token_accuracy": 0.7483788222074509, "num_tokens": 1362603199.0, "step": 18960 }, { "entropy": 0.9101712808012963, "epoch": 5.170346143363314, "grad_norm": 0.11161109805107117, "learning_rate": 7.808112960198942e-05, "loss": 1.3422, "mean_token_accuracy": 0.7523481532931328, "num_tokens": 1363323415.0, "step": 18970 }, { "entropy": 0.9075639858841896, "epoch": 5.173071681657127, "grad_norm": 0.12539154291152954, "learning_rate": 7.805626622962796e-05, "loss": 1.3276, "mean_token_accuracy": 0.750854168832302, "num_tokens": 1364041718.0, "step": 18980 }, { "entropy": 0.9018291965126991, "epoch": 5.17579721995094, "grad_norm": 0.12013975530862808, "learning_rate": 7.803139272728606e-05, "loss": 1.3307, "mean_token_accuracy": 0.7495744436979294, "num_tokens": 1364746616.0, "step": 18990 }, { "entropy": 0.9024452075362206, "epoch": 5.178522758244753, "grad_norm": 0.10841753333806992, "learning_rate": 7.800650910394449e-05, "loss": 1.3216, "mean_token_accuracy": 0.7567202374339104, "num_tokens": 1365485662.0, "step": 19000 }, { "entropy": 0.9038829073309899, "epoch": 5.181248296538566, "grad_norm": 0.1268831491470337, "learning_rate": 7.798161536858776e-05, "loss": 1.3349, "mean_token_accuracy": 0.7507214352488518, "num_tokens": 1366196113.0, "step": 19010 }, { "entropy": 0.9127470672130584, "epoch": 5.183973834832379, "grad_norm": 0.13608817756175995, "learning_rate": 7.795671153020399e-05, "loss": 1.3392, "mean_token_accuracy": 0.747468601167202, "num_tokens": 1366909657.0, "step": 19020 }, { "entropy": 0.9076567769050599, "epoch": 5.186699373126192, "grad_norm": 0.12499534338712692, "learning_rate": 7.793179759778493e-05, "loss": 1.3357, "mean_token_accuracy": 0.7521659284830093, "num_tokens": 1367635085.0, "step": 19030 }, { "entropy": 0.9101962640881538, "epoch": 5.189424911420005, "grad_norm": 0.11534728854894638, "learning_rate": 7.790687358032598e-05, "loss": 1.3409, "mean_token_accuracy": 0.7470502510666848, "num_tokens": 1368341214.0, "step": 19040 }, { "entropy": 0.9091815829277039, "epoch": 5.192150449713819, "grad_norm": 0.1163393184542656, "learning_rate": 7.788193948682621e-05, "loss": 1.3431, "mean_token_accuracy": 0.7499541327357292, "num_tokens": 1369055070.0, "step": 19050 }, { "entropy": 0.9086731627583504, "epoch": 5.194875988007632, "grad_norm": 0.11986309289932251, "learning_rate": 7.78569953262883e-05, "loss": 1.3369, "mean_token_accuracy": 0.748068630695343, "num_tokens": 1369771537.0, "step": 19060 }, { "entropy": 0.9071047112345696, "epoch": 5.197601526301445, "grad_norm": 0.11011476814746857, "learning_rate": 7.78320411077186e-05, "loss": 1.3312, "mean_token_accuracy": 0.751863069832325, "num_tokens": 1370488216.0, "step": 19070 }, { "entropy": 0.9116240307688713, "epoch": 5.200327064595258, "grad_norm": 0.11632122099399567, "learning_rate": 7.780707684012703e-05, "loss": 1.3452, "mean_token_accuracy": 0.7497341588139534, "num_tokens": 1371201818.0, "step": 19080 }, { "entropy": 0.9063777029514313, "epoch": 5.203052602889071, "grad_norm": 0.12040931731462479, "learning_rate": 7.77821025325272e-05, "loss": 1.3354, "mean_token_accuracy": 0.7512107893824578, "num_tokens": 1371923557.0, "step": 19090 }, { "entropy": 0.9083833083510399, "epoch": 5.205778141182884, "grad_norm": 0.12313888221979141, "learning_rate": 7.775711819393632e-05, "loss": 1.332, "mean_token_accuracy": 0.7498325526714325, "num_tokens": 1372652851.0, "step": 19100 }, { "entropy": 0.909971933066845, "epoch": 5.208503679476697, "grad_norm": 0.11367330700159073, "learning_rate": 7.77321238333752e-05, "loss": 1.3374, "mean_token_accuracy": 0.7517801567912101, "num_tokens": 1373386848.0, "step": 19110 }, { "entropy": 0.906111478805542, "epoch": 5.2112292177705095, "grad_norm": 0.12350302189588547, "learning_rate": 7.770711945986833e-05, "loss": 1.3326, "mean_token_accuracy": 0.7504727497696877, "num_tokens": 1374109890.0, "step": 19120 }, { "entropy": 0.8956575006246567, "epoch": 5.2139547560643225, "grad_norm": 0.11455515772104263, "learning_rate": 7.768210508244373e-05, "loss": 1.3251, "mean_token_accuracy": 0.7561988785862923, "num_tokens": 1374830846.0, "step": 19130 }, { "entropy": 0.9134457930922508, "epoch": 5.216680294358135, "grad_norm": 0.11794273555278778, "learning_rate": 7.765708071013311e-05, "loss": 1.3429, "mean_token_accuracy": 0.7462093397974968, "num_tokens": 1375540653.0, "step": 19140 }, { "entropy": 0.9088801175355912, "epoch": 5.219405832651948, "grad_norm": 0.127328559756279, "learning_rate": 7.763204635197174e-05, "loss": 1.3346, "mean_token_accuracy": 0.7491170018911362, "num_tokens": 1376262815.0, "step": 19150 }, { "entropy": 0.9111427307128906, "epoch": 5.222131370945762, "grad_norm": 0.11400771141052246, "learning_rate": 7.760700201699854e-05, "loss": 1.3447, "mean_token_accuracy": 0.7470154613256454, "num_tokens": 1376970324.0, "step": 19160 }, { "entropy": 0.911037626862526, "epoch": 5.224856909239575, "grad_norm": 0.1092766523361206, "learning_rate": 7.758194771425594e-05, "loss": 1.3417, "mean_token_accuracy": 0.7472645550966263, "num_tokens": 1377674775.0, "step": 19170 }, { "entropy": 0.9015596866607666, "epoch": 5.227582447533388, "grad_norm": 0.12264671176671982, "learning_rate": 7.755688345279009e-05, "loss": 1.3255, "mean_token_accuracy": 0.7519594937562942, "num_tokens": 1378389712.0, "step": 19180 }, { "entropy": 0.9012925669550895, "epoch": 5.230307985827201, "grad_norm": 0.11462859064340591, "learning_rate": 7.753180924165069e-05, "loss": 1.3331, "mean_token_accuracy": 0.7517343029379845, "num_tokens": 1379112505.0, "step": 19190 }, { "entropy": 0.910705478489399, "epoch": 5.233033524121014, "grad_norm": 0.12070734798908234, "learning_rate": 7.750672508989096e-05, "loss": 1.3299, "mean_token_accuracy": 0.7470805883407593, "num_tokens": 1379823856.0, "step": 19200 }, { "entropy": 0.9054174587130547, "epoch": 5.235759062414827, "grad_norm": 0.10295546054840088, "learning_rate": 7.748163100656782e-05, "loss": 1.3338, "mean_token_accuracy": 0.7534317210316658, "num_tokens": 1380557353.0, "step": 19210 }, { "entropy": 0.9041800126433372, "epoch": 5.23848460070864, "grad_norm": 0.11778882890939713, "learning_rate": 7.745652700074172e-05, "loss": 1.3328, "mean_token_accuracy": 0.7520045042037964, "num_tokens": 1381270670.0, "step": 19220 }, { "entropy": 0.8997292220592499, "epoch": 5.241210139002453, "grad_norm": 0.11303021013736725, "learning_rate": 7.743141308147668e-05, "loss": 1.3269, "mean_token_accuracy": 0.7499917581677437, "num_tokens": 1381972787.0, "step": 19230 }, { "entropy": 0.9059125691652298, "epoch": 5.243935677296266, "grad_norm": 0.11100378632545471, "learning_rate": 7.740628925784032e-05, "loss": 1.3365, "mean_token_accuracy": 0.7547996297478676, "num_tokens": 1382716022.0, "step": 19240 }, { "entropy": 0.9083168834447861, "epoch": 5.246661215590079, "grad_norm": 0.10881959646940231, "learning_rate": 7.738115553890387e-05, "loss": 1.3371, "mean_token_accuracy": 0.7476097568869591, "num_tokens": 1383423565.0, "step": 19250 }, { "entropy": 0.9086048856377602, "epoch": 5.249386753883892, "grad_norm": 0.11474138498306274, "learning_rate": 7.735601193374205e-05, "loss": 1.3357, "mean_token_accuracy": 0.7469335675239563, "num_tokens": 1384123967.0, "step": 19260 }, { "entropy": 0.9057020366191864, "epoch": 5.2521122921777055, "grad_norm": 0.13058039546012878, "learning_rate": 7.733085845143322e-05, "loss": 1.3322, "mean_token_accuracy": 0.751021246612072, "num_tokens": 1384851520.0, "step": 19270 }, { "entropy": 0.9090562105178833, "epoch": 5.254837830471518, "grad_norm": 0.12455740571022034, "learning_rate": 7.730569510105929e-05, "loss": 1.3444, "mean_token_accuracy": 0.7508804053068161, "num_tokens": 1385575365.0, "step": 19280 }, { "entropy": 0.9198357537388802, "epoch": 5.257563368765331, "grad_norm": 0.11248283833265305, "learning_rate": 7.72805218917057e-05, "loss": 1.3463, "mean_token_accuracy": 0.7451340645551682, "num_tokens": 1386289570.0, "step": 19290 }, { "entropy": 0.9151126220822334, "epoch": 5.260288907059144, "grad_norm": 0.11552846431732178, "learning_rate": 7.72553388324615e-05, "loss": 1.3381, "mean_token_accuracy": 0.7482043281197548, "num_tokens": 1387004623.0, "step": 19300 }, { "entropy": 0.9030871108174324, "epoch": 5.263014445352957, "grad_norm": 0.123524971306324, "learning_rate": 7.723014593241926e-05, "loss": 1.3348, "mean_token_accuracy": 0.7522234320640564, "num_tokens": 1387729084.0, "step": 19310 }, { "entropy": 0.899794852733612, "epoch": 5.26573998364677, "grad_norm": 0.11385549604892731, "learning_rate": 7.720494320067513e-05, "loss": 1.3272, "mean_token_accuracy": 0.7524638131260872, "num_tokens": 1388438859.0, "step": 19320 }, { "entropy": 0.9128438696265221, "epoch": 5.268465521940583, "grad_norm": 0.10310929268598557, "learning_rate": 7.717973064632875e-05, "loss": 1.3402, "mean_token_accuracy": 0.7502741917967797, "num_tokens": 1389167010.0, "step": 19330 }, { "entropy": 0.9036715939640999, "epoch": 5.271191060234396, "grad_norm": 0.11425105482339859, "learning_rate": 7.715450827848342e-05, "loss": 1.3275, "mean_token_accuracy": 0.7534997895359993, "num_tokens": 1389901009.0, "step": 19340 }, { "entropy": 0.9070032447576523, "epoch": 5.273916598528209, "grad_norm": 0.11248745769262314, "learning_rate": 7.712927610624586e-05, "loss": 1.3385, "mean_token_accuracy": 0.7467876300215721, "num_tokens": 1390611861.0, "step": 19350 }, { "entropy": 0.9052289351820946, "epoch": 5.276642136822022, "grad_norm": 0.11316084861755371, "learning_rate": 7.71040341387264e-05, "loss": 1.3306, "mean_token_accuracy": 0.7510544061660767, "num_tokens": 1391337025.0, "step": 19360 }, { "entropy": 0.9025282666087151, "epoch": 5.279367675115836, "grad_norm": 0.11133657395839691, "learning_rate": 7.707878238503891e-05, "loss": 1.3274, "mean_token_accuracy": 0.7547363251447677, "num_tokens": 1392063071.0, "step": 19370 }, { "entropy": 0.9065290451049804, "epoch": 5.282093213409649, "grad_norm": 0.11806612461805344, "learning_rate": 7.705352085430075e-05, "loss": 1.3335, "mean_token_accuracy": 0.7478181257843971, "num_tokens": 1392775824.0, "step": 19380 }, { "entropy": 0.9054453298449516, "epoch": 5.284818751703462, "grad_norm": 0.11038026958703995, "learning_rate": 7.702824955563284e-05, "loss": 1.334, "mean_token_accuracy": 0.7522917613387108, "num_tokens": 1393496991.0, "step": 19390 }, { "entropy": 0.9151970610022545, "epoch": 5.287544289997275, "grad_norm": 0.14004695415496826, "learning_rate": 7.700296849815963e-05, "loss": 1.3487, "mean_token_accuracy": 0.7442385584115982, "num_tokens": 1394207687.0, "step": 19400 }, { "entropy": 0.9074890226125717, "epoch": 5.290269828291088, "grad_norm": 0.11384852975606918, "learning_rate": 7.697767769100908e-05, "loss": 1.3296, "mean_token_accuracy": 0.7558194622397423, "num_tokens": 1394955201.0, "step": 19410 }, { "entropy": 0.9050102978944778, "epoch": 5.2929953665849006, "grad_norm": 0.12064824998378754, "learning_rate": 7.695237714331266e-05, "loss": 1.3359, "mean_token_accuracy": 0.7510082855820656, "num_tokens": 1395673016.0, "step": 19420 }, { "entropy": 0.9079841196537017, "epoch": 5.2957209048787135, "grad_norm": 0.1407109946012497, "learning_rate": 7.692706686420543e-05, "loss": 1.3343, "mean_token_accuracy": 0.7475971832871438, "num_tokens": 1396382824.0, "step": 19430 }, { "entropy": 0.9041830107569695, "epoch": 5.298446443172526, "grad_norm": 0.11657635122537613, "learning_rate": 7.690174686282583e-05, "loss": 1.336, "mean_token_accuracy": 0.7495165050029755, "num_tokens": 1397096108.0, "step": 19440 }, { "entropy": 0.9078656613826752, "epoch": 5.301171981466339, "grad_norm": 0.11287423968315125, "learning_rate": 7.687641714831593e-05, "loss": 1.3352, "mean_token_accuracy": 0.7502091526985168, "num_tokens": 1397816095.0, "step": 19450 }, { "entropy": 0.9061649590730667, "epoch": 5.303897519760152, "grad_norm": 0.12110287696123123, "learning_rate": 7.685107772982125e-05, "loss": 1.3337, "mean_token_accuracy": 0.7503016650676727, "num_tokens": 1398529791.0, "step": 19460 }, { "entropy": 0.9036917462944984, "epoch": 5.306623058053965, "grad_norm": 0.11222954094409943, "learning_rate": 7.682572861649083e-05, "loss": 1.334, "mean_token_accuracy": 0.7517042055726051, "num_tokens": 1399256259.0, "step": 19470 }, { "entropy": 0.9025445148348809, "epoch": 5.309348596347778, "grad_norm": 0.11223101615905762, "learning_rate": 7.68003698174772e-05, "loss": 1.3321, "mean_token_accuracy": 0.7515106126666069, "num_tokens": 1399978047.0, "step": 19480 }, { "entropy": 0.9033101335167885, "epoch": 5.312074134641592, "grad_norm": 0.1127723678946495, "learning_rate": 7.677500134193643e-05, "loss": 1.3277, "mean_token_accuracy": 0.7530519783496856, "num_tokens": 1400699195.0, "step": 19490 }, { "entropy": 0.904048889875412, "epoch": 5.314799672935405, "grad_norm": 0.10669442266225815, "learning_rate": 7.674962319902799e-05, "loss": 1.3292, "mean_token_accuracy": 0.7526533991098404, "num_tokens": 1401423595.0, "step": 19500 }, { "entropy": 0.905977538228035, "epoch": 5.317525211229218, "grad_norm": 0.11804743111133575, "learning_rate": 7.672423539791494e-05, "loss": 1.3295, "mean_token_accuracy": 0.7526730731129646, "num_tokens": 1402157190.0, "step": 19510 }, { "entropy": 0.895224104821682, "epoch": 5.320250749523031, "grad_norm": 0.12127908319234848, "learning_rate": 7.669883794776376e-05, "loss": 1.3305, "mean_token_accuracy": 0.7575635626912117, "num_tokens": 1402892572.0, "step": 19520 }, { "entropy": 0.9105286493897438, "epoch": 5.322976287816844, "grad_norm": 0.1054353341460228, "learning_rate": 7.667343085774448e-05, "loss": 1.3381, "mean_token_accuracy": 0.7508665218949317, "num_tokens": 1403611219.0, "step": 19530 }, { "entropy": 0.9054419875144959, "epoch": 5.325701826110657, "grad_norm": 0.11713731288909912, "learning_rate": 7.664801413703052e-05, "loss": 1.339, "mean_token_accuracy": 0.7495303899049759, "num_tokens": 1404317519.0, "step": 19540 }, { "entropy": 0.9082285046577454, "epoch": 5.32842736440447, "grad_norm": 0.12444167584180832, "learning_rate": 7.662258779479888e-05, "loss": 1.3311, "mean_token_accuracy": 0.7541111633181572, "num_tokens": 1405040140.0, "step": 19550 }, { "entropy": 0.8985153838992119, "epoch": 5.331152902698283, "grad_norm": 0.12595868110656738, "learning_rate": 7.659715184022994e-05, "loss": 1.3269, "mean_token_accuracy": 0.7527410835027695, "num_tokens": 1405749398.0, "step": 19560 }, { "entropy": 0.9099251523613929, "epoch": 5.333878440992096, "grad_norm": 0.1393590271472931, "learning_rate": 7.657170628250759e-05, "loss": 1.3372, "mean_token_accuracy": 0.7476893916726113, "num_tokens": 1406467895.0, "step": 19570 }, { "entropy": 0.9051065519452095, "epoch": 5.336603979285909, "grad_norm": 0.1308859884738922, "learning_rate": 7.654625113081922e-05, "loss": 1.3348, "mean_token_accuracy": 0.7513506069779397, "num_tokens": 1407192334.0, "step": 19580 }, { "entropy": 0.9081906601786613, "epoch": 5.339329517579722, "grad_norm": 0.11979203671216965, "learning_rate": 7.652078639435563e-05, "loss": 1.3389, "mean_token_accuracy": 0.751957580447197, "num_tokens": 1407909539.0, "step": 19590 }, { "entropy": 0.9147018074989319, "epoch": 5.342055055873535, "grad_norm": 0.11424284428358078, "learning_rate": 7.649531208231112e-05, "loss": 1.3482, "mean_token_accuracy": 0.7451479762792588, "num_tokens": 1408621393.0, "step": 19600 }, { "entropy": 0.9017274841666222, "epoch": 5.344780594167348, "grad_norm": 0.11710764467716217, "learning_rate": 7.646982820388342e-05, "loss": 1.3283, "mean_token_accuracy": 0.7538257449865341, "num_tokens": 1409343631.0, "step": 19610 }, { "entropy": 0.897904546558857, "epoch": 5.347506132461161, "grad_norm": 0.1083025112748146, "learning_rate": 7.644433476827373e-05, "loss": 1.325, "mean_token_accuracy": 0.7533201783895492, "num_tokens": 1410065428.0, "step": 19620 }, { "entropy": 0.8997597068548202, "epoch": 5.350231670754974, "grad_norm": 0.11617015302181244, "learning_rate": 7.64188317846867e-05, "loss": 1.3257, "mean_token_accuracy": 0.7566874668002128, "num_tokens": 1410795942.0, "step": 19630 }, { "entropy": 0.905792772769928, "epoch": 5.352957209048787, "grad_norm": 0.11008379608392715, "learning_rate": 7.639331926233042e-05, "loss": 1.3321, "mean_token_accuracy": 0.753586845099926, "num_tokens": 1411517166.0, "step": 19640 }, { "entropy": 0.9120403468608856, "epoch": 5.3556827473426, "grad_norm": 0.11209972947835922, "learning_rate": 7.636779721041642e-05, "loss": 1.3424, "mean_token_accuracy": 0.7472355544567109, "num_tokens": 1412235008.0, "step": 19650 }, { "entropy": 0.9027108520269393, "epoch": 5.358408285636413, "grad_norm": 0.1391863375902176, "learning_rate": 7.63422656381597e-05, "loss": 1.3313, "mean_token_accuracy": 0.75594282746315, "num_tokens": 1412962667.0, "step": 19660 }, { "entropy": 0.9091307118535041, "epoch": 5.361133823930226, "grad_norm": 0.12177189439535141, "learning_rate": 7.631672455477865e-05, "loss": 1.3396, "mean_token_accuracy": 0.7468419194221496, "num_tokens": 1413675189.0, "step": 19670 }, { "entropy": 0.9070631563663483, "epoch": 5.363859362224039, "grad_norm": 0.11187789589166641, "learning_rate": 7.629117396949512e-05, "loss": 1.3434, "mean_token_accuracy": 0.7456631541252137, "num_tokens": 1414378068.0, "step": 19680 }, { "entropy": 0.900896580517292, "epoch": 5.366584900517852, "grad_norm": 0.1092860996723175, "learning_rate": 7.626561389153441e-05, "loss": 1.3325, "mean_token_accuracy": 0.7518083170056343, "num_tokens": 1415095124.0, "step": 19690 }, { "entropy": 0.9109518691897392, "epoch": 5.369310438811666, "grad_norm": 0.11021330207586288, "learning_rate": 7.624004433012524e-05, "loss": 1.3458, "mean_token_accuracy": 0.7492843508720398, "num_tokens": 1415809720.0, "step": 19700 }, { "entropy": 0.9164837971329689, "epoch": 5.372035977105479, "grad_norm": 0.11230812966823578, "learning_rate": 7.621446529449969e-05, "loss": 1.3441, "mean_token_accuracy": 0.7437252566218376, "num_tokens": 1416514761.0, "step": 19710 }, { "entropy": 0.9080846697092056, "epoch": 5.374761515399292, "grad_norm": 0.12813308835029602, "learning_rate": 7.618887679389337e-05, "loss": 1.3318, "mean_token_accuracy": 0.7514203503727913, "num_tokens": 1417231382.0, "step": 19720 }, { "entropy": 0.9045114368200302, "epoch": 5.3774870536931045, "grad_norm": 0.11684253811836243, "learning_rate": 7.616327883754521e-05, "loss": 1.3303, "mean_token_accuracy": 0.7518407315015793, "num_tokens": 1417952019.0, "step": 19730 }, { "entropy": 0.9064024522900581, "epoch": 5.3802125919869175, "grad_norm": 0.12381158024072647, "learning_rate": 7.613767143469762e-05, "loss": 1.3301, "mean_token_accuracy": 0.7515939101576805, "num_tokens": 1418679736.0, "step": 19740 }, { "entropy": 0.9053021788597106, "epoch": 5.38293813028073, "grad_norm": 0.11646660417318344, "learning_rate": 7.611205459459639e-05, "loss": 1.3325, "mean_token_accuracy": 0.7485539689660072, "num_tokens": 1419397767.0, "step": 19750 }, { "entropy": 0.9090729087591172, "epoch": 5.385663668574543, "grad_norm": 0.10986338555812836, "learning_rate": 7.608642832649069e-05, "loss": 1.3352, "mean_token_accuracy": 0.7499466896057129, "num_tokens": 1420111514.0, "step": 19760 }, { "entropy": 0.9054888308048248, "epoch": 5.388389206868356, "grad_norm": 0.11227500438690186, "learning_rate": 7.606079263963317e-05, "loss": 1.3394, "mean_token_accuracy": 0.7531944304704666, "num_tokens": 1420830287.0, "step": 19770 }, { "entropy": 0.9086398214101792, "epoch": 5.391114745162169, "grad_norm": 0.11145076900720596, "learning_rate": 7.603514754327983e-05, "loss": 1.3427, "mean_token_accuracy": 0.7472387075424194, "num_tokens": 1421546419.0, "step": 19780 }, { "entropy": 0.9121958896517753, "epoch": 5.393840283455982, "grad_norm": 0.11511708796024323, "learning_rate": 7.600949304669005e-05, "loss": 1.344, "mean_token_accuracy": 0.7537903472781181, "num_tokens": 1422276582.0, "step": 19790 }, { "entropy": 0.9117308780550957, "epoch": 5.396565821749796, "grad_norm": 0.10570119321346283, "learning_rate": 7.598382915912665e-05, "loss": 1.3452, "mean_token_accuracy": 0.7464302599430084, "num_tokens": 1422984287.0, "step": 19800 }, { "entropy": 0.8995277851819992, "epoch": 5.399291360043609, "grad_norm": 0.12177679687738419, "learning_rate": 7.595815588985581e-05, "loss": 1.3243, "mean_token_accuracy": 0.755612076818943, "num_tokens": 1423719401.0, "step": 19810 }, { "entropy": 0.9075158998370171, "epoch": 5.402016898337422, "grad_norm": 0.12687304615974426, "learning_rate": 7.593247324814712e-05, "loss": 1.3419, "mean_token_accuracy": 0.7462605714797974, "num_tokens": 1424415621.0, "step": 19820 }, { "entropy": 0.9051286518573761, "epoch": 5.404742436631235, "grad_norm": 0.11561757326126099, "learning_rate": 7.590678124327354e-05, "loss": 1.3298, "mean_token_accuracy": 0.7537098959088325, "num_tokens": 1425143985.0, "step": 19830 }, { "entropy": 0.9019662946462631, "epoch": 5.407467974925048, "grad_norm": 0.11109740287065506, "learning_rate": 7.58810798845114e-05, "loss": 1.3359, "mean_token_accuracy": 0.755416439473629, "num_tokens": 1425871385.0, "step": 19840 }, { "entropy": 0.9108938261866569, "epoch": 5.410193513218861, "grad_norm": 0.11039499938488007, "learning_rate": 7.585536918114041e-05, "loss": 1.3386, "mean_token_accuracy": 0.749568022787571, "num_tokens": 1426588716.0, "step": 19850 }, { "entropy": 0.8967614889144897, "epoch": 5.412919051512674, "grad_norm": 0.1311003565788269, "learning_rate": 7.582964914244368e-05, "loss": 1.3299, "mean_token_accuracy": 0.751678578555584, "num_tokens": 1427307684.0, "step": 19860 }, { "entropy": 0.9076550498604774, "epoch": 5.415644589806487, "grad_norm": 0.12214123457670212, "learning_rate": 7.580391977770767e-05, "loss": 1.337, "mean_token_accuracy": 0.7504000514745712, "num_tokens": 1428018267.0, "step": 19870 }, { "entropy": 0.9148858696222305, "epoch": 5.4183701281003, "grad_norm": 0.10823305696249008, "learning_rate": 7.577818109622221e-05, "loss": 1.3431, "mean_token_accuracy": 0.7481129378080368, "num_tokens": 1428738502.0, "step": 19880 }, { "entropy": 0.9061247304081916, "epoch": 5.4210956663941126, "grad_norm": 0.11874030530452728, "learning_rate": 7.575243310728048e-05, "loss": 1.33, "mean_token_accuracy": 0.7531487971544266, "num_tokens": 1429466540.0, "step": 19890 }, { "entropy": 0.9076259955763817, "epoch": 5.4238212046879255, "grad_norm": 0.12292955815792084, "learning_rate": 7.572667582017907e-05, "loss": 1.3379, "mean_token_accuracy": 0.7469023033976555, "num_tokens": 1430166146.0, "step": 19900 }, { "entropy": 0.909446969628334, "epoch": 5.4265467429817384, "grad_norm": 0.1153629794716835, "learning_rate": 7.570090924421786e-05, "loss": 1.3424, "mean_token_accuracy": 0.7452532842755317, "num_tokens": 1430864648.0, "step": 19910 }, { "entropy": 0.8984705403447151, "epoch": 5.429272281275552, "grad_norm": 0.10957809537649155, "learning_rate": 7.567513338870013e-05, "loss": 1.3293, "mean_token_accuracy": 0.7593380361795425, "num_tokens": 1431601094.0, "step": 19920 }, { "entropy": 0.9151330262422561, "epoch": 5.431997819569365, "grad_norm": 0.11466176062822342, "learning_rate": 7.564934826293251e-05, "loss": 1.3398, "mean_token_accuracy": 0.7458806976675987, "num_tokens": 1432311408.0, "step": 19930 }, { "entropy": 0.898513650894165, "epoch": 5.434723357863178, "grad_norm": 0.1184920072555542, "learning_rate": 7.562355387622493e-05, "loss": 1.3179, "mean_token_accuracy": 0.7580939635634423, "num_tokens": 1433044062.0, "step": 19940 }, { "entropy": 0.9102798148989677, "epoch": 5.437448896156991, "grad_norm": 0.11374345421791077, "learning_rate": 7.559775023789071e-05, "loss": 1.3422, "mean_token_accuracy": 0.7491901963949203, "num_tokens": 1433768093.0, "step": 19950 }, { "entropy": 0.9103214174509049, "epoch": 5.440174434450804, "grad_norm": 0.11783763766288757, "learning_rate": 7.557193735724651e-05, "loss": 1.3353, "mean_token_accuracy": 0.7503290638327599, "num_tokens": 1434487735.0, "step": 19960 }, { "entropy": 0.908466774225235, "epoch": 5.442899972744617, "grad_norm": 0.11903638392686844, "learning_rate": 7.55461152436123e-05, "loss": 1.3349, "mean_token_accuracy": 0.7494949519634246, "num_tokens": 1435203822.0, "step": 19970 }, { "entropy": 0.9091369539499283, "epoch": 5.44562551103843, "grad_norm": 0.11400353163480759, "learning_rate": 7.55202839063114e-05, "loss": 1.339, "mean_token_accuracy": 0.7500902906060218, "num_tokens": 1435922304.0, "step": 19980 }, { "entropy": 0.9097193807363511, "epoch": 5.448351049332243, "grad_norm": 0.11606765538454056, "learning_rate": 7.549444335467049e-05, "loss": 1.3421, "mean_token_accuracy": 0.7503934010863305, "num_tokens": 1436640597.0, "step": 19990 }, { "entropy": 0.9020377561450005, "epoch": 5.451076587626056, "grad_norm": 0.11023647338151932, "learning_rate": 7.54685935980195e-05, "loss": 1.3323, "mean_token_accuracy": 0.7534341529011727, "num_tokens": 1437353112.0, "step": 20000 }, { "entropy": 0.9162172496318817, "epoch": 5.453802125919869, "grad_norm": 0.11996352672576904, "learning_rate": 7.544273464569176e-05, "loss": 1.3452, "mean_token_accuracy": 0.7470343619585037, "num_tokens": 1438069947.0, "step": 20010 }, { "entropy": 0.9053322419524192, "epoch": 5.456527664213683, "grad_norm": 0.1083291694521904, "learning_rate": 7.541686650702387e-05, "loss": 1.3345, "mean_token_accuracy": 0.7503931105136872, "num_tokens": 1438792526.0, "step": 20020 }, { "entropy": 0.9153704836964607, "epoch": 5.459253202507496, "grad_norm": 0.11806406825780869, "learning_rate": 7.539098919135579e-05, "loss": 1.3447, "mean_token_accuracy": 0.7499242499470711, "num_tokens": 1439516853.0, "step": 20030 }, { "entropy": 0.8986057966947556, "epoch": 5.4619787408013085, "grad_norm": 0.12491049617528915, "learning_rate": 7.536510270803074e-05, "loss": 1.3206, "mean_token_accuracy": 0.7556749016046524, "num_tokens": 1440248947.0, "step": 20040 }, { "entropy": 0.9066046863794327, "epoch": 5.4647042790951215, "grad_norm": 0.11053416877985, "learning_rate": 7.533920706639531e-05, "loss": 1.3348, "mean_token_accuracy": 0.7530885234475135, "num_tokens": 1440979604.0, "step": 20050 }, { "entropy": 0.9050970584154129, "epoch": 5.467429817388934, "grad_norm": 0.12423629313707352, "learning_rate": 7.531330227579935e-05, "loss": 1.3317, "mean_token_accuracy": 0.7531575649976731, "num_tokens": 1441707103.0, "step": 20060 }, { "entropy": 0.907585859298706, "epoch": 5.470155355682747, "grad_norm": 0.12942558526992798, "learning_rate": 7.528738834559601e-05, "loss": 1.3357, "mean_token_accuracy": 0.7485477849841118, "num_tokens": 1442418576.0, "step": 20070 }, { "entropy": 0.907803401350975, "epoch": 5.47288089397656, "grad_norm": 0.11285819858312607, "learning_rate": 7.526146528514182e-05, "loss": 1.3434, "mean_token_accuracy": 0.7495760977268219, "num_tokens": 1443131298.0, "step": 20080 }, { "entropy": 0.9082187086343765, "epoch": 5.475606432270373, "grad_norm": 0.11220671236515045, "learning_rate": 7.523553310379648e-05, "loss": 1.3343, "mean_token_accuracy": 0.7479541718959808, "num_tokens": 1443845812.0, "step": 20090 }, { "entropy": 0.9146851256489754, "epoch": 5.478331970564186, "grad_norm": 0.12780430912971497, "learning_rate": 7.520959181092308e-05, "loss": 1.3447, "mean_token_accuracy": 0.7462508618831635, "num_tokens": 1444557250.0, "step": 20100 }, { "entropy": 0.9132054328918457, "epoch": 5.481057508857999, "grad_norm": 0.11686737835407257, "learning_rate": 7.518364141588797e-05, "loss": 1.3388, "mean_token_accuracy": 0.7521233156323432, "num_tokens": 1445282491.0, "step": 20110 }, { "entropy": 0.9029791802167892, "epoch": 5.483783047151812, "grad_norm": 0.11449231207370758, "learning_rate": 7.515768192806078e-05, "loss": 1.3311, "mean_token_accuracy": 0.7513266012072564, "num_tokens": 1446000947.0, "step": 20120 }, { "entropy": 0.9054128766059876, "epoch": 5.486508585445626, "grad_norm": 0.09959646314382553, "learning_rate": 7.513171335681442e-05, "loss": 1.3281, "mean_token_accuracy": 0.7520932570099831, "num_tokens": 1446727749.0, "step": 20130 }, { "entropy": 0.9029397517442703, "epoch": 5.489234123739439, "grad_norm": 0.13366763293743134, "learning_rate": 7.510573571152513e-05, "loss": 1.3295, "mean_token_accuracy": 0.7515622198581695, "num_tokens": 1447455668.0, "step": 20140 }, { "entropy": 0.9119272291660309, "epoch": 5.491959662033252, "grad_norm": 0.12279974669218063, "learning_rate": 7.507974900157233e-05, "loss": 1.3415, "mean_token_accuracy": 0.7486102536320687, "num_tokens": 1448171096.0, "step": 20150 }, { "entropy": 0.9111403718590736, "epoch": 5.494685200327065, "grad_norm": 0.11162228882312775, "learning_rate": 7.505375323633878e-05, "loss": 1.3483, "mean_token_accuracy": 0.7475664585828781, "num_tokens": 1448879233.0, "step": 20160 }, { "entropy": 0.8979356229305268, "epoch": 5.497410738620878, "grad_norm": 0.11792001128196716, "learning_rate": 7.502774842521054e-05, "loss": 1.3229, "mean_token_accuracy": 0.7544900998473167, "num_tokens": 1449597550.0, "step": 20170 }, { "entropy": 0.9082313403487206, "epoch": 5.500136276914691, "grad_norm": 0.10402727872133255, "learning_rate": 7.500173457757685e-05, "loss": 1.3398, "mean_token_accuracy": 0.7487385854125023, "num_tokens": 1450309282.0, "step": 20180 }, { "entropy": 0.9001877471804619, "epoch": 5.502861815208504, "grad_norm": 0.12189797312021255, "learning_rate": 7.497571170283026e-05, "loss": 1.3272, "mean_token_accuracy": 0.7528101876378059, "num_tokens": 1451019808.0, "step": 20190 }, { "entropy": 0.8964033558964729, "epoch": 5.5055873535023165, "grad_norm": 0.11383513361215591, "learning_rate": 7.49496798103666e-05, "loss": 1.3204, "mean_token_accuracy": 0.7546953797340393, "num_tokens": 1451744964.0, "step": 20200 }, { "entropy": 0.9120410367846489, "epoch": 5.5083128917961295, "grad_norm": 0.11335021257400513, "learning_rate": 7.492363890958489e-05, "loss": 1.3379, "mean_token_accuracy": 0.7478732347488404, "num_tokens": 1452457818.0, "step": 20210 }, { "entropy": 0.903009295463562, "epoch": 5.511038430089942, "grad_norm": 0.10975080728530884, "learning_rate": 7.489758900988748e-05, "loss": 1.3348, "mean_token_accuracy": 0.7547759979963302, "num_tokens": 1453177700.0, "step": 20220 }, { "entropy": 0.9056313022971153, "epoch": 5.513763968383756, "grad_norm": 0.12535880506038666, "learning_rate": 7.487153012067992e-05, "loss": 1.3367, "mean_token_accuracy": 0.7520108968019485, "num_tokens": 1453901511.0, "step": 20230 }, { "entropy": 0.9079207628965378, "epoch": 5.516489506677569, "grad_norm": 0.12012846022844315, "learning_rate": 7.484546225137103e-05, "loss": 1.3287, "mean_token_accuracy": 0.7541177779436111, "num_tokens": 1454632443.0, "step": 20240 }, { "entropy": 0.9155611962080001, "epoch": 5.519215044971382, "grad_norm": 0.11876795440912247, "learning_rate": 7.481938541137284e-05, "loss": 1.344, "mean_token_accuracy": 0.7458859100937844, "num_tokens": 1455349699.0, "step": 20250 }, { "entropy": 0.907274204492569, "epoch": 5.521940583265195, "grad_norm": 0.12015290558338165, "learning_rate": 7.479329961010065e-05, "loss": 1.3294, "mean_token_accuracy": 0.7453959077596665, "num_tokens": 1456063702.0, "step": 20260 }, { "entropy": 0.9086082488298416, "epoch": 5.524666121559008, "grad_norm": 0.11473998427391052, "learning_rate": 7.476720485697299e-05, "loss": 1.3398, "mean_token_accuracy": 0.7506502345204353, "num_tokens": 1456782137.0, "step": 20270 }, { "entropy": 0.9110724046826363, "epoch": 5.527391659852821, "grad_norm": 0.11411876976490021, "learning_rate": 7.47411011614116e-05, "loss": 1.3442, "mean_token_accuracy": 0.7489840254187584, "num_tokens": 1457505573.0, "step": 20280 }, { "entropy": 0.9120266690850258, "epoch": 5.530117198146634, "grad_norm": 0.12499787658452988, "learning_rate": 7.471498853284148e-05, "loss": 1.3405, "mean_token_accuracy": 0.7482805222272872, "num_tokens": 1458221670.0, "step": 20290 }, { "entropy": 0.9048104181885719, "epoch": 5.532842736440447, "grad_norm": 0.13739416003227234, "learning_rate": 7.468886698069085e-05, "loss": 1.3347, "mean_token_accuracy": 0.7490284994244576, "num_tokens": 1458939298.0, "step": 20300 }, { "entropy": 0.9044500857591629, "epoch": 5.53556827473426, "grad_norm": 0.1126444861292839, "learning_rate": 7.466273651439114e-05, "loss": 1.3326, "mean_token_accuracy": 0.7474282279610633, "num_tokens": 1459645367.0, "step": 20310 }, { "entropy": 0.9038434520363807, "epoch": 5.538293813028073, "grad_norm": 0.11752692610025406, "learning_rate": 7.463659714337699e-05, "loss": 1.3326, "mean_token_accuracy": 0.7536931246519089, "num_tokens": 1460374527.0, "step": 20320 }, { "entropy": 0.9099839940667153, "epoch": 5.541019351321886, "grad_norm": 0.11410974711179733, "learning_rate": 7.461044887708628e-05, "loss": 1.3342, "mean_token_accuracy": 0.751562948524952, "num_tokens": 1461096966.0, "step": 20330 }, { "entropy": 0.9014537543058395, "epoch": 5.543744889615699, "grad_norm": 0.11125433444976807, "learning_rate": 7.458429172496008e-05, "loss": 1.3297, "mean_token_accuracy": 0.7535984814167023, "num_tokens": 1461815635.0, "step": 20340 }, { "entropy": 0.9084295406937599, "epoch": 5.5464704279095125, "grad_norm": 0.11080422252416611, "learning_rate": 7.455812569644267e-05, "loss": 1.3341, "mean_token_accuracy": 0.7486643940210342, "num_tokens": 1462538299.0, "step": 20350 }, { "entropy": 0.9197900325059891, "epoch": 5.5491959662033254, "grad_norm": 0.11600863933563232, "learning_rate": 7.453195080098156e-05, "loss": 1.342, "mean_token_accuracy": 0.7477640584111214, "num_tokens": 1463266668.0, "step": 20360 }, { "entropy": 0.9118197932839394, "epoch": 5.551921504497138, "grad_norm": 0.1464001089334488, "learning_rate": 7.450576704802744e-05, "loss": 1.3389, "mean_token_accuracy": 0.7487740635871887, "num_tokens": 1463985261.0, "step": 20370 }, { "entropy": 0.9112050861120224, "epoch": 5.554647042790951, "grad_norm": 0.11449520289897919, "learning_rate": 7.44795744470342e-05, "loss": 1.3392, "mean_token_accuracy": 0.7453368082642555, "num_tokens": 1464694289.0, "step": 20380 }, { "entropy": 0.9063918381929398, "epoch": 5.557372581084764, "grad_norm": 0.10858428478240967, "learning_rate": 7.445337300745892e-05, "loss": 1.3307, "mean_token_accuracy": 0.7507871344685555, "num_tokens": 1465404383.0, "step": 20390 }, { "entropy": 0.9051426962018013, "epoch": 5.560098119378577, "grad_norm": 0.10692258179187775, "learning_rate": 7.442716273876188e-05, "loss": 1.3354, "mean_token_accuracy": 0.749012079834938, "num_tokens": 1466116990.0, "step": 20400 }, { "entropy": 0.9113408133387566, "epoch": 5.56282365767239, "grad_norm": 0.10736019909381866, "learning_rate": 7.440094365040656e-05, "loss": 1.3355, "mean_token_accuracy": 0.7532822921872139, "num_tokens": 1466842064.0, "step": 20410 }, { "entropy": 0.9093280717730522, "epoch": 5.565549195966203, "grad_norm": 0.11680605262517929, "learning_rate": 7.437471575185959e-05, "loss": 1.3378, "mean_token_accuracy": 0.747671315073967, "num_tokens": 1467556781.0, "step": 20420 }, { "entropy": 0.8958086788654327, "epoch": 5.568274734260016, "grad_norm": 0.12360627949237823, "learning_rate": 7.434847905259081e-05, "loss": 1.3228, "mean_token_accuracy": 0.7576392307877541, "num_tokens": 1468296360.0, "step": 20430 }, { "entropy": 0.902715815603733, "epoch": 5.571000272553829, "grad_norm": 0.11227795481681824, "learning_rate": 7.432223356207322e-05, "loss": 1.3327, "mean_token_accuracy": 0.7470630362629891, "num_tokens": 1469003601.0, "step": 20440 }, { "entropy": 0.8954124122858047, "epoch": 5.573725810847643, "grad_norm": 0.11043966561555862, "learning_rate": 7.429597928978302e-05, "loss": 1.327, "mean_token_accuracy": 0.7527671173214913, "num_tokens": 1469721159.0, "step": 20450 }, { "entropy": 0.8985204964876174, "epoch": 5.576451349141456, "grad_norm": 0.12268073856830597, "learning_rate": 7.426971624519953e-05, "loss": 1.3318, "mean_token_accuracy": 0.753266267478466, "num_tokens": 1470435623.0, "step": 20460 }, { "entropy": 0.9078370571136475, "epoch": 5.579176887435269, "grad_norm": 0.12063147127628326, "learning_rate": 7.424344443780534e-05, "loss": 1.335, "mean_token_accuracy": 0.7487000048160553, "num_tokens": 1471150721.0, "step": 20470 }, { "entropy": 0.9103540197014809, "epoch": 5.581902425729082, "grad_norm": 0.11219299584627151, "learning_rate": 7.421716387708605e-05, "loss": 1.338, "mean_token_accuracy": 0.7505401521921158, "num_tokens": 1471868754.0, "step": 20480 }, { "entropy": 0.9084721207618713, "epoch": 5.584627964022895, "grad_norm": 0.11898704618215561, "learning_rate": 7.419087457253057e-05, "loss": 1.3356, "mean_token_accuracy": 0.7494804993271827, "num_tokens": 1472592616.0, "step": 20490 }, { "entropy": 0.9035915836691857, "epoch": 5.587353502316708, "grad_norm": 0.12188675999641418, "learning_rate": 7.416457653363086e-05, "loss": 1.3249, "mean_token_accuracy": 0.7526019886136055, "num_tokens": 1473322061.0, "step": 20500 }, { "entropy": 0.9117862388491631, "epoch": 5.5900790406105205, "grad_norm": 0.1346140205860138, "learning_rate": 7.413826976988209e-05, "loss": 1.3362, "mean_token_accuracy": 0.747203154861927, "num_tokens": 1474026772.0, "step": 20510 }, { "entropy": 0.9080166593194008, "epoch": 5.5928045789043335, "grad_norm": 0.17116689682006836, "learning_rate": 7.411195429078258e-05, "loss": 1.3286, "mean_token_accuracy": 0.7503232747316361, "num_tokens": 1474752018.0, "step": 20520 }, { "entropy": 0.904227003455162, "epoch": 5.595530117198146, "grad_norm": 0.14302507042884827, "learning_rate": 7.408563010583377e-05, "loss": 1.3332, "mean_token_accuracy": 0.7524076342582703, "num_tokens": 1475469561.0, "step": 20530 }, { "entropy": 0.9029385939240455, "epoch": 5.598255655491959, "grad_norm": 0.10689301788806915, "learning_rate": 7.405929722454026e-05, "loss": 1.334, "mean_token_accuracy": 0.7467936128377914, "num_tokens": 1476172339.0, "step": 20540 }, { "entropy": 0.9055037021636962, "epoch": 5.600981193785772, "grad_norm": 0.1079697534441948, "learning_rate": 7.403295565640977e-05, "loss": 1.3405, "mean_token_accuracy": 0.7461986854672432, "num_tokens": 1476876827.0, "step": 20550 }, { "entropy": 0.9079792276024818, "epoch": 5.603706732079585, "grad_norm": 0.11904729902744293, "learning_rate": 7.40066054109532e-05, "loss": 1.3449, "mean_token_accuracy": 0.7490259379148483, "num_tokens": 1477585879.0, "step": 20560 }, { "entropy": 0.8998463958501816, "epoch": 5.606432270373399, "grad_norm": 0.1142992153763771, "learning_rate": 7.398024649768453e-05, "loss": 1.3209, "mean_token_accuracy": 0.7542578890919686, "num_tokens": 1478313059.0, "step": 20570 }, { "entropy": 0.9039091795682908, "epoch": 5.609157808667212, "grad_norm": 0.12061621248722076, "learning_rate": 7.395387892612092e-05, "loss": 1.3372, "mean_token_accuracy": 0.7542914986610413, "num_tokens": 1479043854.0, "step": 20580 }, { "entropy": 0.9103962168097496, "epoch": 5.611883346961025, "grad_norm": 0.11515385657548904, "learning_rate": 7.392750270578261e-05, "loss": 1.3387, "mean_token_accuracy": 0.7487710952758789, "num_tokens": 1479763616.0, "step": 20590 }, { "entropy": 0.9080936193466187, "epoch": 5.614608885254838, "grad_norm": 0.11225724965333939, "learning_rate": 7.3901117846193e-05, "loss": 1.3365, "mean_token_accuracy": 0.7493144363164902, "num_tokens": 1480487054.0, "step": 20600 }, { "entropy": 0.9011351138353347, "epoch": 5.617334423548651, "grad_norm": 0.11288349330425262, "learning_rate": 7.387472435687857e-05, "loss": 1.3302, "mean_token_accuracy": 0.7527704104781151, "num_tokens": 1481202839.0, "step": 20610 }, { "entropy": 0.9073983520269394, "epoch": 5.620059961842464, "grad_norm": 0.11644807457923889, "learning_rate": 7.384832224736897e-05, "loss": 1.34, "mean_token_accuracy": 0.7466869860887527, "num_tokens": 1481910828.0, "step": 20620 }, { "entropy": 0.9031661286950111, "epoch": 5.622785500136277, "grad_norm": 0.11115820705890656, "learning_rate": 7.382191152719691e-05, "loss": 1.3243, "mean_token_accuracy": 0.7502575770020485, "num_tokens": 1482639275.0, "step": 20630 }, { "entropy": 0.902911764383316, "epoch": 5.62551103843009, "grad_norm": 0.11243662238121033, "learning_rate": 7.379549220589823e-05, "loss": 1.3289, "mean_token_accuracy": 0.7518644094467163, "num_tokens": 1483362131.0, "step": 20640 }, { "entropy": 0.901501926779747, "epoch": 5.628236576723903, "grad_norm": 0.11614526808261871, "learning_rate": 7.376906429301189e-05, "loss": 1.3274, "mean_token_accuracy": 0.7536589324474334, "num_tokens": 1484092910.0, "step": 20650 }, { "entropy": 0.904544286429882, "epoch": 5.6309621150177165, "grad_norm": 0.11139136552810669, "learning_rate": 7.374262779807992e-05, "loss": 1.3318, "mean_token_accuracy": 0.7508685305714607, "num_tokens": 1484817903.0, "step": 20660 }, { "entropy": 0.9108938813209534, "epoch": 5.633687653311529, "grad_norm": 0.1144838035106659, "learning_rate": 7.371618273064749e-05, "loss": 1.339, "mean_token_accuracy": 0.7504678934812545, "num_tokens": 1485538554.0, "step": 20670 }, { "entropy": 0.9001557230949402, "epoch": 5.636413191605342, "grad_norm": 0.1142508015036583, "learning_rate": 7.368972910026282e-05, "loss": 1.3274, "mean_token_accuracy": 0.7570841550827027, "num_tokens": 1486267378.0, "step": 20680 }, { "entropy": 0.9114839643239975, "epoch": 5.639138729899155, "grad_norm": 0.1170973926782608, "learning_rate": 7.366326691647726e-05, "loss": 1.3408, "mean_token_accuracy": 0.7509129852056503, "num_tokens": 1486987586.0, "step": 20690 }, { "entropy": 0.9058082833886146, "epoch": 5.641864268192968, "grad_norm": 0.12553860247135162, "learning_rate": 7.363679618884521e-05, "loss": 1.331, "mean_token_accuracy": 0.7483681857585907, "num_tokens": 1487694735.0, "step": 20700 }, { "entropy": 0.9067086935043335, "epoch": 5.644589806486781, "grad_norm": 0.11567724496126175, "learning_rate": 7.36103169269242e-05, "loss": 1.3356, "mean_token_accuracy": 0.7496160626411438, "num_tokens": 1488407260.0, "step": 20710 }, { "entropy": 0.9018784865736962, "epoch": 5.647315344780594, "grad_norm": 0.11900515109300613, "learning_rate": 7.358382914027482e-05, "loss": 1.3223, "mean_token_accuracy": 0.7485745057463646, "num_tokens": 1489112368.0, "step": 20720 }, { "entropy": 0.9091901272535324, "epoch": 5.650040883074407, "grad_norm": 0.11961226910352707, "learning_rate": 7.355733283846072e-05, "loss": 1.336, "mean_token_accuracy": 0.7524806439876557, "num_tokens": 1489843077.0, "step": 20730 }, { "entropy": 0.9084666013717652, "epoch": 5.65276642136822, "grad_norm": 0.12814275920391083, "learning_rate": 7.353082803104864e-05, "loss": 1.3419, "mean_token_accuracy": 0.7467518895864487, "num_tokens": 1490539035.0, "step": 20740 }, { "entropy": 0.9046581968665123, "epoch": 5.655491959662033, "grad_norm": 0.11628738790750504, "learning_rate": 7.350431472760839e-05, "loss": 1.3355, "mean_token_accuracy": 0.7516518905758858, "num_tokens": 1491265803.0, "step": 20750 }, { "entropy": 0.9021990105509758, "epoch": 5.658217497955846, "grad_norm": 0.11885421723127365, "learning_rate": 7.347779293771287e-05, "loss": 1.3339, "mean_token_accuracy": 0.7534673601388931, "num_tokens": 1491991955.0, "step": 20760 }, { "entropy": 0.9049893140792846, "epoch": 5.660943036249659, "grad_norm": 0.1268477737903595, "learning_rate": 7.3451262670938e-05, "loss": 1.3386, "mean_token_accuracy": 0.7474268466234207, "num_tokens": 1492696757.0, "step": 20770 }, { "entropy": 0.9139819592237473, "epoch": 5.663668574543473, "grad_norm": 0.11796873807907104, "learning_rate": 7.34247239368628e-05, "loss": 1.3433, "mean_token_accuracy": 0.7465931549668312, "num_tokens": 1493421090.0, "step": 20780 }, { "entropy": 0.901647137105465, "epoch": 5.666394112837286, "grad_norm": 0.11307866871356964, "learning_rate": 7.339817674506934e-05, "loss": 1.3316, "mean_token_accuracy": 0.7515180230140686, "num_tokens": 1494140516.0, "step": 20790 }, { "entropy": 0.9086991220712661, "epoch": 5.669119651131099, "grad_norm": 0.10930800437927246, "learning_rate": 7.33716211051427e-05, "loss": 1.331, "mean_token_accuracy": 0.7510665923357009, "num_tokens": 1494856525.0, "step": 20800 }, { "entropy": 0.9052547365427017, "epoch": 5.671845189424912, "grad_norm": 0.1316278725862503, "learning_rate": 7.334505702667106e-05, "loss": 1.333, "mean_token_accuracy": 0.7491701155900955, "num_tokens": 1495568587.0, "step": 20810 }, { "entropy": 0.9048445269465446, "epoch": 5.6745707277187245, "grad_norm": 0.11319801211357117, "learning_rate": 7.331848451924565e-05, "loss": 1.3292, "mean_token_accuracy": 0.7502135202288628, "num_tokens": 1496282288.0, "step": 20820 }, { "entropy": 0.907095630466938, "epoch": 5.6772962660125375, "grad_norm": 0.11182509362697601, "learning_rate": 7.329190359246072e-05, "loss": 1.3322, "mean_token_accuracy": 0.7530362710356713, "num_tokens": 1497012885.0, "step": 20830 }, { "entropy": 0.9074946895241738, "epoch": 5.68002180430635, "grad_norm": 0.12122611701488495, "learning_rate": 7.326531425591353e-05, "loss": 1.3422, "mean_token_accuracy": 0.7459175392985344, "num_tokens": 1497710927.0, "step": 20840 }, { "entropy": 0.9031350791454316, "epoch": 5.682747342600163, "grad_norm": 0.10637669265270233, "learning_rate": 7.323871651920445e-05, "loss": 1.3348, "mean_token_accuracy": 0.7532668948173523, "num_tokens": 1498436997.0, "step": 20850 }, { "entropy": 0.8981655642390252, "epoch": 5.685472880893976, "grad_norm": 0.11300493776798248, "learning_rate": 7.321211039193683e-05, "loss": 1.328, "mean_token_accuracy": 0.750158154964447, "num_tokens": 1499138993.0, "step": 20860 }, { "entropy": 0.9084590286016464, "epoch": 5.688198419187789, "grad_norm": 0.1168494001030922, "learning_rate": 7.318549588371708e-05, "loss": 1.3322, "mean_token_accuracy": 0.7514884144067764, "num_tokens": 1499865175.0, "step": 20870 }, { "entropy": 0.9064156174659729, "epoch": 5.690923957481603, "grad_norm": 0.12878461182117462, "learning_rate": 7.315887300415461e-05, "loss": 1.3328, "mean_token_accuracy": 0.7508704990148545, "num_tokens": 1500585521.0, "step": 20880 }, { "entropy": 0.9077233120799064, "epoch": 5.693649495775416, "grad_norm": 0.11928346753120422, "learning_rate": 7.313224176286185e-05, "loss": 1.3326, "mean_token_accuracy": 0.7496184825897216, "num_tokens": 1501305914.0, "step": 20890 }, { "entropy": 0.9070781856775284, "epoch": 5.696375034069229, "grad_norm": 0.1107550859451294, "learning_rate": 7.310560216945427e-05, "loss": 1.3349, "mean_token_accuracy": 0.7506834283471108, "num_tokens": 1502023189.0, "step": 20900 }, { "entropy": 0.9059104502201081, "epoch": 5.699100572363042, "grad_norm": 0.11642283946275711, "learning_rate": 7.307895423355035e-05, "loss": 1.3336, "mean_token_accuracy": 0.7461674377322197, "num_tokens": 1502729027.0, "step": 20910 }, { "entropy": 0.9075036674737931, "epoch": 5.701826110656855, "grad_norm": 0.12099692225456238, "learning_rate": 7.305229796477158e-05, "loss": 1.3319, "mean_token_accuracy": 0.749399158358574, "num_tokens": 1503449220.0, "step": 20920 }, { "entropy": 0.9101551100611687, "epoch": 5.704551648950668, "grad_norm": 0.10946380347013474, "learning_rate": 7.302563337274246e-05, "loss": 1.3369, "mean_token_accuracy": 0.7491980984807014, "num_tokens": 1504151882.0, "step": 20930 }, { "entropy": 0.9068921029567718, "epoch": 5.707277187244481, "grad_norm": 0.1121559888124466, "learning_rate": 7.29989604670905e-05, "loss": 1.3357, "mean_token_accuracy": 0.7482832372188568, "num_tokens": 1504869987.0, "step": 20940 }, { "entropy": 0.907612769305706, "epoch": 5.710002725538294, "grad_norm": 0.10779725760221481, "learning_rate": 7.297227925744618e-05, "loss": 1.3368, "mean_token_accuracy": 0.7545360907912254, "num_tokens": 1505601375.0, "step": 20950 }, { "entropy": 0.9046850204467773, "epoch": 5.712728263832107, "grad_norm": 0.11786270141601562, "learning_rate": 7.294558975344301e-05, "loss": 1.3397, "mean_token_accuracy": 0.7510627821087837, "num_tokens": 1506323334.0, "step": 20960 }, { "entropy": 0.9153681427240372, "epoch": 5.71545380212592, "grad_norm": 0.11150839179754257, "learning_rate": 7.291889196471752e-05, "loss": 1.3361, "mean_token_accuracy": 0.7479392275214195, "num_tokens": 1507038388.0, "step": 20970 }, { "entropy": 0.913441763818264, "epoch": 5.7181793404197325, "grad_norm": 0.10878941416740417, "learning_rate": 7.289218590090916e-05, "loss": 1.3455, "mean_token_accuracy": 0.7470132410526276, "num_tokens": 1507751982.0, "step": 20980 }, { "entropy": 0.9085206687450409, "epoch": 5.7209048787135455, "grad_norm": 0.1076442077755928, "learning_rate": 7.286547157166041e-05, "loss": 1.3339, "mean_token_accuracy": 0.7513268738985062, "num_tokens": 1508484253.0, "step": 20990 }, { "entropy": 0.9020295903086663, "epoch": 5.723630417007359, "grad_norm": 0.11886076629161835, "learning_rate": 7.283874898661678e-05, "loss": 1.3304, "mean_token_accuracy": 0.7555002585053444, "num_tokens": 1509213233.0, "step": 21000 }, { "entropy": 0.9031096026301384, "epoch": 5.726355955301172, "grad_norm": 0.11685291677713394, "learning_rate": 7.281201815542666e-05, "loss": 1.3287, "mean_token_accuracy": 0.7478416725993157, "num_tokens": 1509922375.0, "step": 21010 }, { "entropy": 0.9087613329291344, "epoch": 5.729081493594985, "grad_norm": 0.11429954320192337, "learning_rate": 7.278527908774147e-05, "loss": 1.3377, "mean_token_accuracy": 0.7501318350434303, "num_tokens": 1510641545.0, "step": 21020 }, { "entropy": 0.9057684108614922, "epoch": 5.731807031888798, "grad_norm": 0.11861546337604523, "learning_rate": 7.275853179321565e-05, "loss": 1.332, "mean_token_accuracy": 0.7496027112007141, "num_tokens": 1511347859.0, "step": 21030 }, { "entropy": 0.9060276508331299, "epoch": 5.734532570182611, "grad_norm": 0.1182515025138855, "learning_rate": 7.273177628150652e-05, "loss": 1.3317, "mean_token_accuracy": 0.7510891646146775, "num_tokens": 1512070803.0, "step": 21040 }, { "entropy": 0.9113850757479668, "epoch": 5.737258108476424, "grad_norm": 0.11283525824546814, "learning_rate": 7.27050125622744e-05, "loss": 1.3345, "mean_token_accuracy": 0.7453511193394661, "num_tokens": 1512777940.0, "step": 21050 }, { "entropy": 0.9128487035632133, "epoch": 5.739983646770237, "grad_norm": 0.11141043901443481, "learning_rate": 7.267824064518264e-05, "loss": 1.3397, "mean_token_accuracy": 0.7464693874120713, "num_tokens": 1513490793.0, "step": 21060 }, { "entropy": 0.9017889350652695, "epoch": 5.74270918506405, "grad_norm": 0.1313389241695404, "learning_rate": 7.265146053989744e-05, "loss": 1.3375, "mean_token_accuracy": 0.7485280215740204, "num_tokens": 1514193471.0, "step": 21070 }, { "entropy": 0.9016789928078651, "epoch": 5.745434723357863, "grad_norm": 0.22550202906131744, "learning_rate": 7.262467225608805e-05, "loss": 1.331, "mean_token_accuracy": 0.7484898760914802, "num_tokens": 1514914647.0, "step": 21080 }, { "entropy": 0.9075780168175698, "epoch": 5.748160261651676, "grad_norm": 0.11743731051683426, "learning_rate": 7.259787580342662e-05, "loss": 1.3378, "mean_token_accuracy": 0.7536318570375442, "num_tokens": 1515649835.0, "step": 21090 }, { "entropy": 0.9135808631777763, "epoch": 5.75088579994549, "grad_norm": 0.1413869708776474, "learning_rate": 7.257107119158824e-05, "loss": 1.3457, "mean_token_accuracy": 0.7477648884057999, "num_tokens": 1516364830.0, "step": 21100 }, { "entropy": 0.9115987747907639, "epoch": 5.753611338239303, "grad_norm": 0.11431247740983963, "learning_rate": 7.2544258430251e-05, "loss": 1.3327, "mean_token_accuracy": 0.7489842206239701, "num_tokens": 1517075455.0, "step": 21110 }, { "entropy": 0.9034978196024894, "epoch": 5.7563368765331155, "grad_norm": 0.11637931317090988, "learning_rate": 7.251743752909589e-05, "loss": 1.3299, "mean_token_accuracy": 0.7487104117870331, "num_tokens": 1517787951.0, "step": 21120 }, { "entropy": 0.9044322043657302, "epoch": 5.7590624148269285, "grad_norm": 0.11377184092998505, "learning_rate": 7.249060849780684e-05, "loss": 1.3376, "mean_token_accuracy": 0.7492161333560944, "num_tokens": 1518487047.0, "step": 21130 }, { "entropy": 0.9142660677433014, "epoch": 5.761787953120741, "grad_norm": 0.1095757707953453, "learning_rate": 7.246377134607073e-05, "loss": 1.3423, "mean_token_accuracy": 0.7529979705810547, "num_tokens": 1519221826.0, "step": 21140 }, { "entropy": 0.9087027072906494, "epoch": 5.764513491414554, "grad_norm": 0.11647851765155792, "learning_rate": 7.24369260835774e-05, "loss": 1.3322, "mean_token_accuracy": 0.7485354587435722, "num_tokens": 1519942841.0, "step": 21150 }, { "entropy": 0.9132734730839729, "epoch": 5.767239029708367, "grad_norm": 0.11407783627510071, "learning_rate": 7.241007272001953e-05, "loss": 1.3449, "mean_token_accuracy": 0.7486987560987473, "num_tokens": 1520663817.0, "step": 21160 }, { "entropy": 0.9116878688335419, "epoch": 5.76996456800218, "grad_norm": 0.10810646414756775, "learning_rate": 7.238321126509282e-05, "loss": 1.3308, "mean_token_accuracy": 0.746232533454895, "num_tokens": 1521373149.0, "step": 21170 }, { "entropy": 0.9063387632369995, "epoch": 5.772690106295993, "grad_norm": 0.10843205451965332, "learning_rate": 7.235634172849584e-05, "loss": 1.3396, "mean_token_accuracy": 0.7472685724496841, "num_tokens": 1522086820.0, "step": 21180 }, { "entropy": 0.913464541733265, "epoch": 5.775415644589806, "grad_norm": 0.12286760658025742, "learning_rate": 7.232946411993009e-05, "loss": 1.3406, "mean_token_accuracy": 0.7466552630066872, "num_tokens": 1522801372.0, "step": 21190 }, { "entropy": 0.9062201827764511, "epoch": 5.778141182883619, "grad_norm": 0.1153421700000763, "learning_rate": 7.23025784491e-05, "loss": 1.3309, "mean_token_accuracy": 0.7528724387288094, "num_tokens": 1523528832.0, "step": 21200 }, { "entropy": 0.8964129894971847, "epoch": 5.780866721177432, "grad_norm": 0.11012628674507141, "learning_rate": 7.227568472571286e-05, "loss": 1.325, "mean_token_accuracy": 0.7586266621947289, "num_tokens": 1524272812.0, "step": 21210 }, { "entropy": 0.9096088528633117, "epoch": 5.783592259471246, "grad_norm": 0.14736290276050568, "learning_rate": 7.224878295947894e-05, "loss": 1.3503, "mean_token_accuracy": 0.7448491111397744, "num_tokens": 1524969510.0, "step": 21220 }, { "entropy": 0.8980430319905282, "epoch": 5.786317797765059, "grad_norm": 0.11593416333198547, "learning_rate": 7.222187316011138e-05, "loss": 1.331, "mean_token_accuracy": 0.7527055189013481, "num_tokens": 1525691152.0, "step": 21230 }, { "entropy": 0.8960934340953827, "epoch": 5.789043336058872, "grad_norm": 0.11741005629301071, "learning_rate": 7.219495533732618e-05, "loss": 1.3198, "mean_token_accuracy": 0.7602716162800789, "num_tokens": 1526428035.0, "step": 21240 }, { "entropy": 0.9068446651101112, "epoch": 5.791768874352685, "grad_norm": 0.10496514290571213, "learning_rate": 7.21680295008423e-05, "loss": 1.3359, "mean_token_accuracy": 0.7567587852478027, "num_tokens": 1527164602.0, "step": 21250 }, { "entropy": 0.9012785717844963, "epoch": 5.794494412646498, "grad_norm": 0.11333508789539337, "learning_rate": 7.214109566038158e-05, "loss": 1.3377, "mean_token_accuracy": 0.7537783280014991, "num_tokens": 1527883641.0, "step": 21260 }, { "entropy": 0.9095819979906082, "epoch": 5.797219950940311, "grad_norm": 0.11693883687257767, "learning_rate": 7.211415382566871e-05, "loss": 1.3361, "mean_token_accuracy": 0.7505184873938561, "num_tokens": 1528598023.0, "step": 21270 }, { "entropy": 0.9130471631884575, "epoch": 5.799945489234124, "grad_norm": 0.13102532923221588, "learning_rate": 7.208720400643131e-05, "loss": 1.3443, "mean_token_accuracy": 0.7470770180225372, "num_tokens": 1529307248.0, "step": 21280 }, { "entropy": 0.9062995433807373, "epoch": 5.8026710275279365, "grad_norm": 0.11358413845300674, "learning_rate": 7.206024621239986e-05, "loss": 1.3267, "mean_token_accuracy": 0.7522414743900299, "num_tokens": 1530032785.0, "step": 21290 }, { "entropy": 0.9074021801352501, "epoch": 5.8053965658217495, "grad_norm": 0.11888142675161362, "learning_rate": 7.203328045330773e-05, "loss": 1.3479, "mean_token_accuracy": 0.7494888335466385, "num_tokens": 1530747194.0, "step": 21300 }, { "entropy": 0.901043277978897, "epoch": 5.808122104115563, "grad_norm": 0.11507439613342285, "learning_rate": 7.200630673889117e-05, "loss": 1.334, "mean_token_accuracy": 0.7542605042457581, "num_tokens": 1531472972.0, "step": 21310 }, { "entropy": 0.9156588390469551, "epoch": 5.810847642409376, "grad_norm": 0.1293054074048996, "learning_rate": 7.197932507888929e-05, "loss": 1.3425, "mean_token_accuracy": 0.7489974901080132, "num_tokens": 1532187546.0, "step": 21320 }, { "entropy": 0.9082718387246131, "epoch": 5.813573180703189, "grad_norm": 0.11587195843458176, "learning_rate": 7.195233548304407e-05, "loss": 1.3319, "mean_token_accuracy": 0.7506336972117424, "num_tokens": 1532907614.0, "step": 21330 }, { "entropy": 0.90416921377182, "epoch": 5.816298718997002, "grad_norm": 0.11691489070653915, "learning_rate": 7.192533796110036e-05, "loss": 1.3473, "mean_token_accuracy": 0.7484967574477196, "num_tokens": 1533617716.0, "step": 21340 }, { "entropy": 0.907621382176876, "epoch": 5.819024257290815, "grad_norm": 0.11140576004981995, "learning_rate": 7.189833252280588e-05, "loss": 1.3337, "mean_token_accuracy": 0.7470261678099632, "num_tokens": 1534328518.0, "step": 21350 }, { "entropy": 0.9058356672525406, "epoch": 5.821749795584628, "grad_norm": 0.11089876294136047, "learning_rate": 7.187131917791118e-05, "loss": 1.3324, "mean_token_accuracy": 0.7501423612236977, "num_tokens": 1535042030.0, "step": 21360 }, { "entropy": 0.9052778214216233, "epoch": 5.824475333878441, "grad_norm": 0.11452427506446838, "learning_rate": 7.184429793616968e-05, "loss": 1.3285, "mean_token_accuracy": 0.7518876895308495, "num_tokens": 1535773704.0, "step": 21370 }, { "entropy": 0.9050400242209434, "epoch": 5.827200872172254, "grad_norm": 0.11301568895578384, "learning_rate": 7.18172688073377e-05, "loss": 1.3234, "mean_token_accuracy": 0.7526569321751595, "num_tokens": 1536499006.0, "step": 21380 }, { "entropy": 0.9012054517865181, "epoch": 5.829926410466067, "grad_norm": 0.11559009552001953, "learning_rate": 7.179023180117433e-05, "loss": 1.332, "mean_token_accuracy": 0.7539320036768913, "num_tokens": 1537223155.0, "step": 21390 }, { "entropy": 0.896777668595314, "epoch": 5.83265194875988, "grad_norm": 0.11815473437309265, "learning_rate": 7.176318692744153e-05, "loss": 1.3294, "mean_token_accuracy": 0.7591805055737495, "num_tokens": 1537956904.0, "step": 21400 }, { "entropy": 0.8999134451150894, "epoch": 5.835377487053693, "grad_norm": 0.1185450404882431, "learning_rate": 7.173613419590411e-05, "loss": 1.3261, "mean_token_accuracy": 0.7577306047081948, "num_tokens": 1538689494.0, "step": 21410 }, { "entropy": 0.899851243197918, "epoch": 5.838103025347506, "grad_norm": 0.11542113125324249, "learning_rate": 7.170907361632972e-05, "loss": 1.3286, "mean_token_accuracy": 0.7565847590565682, "num_tokens": 1539412090.0, "step": 21420 }, { "entropy": 0.9017447680234909, "epoch": 5.8408285636413195, "grad_norm": 0.11492068320512772, "learning_rate": 7.168200519848884e-05, "loss": 1.3366, "mean_token_accuracy": 0.7529019027948379, "num_tokens": 1540132195.0, "step": 21430 }, { "entropy": 0.9049430832266807, "epoch": 5.8435541019351325, "grad_norm": 0.11647587269544601, "learning_rate": 7.165492895215481e-05, "loss": 1.3325, "mean_token_accuracy": 0.7481189534068108, "num_tokens": 1540835722.0, "step": 21440 }, { "entropy": 0.8994492426514625, "epoch": 5.846279640228945, "grad_norm": 0.11033880710601807, "learning_rate": 7.16278448871037e-05, "loss": 1.3299, "mean_token_accuracy": 0.7494186624884606, "num_tokens": 1541553860.0, "step": 21450 }, { "entropy": 0.9022593319416046, "epoch": 5.849005178522758, "grad_norm": 0.10914087295532227, "learning_rate": 7.160075301311451e-05, "loss": 1.3307, "mean_token_accuracy": 0.7485667675733566, "num_tokens": 1542260817.0, "step": 21460 }, { "entropy": 0.8925522163510322, "epoch": 5.851730716816571, "grad_norm": 0.10634701699018478, "learning_rate": 7.157365333996903e-05, "loss": 1.3217, "mean_token_accuracy": 0.7552912056446075, "num_tokens": 1542986865.0, "step": 21470 }, { "entropy": 0.896972981095314, "epoch": 5.854456255110384, "grad_norm": 0.11877600848674774, "learning_rate": 7.154654587745181e-05, "loss": 1.326, "mean_token_accuracy": 0.7548259600996972, "num_tokens": 1543711426.0, "step": 21480 }, { "entropy": 0.9042829141020775, "epoch": 5.857181793404197, "grad_norm": 0.10897119343280792, "learning_rate": 7.151943063535029e-05, "loss": 1.332, "mean_token_accuracy": 0.7512248262763024, "num_tokens": 1544447293.0, "step": 21490 }, { "entropy": 0.9050748169422149, "epoch": 5.85990733169801, "grad_norm": 0.11239845305681229, "learning_rate": 7.149230762345466e-05, "loss": 1.3252, "mean_token_accuracy": 0.7527645841240883, "num_tokens": 1545177492.0, "step": 21500 }, { "entropy": 0.9117373630404473, "epoch": 5.862632869991823, "grad_norm": 0.11432221531867981, "learning_rate": 7.146517685155797e-05, "loss": 1.3329, "mean_token_accuracy": 0.7515347197651863, "num_tokens": 1545910253.0, "step": 21510 }, { "entropy": 0.9061395451426506, "epoch": 5.865358408285636, "grad_norm": 0.12396573275327682, "learning_rate": 7.143803832945601e-05, "loss": 1.3271, "mean_token_accuracy": 0.7548024579882622, "num_tokens": 1546638251.0, "step": 21520 }, { "entropy": 0.9042191088199616, "epoch": 5.86808394657945, "grad_norm": 0.1185867041349411, "learning_rate": 7.141089206694743e-05, "loss": 1.3337, "mean_token_accuracy": 0.7500158175826073, "num_tokens": 1547351455.0, "step": 21530 }, { "entropy": 0.9097189202904701, "epoch": 5.870809484873263, "grad_norm": 0.11794767528772354, "learning_rate": 7.138373807383362e-05, "loss": 1.3356, "mean_token_accuracy": 0.7525267764925957, "num_tokens": 1548075104.0, "step": 21540 }, { "entropy": 0.9049504280090332, "epoch": 5.873535023167076, "grad_norm": 0.12269119918346405, "learning_rate": 7.13565763599188e-05, "loss": 1.3338, "mean_token_accuracy": 0.7550853103399277, "num_tokens": 1548807941.0, "step": 21550 }, { "entropy": 0.9065029069781303, "epoch": 5.876260561460889, "grad_norm": 0.1095624566078186, "learning_rate": 7.132940693500998e-05, "loss": 1.3383, "mean_token_accuracy": 0.7514843955636025, "num_tokens": 1549522912.0, "step": 21560 }, { "entropy": 0.9028425559401512, "epoch": 5.878986099754702, "grad_norm": 0.11521097272634506, "learning_rate": 7.13022298089169e-05, "loss": 1.3322, "mean_token_accuracy": 0.752574360370636, "num_tokens": 1550251480.0, "step": 21570 }, { "entropy": 0.9045530989766121, "epoch": 5.881711638048515, "grad_norm": 0.10882606357336044, "learning_rate": 7.127504499145213e-05, "loss": 1.3189, "mean_token_accuracy": 0.7573057830333709, "num_tokens": 1550997916.0, "step": 21580 }, { "entropy": 0.8961788237094879, "epoch": 5.8844371763423275, "grad_norm": 0.10879376530647278, "learning_rate": 7.124785249243103e-05, "loss": 1.3243, "mean_token_accuracy": 0.7560637041926384, "num_tokens": 1551737601.0, "step": 21590 }, { "entropy": 0.9038919240236283, "epoch": 5.8871627146361405, "grad_norm": 0.12050269544124603, "learning_rate": 7.12206523216717e-05, "loss": 1.3271, "mean_token_accuracy": 0.7502954587340355, "num_tokens": 1552448903.0, "step": 21600 }, { "entropy": 0.8999939456582069, "epoch": 5.889888252929953, "grad_norm": 0.12266591191291809, "learning_rate": 7.119344448899498e-05, "loss": 1.3241, "mean_token_accuracy": 0.7521205097436905, "num_tokens": 1553167664.0, "step": 21610 }, { "entropy": 0.9063843786716461, "epoch": 5.892613791223766, "grad_norm": 0.11235978454351425, "learning_rate": 7.116622900422456e-05, "loss": 1.3351, "mean_token_accuracy": 0.7485270857810974, "num_tokens": 1553874680.0, "step": 21620 }, { "entropy": 0.9047386437654495, "epoch": 5.895339329517579, "grad_norm": 0.12159693241119385, "learning_rate": 7.113900587718685e-05, "loss": 1.3374, "mean_token_accuracy": 0.7542475134134292, "num_tokens": 1554606300.0, "step": 21630 }, { "entropy": 0.9033267572522163, "epoch": 5.898064867811392, "grad_norm": 0.12074053287506104, "learning_rate": 7.111177511771099e-05, "loss": 1.3328, "mean_token_accuracy": 0.7475815027952194, "num_tokens": 1555307808.0, "step": 21640 }, { "entropy": 0.9042378276586532, "epoch": 5.900790406105206, "grad_norm": 0.11893583834171295, "learning_rate": 7.108453673562891e-05, "loss": 1.3309, "mean_token_accuracy": 0.7536738410592079, "num_tokens": 1556030679.0, "step": 21650 }, { "entropy": 0.9091543048620224, "epoch": 5.903515944399019, "grad_norm": 0.11554117500782013, "learning_rate": 7.10572907407753e-05, "loss": 1.3421, "mean_token_accuracy": 0.7465230345726013, "num_tokens": 1556730101.0, "step": 21660 }, { "entropy": 0.9006141796708107, "epoch": 5.906241482692832, "grad_norm": 0.1543373018503189, "learning_rate": 7.103003714298757e-05, "loss": 1.3273, "mean_token_accuracy": 0.752702134847641, "num_tokens": 1557444362.0, "step": 21670 }, { "entropy": 0.9043982520699501, "epoch": 5.908967020986645, "grad_norm": 0.12153176963329315, "learning_rate": 7.100277595210591e-05, "loss": 1.3331, "mean_token_accuracy": 0.7517162814736367, "num_tokens": 1558174426.0, "step": 21680 }, { "entropy": 0.903817056119442, "epoch": 5.911692559280458, "grad_norm": 0.11969004571437836, "learning_rate": 7.097550717797321e-05, "loss": 1.3314, "mean_token_accuracy": 0.7550696551799774, "num_tokens": 1558914880.0, "step": 21690 }, { "entropy": 0.9011016815900803, "epoch": 5.914418097574271, "grad_norm": 0.12317018210887909, "learning_rate": 7.094823083043511e-05, "loss": 1.324, "mean_token_accuracy": 0.7550008714199066, "num_tokens": 1559646795.0, "step": 21700 }, { "entropy": 0.91651850938797, "epoch": 5.917143635868084, "grad_norm": 0.11649711430072784, "learning_rate": 7.092094691934004e-05, "loss": 1.3401, "mean_token_accuracy": 0.7480064913630485, "num_tokens": 1560372629.0, "step": 21710 }, { "entropy": 0.9046705111861228, "epoch": 5.919869174161897, "grad_norm": 0.12039873003959656, "learning_rate": 7.089365545453906e-05, "loss": 1.3261, "mean_token_accuracy": 0.7540947735309601, "num_tokens": 1561103426.0, "step": 21720 }, { "entropy": 0.9046516075730324, "epoch": 5.92259471245571, "grad_norm": 0.11867029964923859, "learning_rate": 7.086635644588604e-05, "loss": 1.3447, "mean_token_accuracy": 0.7449310541152954, "num_tokens": 1561803039.0, "step": 21730 }, { "entropy": 0.9128703400492668, "epoch": 5.9253202507495235, "grad_norm": 0.10717029124498367, "learning_rate": 7.083904990323755e-05, "loss": 1.3421, "mean_token_accuracy": 0.7493982627987862, "num_tokens": 1562528882.0, "step": 21740 }, { "entropy": 0.9036580204963685, "epoch": 5.9280457890433365, "grad_norm": 0.12170601636171341, "learning_rate": 7.081173583645286e-05, "loss": 1.3242, "mean_token_accuracy": 0.7546490073204041, "num_tokens": 1563254856.0, "step": 21750 }, { "entropy": 0.9064361125230789, "epoch": 5.930771327337149, "grad_norm": 0.11220008134841919, "learning_rate": 7.078441425539398e-05, "loss": 1.3402, "mean_token_accuracy": 0.7528118431568146, "num_tokens": 1563972881.0, "step": 21760 }, { "entropy": 0.9053695395588874, "epoch": 5.933496865630962, "grad_norm": 0.11225832998752594, "learning_rate": 7.075708516992562e-05, "loss": 1.3287, "mean_token_accuracy": 0.7548480466008186, "num_tokens": 1564702125.0, "step": 21770 }, { "entropy": 0.904731398820877, "epoch": 5.936222403924775, "grad_norm": 0.12214484065771103, "learning_rate": 7.07297485899152e-05, "loss": 1.3336, "mean_token_accuracy": 0.7515589758753777, "num_tokens": 1565429318.0, "step": 21780 }, { "entropy": 0.9099110662937164, "epoch": 5.938947942218588, "grad_norm": 0.13402391970157623, "learning_rate": 7.070240452523288e-05, "loss": 1.3463, "mean_token_accuracy": 0.7511887595057487, "num_tokens": 1566148102.0, "step": 21790 }, { "entropy": 0.9190353766083718, "epoch": 5.941673480512401, "grad_norm": 0.1147463247179985, "learning_rate": 7.067505298575146e-05, "loss": 1.3533, "mean_token_accuracy": 0.7461867153644561, "num_tokens": 1566857817.0, "step": 21800 }, { "entropy": 0.909945385158062, "epoch": 5.944399018806214, "grad_norm": 0.11669431626796722, "learning_rate": 7.064769398134649e-05, "loss": 1.3383, "mean_token_accuracy": 0.7492309078574181, "num_tokens": 1567575204.0, "step": 21810 }, { "entropy": 0.9009095013141633, "epoch": 5.947124557100027, "grad_norm": 0.1547296643257141, "learning_rate": 7.062032752189619e-05, "loss": 1.3304, "mean_token_accuracy": 0.7499802619218826, "num_tokens": 1568279167.0, "step": 21820 }, { "entropy": 0.8945521906018257, "epoch": 5.94985009539384, "grad_norm": 0.11645699292421341, "learning_rate": 7.059295361728149e-05, "loss": 1.3376, "mean_token_accuracy": 0.7529954999685288, "num_tokens": 1568989407.0, "step": 21830 }, { "entropy": 0.9087991073727608, "epoch": 5.952575633687653, "grad_norm": 0.11843431740999222, "learning_rate": 7.056557227738597e-05, "loss": 1.3401, "mean_token_accuracy": 0.7492764741182327, "num_tokens": 1569703038.0, "step": 21840 }, { "entropy": 0.9076632171869278, "epoch": 5.955301171981466, "grad_norm": 0.1186591237783432, "learning_rate": 7.053818351209596e-05, "loss": 1.3385, "mean_token_accuracy": 0.7492095783352852, "num_tokens": 1570419352.0, "step": 21850 }, { "entropy": 0.9066355928778649, "epoch": 5.95802671027528, "grad_norm": 0.11073645204305649, "learning_rate": 7.05107873313004e-05, "loss": 1.332, "mean_token_accuracy": 0.7488937497138977, "num_tokens": 1571133758.0, "step": 21860 }, { "entropy": 0.9008475184440613, "epoch": 5.960752248569093, "grad_norm": 0.11767814308404922, "learning_rate": 7.048338374489096e-05, "loss": 1.3276, "mean_token_accuracy": 0.7530233487486839, "num_tokens": 1571865638.0, "step": 21870 }, { "entropy": 0.9052358761429786, "epoch": 5.963477786862906, "grad_norm": 0.15197525918483734, "learning_rate": 7.045597276276197e-05, "loss": 1.3222, "mean_token_accuracy": 0.7525520205497742, "num_tokens": 1572599090.0, "step": 21880 }, { "entropy": 0.8935629814863205, "epoch": 5.966203325156719, "grad_norm": 0.12846499681472778, "learning_rate": 7.04285543948104e-05, "loss": 1.3214, "mean_token_accuracy": 0.754536534845829, "num_tokens": 1573322068.0, "step": 21890 }, { "entropy": 0.8992321044206619, "epoch": 5.9689288634505315, "grad_norm": 0.12908099591732025, "learning_rate": 7.040112865093593e-05, "loss": 1.3343, "mean_token_accuracy": 0.7531968131661415, "num_tokens": 1574043501.0, "step": 21900 }, { "entropy": 0.9084354728460312, "epoch": 5.9716544017443445, "grad_norm": 0.11236303299665451, "learning_rate": 7.037369554104087e-05, "loss": 1.3346, "mean_token_accuracy": 0.7484549596905709, "num_tokens": 1574760565.0, "step": 21910 }, { "entropy": 0.913992977142334, "epoch": 5.974379940038157, "grad_norm": 0.11477797478437424, "learning_rate": 7.034625507503022e-05, "loss": 1.3418, "mean_token_accuracy": 0.7486337691545486, "num_tokens": 1575480198.0, "step": 21920 }, { "entropy": 0.9076977044343948, "epoch": 5.97710547833197, "grad_norm": 0.1153983324766159, "learning_rate": 7.031880726281161e-05, "loss": 1.3283, "mean_token_accuracy": 0.7501808911561966, "num_tokens": 1576202011.0, "step": 21930 }, { "entropy": 0.9015500947833062, "epoch": 5.979831016625783, "grad_norm": 0.10736705362796783, "learning_rate": 7.029135211429534e-05, "loss": 1.3306, "mean_token_accuracy": 0.7478416576981545, "num_tokens": 1576908139.0, "step": 21940 }, { "entropy": 0.9075870469212532, "epoch": 5.982556554919596, "grad_norm": 0.11770978569984436, "learning_rate": 7.026388963939435e-05, "loss": 1.3385, "mean_token_accuracy": 0.7497616693377495, "num_tokens": 1577616701.0, "step": 21950 }, { "entropy": 0.9064632877707481, "epoch": 5.98528209321341, "grad_norm": 0.12228012084960938, "learning_rate": 7.023641984802421e-05, "loss": 1.3295, "mean_token_accuracy": 0.7563860073685647, "num_tokens": 1578352596.0, "step": 21960 }, { "entropy": 0.9038796693086624, "epoch": 5.988007631507223, "grad_norm": 0.10734150558710098, "learning_rate": 7.020894275010318e-05, "loss": 1.3345, "mean_token_accuracy": 0.7479429483413697, "num_tokens": 1579065080.0, "step": 21970 }, { "entropy": 0.9043041512370109, "epoch": 5.990733169801036, "grad_norm": 0.11305051296949387, "learning_rate": 7.018145835555209e-05, "loss": 1.3278, "mean_token_accuracy": 0.7520740538835525, "num_tokens": 1579785660.0, "step": 21980 }, { "entropy": 0.9011677592992783, "epoch": 5.993458708094849, "grad_norm": 0.1225271001458168, "learning_rate": 7.015396667429448e-05, "loss": 1.3272, "mean_token_accuracy": 0.7554933309555054, "num_tokens": 1580508583.0, "step": 21990 }, { "entropy": 0.9020877957344056, "epoch": 5.996184246388662, "grad_norm": 0.11489120870828629, "learning_rate": 7.012646771625644e-05, "loss": 1.3282, "mean_token_accuracy": 0.7508908599615097, "num_tokens": 1581217757.0, "step": 22000 }, { "entropy": 0.9066957876086235, "epoch": 5.998909784682475, "grad_norm": 0.10596401244401932, "learning_rate": 7.009896149136674e-05, "loss": 1.3355, "mean_token_accuracy": 0.7449407547712326, "num_tokens": 1581915021.0, "step": 22010 }, { "entropy": 0.8996339097619057, "epoch": 6.001635322976288, "grad_norm": 0.11777181178331375, "learning_rate": 7.00714480095568e-05, "loss": 1.3146, "mean_token_accuracy": 0.7546662047505379, "num_tokens": 1582646097.0, "step": 22020 }, { "entropy": 0.8918565154075623, "epoch": 6.004360861270101, "grad_norm": 0.12640653550624847, "learning_rate": 7.004392728076058e-05, "loss": 1.3255, "mean_token_accuracy": 0.7498223036527634, "num_tokens": 1583355899.0, "step": 22030 }, { "entropy": 0.8883702427148819, "epoch": 6.007086399563914, "grad_norm": 0.13016051054000854, "learning_rate": 7.00163993149147e-05, "loss": 1.3195, "mean_token_accuracy": 0.7538187056779861, "num_tokens": 1584075326.0, "step": 22040 }, { "entropy": 0.8920476689934731, "epoch": 6.009811937857727, "grad_norm": 0.12302690744400024, "learning_rate": 6.998886412195842e-05, "loss": 1.3202, "mean_token_accuracy": 0.7489654153585434, "num_tokens": 1584771151.0, "step": 22050 }, { "entropy": 0.8842059820890427, "epoch": 6.0125374761515396, "grad_norm": 0.12850545346736908, "learning_rate": 6.996132171183358e-05, "loss": 1.3142, "mean_token_accuracy": 0.7590628907084465, "num_tokens": 1585492023.0, "step": 22060 }, { "entropy": 0.8875583812594414, "epoch": 6.015263014445353, "grad_norm": 0.13881002366542816, "learning_rate": 6.99337720944846e-05, "loss": 1.3087, "mean_token_accuracy": 0.7540833830833436, "num_tokens": 1586216570.0, "step": 22070 }, { "entropy": 0.8929170578718185, "epoch": 6.017988552739166, "grad_norm": 0.1315547227859497, "learning_rate": 6.990621527985856e-05, "loss": 1.3195, "mean_token_accuracy": 0.7589869886636734, "num_tokens": 1586953873.0, "step": 22080 }, { "entropy": 0.8922048270702362, "epoch": 6.020714091032979, "grad_norm": 0.11654641479253769, "learning_rate": 6.987865127790508e-05, "loss": 1.3128, "mean_token_accuracy": 0.7577459946274757, "num_tokens": 1587678683.0, "step": 22090 }, { "entropy": 0.8893833413720131, "epoch": 6.023439629326792, "grad_norm": 0.11815489083528519, "learning_rate": 6.985108009857643e-05, "loss": 1.3199, "mean_token_accuracy": 0.7532740905880928, "num_tokens": 1588396643.0, "step": 22100 }, { "entropy": 0.890563715994358, "epoch": 6.026165167620605, "grad_norm": 0.12686485052108765, "learning_rate": 6.982350175182744e-05, "loss": 1.3157, "mean_token_accuracy": 0.7522914201021195, "num_tokens": 1589108260.0, "step": 22110 }, { "entropy": 0.8936678737401962, "epoch": 6.028890705914418, "grad_norm": 0.1292998045682907, "learning_rate": 6.979591624761552e-05, "loss": 1.3214, "mean_token_accuracy": 0.7485388427972793, "num_tokens": 1589817771.0, "step": 22120 }, { "entropy": 0.8897582158446312, "epoch": 6.031616244208231, "grad_norm": 0.12712526321411133, "learning_rate": 6.976832359590067e-05, "loss": 1.321, "mean_token_accuracy": 0.7518042385578155, "num_tokens": 1590534431.0, "step": 22130 }, { "entropy": 0.8897338256239891, "epoch": 6.034341782502044, "grad_norm": 0.13390809297561646, "learning_rate": 6.974072380664551e-05, "loss": 1.3229, "mean_token_accuracy": 0.7534710794687272, "num_tokens": 1591246909.0, "step": 22140 }, { "entropy": 0.8840497434139252, "epoch": 6.037067320795857, "grad_norm": 0.12325893342494965, "learning_rate": 6.971311688981518e-05, "loss": 1.3133, "mean_token_accuracy": 0.7563563913106919, "num_tokens": 1591968830.0, "step": 22150 }, { "entropy": 0.8909603416919708, "epoch": 6.03979285908967, "grad_norm": 0.13583821058273315, "learning_rate": 6.968550285537745e-05, "loss": 1.3184, "mean_token_accuracy": 0.7549219325184822, "num_tokens": 1592680889.0, "step": 22160 }, { "entropy": 0.8920790418982506, "epoch": 6.042518397383483, "grad_norm": 0.1283435970544815, "learning_rate": 6.965788171330258e-05, "loss": 1.3215, "mean_token_accuracy": 0.7514332816004753, "num_tokens": 1593394633.0, "step": 22170 }, { "entropy": 0.8921322748064995, "epoch": 6.045243935677297, "grad_norm": 0.127129465341568, "learning_rate": 6.963025347356349e-05, "loss": 1.3206, "mean_token_accuracy": 0.7548703938722611, "num_tokens": 1594118725.0, "step": 22180 }, { "entropy": 0.8960848644375801, "epoch": 6.04796947397111, "grad_norm": 0.12366831302642822, "learning_rate": 6.960261814613558e-05, "loss": 1.3234, "mean_token_accuracy": 0.7518098592758179, "num_tokens": 1594840620.0, "step": 22190 }, { "entropy": 0.8972969114780426, "epoch": 6.050695012264923, "grad_norm": 0.12490490078926086, "learning_rate": 6.957497574099687e-05, "loss": 1.3245, "mean_token_accuracy": 0.7537968784570694, "num_tokens": 1595560984.0, "step": 22200 }, { "entropy": 0.8910147756338119, "epoch": 6.0534205505587355, "grad_norm": 0.12830320000648499, "learning_rate": 6.95473262681279e-05, "loss": 1.3071, "mean_token_accuracy": 0.753321748971939, "num_tokens": 1596278756.0, "step": 22210 }, { "entropy": 0.8912463679909706, "epoch": 6.0561460888525485, "grad_norm": 0.12675067782402039, "learning_rate": 6.951966973751178e-05, "loss": 1.3158, "mean_token_accuracy": 0.7535087749361992, "num_tokens": 1596995412.0, "step": 22220 }, { "entropy": 0.886512254178524, "epoch": 6.058871627146361, "grad_norm": 0.12018350511789322, "learning_rate": 6.949200615913417e-05, "loss": 1.3167, "mean_token_accuracy": 0.7514047920703888, "num_tokens": 1597692120.0, "step": 22230 }, { "entropy": 0.8892407730221749, "epoch": 6.061597165440174, "grad_norm": 0.1190294548869133, "learning_rate": 6.946433554298326e-05, "loss": 1.3115, "mean_token_accuracy": 0.7567781344056129, "num_tokens": 1598422283.0, "step": 22240 }, { "entropy": 0.8828908443450928, "epoch": 6.064322703733987, "grad_norm": 0.12898795306682587, "learning_rate": 6.943665789904979e-05, "loss": 1.3104, "mean_token_accuracy": 0.7551097676157952, "num_tokens": 1599143476.0, "step": 22250 }, { "entropy": 0.9043629035353661, "epoch": 6.0670482420278, "grad_norm": 0.12606586515903473, "learning_rate": 6.940897323732703e-05, "loss": 1.3178, "mean_token_accuracy": 0.7502626135945321, "num_tokens": 1599866042.0, "step": 22260 }, { "entropy": 0.8884061798453331, "epoch": 6.069773780321613, "grad_norm": 0.12459734082221985, "learning_rate": 6.938128156781078e-05, "loss": 1.3144, "mean_token_accuracy": 0.753172567486763, "num_tokens": 1600580503.0, "step": 22270 }, { "entropy": 0.8842171415686607, "epoch": 6.072499318615426, "grad_norm": 0.12710915505886078, "learning_rate": 6.935358290049939e-05, "loss": 1.3119, "mean_token_accuracy": 0.7543427735567093, "num_tokens": 1601299172.0, "step": 22280 }, { "entropy": 0.8847817584872246, "epoch": 6.07522485690924, "grad_norm": 0.12989383935928345, "learning_rate": 6.932587724539374e-05, "loss": 1.3106, "mean_token_accuracy": 0.7561130687594414, "num_tokens": 1602015327.0, "step": 22290 }, { "entropy": 0.8922547936439514, "epoch": 6.077950395203053, "grad_norm": 0.14769838750362396, "learning_rate": 6.929816461249719e-05, "loss": 1.3194, "mean_token_accuracy": 0.7522080436348915, "num_tokens": 1602722231.0, "step": 22300 }, { "entropy": 0.8895033150911331, "epoch": 6.080675933496866, "grad_norm": 0.13418523967266083, "learning_rate": 6.927044501181568e-05, "loss": 1.313, "mean_token_accuracy": 0.7518047258257866, "num_tokens": 1603431915.0, "step": 22310 }, { "entropy": 0.8931319579482079, "epoch": 6.083401471790679, "grad_norm": 0.12505514919757843, "learning_rate": 6.92427184533576e-05, "loss": 1.3205, "mean_token_accuracy": 0.7564160689711571, "num_tokens": 1604167329.0, "step": 22320 }, { "entropy": 0.8987172707915306, "epoch": 6.086127010084492, "grad_norm": 0.1262582689523697, "learning_rate": 6.921498494713392e-05, "loss": 1.3306, "mean_token_accuracy": 0.7501651674509049, "num_tokens": 1604880356.0, "step": 22330 }, { "entropy": 0.8913463935256004, "epoch": 6.088852548378305, "grad_norm": 0.13527299463748932, "learning_rate": 6.918724450315805e-05, "loss": 1.3199, "mean_token_accuracy": 0.7520601511001587, "num_tokens": 1605594598.0, "step": 22340 }, { "entropy": 0.8869917944073678, "epoch": 6.091578086672118, "grad_norm": 0.12402289360761642, "learning_rate": 6.915949713144599e-05, "loss": 1.3152, "mean_token_accuracy": 0.7564192846417427, "num_tokens": 1606313126.0, "step": 22350 }, { "entropy": 0.894322058558464, "epoch": 6.094303624965931, "grad_norm": 0.1261168122291565, "learning_rate": 6.913174284201613e-05, "loss": 1.3287, "mean_token_accuracy": 0.7501348540186882, "num_tokens": 1607023545.0, "step": 22360 }, { "entropy": 0.8885378792881966, "epoch": 6.0970291632597435, "grad_norm": 0.11853428184986115, "learning_rate": 6.910398164488946e-05, "loss": 1.3073, "mean_token_accuracy": 0.760647115111351, "num_tokens": 1607765314.0, "step": 22370 }, { "entropy": 0.8893858775496483, "epoch": 6.0997547015535565, "grad_norm": 0.12499324977397919, "learning_rate": 6.907621355008942e-05, "loss": 1.3151, "mean_token_accuracy": 0.752248714864254, "num_tokens": 1608471248.0, "step": 22380 }, { "entropy": 0.8909812286496163, "epoch": 6.102480239847369, "grad_norm": 0.1291303187608719, "learning_rate": 6.904843856764193e-05, "loss": 1.3187, "mean_token_accuracy": 0.7530547022819519, "num_tokens": 1609188891.0, "step": 22390 }, { "entropy": 0.8938685089349747, "epoch": 6.105205778141183, "grad_norm": 0.11796817183494568, "learning_rate": 6.90206567075754e-05, "loss": 1.3156, "mean_token_accuracy": 0.7525603711605072, "num_tokens": 1609912471.0, "step": 22400 }, { "entropy": 0.8958727091550827, "epoch": 6.107931316434996, "grad_norm": 0.1305599957704544, "learning_rate": 6.899286797992079e-05, "loss": 1.3181, "mean_token_accuracy": 0.7548779636621475, "num_tokens": 1610632297.0, "step": 22410 }, { "entropy": 0.8944883346557617, "epoch": 6.110656854728809, "grad_norm": 0.12552963197231293, "learning_rate": 6.89650723947114e-05, "loss": 1.3185, "mean_token_accuracy": 0.7562395870685578, "num_tokens": 1611369778.0, "step": 22420 }, { "entropy": 0.8903278291225434, "epoch": 6.113382393022622, "grad_norm": 0.12508676946163177, "learning_rate": 6.893726996198315e-05, "loss": 1.3099, "mean_token_accuracy": 0.7585559323430061, "num_tokens": 1612115016.0, "step": 22430 }, { "entropy": 0.8874625027179718, "epoch": 6.116107931316435, "grad_norm": 0.1288505643606186, "learning_rate": 6.890946069177435e-05, "loss": 1.3163, "mean_token_accuracy": 0.7557416692376137, "num_tokens": 1612844894.0, "step": 22440 }, { "entropy": 0.8882686629891395, "epoch": 6.118833469610248, "grad_norm": 0.12406323850154877, "learning_rate": 6.88816445941258e-05, "loss": 1.3064, "mean_token_accuracy": 0.7553786844015121, "num_tokens": 1613566824.0, "step": 22450 }, { "entropy": 0.8838739201426506, "epoch": 6.121559007904061, "grad_norm": 0.1409529149532318, "learning_rate": 6.885382167908077e-05, "loss": 1.3128, "mean_token_accuracy": 0.7541501834988594, "num_tokens": 1614282411.0, "step": 22460 }, { "entropy": 0.895191416144371, "epoch": 6.124284546197874, "grad_norm": 0.12471000105142593, "learning_rate": 6.8825991956685e-05, "loss": 1.3214, "mean_token_accuracy": 0.754830002784729, "num_tokens": 1615002230.0, "step": 22470 }, { "entropy": 0.8889313638210297, "epoch": 6.127010084491687, "grad_norm": 0.12469696998596191, "learning_rate": 6.879815543698665e-05, "loss": 1.3122, "mean_token_accuracy": 0.7525438651442528, "num_tokens": 1615720889.0, "step": 22480 }, { "entropy": 0.8920111954212189, "epoch": 6.1297356227855, "grad_norm": 0.1284060776233673, "learning_rate": 6.877031213003636e-05, "loss": 1.321, "mean_token_accuracy": 0.7575472369790077, "num_tokens": 1616456158.0, "step": 22490 }, { "entropy": 0.8941321104764939, "epoch": 6.132461161079313, "grad_norm": 0.11869368702173233, "learning_rate": 6.874246204588724e-05, "loss": 1.309, "mean_token_accuracy": 0.7604214429855347, "num_tokens": 1617209190.0, "step": 22500 }, { "entropy": 0.8966589763760566, "epoch": 6.1351866993731266, "grad_norm": 0.1317199319601059, "learning_rate": 6.87146051945948e-05, "loss": 1.3273, "mean_token_accuracy": 0.7514427572488784, "num_tokens": 1617929382.0, "step": 22510 }, { "entropy": 0.8902032285928726, "epoch": 6.1379122376669395, "grad_norm": 0.13315516710281372, "learning_rate": 6.868674158621704e-05, "loss": 1.3204, "mean_token_accuracy": 0.753947240114212, "num_tokens": 1618649219.0, "step": 22520 }, { "entropy": 0.8954225808382035, "epoch": 6.140637775960752, "grad_norm": 0.13436183333396912, "learning_rate": 6.865887123081439e-05, "loss": 1.3166, "mean_token_accuracy": 0.7565888911485672, "num_tokens": 1619389312.0, "step": 22530 }, { "entropy": 0.8795060738921165, "epoch": 6.143363314254565, "grad_norm": 0.13542599976062775, "learning_rate": 6.863099413844966e-05, "loss": 1.3064, "mean_token_accuracy": 0.7552435308694839, "num_tokens": 1620104826.0, "step": 22540 }, { "entropy": 0.8968888089060784, "epoch": 6.146088852548378, "grad_norm": 0.12925991415977478, "learning_rate": 6.860311031918819e-05, "loss": 1.311, "mean_token_accuracy": 0.7561874642968178, "num_tokens": 1620847714.0, "step": 22550 }, { "entropy": 0.8927373275160789, "epoch": 6.148814390842191, "grad_norm": 0.12346458435058594, "learning_rate": 6.857521978309767e-05, "loss": 1.3223, "mean_token_accuracy": 0.7570818364620209, "num_tokens": 1621582588.0, "step": 22560 }, { "entropy": 0.8965425729751587, "epoch": 6.151539929136004, "grad_norm": 0.1410234123468399, "learning_rate": 6.854732254024823e-05, "loss": 1.3303, "mean_token_accuracy": 0.7513458266854286, "num_tokens": 1622294199.0, "step": 22570 }, { "entropy": 0.8883983790874481, "epoch": 6.154265467429817, "grad_norm": 0.1301908940076828, "learning_rate": 6.851941860071247e-05, "loss": 1.3137, "mean_token_accuracy": 0.7528089091181756, "num_tokens": 1623003865.0, "step": 22580 }, { "entropy": 0.8913798347115517, "epoch": 6.15699100572363, "grad_norm": 0.12132018804550171, "learning_rate": 6.849150797456536e-05, "loss": 1.3174, "mean_token_accuracy": 0.7533126696944237, "num_tokens": 1623734066.0, "step": 22590 }, { "entropy": 0.8933842197060585, "epoch": 6.159716544017443, "grad_norm": 0.12742134928703308, "learning_rate": 6.846359067188427e-05, "loss": 1.3193, "mean_token_accuracy": 0.7530615836381912, "num_tokens": 1624455959.0, "step": 22600 }, { "entropy": 0.8866404846310616, "epoch": 6.162442082311257, "grad_norm": 0.13009659945964813, "learning_rate": 6.843566670274903e-05, "loss": 1.3178, "mean_token_accuracy": 0.7511741638183593, "num_tokens": 1625156696.0, "step": 22610 }, { "entropy": 0.8912604719400405, "epoch": 6.16516762060507, "grad_norm": 0.1300330013036728, "learning_rate": 6.840773607724184e-05, "loss": 1.3175, "mean_token_accuracy": 0.7565377578139305, "num_tokens": 1625889918.0, "step": 22620 }, { "entropy": 0.8939005225896836, "epoch": 6.167893158898883, "grad_norm": 0.12857604026794434, "learning_rate": 6.837979880544734e-05, "loss": 1.322, "mean_token_accuracy": 0.7528885453939438, "num_tokens": 1626613661.0, "step": 22630 }, { "entropy": 0.8946500390768051, "epoch": 6.170618697192696, "grad_norm": 0.12966182827949524, "learning_rate": 6.835185489745251e-05, "loss": 1.3176, "mean_token_accuracy": 0.755151455104351, "num_tokens": 1627336842.0, "step": 22640 }, { "entropy": 0.8905218884348869, "epoch": 6.173344235486509, "grad_norm": 0.13915207982063293, "learning_rate": 6.832390436334679e-05, "loss": 1.3141, "mean_token_accuracy": 0.7541632756590844, "num_tokens": 1628056044.0, "step": 22650 }, { "entropy": 0.888375709950924, "epoch": 6.176069773780322, "grad_norm": 0.1322900652885437, "learning_rate": 6.829594721322198e-05, "loss": 1.3194, "mean_token_accuracy": 0.7544383108615875, "num_tokens": 1628772990.0, "step": 22660 }, { "entropy": 0.8861851319670677, "epoch": 6.178795312074135, "grad_norm": 0.12365427613258362, "learning_rate": 6.826798345717227e-05, "loss": 1.3154, "mean_token_accuracy": 0.7540062472224236, "num_tokens": 1629491637.0, "step": 22670 }, { "entropy": 0.8840339452028274, "epoch": 6.1815208503679475, "grad_norm": 0.12385515123605728, "learning_rate": 6.824001310529424e-05, "loss": 1.3083, "mean_token_accuracy": 0.7553656801581383, "num_tokens": 1630209301.0, "step": 22680 }, { "entropy": 0.904748423397541, "epoch": 6.1842463886617605, "grad_norm": 0.11822356283664703, "learning_rate": 6.821203616768685e-05, "loss": 1.3172, "mean_token_accuracy": 0.7522397011518478, "num_tokens": 1630942852.0, "step": 22690 }, { "entropy": 0.8997132733464241, "epoch": 6.186971926955573, "grad_norm": 0.13043208420276642, "learning_rate": 6.818405265445143e-05, "loss": 1.3225, "mean_token_accuracy": 0.7487904891371727, "num_tokens": 1631646181.0, "step": 22700 }, { "entropy": 0.8879512473940849, "epoch": 6.189697465249386, "grad_norm": 0.12371441721916199, "learning_rate": 6.815606257569171e-05, "loss": 1.3124, "mean_token_accuracy": 0.7555837824940681, "num_tokens": 1632373271.0, "step": 22710 }, { "entropy": 0.8926724269986153, "epoch": 6.1924230035432, "grad_norm": 0.1282380223274231, "learning_rate": 6.812806594151377e-05, "loss": 1.3153, "mean_token_accuracy": 0.7546018064022064, "num_tokens": 1633103388.0, "step": 22720 }, { "entropy": 0.8907320380210877, "epoch": 6.195148541837013, "grad_norm": 0.12031175941228867, "learning_rate": 6.810006276202603e-05, "loss": 1.3119, "mean_token_accuracy": 0.7557961121201515, "num_tokens": 1633832517.0, "step": 22730 }, { "entropy": 0.8913863524794579, "epoch": 6.197874080130826, "grad_norm": 0.12618345022201538, "learning_rate": 6.807205304733936e-05, "loss": 1.3171, "mean_token_accuracy": 0.7520734235644341, "num_tokens": 1634544327.0, "step": 22740 }, { "entropy": 0.8889236986637116, "epoch": 6.200599618424639, "grad_norm": 0.1265101432800293, "learning_rate": 6.804403680756687e-05, "loss": 1.3143, "mean_token_accuracy": 0.755327270925045, "num_tokens": 1635271233.0, "step": 22750 }, { "entropy": 0.8882743090391159, "epoch": 6.203325156718452, "grad_norm": 0.12307625263929367, "learning_rate": 6.801601405282412e-05, "loss": 1.3173, "mean_token_accuracy": 0.7541785255074501, "num_tokens": 1635991568.0, "step": 22760 }, { "entropy": 0.8878097742795944, "epoch": 6.206050695012265, "grad_norm": 0.12814800441265106, "learning_rate": 6.7987984793229e-05, "loss": 1.3119, "mean_token_accuracy": 0.7537838399410248, "num_tokens": 1636697369.0, "step": 22770 }, { "entropy": 0.8963440015912056, "epoch": 6.208776233306078, "grad_norm": 0.1348268836736679, "learning_rate": 6.795994903890172e-05, "loss": 1.318, "mean_token_accuracy": 0.7527847737073898, "num_tokens": 1637423328.0, "step": 22780 }, { "entropy": 0.8971793323755264, "epoch": 6.211501771599891, "grad_norm": 0.12599802017211914, "learning_rate": 6.793190679996487e-05, "loss": 1.3183, "mean_token_accuracy": 0.7480891391634941, "num_tokens": 1638136778.0, "step": 22790 }, { "entropy": 0.8978354439139367, "epoch": 6.214227309893704, "grad_norm": 0.11951422691345215, "learning_rate": 6.790385808654334e-05, "loss": 1.329, "mean_token_accuracy": 0.7470620110630989, "num_tokens": 1638845767.0, "step": 22800 }, { "entropy": 0.8890793532133102, "epoch": 6.216952848187517, "grad_norm": 0.14458394050598145, "learning_rate": 6.787580290876441e-05, "loss": 1.3214, "mean_token_accuracy": 0.7524440795183182, "num_tokens": 1639554711.0, "step": 22810 }, { "entropy": 0.8881776869297028, "epoch": 6.21967838648133, "grad_norm": 0.1261187046766281, "learning_rate": 6.784774127675766e-05, "loss": 1.3093, "mean_token_accuracy": 0.7549481615424156, "num_tokens": 1640285285.0, "step": 22820 }, { "entropy": 0.8906338453292847, "epoch": 6.2224039247751435, "grad_norm": 0.1307862251996994, "learning_rate": 6.781967320065501e-05, "loss": 1.3079, "mean_token_accuracy": 0.7568583205342293, "num_tokens": 1641016695.0, "step": 22830 }, { "entropy": 0.8807773485779762, "epoch": 6.225129463068956, "grad_norm": 0.1270526498556137, "learning_rate": 6.77915986905907e-05, "loss": 1.3095, "mean_token_accuracy": 0.7582296550273895, "num_tokens": 1641747377.0, "step": 22840 }, { "entropy": 0.8841337040066719, "epoch": 6.227855001362769, "grad_norm": 0.12727545201778412, "learning_rate": 6.776351775670129e-05, "loss": 1.3074, "mean_token_accuracy": 0.7586832597851754, "num_tokens": 1642474278.0, "step": 22850 }, { "entropy": 0.8928334191441536, "epoch": 6.230580539656582, "grad_norm": 0.12225507199764252, "learning_rate": 6.773543040912569e-05, "loss": 1.321, "mean_token_accuracy": 0.7530438497662544, "num_tokens": 1643185876.0, "step": 22860 }, { "entropy": 0.895265993475914, "epoch": 6.233306077950395, "grad_norm": 0.1776934713125229, "learning_rate": 6.770733665800507e-05, "loss": 1.3236, "mean_token_accuracy": 0.7498766735196114, "num_tokens": 1643890972.0, "step": 22870 }, { "entropy": 0.8864861071109772, "epoch": 6.236031616244208, "grad_norm": 0.12553735077381134, "learning_rate": 6.767923651348297e-05, "loss": 1.3186, "mean_token_accuracy": 0.7555804580450058, "num_tokens": 1644600926.0, "step": 22880 }, { "entropy": 0.8897723659873009, "epoch": 6.238757154538021, "grad_norm": 0.12780770659446716, "learning_rate": 6.765112998570522e-05, "loss": 1.3134, "mean_token_accuracy": 0.7504253312945366, "num_tokens": 1645309227.0, "step": 22890 }, { "entropy": 0.8836939483880997, "epoch": 6.241482692831834, "grad_norm": 0.13114844262599945, "learning_rate": 6.76230170848199e-05, "loss": 1.3151, "mean_token_accuracy": 0.7565981298685074, "num_tokens": 1646027636.0, "step": 22900 }, { "entropy": 0.8949156388640404, "epoch": 6.244208231125647, "grad_norm": 0.12638813257217407, "learning_rate": 6.759489782097749e-05, "loss": 1.3168, "mean_token_accuracy": 0.7493349418044091, "num_tokens": 1646748504.0, "step": 22910 }, { "entropy": 0.8914054661989212, "epoch": 6.24693376941946, "grad_norm": 0.12566597759723663, "learning_rate": 6.756677220433072e-05, "loss": 1.3223, "mean_token_accuracy": 0.7530945912003517, "num_tokens": 1647465546.0, "step": 22920 }, { "entropy": 0.8930309310555458, "epoch": 6.249659307713273, "grad_norm": 0.1308824121952057, "learning_rate": 6.753864024503458e-05, "loss": 1.323, "mean_token_accuracy": 0.7517623871564865, "num_tokens": 1648180371.0, "step": 22930 }, { "entropy": 0.8952459499239922, "epoch": 6.252384846007087, "grad_norm": 0.13122569024562836, "learning_rate": 6.751050195324638e-05, "loss": 1.3199, "mean_token_accuracy": 0.749671746790409, "num_tokens": 1648882516.0, "step": 22940 }, { "entropy": 0.8864050194621086, "epoch": 6.2551103843009, "grad_norm": 0.1290164291858673, "learning_rate": 6.748235733912573e-05, "loss": 1.3116, "mean_token_accuracy": 0.7586789190769195, "num_tokens": 1649608654.0, "step": 22950 }, { "entropy": 0.8909218072891235, "epoch": 6.257835922594713, "grad_norm": 0.12734967470169067, "learning_rate": 6.745420641283449e-05, "loss": 1.3201, "mean_token_accuracy": 0.7540360197424889, "num_tokens": 1650323619.0, "step": 22960 }, { "entropy": 0.894496864080429, "epoch": 6.260561460888526, "grad_norm": 0.11867977678775787, "learning_rate": 6.742604918453684e-05, "loss": 1.3137, "mean_token_accuracy": 0.7555643871426583, "num_tokens": 1651061365.0, "step": 22970 }, { "entropy": 0.8806008353829384, "epoch": 6.2632869991823386, "grad_norm": 0.1332656443119049, "learning_rate": 6.739788566439923e-05, "loss": 1.3198, "mean_token_accuracy": 0.7565188840031624, "num_tokens": 1651776100.0, "step": 22980 }, { "entropy": 0.8906694203615189, "epoch": 6.2660125374761515, "grad_norm": 0.1220070943236351, "learning_rate": 6.736971586259033e-05, "loss": 1.3216, "mean_token_accuracy": 0.7555127948522568, "num_tokens": 1652500151.0, "step": 22990 }, { "entropy": 0.8953827202320099, "epoch": 6.2687380757699644, "grad_norm": 0.1308388113975525, "learning_rate": 6.734153978928111e-05, "loss": 1.3225, "mean_token_accuracy": 0.7522341355681419, "num_tokens": 1653217232.0, "step": 23000 }, { "entropy": 0.8931818947196006, "epoch": 6.271463614063777, "grad_norm": 0.13166120648384094, "learning_rate": 6.731335745464485e-05, "loss": 1.3225, "mean_token_accuracy": 0.7508315578103065, "num_tokens": 1653926371.0, "step": 23010 }, { "entropy": 0.8927141845226287, "epoch": 6.27418915235759, "grad_norm": 0.12071728706359863, "learning_rate": 6.7285168868857e-05, "loss": 1.3139, "mean_token_accuracy": 0.7525391235947609, "num_tokens": 1654653506.0, "step": 23020 }, { "entropy": 0.8891505330801011, "epoch": 6.276914690651403, "grad_norm": 0.13824611902236938, "learning_rate": 6.725697404209535e-05, "loss": 1.3117, "mean_token_accuracy": 0.7533309891819954, "num_tokens": 1655366801.0, "step": 23030 }, { "entropy": 0.8925409883260726, "epoch": 6.279640228945217, "grad_norm": 0.12709136307239532, "learning_rate": 6.722877298453988e-05, "loss": 1.3151, "mean_token_accuracy": 0.7516300871968269, "num_tokens": 1656084379.0, "step": 23040 }, { "entropy": 0.8974668428301811, "epoch": 6.28236576723903, "grad_norm": 0.135416641831398, "learning_rate": 6.720056570637288e-05, "loss": 1.3193, "mean_token_accuracy": 0.7500672295689583, "num_tokens": 1656795900.0, "step": 23050 }, { "entropy": 0.8910537645220756, "epoch": 6.285091305532843, "grad_norm": 0.12810403108596802, "learning_rate": 6.717235221777884e-05, "loss": 1.3158, "mean_token_accuracy": 0.7524344757199287, "num_tokens": 1657517916.0, "step": 23060 }, { "entropy": 0.895925197005272, "epoch": 6.287816843826656, "grad_norm": 0.12679268419742584, "learning_rate": 6.714413252894452e-05, "loss": 1.3199, "mean_token_accuracy": 0.7524157360196113, "num_tokens": 1658236479.0, "step": 23070 }, { "entropy": 0.8970654159784317, "epoch": 6.290542382120469, "grad_norm": 0.12934447824954987, "learning_rate": 6.711590665005887e-05, "loss": 1.3296, "mean_token_accuracy": 0.7537188276648521, "num_tokens": 1658958245.0, "step": 23080 }, { "entropy": 0.8944193720817566, "epoch": 6.293267920414282, "grad_norm": 0.12345714122056961, "learning_rate": 6.708767459131315e-05, "loss": 1.3269, "mean_token_accuracy": 0.7518907606601715, "num_tokens": 1659665312.0, "step": 23090 }, { "entropy": 0.8892689511179924, "epoch": 6.295993458708095, "grad_norm": 0.1303255259990692, "learning_rate": 6.705943636290079e-05, "loss": 1.3227, "mean_token_accuracy": 0.7500828951597214, "num_tokens": 1660368213.0, "step": 23100 }, { "entropy": 0.8863576143980026, "epoch": 6.298718997001908, "grad_norm": 0.12337734550237656, "learning_rate": 6.70311919750175e-05, "loss": 1.3066, "mean_token_accuracy": 0.7597868055105209, "num_tokens": 1661104476.0, "step": 23110 }, { "entropy": 0.8880080595612526, "epoch": 6.301444535295721, "grad_norm": 0.12878258526325226, "learning_rate": 6.700294143786115e-05, "loss": 1.3135, "mean_token_accuracy": 0.7550767511129379, "num_tokens": 1661826814.0, "step": 23120 }, { "entropy": 0.8858757704496384, "epoch": 6.304170073589534, "grad_norm": 0.13227084279060364, "learning_rate": 6.697468476163185e-05, "loss": 1.314, "mean_token_accuracy": 0.7593360260128975, "num_tokens": 1662562879.0, "step": 23130 }, { "entropy": 0.8885963514447213, "epoch": 6.306895611883347, "grad_norm": 0.14592814445495605, "learning_rate": 6.694642195653198e-05, "loss": 1.324, "mean_token_accuracy": 0.7531319305300712, "num_tokens": 1663273635.0, "step": 23140 }, { "entropy": 0.8851574152708054, "epoch": 6.3096211501771595, "grad_norm": 0.13013918697834015, "learning_rate": 6.691815303276608e-05, "loss": 1.3048, "mean_token_accuracy": 0.7523117408156395, "num_tokens": 1663991083.0, "step": 23150 }, { "entropy": 0.8889756724238396, "epoch": 6.312346688470973, "grad_norm": 0.12669463455677032, "learning_rate": 6.68898780005409e-05, "loss": 1.3156, "mean_token_accuracy": 0.7576033070683479, "num_tokens": 1664715614.0, "step": 23160 }, { "entropy": 0.8899347677826881, "epoch": 6.315072226764786, "grad_norm": 0.12626436352729797, "learning_rate": 6.686159687006541e-05, "loss": 1.3224, "mean_token_accuracy": 0.7536514043807984, "num_tokens": 1665445966.0, "step": 23170 }, { "entropy": 0.8888762414455413, "epoch": 6.317797765058599, "grad_norm": 0.12010875344276428, "learning_rate": 6.683330965155081e-05, "loss": 1.3095, "mean_token_accuracy": 0.7526542827486992, "num_tokens": 1666160729.0, "step": 23180 }, { "entropy": 0.8972968846559525, "epoch": 6.320523303352412, "grad_norm": 0.12839588522911072, "learning_rate": 6.680501635521043e-05, "loss": 1.3226, "mean_token_accuracy": 0.7494635313749314, "num_tokens": 1666879523.0, "step": 23190 }, { "entropy": 0.9004280254244804, "epoch": 6.323248841646225, "grad_norm": 0.1343114674091339, "learning_rate": 6.677671699125986e-05, "loss": 1.3275, "mean_token_accuracy": 0.748376627266407, "num_tokens": 1667591974.0, "step": 23200 }, { "entropy": 0.9000216856598854, "epoch": 6.325974379940038, "grad_norm": 0.12477145344018936, "learning_rate": 6.674841156991685e-05, "loss": 1.3271, "mean_token_accuracy": 0.7486219316720962, "num_tokens": 1668299821.0, "step": 23210 }, { "entropy": 0.8939940422773361, "epoch": 6.328699918233851, "grad_norm": 0.1266832947731018, "learning_rate": 6.67201001014013e-05, "loss": 1.3179, "mean_token_accuracy": 0.752446548640728, "num_tokens": 1669024776.0, "step": 23220 }, { "entropy": 0.8983014822006226, "epoch": 6.331425456527664, "grad_norm": 0.1296415477991104, "learning_rate": 6.669178259593538e-05, "loss": 1.3265, "mean_token_accuracy": 0.7508083760738373, "num_tokens": 1669750314.0, "step": 23230 }, { "entropy": 0.8913666635751725, "epoch": 6.334150994821477, "grad_norm": 0.13265082240104675, "learning_rate": 6.666345906374338e-05, "loss": 1.3269, "mean_token_accuracy": 0.7540781378746033, "num_tokens": 1670467847.0, "step": 23240 }, { "entropy": 0.8890855371952057, "epoch": 6.33687653311529, "grad_norm": 0.126531720161438, "learning_rate": 6.663512951505177e-05, "loss": 1.3054, "mean_token_accuracy": 0.7585485383868218, "num_tokens": 1671200568.0, "step": 23250 }, { "entropy": 0.9016404092311859, "epoch": 6.339602071409104, "grad_norm": 0.1255868375301361, "learning_rate": 6.660679396008922e-05, "loss": 1.3323, "mean_token_accuracy": 0.7508169993758201, "num_tokens": 1671915657.0, "step": 23260 }, { "entropy": 0.8987109735608101, "epoch": 6.342327609702917, "grad_norm": 0.14064787328243256, "learning_rate": 6.657845240908654e-05, "loss": 1.3177, "mean_token_accuracy": 0.7515898689627647, "num_tokens": 1672622573.0, "step": 23270 }, { "entropy": 0.8917651459574699, "epoch": 6.34505314799673, "grad_norm": 0.12363500893115997, "learning_rate": 6.655010487227671e-05, "loss": 1.3151, "mean_token_accuracy": 0.7533663526177407, "num_tokens": 1673335813.0, "step": 23280 }, { "entropy": 0.8902298092842102, "epoch": 6.3477786862905425, "grad_norm": 0.13857240974903107, "learning_rate": 6.652175135989487e-05, "loss": 1.3145, "mean_token_accuracy": 0.7535278961062432, "num_tokens": 1674046266.0, "step": 23290 }, { "entropy": 0.8870541349053382, "epoch": 6.3505042245843555, "grad_norm": 0.15220853686332703, "learning_rate": 6.649339188217836e-05, "loss": 1.3048, "mean_token_accuracy": 0.7575495153665542, "num_tokens": 1674767492.0, "step": 23300 }, { "entropy": 0.8958998307585716, "epoch": 6.353229762878168, "grad_norm": 0.12492650747299194, "learning_rate": 6.646502644936659e-05, "loss": 1.3169, "mean_token_accuracy": 0.7527160704135895, "num_tokens": 1675501332.0, "step": 23310 }, { "entropy": 0.8936477765440941, "epoch": 6.355955301171981, "grad_norm": 0.13287654519081116, "learning_rate": 6.64366550717012e-05, "loss": 1.313, "mean_token_accuracy": 0.7562225490808487, "num_tokens": 1676238175.0, "step": 23320 }, { "entropy": 0.8891023188829422, "epoch": 6.358680839465794, "grad_norm": 0.13067872822284698, "learning_rate": 6.640827775942595e-05, "loss": 1.3143, "mean_token_accuracy": 0.7531682774424553, "num_tokens": 1676959889.0, "step": 23330 }, { "entropy": 0.8914091661572456, "epoch": 6.361406377759607, "grad_norm": 0.1234472244977951, "learning_rate": 6.63798945227867e-05, "loss": 1.3227, "mean_token_accuracy": 0.7489127948880195, "num_tokens": 1677665496.0, "step": 23340 }, { "entropy": 0.8856423974037171, "epoch": 6.36413191605342, "grad_norm": 0.13285700976848602, "learning_rate": 6.635150537203152e-05, "loss": 1.3144, "mean_token_accuracy": 0.7498030632734298, "num_tokens": 1678366349.0, "step": 23350 }, { "entropy": 0.8926140740513802, "epoch": 6.366857454347233, "grad_norm": 0.12738476693630219, "learning_rate": 6.632311031741057e-05, "loss": 1.3163, "mean_token_accuracy": 0.7527148187160492, "num_tokens": 1679081477.0, "step": 23360 }, { "entropy": 0.8965121746063233, "epoch": 6.369582992641047, "grad_norm": 0.12689495086669922, "learning_rate": 6.629470936917615e-05, "loss": 1.3299, "mean_token_accuracy": 0.7492060095071793, "num_tokens": 1679790276.0, "step": 23370 }, { "entropy": 0.8893764913082123, "epoch": 6.37230853093486, "grad_norm": 0.12410731613636017, "learning_rate": 6.62663025375827e-05, "loss": 1.3098, "mean_token_accuracy": 0.74893439412117, "num_tokens": 1680495360.0, "step": 23380 }, { "entropy": 0.8907683804631233, "epoch": 6.375034069228673, "grad_norm": 0.13427311182022095, "learning_rate": 6.623788983288677e-05, "loss": 1.3198, "mean_token_accuracy": 0.754366135597229, "num_tokens": 1681219401.0, "step": 23390 }, { "entropy": 0.896857637166977, "epoch": 6.377759607522486, "grad_norm": 0.12843424081802368, "learning_rate": 6.620947126534703e-05, "loss": 1.3208, "mean_token_accuracy": 0.7514572486281395, "num_tokens": 1681936126.0, "step": 23400 }, { "entropy": 0.8925153493881226, "epoch": 6.380485145816299, "grad_norm": 0.1244444027543068, "learning_rate": 6.618104684522428e-05, "loss": 1.3274, "mean_token_accuracy": 0.7482243925333023, "num_tokens": 1682636547.0, "step": 23410 }, { "entropy": 0.8861335068941116, "epoch": 6.383210684110112, "grad_norm": 0.142676442861557, "learning_rate": 6.615261658278144e-05, "loss": 1.3196, "mean_token_accuracy": 0.7547627225518226, "num_tokens": 1683340915.0, "step": 23420 }, { "entropy": 0.8925488859415054, "epoch": 6.385936222403925, "grad_norm": 0.12367556244134903, "learning_rate": 6.612418048828349e-05, "loss": 1.3169, "mean_token_accuracy": 0.7496591046452522, "num_tokens": 1684046546.0, "step": 23430 }, { "entropy": 0.8861442267894745, "epoch": 6.388661760697738, "grad_norm": 0.13329732418060303, "learning_rate": 6.609573857199758e-05, "loss": 1.3137, "mean_token_accuracy": 0.753875145316124, "num_tokens": 1684753967.0, "step": 23440 }, { "entropy": 0.8948607563972473, "epoch": 6.391387298991551, "grad_norm": 0.13758523762226105, "learning_rate": 6.606729084419293e-05, "loss": 1.3259, "mean_token_accuracy": 0.7501895040273666, "num_tokens": 1685458624.0, "step": 23450 }, { "entropy": 0.8905760660767555, "epoch": 6.3941128372853635, "grad_norm": 0.13088218867778778, "learning_rate": 6.603883731514084e-05, "loss": 1.3139, "mean_token_accuracy": 0.7591215088963509, "num_tokens": 1686191114.0, "step": 23460 }, { "entropy": 0.8919359445571899, "epoch": 6.396838375579177, "grad_norm": 0.13223186135292053, "learning_rate": 6.601037799511474e-05, "loss": 1.3256, "mean_token_accuracy": 0.7524249017238617, "num_tokens": 1686898721.0, "step": 23470 }, { "entropy": 0.8904221951961517, "epoch": 6.39956391387299, "grad_norm": 0.12571395933628082, "learning_rate": 6.598191289439016e-05, "loss": 1.3139, "mean_token_accuracy": 0.7535535246133804, "num_tokens": 1687611162.0, "step": 23480 }, { "entropy": 0.8901495292782784, "epoch": 6.402289452166803, "grad_norm": 0.13453614711761475, "learning_rate": 6.595344202324468e-05, "loss": 1.3244, "mean_token_accuracy": 0.7533126056194306, "num_tokens": 1688325875.0, "step": 23490 }, { "entropy": 0.8958468347787857, "epoch": 6.405014990460616, "grad_norm": 0.1318880021572113, "learning_rate": 6.592496539195794e-05, "loss": 1.325, "mean_token_accuracy": 0.7493641376495361, "num_tokens": 1689030804.0, "step": 23500 }, { "entropy": 0.8912514030933381, "epoch": 6.407740528754429, "grad_norm": 0.13106226921081543, "learning_rate": 6.589648301081173e-05, "loss": 1.3185, "mean_token_accuracy": 0.7552205622196198, "num_tokens": 1689761757.0, "step": 23510 }, { "entropy": 0.8896019339561463, "epoch": 6.410466067048242, "grad_norm": 0.1246907114982605, "learning_rate": 6.586799489008988e-05, "loss": 1.3131, "mean_token_accuracy": 0.7572718515992165, "num_tokens": 1690498781.0, "step": 23520 }, { "entropy": 0.8915984958410264, "epoch": 6.413191605342055, "grad_norm": 0.13249586522579193, "learning_rate": 6.58395010400783e-05, "loss": 1.312, "mean_token_accuracy": 0.7548464789986611, "num_tokens": 1691226504.0, "step": 23530 }, { "entropy": 0.8985194623470306, "epoch": 6.415917143635868, "grad_norm": 0.12803570926189423, "learning_rate": 6.581100147106498e-05, "loss": 1.3178, "mean_token_accuracy": 0.755246813595295, "num_tokens": 1691964479.0, "step": 23540 }, { "entropy": 0.8917974069714546, "epoch": 6.418642681929681, "grad_norm": 0.13058391213417053, "learning_rate": 6.578249619333992e-05, "loss": 1.3173, "mean_token_accuracy": 0.7533485591411591, "num_tokens": 1692680451.0, "step": 23550 }, { "entropy": 0.889213714003563, "epoch": 6.421368220223494, "grad_norm": 0.1276865452528, "learning_rate": 6.575398521719525e-05, "loss": 1.3171, "mean_token_accuracy": 0.753696845471859, "num_tokens": 1693391615.0, "step": 23560 }, { "entropy": 0.8873524084687233, "epoch": 6.424093758517307, "grad_norm": 0.1355648934841156, "learning_rate": 6.572546855292511e-05, "loss": 1.3178, "mean_token_accuracy": 0.7564250737428665, "num_tokens": 1694103861.0, "step": 23570 }, { "entropy": 0.889432792365551, "epoch": 6.42681929681112, "grad_norm": 0.1281968355178833, "learning_rate": 6.569694621082572e-05, "loss": 1.3159, "mean_token_accuracy": 0.7529659688472747, "num_tokens": 1694821987.0, "step": 23580 }, { "entropy": 0.8942313596606255, "epoch": 6.429544835104934, "grad_norm": 0.13217511773109436, "learning_rate": 6.566841820119534e-05, "loss": 1.3156, "mean_token_accuracy": 0.7584445595741272, "num_tokens": 1695555333.0, "step": 23590 }, { "entropy": 0.8878136515617371, "epoch": 6.4322703733987465, "grad_norm": 0.15396036207675934, "learning_rate": 6.563988453433429e-05, "loss": 1.3119, "mean_token_accuracy": 0.7593174755573273, "num_tokens": 1696294307.0, "step": 23600 }, { "entropy": 0.8902526319026947, "epoch": 6.4349959116925595, "grad_norm": 0.12914952635765076, "learning_rate": 6.561134522054488e-05, "loss": 1.3163, "mean_token_accuracy": 0.7554532706737518, "num_tokens": 1697025205.0, "step": 23610 }, { "entropy": 0.8902714803814888, "epoch": 6.437721449986372, "grad_norm": 0.12394432723522186, "learning_rate": 6.558280027013154e-05, "loss": 1.3202, "mean_token_accuracy": 0.7533359780907631, "num_tokens": 1697746596.0, "step": 23620 }, { "entropy": 0.9008207753300667, "epoch": 6.440446988280185, "grad_norm": 0.11941054463386536, "learning_rate": 6.555424969340071e-05, "loss": 1.3303, "mean_token_accuracy": 0.7471015900373459, "num_tokens": 1698454352.0, "step": 23630 }, { "entropy": 0.8937665760517121, "epoch": 6.443172526573998, "grad_norm": 0.1217990517616272, "learning_rate": 6.55256935006608e-05, "loss": 1.3055, "mean_token_accuracy": 0.750526025891304, "num_tokens": 1699170833.0, "step": 23640 }, { "entropy": 0.8947145149111748, "epoch": 6.445898064867811, "grad_norm": 0.17192257940769196, "learning_rate": 6.54971317022223e-05, "loss": 1.3328, "mean_token_accuracy": 0.7513601586222649, "num_tokens": 1699883942.0, "step": 23650 }, { "entropy": 0.9000633776187896, "epoch": 6.448623603161624, "grad_norm": 0.12901583313941956, "learning_rate": 6.546856430839776e-05, "loss": 1.3234, "mean_token_accuracy": 0.7515505746006965, "num_tokens": 1700602474.0, "step": 23660 }, { "entropy": 0.8940084531903267, "epoch": 6.451349141455437, "grad_norm": 0.14255863428115845, "learning_rate": 6.543999132950165e-05, "loss": 1.3258, "mean_token_accuracy": 0.7506169125437736, "num_tokens": 1701309757.0, "step": 23670 }, { "entropy": 0.8904284313321114, "epoch": 6.45407467974925, "grad_norm": 0.14267265796661377, "learning_rate": 6.541141277585054e-05, "loss": 1.3157, "mean_token_accuracy": 0.754489229619503, "num_tokens": 1702031621.0, "step": 23680 }, { "entropy": 0.8959540873765945, "epoch": 6.456800218043064, "grad_norm": 0.13613547384738922, "learning_rate": 6.5382828657763e-05, "loss": 1.3227, "mean_token_accuracy": 0.75272366553545, "num_tokens": 1702753239.0, "step": 23690 }, { "entropy": 0.8928972169756889, "epoch": 6.459525756336877, "grad_norm": 0.12474264949560165, "learning_rate": 6.535423898555958e-05, "loss": 1.3129, "mean_token_accuracy": 0.754960723221302, "num_tokens": 1703474389.0, "step": 23700 }, { "entropy": 0.8876286342740058, "epoch": 6.46225129463069, "grad_norm": 0.12610182166099548, "learning_rate": 6.532564376956289e-05, "loss": 1.3154, "mean_token_accuracy": 0.7527513980865479, "num_tokens": 1704188643.0, "step": 23710 }, { "entropy": 0.8942540109157562, "epoch": 6.464976832924503, "grad_norm": 0.13448436558246613, "learning_rate": 6.529704302009743e-05, "loss": 1.3208, "mean_token_accuracy": 0.7528475806117058, "num_tokens": 1704915281.0, "step": 23720 }, { "entropy": 0.892904594540596, "epoch": 6.467702371218316, "grad_norm": 0.12359185516834259, "learning_rate": 6.526843674748983e-05, "loss": 1.3204, "mean_token_accuracy": 0.7529234677553177, "num_tokens": 1705641134.0, "step": 23730 }, { "entropy": 0.895223182439804, "epoch": 6.470427909512129, "grad_norm": 0.13306471705436707, "learning_rate": 6.523982496206863e-05, "loss": 1.3143, "mean_token_accuracy": 0.751647324860096, "num_tokens": 1706364710.0, "step": 23740 }, { "entropy": 0.8945942804217338, "epoch": 6.473153447805942, "grad_norm": 0.13376927375793457, "learning_rate": 6.52112076741644e-05, "loss": 1.3173, "mean_token_accuracy": 0.7524019733071328, "num_tokens": 1707091616.0, "step": 23750 }, { "entropy": 0.8862835958600044, "epoch": 6.4758789860997545, "grad_norm": 0.13562124967575073, "learning_rate": 6.518258489410967e-05, "loss": 1.3113, "mean_token_accuracy": 0.757615952193737, "num_tokens": 1707810977.0, "step": 23760 }, { "entropy": 0.8875472873449326, "epoch": 6.4786045243935675, "grad_norm": 0.12648871541023254, "learning_rate": 6.515395663223898e-05, "loss": 1.3166, "mean_token_accuracy": 0.7528648927807808, "num_tokens": 1708514829.0, "step": 23770 }, { "entropy": 0.8876741334795952, "epoch": 6.48133006268738, "grad_norm": 0.1349627673625946, "learning_rate": 6.512532289888882e-05, "loss": 1.3091, "mean_token_accuracy": 0.7556482389569282, "num_tokens": 1709245361.0, "step": 23780 }, { "entropy": 0.8908647835254669, "epoch": 6.484055600981193, "grad_norm": 0.12928390502929688, "learning_rate": 6.509668370439768e-05, "loss": 1.3178, "mean_token_accuracy": 0.7556312114000321, "num_tokens": 1709976801.0, "step": 23790 }, { "entropy": 0.8940265402197838, "epoch": 6.486781139275007, "grad_norm": 0.12529900670051575, "learning_rate": 6.506803905910603e-05, "loss": 1.3191, "mean_token_accuracy": 0.7518533378839493, "num_tokens": 1710686925.0, "step": 23800 }, { "entropy": 0.8857969135046005, "epoch": 6.48950667756882, "grad_norm": 0.1354072242975235, "learning_rate": 6.503938897335624e-05, "loss": 1.3156, "mean_token_accuracy": 0.755453372001648, "num_tokens": 1711400865.0, "step": 23810 }, { "entropy": 0.8843122676014901, "epoch": 6.492232215862633, "grad_norm": 0.12267336249351501, "learning_rate": 6.501073345749273e-05, "loss": 1.3061, "mean_token_accuracy": 0.7538071915507316, "num_tokens": 1712128288.0, "step": 23820 }, { "entropy": 0.8946838319301605, "epoch": 6.494957754156446, "grad_norm": 0.125118687748909, "learning_rate": 6.498207252186184e-05, "loss": 1.3199, "mean_token_accuracy": 0.7512657254934311, "num_tokens": 1712849010.0, "step": 23830 }, { "entropy": 0.8896793156862259, "epoch": 6.497683292450259, "grad_norm": 0.13046804070472717, "learning_rate": 6.495340617681188e-05, "loss": 1.3123, "mean_token_accuracy": 0.7554600208997726, "num_tokens": 1713573289.0, "step": 23840 }, { "entropy": 0.8903471857309342, "epoch": 6.500408830744072, "grad_norm": 0.14014749228954315, "learning_rate": 6.492473443269309e-05, "loss": 1.3121, "mean_token_accuracy": 0.7567742720246315, "num_tokens": 1714305119.0, "step": 23850 }, { "entropy": 0.8933516576886177, "epoch": 6.503134369037885, "grad_norm": 0.1295813024044037, "learning_rate": 6.48960572998577e-05, "loss": 1.3305, "mean_token_accuracy": 0.7485965028405189, "num_tokens": 1715010500.0, "step": 23860 }, { "entropy": 0.897659121453762, "epoch": 6.505859907331698, "grad_norm": 0.13633602857589722, "learning_rate": 6.486737478865982e-05, "loss": 1.3205, "mean_token_accuracy": 0.7503689274191856, "num_tokens": 1715724001.0, "step": 23870 }, { "entropy": 0.8984023123979569, "epoch": 6.508585445625511, "grad_norm": 0.13099007308483124, "learning_rate": 6.483868690945558e-05, "loss": 1.3235, "mean_token_accuracy": 0.7546491786837578, "num_tokens": 1716459393.0, "step": 23880 }, { "entropy": 0.8881630569696426, "epoch": 6.511310983919324, "grad_norm": 0.12748360633850098, "learning_rate": 6.480999367260298e-05, "loss": 1.3122, "mean_token_accuracy": 0.75551338493824, "num_tokens": 1717181110.0, "step": 23890 }, { "entropy": 0.8861339643597603, "epoch": 6.514036522213138, "grad_norm": 0.13338781893253326, "learning_rate": 6.4781295088462e-05, "loss": 1.3168, "mean_token_accuracy": 0.7524291262030601, "num_tokens": 1717882430.0, "step": 23900 }, { "entropy": 0.8883640363812446, "epoch": 6.5167620605069505, "grad_norm": 0.1292986422777176, "learning_rate": 6.475259116739454e-05, "loss": 1.3172, "mean_token_accuracy": 0.7540691047906876, "num_tokens": 1718593758.0, "step": 23910 }, { "entropy": 0.8899330779910087, "epoch": 6.5194875988007635, "grad_norm": 0.13770543038845062, "learning_rate": 6.472388191976441e-05, "loss": 1.317, "mean_token_accuracy": 0.7589975893497467, "num_tokens": 1719328185.0, "step": 23920 }, { "entropy": 0.8917457908391953, "epoch": 6.522213137094576, "grad_norm": 0.13328559696674347, "learning_rate": 6.469516735593737e-05, "loss": 1.318, "mean_token_accuracy": 0.7550568327307701, "num_tokens": 1720048314.0, "step": 23930 }, { "entropy": 0.8939030185341835, "epoch": 6.524938675388389, "grad_norm": 0.1289254128932953, "learning_rate": 6.466644748628107e-05, "loss": 1.3258, "mean_token_accuracy": 0.7536257997155189, "num_tokens": 1720756720.0, "step": 23940 }, { "entropy": 0.8894197911024093, "epoch": 6.527664213682202, "grad_norm": 0.1329088807106018, "learning_rate": 6.46377223211651e-05, "loss": 1.3161, "mean_token_accuracy": 0.7506936267018318, "num_tokens": 1721465576.0, "step": 23950 }, { "entropy": 0.8965966418385506, "epoch": 6.530389751976015, "grad_norm": 0.1288381814956665, "learning_rate": 6.460899187096095e-05, "loss": 1.3187, "mean_token_accuracy": 0.7482483148574829, "num_tokens": 1722179925.0, "step": 23960 }, { "entropy": 0.8917963176965713, "epoch": 6.533115290269828, "grad_norm": 0.12459111958742142, "learning_rate": 6.458025614604203e-05, "loss": 1.3103, "mean_token_accuracy": 0.7549076959490776, "num_tokens": 1722908032.0, "step": 23970 }, { "entropy": 0.8876068472862244, "epoch": 6.535840828563641, "grad_norm": 0.1401968002319336, "learning_rate": 6.455151515678363e-05, "loss": 1.3027, "mean_token_accuracy": 0.7560511589050293, "num_tokens": 1723631293.0, "step": 23980 }, { "entropy": 0.8865098312497139, "epoch": 6.538566366857454, "grad_norm": 0.12456918507814407, "learning_rate": 6.452276891356295e-05, "loss": 1.3125, "mean_token_accuracy": 0.7547439321875572, "num_tokens": 1724347625.0, "step": 23990 }, { "entropy": 0.8943420633673668, "epoch": 6.541291905151267, "grad_norm": 0.12663772702217102, "learning_rate": 6.449401742675913e-05, "loss": 1.3256, "mean_token_accuracy": 0.7505205154418946, "num_tokens": 1725053248.0, "step": 24000 }, { "entropy": 0.8970868140459061, "epoch": 6.54401744344508, "grad_norm": 0.12651976943016052, "learning_rate": 6.446526070675314e-05, "loss": 1.3213, "mean_token_accuracy": 0.7507851839065551, "num_tokens": 1725774801.0, "step": 24010 }, { "entropy": 0.8989195540547371, "epoch": 6.546742981738894, "grad_norm": 0.13023047149181366, "learning_rate": 6.443649876392785e-05, "loss": 1.3281, "mean_token_accuracy": 0.7508052751421929, "num_tokens": 1726487268.0, "step": 24020 }, { "entropy": 0.8936064541339874, "epoch": 6.549468520032707, "grad_norm": 0.13014456629753113, "learning_rate": 6.440773160866807e-05, "loss": 1.3149, "mean_token_accuracy": 0.7517767742276191, "num_tokens": 1727216659.0, "step": 24030 }, { "entropy": 0.8856271132826805, "epoch": 6.55219405832652, "grad_norm": 0.13365373015403748, "learning_rate": 6.437895925136043e-05, "loss": 1.3129, "mean_token_accuracy": 0.7560368105769157, "num_tokens": 1727943823.0, "step": 24040 }, { "entropy": 0.8843535616993904, "epoch": 6.554919596620333, "grad_norm": 0.12778621912002563, "learning_rate": 6.435018170239345e-05, "loss": 1.3056, "mean_token_accuracy": 0.75809406042099, "num_tokens": 1728669551.0, "step": 24050 }, { "entropy": 0.8948861703276634, "epoch": 6.557645134914146, "grad_norm": 0.130461186170578, "learning_rate": 6.432139897215757e-05, "loss": 1.317, "mean_token_accuracy": 0.7529885828495025, "num_tokens": 1729389158.0, "step": 24060 }, { "entropy": 0.8886276677250862, "epoch": 6.5603706732079585, "grad_norm": 0.13357917964458466, "learning_rate": 6.429261107104506e-05, "loss": 1.3154, "mean_token_accuracy": 0.7550659969449043, "num_tokens": 1730105326.0, "step": 24070 }, { "entropy": 0.8856066077947616, "epoch": 6.5630962115017715, "grad_norm": 0.12202835828065872, "learning_rate": 6.426381800945003e-05, "loss": 1.322, "mean_token_accuracy": 0.7514744594693183, "num_tokens": 1730810191.0, "step": 24080 }, { "entropy": 0.8879060074687004, "epoch": 6.565821749795584, "grad_norm": 0.1253044158220291, "learning_rate": 6.423501979776851e-05, "loss": 1.3161, "mean_token_accuracy": 0.7507121905684471, "num_tokens": 1731515682.0, "step": 24090 }, { "entropy": 0.8891847297549248, "epoch": 6.568547288089397, "grad_norm": 0.13624908030033112, "learning_rate": 6.420621644639838e-05, "loss": 1.3143, "mean_token_accuracy": 0.7506772324442863, "num_tokens": 1732224391.0, "step": 24100 }, { "entropy": 0.8838733717799186, "epoch": 6.57127282638321, "grad_norm": 0.13081113994121552, "learning_rate": 6.417740796573935e-05, "loss": 1.3093, "mean_token_accuracy": 0.7561607211828232, "num_tokens": 1732948736.0, "step": 24110 }, { "entropy": 0.8956152871251106, "epoch": 6.573998364677024, "grad_norm": 0.11970707774162292, "learning_rate": 6.414859436619299e-05, "loss": 1.3265, "mean_token_accuracy": 0.7495107665657997, "num_tokens": 1733662862.0, "step": 24120 }, { "entropy": 0.8898704186081886, "epoch": 6.576723902970837, "grad_norm": 0.22617320716381073, "learning_rate": 6.411977565816274e-05, "loss": 1.3127, "mean_token_accuracy": 0.7540691748261452, "num_tokens": 1734386723.0, "step": 24130 }, { "entropy": 0.8996606901288032, "epoch": 6.57944944126465, "grad_norm": 0.13188959658145905, "learning_rate": 6.409095185205385e-05, "loss": 1.3279, "mean_token_accuracy": 0.7504490211606025, "num_tokens": 1735107352.0, "step": 24140 }, { "entropy": 0.8828933015465736, "epoch": 6.582174979558463, "grad_norm": 0.12779057025909424, "learning_rate": 6.406212295827342e-05, "loss": 1.3121, "mean_token_accuracy": 0.7595152884721756, "num_tokens": 1735836339.0, "step": 24150 }, { "entropy": 0.8865995883941651, "epoch": 6.584900517852276, "grad_norm": 0.13406582176685333, "learning_rate": 6.403328898723043e-05, "loss": 1.3055, "mean_token_accuracy": 0.7550941169261932, "num_tokens": 1736557165.0, "step": 24160 }, { "entropy": 0.8959143862128258, "epoch": 6.587626056146089, "grad_norm": 0.12159795314073563, "learning_rate": 6.400444994933562e-05, "loss": 1.3164, "mean_token_accuracy": 0.7527622133493423, "num_tokens": 1737283974.0, "step": 24170 }, { "entropy": 0.8952702283859253, "epoch": 6.590351594439902, "grad_norm": 0.1343999058008194, "learning_rate": 6.397560585500162e-05, "loss": 1.3241, "mean_token_accuracy": 0.7504002094268799, "num_tokens": 1737995468.0, "step": 24180 }, { "entropy": 0.880812081694603, "epoch": 6.593077132733715, "grad_norm": 0.12571381032466888, "learning_rate": 6.394675671464285e-05, "loss": 1.3063, "mean_token_accuracy": 0.7595406115055084, "num_tokens": 1738737475.0, "step": 24190 }, { "entropy": 0.8856984466314316, "epoch": 6.595802671027528, "grad_norm": 0.12951508164405823, "learning_rate": 6.391790253867558e-05, "loss": 1.3019, "mean_token_accuracy": 0.7567184373736382, "num_tokens": 1739467299.0, "step": 24200 }, { "entropy": 0.8935243427753449, "epoch": 6.598528209321341, "grad_norm": 0.11822971701622009, "learning_rate": 6.388904333751787e-05, "loss": 1.3149, "mean_token_accuracy": 0.7509625971317291, "num_tokens": 1740182846.0, "step": 24210 }, { "entropy": 0.885768061876297, "epoch": 6.601253747615154, "grad_norm": 0.12649142742156982, "learning_rate": 6.386017912158962e-05, "loss": 1.3177, "mean_token_accuracy": 0.756460054218769, "num_tokens": 1740913451.0, "step": 24220 }, { "entropy": 0.8956640034914016, "epoch": 6.6039792859089665, "grad_norm": 0.13004878163337708, "learning_rate": 6.383130990131252e-05, "loss": 1.3257, "mean_token_accuracy": 0.7497450560331345, "num_tokens": 1741622837.0, "step": 24230 }, { "entropy": 0.8826272994279861, "epoch": 6.60670482420278, "grad_norm": 0.12117267400026321, "learning_rate": 6.380243568711006e-05, "loss": 1.3083, "mean_token_accuracy": 0.7582021147012711, "num_tokens": 1742351492.0, "step": 24240 }, { "entropy": 0.8956345677375793, "epoch": 6.609430362496593, "grad_norm": 0.1367512345314026, "learning_rate": 6.377355648940759e-05, "loss": 1.3223, "mean_token_accuracy": 0.7494165197014808, "num_tokens": 1743053734.0, "step": 24250 }, { "entropy": 0.8893290594220161, "epoch": 6.612155900790406, "grad_norm": 0.12484463304281235, "learning_rate": 6.37446723186322e-05, "loss": 1.3049, "mean_token_accuracy": 0.7561960011720658, "num_tokens": 1743783093.0, "step": 24260 }, { "entropy": 0.893658597767353, "epoch": 6.614881439084219, "grad_norm": 0.12526802718639374, "learning_rate": 6.371578318521275e-05, "loss": 1.312, "mean_token_accuracy": 0.7512623444199562, "num_tokens": 1744503404.0, "step": 24270 }, { "entropy": 0.8851838201284409, "epoch": 6.617606977378032, "grad_norm": 0.14824999868869781, "learning_rate": 6.368688909958001e-05, "loss": 1.3101, "mean_token_accuracy": 0.7554869264364242, "num_tokens": 1745213421.0, "step": 24280 }, { "entropy": 0.8950522854924202, "epoch": 6.620332515671845, "grad_norm": 0.13106846809387207, "learning_rate": 6.36579900721664e-05, "loss": 1.327, "mean_token_accuracy": 0.7499068573117256, "num_tokens": 1745925812.0, "step": 24290 }, { "entropy": 0.8931015208363533, "epoch": 6.623058053965658, "grad_norm": 0.12991878390312195, "learning_rate": 6.362908611340621e-05, "loss": 1.3193, "mean_token_accuracy": 0.752657313644886, "num_tokens": 1746653727.0, "step": 24300 }, { "entropy": 0.8938193216919899, "epoch": 6.625783592259471, "grad_norm": 0.12958885729312897, "learning_rate": 6.36001772337355e-05, "loss": 1.32, "mean_token_accuracy": 0.7505113437771798, "num_tokens": 1747360152.0, "step": 24310 }, { "entropy": 0.8950100347399712, "epoch": 6.628509130553284, "grad_norm": 0.11723659932613373, "learning_rate": 6.357126344359209e-05, "loss": 1.3208, "mean_token_accuracy": 0.7511440187692642, "num_tokens": 1748084047.0, "step": 24320 }, { "entropy": 0.8897304311394691, "epoch": 6.631234668847098, "grad_norm": 0.1372891217470169, "learning_rate": 6.354234475341556e-05, "loss": 1.3188, "mean_token_accuracy": 0.7515660494565963, "num_tokens": 1748790112.0, "step": 24330 }, { "entropy": 0.8884767234325409, "epoch": 6.633960207140911, "grad_norm": 0.12608219683170319, "learning_rate": 6.35134211736473e-05, "loss": 1.3138, "mean_token_accuracy": 0.7541348546743393, "num_tokens": 1749507751.0, "step": 24340 }, { "entropy": 0.8946855247020722, "epoch": 6.636685745434724, "grad_norm": 0.12446733564138412, "learning_rate": 6.348449271473042e-05, "loss": 1.3181, "mean_token_accuracy": 0.7499898329377175, "num_tokens": 1750216543.0, "step": 24350 }, { "entropy": 0.8841793164610863, "epoch": 6.639411283728537, "grad_norm": 0.13644251227378845, "learning_rate": 6.345555938710982e-05, "loss": 1.3087, "mean_token_accuracy": 0.7546942919492722, "num_tokens": 1750928991.0, "step": 24360 }, { "entropy": 0.8819687396287919, "epoch": 6.64213682202235, "grad_norm": 0.13751031458377838, "learning_rate": 6.342662120123218e-05, "loss": 1.318, "mean_token_accuracy": 0.7530433446168899, "num_tokens": 1751630163.0, "step": 24370 }, { "entropy": 0.8908970817923546, "epoch": 6.6448623603161625, "grad_norm": 0.12846535444259644, "learning_rate": 6.339767816754585e-05, "loss": 1.317, "mean_token_accuracy": 0.7512157216668129, "num_tokens": 1752349451.0, "step": 24380 }, { "entropy": 0.895119409263134, "epoch": 6.6475878986099755, "grad_norm": 0.13087886571884155, "learning_rate": 6.336873029650104e-05, "loss": 1.3154, "mean_token_accuracy": 0.7545461416244507, "num_tokens": 1753086086.0, "step": 24390 }, { "entropy": 0.8943515375256539, "epoch": 6.650313436903788, "grad_norm": 0.1285870373249054, "learning_rate": 6.333977759854962e-05, "loss": 1.3122, "mean_token_accuracy": 0.7522528052330018, "num_tokens": 1753811823.0, "step": 24400 }, { "entropy": 0.8933129757642746, "epoch": 6.653038975197601, "grad_norm": 0.1275702714920044, "learning_rate": 6.331082008414525e-05, "loss": 1.3158, "mean_token_accuracy": 0.7519129410386085, "num_tokens": 1754536761.0, "step": 24410 }, { "entropy": 0.8880542337894439, "epoch": 6.655764513491414, "grad_norm": 0.12732753157615662, "learning_rate": 6.328185776374331e-05, "loss": 1.3131, "mean_token_accuracy": 0.7550013184547424, "num_tokens": 1755250630.0, "step": 24420 }, { "entropy": 0.8821530431509018, "epoch": 6.658490051785227, "grad_norm": 0.12260854989290237, "learning_rate": 6.325289064780094e-05, "loss": 1.3143, "mean_token_accuracy": 0.752858467400074, "num_tokens": 1755956287.0, "step": 24430 }, { "entropy": 0.8928753837943078, "epoch": 6.66121559007904, "grad_norm": 0.27121585607528687, "learning_rate": 6.322391874677695e-05, "loss": 1.3188, "mean_token_accuracy": 0.7530712425708771, "num_tokens": 1756682135.0, "step": 24440 }, { "entropy": 0.8917052865028381, "epoch": 6.663941128372854, "grad_norm": 0.12325097620487213, "learning_rate": 6.319494207113195e-05, "loss": 1.3142, "mean_token_accuracy": 0.7508950963616371, "num_tokens": 1757395883.0, "step": 24450 }, { "entropy": 0.8906190350651741, "epoch": 6.666666666666667, "grad_norm": 0.12949134409427643, "learning_rate": 6.316596063132822e-05, "loss": 1.319, "mean_token_accuracy": 0.7552656531333923, "num_tokens": 1758120405.0, "step": 24460 }, { "entropy": 0.8926933661103249, "epoch": 6.66939220496048, "grad_norm": 0.12961310148239136, "learning_rate": 6.313697443782982e-05, "loss": 1.322, "mean_token_accuracy": 0.7506764069199562, "num_tokens": 1758828318.0, "step": 24470 }, { "entropy": 0.8932582020759583, "epoch": 6.672117743254293, "grad_norm": 0.1281840056180954, "learning_rate": 6.310798350110246e-05, "loss": 1.319, "mean_token_accuracy": 0.7502627789974212, "num_tokens": 1759532559.0, "step": 24480 }, { "entropy": 0.8890052795410156, "epoch": 6.674843281548106, "grad_norm": 0.1319226175546646, "learning_rate": 6.30789878316136e-05, "loss": 1.3175, "mean_token_accuracy": 0.7541633531451225, "num_tokens": 1760243785.0, "step": 24490 }, { "entropy": 0.8888242825865745, "epoch": 6.677568819841919, "grad_norm": 0.12243334203958511, "learning_rate": 6.304998743983239e-05, "loss": 1.3163, "mean_token_accuracy": 0.7570770010352135, "num_tokens": 1760972586.0, "step": 24500 }, { "entropy": 0.8893096715211868, "epoch": 6.680294358135732, "grad_norm": 0.13131950795650482, "learning_rate": 6.302098233622972e-05, "loss": 1.3157, "mean_token_accuracy": 0.7527543500065803, "num_tokens": 1761689047.0, "step": 24510 }, { "entropy": 0.887695050239563, "epoch": 6.683019896429545, "grad_norm": 0.1326379030942917, "learning_rate": 6.299197253127815e-05, "loss": 1.3146, "mean_token_accuracy": 0.7535473465919494, "num_tokens": 1762411702.0, "step": 24520 }, { "entropy": 0.8963560268282891, "epoch": 6.685745434723358, "grad_norm": 0.13111519813537598, "learning_rate": 6.296295803545191e-05, "loss": 1.3281, "mean_token_accuracy": 0.7485727503895759, "num_tokens": 1763116185.0, "step": 24530 }, { "entropy": 0.8973544210195541, "epoch": 6.6884709730171705, "grad_norm": 0.13762107491493225, "learning_rate": 6.293393885922702e-05, "loss": 1.3202, "mean_token_accuracy": 0.7498584285378456, "num_tokens": 1763833304.0, "step": 24540 }, { "entropy": 0.8898538023233413, "epoch": 6.691196511310984, "grad_norm": 0.13277111947536469, "learning_rate": 6.290491501308108e-05, "loss": 1.3106, "mean_token_accuracy": 0.7581757709383965, "num_tokens": 1764568051.0, "step": 24550 }, { "entropy": 0.8891453593969345, "epoch": 6.693922049604797, "grad_norm": 0.12729622423648834, "learning_rate": 6.287588650749343e-05, "loss": 1.3131, "mean_token_accuracy": 0.7540027663111687, "num_tokens": 1765300001.0, "step": 24560 }, { "entropy": 0.895088429749012, "epoch": 6.69664758789861, "grad_norm": 0.13212324678897858, "learning_rate": 6.284685335294511e-05, "loss": 1.3239, "mean_token_accuracy": 0.7556274324655533, "num_tokens": 1766016154.0, "step": 24570 }, { "entropy": 0.8938517928123474, "epoch": 6.699373126192423, "grad_norm": 0.14164453744888306, "learning_rate": 6.281781555991878e-05, "loss": 1.3237, "mean_token_accuracy": 0.7555088177323341, "num_tokens": 1766743771.0, "step": 24580 }, { "entropy": 0.8876852571964264, "epoch": 6.702098664486236, "grad_norm": 0.12492102384567261, "learning_rate": 6.278877313889884e-05, "loss": 1.3143, "mean_token_accuracy": 0.7587466761469841, "num_tokens": 1767475491.0, "step": 24590 }, { "entropy": 0.8952235966920853, "epoch": 6.704824202780049, "grad_norm": 0.12633070349693298, "learning_rate": 6.275972610037136e-05, "loss": 1.3288, "mean_token_accuracy": 0.7498063012957573, "num_tokens": 1768176601.0, "step": 24600 }, { "entropy": 0.8925411343574524, "epoch": 6.707549741073862, "grad_norm": 0.13363733887672424, "learning_rate": 6.273067445482396e-05, "loss": 1.3299, "mean_token_accuracy": 0.7524307861924171, "num_tokens": 1768881833.0, "step": 24610 }, { "entropy": 0.8888502702116966, "epoch": 6.710275279367675, "grad_norm": 0.13241320848464966, "learning_rate": 6.270161821274607e-05, "loss": 1.3151, "mean_token_accuracy": 0.7526521891355514, "num_tokens": 1769597883.0, "step": 24620 }, { "entropy": 0.8879201605916023, "epoch": 6.713000817661488, "grad_norm": 0.12263783067464828, "learning_rate": 6.267255738462874e-05, "loss": 1.3126, "mean_token_accuracy": 0.7539681926369667, "num_tokens": 1770310587.0, "step": 24630 }, { "entropy": 0.8861521303653717, "epoch": 6.715726355955301, "grad_norm": 0.1356944441795349, "learning_rate": 6.26434919809646e-05, "loss": 1.3173, "mean_token_accuracy": 0.7576313450932503, "num_tokens": 1771030794.0, "step": 24640 }, { "entropy": 0.8939735934138298, "epoch": 6.718451894249114, "grad_norm": 0.128499835729599, "learning_rate": 6.261442201224803e-05, "loss": 1.3242, "mean_token_accuracy": 0.756110742688179, "num_tokens": 1771750478.0, "step": 24650 }, { "entropy": 0.8817349553108216, "epoch": 6.721177432542927, "grad_norm": 0.13707764446735382, "learning_rate": 6.2585347488975e-05, "loss": 1.3123, "mean_token_accuracy": 0.7497487619519234, "num_tokens": 1772452228.0, "step": 24660 }, { "entropy": 0.8883233219385147, "epoch": 6.723902970836741, "grad_norm": 0.1376660317182541, "learning_rate": 6.255626842164318e-05, "loss": 1.3183, "mean_token_accuracy": 0.754699669778347, "num_tokens": 1773165534.0, "step": 24670 }, { "entropy": 0.8869135260581971, "epoch": 6.7266285091305535, "grad_norm": 0.1446562558412552, "learning_rate": 6.252718482075177e-05, "loss": 1.3174, "mean_token_accuracy": 0.7535565987229347, "num_tokens": 1773874549.0, "step": 24680 }, { "entropy": 0.9035732954740524, "epoch": 6.7293540474243665, "grad_norm": 0.12701532244682312, "learning_rate": 6.249809669680174e-05, "loss": 1.3247, "mean_token_accuracy": 0.7481285810470581, "num_tokens": 1774594622.0, "step": 24690 }, { "entropy": 0.8916135907173157, "epoch": 6.732079585718179, "grad_norm": 0.12978671491146088, "learning_rate": 6.246900406029558e-05, "loss": 1.3152, "mean_token_accuracy": 0.7495876282453537, "num_tokens": 1775296615.0, "step": 24700 }, { "entropy": 0.8902298852801322, "epoch": 6.734805124011992, "grad_norm": 0.13260269165039062, "learning_rate": 6.243990692173753e-05, "loss": 1.3091, "mean_token_accuracy": 0.7554959207773209, "num_tokens": 1776023118.0, "step": 24710 }, { "entropy": 0.883197845518589, "epoch": 6.737530662305805, "grad_norm": 0.12556543946266174, "learning_rate": 6.241080529163335e-05, "loss": 1.3082, "mean_token_accuracy": 0.7563388183712959, "num_tokens": 1776750009.0, "step": 24720 }, { "entropy": 0.8866877958178521, "epoch": 6.740256200599618, "grad_norm": 0.13022150099277496, "learning_rate": 6.238169918049045e-05, "loss": 1.3174, "mean_token_accuracy": 0.7532852962613106, "num_tokens": 1777471682.0, "step": 24730 }, { "entropy": 0.8915566191077232, "epoch": 6.742981738893431, "grad_norm": 0.13103778660297394, "learning_rate": 6.235258859881787e-05, "loss": 1.3129, "mean_token_accuracy": 0.7541903033852577, "num_tokens": 1778197294.0, "step": 24740 }, { "entropy": 0.8954208865761757, "epoch": 6.745707277187244, "grad_norm": 0.12838414311408997, "learning_rate": 6.232347355712629e-05, "loss": 1.3147, "mean_token_accuracy": 0.7506286948919296, "num_tokens": 1778909783.0, "step": 24750 }, { "entropy": 0.8895563051104546, "epoch": 6.748432815481058, "grad_norm": 0.12716424465179443, "learning_rate": 6.229435406592794e-05, "loss": 1.3104, "mean_token_accuracy": 0.7477434396743774, "num_tokens": 1779613678.0, "step": 24760 }, { "entropy": 0.8930724635720253, "epoch": 6.751158353774871, "grad_norm": 0.14486993849277496, "learning_rate": 6.226523013573668e-05, "loss": 1.3197, "mean_token_accuracy": 0.7560727789998054, "num_tokens": 1780346417.0, "step": 24770 }, { "entropy": 0.8904518365859986, "epoch": 6.753883892068684, "grad_norm": 0.12527410686016083, "learning_rate": 6.223610177706803e-05, "loss": 1.3226, "mean_token_accuracy": 0.7507403671741486, "num_tokens": 1781052552.0, "step": 24780 }, { "entropy": 0.8915664985775947, "epoch": 6.756609430362497, "grad_norm": 0.14312466979026794, "learning_rate": 6.2206969000439e-05, "loss": 1.3168, "mean_token_accuracy": 0.7518466025590896, "num_tokens": 1781770239.0, "step": 24790 }, { "entropy": 0.8863757699728012, "epoch": 6.75933496865631, "grad_norm": 0.13256804645061493, "learning_rate": 6.21778318163683e-05, "loss": 1.3163, "mean_token_accuracy": 0.7572139993309974, "num_tokens": 1782493481.0, "step": 24800 }, { "entropy": 0.8955301865935326, "epoch": 6.762060506950123, "grad_norm": 0.12993404269218445, "learning_rate": 6.214869023537617e-05, "loss": 1.3216, "mean_token_accuracy": 0.7534404128789902, "num_tokens": 1783210604.0, "step": 24810 }, { "entropy": 0.8905673056840897, "epoch": 6.764786045243936, "grad_norm": 0.13321179151535034, "learning_rate": 6.211954426798445e-05, "loss": 1.3189, "mean_token_accuracy": 0.7539059400558472, "num_tokens": 1783937145.0, "step": 24820 }, { "entropy": 0.888870345056057, "epoch": 6.767511583537749, "grad_norm": 0.12881068885326385, "learning_rate": 6.209039392471655e-05, "loss": 1.3109, "mean_token_accuracy": 0.7551013827323914, "num_tokens": 1784654847.0, "step": 24830 }, { "entropy": 0.8842212155461311, "epoch": 6.770237121831562, "grad_norm": 0.1341342031955719, "learning_rate": 6.206123921609752e-05, "loss": 1.3169, "mean_token_accuracy": 0.7548576384782791, "num_tokens": 1785368803.0, "step": 24840 }, { "entropy": 0.8953014209866523, "epoch": 6.7729626601253745, "grad_norm": 0.12916676700115204, "learning_rate": 6.20320801526539e-05, "loss": 1.3152, "mean_token_accuracy": 0.7519174054265022, "num_tokens": 1786087885.0, "step": 24850 }, { "entropy": 0.8924761295318604, "epoch": 6.7756881984191875, "grad_norm": 0.1352209597826004, "learning_rate": 6.200291674491389e-05, "loss": 1.3171, "mean_token_accuracy": 0.7516786128282547, "num_tokens": 1786794685.0, "step": 24860 }, { "entropy": 0.8978717163205147, "epoch": 6.778413736713, "grad_norm": 0.13338683545589447, "learning_rate": 6.197374900340717e-05, "loss": 1.3268, "mean_token_accuracy": 0.7472734853625298, "num_tokens": 1787495432.0, "step": 24870 }, { "entropy": 0.8823297992348671, "epoch": 6.781139275006813, "grad_norm": 0.14823059737682343, "learning_rate": 6.194457693866507e-05, "loss": 1.3046, "mean_token_accuracy": 0.760610094666481, "num_tokens": 1788234159.0, "step": 24880 }, { "entropy": 0.8852872222661972, "epoch": 6.783864813300627, "grad_norm": 0.12477268278598785, "learning_rate": 6.191540056122039e-05, "loss": 1.3108, "mean_token_accuracy": 0.7568852975964546, "num_tokens": 1788952975.0, "step": 24890 }, { "entropy": 0.889084380865097, "epoch": 6.78659035159444, "grad_norm": 0.1310306191444397, "learning_rate": 6.188621988160759e-05, "loss": 1.3193, "mean_token_accuracy": 0.7547228544950485, "num_tokens": 1789667292.0, "step": 24900 }, { "entropy": 0.8856345131993294, "epoch": 6.789315889888253, "grad_norm": 0.13499148190021515, "learning_rate": 6.185703491036259e-05, "loss": 1.31, "mean_token_accuracy": 0.7545298427343369, "num_tokens": 1790393082.0, "step": 24910 }, { "entropy": 0.8889864951372146, "epoch": 6.792041428182066, "grad_norm": 0.13105006515979767, "learning_rate": 6.182784565802294e-05, "loss": 1.3076, "mean_token_accuracy": 0.7521557480096817, "num_tokens": 1791098703.0, "step": 24920 }, { "entropy": 0.8832415670156479, "epoch": 6.794766966475879, "grad_norm": 0.13367614150047302, "learning_rate": 6.179865213512766e-05, "loss": 1.3221, "mean_token_accuracy": 0.7522967308759689, "num_tokens": 1791802322.0, "step": 24930 }, { "entropy": 0.8917075216770172, "epoch": 6.797492504769692, "grad_norm": 0.12641644477844238, "learning_rate": 6.176945435221736e-05, "loss": 1.3228, "mean_token_accuracy": 0.7473835825920105, "num_tokens": 1792498190.0, "step": 24940 }, { "entropy": 0.8921925216913223, "epoch": 6.800218043063505, "grad_norm": 0.1273316591978073, "learning_rate": 6.174025231983416e-05, "loss": 1.3155, "mean_token_accuracy": 0.7546837568283081, "num_tokens": 1793218782.0, "step": 24950 }, { "entropy": 0.8941346377134323, "epoch": 6.802943581357318, "grad_norm": 0.1447201818227768, "learning_rate": 6.171104604852179e-05, "loss": 1.3222, "mean_token_accuracy": 0.7505118101835251, "num_tokens": 1793928192.0, "step": 24960 }, { "entropy": 0.8849840000271797, "epoch": 6.805669119651131, "grad_norm": 0.13333961367607117, "learning_rate": 6.168183554882538e-05, "loss": 1.3141, "mean_token_accuracy": 0.7556151181459427, "num_tokens": 1794652393.0, "step": 24970 }, { "entropy": 0.8927885562181472, "epoch": 6.808394657944945, "grad_norm": 0.13098543882369995, "learning_rate": 6.165262083129169e-05, "loss": 1.3183, "mean_token_accuracy": 0.7493065282702446, "num_tokens": 1795376456.0, "step": 24980 }, { "entropy": 0.8905992582440376, "epoch": 6.8111201962387575, "grad_norm": 0.13117153942584991, "learning_rate": 6.162340190646896e-05, "loss": 1.3244, "mean_token_accuracy": 0.7521332427859306, "num_tokens": 1796081411.0, "step": 24990 }, { "entropy": 0.890515461564064, "epoch": 6.8138457345325705, "grad_norm": 0.1338358074426651, "learning_rate": 6.159417878490697e-05, "loss": 1.3226, "mean_token_accuracy": 0.7561894357204437, "num_tokens": 1796793379.0, "step": 25000 }, { "entropy": 0.8920251533389092, "epoch": 6.816571272826383, "grad_norm": 0.1321912556886673, "learning_rate": 6.1564951477157e-05, "loss": 1.317, "mean_token_accuracy": 0.7513139307498932, "num_tokens": 1797508363.0, "step": 25010 }, { "entropy": 0.8878983482718468, "epoch": 6.819296811120196, "grad_norm": 0.12442489713430405, "learning_rate": 6.153571999377185e-05, "loss": 1.3196, "mean_token_accuracy": 0.7533785417675972, "num_tokens": 1798225244.0, "step": 25020 }, { "entropy": 0.8908624187111854, "epoch": 6.822022349414009, "grad_norm": 0.12250331789255142, "learning_rate": 6.150648434530581e-05, "loss": 1.3141, "mean_token_accuracy": 0.7504842028021812, "num_tokens": 1798932347.0, "step": 25030 }, { "entropy": 0.8861579939723014, "epoch": 6.824747887707822, "grad_norm": 0.12292330712080002, "learning_rate": 6.147724454231471e-05, "loss": 1.3195, "mean_token_accuracy": 0.7477668762207031, "num_tokens": 1799632761.0, "step": 25040 }, { "entropy": 0.8902771726250649, "epoch": 6.827473426001635, "grad_norm": 0.12106510996818542, "learning_rate": 6.144800059535584e-05, "loss": 1.3157, "mean_token_accuracy": 0.7549340993165969, "num_tokens": 1800364884.0, "step": 25050 }, { "entropy": 0.8949364453554154, "epoch": 6.830198964295448, "grad_norm": 0.12179964780807495, "learning_rate": 6.1418752514988e-05, "loss": 1.3219, "mean_token_accuracy": 0.7526259392499923, "num_tokens": 1801082374.0, "step": 25060 }, { "entropy": 0.8969263181090354, "epoch": 6.832924502589261, "grad_norm": 0.1304628849029541, "learning_rate": 6.13895003117715e-05, "loss": 1.3234, "mean_token_accuracy": 0.7511690348386765, "num_tokens": 1801800134.0, "step": 25070 }, { "entropy": 0.8968133956193924, "epoch": 6.835650040883074, "grad_norm": 0.12084237486124039, "learning_rate": 6.13602439962681e-05, "loss": 1.3172, "mean_token_accuracy": 0.7497126936912537, "num_tokens": 1802521122.0, "step": 25080 }, { "entropy": 0.8833630070090294, "epoch": 6.838375579176887, "grad_norm": 0.1426776647567749, "learning_rate": 6.133098357904111e-05, "loss": 1.314, "mean_token_accuracy": 0.7548305094242096, "num_tokens": 1803233108.0, "step": 25090 }, { "entropy": 0.8972644343972206, "epoch": 6.841101117470701, "grad_norm": 0.12756995856761932, "learning_rate": 6.130171907065528e-05, "loss": 1.3207, "mean_token_accuracy": 0.7509740442037582, "num_tokens": 1803943588.0, "step": 25100 }, { "entropy": 0.8945842295885086, "epoch": 6.843826655764514, "grad_norm": 0.12099883705377579, "learning_rate": 6.127245048167677e-05, "loss": 1.3134, "mean_token_accuracy": 0.7521846234798432, "num_tokens": 1804663812.0, "step": 25110 }, { "entropy": 0.8933159589767456, "epoch": 6.846552194058327, "grad_norm": 0.13169211149215698, "learning_rate": 6.124317782267334e-05, "loss": 1.323, "mean_token_accuracy": 0.7487967729568481, "num_tokens": 1805361304.0, "step": 25120 }, { "entropy": 0.8939870715141296, "epoch": 6.84927773235214, "grad_norm": 0.13507576286792755, "learning_rate": 6.121390110421417e-05, "loss": 1.3242, "mean_token_accuracy": 0.7542021676898003, "num_tokens": 1806090119.0, "step": 25130 }, { "entropy": 0.8863414153456688, "epoch": 6.852003270645953, "grad_norm": 0.14156360924243927, "learning_rate": 6.118462033686986e-05, "loss": 1.3115, "mean_token_accuracy": 0.7529726713895798, "num_tokens": 1806806945.0, "step": 25140 }, { "entropy": 0.8881063982844353, "epoch": 6.8547288089397655, "grad_norm": 0.12910422682762146, "learning_rate": 6.115533553121253e-05, "loss": 1.3182, "mean_token_accuracy": 0.7578499868512154, "num_tokens": 1807530800.0, "step": 25150 }, { "entropy": 0.8826519504189492, "epoch": 6.8574543472335785, "grad_norm": 0.12877538800239563, "learning_rate": 6.112604669781572e-05, "loss": 1.307, "mean_token_accuracy": 0.7581726223230362, "num_tokens": 1808251647.0, "step": 25160 }, { "entropy": 0.879099203646183, "epoch": 6.860179885527391, "grad_norm": 0.12529128789901733, "learning_rate": 6.109675384725446e-05, "loss": 1.3147, "mean_token_accuracy": 0.7574768289923668, "num_tokens": 1808976064.0, "step": 25170 }, { "entropy": 0.8908263728022575, "epoch": 6.862905423821204, "grad_norm": 0.13036611676216125, "learning_rate": 6.106745699010518e-05, "loss": 1.3232, "mean_token_accuracy": 0.7502112478017807, "num_tokens": 1809687524.0, "step": 25180 }, { "entropy": 0.8970330774784088, "epoch": 6.865630962115017, "grad_norm": 0.129790797829628, "learning_rate": 6.103815613694584e-05, "loss": 1.3266, "mean_token_accuracy": 0.7507972061634064, "num_tokens": 1810411749.0, "step": 25190 }, { "entropy": 0.8960664182901382, "epoch": 6.868356500408831, "grad_norm": 0.13538548350334167, "learning_rate": 6.100885129835575e-05, "loss": 1.3263, "mean_token_accuracy": 0.7504530757665634, "num_tokens": 1811126021.0, "step": 25200 }, { "entropy": 0.898378475010395, "epoch": 6.871082038702644, "grad_norm": 0.13220278918743134, "learning_rate": 6.09795424849157e-05, "loss": 1.3228, "mean_token_accuracy": 0.7522737562656403, "num_tokens": 1811860168.0, "step": 25210 }, { "entropy": 0.8975155144929886, "epoch": 6.873807576996457, "grad_norm": 0.12303317338228226, "learning_rate": 6.095022970720793e-05, "loss": 1.3164, "mean_token_accuracy": 0.7558909565210342, "num_tokens": 1812600662.0, "step": 25220 }, { "entropy": 0.8922346726059913, "epoch": 6.87653311529027, "grad_norm": 0.1409824788570404, "learning_rate": 6.092091297581608e-05, "loss": 1.3189, "mean_token_accuracy": 0.7525821834802627, "num_tokens": 1813316952.0, "step": 25230 }, { "entropy": 0.8965624541044235, "epoch": 6.879258653584083, "grad_norm": 0.12102717906236649, "learning_rate": 6.089159230132524e-05, "loss": 1.3306, "mean_token_accuracy": 0.7498206123709679, "num_tokens": 1814030467.0, "step": 25240 }, { "entropy": 0.893408976495266, "epoch": 6.881984191877896, "grad_norm": 0.1330675482749939, "learning_rate": 6.086226769432193e-05, "loss": 1.3217, "mean_token_accuracy": 0.7534523352980613, "num_tokens": 1814755046.0, "step": 25250 }, { "entropy": 0.8845838963985443, "epoch": 6.884709730171709, "grad_norm": 0.12887269258499146, "learning_rate": 6.083293916539406e-05, "loss": 1.3155, "mean_token_accuracy": 0.7518935963511467, "num_tokens": 1815466463.0, "step": 25260 }, { "entropy": 0.8824153304100036, "epoch": 6.887435268465522, "grad_norm": 0.13421593606472015, "learning_rate": 6.0803606725130965e-05, "loss": 1.3119, "mean_token_accuracy": 0.7580133184790612, "num_tokens": 1816185402.0, "step": 25270 }, { "entropy": 0.8832359358668327, "epoch": 6.890160806759335, "grad_norm": 0.12394164502620697, "learning_rate": 6.077427038412344e-05, "loss": 1.3097, "mean_token_accuracy": 0.7570543676614762, "num_tokens": 1816905596.0, "step": 25280 }, { "entropy": 0.884107905626297, "epoch": 6.892886345053148, "grad_norm": 0.13406658172607422, "learning_rate": 6.074493015296361e-05, "loss": 1.3114, "mean_token_accuracy": 0.7576464235782623, "num_tokens": 1817640103.0, "step": 25290 }, { "entropy": 0.8825078994035721, "epoch": 6.895611883346961, "grad_norm": 0.14242766797542572, "learning_rate": 6.0715586042245043e-05, "loss": 1.3143, "mean_token_accuracy": 0.7528106242418289, "num_tokens": 1818339337.0, "step": 25300 }, { "entropy": 0.8900894001126289, "epoch": 6.898337421640774, "grad_norm": 0.1387607753276825, "learning_rate": 6.068623806256274e-05, "loss": 1.3203, "mean_token_accuracy": 0.7529940992593765, "num_tokens": 1819054669.0, "step": 25310 }, { "entropy": 0.88262540102005, "epoch": 6.901062959934587, "grad_norm": 0.12354110181331635, "learning_rate": 6.065688622451304e-05, "loss": 1.3113, "mean_token_accuracy": 0.7585963323712349, "num_tokens": 1819784957.0, "step": 25320 }, { "entropy": 0.8864086881279946, "epoch": 6.9037884982284, "grad_norm": 0.14237426221370697, "learning_rate": 6.06275305386937e-05, "loss": 1.3144, "mean_token_accuracy": 0.7556328341364861, "num_tokens": 1820507113.0, "step": 25330 }, { "entropy": 0.8944937258958816, "epoch": 6.906514036522213, "grad_norm": 0.13102467358112335, "learning_rate": 6.0598171015703895e-05, "loss": 1.3242, "mean_token_accuracy": 0.75197584182024, "num_tokens": 1821219311.0, "step": 25340 }, { "entropy": 0.8945687383413314, "epoch": 6.909239574816026, "grad_norm": 0.1266109198331833, "learning_rate": 6.056880766614412e-05, "loss": 1.3243, "mean_token_accuracy": 0.7514003947377205, "num_tokens": 1821932908.0, "step": 25350 }, { "entropy": 0.8875587612390519, "epoch": 6.911965113109839, "grad_norm": 0.12885835766792297, "learning_rate": 6.053944050061633e-05, "loss": 1.3169, "mean_token_accuracy": 0.7505095466971398, "num_tokens": 1822634108.0, "step": 25360 }, { "entropy": 0.8883148550987243, "epoch": 6.914690651403652, "grad_norm": 0.1644582897424698, "learning_rate": 6.051006952972378e-05, "loss": 1.3136, "mean_token_accuracy": 0.7556955307722092, "num_tokens": 1823355702.0, "step": 25370 }, { "entropy": 0.8857153192162514, "epoch": 6.917416189697465, "grad_norm": 0.16814067959785461, "learning_rate": 6.048069476407117e-05, "loss": 1.3129, "mean_token_accuracy": 0.7535390347242356, "num_tokens": 1824060649.0, "step": 25380 }, { "entropy": 0.888411970436573, "epoch": 6.920141727991278, "grad_norm": 0.13149769604206085, "learning_rate": 6.045131621426452e-05, "loss": 1.3127, "mean_token_accuracy": 0.7515056937932968, "num_tokens": 1824773374.0, "step": 25390 }, { "entropy": 0.8872165113687516, "epoch": 6.922867266285091, "grad_norm": 0.1266518384218216, "learning_rate": 6.042193389091124e-05, "loss": 1.3186, "mean_token_accuracy": 0.7529063448309898, "num_tokens": 1825489650.0, "step": 25400 }, { "entropy": 0.8882512658834457, "epoch": 6.925592804578905, "grad_norm": 0.14183460175991058, "learning_rate": 6.0392547804620093e-05, "loss": 1.3135, "mean_token_accuracy": 0.7538353443145752, "num_tokens": 1826212918.0, "step": 25410 }, { "entropy": 0.8908900067210197, "epoch": 6.928318342872718, "grad_norm": 0.14262664318084717, "learning_rate": 6.036315796600119e-05, "loss": 1.3196, "mean_token_accuracy": 0.7542007371783257, "num_tokens": 1826928865.0, "step": 25420 }, { "entropy": 0.8866520047187805, "epoch": 6.931043881166531, "grad_norm": 0.12231040745973587, "learning_rate": 6.033376438566605e-05, "loss": 1.3015, "mean_token_accuracy": 0.755017101764679, "num_tokens": 1827654261.0, "step": 25430 }, { "entropy": 0.8829600974917412, "epoch": 6.933769419460344, "grad_norm": 0.13049496710300446, "learning_rate": 6.030436707422745e-05, "loss": 1.3072, "mean_token_accuracy": 0.7576208561658859, "num_tokens": 1828376179.0, "step": 25440 }, { "entropy": 0.8899279996752739, "epoch": 6.936494957754157, "grad_norm": 0.13958017528057098, "learning_rate": 6.027496604229961e-05, "loss": 1.3224, "mean_token_accuracy": 0.7475732579827309, "num_tokens": 1829068793.0, "step": 25450 }, { "entropy": 0.8850479483604431, "epoch": 6.9392204960479695, "grad_norm": 0.13414804637432098, "learning_rate": 6.0245561300498034e-05, "loss": 1.3207, "mean_token_accuracy": 0.7567609786987305, "num_tokens": 1829789136.0, "step": 25460 }, { "entropy": 0.8858461394906044, "epoch": 6.9419460343417825, "grad_norm": 0.12835468351840973, "learning_rate": 6.021615285943958e-05, "loss": 1.3133, "mean_token_accuracy": 0.7571169376373291, "num_tokens": 1830510355.0, "step": 25470 }, { "entropy": 0.8861836612224578, "epoch": 6.944671572635595, "grad_norm": 0.13081277906894684, "learning_rate": 6.018674072974244e-05, "loss": 1.308, "mean_token_accuracy": 0.7534803554415703, "num_tokens": 1831233640.0, "step": 25480 }, { "entropy": 0.8840690895915031, "epoch": 6.947397110929408, "grad_norm": 0.1314501315355301, "learning_rate": 6.015732492202617e-05, "loss": 1.3125, "mean_token_accuracy": 0.7585026815533638, "num_tokens": 1831975632.0, "step": 25490 }, { "entropy": 0.8896793007850647, "epoch": 6.950122649223221, "grad_norm": 0.14163920283317566, "learning_rate": 6.012790544691159e-05, "loss": 1.3101, "mean_token_accuracy": 0.7513944432139397, "num_tokens": 1832690253.0, "step": 25500 }, { "entropy": 0.8853412166237831, "epoch": 6.952848187517034, "grad_norm": 0.13058798015117645, "learning_rate": 6.0098482315020896e-05, "loss": 1.3069, "mean_token_accuracy": 0.7581047922372818, "num_tokens": 1833423579.0, "step": 25510 }, { "entropy": 0.8871693447232246, "epoch": 6.955573725810847, "grad_norm": 0.12563154101371765, "learning_rate": 6.0069055536977595e-05, "loss": 1.3158, "mean_token_accuracy": 0.7564632892608643, "num_tokens": 1834134410.0, "step": 25520 }, { "entropy": 0.882788622379303, "epoch": 6.958299264104661, "grad_norm": 0.1307438313961029, "learning_rate": 6.0039625123406495e-05, "loss": 1.3099, "mean_token_accuracy": 0.7566651105880737, "num_tokens": 1834858003.0, "step": 25530 }, { "entropy": 0.8913815826177597, "epoch": 6.961024802398474, "grad_norm": 0.13012726604938507, "learning_rate": 6.001019108493372e-05, "loss": 1.3145, "mean_token_accuracy": 0.7526103541254997, "num_tokens": 1835573847.0, "step": 25540 }, { "entropy": 0.8850127249956131, "epoch": 6.963750340692287, "grad_norm": 0.12452500313520432, "learning_rate": 5.998075343218672e-05, "loss": 1.3105, "mean_token_accuracy": 0.7558508038520813, "num_tokens": 1836291597.0, "step": 25550 }, { "entropy": 0.8863060176372528, "epoch": 6.9664758789861, "grad_norm": 0.12626658380031586, "learning_rate": 5.995131217579423e-05, "loss": 1.3131, "mean_token_accuracy": 0.7589380100369454, "num_tokens": 1837028787.0, "step": 25560 }, { "entropy": 0.8877708554267884, "epoch": 6.969201417279913, "grad_norm": 0.13097473978996277, "learning_rate": 5.9921867326386294e-05, "loss": 1.3134, "mean_token_accuracy": 0.7542364045977592, "num_tokens": 1837757482.0, "step": 25570 }, { "entropy": 0.894642573595047, "epoch": 6.971926955573726, "grad_norm": 0.1353239119052887, "learning_rate": 5.989241889459427e-05, "loss": 1.3181, "mean_token_accuracy": 0.7549946740269661, "num_tokens": 1838492788.0, "step": 25580 }, { "entropy": 0.8870107933878899, "epoch": 6.974652493867539, "grad_norm": 0.12750038504600525, "learning_rate": 5.986296689105076e-05, "loss": 1.3143, "mean_token_accuracy": 0.7520146772265435, "num_tokens": 1839205036.0, "step": 25590 }, { "entropy": 0.8909857362508774, "epoch": 6.977378032161352, "grad_norm": 0.12656597793102264, "learning_rate": 5.9833511326389725e-05, "loss": 1.3124, "mean_token_accuracy": 0.756410850584507, "num_tokens": 1839936330.0, "step": 25600 }, { "entropy": 0.8968017011880874, "epoch": 6.980103570455165, "grad_norm": 0.12405797094106674, "learning_rate": 5.9804052211246345e-05, "loss": 1.3199, "mean_token_accuracy": 0.7516512796282768, "num_tokens": 1840651268.0, "step": 25610 }, { "entropy": 0.8871091291308403, "epoch": 6.9828291087489776, "grad_norm": 0.13120581209659576, "learning_rate": 5.977458955625712e-05, "loss": 1.3099, "mean_token_accuracy": 0.7555394068360328, "num_tokens": 1841387356.0, "step": 25620 }, { "entropy": 0.8886284098029137, "epoch": 6.985554647042791, "grad_norm": 0.13083769381046295, "learning_rate": 5.9745123372059853e-05, "loss": 1.3123, "mean_token_accuracy": 0.7536327734589576, "num_tokens": 1842115008.0, "step": 25630 }, { "entropy": 0.8853094175457954, "epoch": 6.988280185336604, "grad_norm": 0.1331971287727356, "learning_rate": 5.9715653669293545e-05, "loss": 1.3047, "mean_token_accuracy": 0.7562429383397102, "num_tokens": 1842840643.0, "step": 25640 }, { "entropy": 0.8968934863805771, "epoch": 6.991005723630417, "grad_norm": 0.1355733871459961, "learning_rate": 5.968618045859853e-05, "loss": 1.3269, "mean_token_accuracy": 0.7489420115947724, "num_tokens": 1843545441.0, "step": 25650 }, { "entropy": 0.8933965265750885, "epoch": 6.99373126192423, "grad_norm": 0.12968383729457855, "learning_rate": 5.965670375061638e-05, "loss": 1.3147, "mean_token_accuracy": 0.7529557570815086, "num_tokens": 1844262644.0, "step": 25660 }, { "entropy": 0.8912503585219383, "epoch": 6.996456800218043, "grad_norm": 0.12128704786300659, "learning_rate": 5.9627223555989974e-05, "loss": 1.3192, "mean_token_accuracy": 0.7518787369132042, "num_tokens": 1844978661.0, "step": 25670 }, { "entropy": 0.8842117726802826, "epoch": 6.999182338511856, "grad_norm": 0.12942983210086823, "learning_rate": 5.959773988536337e-05, "loss": 1.3122, "mean_token_accuracy": 0.753253199160099, "num_tokens": 1845689292.0, "step": 25680 }, { "entropy": 0.8827182292938233, "epoch": 7.001907876805669, "grad_norm": 0.12594494223594666, "learning_rate": 5.9568252749381946e-05, "loss": 1.3043, "mean_token_accuracy": 0.7580388650298119, "num_tokens": 1846409716.0, "step": 25690 }, { "entropy": 0.87383753657341, "epoch": 7.004633415099482, "grad_norm": 0.1468559056520462, "learning_rate": 5.953876215869231e-05, "loss": 1.2991, "mean_token_accuracy": 0.7622627973556518, "num_tokens": 1847148069.0, "step": 25700 }, { "entropy": 0.8747234106063843, "epoch": 7.007358953393295, "grad_norm": 0.14879809319972992, "learning_rate": 5.950926812394232e-05, "loss": 1.299, "mean_token_accuracy": 0.7560095652937889, "num_tokens": 1847870227.0, "step": 25710 }, { "entropy": 0.874944044649601, "epoch": 7.010084491687108, "grad_norm": 0.14737948775291443, "learning_rate": 5.947977065578108e-05, "loss": 1.3028, "mean_token_accuracy": 0.7561734259128571, "num_tokens": 1848587072.0, "step": 25720 }, { "entropy": 0.8718336135149002, "epoch": 7.012810029980921, "grad_norm": 0.14516662061214447, "learning_rate": 5.945026976485891e-05, "loss": 1.2919, "mean_token_accuracy": 0.7556194886565208, "num_tokens": 1849303510.0, "step": 25730 }, { "entropy": 0.8663932263851166, "epoch": 7.015535568274735, "grad_norm": 0.13793468475341797, "learning_rate": 5.9420765461827424e-05, "loss": 1.291, "mean_token_accuracy": 0.7601346105337143, "num_tokens": 1850029730.0, "step": 25740 }, { "entropy": 0.8823228001594543, "epoch": 7.018261106568548, "grad_norm": 0.15650111436843872, "learning_rate": 5.939125775733939e-05, "loss": 1.3005, "mean_token_accuracy": 0.7535691395401954, "num_tokens": 1850744487.0, "step": 25750 }, { "entropy": 0.8704546928405762, "epoch": 7.020986644862361, "grad_norm": 0.13706140220165253, "learning_rate": 5.936174666204887e-05, "loss": 1.29, "mean_token_accuracy": 0.7583501160144805, "num_tokens": 1851474367.0, "step": 25760 }, { "entropy": 0.8767647996544838, "epoch": 7.0237121831561735, "grad_norm": 0.15674827992916107, "learning_rate": 5.933223218661111e-05, "loss": 1.2937, "mean_token_accuracy": 0.7525588110089302, "num_tokens": 1852182499.0, "step": 25770 }, { "entropy": 0.8705548405647278, "epoch": 7.0264377214499865, "grad_norm": 0.14327582716941833, "learning_rate": 5.930271434168261e-05, "loss": 1.2879, "mean_token_accuracy": 0.7598174691200257, "num_tokens": 1852911780.0, "step": 25780 }, { "entropy": 0.8777773588895798, "epoch": 7.029163259743799, "grad_norm": 0.16943815350532532, "learning_rate": 5.9273193137921034e-05, "loss": 1.3014, "mean_token_accuracy": 0.7552996784448623, "num_tokens": 1853624809.0, "step": 25790 }, { "entropy": 0.8729385986924172, "epoch": 7.031888798037612, "grad_norm": 0.14058621227741241, "learning_rate": 5.9243668585985324e-05, "loss": 1.2974, "mean_token_accuracy": 0.7559783667325973, "num_tokens": 1854332134.0, "step": 25800 }, { "entropy": 0.8762853026390076, "epoch": 7.034614336331425, "grad_norm": 0.15448784828186035, "learning_rate": 5.921414069653559e-05, "loss": 1.2886, "mean_token_accuracy": 0.7573204502463341, "num_tokens": 1855055077.0, "step": 25810 }, { "entropy": 0.8673344030976295, "epoch": 7.037339874625238, "grad_norm": 0.14283548295497894, "learning_rate": 5.918460948023314e-05, "loss": 1.2904, "mean_token_accuracy": 0.761931137740612, "num_tokens": 1855789834.0, "step": 25820 }, { "entropy": 0.8762605920433998, "epoch": 7.040065412919051, "grad_norm": 0.14536963403224945, "learning_rate": 5.915507494774051e-05, "loss": 1.307, "mean_token_accuracy": 0.7530893743038177, "num_tokens": 1856499524.0, "step": 25830 }, { "entropy": 0.8695098787546158, "epoch": 7.042790951212864, "grad_norm": 0.14235912263393402, "learning_rate": 5.912553710972143e-05, "loss": 1.2879, "mean_token_accuracy": 0.7548491284251213, "num_tokens": 1857203651.0, "step": 25840 }, { "entropy": 0.8765233427286148, "epoch": 7.045516489506678, "grad_norm": 0.15693019330501556, "learning_rate": 5.909599597684081e-05, "loss": 1.29, "mean_token_accuracy": 0.7588856726884842, "num_tokens": 1857930689.0, "step": 25850 }, { "entropy": 0.873693810403347, "epoch": 7.048242027800491, "grad_norm": 0.1523929387331009, "learning_rate": 5.906645155976476e-05, "loss": 1.2999, "mean_token_accuracy": 0.7557924911379814, "num_tokens": 1858652937.0, "step": 25860 }, { "entropy": 0.8805491030216217, "epoch": 7.050967566094304, "grad_norm": 0.13906849920749664, "learning_rate": 5.9036903869160564e-05, "loss": 1.3049, "mean_token_accuracy": 0.7498277887701988, "num_tokens": 1859351039.0, "step": 25870 }, { "entropy": 0.877228170633316, "epoch": 7.053693104388117, "grad_norm": 0.14655278623104095, "learning_rate": 5.90073529156967e-05, "loss": 1.2929, "mean_token_accuracy": 0.7556937620043754, "num_tokens": 1860073562.0, "step": 25880 }, { "entropy": 0.8722148582339286, "epoch": 7.05641864268193, "grad_norm": 0.14586222171783447, "learning_rate": 5.897779871004281e-05, "loss": 1.2926, "mean_token_accuracy": 0.7574687734246254, "num_tokens": 1860806603.0, "step": 25890 }, { "entropy": 0.8758646205067635, "epoch": 7.059144180975743, "grad_norm": 0.14526154100894928, "learning_rate": 5.894824126286974e-05, "loss": 1.3014, "mean_token_accuracy": 0.7530226081609726, "num_tokens": 1861517748.0, "step": 25900 }, { "entropy": 0.8793660134077073, "epoch": 7.061869719269556, "grad_norm": 0.14603964984416962, "learning_rate": 5.8918680584849464e-05, "loss": 1.2997, "mean_token_accuracy": 0.7553532078862191, "num_tokens": 1862239234.0, "step": 25910 }, { "entropy": 0.8771114945411682, "epoch": 7.064595257563369, "grad_norm": 0.15067288279533386, "learning_rate": 5.8889116686655155e-05, "loss": 1.3032, "mean_token_accuracy": 0.756546376645565, "num_tokens": 1862954604.0, "step": 25920 }, { "entropy": 0.8750939950346946, "epoch": 7.0673207958571815, "grad_norm": 0.14782260358333588, "learning_rate": 5.885954957896115e-05, "loss": 1.2938, "mean_token_accuracy": 0.7629788026213646, "num_tokens": 1863688097.0, "step": 25930 }, { "entropy": 0.8741045355796814, "epoch": 7.0700463341509945, "grad_norm": 0.14869625866413116, "learning_rate": 5.88299792724429e-05, "loss": 1.2993, "mean_token_accuracy": 0.759143902361393, "num_tokens": 1864416271.0, "step": 25940 }, { "entropy": 0.8720627635717392, "epoch": 7.072771872444807, "grad_norm": 0.14257268607616425, "learning_rate": 5.880040577777708e-05, "loss": 1.3009, "mean_token_accuracy": 0.7576109483838082, "num_tokens": 1865134311.0, "step": 25950 }, { "entropy": 0.8788901478052139, "epoch": 7.075497410738621, "grad_norm": 0.15309759974479675, "learning_rate": 5.877082910564146e-05, "loss": 1.3063, "mean_token_accuracy": 0.7543908953666687, "num_tokens": 1865845673.0, "step": 25960 }, { "entropy": 0.8736586809158325, "epoch": 7.078222949032434, "grad_norm": 0.15360787510871887, "learning_rate": 5.874124926671498e-05, "loss": 1.3032, "mean_token_accuracy": 0.756864820420742, "num_tokens": 1866558735.0, "step": 25970 }, { "entropy": 0.8797694593667984, "epoch": 7.080948487326247, "grad_norm": 0.1488131731748581, "learning_rate": 5.871166627167772e-05, "loss": 1.2994, "mean_token_accuracy": 0.7545985385775567, "num_tokens": 1867273078.0, "step": 25980 }, { "entropy": 0.8750902444124222, "epoch": 7.08367402562006, "grad_norm": 0.1553211510181427, "learning_rate": 5.8682080131210916e-05, "loss": 1.299, "mean_token_accuracy": 0.7520381003618241, "num_tokens": 1867972370.0, "step": 25990 }, { "entropy": 0.8790387660264969, "epoch": 7.086399563913873, "grad_norm": 0.14957445859909058, "learning_rate": 5.865249085599689e-05, "loss": 1.2963, "mean_token_accuracy": 0.7567360460758209, "num_tokens": 1868707356.0, "step": 26000 }, { "entropy": 0.8829400196671486, "epoch": 7.089125102207686, "grad_norm": 0.16321925818920135, "learning_rate": 5.862289845671917e-05, "loss": 1.2954, "mean_token_accuracy": 0.7559129923582077, "num_tokens": 1869432113.0, "step": 26010 }, { "entropy": 0.8690956473350525, "epoch": 7.091850640501499, "grad_norm": 0.1361200362443924, "learning_rate": 5.8593302944062346e-05, "loss": 1.2987, "mean_token_accuracy": 0.7589480504393578, "num_tokens": 1870150186.0, "step": 26020 }, { "entropy": 0.8744716703891754, "epoch": 7.094576178795312, "grad_norm": 0.14653931558132172, "learning_rate": 5.856370432871216e-05, "loss": 1.3006, "mean_token_accuracy": 0.7579378753900528, "num_tokens": 1870872565.0, "step": 26030 }, { "entropy": 0.8781326964497567, "epoch": 7.097301717089125, "grad_norm": 0.1471918225288391, "learning_rate": 5.853410262135548e-05, "loss": 1.3025, "mean_token_accuracy": 0.7564917609095574, "num_tokens": 1871590788.0, "step": 26040 }, { "entropy": 0.877470214664936, "epoch": 7.100027255382938, "grad_norm": 0.14674139022827148, "learning_rate": 5.850449783268029e-05, "loss": 1.3018, "mean_token_accuracy": 0.754204623401165, "num_tokens": 1872306796.0, "step": 26050 }, { "entropy": 0.8754927709698677, "epoch": 7.102752793676752, "grad_norm": 0.1696721315383911, "learning_rate": 5.847488997337566e-05, "loss": 1.3006, "mean_token_accuracy": 0.7581387490034104, "num_tokens": 1873028300.0, "step": 26060 }, { "entropy": 0.8749557644128799, "epoch": 7.1054783319705646, "grad_norm": 0.1399001181125641, "learning_rate": 5.8445279054131785e-05, "loss": 1.2996, "mean_token_accuracy": 0.7563225671648979, "num_tokens": 1873749232.0, "step": 26070 }, { "entropy": 0.8754014566540718, "epoch": 7.1082038702643775, "grad_norm": 0.13720010221004486, "learning_rate": 5.841566508563999e-05, "loss": 1.294, "mean_token_accuracy": 0.7545505180954933, "num_tokens": 1874462772.0, "step": 26080 }, { "entropy": 0.8690753966569901, "epoch": 7.1109294085581904, "grad_norm": 0.15143989026546478, "learning_rate": 5.838604807859267e-05, "loss": 1.2934, "mean_token_accuracy": 0.7571880966424942, "num_tokens": 1875193775.0, "step": 26090 }, { "entropy": 0.8689525797963142, "epoch": 7.113654946852003, "grad_norm": 0.14893269538879395, "learning_rate": 5.835642804368333e-05, "loss": 1.2914, "mean_token_accuracy": 0.7562677934765816, "num_tokens": 1875902636.0, "step": 26100 }, { "entropy": 0.8736646234989166, "epoch": 7.116380485145816, "grad_norm": 0.1414748728275299, "learning_rate": 5.8326804991606546e-05, "loss": 1.295, "mean_token_accuracy": 0.757441146671772, "num_tokens": 1876626275.0, "step": 26110 }, { "entropy": 0.8731375485658646, "epoch": 7.119106023439629, "grad_norm": 0.14848846197128296, "learning_rate": 5.829717893305801e-05, "loss": 1.2884, "mean_token_accuracy": 0.7576317623257637, "num_tokens": 1877347469.0, "step": 26120 }, { "entropy": 0.8723952531814575, "epoch": 7.121831561733442, "grad_norm": 0.1503380537033081, "learning_rate": 5.8267549878734495e-05, "loss": 1.305, "mean_token_accuracy": 0.7554426342248917, "num_tokens": 1878061805.0, "step": 26130 }, { "entropy": 0.8748130679130555, "epoch": 7.124557100027255, "grad_norm": 0.1450539529323578, "learning_rate": 5.823791783933386e-05, "loss": 1.2991, "mean_token_accuracy": 0.7596857830882072, "num_tokens": 1878799450.0, "step": 26140 }, { "entropy": 0.869141885638237, "epoch": 7.127282638321068, "grad_norm": 0.15486854314804077, "learning_rate": 5.820828282555502e-05, "loss": 1.2931, "mean_token_accuracy": 0.7584925502538681, "num_tokens": 1879519878.0, "step": 26150 }, { "entropy": 0.8671886593103408, "epoch": 7.130008176614881, "grad_norm": 0.15078620612621307, "learning_rate": 5.817864484809797e-05, "loss": 1.285, "mean_token_accuracy": 0.7625649064779282, "num_tokens": 1880255117.0, "step": 26160 }, { "entropy": 0.876307912170887, "epoch": 7.132733714908694, "grad_norm": 0.15839825570583344, "learning_rate": 5.81490039176638e-05, "loss": 1.3062, "mean_token_accuracy": 0.7533732756972313, "num_tokens": 1880960324.0, "step": 26170 }, { "entropy": 0.8709997043013573, "epoch": 7.135459253202508, "grad_norm": 0.13962945342063904, "learning_rate": 5.811936004495465e-05, "loss": 1.3044, "mean_token_accuracy": 0.7553649961948394, "num_tokens": 1881663381.0, "step": 26180 }, { "entropy": 0.8603877604007721, "epoch": 7.138184791496321, "grad_norm": 0.1384153664112091, "learning_rate": 5.8089713240673695e-05, "loss": 1.292, "mean_token_accuracy": 0.7593579024076462, "num_tokens": 1882383259.0, "step": 26190 }, { "entropy": 0.8779341742396355, "epoch": 7.140910329790134, "grad_norm": 0.1410437822341919, "learning_rate": 5.806006351552523e-05, "loss": 1.2977, "mean_token_accuracy": 0.7531718775629997, "num_tokens": 1883096871.0, "step": 26200 }, { "entropy": 0.8759750500321388, "epoch": 7.143635868083947, "grad_norm": 0.1437990814447403, "learning_rate": 5.8030410880214535e-05, "loss": 1.2919, "mean_token_accuracy": 0.7562564298510551, "num_tokens": 1883817598.0, "step": 26210 }, { "entropy": 0.870393043756485, "epoch": 7.14636140637776, "grad_norm": 0.14680783450603485, "learning_rate": 5.8000755345448e-05, "loss": 1.2938, "mean_token_accuracy": 0.7575946375727654, "num_tokens": 1884540367.0, "step": 26220 }, { "entropy": 0.8708333566784858, "epoch": 7.149086944671573, "grad_norm": 0.1478429138660431, "learning_rate": 5.797109692193302e-05, "loss": 1.2992, "mean_token_accuracy": 0.758022865653038, "num_tokens": 1885258891.0, "step": 26230 }, { "entropy": 0.8699542701244354, "epoch": 7.1518124829653855, "grad_norm": 0.24645479023456573, "learning_rate": 5.794143562037806e-05, "loss": 1.2889, "mean_token_accuracy": 0.7612785547971725, "num_tokens": 1885982493.0, "step": 26240 }, { "entropy": 0.8763674259185791, "epoch": 7.1545380212591985, "grad_norm": 0.16096802055835724, "learning_rate": 5.79117714514926e-05, "loss": 1.3015, "mean_token_accuracy": 0.7544290259480476, "num_tokens": 1886692035.0, "step": 26250 }, { "entropy": 0.8811359405517578, "epoch": 7.157263559553011, "grad_norm": 0.15165232121944427, "learning_rate": 5.788210442598719e-05, "loss": 1.2984, "mean_token_accuracy": 0.7553988859057427, "num_tokens": 1887419643.0, "step": 26260 }, { "entropy": 0.8746663436293602, "epoch": 7.159989097846824, "grad_norm": 0.13912591338157654, "learning_rate": 5.785243455457338e-05, "loss": 1.2987, "mean_token_accuracy": 0.7545264646410942, "num_tokens": 1888143199.0, "step": 26270 }, { "entropy": 0.8752788513898849, "epoch": 7.162714636140638, "grad_norm": 0.17055462300777435, "learning_rate": 5.782276184796373e-05, "loss": 1.2935, "mean_token_accuracy": 0.7571158647537232, "num_tokens": 1888869073.0, "step": 26280 }, { "entropy": 0.8772252917289733, "epoch": 7.165440174434451, "grad_norm": 0.1450638771057129, "learning_rate": 5.779308631687191e-05, "loss": 1.297, "mean_token_accuracy": 0.7533574894070625, "num_tokens": 1889587743.0, "step": 26290 }, { "entropy": 0.8710338369011879, "epoch": 7.168165712728264, "grad_norm": 0.1593686193227768, "learning_rate": 5.776340797201252e-05, "loss": 1.2938, "mean_token_accuracy": 0.7594601094722748, "num_tokens": 1890317769.0, "step": 26300 }, { "entropy": 0.8735907509922981, "epoch": 7.170891251022077, "grad_norm": 0.14964617788791656, "learning_rate": 5.773372682410119e-05, "loss": 1.2931, "mean_token_accuracy": 0.7603439137339592, "num_tokens": 1891043657.0, "step": 26310 }, { "entropy": 0.8753811821341515, "epoch": 7.17361678931589, "grad_norm": 0.14793598651885986, "learning_rate": 5.770404288385459e-05, "loss": 1.293, "mean_token_accuracy": 0.7586567997932434, "num_tokens": 1891775050.0, "step": 26320 }, { "entropy": 0.8740849614143371, "epoch": 7.176342327609703, "grad_norm": 0.15123946964740753, "learning_rate": 5.767435616199041e-05, "loss": 1.2958, "mean_token_accuracy": 0.752157972753048, "num_tokens": 1892471265.0, "step": 26330 }, { "entropy": 0.8787199497222901, "epoch": 7.179067865903516, "grad_norm": 0.1432448923587799, "learning_rate": 5.7644666669227295e-05, "loss": 1.3021, "mean_token_accuracy": 0.7555218532681465, "num_tokens": 1893181058.0, "step": 26340 }, { "entropy": 0.8780265122652053, "epoch": 7.181793404197329, "grad_norm": 0.14211753010749817, "learning_rate": 5.761497441628494e-05, "loss": 1.3011, "mean_token_accuracy": 0.7550155445933342, "num_tokens": 1893907513.0, "step": 26350 }, { "entropy": 0.8750667542219162, "epoch": 7.184518942491142, "grad_norm": 0.16624762117862701, "learning_rate": 5.758527941388398e-05, "loss": 1.298, "mean_token_accuracy": 0.7573418155312538, "num_tokens": 1894631206.0, "step": 26360 }, { "entropy": 0.864818049967289, "epoch": 7.187244480784955, "grad_norm": 0.16290631890296936, "learning_rate": 5.755558167274613e-05, "loss": 1.289, "mean_token_accuracy": 0.7592792555689811, "num_tokens": 1895357144.0, "step": 26370 }, { "entropy": 0.8728147938847541, "epoch": 7.189970019078768, "grad_norm": 0.15238237380981445, "learning_rate": 5.752588120359399e-05, "loss": 1.2917, "mean_token_accuracy": 0.7546495750546456, "num_tokens": 1896070079.0, "step": 26380 }, { "entropy": 0.8765429362654686, "epoch": 7.1926955573725815, "grad_norm": 0.15025635063648224, "learning_rate": 5.749617801715121e-05, "loss": 1.3078, "mean_token_accuracy": 0.7570309311151504, "num_tokens": 1896793112.0, "step": 26390 }, { "entropy": 0.8747450307011604, "epoch": 7.195421095666394, "grad_norm": 0.14232859015464783, "learning_rate": 5.746647212414242e-05, "loss": 1.3013, "mean_token_accuracy": 0.7579892069101334, "num_tokens": 1897510056.0, "step": 26400 }, { "entropy": 0.8638418808579444, "epoch": 7.198146633960207, "grad_norm": 0.15131346881389618, "learning_rate": 5.74367635352932e-05, "loss": 1.2939, "mean_token_accuracy": 0.7587176471948623, "num_tokens": 1898214594.0, "step": 26410 }, { "entropy": 0.8682623416185379, "epoch": 7.20087217225402, "grad_norm": 0.15739648044109344, "learning_rate": 5.740705226133013e-05, "loss": 1.2891, "mean_token_accuracy": 0.7574314340949059, "num_tokens": 1898932898.0, "step": 26420 }, { "entropy": 0.8732482492923737, "epoch": 7.203597710547833, "grad_norm": 0.15174973011016846, "learning_rate": 5.7377338312980735e-05, "loss": 1.3013, "mean_token_accuracy": 0.7557144984602928, "num_tokens": 1899643041.0, "step": 26430 }, { "entropy": 0.8734035849571228, "epoch": 7.206323248841646, "grad_norm": 0.14822854101657867, "learning_rate": 5.734762170097352e-05, "loss": 1.3017, "mean_token_accuracy": 0.75667884349823, "num_tokens": 1900357545.0, "step": 26440 }, { "entropy": 0.8675457984209061, "epoch": 7.209048787135459, "grad_norm": 0.1542288213968277, "learning_rate": 5.731790243603794e-05, "loss": 1.2975, "mean_token_accuracy": 0.7582554280757904, "num_tokens": 1901064344.0, "step": 26450 }, { "entropy": 0.8695284485816955, "epoch": 7.211774325429272, "grad_norm": 0.15805630385875702, "learning_rate": 5.7288180528904445e-05, "loss": 1.2908, "mean_token_accuracy": 0.7603192314505577, "num_tokens": 1901782335.0, "step": 26460 }, { "entropy": 0.8807531267404556, "epoch": 7.214499863723085, "grad_norm": 0.13325440883636475, "learning_rate": 5.725845599030438e-05, "loss": 1.2953, "mean_token_accuracy": 0.754032127559185, "num_tokens": 1902502399.0, "step": 26470 }, { "entropy": 0.8696189224720001, "epoch": 7.217225402016898, "grad_norm": 0.1460484117269516, "learning_rate": 5.722872883097009e-05, "loss": 1.2962, "mean_token_accuracy": 0.7574547484517098, "num_tokens": 1903209640.0, "step": 26480 }, { "entropy": 0.8711689874529839, "epoch": 7.219950940310711, "grad_norm": 0.1420704871416092, "learning_rate": 5.719899906163485e-05, "loss": 1.2968, "mean_token_accuracy": 0.7579603239893913, "num_tokens": 1903931633.0, "step": 26490 }, { "entropy": 0.8681849867105484, "epoch": 7.222676478604525, "grad_norm": 0.1611538976430893, "learning_rate": 5.716926669303285e-05, "loss": 1.3001, "mean_token_accuracy": 0.7574627697467804, "num_tokens": 1904635178.0, "step": 26500 }, { "entropy": 0.8808808535337448, "epoch": 7.225402016898338, "grad_norm": 0.14451847970485687, "learning_rate": 5.713953173589925e-05, "loss": 1.3024, "mean_token_accuracy": 0.7549888685345649, "num_tokens": 1905359027.0, "step": 26510 }, { "entropy": 0.880359698832035, "epoch": 7.228127555192151, "grad_norm": 0.1502303034067154, "learning_rate": 5.710979420097018e-05, "loss": 1.3079, "mean_token_accuracy": 0.7542410060763359, "num_tokens": 1906070571.0, "step": 26520 }, { "entropy": 0.8744180366396904, "epoch": 7.230853093485964, "grad_norm": 0.1395016610622406, "learning_rate": 5.708005409898259e-05, "loss": 1.2944, "mean_token_accuracy": 0.7585380360484123, "num_tokens": 1906801705.0, "step": 26530 }, { "entropy": 0.8749017134308815, "epoch": 7.233578631779777, "grad_norm": 0.15864379703998566, "learning_rate": 5.7050311440674476e-05, "loss": 1.3022, "mean_token_accuracy": 0.7603865161538124, "num_tokens": 1907533354.0, "step": 26540 }, { "entropy": 0.872776010632515, "epoch": 7.2363041700735895, "grad_norm": 0.151897132396698, "learning_rate": 5.702056623678469e-05, "loss": 1.2926, "mean_token_accuracy": 0.7577180013060569, "num_tokens": 1908260593.0, "step": 26550 }, { "entropy": 0.8791093736886978, "epoch": 7.2390297083674024, "grad_norm": 0.14768271148204803, "learning_rate": 5.6990818498053014e-05, "loss": 1.3086, "mean_token_accuracy": 0.753087967634201, "num_tokens": 1908978048.0, "step": 26560 }, { "entropy": 0.8763909667730332, "epoch": 7.241755246661215, "grad_norm": 0.1572977751493454, "learning_rate": 5.696106823522016e-05, "loss": 1.2934, "mean_token_accuracy": 0.755253580212593, "num_tokens": 1909697715.0, "step": 26570 }, { "entropy": 0.8799683541059494, "epoch": 7.244480784955028, "grad_norm": 0.14823664724826813, "learning_rate": 5.693131545902774e-05, "loss": 1.3091, "mean_token_accuracy": 0.7538741514086723, "num_tokens": 1910411537.0, "step": 26580 }, { "entropy": 0.8791606545448303, "epoch": 7.247206323248841, "grad_norm": 0.1453849971294403, "learning_rate": 5.690156018021827e-05, "loss": 1.3042, "mean_token_accuracy": 0.7514085024595261, "num_tokens": 1911122559.0, "step": 26590 }, { "entropy": 0.8769569367170333, "epoch": 7.249931861542654, "grad_norm": 0.1487053632736206, "learning_rate": 5.687180240953518e-05, "loss": 1.3013, "mean_token_accuracy": 0.7544289767742157, "num_tokens": 1911838374.0, "step": 26600 }, { "entropy": 0.8753040879964828, "epoch": 7.252657399836468, "grad_norm": 0.1425638496875763, "learning_rate": 5.684204215772281e-05, "loss": 1.3008, "mean_token_accuracy": 0.757389535009861, "num_tokens": 1912564686.0, "step": 26610 }, { "entropy": 0.8770721167325973, "epoch": 7.255382938130281, "grad_norm": 0.14608031511306763, "learning_rate": 5.681227943552634e-05, "loss": 1.3003, "mean_token_accuracy": 0.75359016507864, "num_tokens": 1913285484.0, "step": 26620 }, { "entropy": 0.8745535492897034, "epoch": 7.258108476424094, "grad_norm": 0.14657150208950043, "learning_rate": 5.678251425369191e-05, "loss": 1.2932, "mean_token_accuracy": 0.7575717538595199, "num_tokens": 1914006490.0, "step": 26630 }, { "entropy": 0.8714345395565033, "epoch": 7.260834014717907, "grad_norm": 0.1463703066110611, "learning_rate": 5.675274662296654e-05, "loss": 1.2988, "mean_token_accuracy": 0.7547225907444954, "num_tokens": 1914717634.0, "step": 26640 }, { "entropy": 0.8697472095489502, "epoch": 7.26355955301172, "grad_norm": 0.1437256783246994, "learning_rate": 5.672297655409806e-05, "loss": 1.293, "mean_token_accuracy": 0.7568093731999397, "num_tokens": 1915443995.0, "step": 26650 }, { "entropy": 0.8644485801458359, "epoch": 7.266285091305533, "grad_norm": 0.14560437202453613, "learning_rate": 5.669320405783528e-05, "loss": 1.2904, "mean_token_accuracy": 0.7605119436979294, "num_tokens": 1916162662.0, "step": 26660 }, { "entropy": 0.8658681184053421, "epoch": 7.269010629599346, "grad_norm": 0.15063898265361786, "learning_rate": 5.666342914492785e-05, "loss": 1.2954, "mean_token_accuracy": 0.7597482159733773, "num_tokens": 1916885796.0, "step": 26670 }, { "entropy": 0.8673249945044518, "epoch": 7.271736167893159, "grad_norm": 0.14441640675067902, "learning_rate": 5.6633651826126235e-05, "loss": 1.2921, "mean_token_accuracy": 0.759340013563633, "num_tokens": 1917602591.0, "step": 26680 }, { "entropy": 0.8810052171349525, "epoch": 7.274461706186972, "grad_norm": 0.1468001902103424, "learning_rate": 5.6603872112181855e-05, "loss": 1.3001, "mean_token_accuracy": 0.7559056729078293, "num_tokens": 1918324243.0, "step": 26690 }, { "entropy": 0.873295296728611, "epoch": 7.277187244480785, "grad_norm": 0.1526554822921753, "learning_rate": 5.6574090013846946e-05, "loss": 1.29, "mean_token_accuracy": 0.7562502101063728, "num_tokens": 1919042536.0, "step": 26700 }, { "entropy": 0.8708538606762886, "epoch": 7.279912782774598, "grad_norm": 0.16268682479858398, "learning_rate": 5.654430554187462e-05, "loss": 1.297, "mean_token_accuracy": 0.7591925546526909, "num_tokens": 1919774068.0, "step": 26710 }, { "entropy": 0.8741784408688545, "epoch": 7.282638321068411, "grad_norm": 0.13987214863300323, "learning_rate": 5.651451870701884e-05, "loss": 1.2991, "mean_token_accuracy": 0.7585245609283447, "num_tokens": 1920497162.0, "step": 26720 }, { "entropy": 0.8752786368131638, "epoch": 7.285363859362224, "grad_norm": 0.14615780115127563, "learning_rate": 5.648472952003443e-05, "loss": 1.3053, "mean_token_accuracy": 0.7574028953909874, "num_tokens": 1921217946.0, "step": 26730 }, { "entropy": 0.872516205906868, "epoch": 7.288089397656037, "grad_norm": 0.1476518213748932, "learning_rate": 5.6454937991677045e-05, "loss": 1.295, "mean_token_accuracy": 0.7549552768468857, "num_tokens": 1921927093.0, "step": 26740 }, { "entropy": 0.8677942544221878, "epoch": 7.29081493594985, "grad_norm": 0.14972105622291565, "learning_rate": 5.642514413270321e-05, "loss": 1.2867, "mean_token_accuracy": 0.7599112004041672, "num_tokens": 1922658036.0, "step": 26750 }, { "entropy": 0.8700306206941605, "epoch": 7.293540474243663, "grad_norm": 0.15284699201583862, "learning_rate": 5.639534795387029e-05, "loss": 1.2971, "mean_token_accuracy": 0.7596366837620735, "num_tokens": 1923385377.0, "step": 26760 }, { "entropy": 0.8781607255339623, "epoch": 7.296266012537476, "grad_norm": 0.14511984586715698, "learning_rate": 5.6365549465936455e-05, "loss": 1.2881, "mean_token_accuracy": 0.7567567452788353, "num_tokens": 1924115821.0, "step": 26770 }, { "entropy": 0.8762117221951484, "epoch": 7.298991550831289, "grad_norm": 0.1574789583683014, "learning_rate": 5.633574867966073e-05, "loss": 1.298, "mean_token_accuracy": 0.7559019878506661, "num_tokens": 1924834287.0, "step": 26780 }, { "entropy": 0.8820765510201454, "epoch": 7.301717089125102, "grad_norm": 0.14718078076839447, "learning_rate": 5.630594560580298e-05, "loss": 1.2951, "mean_token_accuracy": 0.7587728559970855, "num_tokens": 1925575763.0, "step": 26790 }, { "entropy": 0.8790650695562363, "epoch": 7.304442627418915, "grad_norm": 0.15892545878887177, "learning_rate": 5.62761402551239e-05, "loss": 1.2928, "mean_token_accuracy": 0.7535487607121467, "num_tokens": 1926296917.0, "step": 26800 }, { "entropy": 0.8677218273282051, "epoch": 7.307168165712728, "grad_norm": 0.13702869415283203, "learning_rate": 5.6246332638384966e-05, "loss": 1.2863, "mean_token_accuracy": 0.7585681483149529, "num_tokens": 1927027864.0, "step": 26810 }, { "entropy": 0.8745145723223686, "epoch": 7.309893704006542, "grad_norm": 0.1458585262298584, "learning_rate": 5.6216522766348546e-05, "loss": 1.3009, "mean_token_accuracy": 0.7565836235880852, "num_tokens": 1927750164.0, "step": 26820 }, { "entropy": 0.8716302827000618, "epoch": 7.312619242300355, "grad_norm": 0.14542189240455627, "learning_rate": 5.618671064977772e-05, "loss": 1.2965, "mean_token_accuracy": 0.7582589849829674, "num_tokens": 1928472162.0, "step": 26830 }, { "entropy": 0.8728285521268845, "epoch": 7.315344780594168, "grad_norm": 0.1470698118209839, "learning_rate": 5.615689629943647e-05, "loss": 1.2997, "mean_token_accuracy": 0.7578873261809349, "num_tokens": 1929196879.0, "step": 26840 }, { "entropy": 0.8646959900856018, "epoch": 7.3180703188879805, "grad_norm": 0.14543084800243378, "learning_rate": 5.612707972608955e-05, "loss": 1.296, "mean_token_accuracy": 0.7581882014870643, "num_tokens": 1929906321.0, "step": 26850 }, { "entropy": 0.8686492219567299, "epoch": 7.3207958571817935, "grad_norm": 0.15842905640602112, "learning_rate": 5.60972609405025e-05, "loss": 1.2863, "mean_token_accuracy": 0.7616284027695656, "num_tokens": 1930641616.0, "step": 26860 }, { "entropy": 0.8771625027060509, "epoch": 7.323521395475606, "grad_norm": 0.14808574318885803, "learning_rate": 5.606743995344167e-05, "loss": 1.2988, "mean_token_accuracy": 0.7534963071346283, "num_tokens": 1931348000.0, "step": 26870 }, { "entropy": 0.8703848287463188, "epoch": 7.326246933769419, "grad_norm": 0.14173507690429688, "learning_rate": 5.603761677567424e-05, "loss": 1.2915, "mean_token_accuracy": 0.7567645877599716, "num_tokens": 1932061448.0, "step": 26880 }, { "entropy": 0.875830689072609, "epoch": 7.328972472063232, "grad_norm": 0.14382077753543854, "learning_rate": 5.6007791417968114e-05, "loss": 1.3019, "mean_token_accuracy": 0.7579288348555565, "num_tokens": 1932790003.0, "step": 26890 }, { "entropy": 0.8764667242765427, "epoch": 7.331698010357045, "grad_norm": 0.1480296105146408, "learning_rate": 5.597796389109205e-05, "loss": 1.305, "mean_token_accuracy": 0.7592344105243682, "num_tokens": 1933516726.0, "step": 26900 }, { "entropy": 0.8774703487753868, "epoch": 7.334423548650858, "grad_norm": 0.15020212531089783, "learning_rate": 5.594813420581554e-05, "loss": 1.3004, "mean_token_accuracy": 0.7581730052828789, "num_tokens": 1934247798.0, "step": 26910 }, { "entropy": 0.8736540108919144, "epoch": 7.337149086944671, "grad_norm": 0.15321451425552368, "learning_rate": 5.591830237290887e-05, "loss": 1.2876, "mean_token_accuracy": 0.7563091889023781, "num_tokens": 1934980623.0, "step": 26920 }, { "entropy": 0.8708978682756424, "epoch": 7.339874625238485, "grad_norm": 0.14175894856452942, "learning_rate": 5.588846840314313e-05, "loss": 1.2889, "mean_token_accuracy": 0.7525080293416977, "num_tokens": 1935691312.0, "step": 26930 }, { "entropy": 0.8693087965250015, "epoch": 7.342600163532298, "grad_norm": 0.1484062820672989, "learning_rate": 5.585863230729015e-05, "loss": 1.2924, "mean_token_accuracy": 0.7605011075735092, "num_tokens": 1936412220.0, "step": 26940 }, { "entropy": 0.8658810436725617, "epoch": 7.345325701826111, "grad_norm": 0.14559951424598694, "learning_rate": 5.582879409612252e-05, "loss": 1.2841, "mean_token_accuracy": 0.7626533910632134, "num_tokens": 1937137010.0, "step": 26950 }, { "entropy": 0.8778633654117585, "epoch": 7.348051240119924, "grad_norm": 0.13812687993049622, "learning_rate": 5.57989537804136e-05, "loss": 1.2947, "mean_token_accuracy": 0.7557541623711586, "num_tokens": 1937853165.0, "step": 26960 }, { "entropy": 0.8690854504704475, "epoch": 7.350776778413737, "grad_norm": 0.1555824875831604, "learning_rate": 5.576911137093755e-05, "loss": 1.2918, "mean_token_accuracy": 0.7585563018918038, "num_tokens": 1938584116.0, "step": 26970 }, { "entropy": 0.8780083298683167, "epoch": 7.35350231670755, "grad_norm": 0.1554984301328659, "learning_rate": 5.5739266878469244e-05, "loss": 1.2906, "mean_token_accuracy": 0.7591735869646072, "num_tokens": 1939314489.0, "step": 26980 }, { "entropy": 0.8686507850885391, "epoch": 7.356227855001363, "grad_norm": 0.1445007026195526, "learning_rate": 5.570942031378431e-05, "loss": 1.2948, "mean_token_accuracy": 0.7603983774781227, "num_tokens": 1940039701.0, "step": 26990 }, { "entropy": 0.8691764920949936, "epoch": 7.358953393295176, "grad_norm": 0.1479530930519104, "learning_rate": 5.567957168765914e-05, "loss": 1.2934, "mean_token_accuracy": 0.757313358783722, "num_tokens": 1940745127.0, "step": 27000 }, { "entropy": 0.8695494890213012, "epoch": 7.361678931588989, "grad_norm": 0.16647686064243317, "learning_rate": 5.564972101087085e-05, "loss": 1.2994, "mean_token_accuracy": 0.7575660184025764, "num_tokens": 1941473340.0, "step": 27010 }, { "entropy": 0.8801256656646729, "epoch": 7.3644044698828015, "grad_norm": 0.16509966552257538, "learning_rate": 5.561986829419731e-05, "loss": 1.299, "mean_token_accuracy": 0.7550579234957695, "num_tokens": 1942196825.0, "step": 27020 }, { "entropy": 0.87327411621809, "epoch": 7.3671300081766145, "grad_norm": 0.1618693321943283, "learning_rate": 5.5590013548417144e-05, "loss": 1.3043, "mean_token_accuracy": 0.7550663352012634, "num_tokens": 1942911042.0, "step": 27030 }, { "entropy": 0.8774277091026306, "epoch": 7.369855546470428, "grad_norm": 0.20013737678527832, "learning_rate": 5.556015678430968e-05, "loss": 1.2973, "mean_token_accuracy": 0.7544228315353394, "num_tokens": 1943632151.0, "step": 27040 }, { "entropy": 0.8747197523713112, "epoch": 7.372581084764241, "grad_norm": 0.1496356576681137, "learning_rate": 5.553029801265499e-05, "loss": 1.3001, "mean_token_accuracy": 0.757723331451416, "num_tokens": 1944350133.0, "step": 27050 }, { "entropy": 0.8781649515032768, "epoch": 7.375306623058054, "grad_norm": 0.14166666567325592, "learning_rate": 5.550043724423386e-05, "loss": 1.2967, "mean_token_accuracy": 0.7560077399015427, "num_tokens": 1945065543.0, "step": 27060 }, { "entropy": 0.8705385491251946, "epoch": 7.378032161351867, "grad_norm": 0.14302848279476166, "learning_rate": 5.547057448982781e-05, "loss": 1.299, "mean_token_accuracy": 0.7566994354128838, "num_tokens": 1945786897.0, "step": 27070 }, { "entropy": 0.8793146178126335, "epoch": 7.38075769964568, "grad_norm": 0.15471141040325165, "learning_rate": 5.544070976021907e-05, "loss": 1.2983, "mean_token_accuracy": 0.7566537842154503, "num_tokens": 1946507446.0, "step": 27080 }, { "entropy": 0.8735587447881699, "epoch": 7.383483237939493, "grad_norm": 0.1450737714767456, "learning_rate": 5.541084306619056e-05, "loss": 1.3035, "mean_token_accuracy": 0.7568038001656532, "num_tokens": 1947216149.0, "step": 27090 }, { "entropy": 0.8783910438418389, "epoch": 7.386208776233306, "grad_norm": 0.14964261651039124, "learning_rate": 5.5380974418525965e-05, "loss": 1.3089, "mean_token_accuracy": 0.7551267296075821, "num_tokens": 1947932134.0, "step": 27100 }, { "entropy": 0.8729043811559677, "epoch": 7.388934314527119, "grad_norm": 0.15176354348659515, "learning_rate": 5.535110382800963e-05, "loss": 1.3021, "mean_token_accuracy": 0.7548694238066673, "num_tokens": 1948644380.0, "step": 27110 }, { "entropy": 0.8665193617343903, "epoch": 7.391659852820932, "grad_norm": 0.15515904128551483, "learning_rate": 5.5321231305426616e-05, "loss": 1.2964, "mean_token_accuracy": 0.7560141786932946, "num_tokens": 1949344586.0, "step": 27120 }, { "entropy": 0.8758058831095695, "epoch": 7.394385391114745, "grad_norm": 0.14520084857940674, "learning_rate": 5.529135686156266e-05, "loss": 1.307, "mean_token_accuracy": 0.7543540596961975, "num_tokens": 1950046275.0, "step": 27130 }, { "entropy": 0.8598334476351738, "epoch": 7.397110929408559, "grad_norm": 0.14953961968421936, "learning_rate": 5.5261480507204255e-05, "loss": 1.2895, "mean_token_accuracy": 0.7635306343436241, "num_tokens": 1950777609.0, "step": 27140 }, { "entropy": 0.8784276217222213, "epoch": 7.399836467702372, "grad_norm": 0.14264141023159027, "learning_rate": 5.52316022531385e-05, "loss": 1.3017, "mean_token_accuracy": 0.756753858923912, "num_tokens": 1951504210.0, "step": 27150 }, { "entropy": 0.8731119826436042, "epoch": 7.4025620059961845, "grad_norm": 0.14532233774662018, "learning_rate": 5.5201722110153244e-05, "loss": 1.2976, "mean_token_accuracy": 0.7603534251451493, "num_tokens": 1952236971.0, "step": 27160 }, { "entropy": 0.8778833121061325, "epoch": 7.4052875442899975, "grad_norm": 0.15055438876152039, "learning_rate": 5.517184008903699e-05, "loss": 1.2967, "mean_token_accuracy": 0.7536444157361984, "num_tokens": 1952944489.0, "step": 27170 }, { "entropy": 0.88260188549757, "epoch": 7.40801308258381, "grad_norm": 0.14573059976100922, "learning_rate": 5.5141956200578914e-05, "loss": 1.3108, "mean_token_accuracy": 0.7570423111319542, "num_tokens": 1953671895.0, "step": 27180 }, { "entropy": 0.871610289812088, "epoch": 7.410738620877623, "grad_norm": 0.14601604640483856, "learning_rate": 5.51120704555689e-05, "loss": 1.2873, "mean_token_accuracy": 0.758485485613346, "num_tokens": 1954401100.0, "step": 27190 }, { "entropy": 0.8706778183579444, "epoch": 7.413464159171436, "grad_norm": 0.17026714980602264, "learning_rate": 5.508218286479746e-05, "loss": 1.2944, "mean_token_accuracy": 0.7586376383900643, "num_tokens": 1955119071.0, "step": 27200 }, { "entropy": 0.8755591064691544, "epoch": 7.416189697465249, "grad_norm": 0.13916918635368347, "learning_rate": 5.5052293439055804e-05, "loss": 1.2944, "mean_token_accuracy": 0.7645180627703667, "num_tokens": 1955867848.0, "step": 27210 }, { "entropy": 0.8669392347335816, "epoch": 7.418915235759062, "grad_norm": 0.21698226034641266, "learning_rate": 5.502240218913577e-05, "loss": 1.2882, "mean_token_accuracy": 0.7592273488640785, "num_tokens": 1956583663.0, "step": 27220 }, { "entropy": 0.870184437930584, "epoch": 7.421640774052875, "grad_norm": 0.14668874442577362, "learning_rate": 5.499250912582992e-05, "loss": 1.2976, "mean_token_accuracy": 0.75679152905941, "num_tokens": 1957298917.0, "step": 27230 }, { "entropy": 0.8762162327766418, "epoch": 7.424366312346688, "grad_norm": 0.150191068649292, "learning_rate": 5.4962614259931365e-05, "loss": 1.3014, "mean_token_accuracy": 0.7538296952843666, "num_tokens": 1958019543.0, "step": 27240 }, { "entropy": 0.8609578981995583, "epoch": 7.427091850640501, "grad_norm": 0.15371190011501312, "learning_rate": 5.4932717602233985e-05, "loss": 1.2919, "mean_token_accuracy": 0.7573593899607658, "num_tokens": 1958725145.0, "step": 27250 }, { "entropy": 0.8777864828705788, "epoch": 7.429817388934315, "grad_norm": 0.1603131741285324, "learning_rate": 5.4902819163532224e-05, "loss": 1.3016, "mean_token_accuracy": 0.7558649733662606, "num_tokens": 1959453162.0, "step": 27260 }, { "entropy": 0.8782357349991798, "epoch": 7.432542927228128, "grad_norm": 0.14163288474082947, "learning_rate": 5.48729189546212e-05, "loss": 1.3043, "mean_token_accuracy": 0.7551824197173118, "num_tokens": 1960167109.0, "step": 27270 }, { "entropy": 0.8796595558524132, "epoch": 7.435268465521941, "grad_norm": 0.1622946560382843, "learning_rate": 5.484301698629667e-05, "loss": 1.3034, "mean_token_accuracy": 0.7564584419131279, "num_tokens": 1960888368.0, "step": 27280 }, { "entropy": 0.8698703140020371, "epoch": 7.437994003815754, "grad_norm": 0.14658711850643158, "learning_rate": 5.4813113269355035e-05, "loss": 1.3043, "mean_token_accuracy": 0.7558253839612007, "num_tokens": 1961592155.0, "step": 27290 }, { "entropy": 0.8798405855894089, "epoch": 7.440719542109567, "grad_norm": 0.1534138321876526, "learning_rate": 5.4783207814593286e-05, "loss": 1.3005, "mean_token_accuracy": 0.7533506646752357, "num_tokens": 1962301630.0, "step": 27300 }, { "entropy": 0.8711357161402702, "epoch": 7.44344508040338, "grad_norm": 0.1563558578491211, "learning_rate": 5.475330063280909e-05, "loss": 1.2939, "mean_token_accuracy": 0.7589615762233735, "num_tokens": 1963029478.0, "step": 27310 }, { "entropy": 0.874621294438839, "epoch": 7.4461706186971925, "grad_norm": 0.17626208066940308, "learning_rate": 5.472339173480072e-05, "loss": 1.2976, "mean_token_accuracy": 0.762251828610897, "num_tokens": 1963755758.0, "step": 27320 }, { "entropy": 0.8707356587052345, "epoch": 7.4488961569910055, "grad_norm": 0.14620471000671387, "learning_rate": 5.4693481131367053e-05, "loss": 1.2902, "mean_token_accuracy": 0.760369473695755, "num_tokens": 1964482144.0, "step": 27330 }, { "entropy": 0.8790704697370529, "epoch": 7.451621695284818, "grad_norm": 0.1517985761165619, "learning_rate": 5.466356883330761e-05, "loss": 1.3049, "mean_token_accuracy": 0.7572114810347557, "num_tokens": 1965187783.0, "step": 27340 }, { "entropy": 0.8741227284073829, "epoch": 7.454347233578631, "grad_norm": 0.15087679028511047, "learning_rate": 5.46336548514225e-05, "loss": 1.3024, "mean_token_accuracy": 0.7526372775435448, "num_tokens": 1965896017.0, "step": 27350 }, { "entropy": 0.8820385470986366, "epoch": 7.457072771872445, "grad_norm": 0.1478431671857834, "learning_rate": 5.460373919651245e-05, "loss": 1.304, "mean_token_accuracy": 0.7544811740517616, "num_tokens": 1966614752.0, "step": 27360 }, { "entropy": 0.86817337423563, "epoch": 7.459798310166258, "grad_norm": 0.14179888367652893, "learning_rate": 5.45738218793788e-05, "loss": 1.2929, "mean_token_accuracy": 0.7584007635712624, "num_tokens": 1967326882.0, "step": 27370 }, { "entropy": 0.8750143766403198, "epoch": 7.462523848460071, "grad_norm": 0.15783092379570007, "learning_rate": 5.454390291082346e-05, "loss": 1.306, "mean_token_accuracy": 0.7565370664000511, "num_tokens": 1968045004.0, "step": 27380 }, { "entropy": 0.8752815082669259, "epoch": 7.465249386753884, "grad_norm": 0.143658846616745, "learning_rate": 5.451398230164897e-05, "loss": 1.2927, "mean_token_accuracy": 0.7576921477913856, "num_tokens": 1968757703.0, "step": 27390 }, { "entropy": 0.8686357542872429, "epoch": 7.467974925047697, "grad_norm": 0.16239280998706818, "learning_rate": 5.448406006265846e-05, "loss": 1.2898, "mean_token_accuracy": 0.7560498282313347, "num_tokens": 1969467259.0, "step": 27400 }, { "entropy": 0.8754814326763153, "epoch": 7.47070046334151, "grad_norm": 0.14713862538337708, "learning_rate": 5.4454136204655624e-05, "loss": 1.2993, "mean_token_accuracy": 0.7532849207520484, "num_tokens": 1970171090.0, "step": 27410 }, { "entropy": 0.878950223326683, "epoch": 7.473426001635323, "grad_norm": 0.14513806998729706, "learning_rate": 5.442421073844475e-05, "loss": 1.2991, "mean_token_accuracy": 0.7543308869004249, "num_tokens": 1970875920.0, "step": 27420 }, { "entropy": 0.8695757389068604, "epoch": 7.476151539929136, "grad_norm": 0.1472143828868866, "learning_rate": 5.439428367483072e-05, "loss": 1.281, "mean_token_accuracy": 0.75978524684906, "num_tokens": 1971613157.0, "step": 27430 }, { "entropy": 0.8697513654828072, "epoch": 7.478877078222949, "grad_norm": 0.14886444807052612, "learning_rate": 5.436435502461897e-05, "loss": 1.2883, "mean_token_accuracy": 0.7608008369803428, "num_tokens": 1972352268.0, "step": 27440 }, { "entropy": 0.8863059863448143, "epoch": 7.481602616516762, "grad_norm": 0.15480509400367737, "learning_rate": 5.4334424798615546e-05, "loss": 1.3142, "mean_token_accuracy": 0.7498865917325019, "num_tokens": 1973057486.0, "step": 27450 }, { "entropy": 0.870640966296196, "epoch": 7.484328154810575, "grad_norm": 0.1481386125087738, "learning_rate": 5.430449300762702e-05, "loss": 1.3039, "mean_token_accuracy": 0.7583491995930671, "num_tokens": 1973770465.0, "step": 27460 }, { "entropy": 0.8789900720119477, "epoch": 7.4870536931043885, "grad_norm": 0.14939655363559723, "learning_rate": 5.427455966246057e-05, "loss": 1.3076, "mean_token_accuracy": 0.7516216769814491, "num_tokens": 1974475301.0, "step": 27470 }, { "entropy": 0.8683831721544266, "epoch": 7.4897792313982015, "grad_norm": 0.14119526743888855, "learning_rate": 5.424462477392388e-05, "loss": 1.292, "mean_token_accuracy": 0.7570024654269218, "num_tokens": 1975181148.0, "step": 27480 }, { "entropy": 0.8829577803611756, "epoch": 7.492504769692014, "grad_norm": 0.15738560259342194, "learning_rate": 5.421468835282524e-05, "loss": 1.3134, "mean_token_accuracy": 0.751892414689064, "num_tokens": 1975894738.0, "step": 27490 }, { "entropy": 0.8754595801234245, "epoch": 7.495230307985827, "grad_norm": 0.16415882110595703, "learning_rate": 5.418475040997348e-05, "loss": 1.3025, "mean_token_accuracy": 0.7552436009049416, "num_tokens": 1976604250.0, "step": 27500 }, { "entropy": 0.8759715840220451, "epoch": 7.49795584627964, "grad_norm": 0.15219652652740479, "learning_rate": 5.4154810956177994e-05, "loss": 1.3003, "mean_token_accuracy": 0.7568041488528252, "num_tokens": 1977319582.0, "step": 27510 }, { "entropy": 0.874935844540596, "epoch": 7.500681384573453, "grad_norm": 0.1453443467617035, "learning_rate": 5.412487000224868e-05, "loss": 1.2957, "mean_token_accuracy": 0.7554998025298119, "num_tokens": 1978036600.0, "step": 27520 }, { "entropy": 0.8738935187458992, "epoch": 7.503406922867266, "grad_norm": 0.146016925573349, "learning_rate": 5.409492755899602e-05, "loss": 1.2973, "mean_token_accuracy": 0.7545162200927734, "num_tokens": 1978750720.0, "step": 27530 }, { "entropy": 0.8722354531288147, "epoch": 7.506132461161079, "grad_norm": 0.14861078560352325, "learning_rate": 5.4064983637231016e-05, "loss": 1.3033, "mean_token_accuracy": 0.7554042488336563, "num_tokens": 1979460934.0, "step": 27540 }, { "entropy": 0.8751856788992882, "epoch": 7.508857999454892, "grad_norm": 0.15488703548908234, "learning_rate": 5.403503824776518e-05, "loss": 1.2938, "mean_token_accuracy": 0.7567870914936066, "num_tokens": 1980177931.0, "step": 27550 }, { "entropy": 0.8693725138902664, "epoch": 7.511583537748705, "grad_norm": 0.17622137069702148, "learning_rate": 5.400509140141061e-05, "loss": 1.2986, "mean_token_accuracy": 0.7618825286626816, "num_tokens": 1980909112.0, "step": 27560 }, { "entropy": 0.875079782307148, "epoch": 7.514309076042519, "grad_norm": 0.14566169679164886, "learning_rate": 5.397514310897988e-05, "loss": 1.2971, "mean_token_accuracy": 0.7558818951249122, "num_tokens": 1981630452.0, "step": 27570 }, { "entropy": 0.8672457680106163, "epoch": 7.517034614336332, "grad_norm": 0.15224742889404297, "learning_rate": 5.3945193381286095e-05, "loss": 1.2867, "mean_token_accuracy": 0.7568916633725167, "num_tokens": 1982352311.0, "step": 27580 }, { "entropy": 0.8709974974393845, "epoch": 7.519760152630145, "grad_norm": 0.14790773391723633, "learning_rate": 5.391524222914293e-05, "loss": 1.299, "mean_token_accuracy": 0.7587826490402222, "num_tokens": 1983071543.0, "step": 27590 }, { "entropy": 0.8683429807424545, "epoch": 7.522485690923958, "grad_norm": 0.14690671861171722, "learning_rate": 5.388528966336448e-05, "loss": 1.3012, "mean_token_accuracy": 0.7594067826867104, "num_tokens": 1983786649.0, "step": 27600 }, { "entropy": 0.8661997959017753, "epoch": 7.525211229217771, "grad_norm": 0.16435834765434265, "learning_rate": 5.385533569476543e-05, "loss": 1.2879, "mean_token_accuracy": 0.7576445356011391, "num_tokens": 1984501021.0, "step": 27610 }, { "entropy": 0.8720558568835258, "epoch": 7.527936767511584, "grad_norm": 0.15992335975170135, "learning_rate": 5.3825380334160955e-05, "loss": 1.293, "mean_token_accuracy": 0.7589874520897866, "num_tokens": 1985223828.0, "step": 27620 }, { "entropy": 0.8726562917232513, "epoch": 7.5306623058053965, "grad_norm": 0.15062344074249268, "learning_rate": 5.379542359236669e-05, "loss": 1.2995, "mean_token_accuracy": 0.7584767267107964, "num_tokens": 1985941467.0, "step": 27630 }, { "entropy": 0.8708229914307595, "epoch": 7.5333878440992095, "grad_norm": 0.15603512525558472, "learning_rate": 5.376546548019882e-05, "loss": 1.2933, "mean_token_accuracy": 0.7633575603365899, "num_tokens": 1986676136.0, "step": 27640 }, { "entropy": 0.8802310168743134, "epoch": 7.536113382393022, "grad_norm": 0.1490899622440338, "learning_rate": 5.3735506008474e-05, "loss": 1.3043, "mean_token_accuracy": 0.7534748643636704, "num_tokens": 1987392447.0, "step": 27650 }, { "entropy": 0.8674998924136161, "epoch": 7.538838920686835, "grad_norm": 0.1464938372373581, "learning_rate": 5.370554518800938e-05, "loss": 1.2942, "mean_token_accuracy": 0.7565787047147751, "num_tokens": 1988102176.0, "step": 27660 }, { "entropy": 0.8758485689759254, "epoch": 7.541564458980648, "grad_norm": 0.16097642481327057, "learning_rate": 5.367558302962261e-05, "loss": 1.3015, "mean_token_accuracy": 0.7581014633178711, "num_tokens": 1988829150.0, "step": 27670 }, { "entropy": 0.8719006225466728, "epoch": 7.544289997274461, "grad_norm": 0.14630360901355743, "learning_rate": 5.364561954413179e-05, "loss": 1.291, "mean_token_accuracy": 0.758354552090168, "num_tokens": 1989552435.0, "step": 27680 }, { "entropy": 0.8725865796208382, "epoch": 7.547015535568275, "grad_norm": 0.14534975588321686, "learning_rate": 5.361565474235553e-05, "loss": 1.2947, "mean_token_accuracy": 0.7572773873806, "num_tokens": 1990277435.0, "step": 27690 }, { "entropy": 0.8703749105334282, "epoch": 7.549741073862088, "grad_norm": 0.15353354811668396, "learning_rate": 5.3585688635112905e-05, "loss": 1.2975, "mean_token_accuracy": 0.7611069425940513, "num_tokens": 1991010665.0, "step": 27700 }, { "entropy": 0.8728433132171631, "epoch": 7.552466612155901, "grad_norm": 0.14781498908996582, "learning_rate": 5.355572123322348e-05, "loss": 1.2978, "mean_token_accuracy": 0.7551047176122665, "num_tokens": 1991721417.0, "step": 27710 }, { "entropy": 0.8746820703148842, "epoch": 7.555192150449714, "grad_norm": 0.14716841280460358, "learning_rate": 5.352575254750723e-05, "loss": 1.3009, "mean_token_accuracy": 0.7551755025982857, "num_tokens": 1992448824.0, "step": 27720 }, { "entropy": 0.8664837598800659, "epoch": 7.557917688743527, "grad_norm": 0.1486971527338028, "learning_rate": 5.349578258878466e-05, "loss": 1.2968, "mean_token_accuracy": 0.7625233814120292, "num_tokens": 1993176475.0, "step": 27730 }, { "entropy": 0.8618240833282471, "epoch": 7.56064322703734, "grad_norm": 0.1519266813993454, "learning_rate": 5.34658113678767e-05, "loss": 1.2853, "mean_token_accuracy": 0.7587587416172028, "num_tokens": 1993886616.0, "step": 27740 }, { "entropy": 0.8753886893391609, "epoch": 7.563368765331153, "grad_norm": 0.14492467045783997, "learning_rate": 5.343583889560474e-05, "loss": 1.2973, "mean_token_accuracy": 0.7597087681293487, "num_tokens": 1994620813.0, "step": 27750 }, { "entropy": 0.8721052780747414, "epoch": 7.566094303624966, "grad_norm": 0.14899621903896332, "learning_rate": 5.340586518279064e-05, "loss": 1.3009, "mean_token_accuracy": 0.7571509644389153, "num_tokens": 1995334839.0, "step": 27760 }, { "entropy": 0.873625734448433, "epoch": 7.568819841918779, "grad_norm": 0.15280811488628387, "learning_rate": 5.337589024025668e-05, "loss": 1.3065, "mean_token_accuracy": 0.7560456842184067, "num_tokens": 1996042429.0, "step": 27770 }, { "entropy": 0.8739833995699883, "epoch": 7.571545380212592, "grad_norm": 0.15121133625507355, "learning_rate": 5.334591407882559e-05, "loss": 1.296, "mean_token_accuracy": 0.7578023582696914, "num_tokens": 1996763238.0, "step": 27780 }, { "entropy": 0.8746642336249352, "epoch": 7.574270918506405, "grad_norm": 0.14567768573760986, "learning_rate": 5.331593670932057e-05, "loss": 1.2883, "mean_token_accuracy": 0.7543858543038369, "num_tokens": 1997473219.0, "step": 27790 }, { "entropy": 0.87596046179533, "epoch": 7.576996456800218, "grad_norm": 0.15322861075401306, "learning_rate": 5.328595814256521e-05, "loss": 1.2992, "mean_token_accuracy": 0.7527386784553528, "num_tokens": 1998180186.0, "step": 27800 }, { "entropy": 0.8672592014074325, "epoch": 7.579721995094031, "grad_norm": 0.15870657563209534, "learning_rate": 5.325597838938355e-05, "loss": 1.2901, "mean_token_accuracy": 0.76070666462183, "num_tokens": 1998904004.0, "step": 27810 }, { "entropy": 0.8716690674424171, "epoch": 7.582447533387844, "grad_norm": 0.1436341106891632, "learning_rate": 5.3225997460600105e-05, "loss": 1.2896, "mean_token_accuracy": 0.7607816740870476, "num_tokens": 1999651781.0, "step": 27820 }, { "entropy": 0.8652073204517364, "epoch": 7.585173071681657, "grad_norm": 0.16149428486824036, "learning_rate": 5.319601536703972e-05, "loss": 1.2879, "mean_token_accuracy": 0.7590062454342842, "num_tokens": 2000364603.0, "step": 27830 }, { "entropy": 0.8689879328012466, "epoch": 7.58789860997547, "grad_norm": 0.148299440741539, "learning_rate": 5.316603211952775e-05, "loss": 1.2939, "mean_token_accuracy": 0.7555256754159927, "num_tokens": 2001078895.0, "step": 27840 }, { "entropy": 0.872168904542923, "epoch": 7.590624148269283, "grad_norm": 0.14846102893352509, "learning_rate": 5.3136047728889926e-05, "loss": 1.2955, "mean_token_accuracy": 0.7549246683716774, "num_tokens": 2001791417.0, "step": 27850 }, { "entropy": 0.8768918186426162, "epoch": 7.593349686563096, "grad_norm": 0.14368847012519836, "learning_rate": 5.310606220595238e-05, "loss": 1.2963, "mean_token_accuracy": 0.7554072514176369, "num_tokens": 2002515932.0, "step": 27860 }, { "entropy": 0.8717198982834816, "epoch": 7.596075224856909, "grad_norm": 0.14632409811019897, "learning_rate": 5.3076075561541675e-05, "loss": 1.2958, "mean_token_accuracy": 0.7551713183522224, "num_tokens": 2003222492.0, "step": 27870 }, { "entropy": 0.8790291532874107, "epoch": 7.598800763150722, "grad_norm": 0.1530723124742508, "learning_rate": 5.304608780648479e-05, "loss": 1.3143, "mean_token_accuracy": 0.7510809034109116, "num_tokens": 2003929619.0, "step": 27880 }, { "entropy": 0.8678181394934654, "epoch": 7.601526301444535, "grad_norm": 0.14335593581199646, "learning_rate": 5.301609895160906e-05, "loss": 1.2984, "mean_token_accuracy": 0.7595829129219055, "num_tokens": 2004650738.0, "step": 27890 }, { "entropy": 0.8779300346970558, "epoch": 7.604251839738348, "grad_norm": 0.16247470676898956, "learning_rate": 5.2986109007742256e-05, "loss": 1.2989, "mean_token_accuracy": 0.7545091077685356, "num_tokens": 2005370340.0, "step": 27900 }, { "entropy": 0.8720334753394127, "epoch": 7.606977378032162, "grad_norm": 0.15210209786891937, "learning_rate": 5.295611798571255e-05, "loss": 1.2955, "mean_token_accuracy": 0.7591853260993957, "num_tokens": 2006095537.0, "step": 27910 }, { "entropy": 0.8750460058450699, "epoch": 7.609702916325975, "grad_norm": 0.15534533560276031, "learning_rate": 5.2926125896348455e-05, "loss": 1.298, "mean_token_accuracy": 0.7603192970156669, "num_tokens": 2006829278.0, "step": 27920 }, { "entropy": 0.8695294588804245, "epoch": 7.612428454619788, "grad_norm": 0.15298064053058624, "learning_rate": 5.2896132750478914e-05, "loss": 1.3013, "mean_token_accuracy": 0.7559292703866959, "num_tokens": 2007537533.0, "step": 27930 }, { "entropy": 0.874238470196724, "epoch": 7.6151539929136005, "grad_norm": 0.150922030210495, "learning_rate": 5.286613855893322e-05, "loss": 1.296, "mean_token_accuracy": 0.7546189114451408, "num_tokens": 2008248282.0, "step": 27940 }, { "entropy": 0.86860870718956, "epoch": 7.6178795312074135, "grad_norm": 0.1464589536190033, "learning_rate": 5.28361433325411e-05, "loss": 1.2875, "mean_token_accuracy": 0.7599435091018677, "num_tokens": 2008974839.0, "step": 27950 }, { "entropy": 0.8728788539767265, "epoch": 7.620605069501226, "grad_norm": 0.1423725187778473, "learning_rate": 5.2806147082132575e-05, "loss": 1.2966, "mean_token_accuracy": 0.7579036712646484, "num_tokens": 2009694196.0, "step": 27960 }, { "entropy": 0.8673812478780747, "epoch": 7.623330607795039, "grad_norm": 0.1488499939441681, "learning_rate": 5.277614981853808e-05, "loss": 1.2921, "mean_token_accuracy": 0.7593614980578423, "num_tokens": 2010416044.0, "step": 27970 }, { "entropy": 0.8709435850381851, "epoch": 7.626056146088852, "grad_norm": 0.15130707621574402, "learning_rate": 5.274615155258842e-05, "loss": 1.293, "mean_token_accuracy": 0.7609807163476944, "num_tokens": 2011150351.0, "step": 27980 }, { "entropy": 0.8771456077694892, "epoch": 7.628781684382665, "grad_norm": 0.16368922591209412, "learning_rate": 5.271615229511475e-05, "loss": 1.3004, "mean_token_accuracy": 0.7585861459374428, "num_tokens": 2011875815.0, "step": 27990 }, { "entropy": 0.8724688425660133, "epoch": 7.631507222676479, "grad_norm": 0.15537528693675995, "learning_rate": 5.268615205694861e-05, "loss": 1.2998, "mean_token_accuracy": 0.7584230929613114, "num_tokens": 2012593558.0, "step": 28000 }, { "entropy": 0.8713582247495651, "epoch": 7.634232760970292, "grad_norm": 0.15075698494911194, "learning_rate": 5.2656150848921826e-05, "loss": 1.293, "mean_token_accuracy": 0.7569369345903396, "num_tokens": 2013310383.0, "step": 28010 }, { "entropy": 0.8728232637047768, "epoch": 7.636958299264105, "grad_norm": 0.1428200602531433, "learning_rate": 5.262614868186665e-05, "loss": 1.2967, "mean_token_accuracy": 0.7571837827563286, "num_tokens": 2014029852.0, "step": 28020 }, { "entropy": 0.8691148728132247, "epoch": 7.639683837557918, "grad_norm": 0.14623454213142395, "learning_rate": 5.259614556661564e-05, "loss": 1.2954, "mean_token_accuracy": 0.7571438029408455, "num_tokens": 2014749163.0, "step": 28030 }, { "entropy": 0.8800149992108345, "epoch": 7.642409375851731, "grad_norm": 0.1505279541015625, "learning_rate": 5.256614151400169e-05, "loss": 1.2967, "mean_token_accuracy": 0.7544341444969177, "num_tokens": 2015471406.0, "step": 28040 }, { "entropy": 0.8720920726656913, "epoch": 7.645134914145544, "grad_norm": 0.14527486264705658, "learning_rate": 5.253613653485806e-05, "loss": 1.3012, "mean_token_accuracy": 0.7559257552027703, "num_tokens": 2016184202.0, "step": 28050 }, { "entropy": 0.8746996775269509, "epoch": 7.647860452439357, "grad_norm": 0.1468832790851593, "learning_rate": 5.250613064001835e-05, "loss": 1.295, "mean_token_accuracy": 0.754166205227375, "num_tokens": 2016898886.0, "step": 28060 }, { "entropy": 0.8767225205898285, "epoch": 7.65058599073317, "grad_norm": 0.14846216142177582, "learning_rate": 5.247612384031644e-05, "loss": 1.3017, "mean_token_accuracy": 0.7529629811644554, "num_tokens": 2017606335.0, "step": 28070 }, { "entropy": 0.8717394858598709, "epoch": 7.653311529026983, "grad_norm": 0.1528032273054123, "learning_rate": 5.2446116146586576e-05, "loss": 1.2919, "mean_token_accuracy": 0.7587347462773323, "num_tokens": 2018336966.0, "step": 28080 }, { "entropy": 0.8684518188238144, "epoch": 7.656037067320796, "grad_norm": 0.1458507925271988, "learning_rate": 5.241610756966334e-05, "loss": 1.2909, "mean_token_accuracy": 0.7595139756798744, "num_tokens": 2019060486.0, "step": 28090 }, { "entropy": 0.8723010882735253, "epoch": 7.6587626056146085, "grad_norm": 0.15268127620220184, "learning_rate": 5.23860981203816e-05, "loss": 1.299, "mean_token_accuracy": 0.7563619449734688, "num_tokens": 2019775885.0, "step": 28100 }, { "entropy": 0.8726183950901032, "epoch": 7.6614881439084215, "grad_norm": 0.16130176186561584, "learning_rate": 5.2356087809576537e-05, "loss": 1.2984, "mean_token_accuracy": 0.7603875428438187, "num_tokens": 2020506495.0, "step": 28110 }, { "entropy": 0.8787395536899567, "epoch": 7.664213682202235, "grad_norm": 0.14795050024986267, "learning_rate": 5.2326076648083686e-05, "loss": 1.3029, "mean_token_accuracy": 0.7544093638658523, "num_tokens": 2021231415.0, "step": 28120 }, { "entropy": 0.8735887467861175, "epoch": 7.666939220496048, "grad_norm": 0.15643061697483063, "learning_rate": 5.229606464673884e-05, "loss": 1.2996, "mean_token_accuracy": 0.7532265886664391, "num_tokens": 2021946770.0, "step": 28130 }, { "entropy": 0.8820726230740548, "epoch": 7.669664758789861, "grad_norm": 0.14852860569953918, "learning_rate": 5.226605181637812e-05, "loss": 1.306, "mean_token_accuracy": 0.7542601272463798, "num_tokens": 2022665280.0, "step": 28140 }, { "entropy": 0.8707545638084412, "epoch": 7.672390297083674, "grad_norm": 0.1472589671611786, "learning_rate": 5.2236038167837955e-05, "loss": 1.2928, "mean_token_accuracy": 0.7565170720219612, "num_tokens": 2023379803.0, "step": 28150 }, { "entropy": 0.8759514331817627, "epoch": 7.675115835377487, "grad_norm": 0.15143978595733643, "learning_rate": 5.2206023711955035e-05, "loss": 1.2981, "mean_token_accuracy": 0.7590578615665435, "num_tokens": 2024101475.0, "step": 28160 }, { "entropy": 0.8768856734037399, "epoch": 7.6778413736713, "grad_norm": 0.14674776792526245, "learning_rate": 5.217600845956637e-05, "loss": 1.2945, "mean_token_accuracy": 0.7557491675019264, "num_tokens": 2024829995.0, "step": 28170 }, { "entropy": 0.870268528163433, "epoch": 7.680566911965113, "grad_norm": 0.14764563739299774, "learning_rate": 5.214599242150927e-05, "loss": 1.297, "mean_token_accuracy": 0.753543208539486, "num_tokens": 2025532013.0, "step": 28180 }, { "entropy": 0.8822046786546707, "epoch": 7.683292450258926, "grad_norm": 0.1518286168575287, "learning_rate": 5.2115975608621306e-05, "loss": 1.3045, "mean_token_accuracy": 0.7527895733714104, "num_tokens": 2026245566.0, "step": 28190 }, { "entropy": 0.8823674887418747, "epoch": 7.686017988552739, "grad_norm": 0.15768709778785706, "learning_rate": 5.20859580317403e-05, "loss": 1.3064, "mean_token_accuracy": 0.7527905866503716, "num_tokens": 2026958744.0, "step": 28200 }, { "entropy": 0.8611121058464051, "epoch": 7.688743526846552, "grad_norm": 0.15413539111614227, "learning_rate": 5.205593970170441e-05, "loss": 1.2896, "mean_token_accuracy": 0.7592192009091377, "num_tokens": 2027664655.0, "step": 28210 }, { "entropy": 0.8748145267367363, "epoch": 7.691469065140366, "grad_norm": 0.1530967354774475, "learning_rate": 5.202592062935203e-05, "loss": 1.3017, "mean_token_accuracy": 0.7531543225049973, "num_tokens": 2028374681.0, "step": 28220 }, { "entropy": 0.8767523631453514, "epoch": 7.694194603434179, "grad_norm": 0.1627414971590042, "learning_rate": 5.199590082552185e-05, "loss": 1.303, "mean_token_accuracy": 0.7552956163883209, "num_tokens": 2029088867.0, "step": 28230 }, { "entropy": 0.8727109178900718, "epoch": 7.6969201417279915, "grad_norm": 0.1445888876914978, "learning_rate": 5.1965880301052784e-05, "loss": 1.2971, "mean_token_accuracy": 0.7599951565265656, "num_tokens": 2029821879.0, "step": 28240 }, { "entropy": 0.8680927142500877, "epoch": 7.6996456800218045, "grad_norm": 0.14112494885921478, "learning_rate": 5.193585906678401e-05, "loss": 1.2839, "mean_token_accuracy": 0.7629461631178855, "num_tokens": 2030556588.0, "step": 28250 }, { "entropy": 0.865997676551342, "epoch": 7.702371218315617, "grad_norm": 0.16141605377197266, "learning_rate": 5.1905837133555013e-05, "loss": 1.2933, "mean_token_accuracy": 0.7613214045763016, "num_tokens": 2031286201.0, "step": 28260 }, { "entropy": 0.8729136109352111, "epoch": 7.70509675660943, "grad_norm": 0.14612805843353271, "learning_rate": 5.187581451220549e-05, "loss": 1.2968, "mean_token_accuracy": 0.7578103125095368, "num_tokens": 2032012448.0, "step": 28270 }, { "entropy": 0.867331612110138, "epoch": 7.707822294903243, "grad_norm": 0.15364515781402588, "learning_rate": 5.1845791213575366e-05, "loss": 1.2889, "mean_token_accuracy": 0.7628289684653282, "num_tokens": 2032732866.0, "step": 28280 }, { "entropy": 0.8800551548600197, "epoch": 7.710547833197056, "grad_norm": 0.1462222784757614, "learning_rate": 5.181576724850485e-05, "loss": 1.3009, "mean_token_accuracy": 0.7573458805680275, "num_tokens": 2033464624.0, "step": 28290 }, { "entropy": 0.8730786427855491, "epoch": 7.713273371490869, "grad_norm": 0.15561863780021667, "learning_rate": 5.178574262783441e-05, "loss": 1.2978, "mean_token_accuracy": 0.7562719061970711, "num_tokens": 2034181348.0, "step": 28300 }, { "entropy": 0.8696371629834175, "epoch": 7.715998909784682, "grad_norm": 0.13873456418514252, "learning_rate": 5.1755717362404676e-05, "loss": 1.2927, "mean_token_accuracy": 0.7574522286653519, "num_tokens": 2034894145.0, "step": 28310 }, { "entropy": 0.8680856406688691, "epoch": 7.718724448078495, "grad_norm": 0.15574420988559723, "learning_rate": 5.172569146305659e-05, "loss": 1.2989, "mean_token_accuracy": 0.7579647421836853, "num_tokens": 2035603297.0, "step": 28320 }, { "entropy": 0.8740738928318024, "epoch": 7.721449986372308, "grad_norm": 0.15564875304698944, "learning_rate": 5.169566494063125e-05, "loss": 1.296, "mean_token_accuracy": 0.7547544836997986, "num_tokens": 2036319544.0, "step": 28330 }, { "entropy": 0.8744974240660668, "epoch": 7.724175524666122, "grad_norm": 0.1477930098772049, "learning_rate": 5.1665637805970033e-05, "loss": 1.2962, "mean_token_accuracy": 0.7602969035506248, "num_tokens": 2037049995.0, "step": 28340 }, { "entropy": 0.8757786348462104, "epoch": 7.726901062959935, "grad_norm": 0.1456153392791748, "learning_rate": 5.1635610069914545e-05, "loss": 1.3061, "mean_token_accuracy": 0.752829161286354, "num_tokens": 2037765878.0, "step": 28350 }, { "entropy": 0.8735652223229409, "epoch": 7.729626601253748, "grad_norm": 0.14605747163295746, "learning_rate": 5.160558174330654e-05, "loss": 1.3039, "mean_token_accuracy": 0.7535927176475525, "num_tokens": 2038468813.0, "step": 28360 }, { "entropy": 0.8727952927350998, "epoch": 7.732352139547561, "grad_norm": 0.1495419591665268, "learning_rate": 5.157555283698805e-05, "loss": 1.2959, "mean_token_accuracy": 0.7583206579089165, "num_tokens": 2039192634.0, "step": 28370 }, { "entropy": 0.873136593401432, "epoch": 7.735077677841374, "grad_norm": 0.27537640929222107, "learning_rate": 5.154552336180132e-05, "loss": 1.2953, "mean_token_accuracy": 0.7609014913439751, "num_tokens": 2039915717.0, "step": 28380 }, { "entropy": 0.8816787675023079, "epoch": 7.737803216135187, "grad_norm": 0.1552937924861908, "learning_rate": 5.1515493328588725e-05, "loss": 1.3028, "mean_token_accuracy": 0.7500071495771408, "num_tokens": 2040616409.0, "step": 28390 }, { "entropy": 0.868381279706955, "epoch": 7.740528754429, "grad_norm": 0.15035855770111084, "learning_rate": 5.148546274819293e-05, "loss": 1.2919, "mean_token_accuracy": 0.7579583555459977, "num_tokens": 2041341127.0, "step": 28400 }, { "entropy": 0.8838419929146767, "epoch": 7.7432542927228125, "grad_norm": 0.1548195779323578, "learning_rate": 5.1455431631456754e-05, "loss": 1.3085, "mean_token_accuracy": 0.7517982959747315, "num_tokens": 2042048723.0, "step": 28410 }, { "entropy": 0.8783964306116104, "epoch": 7.7459798310166255, "grad_norm": 0.15469075739383698, "learning_rate": 5.1425399989223224e-05, "loss": 1.3052, "mean_token_accuracy": 0.7562689185142517, "num_tokens": 2042775977.0, "step": 28420 }, { "entropy": 0.8680647879838943, "epoch": 7.748705369310439, "grad_norm": 0.14739985764026642, "learning_rate": 5.139536783233552e-05, "loss": 1.3002, "mean_token_accuracy": 0.7525867044925689, "num_tokens": 2043468264.0, "step": 28430 }, { "entropy": 0.8728204682469368, "epoch": 7.751430907604252, "grad_norm": 0.14950290322303772, "learning_rate": 5.1365335171637054e-05, "loss": 1.2964, "mean_token_accuracy": 0.7546725392341613, "num_tokens": 2044191301.0, "step": 28440 }, { "entropy": 0.8709087863564491, "epoch": 7.754156445898065, "grad_norm": 0.14465369284152985, "learning_rate": 5.13353020179714e-05, "loss": 1.2959, "mean_token_accuracy": 0.7577947944402694, "num_tokens": 2044922129.0, "step": 28450 }, { "entropy": 0.8761092722415924, "epoch": 7.756881984191878, "grad_norm": 0.14949002861976624, "learning_rate": 5.130526838218233e-05, "loss": 1.297, "mean_token_accuracy": 0.7524799570441246, "num_tokens": 2045627395.0, "step": 28460 }, { "entropy": 0.8751310005784034, "epoch": 7.759607522485691, "grad_norm": 0.14488691091537476, "learning_rate": 5.1275234275113746e-05, "loss": 1.2875, "mean_token_accuracy": 0.7553243070840836, "num_tokens": 2046348000.0, "step": 28470 }, { "entropy": 0.8674445793032646, "epoch": 7.762333060779504, "grad_norm": 0.1486712098121643, "learning_rate": 5.124519970760976e-05, "loss": 1.2806, "mean_token_accuracy": 0.7652259364724159, "num_tokens": 2047087265.0, "step": 28480 }, { "entropy": 0.8799532428383827, "epoch": 7.765058599073317, "grad_norm": 0.15229366719722748, "learning_rate": 5.121516469051463e-05, "loss": 1.298, "mean_token_accuracy": 0.7570998996496201, "num_tokens": 2047812014.0, "step": 28490 }, { "entropy": 0.8761812463402748, "epoch": 7.76778413736713, "grad_norm": 0.15411978960037231, "learning_rate": 5.11851292346728e-05, "loss": 1.2991, "mean_token_accuracy": 0.7579398721456527, "num_tokens": 2048543242.0, "step": 28500 }, { "entropy": 0.8693125024437904, "epoch": 7.770509675660943, "grad_norm": 0.14534714818000793, "learning_rate": 5.115509335092884e-05, "loss": 1.2988, "mean_token_accuracy": 0.7580270186066628, "num_tokens": 2049259454.0, "step": 28510 }, { "entropy": 0.8759208023548126, "epoch": 7.773235213954756, "grad_norm": 0.15540142357349396, "learning_rate": 5.112505705012749e-05, "loss": 1.2991, "mean_token_accuracy": 0.7556175932288169, "num_tokens": 2049983695.0, "step": 28520 }, { "entropy": 0.8707679629325866, "epoch": 7.775960752248569, "grad_norm": 0.1550641804933548, "learning_rate": 5.109502034311365e-05, "loss": 1.2924, "mean_token_accuracy": 0.7534662991762161, "num_tokens": 2050682950.0, "step": 28530 }, { "entropy": 0.8711427360773086, "epoch": 7.778686290542382, "grad_norm": 0.1522579938173294, "learning_rate": 5.106498324073235e-05, "loss": 1.2936, "mean_token_accuracy": 0.7548329576849937, "num_tokens": 2051406021.0, "step": 28540 }, { "entropy": 0.8687419131398201, "epoch": 7.7814118288361955, "grad_norm": 0.1569044142961502, "learning_rate": 5.103494575382875e-05, "loss": 1.2891, "mean_token_accuracy": 0.7605527967214585, "num_tokens": 2052138302.0, "step": 28550 }, { "entropy": 0.8768089443445206, "epoch": 7.7841373671300085, "grad_norm": 0.14389604330062866, "learning_rate": 5.100490789324822e-05, "loss": 1.2981, "mean_token_accuracy": 0.7566765040159226, "num_tokens": 2052856325.0, "step": 28560 }, { "entropy": 0.8717021763324737, "epoch": 7.786862905423821, "grad_norm": 0.1500464230775833, "learning_rate": 5.0974869669836176e-05, "loss": 1.3067, "mean_token_accuracy": 0.7527828842401505, "num_tokens": 2053547861.0, "step": 28570 }, { "entropy": 0.880061000585556, "epoch": 7.789588443717634, "grad_norm": 0.16395455598831177, "learning_rate": 5.09448310944382e-05, "loss": 1.3128, "mean_token_accuracy": 0.7522459611296654, "num_tokens": 2054247397.0, "step": 28580 }, { "entropy": 0.8706887930631637, "epoch": 7.792313982011447, "grad_norm": 0.152640700340271, "learning_rate": 5.091479217790004e-05, "loss": 1.3015, "mean_token_accuracy": 0.7574447631835938, "num_tokens": 2054956031.0, "step": 28590 }, { "entropy": 0.8678671464323997, "epoch": 7.79503952030526, "grad_norm": 0.1524311751127243, "learning_rate": 5.088475293106748e-05, "loss": 1.2858, "mean_token_accuracy": 0.7643247053027153, "num_tokens": 2055696865.0, "step": 28600 }, { "entropy": 0.8778502061963082, "epoch": 7.797765058599073, "grad_norm": 0.16135413944721222, "learning_rate": 5.085471336478651e-05, "loss": 1.2953, "mean_token_accuracy": 0.7575853750109672, "num_tokens": 2056422012.0, "step": 28610 }, { "entropy": 0.8740970060229302, "epoch": 7.800490596892886, "grad_norm": 0.1481577605009079, "learning_rate": 5.08246734899032e-05, "loss": 1.3054, "mean_token_accuracy": 0.7566355332732201, "num_tokens": 2057143210.0, "step": 28620 }, { "entropy": 0.8765804812312126, "epoch": 7.803216135186699, "grad_norm": 0.14563089609146118, "learning_rate": 5.0794633317263705e-05, "loss": 1.2969, "mean_token_accuracy": 0.7538089320063591, "num_tokens": 2057848448.0, "step": 28630 }, { "entropy": 0.8724101155996322, "epoch": 7.805941673480512, "grad_norm": 0.14638759195804596, "learning_rate": 5.076459285771434e-05, "loss": 1.2959, "mean_token_accuracy": 0.7598433643579483, "num_tokens": 2058577055.0, "step": 28640 }, { "entropy": 0.871101850271225, "epoch": 7.808667211774326, "grad_norm": 0.14928314089775085, "learning_rate": 5.073455212210149e-05, "loss": 1.2905, "mean_token_accuracy": 0.7581345871090889, "num_tokens": 2059297531.0, "step": 28650 }, { "entropy": 0.8746340870857239, "epoch": 7.811392750068139, "grad_norm": 0.15390898287296295, "learning_rate": 5.070451112127164e-05, "loss": 1.3031, "mean_token_accuracy": 0.7531252816319466, "num_tokens": 2059994462.0, "step": 28660 }, { "entropy": 0.8774883389472962, "epoch": 7.814118288361952, "grad_norm": 0.1507336050271988, "learning_rate": 5.067446986607138e-05, "loss": 1.3043, "mean_token_accuracy": 0.7546640068292618, "num_tokens": 2060717996.0, "step": 28670 }, { "entropy": 0.8740352123975754, "epoch": 7.816843826655765, "grad_norm": 0.1557072103023529, "learning_rate": 5.0644428367347384e-05, "loss": 1.3012, "mean_token_accuracy": 0.7583262786269188, "num_tokens": 2061442048.0, "step": 28680 }, { "entropy": 0.8714375674724579, "epoch": 7.819569364949578, "grad_norm": 0.14534524083137512, "learning_rate": 5.0614386635946444e-05, "loss": 1.2973, "mean_token_accuracy": 0.7554130285978318, "num_tokens": 2062152326.0, "step": 28690 }, { "entropy": 0.8720107138156891, "epoch": 7.822294903243391, "grad_norm": 0.15054894983768463, "learning_rate": 5.0584344682715376e-05, "loss": 1.2911, "mean_token_accuracy": 0.7564399510622024, "num_tokens": 2062863326.0, "step": 28700 }, { "entropy": 0.8656201481819152, "epoch": 7.8250204415372036, "grad_norm": 0.15560075640678406, "learning_rate": 5.055430251850115e-05, "loss": 1.2894, "mean_token_accuracy": 0.7588586747646332, "num_tokens": 2063574513.0, "step": 28710 }, { "entropy": 0.8750212281942368, "epoch": 7.8277459798310165, "grad_norm": 0.14586029946804047, "learning_rate": 5.052426015415074e-05, "loss": 1.2966, "mean_token_accuracy": 0.7538041993975639, "num_tokens": 2064290500.0, "step": 28720 }, { "entropy": 0.8781249269843101, "epoch": 7.8304715181248294, "grad_norm": 0.15518252551555634, "learning_rate": 5.049421760051124e-05, "loss": 1.3055, "mean_token_accuracy": 0.7511297702789307, "num_tokens": 2064992594.0, "step": 28730 }, { "entropy": 0.8679031729698181, "epoch": 7.833197056418642, "grad_norm": 0.1644304394721985, "learning_rate": 5.046417486842981e-05, "loss": 1.2928, "mean_token_accuracy": 0.7591112449765205, "num_tokens": 2065704189.0, "step": 28740 }, { "entropy": 0.8719989255070686, "epoch": 7.835922594712455, "grad_norm": 0.1510053128004074, "learning_rate": 5.043413196875364e-05, "loss": 1.3027, "mean_token_accuracy": 0.7548772737383842, "num_tokens": 2066429087.0, "step": 28750 }, { "entropy": 0.8725510746240616, "epoch": 7.838648133006268, "grad_norm": 0.16147853434085846, "learning_rate": 5.0404088912330014e-05, "loss": 1.2959, "mean_token_accuracy": 0.7553753957152367, "num_tokens": 2067146968.0, "step": 28760 }, { "entropy": 0.869031710922718, "epoch": 7.841373671300082, "grad_norm": 0.15349683165550232, "learning_rate": 5.0374045710006265e-05, "loss": 1.2946, "mean_token_accuracy": 0.7622701898217201, "num_tokens": 2067874528.0, "step": 28770 }, { "entropy": 0.8651412725448608, "epoch": 7.844099209593895, "grad_norm": 0.15462660789489746, "learning_rate": 5.034400237262977e-05, "loss": 1.2952, "mean_token_accuracy": 0.7564776301383972, "num_tokens": 2068591259.0, "step": 28780 }, { "entropy": 0.879278439283371, "epoch": 7.846824747887708, "grad_norm": 0.15315796434879303, "learning_rate": 5.031395891104796e-05, "loss": 1.2998, "mean_token_accuracy": 0.7557676270604133, "num_tokens": 2069315225.0, "step": 28790 }, { "entropy": 0.8675184726715088, "epoch": 7.849550286181521, "grad_norm": 0.16138049960136414, "learning_rate": 5.0283915336108334e-05, "loss": 1.2907, "mean_token_accuracy": 0.7601470157504082, "num_tokens": 2070031797.0, "step": 28800 }, { "entropy": 0.8679433673620224, "epoch": 7.852275824475334, "grad_norm": 0.15830840170383453, "learning_rate": 5.025387165865837e-05, "loss": 1.2881, "mean_token_accuracy": 0.7589368507266044, "num_tokens": 2070744676.0, "step": 28810 }, { "entropy": 0.8728272631764412, "epoch": 7.855001362769147, "grad_norm": 0.17641285061836243, "learning_rate": 5.022382788954564e-05, "loss": 1.2967, "mean_token_accuracy": 0.7578941285610199, "num_tokens": 2071463729.0, "step": 28820 }, { "entropy": 0.8773080214858056, "epoch": 7.85772690106296, "grad_norm": 0.14152438938617706, "learning_rate": 5.019378403961774e-05, "loss": 1.3003, "mean_token_accuracy": 0.7510676220059395, "num_tokens": 2072164198.0, "step": 28830 }, { "entropy": 0.8713888987898827, "epoch": 7.860452439356773, "grad_norm": 0.14663468301296234, "learning_rate": 5.016374011972227e-05, "loss": 1.2947, "mean_token_accuracy": 0.7552718207240104, "num_tokens": 2072874975.0, "step": 28840 }, { "entropy": 0.8713116094470024, "epoch": 7.863177977650586, "grad_norm": 0.1441587209701538, "learning_rate": 5.013369614070689e-05, "loss": 1.2916, "mean_token_accuracy": 0.7578077897429466, "num_tokens": 2073587049.0, "step": 28850 }, { "entropy": 0.8819049805402756, "epoch": 7.8659035159443995, "grad_norm": 0.14788268506526947, "learning_rate": 5.010365211341925e-05, "loss": 1.3095, "mean_token_accuracy": 0.7508459910750389, "num_tokens": 2074295657.0, "step": 28860 }, { "entropy": 0.8664075076580048, "epoch": 7.8686290542382125, "grad_norm": 0.1527957022190094, "learning_rate": 5.007360804870702e-05, "loss": 1.2945, "mean_token_accuracy": 0.7563967630267143, "num_tokens": 2075002325.0, "step": 28870 }, { "entropy": 0.8703516647219658, "epoch": 7.871354592532025, "grad_norm": 0.14753733575344086, "learning_rate": 5.004356395741792e-05, "loss": 1.2959, "mean_token_accuracy": 0.7564651280641556, "num_tokens": 2075714080.0, "step": 28880 }, { "entropy": 0.8724898785352707, "epoch": 7.874080130825838, "grad_norm": 0.15951234102249146, "learning_rate": 5.0013519850399636e-05, "loss": 1.2997, "mean_token_accuracy": 0.7589197918772698, "num_tokens": 2076433153.0, "step": 28890 }, { "entropy": 0.8677097305655479, "epoch": 7.876805669119651, "grad_norm": 0.15661266446113586, "learning_rate": 4.99834757384999e-05, "loss": 1.2907, "mean_token_accuracy": 0.7581684812903404, "num_tokens": 2077155366.0, "step": 28900 }, { "entropy": 0.8718841284513473, "epoch": 7.879531207413464, "grad_norm": 0.15242601931095123, "learning_rate": 4.995343163256638e-05, "loss": 1.299, "mean_token_accuracy": 0.7597081452608109, "num_tokens": 2077877506.0, "step": 28910 }, { "entropy": 0.8715924382209778, "epoch": 7.882256745707277, "grad_norm": 0.14559628069400787, "learning_rate": 4.992338754344681e-05, "loss": 1.2964, "mean_token_accuracy": 0.7535214453935624, "num_tokens": 2078576137.0, "step": 28920 }, { "entropy": 0.8692012846469879, "epoch": 7.88498228400109, "grad_norm": 0.1578289419412613, "learning_rate": 4.9893343481988916e-05, "loss": 1.2982, "mean_token_accuracy": 0.7584845826029778, "num_tokens": 2079284511.0, "step": 28930 }, { "entropy": 0.865885728597641, "epoch": 7.887707822294903, "grad_norm": 0.15666401386260986, "learning_rate": 4.986329945904034e-05, "loss": 1.2919, "mean_token_accuracy": 0.7594642907381057, "num_tokens": 2080011636.0, "step": 28940 }, { "entropy": 0.8837577745318412, "epoch": 7.890433360588716, "grad_norm": 0.15608501434326172, "learning_rate": 4.983325548544881e-05, "loss": 1.3067, "mean_token_accuracy": 0.748767901957035, "num_tokens": 2080709720.0, "step": 28950 }, { "entropy": 0.8710357174277306, "epoch": 7.893158898882529, "grad_norm": 0.15831336379051208, "learning_rate": 4.9803211572061964e-05, "loss": 1.2969, "mean_token_accuracy": 0.7558223530650139, "num_tokens": 2081422223.0, "step": 28960 }, { "entropy": 0.8780325442552567, "epoch": 7.895884437176342, "grad_norm": 0.14892467856407166, "learning_rate": 4.977316772972742e-05, "loss": 1.3054, "mean_token_accuracy": 0.7538846135139465, "num_tokens": 2082140287.0, "step": 28970 }, { "entropy": 0.8729042440652848, "epoch": 7.898609975470155, "grad_norm": 0.15484024584293365, "learning_rate": 4.974312396929284e-05, "loss": 1.2995, "mean_token_accuracy": 0.7566973924636841, "num_tokens": 2082852070.0, "step": 28980 }, { "entropy": 0.8725142627954483, "epoch": 7.901335513763969, "grad_norm": 0.15064504742622375, "learning_rate": 4.971308030160578e-05, "loss": 1.2988, "mean_token_accuracy": 0.756444227695465, "num_tokens": 2083569938.0, "step": 28990 }, { "entropy": 0.8781291499733925, "epoch": 7.904061052057782, "grad_norm": 0.14941169321537018, "learning_rate": 4.9683036737513766e-05, "loss": 1.3013, "mean_token_accuracy": 0.7528211146593093, "num_tokens": 2084280826.0, "step": 29000 }, { "entropy": 0.8703803390264511, "epoch": 7.906786590351595, "grad_norm": 0.15744654834270477, "learning_rate": 4.9652993287864365e-05, "loss": 1.307, "mean_token_accuracy": 0.7544958233833313, "num_tokens": 2084986611.0, "step": 29010 }, { "entropy": 0.874736875295639, "epoch": 7.9095121286454075, "grad_norm": 0.15729069709777832, "learning_rate": 4.962294996350502e-05, "loss": 1.3026, "mean_token_accuracy": 0.7613536983728408, "num_tokens": 2085720092.0, "step": 29020 }, { "entropy": 0.8789043530821801, "epoch": 7.9122376669392205, "grad_norm": 0.15260839462280273, "learning_rate": 4.959290677528314e-05, "loss": 1.3005, "mean_token_accuracy": 0.7594448283314705, "num_tokens": 2086458948.0, "step": 29030 }, { "entropy": 0.8734215199947357, "epoch": 7.914963205233033, "grad_norm": 0.1524142473936081, "learning_rate": 4.9562863734046136e-05, "loss": 1.2991, "mean_token_accuracy": 0.7579223662614822, "num_tokens": 2087182747.0, "step": 29040 }, { "entropy": 0.8781965866684913, "epoch": 7.917688743526846, "grad_norm": 0.15536931157112122, "learning_rate": 4.9532820850641324e-05, "loss": 1.3014, "mean_token_accuracy": 0.7552846103906632, "num_tokens": 2087901479.0, "step": 29050 }, { "entropy": 0.8621720016002655, "epoch": 7.920414281820659, "grad_norm": 0.15621359646320343, "learning_rate": 4.9502778135915946e-05, "loss": 1.2844, "mean_token_accuracy": 0.7571163326501846, "num_tokens": 2088614224.0, "step": 29060 }, { "entropy": 0.8729408875107765, "epoch": 7.923139820114472, "grad_norm": 0.1571531891822815, "learning_rate": 4.9472735600717244e-05, "loss": 1.3032, "mean_token_accuracy": 0.7551058560609818, "num_tokens": 2089319357.0, "step": 29070 }, { "entropy": 0.8744441866874695, "epoch": 7.925865358408286, "grad_norm": 0.15197701752185822, "learning_rate": 4.944269325589235e-05, "loss": 1.2983, "mean_token_accuracy": 0.7555972620844841, "num_tokens": 2090024117.0, "step": 29080 }, { "entropy": 0.8694946125149727, "epoch": 7.928590896702099, "grad_norm": 0.14163386821746826, "learning_rate": 4.94126511122883e-05, "loss": 1.2849, "mean_token_accuracy": 0.7586724862456322, "num_tokens": 2090754500.0, "step": 29090 }, { "entropy": 0.8758626118302345, "epoch": 7.931316434995912, "grad_norm": 0.15822726488113403, "learning_rate": 4.938260918075215e-05, "loss": 1.2957, "mean_token_accuracy": 0.7548936754465103, "num_tokens": 2091479909.0, "step": 29100 }, { "entropy": 0.8677125558257103, "epoch": 7.934041973289725, "grad_norm": 0.15288494527339935, "learning_rate": 4.935256747213079e-05, "loss": 1.2901, "mean_token_accuracy": 0.7586245208978653, "num_tokens": 2092201401.0, "step": 29110 }, { "entropy": 0.8700149923563003, "epoch": 7.936767511583538, "grad_norm": 0.16054970026016235, "learning_rate": 4.932252599727107e-05, "loss": 1.295, "mean_token_accuracy": 0.7596103355288506, "num_tokens": 2092922481.0, "step": 29120 }, { "entropy": 0.8743564888834954, "epoch": 7.939493049877351, "grad_norm": 0.15474098920822144, "learning_rate": 4.929248476701975e-05, "loss": 1.2959, "mean_token_accuracy": 0.7529025077819824, "num_tokens": 2093630352.0, "step": 29130 }, { "entropy": 0.8784813895821572, "epoch": 7.942218588171164, "grad_norm": 0.14834600687026978, "learning_rate": 4.9262443792223514e-05, "loss": 1.3037, "mean_token_accuracy": 0.7554646402597427, "num_tokens": 2094361932.0, "step": 29140 }, { "entropy": 0.8759296759963036, "epoch": 7.944944126464977, "grad_norm": 0.1595781147480011, "learning_rate": 4.923240308372891e-05, "loss": 1.2998, "mean_token_accuracy": 0.7544375360012054, "num_tokens": 2095070081.0, "step": 29150 }, { "entropy": 0.8672859281301498, "epoch": 7.94766966475879, "grad_norm": 0.15980692207813263, "learning_rate": 4.920236265238244e-05, "loss": 1.2935, "mean_token_accuracy": 0.7607377246022224, "num_tokens": 2095793054.0, "step": 29160 }, { "entropy": 0.877199088037014, "epoch": 7.950395203052603, "grad_norm": 0.1558620184659958, "learning_rate": 4.91723225090305e-05, "loss": 1.3007, "mean_token_accuracy": 0.7527604401111603, "num_tokens": 2096502020.0, "step": 29170 }, { "entropy": 0.8671931162476539, "epoch": 7.953120741346416, "grad_norm": 0.14660750329494476, "learning_rate": 4.9142282664519325e-05, "loss": 1.2905, "mean_token_accuracy": 0.7587891101837159, "num_tokens": 2097227198.0, "step": 29180 }, { "entropy": 0.8784502819180489, "epoch": 7.9558462796402285, "grad_norm": 0.15164071321487427, "learning_rate": 4.9112243129695135e-05, "loss": 1.2952, "mean_token_accuracy": 0.7544587805867196, "num_tokens": 2097955629.0, "step": 29190 }, { "entropy": 0.8754410952329635, "epoch": 7.958571817934042, "grad_norm": 0.1389971375465393, "learning_rate": 4.908220391540396e-05, "loss": 1.2894, "mean_token_accuracy": 0.7591995671391487, "num_tokens": 2098695455.0, "step": 29200 }, { "entropy": 0.8730250328779221, "epoch": 7.961297356227855, "grad_norm": 0.1592153012752533, "learning_rate": 4.905216503249173e-05, "loss": 1.3056, "mean_token_accuracy": 0.7555223658680916, "num_tokens": 2099404174.0, "step": 29210 }, { "entropy": 0.8666514158248901, "epoch": 7.964022894521668, "grad_norm": 0.15044082701206207, "learning_rate": 4.902212649180431e-05, "loss": 1.2927, "mean_token_accuracy": 0.7587355688214302, "num_tokens": 2100128215.0, "step": 29220 }, { "entropy": 0.8808118417859078, "epoch": 7.966748432815481, "grad_norm": 0.14613182842731476, "learning_rate": 4.8992088304187375e-05, "loss": 1.3007, "mean_token_accuracy": 0.7540887221693993, "num_tokens": 2100831599.0, "step": 29230 }, { "entropy": 0.869738195836544, "epoch": 7.969473971109294, "grad_norm": 0.15028458833694458, "learning_rate": 4.896205048048647e-05, "loss": 1.2982, "mean_token_accuracy": 0.7567011937499046, "num_tokens": 2101555506.0, "step": 29240 }, { "entropy": 0.8647333770990372, "epoch": 7.972199509403107, "grad_norm": 0.15632669627666473, "learning_rate": 4.893201303154709e-05, "loss": 1.2968, "mean_token_accuracy": 0.7580927804112434, "num_tokens": 2102264508.0, "step": 29250 }, { "entropy": 0.8750887006521225, "epoch": 7.97492504769692, "grad_norm": 0.14812743663787842, "learning_rate": 4.890197596821451e-05, "loss": 1.3058, "mean_token_accuracy": 0.7583898589015007, "num_tokens": 2102994858.0, "step": 29260 }, { "entropy": 0.8756055474281311, "epoch": 7.977650585990733, "grad_norm": 0.14465123414993286, "learning_rate": 4.887193930133388e-05, "loss": 1.2929, "mean_token_accuracy": 0.7579392105340957, "num_tokens": 2103725694.0, "step": 29270 }, { "entropy": 0.879104483127594, "epoch": 7.980376124284546, "grad_norm": 0.15725469589233398, "learning_rate": 4.884190304175025e-05, "loss": 1.3039, "mean_token_accuracy": 0.7550291955471039, "num_tokens": 2104446339.0, "step": 29280 }, { "entropy": 0.8693584635853767, "epoch": 7.983101662578359, "grad_norm": 0.16086307168006897, "learning_rate": 4.88118672003085e-05, "loss": 1.2962, "mean_token_accuracy": 0.7578431040048599, "num_tokens": 2105158797.0, "step": 29290 }, { "entropy": 0.8693640872836113, "epoch": 7.985827200872173, "grad_norm": 0.14272333681583405, "learning_rate": 4.878183178785332e-05, "loss": 1.2951, "mean_token_accuracy": 0.7567166343331337, "num_tokens": 2105866549.0, "step": 29300 }, { "entropy": 0.874030065536499, "epoch": 7.988552739165986, "grad_norm": 0.1451587677001953, "learning_rate": 4.8751796815229325e-05, "loss": 1.2994, "mean_token_accuracy": 0.756797869503498, "num_tokens": 2106602225.0, "step": 29310 }, { "entropy": 0.8713746085762978, "epoch": 7.991278277459799, "grad_norm": 0.1409689337015152, "learning_rate": 4.872176229328089e-05, "loss": 1.2997, "mean_token_accuracy": 0.7568163946270943, "num_tokens": 2107314621.0, "step": 29320 }, { "entropy": 0.8717377915978431, "epoch": 7.9940038157536115, "grad_norm": 0.14872410893440247, "learning_rate": 4.869172823285227e-05, "loss": 1.3008, "mean_token_accuracy": 0.7556920111179352, "num_tokens": 2108022731.0, "step": 29330 }, { "entropy": 0.8727119475603103, "epoch": 7.9967293540474245, "grad_norm": 0.1454230099916458, "learning_rate": 4.866169464478757e-05, "loss": 1.297, "mean_token_accuracy": 0.7566224813461304, "num_tokens": 2108738992.0, "step": 29340 }, { "entropy": 0.8854518592357635, "epoch": 7.999454892341237, "grad_norm": 0.14412358403205872, "learning_rate": 4.863166153993067e-05, "loss": 1.3024, "mean_token_accuracy": 0.753192912042141, "num_tokens": 2109461047.0, "step": 29350 } ], "logging_steps": 10, "max_steps": 55035, "num_input_tokens_seen": 0, "num_train_epochs": 15, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.050092967582478e+20, "train_batch_size": 4, "trial_name": null, "trial_params": null }