{
  "git_commit": "12dea70ca74a31f368d13e88267377a7198bb0b1",
  "batch_tokens": 131072,
  "micro_batch_size": 128,
  "accumulation_steps": 1,
  "parameters": 20403520,
  "training_tokens": 408071168,
  "optimizer_steps": 3120,
  "epochs": 40,
  "validation_tokens": 197411295,
  "cache_identity": "8cf0c4883c19d26f378623f91bfe079bc8ebf8f23e51814821f4c8c28c4b8151",
  "lrs": [
    0.0014,
    0.0028,
    0.004,
    0.0056,
    0.008,
    0.0112,
    0.016,
    0.0224
  ],
  "beta2s": [
    0.95,
    0.98,
    0.999
  ],
  "seeds": [
    42,
    43,
    44
  ],
  "selection": "Mean final full-validation loss over all three seeds; ties: LR, beta2",
  "measured_date": "2026-09-11",
  "archive": "runs/sync-20m-batch128k-micro128-20260911",
  "source_hashes": [
    "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
  ],
  "source_file_hashes": {
    "source/tiny_llm/__init__.py": "a6c9b2e8602883c050a69acaf3f8c8a5c76b4885d66085813c7342f21d481f2d",
    "source/tiny_llm/__main__.py": "18b0986089d17edd6a889f723a95d0418ba60d22e4f8214f33539b5bc77bcb34",
    "source/tiny_llm/analysis/__init__.py": "f7899324f928575b7c353c51b0c5e5b21b547e5effb8e045e1ac9e9ad68e1ca4",
    "source/tiny_llm/analysis/core.py": "175857de6e32e89407431320ef4130c588ec20de177842f001909b9b4958a7cf",
    "source/tiny_llm/analysis/plot.py": "7de80840117c68347c45647dc9a0fb52e482b25765f1c8ad701a7ad2fb867f3e",
    "source/tiny_llm/analysis/slurm.py": "37a16565f3926d186af3c8715b77a155fb8bca0883046446028f366751dde1b5",
    "source/tiny_llm/benchmark.py": "ff1cd6c8c685f618b560af25ef591d3fe3b6ec70f412741324e85cec91ece5e6",
    "source/tiny_llm/checkpoints.py": "9340160365df6d7076a8f684201c733327c17392c2002c9fd13d0e294eebeadd",
    "source/tiny_llm/cli.py": "c0fb2352369e16af95eca7a95267d2fa03d2a22038d523e95498541460a910f5",
    "source/tiny_llm/config.py": "16f76800e67c3c0544bd5dee4b6db52a739b38956e80b029638f5a07035c78e7",
    "source/tiny_llm/data.py": "74c1a9e7190fb19e5d7a5f07e17427a5b32937755b41ad51a4461fc04507b8bf",
    "source/tiny_llm/experiments.py": "96c7cc117f731e9ab44dba16d16760014c59d6f19f5f2e0cc69f713a69353c23",
    "source/tiny_llm/model.py": "0c76eb6e409abf7760e5c5b16a4ee8c16079008ae5863ca3cc28af3d65ec1cc2",
    "source/tiny_llm/packed.py": "33bc1b5c797f1f463995e3fe1ab70bd3f88d9febf523d6a90626b5fc800c7b50",
    "source/tiny_llm/packed_benchmark.py": "9d5258105785923cabe600ea9e7657ca4eaa28bc00b94e9079b87daf70d8ae12",
    "source/tiny_llm/packed_optimizer.py": "6e18cb17bdfda8dc82a3b4e57d565af07917897899ada95760121bf2b14e4752",
    "source/tiny_llm/runtime.py": "58fc2a63c39eb20f6b5ba2234d31e1ef83ee1bad02adf0d14d522a02530f8e27",
    "source/tiny_llm/train.py": "3f9c99a686d60b3e14e217e02f5f40c998e6d8cefec34102051f3df135da3ade",
    "source/uv.lock": "1e8873894c75b04fd652d0330c5e7d7a520153ade645b0703d0d74b482cdc4c5",
    "source/pyproject.toml": "1597769fe175d1ead676d7dd9e319b84cd31a2e779065c466f0e05dc109897d1"
  },
  "environment": {
    "python": "3.12.13 (main, May 10 2026, 19:27:23) [Clang 22.1.3 ]",
    "versions": {
      "torch": "2.14.0",
      "triton": "3.8.0",
      "numpy": "2.5.3",
      "pydantic": "2.13.5",
      "datasets": "5.0.1",
      "transformers": "5.16.1"
    },
    "cuda": "13.0",
    "gpu": "NVIDIA GH200 120GB"
  },
  "submission": {
    "pilot": "2309169",
    "sweep": "2309171"
  },
  "winner": {
    "lr": 0.0056,
    "beta2": 0.98,
    "seeds": 3,
    "mean_loss": 3.558689018800622,
    "std_loss": 0.004887194781964228
  },
  "groups": [
    {
      "lr": 0.0056,
      "beta2": 0.98,
      "seeds": 3,
      "mean_loss": 3.558689018800622,
      "std_loss": 0.004887194781964228
    },
    {
      "lr": 0.004,
      "beta2": 0.98,
      "seeds": 3,
      "mean_loss": 3.562837392178597,
      "std_loss": 0.0042984892862078395
    },
    {
      "lr": 0.0056,
      "beta2": 0.95,
      "seeds": 3,
      "mean_loss": 3.565662959720436,
      "std_loss": 0.0024006160042474344
    },
    {
      "lr": 0.004,
      "beta2": 0.95,
      "seeds": 3,
      "mean_loss": 3.569090904170262,
      "std_loss": 0.0036033200399949003
    },
    {
      "lr": 0.004,
      "beta2": 0.999,
      "seeds": 3,
      "mean_loss": 3.5762063189151454,
      "std_loss": 0.002682033405679386
    },
    {
      "lr": 0.0028,
      "beta2": 0.95,
      "seeds": 3,
      "mean_loss": 3.5825669859797458,
      "std_loss": 0.0056210666418579375
    },
    {
      "lr": 0.0028,
      "beta2": 0.98,
      "seeds": 3,
      "mean_loss": 3.58437814064636,
      "std_loss": 0.0010408551834212893
    },
    {
      "lr": 0.008,
      "beta2": 0.95,
      "seeds": 3,
      "mean_loss": 3.588826839167296,
      "std_loss": 0.027004008245159798
    },
    {
      "lr": 0.0028,
      "beta2": 0.999,
      "seeds": 3,
      "mean_loss": 3.594532543170259,
      "std_loss": 0.0023064320331817366
    },
    {
      "lr": 0.0014,
      "beta2": 0.98,
      "seeds": 3,
      "mean_loss": 3.6272333703260005,
      "std_loss": 0.003093101597314447
    },
    {
      "lr": 0.0014,
      "beta2": 0.95,
      "seeds": 3,
      "mean_loss": 3.634001458560762,
      "std_loss": 0.005096126602574755
    },
    {
      "lr": 0.0014,
      "beta2": 0.999,
      "seeds": 3,
      "mean_loss": 3.637238477526756,
      "std_loss": 0.013446798320948198
    },
    {
      "lr": 0.0056,
      "beta2": 0.999,
      "seeds": 3,
      "mean_loss": 3.6909198726486157,
      "std_loss": 0.10548710814416823
    },
    {
      "lr": 0.008,
      "beta2": 0.98,
      "seeds": 3,
      "mean_loss": 3.899025615431637,
      "std_loss": 0.14315422280205126
    },
    {
      "lr": 0.0112,
      "beta2": 0.95,
      "seeds": 3,
      "mean_loss": 4.371981380812587,
      "std_loss": 0.08477615550727768
    },
    {
      "lr": 0.0112,
      "beta2": 0.98,
      "seeds": 3,
      "mean_loss": 4.554090515461627,
      "std_loss": 0.058824732458561714
    },
    {
      "lr": 0.008,
      "beta2": 0.999,
      "seeds": 3,
      "mean_loss": 4.672552422670731,
      "std_loss": 0.09044623389363038
    },
    {
      "lr": 0.016,
      "beta2": 0.95,
      "seeds": 3,
      "mean_loss": 4.705221427566893,
      "std_loss": 0.03234551993431537
    },
    {
      "lr": 0.0224,
      "beta2": 0.95,
      "seeds": 3,
      "mean_loss": 5.252324581633022,
      "std_loss": 0.37575208005842814
    },
    {
      "lr": 0.0112,
      "beta2": 0.999,
      "seeds": 3,
      "mean_loss": 5.368668497271259,
      "std_loss": 0.47699647185021654
    },
    {
      "lr": 0.016,
      "beta2": 0.98,
      "seeds": 3,
      "mean_loss": 5.404749751660877,
      "std_loss": 0.49603527325996233
    },
    {
      "lr": 0.0224,
      "beta2": 0.98,
      "seeds": 3,
      "mean_loss": 5.603151746920082,
      "std_loss": 0.41485597392131673
    },
    {
      "lr": 0.016,
      "beta2": 0.999,
      "seeds": 3,
      "mean_loss": 5.785472757118695,
      "std_loss": 0.4185670639329892
    },
    {
      "lr": 0.0224,
      "beta2": 0.999,
      "seeds": 3,
      "mean_loss": 5.9848178992613565,
      "std_loss": 0.45558485229890044
    }
  ],
  "runs": [
    {
      "index": 0,
      "run_id": "sync-lr0.0056-beta2-0.999-seed42",
      "lr": 0.0056,
      "beta2": 0.999,
      "seed": 42,
      "directory": "experiments/sync-lr0.0056-beta2-0.999-seed42",
      "job_id": "2309169_0",
      "loss": 3.604161738933793,
      "seconds": 400.20465396496,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.6030228630617325,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.604161738933793,
          "perplexity": 36.750864123013464,
          "tokens": 197411295,
          "seconds": 100.54827312205452,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 400.20465396496,
        "training_seconds": 274.76180745847523,
        "training_elapsed_seconds": 299.60193142900243,
        "training_tokens_per_second": 1485181.5533411491,
        "elapsed_tokens_per_second": 1362044.517048455,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "803541c88c02db8d04f53eda5945935156763712fc593668292f7b59b1c5962c"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 1,
      "run_id": "sync-lr0.0014-beta2-0.95-seed42",
      "lr": 0.0014,
      "beta2": 0.95,
      "seed": 42,
      "directory": "experiments/sync-lr0.0014-beta2-0.95-seed42",
      "job_id": "2309171_1",
      "loss": 3.636277887449773,
      "seconds": 387.5564414219698,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.6342926152541812,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.636277887449773,
          "perplexity": 37.950318159262345,
          "tokens": 197411295,
          "seconds": 100.90249953302555,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 387.5564414219698,
        "training_seconds": 258.372028212063,
        "training_elapsed_seconds": 286.60176692099776,
        "training_tokens_per_second": 1579393.7556780295,
        "elapsed_tokens_per_second": 1423826.420834612,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "2f8c74b280c20d17deaa7d108585797d5673d64f97bee8a17a55439822b28f68"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 2,
      "run_id": "sync-lr0.0014-beta2-0.95-seed43",
      "lr": 0.0014,
      "beta2": 0.95,
      "seed": 43,
      "directory": "experiments/sync-lr0.0014-beta2-0.95-seed43",
      "job_id": "2309171_2",
      "loss": 3.628163892034913,
      "seconds": 385.500117967953,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.6267391575067593,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.628163892034913,
          "perplexity": 37.643635345782656,
          "tokens": 197411295,
          "seconds": 101.44003777496982,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 385.500117967953,
        "training_seconds": 256.67393947951496,
        "training_elapsed_seconds": 283.97848393698223,
        "training_tokens_per_second": 1589842.6183331634,
        "elapsed_tokens_per_second": 1436979.176529991,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "09323ead4ac863dc85f59472798ea3a3b9ab671b34fa73b926223b2ba10b19a2"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 3,
      "run_id": "sync-lr0.0014-beta2-0.95-seed44",
      "lr": 0.0014,
      "beta2": 0.95,
      "seed": 44,
      "directory": "experiments/sync-lr0.0014-beta2-0.95-seed44",
      "job_id": "2309171_3",
      "loss": 3.6375625961975997,
      "seconds": 414.7916536720004,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.635930802955726,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.6375625961975997,
          "perplexity": 37.9991045964556,
          "tokens": 197411295,
          "seconds": 103.00464479299262,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 414.7916536720004,
        "training_seconds": 286.2269982678117,
        "training_elapsed_seconds": 311.7326392569812,
        "training_tokens_per_second": 1425690.694691852,
        "elapsed_tokens_per_second": 1309042.1618109767,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "47d84b9c53862eec606c17cd5d38cd6844bed139fccd259f14e5480afb0676d8"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 4,
      "run_id": "sync-lr0.0014-beta2-0.98-seed42",
      "lr": 0.0014,
      "beta2": 0.98,
      "seed": 42,
      "directory": "experiments/sync-lr0.0014-beta2-0.98-seed42",
      "job_id": "2309171_4",
      "loss": 3.6288249244391237,
      "seconds": 413.94307978998404,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.626187248434817,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.6288249244391237,
          "perplexity": 37.66852723482474,
          "tokens": 197411295,
          "seconds": 101.78948787995614,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 413.94307978998404,
        "training_seconds": 283.98423245653976,
        "training_elapsed_seconds": 312.09912631998304,
        "training_tokens_per_second": 1436950.0886372281,
        "elapsed_tokens_per_second": 1307504.9994905163,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "9f9dd3693643382f3391ec69f56fce516e81af5d4d86b459b49d3c74afa68b2b"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 5,
      "run_id": "sync-lr0.0014-beta2-0.98-seed43",
      "lr": 0.0014,
      "beta2": 0.98,
      "seed": 43,
      "directory": "experiments/sync-lr0.0014-beta2-0.98-seed43",
      "job_id": "2309171_5",
      "loss": 3.629206617306904,
      "seconds": 408.18199703400023,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.6278266080552215,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.629206617306904,
          "perplexity": 37.68290778731264,
          "tokens": 197411295,
          "seconds": 101.84486362803727,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 408.18199703400023,
        "training_seconds": 281.9598328260472,
        "training_elapsed_seconds": 306.27413380902726,
        "training_tokens_per_second": 1447267.0234974786,
        "elapsed_tokens_per_second": 1332372.286634061,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "c1f338f515024c062c12e018a88c88c21e09c66de403e4850a1cd7d107bb52b6"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 6,
      "run_id": "sync-lr0.0014-beta2-0.98-seed44",
      "lr": 0.0014,
      "beta2": 0.98,
      "seed": 44,
      "directory": "experiments/sync-lr0.0014-beta2-0.98-seed44",
      "job_id": "2309171_6",
      "loss": 3.623668569231974,
      "seconds": 414.92536617908627,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.6219984318165674,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.623668569231974,
          "perplexity": 37.474794834054755,
          "tokens": 197411295,
          "seconds": 101.22136604390107,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 414.92536617908627,
        "training_seconds": 282.3604204733856,
        "training_elapsed_seconds": 313.65425812406465,
        "training_tokens_per_second": 1445213.770810571,
        "elapsed_tokens_per_second": 1301022.2480020951,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "16cc2657a2d4866686b587c1cd50ded72132663bf0c5ee490157bb184e469ee7"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 7,
      "run_id": "sync-lr0.0014-beta2-0.999-seed42",
      "lr": 0.0014,
      "beta2": 0.999,
      "seed": 42,
      "directory": "experiments/sync-lr0.0014-beta2-0.999-seed42",
      "job_id": "2309171_7",
      "loss": 3.6217390851782545,
      "seconds": 417.69806110090576,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.6204591989385912,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.6217390851782545,
          "perplexity": 37.40255752778238,
          "tokens": 197411295,
          "seconds": 102.87451314902864,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 417.69806110090576,
        "training_seconds": 286.04880442423746,
        "training_elapsed_seconds": 314.7718454878777,
        "training_tokens_per_second": 1426578.8274185262,
        "elapsed_tokens_per_second": 1296403.0101469648,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "bdb7dba947ef59881ece5052024d78d71568bcfc67f4109d83109f2791178586"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 8,
      "run_id": "sync-lr0.0014-beta2-0.999-seed43",
      "lr": 0.0014,
      "beta2": 0.999,
      "seed": 43,
      "directory": "experiments/sync-lr0.0014-beta2-0.999-seed43",
      "job_id": "2309171_8",
      "loss": 3.6457900544307087,
      "seconds": 412.21881946211215,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.6450575825483584,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.6457900544307087,
          "perplexity": 38.31303027680175,
          "tokens": 197411295,
          "seconds": 101.44600877608173,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 412.21881946211215,
        "training_seconds": 285.91527944034897,
        "training_elapsed_seconds": 310.7091154369991,
        "training_tokens_per_second": 1427245.0524461623,
        "elapsed_tokens_per_second": 1313354.3488933863,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "3b7596cdeba79c34434f92a9d8618decca8a2ac322159ecb60b0532ea9a599a5"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 9,
      "run_id": "sync-lr0.0014-beta2-0.999-seed44",
      "lr": 0.0014,
      "beta2": 0.999,
      "seed": 44,
      "directory": "experiments/sync-lr0.0014-beta2-0.999-seed44",
      "job_id": "2309171_9",
      "loss": 3.6441862929713045,
      "seconds": 415.7068172519794,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.642051789439824,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.6441862929713045,
          "perplexity": 38.2516345606519,
          "tokens": 197411295,
          "seconds": 103.92442302196287,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 415.7068172519794,
        "training_seconds": 285.9986187473405,
        "training_elapsed_seconds": 311.72597423009574,
        "training_tokens_per_second": 1426829.1566838017,
        "elapsed_tokens_per_second": 1309070.150499517,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "c1ab7554e8c2d43e3acf94c69c821a2e103d7938dfe7aca6c7433c22f1bd4211"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 10,
      "run_id": "sync-lr0.0028-beta2-0.95-seed42",
      "lr": 0.0028,
      "beta2": 0.95,
      "seed": 42,
      "directory": "experiments/sync-lr0.0028-beta2-0.95-seed42",
      "job_id": "2309171_10",
      "loss": 3.5872157479470483,
      "seconds": 408.36507332208566,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.585680362603873,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5872157479470483,
          "perplexity": 36.133331440294036,
          "tokens": 197411295,
          "seconds": 101.03699230204802,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 408.36507332208566,
        "training_seconds": 282.2951610456221,
        "training_elapsed_seconds": 307.27322074898984,
        "training_tokens_per_second": 1445547.8673049274,
        "elapsed_tokens_per_second": 1328040.1299055982,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "fd0986c3c8c7a2c9769f64c19f9595735e1ebee57b25208b95237fe3d335b666"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 11,
      "run_id": "sync-lr0.0028-beta2-0.95-seed43",
      "lr": 0.0028,
      "beta2": 0.95,
      "seed": 43,
      "directory": "experiments/sync-lr0.0028-beta2-0.95-seed43",
      "job_id": "2309171_11",
      "loss": 3.5763198318289677,
      "seconds": 406.25544158509,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5754409577217303,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5763198318289677,
          "perplexity": 35.7417628152438,
          "tokens": 197411295,
          "seconds": 101.37457716907375,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 406.25544158509,
        "training_seconds": 279.7522761344444,
        "training_elapsed_seconds": 304.8249690979719,
        "training_tokens_per_second": 1458687.5704413843,
        "elapsed_tokens_per_second": 1338706.5016607756,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "cadd47a253df2340c3744fc4e012295e514bd0a36db25f41e324392d43b6499e"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 12,
      "run_id": "sync-lr0.0028-beta2-0.95-seed44",
      "lr": 0.0028,
      "beta2": 0.95,
      "seed": 44,
      "directory": "experiments/sync-lr0.0028-beta2-0.95-seed44",
      "job_id": "2309171_12",
      "loss": 3.584165378163221,
      "seconds": 410.0477051079506,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5829431094083026,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.584165378163221,
          "perplexity": 36.02327935299438,
          "tokens": 197411295,
          "seconds": 102.28983520704787,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 410.0477051079506,
        "training_seconds": 283.37125958525576,
        "training_elapsed_seconds": 307.70002664090134,
        "training_tokens_per_second": 1440058.418758684,
        "elapsed_tokens_per_second": 1326198.0262232344,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "896db3fe340485bdcaf6f09c11c29a3775ab225f04b28ab96a40a6409323aaa1"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 13,
      "run_id": "sync-lr0.0028-beta2-0.98-seed42",
      "lr": 0.0028,
      "beta2": 0.98,
      "seed": 42,
      "directory": "experiments/sync-lr0.0028-beta2-0.98-seed42",
      "job_id": "2309171_13",
      "loss": 3.5852961626658044,
      "seconds": 406.14007804193534,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5847399362059376,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5852961626658044,
          "perplexity": 36.06403695871047,
          "tokens": 197411295,
          "seconds": 100.24766529700719,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 406.14007804193534,
        "training_seconds": 279.92454191774596,
        "training_elapsed_seconds": 305.83654372405726,
        "training_tokens_per_second": 1457789.892963044,
        "elapsed_tokens_per_second": 1334278.64123453,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "368391c63756f17dbb6354d3458fce39c7d2434bdc9977387e8b6e209279aaa3"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 14,
      "run_id": "sync-lr0.0028-beta2-0.98-seed43",
      "lr": 0.0028,
      "beta2": 0.98,
      "seed": 43,
      "directory": "experiments/sync-lr0.0028-beta2-0.98-seed43",
      "job_id": "2309171_14",
      "loss": 3.584590922902246,
      "seconds": 407.02636859798804,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5831250041675267,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.584590922902246,
          "perplexity": 36.03861213216586,
          "tokens": 197411295,
          "seconds": 102.09566441096831,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 407.02636859798804,
        "training_seconds": 279.81437623593956,
        "training_elapsed_seconds": 304.87518748198636,
        "training_tokens_per_second": 1458363.8392328857,
        "elapsed_tokens_per_second": 1338485.9928101266,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "4e0aebd35d8a49a3d038830e9cf5cd8a03c290ed648375de1e2c0a45a9c7c06e"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 15,
      "run_id": "sync-lr0.0028-beta2-0.98-seed44",
      "lr": 0.0028,
      "beta2": 0.98,
      "seed": 44,
      "directory": "experiments/sync-lr0.0028-beta2-0.98-seed44",
      "job_id": "2309171_15",
      "loss": 3.5832473363710298,
      "seconds": 408.5422437239904,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5814212337978546,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5832473363710298,
          "perplexity": 35.99022365263537,
          "tokens": 197411295,
          "seconds": 101.238697531051,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 408.5422437239904,
        "training_seconds": 282.13527625461575,
        "training_elapsed_seconds": 307.2540295730578,
        "training_tokens_per_second": 1446367.0527741173,
        "elapsed_tokens_per_second": 1328123.0796778542,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "10b4801ea632bd73b7dd37be36c489aba690f583a0f2b34e2b72896b99cadaeb"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 16,
      "run_id": "sync-lr0.0028-beta2-0.999-seed42",
      "lr": 0.0028,
      "beta2": 0.999,
      "seed": 42,
      "directory": "experiments/sync-lr0.0028-beta2-0.999-seed42",
      "job_id": "2309171_16",
      "loss": 3.593366214869782,
      "seconds": 412.79942919302266,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5912057374853523,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.593366214869782,
          "perplexity": 36.35625313364884,
          "tokens": 197411295,
          "seconds": 101.64586564805359,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 412.79942919302266,
        "training_seconds": 284.0499529526569,
        "training_elapsed_seconds": 311.0778918840224,
        "training_tokens_per_second": 1436617.622211027,
        "elapsed_tokens_per_second": 1311797.3943070795,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "3611dc9d5266eac39dbf2d42462774e46a4544fefbb989d20897bea3a22c5f17"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 17,
      "run_id": "sync-lr0.0028-beta2-0.999-seed43",
      "lr": 0.0028,
      "beta2": 0.999,
      "seed": 43,
      "directory": "experiments/sync-lr0.0028-beta2-0.999-seed43",
      "job_id": "2309171_17",
      "loss": 3.59718920375052,
      "seconds": 417.9461483490886,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.597070945324081,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.59718920375052,
          "perplexity": 36.49550870176386,
          "tokens": 197411295,
          "seconds": 102.74184378096834,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 417.9461483490886,
        "training_seconds": 287.2885779446224,
        "training_elapsed_seconds": 315.1244700229727,
        "training_tokens_per_second": 1420422.5274791804,
        "elapsed_tokens_per_second": 1294952.3341372109,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "51968a5211ceb7625bd4eb683e93bd72882c57f2b1fd025552b2d487bcfd3aa1"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 18,
      "run_id": "sync-lr0.0028-beta2-0.999-seed44",
      "lr": 0.0028,
      "beta2": 0.999,
      "seed": 44,
      "directory": "experiments/sync-lr0.0028-beta2-0.999-seed44",
      "job_id": "2309171_18",
      "loss": 3.593042210890475,
      "seconds": 425.7305402238853,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5923201038653385,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.593042210890475,
          "perplexity": 36.344475471068655,
          "tokens": 197411295,
          "seconds": 100.85110924392939,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 425.7305402238853,
        "training_seconds": 289.01004825974815,
        "training_elapsed_seconds": 324.78085344005376,
        "training_tokens_per_second": 1411961.8693438836,
        "elapsed_tokens_per_second": 1256450.8149964558,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "684d2ba473051b25055f330d947affb0c7a3ba6957b65fa308ba7f11dbf3cdfa"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 19,
      "run_id": "sync-lr0.004-beta2-0.95-seed42",
      "lr": 0.004,
      "beta2": 0.95,
      "seed": 42,
      "directory": "experiments/sync-lr0.004-beta2-0.95-seed42",
      "job_id": "2309171_19",
      "loss": 3.573144072662422,
      "seconds": 430.40076340083033,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5706732382148054,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.573144072662422,
          "perplexity": 35.62843562952548,
          "tokens": 197411295,
          "seconds": 102.55974918883294,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 430.40076340083033,
        "training_seconds": 294.7259731392842,
        "training_elapsed_seconds": 327.76786376186647,
        "training_tokens_per_second": 1384578.2360251981,
        "elapsed_tokens_per_second": 1245000.5418971654,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "99b353f844f5b570e7bbcf620197346be520121fe93eff763940761b50e01bb9"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 20,
      "run_id": "sync-lr0.004-beta2-0.95-seed43",
      "lr": 0.004,
      "beta2": 0.95,
      "seed": 43,
      "directory": "experiments/sync-lr0.004-beta2-0.95-seed43",
      "job_id": "2309171_20",
      "loss": 3.5662502043357978,
      "seconds": 407.78216305794194,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5658521124871676,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5662502043357978,
          "perplexity": 35.38366257163852,
          "tokens": 197411295,
          "seconds": 100.56725838687271,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 407.78216305794194,
        "training_seconds": 282.78959862468764,
        "training_elapsed_seconds": 307.14067770098336,
        "training_tokens_per_second": 1443020.4292682752,
        "elapsed_tokens_per_second": 1328613.2304405393,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "0a178f949518ab2a94ed5bf43e15d003af68833f1be3c674fdda062464769355"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 21,
      "run_id": "sync-lr0.004-beta2-0.95-seed44",
      "lr": 0.004,
      "beta2": 0.95,
      "seed": 44,
      "directory": "experiments/sync-lr0.004-beta2-0.95-seed44",
      "job_id": "2309171_21",
      "loss": 3.5678784355125663,
      "seconds": 409.87976982886903,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.567196831775803,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5678784355125663,
          "perplexity": 35.44132228311721,
          "tokens": 197411295,
          "seconds": 101.67791338590905,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 409.87976982886903,
        "training_seconds": 283.41841797786765,
        "training_elapsed_seconds": 308.1305121718906,
        "training_tokens_per_second": 1439818.805395585,
        "elapsed_tokens_per_second": 1324345.2104878128,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "81579468a023e2cd7a441f41f5921eb237217ff01f6b0d9bf05e6150bc780cd8"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 22,
      "run_id": "sync-lr0.004-beta2-0.98-seed42",
      "lr": 0.004,
      "beta2": 0.98,
      "seed": 42,
      "directory": "experiments/sync-lr0.004-beta2-0.98-seed42",
      "job_id": "2309171_22",
      "loss": 3.5671379531597625,
      "seconds": 411.4645437739091,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5656923104729574,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5671379531597625,
          "perplexity": 35.4150883234973,
          "tokens": 197411295,
          "seconds": 101.72161698702257,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 411.4645437739091,
        "training_seconds": 283.5773655192461,
        "training_elapsed_seconds": 309.6890586320078,
        "training_tokens_per_second": 1439011.7746273535,
        "elapsed_tokens_per_second": 1317680.2881011565,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "82f3a71a188f27d2ae6662ea4bea1c8f36b4c976c7821a92cc64c47f50066e4d"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 23,
      "run_id": "sync-lr0.004-beta2-0.98-seed43",
      "lr": 0.004,
      "beta2": 0.98,
      "seed": 43,
      "directory": "experiments/sync-lr0.004-beta2-0.98-seed43",
      "job_id": "2309171_23",
      "loss": 3.5585409775871013,
      "seconds": 408.46191829512827,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.557411337495082,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5585409775871013,
          "perplexity": 35.11193066093189,
          "tokens": 197411295,
          "seconds": 101.62403476494364,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 408.46191829512827,
        "training_seconds": 281.72600184194744,
        "training_elapsed_seconds": 306.7863075330388,
        "training_tokens_per_second": 1448468.2469207586,
        "elapsed_tokens_per_second": 1330147.9172308026,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "475d4c2142ca189f07199e3a07a3c5676194d46e05b434a4b22a53daeb33ce57"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 24,
      "run_id": "sync-lr0.004-beta2-0.98-seed44",
      "lr": 0.004,
      "beta2": 0.98,
      "seed": 44,
      "directory": "experiments/sync-lr0.004-beta2-0.98-seed44",
      "job_id": "2309171_24",
      "loss": 3.562833245788928,
      "seconds": 406.6111799739301,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5606329912293058,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.562833245788928,
          "perplexity": 35.26296439116981,
          "tokens": 197411295,
          "seconds": 100.37708958506119,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 406.6111799739301,
        "training_seconds": 281.30372317810543,
        "training_elapsed_seconds": 306.1843425279949,
        "training_tokens_per_second": 1450642.612865926,
        "elapsed_tokens_per_second": 1332763.0166545485,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "ec377a7ae360738e0c2c4662dc377a7a50e8dda9bda444b9cb340e4d6ff13768"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 25,
      "run_id": "sync-lr0.004-beta2-0.999-seed42",
      "lr": 0.004,
      "beta2": 0.999,
      "seed": 42,
      "directory": "experiments/sync-lr0.004-beta2-0.999-seed42",
      "job_id": "2309171_25",
      "loss": 3.5750732495239617,
      "seconds": 413.9834138250444,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5733347643759585,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5750732495239617,
          "perplexity": 35.697235525400565,
          "tokens": 197411295,
          "seconds": 102.4030127018923,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 413.9834138250444,
        "training_seconds": 284.21204834303353,
        "training_elapsed_seconds": 311.52442764805164,
        "training_tokens_per_second": 1435798.2723782104,
        "elapsed_tokens_per_second": 1309917.0780309504,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "17b0e4c48cf258017458a0befd68d1005d7cbb6b055374d3b528bb82227be75c"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 26,
      "run_id": "sync-lr0.004-beta2-0.999-seed43",
      "lr": 0.004,
      "beta2": 0.999,
      "seed": 43,
      "directory": "experiments/sync-lr0.004-beta2-0.999-seed43",
      "job_id": "2309171_26",
      "loss": 3.5742767729819813,
      "seconds": 412.47199171606917,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5739796943331568,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5742767729819813,
          "perplexity": 35.66881483440033,
          "tokens": 197411295,
          "seconds": 101.81665917299688,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 412.47199171606917,
        "training_seconds": 282.94711435656063,
        "training_elapsed_seconds": 310.5486551489448,
        "training_tokens_per_second": 1442217.1045213847,
        "elapsed_tokens_per_second": 1314032.9582309143,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "5ab95643ee26182133ce3a8cb15a03603dfe91812b1d7353252b4c62a56d6ed7"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 27,
      "run_id": "sync-lr0.004-beta2-0.999-seed44",
      "lr": 0.004,
      "beta2": 0.999,
      "seed": 44,
      "directory": "experiments/sync-lr0.004-beta2-0.999-seed44",
      "job_id": "2309171_27",
      "loss": 3.5792689342394937,
      "seconds": 402.4294773499714,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.57818326586333,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5792689342394937,
          "perplexity": 35.8473245137408,
          "tokens": 197411295,
          "seconds": 101.48838242096826,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 402.4294773499714,
        "training_seconds": 275.814138406422,
        "training_elapsed_seconds": 300.8524877780583,
        "training_tokens_per_second": 1479515.047189831,
        "elapsed_tokens_per_second": 1356382.8938686987,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "55a97b23de5a1c734e3750d2bf6180db8f12c4ba1ea54f610b5bca01965ee41e"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 28,
      "run_id": "sync-lr0.0056-beta2-0.95-seed42",
      "lr": 0.0056,
      "beta2": 0.95,
      "seed": 42,
      "directory": "experiments/sync-lr0.0056-beta2-0.95-seed42",
      "job_id": "2309171_28",
      "loss": 3.5676273667514233,
      "seconds": 403.7977267259266,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.567151596137256,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5676273667514233,
          "perplexity": 35.43242519117597,
          "tokens": 197411295,
          "seconds": 101.18786655901931,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 403.7977267259266,
        "training_seconds": 277.87575121968985,
        "training_elapsed_seconds": 302.5410048090853,
        "training_tokens_per_second": 1468538.244912839,
        "elapsed_tokens_per_second": 1348812.7609594879,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "1daf541f703d48ce90b54e7af48bc945eb2eaf0a61be2b582730069d85bb2827"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 29,
      "run_id": "sync-lr0.0056-beta2-0.95-seed43",
      "lr": 0.0056,
      "beta2": 0.95,
      "seed": 43,
      "directory": "experiments/sync-lr0.0056-beta2-0.95-seed43",
      "job_id": "2309171_29",
      "loss": 3.5629870071201295,
      "seconds": 409.7527318808716,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5626451977443447,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5629870071201295,
          "perplexity": 35.26838688839123,
          "tokens": 197411295,
          "seconds": 102.80336602614261,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 409.7527318808716,
        "training_seconds": 281.7245408690069,
        "training_elapsed_seconds": 306.8847083488945,
        "training_tokens_per_second": 1448475.7584172986,
        "elapsed_tokens_per_second": 1329721.4129550813,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "f94eb62ae53576a6c40d4e9392ab820aad202d329ba4ae8967fe91cf5d277922"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 30,
      "run_id": "sync-lr0.0056-beta2-0.95-seed44",
      "lr": 0.0056,
      "beta2": 0.95,
      "seed": 44,
      "directory": "experiments/sync-lr0.0056-beta2-0.95-seed44",
      "job_id": "2309171_30",
      "loss": 3.5663745052897555,
      "seconds": 402.72821879805997,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.56495531804048,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5663745052897555,
          "perplexity": 35.38806106801368,
          "tokens": 197411295,
          "seconds": 100.64753854798619,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 402.72821879805997,
        "training_seconds": 277.83285811101086,
        "training_elapsed_seconds": 302.02975517197046,
        "training_tokens_per_second": 1468764.9645707174,
        "elapsed_tokens_per_second": 1351095.9136051063,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "3f4dd1560d5b1634e9792ec1038cda2e1d29a1ddd9567dd683a441b617ffab1e"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 31,
      "run_id": "sync-lr0.0056-beta2-0.98-seed42",
      "lr": 0.0056,
      "beta2": 0.98,
      "seed": 42,
      "directory": "experiments/sync-lr0.0056-beta2-0.98-seed42",
      "job_id": "2309171_31",
      "loss": 3.5535064305116237,
      "seconds": 421.16772247699555,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.551165915780157,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5535064305116237,
          "perplexity": 34.935602232440154,
          "tokens": 197411295,
          "seconds": 102.63399306498468,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 421.16772247699555,
        "training_seconds": 287.5543274686206,
        "training_elapsed_seconds": 318.44787176698446,
        "training_tokens_per_second": 1419109.81341267,
        "elapsed_tokens_per_second": 1281437.8872614822,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "02db624938b90c64cea30a486021eaf455e4be760546f2279bd37282d33650e2"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 32,
      "run_id": "sync-lr0.0056-beta2-0.98-seed43",
      "lr": 0.0056,
      "beta2": 0.98,
      "seed": 43,
      "directory": "experiments/sync-lr0.0056-beta2-0.98-seed43",
      "job_id": "2309171_32",
      "loss": 3.5593463385898336,
      "seconds": 413.7033181160223,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.558346501149149,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5593463385898336,
          "perplexity": 35.14021983058482,
          "tokens": 197411295,
          "seconds": 101.80856690206565,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 413.7033181160223,
        "training_seconds": 284.7243429342052,
        "training_elapsed_seconds": 311.80108313797973,
        "training_tokens_per_second": 1433214.8905662699,
        "elapsed_tokens_per_second": 1308754.8121807466,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "b40fc99378878f5f22a2b6cf21a88ef3a91763bfee7604f3080e1796bb299b79"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 33,
      "run_id": "sync-lr0.0056-beta2-0.98-seed44",
      "lr": 0.0056,
      "beta2": 0.98,
      "seed": 44,
      "directory": "experiments/sync-lr0.0056-beta2-0.98-seed44",
      "job_id": "2309171_33",
      "loss": 3.563214287300409,
      "seconds": 411.59149710205384,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.561040906626666,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.563214287300409,
          "perplexity": 35.27640360470724,
          "tokens": 197411295,
          "seconds": 103.16094298905227,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 411.59149710205384,
        "training_seconds": 282.0006651780568,
        "training_elapsed_seconds": 308.3618515699636,
        "training_tokens_per_second": 1447057.4661316546,
        "elapsed_tokens_per_second": 1323351.6594947982,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "2be3941302ca2e8d18a972d40c2341d4302be9ce8854a88204b4bd596599840b"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 34,
      "run_id": "sync-lr0.0056-beta2-0.999-seed43",
      "lr": 0.0056,
      "beta2": 0.999,
      "seed": 43,
      "directory": "experiments/sync-lr0.0056-beta2-0.999-seed43",
      "job_id": "2309171_34",
      "loss": 3.808341492543859,
      "seconds": 404.8546493209433,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.8088081359693997,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.808341492543859,
          "perplexity": 45.07561858895518,
          "tokens": 197411295,
          "seconds": 101.67652215901762,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 404.8546493209433,
        "training_seconds": 277.5487052372191,
        "training_elapsed_seconds": 303.1096855120268,
        "training_tokens_per_second": 1470268.6782531526,
        "elapsed_tokens_per_second": 1346282.1793723532,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "ca0a8b215afdbc134d6687c40009055667a65abaf9b810443299775948f965dd"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 35,
      "run_id": "sync-lr0.0056-beta2-0.999-seed44",
      "lr": 0.0056,
      "beta2": 0.999,
      "seed": 44,
      "directory": "experiments/sync-lr0.0056-beta2-0.999-seed44",
      "job_id": "2309171_35",
      "loss": 3.6602563864681947,
      "seconds": 407.98054813197814,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.6585165191616946,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.6602563864681947,
          "perplexity": 38.87130767114588,
          "tokens": 197411295,
          "seconds": 101.40801933396142,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 407.98054813197814,
        "training_seconds": 281.7763628277462,
        "training_elapsed_seconds": 306.4788726910483,
        "training_tokens_per_second": 1448209.3668355695,
        "elapsed_tokens_per_second": 1331482.2141471517,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "740452882ec990ba50d20c0a77d45c5c2ab993e0c873b0e0cfb18dedd33d4f49"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 36,
      "run_id": "sync-lr0.008-beta2-0.95-seed42",
      "lr": 0.008,
      "beta2": 0.95,
      "seed": 42,
      "directory": "experiments/sync-lr0.008-beta2-0.95-seed42",
      "job_id": "2309171_36",
      "loss": 3.62000827067278,
      "seconds": 413.43899783398956,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.6191591578116453,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.62000827067278,
          "perplexity": 37.337876630136535,
          "tokens": 197411295,
          "seconds": 103.73092502495274,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 413.43899783398956,
        "training_seconds": 282.5368670951575,
        "training_elapsed_seconds": 309.638602697989,
        "training_tokens_per_second": 1444311.2227989805,
        "elapsed_tokens_per_second": 1317895.0054816608,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "ab68442e0d5d61aac32b2d33feef524e192adbe0f91c66bd3cb5564b2d989663"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 37,
      "run_id": "sync-lr0.008-beta2-0.95-seed43",
      "lr": 0.008,
      "beta2": 0.95,
      "seed": 43,
      "directory": "experiments/sync-lr0.008-beta2-0.95-seed43",
      "job_id": "2309171_37",
      "loss": 3.5731639551648193,
      "seconds": 405.82850169797894,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5737586913886266,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.5731639551648193,
          "perplexity": 35.62914401902455,
          "tokens": 197411295,
          "seconds": 100.8663729398977,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 405.82850169797894,
        "training_seconds": 278.635321296053,
        "training_elapsed_seconds": 304.8824914719444,
        "training_tokens_per_second": 1464534.9559484601,
        "elapsed_tokens_per_second": 1338453.9270519284,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "676a39779836a78673d0927a10bd7bbe249cd8566667035fb76c4459f05e14c2"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 38,
      "run_id": "sync-lr0.008-beta2-0.95-seed44",
      "lr": 0.008,
      "beta2": 0.95,
      "seed": 44,
      "directory": "experiments/sync-lr0.008-beta2-0.95-seed44",
      "job_id": "2309171_38",
      "loss": 3.573308291664289,
      "seconds": 402.2623947690008,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.5721577596616343,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.573308291664289,
          "perplexity": 35.63428697610064,
          "tokens": 197411295,
          "seconds": 100.66842009907123,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 402.2623947690008,
        "training_seconds": 277.15832134115044,
        "training_elapsed_seconds": 301.5014559919946,
        "training_tokens_per_second": 1472339.5856396125,
        "elapsed_tokens_per_second": 1353463.3411880936,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "0eecd177b93f3210c0571385a15b0efb0dcfaadd0349a7d34b12dd55ac0ac53f"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 39,
      "run_id": "sync-lr0.008-beta2-0.98-seed42",
      "lr": 0.008,
      "beta2": 0.98,
      "seed": 42,
      "directory": "experiments/sync-lr0.008-beta2-0.98-seed42",
      "job_id": "2309171_39",
      "loss": 3.742013251705526,
      "seconds": 406.53734051890206,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.742849053226256,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.742013251705526,
          "perplexity": 42.18282938819545,
          "tokens": 197411295,
          "seconds": 100.3323176279664,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 406.53734051890206,
        "training_seconds": 279.0145163725829,
        "training_elapsed_seconds": 306.1043251840165,
        "training_tokens_per_second": 1462544.5776272118,
        "elapsed_tokens_per_second": 1333111.4081928947,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "35ed1209bd346f0ed7a96bebe609eed744189aa3e0151ec484728ff661cd9f5a"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 40,
      "run_id": "sync-lr0.008-beta2-0.98-seed43",
      "lr": 0.008,
      "beta2": 0.98,
      "seed": 43,
      "directory": "experiments/sync-lr0.008-beta2-0.98-seed43",
      "job_id": "2309171_40",
      "loss": 4.022291932838654,
      "seconds": 409.0824563310016,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.022237609770127,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.022291932838654,
          "perplexity": 55.82891542995451,
          "tokens": 197411295,
          "seconds": 101.93943956797011,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 409.0824563310016,
        "training_seconds": 280.25349029887,
        "training_elapsed_seconds": 307.02368253900204,
        "training_tokens_per_second": 1456078.8076709472,
        "elapsed_tokens_per_second": 1329119.5149030942,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "3714e855363610fa51312554885dcfe72291801b3f15bb3fb521e549224ab369"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 41,
      "run_id": "sync-lr0.008-beta2-0.98-seed44",
      "lr": 0.008,
      "beta2": 0.98,
      "seed": 44,
      "directory": "experiments/sync-lr0.008-beta2-0.98-seed44",
      "job_id": "2309171_41",
      "loss": 3.9327716617507313,
      "seconds": 410.0246624420397,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 3.9342298317291977,
        "best_epoch": 40,
        "final_validation": {
          "loss": 3.9327716617507313,
          "perplexity": 51.0482703093035,
          "tokens": 197411295,
          "seconds": 102.39307927899063,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 410.0246624420397,
        "training_seconds": 280.37385704298504,
        "training_elapsed_seconds": 307.562826312962,
        "training_tokens_per_second": 1455453.7013678749,
        "elapsed_tokens_per_second": 1326789.6282913114,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "30e99f04524a18e202da77259ce05bffbd8015be86d9fef5dc1a4f5b17adf9c7"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 42,
      "run_id": "sync-lr0.008-beta2-0.999-seed42",
      "lr": 0.008,
      "beta2": 0.999,
      "seed": 42,
      "directory": "experiments/sync-lr0.008-beta2-0.999-seed42",
      "job_id": "2309171_42",
      "loss": 4.775959981304514,
      "seconds": 416.2145760949934,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.7779771442129615,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.775959981304514,
          "perplexity": 118.62413693205555,
          "tokens": 197411295,
          "seconds": 104.38212221697904,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 416.2145760949934,
        "training_seconds": 284.3381337393075,
        "training_elapsed_seconds": 311.779789644992,
        "training_tokens_per_second": 1435161.5895957728,
        "elapsed_tokens_per_second": 1308844.1956569736,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "783021be662ee629f718ea048e2042e4bfa375672662adbc220a9bbd9f7d79a5"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 43,
      "run_id": "sync-lr0.008-beta2-0.999-seed43",
      "lr": 0.008,
      "beta2": 0.999,
      "seed": 43,
      "directory": "experiments/sync-lr0.008-beta2-0.999-seed43",
      "job_id": "2309171_43",
      "loss": 4.633524559044304,
      "seconds": 403.642987213796,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.636494621809683,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.633524559044304,
          "perplexity": 102.87601847238376,
          "tokens": 197411295,
          "seconds": 100.59575952286832,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 403.642987213796,
        "training_seconds": 277.1089117007796,
        "training_elapsed_seconds": 302.96956403390504,
        "training_tokens_per_second": 1472602.1097460503,
        "elapsed_tokens_per_second": 1346904.8262363845,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "0295d258892dbfb696a0cd2e8a9f71190cbdb9b704c43aeb3f860c65c1610e6f"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 44,
      "run_id": "sync-lr0.008-beta2-0.999-seed44",
      "lr": 0.008,
      "beta2": 0.999,
      "seed": 44,
      "directory": "experiments/sync-lr0.008-beta2-0.999-seed44",
      "job_id": "2309171_44",
      "loss": 4.608172727663375,
      "seconds": 404.197563390946,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.609277061024921,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.608172727663375,
          "perplexity": 100.30070538183749,
          "tokens": 197411295,
          "seconds": 101.1397620269563,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 404.197563390946,
        "training_seconds": 277.12470014137216,
        "training_elapsed_seconds": 302.9769915898796,
        "training_tokens_per_second": 1472518.2121688428,
        "elapsed_tokens_per_second": 1346871.8065310372,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "a325505dd635931dbf8eb4a0ecc7f8b2636dbf03ab59b8ba683abbc64ae564cd"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 45,
      "run_id": "sync-lr0.0112-beta2-0.95-seed42",
      "lr": 0.0112,
      "beta2": 0.95,
      "seed": 42,
      "directory": "experiments/sync-lr0.0112-beta2-0.95-seed42",
      "job_id": "2309171_45",
      "loss": 4.382821600001977,
      "seconds": 415.6191476449603,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.384270114868685,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.382821600001977,
          "perplexity": 80.06362251174245,
          "tokens": 197411295,
          "seconds": 101.38991122308653,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 415.6191476449603,
        "training_seconds": 277.73582529556006,
        "training_elapsed_seconds": 314.1788758679759,
        "training_tokens_per_second": 1469278.1083093623,
        "elapsed_tokens_per_second": 1298849.7933625542,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "ca6cd441a43567b7c0ca984a11f950f987e075b25ff31995dab9562508ff7ffa"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 46,
      "run_id": "sync-lr0.0112-beta2-0.95-seed43",
      "lr": 0.0112,
      "beta2": 0.95,
      "seed": 43,
      "directory": "experiments/sync-lr0.0112-beta2-0.95-seed43",
      "job_id": "2309171_46",
      "loss": 4.282306515989841,
      "seconds": 400.5160363580799,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.281292256912208,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.282306515989841,
          "perplexity": 72.40725604528956,
          "tokens": 197411295,
          "seconds": 100.38925493997522,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 400.5160363580799,
        "training_seconds": 274.7673334144056,
        "training_elapsed_seconds": 300.0537722070003,
        "training_tokens_per_second": 1485151.6842598782,
        "elapsed_tokens_per_second": 1359993.4605004098,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "e583009ddc41ac419329bf685b9b7e48d0188afa6d4fc6723d7f99cf6faf827e"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 47,
      "run_id": "sync-lr0.0112-beta2-0.95-seed44",
      "lr": 0.0112,
      "beta2": 0.95,
      "seed": 44,
      "directory": "experiments/sync-lr0.0112-beta2-0.95-seed44",
      "job_id": "2309171_47",
      "loss": 4.450816026445941,
      "seconds": 400.8488117000088,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.45474894127263,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.450816026445941,
          "perplexity": 85.69684637020296,
          "tokens": 197411295,
          "seconds": 101.01290859596338,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 400.8488117000088,
        "training_seconds": 274.6909767574398,
        "training_elapsed_seconds": 299.7670722960029,
        "training_tokens_per_second": 1485564.51623214,
        "elapsed_tokens_per_second": 1361294.1704186008,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "93c43c12bf06c5e318aa3e8166ff5f665e03e4d33a3b3d41f34282b482fa72d3"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 48,
      "run_id": "sync-lr0.0112-beta2-0.98-seed42",
      "lr": 0.0112,
      "beta2": 0.98,
      "seed": 42,
      "directory": "experiments/sync-lr0.0112-beta2-0.98-seed42",
      "job_id": "2309171_48",
      "loss": 4.608426368864175,
      "seconds": 404.352907413966,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.610324407993837,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.608426368864175,
          "perplexity": 100.3261489998302,
          "tokens": 197411295,
          "seconds": 101.85281740804203,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 404.352907413966,
        "training_seconds": 276.3025076548802,
        "training_elapsed_seconds": 302.4422504969407,
        "training_tokens_per_second": 1476899.9798934415,
        "elapsed_tokens_per_second": 1349253.1791755324,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "b0e3f6198e4ad2009597e70be8dd535a861771678ed2b38223feee0d86bcf1dd"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 49,
      "run_id": "sync-lr0.0112-beta2-0.98-seed43",
      "lr": 0.0112,
      "beta2": 0.98,
      "seed": 43,
      "directory": "experiments/sync-lr0.0112-beta2-0.98-seed43",
      "job_id": "2309171_49",
      "loss": 4.491623007670998,
      "seconds": 404.00524656602647,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.492433404570257,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.491623007670998,
          "perplexity": 89.2662081123008,
          "tokens": 197411295,
          "seconds": 101.78922361601144,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 404.00524656602647,
        "training_seconds": 277.3681044228142,
        "training_elapsed_seconds": 302.13045573199634,
        "training_tokens_per_second": 1471226.0043351804,
        "elapsed_tokens_per_second": 1350645.5911944804,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "b949d50e72b23bec46589c185c4ed1aa9fd73effa2a74cbcfdb984416d84625a"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 50,
      "run_id": "sync-lr0.0112-beta2-0.98-seed44",
      "lr": 0.0112,
      "beta2": 0.98,
      "seed": 44,
      "directory": "experiments/sync-lr0.0112-beta2-0.98-seed44",
      "job_id": "2309171_50",
      "loss": 4.562222169849707,
      "seconds": 408.264430655865,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.565278511099939,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.562222169849707,
          "perplexity": 95.79611872944868,
          "tokens": 197411295,
          "seconds": 101.61060200980864,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 408.264430655865,
        "training_seconds": 280.1491005239077,
        "training_elapsed_seconds": 306.58587210904807,
        "training_tokens_per_second": 1456621.3749637776,
        "elapsed_tokens_per_second": 1331017.5227345608,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "98cb9e6a75bae95c2dc22be48e87a590ab4ccde9ef43395f80ede18ffd310984"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 51,
      "run_id": "sync-lr0.0112-beta2-0.999-seed42",
      "lr": 0.0112,
      "beta2": 0.999,
      "seed": 42,
      "directory": "experiments/sync-lr0.0112-beta2-0.999-seed42",
      "job_id": "2309171_51",
      "loss": 5.915986905387606,
      "seconds": 413.2238289571833,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 5.929240453286343,
        "best_epoch": 40,
        "final_validation": {
          "loss": 5.915986905387606,
          "perplexity": 370.9201852581103,
          "tokens": 197411295,
          "seconds": 102.86371674900874,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 413.2238289571833,
        "training_seconds": 283.96815266786143,
        "training_elapsed_seconds": 310.29319709399715,
        "training_tokens_per_second": 1437031.45640171,
        "elapsed_tokens_per_second": 1315114.7747412038,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "12f4eb984bf87ac15a2664c9f127c0f5a1dd25e6274352550075efac1caddfca"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 52,
      "run_id": "sync-lr0.0112-beta2-0.999-seed43",
      "lr": 0.0112,
      "beta2": 0.999,
      "seed": 43,
      "directory": "experiments/sync-lr0.0112-beta2-0.999-seed43",
      "job_id": "2309171_52",
      "loss": 5.148465389781165,
      "seconds": 416.7875842710491,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 5.157961145556818,
        "best_epoch": 40,
        "final_validation": {
          "loss": 5.148465389781165,
          "perplexity": 172.16707812648136,
          "tokens": 197411295,
          "seconds": 101.69883059593849,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 416.7875842710491,
        "training_seconds": 286.23069305869285,
        "training_elapsed_seconds": 314.93993305100594,
        "training_tokens_per_second": 1425672.2912532766,
        "elapsed_tokens_per_second": 1295711.1028975516,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "0227c1c10bbbb0a689b5dd48e213c59a1ae4ae660ea29c3c5e727800f6c1ca50"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 53,
      "run_id": "sync-lr0.0112-beta2-0.999-seed44",
      "lr": 0.0112,
      "beta2": 0.999,
      "seed": 44,
      "directory": "experiments/sync-lr0.0112-beta2-0.999-seed44",
      "job_id": "2309171_53",
      "loss": 5.041553196645007,
      "seconds": 418.9129877560772,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 5.045773347748898,
        "best_epoch": 40,
        "final_validation": {
          "loss": 5.041553196645007,
          "perplexity": 154.71012375474908,
          "tokens": 197411295,
          "seconds": 101.9043042359408,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 418.9129877560772,
        "training_seconds": 287.3300402952591,
        "training_elapsed_seconds": 316.8863021420548,
        "training_tokens_per_second": 1420217.5574146993,
        "elapsed_tokens_per_second": 1287752.626861948,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "63485e7a1c28b02e9818f35402c6c7fb1d67e4819b801c88121f8f9cfd094cfd"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 54,
      "run_id": "sync-lr0.016-beta2-0.95-seed42",
      "lr": 0.016,
      "beta2": 0.95,
      "seed": 42,
      "directory": "experiments/sync-lr0.016-beta2-0.95-seed42",
      "job_id": "2309171_54",
      "loss": 4.721448523874784,
      "seconds": 403.98425430292264,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.72501911754929,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.721448523874784,
          "perplexity": 112.33084879354615,
          "tokens": 197411295,
          "seconds": 100.75542104896158,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 403.98425430292264,
        "training_seconds": 277.78829608263914,
        "training_elapsed_seconds": 303.14551085897256,
        "training_tokens_per_second": 1469000.5797746175,
        "elapsed_tokens_per_second": 1346123.0774743033,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "af23e4ab396533ecf3265ca5949bc20039f56efbab6f92167ab742563ebcc910"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 55,
      "run_id": "sync-lr0.016-beta2-0.95-seed43",
      "lr": 0.016,
      "beta2": 0.95,
      "seed": 43,
      "directory": "experiments/sync-lr0.016-beta2-0.95-seed43",
      "job_id": "2309171_55",
      "loss": 4.726241085018957,
      "seconds": 409.64015496103093,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.731652654965509,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.726241085018957,
          "perplexity": 112.87049336165228,
          "tokens": 197411295,
          "seconds": 102.04300720698666,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 409.64015496103093,
        "training_seconds": 282.38138153846376,
        "training_elapsed_seconds": 307.5274537439691,
        "training_tokens_per_second": 1445106.4931291009,
        "elapsed_tokens_per_second": 1326942.2389187347,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "e79d2fd257d02f2082a09e903c01460b9fa87a2b93cf7038708c311b36f64007"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 56,
      "run_id": "sync-lr0.016-beta2-0.95-seed44",
      "lr": 0.016,
      "beta2": 0.95,
      "seed": 44,
      "directory": "experiments/sync-lr0.016-beta2-0.95-seed44",
      "job_id": "2309171_56",
      "loss": 4.667974673806938,
      "seconds": 413.1410101670772,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.673522189703236,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.667974673806938,
          "perplexity": 106.48186338649867,
          "tokens": 197411295,
          "seconds": 103.28858422196936,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 413.1410101670772,
        "training_seconds": 284.44109543587547,
        "training_elapsed_seconds": 309.78277993097436,
        "training_tokens_per_second": 1434642.0912726226,
        "elapsed_tokens_per_second": 1317281.6387370732,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "3fa695129714ee3b9227158a6cf183d69ce5c37651176582fd1b9e5d118b65b8"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 57,
      "run_id": "sync-lr0.016-beta2-0.98-seed42",
      "lr": 0.016,
      "beta2": 0.98,
      "seed": 42,
      "directory": "experiments/sync-lr0.016-beta2-0.98-seed42",
      "job_id": "2309171_57",
      "loss": 5.548741163689531,
      "seconds": 407.0946415789658,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 5.559508708204757,
        "best_epoch": 40,
        "final_validation": {
          "loss": 5.548741163689531,
          "perplexity": 256.9139396626584,
          "tokens": 197411295,
          "seconds": 101.9010692089796,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 407.0946415789658,
        "training_seconds": 280.1985668975394,
        "training_elapsed_seconds": 305.12314667296596,
        "training_tokens_per_second": 1456364.2224095312,
        "elapsed_tokens_per_second": 1337398.268369901,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "578906a641c0ed13b7a2c96dee3af5548b134c84b8ffe708b65baedc7ace03c0"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 58,
      "run_id": "sync-lr0.016-beta2-0.98-seed43",
      "lr": 0.016,
      "beta2": 0.98,
      "seed": 43,
      "directory": "experiments/sync-lr0.016-beta2-0.98-seed43",
      "job_id": "2309171_58",
      "loss": 4.852649007905244,
      "seconds": 403.688740894082,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.85658578017069,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.852649007905244,
          "perplexity": 128.07922373723818,
          "tokens": 197411295,
          "seconds": 100.85721982095856,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 403.688740894082,
        "training_seconds": 278.09786428464577,
        "training_elapsed_seconds": 302.78061236802023,
        "training_tokens_per_second": 1467365.3429510724,
        "elapsed_tokens_per_second": 1347745.3685310683,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "aa7e9702daba6e7b9577a28e78f88f4159b9be58646f86bb5441e20d16a117a2"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 59,
      "run_id": "sync-lr0.016-beta2-0.98-seed44",
      "lr": 0.016,
      "beta2": 0.98,
      "seed": 44,
      "directory": "experiments/sync-lr0.016-beta2-0.98-seed44",
      "job_id": "2309171_59",
      "loss": 5.812859083387857,
      "seconds": 576.1987602770096,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 5.825575794320547,
        "best_epoch": 40,
        "final_validation": {
          "loss": 5.812859083387857,
          "perplexity": 334.57433543615053,
          "tokens": 197411295,
          "seconds": 106.926284585963,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 576.1987602770096,
        "training_seconds": 301.8569599579787,
        "training_elapsed_seconds": 469.197759256931,
        "training_tokens_per_second": 1351869.3359159494,
        "elapsed_tokens_per_second": 869721.0503440228,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "a962d96bb36371f87ef98494d4b4f2a29debaeae56a498c855718fe37123f05c"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 60,
      "run_id": "sync-lr0.016-beta2-0.999-seed42",
      "lr": 0.016,
      "beta2": 0.999,
      "seed": 42,
      "directory": "experiments/sync-lr0.016-beta2-0.999-seed42",
      "job_id": "2309171_60",
      "loss": 6.081893662571647,
      "seconds": 412.0697612889344,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 6.092805353734168,
        "best_epoch": 40,
        "final_validation": {
          "loss": 6.081893662571647,
          "perplexity": 437.8575646261501,
          "tokens": 197411295,
          "seconds": 102.22648418694735,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 412.0697612889344,
        "training_seconds": 283.7357112423051,
        "training_elapsed_seconds": 309.7902681309497,
        "training_tokens_per_second": 1438208.6985572102,
        "elapsed_tokens_per_second": 1317249.7976195512,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "adb7377cba4881eaf1102af6b500fa1322015a6b5d8c1bc61981e78c7d61a220"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 61,
      "run_id": "sync-lr0.016-beta2-0.999-seed43",
      "lr": 0.016,
      "beta2": 0.999,
      "seed": 43,
      "directory": "experiments/sync-lr0.016-beta2-0.999-seed43",
      "job_id": "2309171_61",
      "loss": 5.306657748892265,
      "seconds": 407.9301355360076,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 5.316138146931886,
        "best_epoch": 40,
        "final_validation": {
          "loss": 5.306657748892265,
          "perplexity": 201.67505204611808,
          "tokens": 197411295,
          "seconds": 101.66823035397101,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 407.9301355360076,
        "training_seconds": 281.535004163743,
        "training_elapsed_seconds": 306.2005245980108,
        "training_tokens_per_second": 1449450.9100639669,
        "elapsed_tokens_per_second": 1332692.5828612738,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "8a10010a256dcf798bd327d5b33435d5d53eb9ed233f8a851b815c54edc225b1"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 62,
      "run_id": "sync-lr0.016-beta2-0.999-seed44",
      "lr": 0.016,
      "beta2": 0.999,
      "seed": 44,
      "directory": "experiments/sync-lr0.016-beta2-0.999-seed44",
      "job_id": "2309171_62",
      "loss": 5.9678668598921725,
      "seconds": 409.5850466840202,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 5.979572132108311,
        "best_epoch": 40,
        "final_validation": {
          "loss": 5.9678668598921725,
          "perplexity": 390.6714243996828,
          "tokens": 197411295,
          "seconds": 101.27733262209222,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 409.5850466840202,
        "training_seconds": 282.15337305655703,
        "training_elapsed_seconds": 308.2233093949035,
        "training_tokens_per_second": 1446274.2854334158,
        "elapsed_tokens_per_second": 1323946.4880223218,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "495df00c08692e9999756746e4587811680f36c5f657dbb121bcdf8b82ebd63c"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 63,
      "run_id": "sync-lr0.0224-beta2-0.95-seed42",
      "lr": 0.0224,
      "beta2": 0.95,
      "seed": 42,
      "directory": "experiments/sync-lr0.0224-beta2-0.95-seed42",
      "job_id": "2309171_63",
      "loss": 5.147090416398743,
      "seconds": 407.9217443600064,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 5.153092913592939,
        "best_epoch": 40,
        "final_validation": {
          "loss": 5.147090416398743,
          "perplexity": 171.93051564755345,
          "tokens": 197411295,
          "seconds": 101.6533227849286,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 407.9217443600064,
        "training_seconds": 279.5910687703872,
        "training_elapsed_seconds": 306.21274519804865,
        "training_tokens_per_second": 1459528.6244108407,
        "elapsed_tokens_per_second": 1332639.3966262657,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "0c7f094645782d446a90b336bd175a4a846e15e612ae20d45a5f783592ad9bf8"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 64,
      "run_id": "sync-lr0.0224-beta2-0.95-seed43",
      "lr": 0.0224,
      "beta2": 0.95,
      "seed": 43,
      "directory": "experiments/sync-lr0.0224-beta2-0.95-seed43",
      "job_id": "2309171_64",
      "loss": 4.940409150585305,
      "seconds": 405.0149166909978,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 4.947648076399226,
        "best_epoch": 40,
        "final_validation": {
          "loss": 4.940409150585305,
          "perplexity": 139.82744834007786,
          "tokens": 197411295,
          "seconds": 101.03769669495523,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 405.0149166909978,
        "training_seconds": 278.9222285691649,
        "training_elapsed_seconds": 303.9225976850139,
        "training_tokens_per_second": 1463028.4939760899,
        "elapsed_tokens_per_second": 1342681.2323541862,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "8ad7cf2873b574b0ebf8df5d6b2ff652b898297ac026794501c0d15a6d58fd14"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 65,
      "run_id": "sync-lr0.0224-beta2-0.95-seed44",
      "lr": 0.0224,
      "beta2": 0.95,
      "seed": 44,
      "directory": "experiments/sync-lr0.0224-beta2-0.95-seed44",
      "job_id": "2309171_65",
      "loss": 5.669474177915018,
      "seconds": 412.4399669090053,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 5.682293676685466,
        "best_epoch": 40,
        "final_validation": {
          "loss": 5.669474177915018,
          "perplexity": 289.88206791677686,
          "tokens": 197411295,
          "seconds": 103.60092341701966,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 412.4399669090053,
        "training_seconds": 282.9219043769408,
        "training_elapsed_seconds": 308.74025332392193,
        "training_tokens_per_second": 1442345.6144149273,
        "elapsed_tokens_per_second": 1321729.718126074,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "717c29b440bec365f9f04047cd6e1ae6e7008825bcc77e9b30263669e1ff93c8"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 66,
      "run_id": "sync-lr0.0224-beta2-0.98-seed42",
      "lr": 0.0224,
      "beta2": 0.98,
      "seed": 42,
      "directory": "experiments/sync-lr0.0224-beta2-0.98-seed42",
      "job_id": "2309171_66",
      "loss": 5.127341423999677,
      "seconds": 412.70743778091855,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 5.131884040209584,
        "best_epoch": 40,
        "final_validation": {
          "loss": 5.127341423999677,
          "perplexity": 168.56836997095257,
          "tokens": 197411295,
          "seconds": 102.73407362494618,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 412.70743778091855,
        "training_seconds": 284.91702891525347,
        "training_elapsed_seconds": 309.886950467946,
        "training_tokens_per_second": 1432245.6244669666,
        "elapsed_tokens_per_second": 1316838.825848557,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "f9184ce55d02623f04ec170d035ee1209b2bfccca21bd4e8af7c8130f749aec3"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 67,
      "run_id": "sync-lr0.0224-beta2-0.98-seed43",
      "lr": 0.0224,
      "beta2": 0.98,
      "seed": 43,
      "directory": "experiments/sync-lr0.0224-beta2-0.98-seed43",
      "job_id": "2309171_67",
      "loss": 5.889107730953773,
      "seconds": 409.7377273909515,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 5.902816047067695,
        "best_epoch": 40,
        "final_validation": {
          "loss": 5.889107730953773,
          "perplexity": 361.08295744645204,
          "tokens": 197411295,
          "seconds": 101.07154363498557,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 409.7377273909515,
        "training_seconds": 282.5584438907681,
        "training_elapsed_seconds": 308.5724283509189,
        "training_tokens_per_second": 1444200.9319592402,
        "elapsed_tokens_per_second": 1322448.5744913274,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "43d084db48533ff4ad1bc11b3841c6da2d05902ecbe2e198742358431b35c8b2"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 68,
      "run_id": "sync-lr0.0224-beta2-0.98-seed44",
      "lr": 0.0224,
      "beta2": 0.98,
      "seed": 44,
      "directory": "experiments/sync-lr0.0224-beta2-0.98-seed44",
      "job_id": "2309171_68",
      "loss": 5.793006085806796,
      "seconds": 404.9852296030149,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 5.80635502552405,
        "best_epoch": 40,
        "final_validation": {
          "loss": 5.793006085806796,
          "perplexity": 327.9975326039107,
          "tokens": 197411295,
          "seconds": 100.7569171449868,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 404.9852296030149,
        "training_seconds": 279.97361480793916,
        "training_elapsed_seconds": 304.1680178620154,
        "training_tokens_per_second": 1457534.3761587508,
        "elapsed_tokens_per_second": 1341597.8802384143,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "fc99fb5585326d7e5e0d4b8aaf084b3c0c26b47a6d334f319666cc529424a887"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 69,
      "run_id": "sync-lr0.0224-beta2-0.999-seed42",
      "lr": 0.0224,
      "beta2": 0.999,
      "seed": 42,
      "directory": "experiments/sync-lr0.0224-beta2-0.999-seed42",
      "job_id": "2309171_69",
      "loss": 6.292228662050512,
      "seconds": 404.68028054898605,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 6.301501021823907,
        "best_epoch": 40,
        "final_validation": {
          "loss": 6.292228662050512,
          "perplexity": 540.3562596134841,
          "tokens": 197411295,
          "seconds": 100.45279354800005,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 404.68028054898605,
        "training_seconds": 279.14745645644143,
        "training_elapsed_seconds": 304.1480855529662,
        "training_tokens_per_second": 1461848.0611650352,
        "elapsed_tokens_per_second": 1341685.8016978574,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "eb2aac973afeb19dd818bd11913403ff687ea087037643bbdbf52439de9f4ffa"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 70,
      "run_id": "sync-lr0.0224-beta2-0.999-seed43",
      "lr": 0.0224,
      "beta2": 0.999,
      "seed": 43,
      "directory": "experiments/sync-lr0.0224-beta2-0.999-seed43",
      "job_id": "2309171_70",
      "loss": 6.200817163273424,
      "seconds": 407.8594408920035,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 6.21663460134785,
        "best_epoch": 40,
        "final_validation": {
          "loss": 6.200817163273424,
          "perplexity": 493.1518620754932,
          "tokens": 197411295,
          "seconds": 101.85286338697188,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 407.8594408920035,
        "training_seconds": 280.48374274012167,
        "training_elapsed_seconds": 305.8848996500019,
        "training_tokens_per_second": 1454883.4952551695,
        "elapsed_tokens_per_second": 1334067.7113088,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "00c0c94c0648bfe1bfca415d0e2cc3684c6976757afb3ab477bac66ce08581df"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    },
    {
      "index": 71,
      "run_id": "sync-lr0.0224-beta2-0.999-seed44",
      "lr": 0.0224,
      "beta2": 0.999,
      "seed": 44,
      "directory": "experiments/sync-lr0.0224-beta2-0.999-seed44",
      "job_id": "2309171_71",
      "loss": 5.461407872460134,
      "seconds": 408.6558513229247,
      "result": {
        "status": "complete",
        "parameters": 20403520,
        "tokens": 408071168,
        "step": 3120,
        "epochs": 40,
        "best_subset_loss": 5.470735994492877,
        "best_epoch": 40,
        "final_validation": {
          "loss": 5.461407872460134,
          "perplexity": 235.42864465770535,
          "tokens": 197411295,
          "seconds": 102.36931911995634,
          "split": "full",
          "validation_complete": true
        },
        "seconds_this_session": 408.6558513229247,
        "training_seconds": 280.102522599278,
        "training_elapsed_seconds": 306.21818864298984,
        "training_tokens_per_second": 1456863.594848081,
        "elapsed_tokens_per_second": 1332615.707147812,
        "peak_memory_bytes": 59196563968,
        "recipe_identity": "cd5d712045a1f93f304cd0561795b3c08e4115928e4687a80f70c1b0bfdb180f"
      },
      "source_hash": "c6adc6270a9095e156c9072b50f95ead71197e3915553c1f1f9f9bdda576b248"
    }
  ]
}
