{
  "bench": "power-cap-96gb",
  "arm": "vllm-fp8-gemma-sustR2-450W",
  "mode": "go",
  "started_utc": "2026-08-25T19:33:27Z",
  "ended_utc": "2026-08-25T19:35:12Z",
  "endpoint": "<serving host>",
  "engine": "vllm",
  "model_requested": "gemma-4-26b-a4b-fp8",
  "models_served": [
    "gemma-4-26b-a4b-fp8"
  ],
  "prompt_file": "p512.txt",
  "prompt_sha256": "90eedd0c53f9554ae3837674504fcb7090013d9a432a653352183c0f25a7ce5c",
  "prompt_tokens_measured": 524,
  "max_tokens": 256,
  "ignore_eos": true,
  "thinking": "off",
  "temperature": 0.0,
  "seed": 20260825,
  "repeats": 60,
  "warmup_waves": 1,
  "power_window": {
    "samples": 209,
    "power_w_mean": 414.7,
    "power_w_peak": 455.7,
    "vram_mib_peak": 82730.0,
    "csv": "power.csv"
  },
  "rows": [
    {
      "concurrency": 16,
      "waves": 60,
      "requests_ok": 960,
      "requests_failed": 0,
      "ttft_ms_p50": 130.7,
      "ttft_ms_p95": 138.5,
      "ttft_ms_min": 106.2,
      "ttft_ms_max": 166.3,
      "decode_tok_s_per_stream_p50": 170.11,
      "decode_tok_s_per_stream_mean": 164.19,
      "aggregate_tok_s_mean": 2426.38,
      "aggregate_tok_s_max": 2519.31,
      "completion_tokens_seen": 245760,
      "reasoning_chunks_seen": 0,
      "answer_chars_seen": 985296,
      "distinct_reply_shas": 11
    }
  ],
  "provenance": {
    "harness_sha256": "96a8f38dd1bbb89ce24f89339d81019fd91435e06e7be21b8476f76ba9ce857b",
    "harness_host": "<harness host>",
    "python": "3.14.4",
    "platform": "Linux-7.0.0-30-generic-x86_64-with-glibc2.43"
  },
  "_kit_note": "power.csv and throttle.csv in this directory carry UTC, Z-stamped timestamps; see the kit README for what was converted and why."
}
