Commit bb11ebb68 for llama.cpp

commit bb11ebb6820ae3f20fc96002f8fd8173a5d8ceed
Author: yanghong <228148915+YangHong7@users.noreply.github.com>
Date:   Fri Sep 18 16:43:06 2026 +0800

    gguf-py: fix Q8_1 block size in GGML_QUANT_SIZES (2+2+32) (#29036)

    * gguf-py: fix Q8_1 block size in GGML_QUANT_SIZES

    * --whitespace

    ---------

    Co-authored-by: Sigbjørn Skjæret <sigbjorn.skjaeret@huggingface.co>

diff --git a/gguf-py/gguf/constants.py b/gguf-py/gguf/constants.py
index 36b4c3190..27c126b36 100644
--- a/gguf-py/gguf/constants.py
+++ b/gguf-py/gguf/constants.py
@@ -5876,7 +5876,7 @@ GGML_QUANT_SIZES: dict[GGMLQuantizationType, tuple[int, int]] = {
     GGMLQuantizationType.Q5_0:    (32, 2 + 4 + 16),
     GGMLQuantizationType.Q5_1:    (32, 2 + 2 + 4 + 16),
     GGMLQuantizationType.Q8_0:    (32, 2 + 32),
-    GGMLQuantizationType.Q8_1:    (32, 4 + 4 + 32),
+    GGMLQuantizationType.Q8_1:    (32, 2 + 2 + 32),
     GGMLQuantizationType.Q2_K:    (256, 2 + 2 + QK_K // 16 + QK_K // 4),
     GGMLQuantizationType.Q3_K:    (256, 2 + QK_K // 4 + QK_K // 8 + 12),
     GGMLQuantizationType.Q4_K:    (256, 2 + 2 + QK_K // 2 + 12),