From 8b575c4b1f0095d1b0b38d131dc22ffa25a19bb6 Mon Sep 17 00:00:00 2001 From: Kawrakow Date: Tue, 31 Mar 2026 15:35:10 +0200 Subject: [PATCH] Fix re-quantizing a model using row-interleaved quants (#1561) --- src/llama-quantize.cpp | 13 +++++++++++++ 1 file changed, 13 insertions(+) diff --git a/src/llama-quantize.cpp b/src/llama-quantize.cpp index aa8b235b..49c36051 100644 --- a/src/llama-quantize.cpp +++ b/src/llama-quantize.cpp @@ -165,6 +165,19 @@ static void llama_tensor_dequantize_internal( return; } + auto num_rows = interleaved_properties(tensor->type).second; + if (num_rows > 1) { + int nrows = ggml_nrows(tensor); + auto row_size = ggml_row_size(tensor->type, tensor->ne[0]); + auto qsrc = (const char *)tensor->data; + for (int row = 0; row < nrows; row += num_rows) { + qtype.to_float(qsrc, f32_output, num_rows*tensor->ne[0]); + qsrc += num_rows*row_size; + f32_output += num_rows*tensor->ne[0]; + } + return; + } + size_t block_size; if (tensor->type == GGML_TYPE_F16 || tensor->type == GGML_TYPE_BF16) {