From 7831c69e27f3cb6ad4d0a6c030e29b73b51eed83 Mon Sep 17 00:00:00 2001 From: Kawrakow Date: Sun, 29 Mar 2026 08:04:43 +0200 Subject: [PATCH] Do not override mmap if GGML_CUDA_NO_PINNED is set (#1546) --- src/llama-load-tensors.cpp | 4 +++- 1 file changed, 3 insertions(+), 1 deletion(-) diff --git a/src/llama-load-tensors.cpp b/src/llama-load-tensors.cpp index 33943009..fa12fc53 100644 --- a/src/llama-load-tensors.cpp +++ b/src/llama-load-tensors.cpp @@ -3945,7 +3945,9 @@ bool create_tensors_helper::create_tensors() { throw std::runtime_error("unknown architecture"); } - use_mmap_buffer &= !has_buft_overrides; + if (getenv("GGML_CUDA_NO_PINNED") == nullptr) { + use_mmap_buffer &= !has_buft_overrides; + } if (model.split_mode == LLAMA_SPLIT_MODE_GRAPH || model.split_mode == LLAMA_SPLIT_MODE_ATTN) { const int n_layer = model.mtp ? model.layers.size()