diff --git a/src/llama-quant.cpp b/src/llama-quant.cpp index 92ebc11b99f..0742c9299b6 100644 --- a/src/llama-quant.cpp +++ b/src/llama-quant.cpp @@ -1050,7 +1050,9 @@ static void llama_model_quantize_impl(const std::string & fname_inp, const std:: metadata[i].target_type = tensor->type; } - metadata[i].requires_imatrix = tensor_requires_imatrix(tensor->name, metadata[i].target_type, ftype); + // tensors that keep their type are copied as-is and do not require an imatrix + metadata[i].requires_imatrix = metadata[i].target_type != tensor->type && + tensor_requires_imatrix(tensor->name, metadata[i].target_type, ftype); if (params->imatrix) { metadata[i].remapped_imatrix_name = remap_imatrix(tensor->name, mapped);