Commit 1537a0a8b for llama.cpp
commit 1537a0a8b2f8711d840878b0a0677ab2213c882c
Author: Nik Bogatyrev <50734723+notforu777@users.noreply.github.com>
Date: Sat Oct 3 18:19:13 2026 +0300
server : fix laya abort by limiting n_batch to n_ubatch (#29903)
* server : fix laya abort by limiting n_batch to n_ubatch
Fixes #29902
Assisted-by: Claude
* fix(review) : rm tests, embeddings cond
diff --git a/common/common.cpp b/common/common.cpp
index d3617fbf1..a2f162b6f 100644
--- a/common/common.cpp
+++ b/common/common.cpp
@@ -1285,6 +1285,14 @@ common_init_result::common_init_result(common_params & params, bool model_only)
LOG_INF("%s", "decision model reads the embeddings output, enabling embedding mode\n");
}
+ // embeddings need the whole batch in one ubatch, so n_batch must not be larger than n_ubatch
+ // (server.cpp does this check for --embedding, but before the model is loaded)
+ if (cparams.embeddings && cparams.n_batch > cparams.n_ubatch) {
+ LOG_WRN("embeddings enabled: setting n_batch = n_ubatch = %u\n", cparams.n_ubatch);
+ cparams.n_batch = cparams.n_ubatch;
+ params.n_batch = params.n_ubatch;
+ }
+
// load and optionally apply lora adapters
for (auto & la : params.lora_adapters) {
llama_adapter_lora_ptr lora;