ik_llama_opt/src
Kawrakow 86e33fd6f4
Initial Gemma4 support (#1581)
* Gemma4: WIP

* Gemma4: WIP - runs with totally wrong results

* Gemma4: WIP - add CPU 512, 512 FA

* Gemma4: WIP

It gives a meaningful response in llama-cli, but PPL is still much too
high. Is this due to tokenizer issues?

* Gemma4: this works

I had forgotten the softcap on the final output.

* Remove log

* Gemma4: WIP E4B/E2B

* Gemma4: Q4B/E2B appear to work now

* gemma4: tokenizer fixes
2026-04-06 10:01:08 +02:00
..
CMakeLists.txt Factor out delta net (#1286) 2026-02-18 17:16:17 +01:00
llama-arch.cpp Initial Gemma4 support (#1581) 2026-04-06 10:01:08 +02:00
llama-arch.h Initial Gemma4 support (#1581) 2026-04-06 10:01:08 +02:00
llama-build-context.cpp Initial Gemma4 support (#1581) 2026-04-06 10:01:08 +02:00
llama-build-context.h Initial Gemma4 support (#1581) 2026-04-06 10:01:08 +02:00
llama-context.h Improve mtp acceptance rate (#1499) 2026-03-25 10:20:22 +01:00
llama-cparams.h Control compute buffer sizes for large batches (#1560) 2026-04-01 07:57:52 +02:00
llama-delta-net.cpp Qwen-3.5/Next tweaks (#1447) 2026-03-18 07:32:17 +01:00
llama-delta-net.h Full graph parallel for Qwen3.5 (dense and MoE) (#1388) 2026-03-10 09:08:24 +01:00
llama-grammar.cpp llama : add token matching support to llama-grammar (#1220) 2026-02-03 07:57:17 +02:00
llama-grammar.h llama : add token matching support to llama-grammar (#1220) 2026-02-03 07:57:17 +02:00
llama-hparams.cpp Initial Gemma4 support (#1581) 2026-04-06 10:01:08 +02:00
llama-hparams.h Initial Gemma4 support (#1581) 2026-04-06 10:01:08 +02:00
llama-impl.h Full graph parallel for Qwen3.5 (dense and MoE) (#1388) 2026-03-10 09:08:24 +01:00
llama-load-tensors.cpp Initial Gemma4 support (#1581) 2026-04-06 10:01:08 +02:00
llama-mmap.cpp Fix clang warnings on macOS (#1354) 2026-03-03 16:27:16 +01:00
llama-mmap.h Enable CUDA graphs for MoE models + GPT-OSS support (#689) 2025-08-15 09:18:07 +03:00
llama-model-loader.cpp Better --n-cpu-moe (#1464) 2026-03-19 06:57:01 +01:00
llama-model-loader.h Better --n-cpu-moe (#1464) 2026-03-19 06:57:01 +01:00
llama-model.cpp Initial Gemma4 support (#1581) 2026-04-06 10:01:08 +02:00
llama-model.h Initial Gemma4 support (#1581) 2026-04-06 10:01:08 +02:00
llama-quantize.cpp Bonsai support (AVX2, generic) (#1570) 2026-04-02 16:54:08 +02:00
llama-quantize.h Allow using -rtr and -muge together (#1444) 2026-03-16 18:26:26 +01:00
llama-sampling.cpp Log probabilities on token sampling crash (#1519) 2026-03-26 14:34:41 +01:00
llama-sampling.h Adaptive P sampler: update review logic, delete old code comments, put prep stage after logit bias (#1386) 2026-03-14 12:34:12 +01:00
llama-vocab.cpp Initial Gemma4 support (#1581) 2026-04-06 10:01:08 +02:00
llama-vocab.h Initial Gemma4 support (#1581) 2026-04-06 10:01:08 +02:00
llama.cpp Initial Gemma4 support (#1581) 2026-04-06 10:01:08 +02:00
unicode-data.cpp Merge mainline llama.cpp (#3) 2024-07-27 07:55:01 +02:00
unicode-data.h Merge mainline llama.cpp (#3) 2024-07-27 07:55:01 +02:00
unicode.cpp Initial Gemma4 support (#1581) 2026-04-06 10:01:08 +02:00
unicode.h Initial Gemma4 support (#1581) 2026-04-06 10:01:08 +02:00