ik_llama_opt/examples
cora4 8e2d83cfee
Fix per_layer_token_embedding (#2117)
Co-authored-by: cora4 <you@example.com>
2026-07-12 11:58:09 +03:00
..
baby-llama
batched
batched-bench
batched.swift
benchmark
convert-llama2c-to-ggml
cvector-generator Split mode graph for dense Gemma4 assistant (#2022) 2026-06-24 18:29:32 +02:00
deprecation-warning
embedding
eval-callback eval-callback : sum over the full tensor, not just the printed slice (#2019) 2026-06-24 08:57:19 +02:00
export-lora
gbnf-validator
gguf
gguf-hash
gguf-split
gritlm
imatrix Fix DFlash oerformance with split mode graph (#1980) 2026-06-17 18:40:02 +02:00
infill
jeopardy
llama-bench Remove deprecated Kompute (Vulkan compute) backend (#2097) 2026-07-08 10:01:01 +02:00
llama.android
llama.swiftui
lookahead
lookup
main feat: allow dflash to work with spec auto tune (#2112) 2026-07-12 07:49:03 +03:00
main-cmake-pkg
mtmd mtmd: add MiniMax M3 vision support (#2086) 2026-07-12 07:19:14 +03:00
parallel
parser
passkey
perplexity on-demand tensor reload (#1989) 2026-06-22 16:36:34 +02:00
quantize Fix per_layer_token_embedding (#2117) 2026-07-12 11:58:09 +03:00
quantize-stats Update autofix and presets (#1867) 2026-05-24 07:30:44 +03:00
retrieval
rpc fix(rpc): update ggml_backend_cuda_init to 3-arg signature (#2084) 2026-07-06 09:26:45 +02:00
save-load-state
server feat: allow dflash to work with spec auto tune (#2112) 2026-07-12 07:49:03 +03:00
simple
speculative
sweep-bench
sycl
tokenize
CMakeLists.txt
Miku.sh
base-translate.sh
chat-13B.bat
chat-13B.sh
chat-persistent.sh
chat-vicuna.sh
chat.sh
convert_legacy_llama.py
json_schema_pydantic_example.py
json_schema_to_grammar.py
llama.vim
llm.vim
pydantic_models_to_grammar.py
pydantic_models_to_grammar_examples.py
reason-act.sh
regex_to_grammar.py
server-llama2-13B.sh
server_embd.py
ts-type-to-grammar.sh