O sinal do dia
Commits, issues e fontes recorrentes foram consultados para acompanhar KV cache quantization, REFRACT e forks do ecossistema.
Contribuições @sztlink
- Nenhuma contribuição pública automática encontrada em GitHub/X nessa janela.
Sinais externos do dia
- commit · TheTom / llama-cpp-turboquant: cuda: fix stale comment on the fused turbo MMA gate
- commit · TheTom / llama-cpp-turboquant: Merge pull request #340 from giveen/qwen4-catchup
- commit · TheTom / llama-cpp-turboquant: memory: skip V-cache allocation for the qwen4exp indexer KV cache
- commit · TheTom / llama-cpp-turboquant: Merge pull request #343 from jasstrong/pr/cuda-generic-fusions
- commit · TheTom / llama-cpp-turboquant: cuda: take the persistent q8 and TQ pre-rotation cache buffers from device memory, not the pool
- commit · TheTom / llama-cpp-turboquant: Merge pull request #344 from jasstrong/pr/dflash-image-positions
- commit · TheTom / llama-cpp-turboquant: cuda: free held cache buffers newest-first at context teardown
- commit · TheTom / llama-cpp-turboquant: test: cover the multi-node CUDA fusions in test-backend-ops
- commit · TheTom / llama-cpp-turboquant: perf(cuda): elementwise chain fusion (midi-kernel)
- commit · TheTom / llama-cpp-turboquant: perf(cuda): per-graph-eval shared-quantize cache for mmvq
- issue · TheTom / llama-cpp-turboquant: #347 CUDA: full test-backend-ops sweep segfaults in ggml_backend_cuda_graph_compute at ROLL on GB10 (passes with graphs disabled)
- issue · TheTom / llama-cpp-turboquant: #346 Compile bug: Windows release archives link the runner's OpenSSL dynamically and never ship it (still open since #109) — one-line fix: -DLLAMA_BUILD_BORINGSSL=ON
- issue · TheTom / llama-cpp-turboquant: #345
--gdn-replaymakes qwen35 generate degenerate looping text - issue · TheTom / turboquant_plus / REFRACT: #99 CUDA vec FA kernel: turbo4 V-cache branch consumes 4 of 8 elements per iteration — half of every head's V output is zero on batch-1 decode (patch attached)
O que observar agora
- Velocidade entre paper, fork e validação em hardware real.
- Qualidade medida por REFRACT, não apenas throughput.
- Claims de forks comparados com execução concreta.
Nota autoral
- Esta edição combina radar de campo com diário de contribuição: o que se moveu no ecossistema e o que o @sztlink efetivamente colocou em circulação no GitHub/X.
- O texto público deve assumir uma voz de trabalho: método, dúvida, evidência e próximo experimento — sem transformar hipótese em resultado.
Fontes consultadas
- TheTom / llama-cpp-turboquant
- TheTom / turboquant_plus / REFRACT
- llama.cpp discussion #20969
- sztlink / turboquant-cuda-bench
- TurboQuant paper
Próxima leitura
TurboQuant é um radar diário e também um diário público de contribuição: consulta fontes recorrentes do ecossistema — TheTom, REFRACT, llama.cpp, benchmark @sztlink, paper TurboQuant e forks adjacentes — e registra o que o @sztlink colocou em circulação no GitHub/X.