Anamnesic Labs

IA onde
ninguém espera.

A Anamnesic é o braço de pesquisa aberta da Chronokairo. Estudamos como rodar modelos de linguagem modernos sob orçamentos de memória rígidos: GPUs antigas, GPUs integradas e máquinas comuns.

O que aprendemos no laboratório chega ao produto: modelos que rodam localmente, com privacidade e sem depender de infraestrutura cara.

github.com/anamnesic

01 / Projetos abertos

Código público, resultados verificáveis.

Runtime de inferência

relic

Ver repositório

Runtime GGUF minimalista para OpenCL 1.2 e 3.0, feito para extrair o máximo de LLMs locais com 1 a 4 GB de VRAM, GPUs integradas e topologias híbridas.

  • Llama, SmolLM2 e Qwen 3.5 (Gated DeltaNet)
  • FP16, Q8_0 e Q4_0 com reempacotamento em tempo de carga
  • Zero alocações no caminho crítico, com buffers planejados estaticamente
  • Validado em NVIDIA GTX 1650 e Intel UHD Graphics

Perfilamento de hardware

surveyor

Ver repositório

Notas de pesquisa, perfilamento de dispositivos e estudos de viabilidade para rodar transformers modernos em hardware obsoleto.

  • Perfil de referência: AMD Caicos XT (Terascale 2), 1 GB DDR3
  • OpenCL 1.2, sem SVM, com buffer máximo de 512 MB
  • Análise de por que motores convencionais falham nesse hardware

Pesquisa de longo prazo

anamnesic-labs

Ver repositório

Pesquisa aplicada de longo horizonte em arquiteturas de baixa VRAM, otimização de atenção e democratização de hardware.

  • Kernels de atenção para OpenCL
  • Especulação heterogênea entre GPUs
  • Quantização abaixo de 4 bits

02 / Linhas de pesquisa

O que estamos investigando.

01

FlashAttention em hardware restrito

Tiling, softmax fundido e normalização online adaptados a OpenCL e a pipelines com pouca memória.

02

Decodificação especulativa distribuída

Uma GPU integrada gera o rascunho com um modelo pequeno, e a GPU dedicada verifica os tokens em lote.

03

Quantização extrema

Métodos abaixo de 4 bits (NF4, AWQ, INT2 e INT3) ajustados ao limite de banda de memória de placas antigas.

04

Mixture-of-Experts com pouca VRAM

Pré-carregamento dinâmico de especialistas para rodar modelos MoE em uma única GPU de estação de trabalho.

Chronokairo

Tecnologia no tempo certo

© 2026 Chronokairo