
Kog levanta US$ 5 mi para provar que GPU comum basta para IA rápida
Startup francesa promete inferência 30x mais rápida em GPUs convencionais e já soma 200 leads comerciais após o lançamento do seu motor de inferência.
Por Otávio Meireles · Repórter de Mercado
3.000 tokens por segundo é o número que a Kog quer que o mercado memorize
A startup francesa Kog levantou uma rodada seed de US$ 5 milhões, liderada pela Varsity VC e apoiada por Scaleway, Bpifrance e pelo selo estatal French Tech 2030. O valor é modesto para os padrões da corrida global por infraestrutura de IA, mas a aposta da empresa é justamente essa: não é preciso reinventar o hardware para acelerar a inferência de modelos de linguagem — basta espremer melhor o que já existe.
Fundada em 2023 pelo engenheiro Gaël Dellalleau, formado em física do estado sólido pela École Polytechnique e ex-competidor do torneio de segurança ofensiva DEF CON CTF, a Kog opera com apenas 11 pessoas em Paris. Em maio, a empresa lançou o tech preview do Kog Inference Engine (KIE) e demonstrou 3.000 tokens de saída por segundo em uma única requisição, rodando em um nó com oito GPUs AMD MI300X — e 2.100 tokens/s em GPUs NVIDIA H200. Os testes usaram o Laneformer 2B, modelo aberto de 2,3 bilhões de parâmetros que a própria Kog disponibilizou no Hugging Face.
O mito da GPU incapaz
O discurso dominante na indústria de IA nos últimos anos é que workflows agênticos — em que modelos precisam responder em tempo real, encadear tarefas e devolver resultados quase instantâneos — exigiriam chips desenhados sob medida para inferência, fora do paradigma tradicional de GPU. A Kog contesta essa tese: para a startup, o gargalo está em como o software explora o hardware, não no silício em si. A promessa comercial é uma aceleração de até 30x na inferência de LLMs sobre GPUs convencionais, sem trocar de fornecedor de chip.
Quem ganha e quem perde
Se a tese da Kog se confirmar em escala, quem ganha primeiro são operadoras de nuvem e data centers que já investiram pesado em GPUs genéricas — como parceiras da própria Kog, caso da Scaleway — e não precisariam migrar para aceleradores especializados. Também se beneficiam aplicações que dependem de latência baixíssima, como geração de código, jogos e apps via prompt, hoje territórios dominados por soluções como o Fast Mode da Anthropic. Do lado de quem perde, ficam fabricantes de chips de inferência dedicados, que veem seu argumento de diferenciação de hardware ser questionado por otimização em nível de software.
A Kog diz ter recebido 200 leads comerciais desde o anúncio de maio. O próximo teste de credibilidade vem em setembro, quando a empresa planeja rodar um modelo maior a 10x de velocidade — resultado que, segundo Dellalleau, deve destravar tração de clientes suficiente para justificar uma rodada Série A.