Cérebro

Postagens

Mostrando postagens com o rótulo Large Language Models

Uma Teoria da Escalabilidade Computacional da Inferência em LLMs

- julho 02, 2025

Modelos de Linguagem Grandes (LLMs) demandam recursos computacionais, energéticos e financeiros substanciais tanto no treinamento quanto na implementação. Enquanto as leis de escalabilidade para treinamento guiaram grande parte do progresso recente na área, os custos de inferência representam agora um componente significativo e crescente do ônus geral de recursos, especialmente para modelos focados em raciocínio. Caracterizações existentes de otimalidade computacional que consideram tamanho do modelo, tamanho do conjunto de dados e tokens de inferência isoladamente ou em combinações fixas podem negligenciar pontos de operação mais eficientes. Neste contexto, foi introduzido o Directed Stochastic Skill Search (DS3), uma estrutura geral que representa a inferência como uma travessia estocástica sobre um grafo de habilidades aprendido. A partir de uma instanciação simplificada, mas expressiva, o DS3 permite derivar expressões de forma fechada para o sucesso da tarefa e o custo computac...

Hypertokens e HDRAM: Nova Memória Associativa para LLMs

- julho 02, 2025

Um artigo recente propõe uma nova abordagem para lidar com a aparente perda de precisão em Large Language Models (LLMs), reformulando o problema como uma questão de distribuição de informação no espaço latente. Intitulado "Hypertokens: Holographic Associative Memory in Tokenized LLMs", o estudo introduz a HDRAM (Holographically Defined Random Access Memory) como uma estrutura de memória simbólica inovadora. A pesquisa aborda especificamente o desafio da memória K:V e V:K em LLMs, tratando o espaço latente dos transformadores como um canal de espectro expandido. A HDRAM é construída sobre o conceito de hypertokens, que são códigos simbólicos estruturados que integram códigos corretores de erros (ECC) clássicos, computação holográfica e busca inspirada em computação quântica. Segundo o autor, esta estrutura permite que a HDRAM recupere informações distribuídas através de um processo de "desexpansão" (despreading) baseado em princípios bem definidos. Os hypertoke...