Frozen artificial neuron with luminous blue and pink fractal dendrites representing adaptive memory in the Dendritron Transformer.

A IA que Nunca Esquece? O Dendritron Transformer e a Busca pela Memória Contínua

Uma arquitetura inspirada no cérebro propõe acrescentar aos modelos de linguagem congelados uma memória separada, capaz de continuar aprendendo.

19–28 minutes

Introdução

Os grandes modelos de linguagem, ou LLMs, frequentemente parecem se lembrar. Eles conseguem acompanhar conversas extensas, analisar documentos, ajustar o tom das respostas e, em alguns casos, preservar preferências do usuário entre diferentes sessões. Essa memória aparente, porém, não equivale a aprendizado permanente.

A maioria dos LLMs modernos utiliza arquiteturas Transformer cujos parâmetros centrais são treinados previamente e depois mantidos congelados. Durante uma conversa, o modelo pode utilizar as informações presentes em sua janela de contexto, mas normalmente não transforma cada interação em conhecimento interno duradouro. Ele pode compreender uma correção hoje e repetir o mesmo erro amanhã.

O Dendritron Transformer é uma proposta experimental que tenta superar essa limitação. A arquitetura combina um Transformer estável e congelado com um módulo treinável menor, inspirado nos dendritos dos neurônios biológicos — estruturas ramificadas que realizam processamento local e não linear antes que os sinais sejam integrados pelo corpo celular.

A ideia é simples, mas ambiciosa: preservar o conhecimento geral do modelo original enquanto um sistema de memória separado e especializado continua aprendendo com novas experiências.

Nessa arquitetura, o Transformer congelado fornece estabilidade, enquanto o módulo Dendritron fornece plasticidade. A questão ainda sem resposta é se esse equilíbrio pode produzir uma IA verdadeiramente adaptativa sem introduzir novas formas de esquecimento, instabilidade, manipulação e perda de controle.


A Ilusão do Aprendizado: Quatro Formas Diferentes de Memória em IA

Um grande modelo de linguagem baseado em Transformers pode parecer aprender por meio de diferentes mecanismos. Eles, porém, não são equivalentes.

Alguns oferecem apenas acesso temporário à informação. Outros armazenam dados fora do modelo. Somente o ajuste fino modifica efetivamente a rede neural.

Janelas de Contexto: Memória de Trabalho Temporária

A janela de contexto contém as informações atualmente disponíveis para o modelo. Isso inclui a conversa, as instruções do sistema, documentos recuperados e outras entradas recentes.

Por exemplo, um usuário pode informar que é vegetariano e que está planejando uma viagem com orçamento limitado. Várias mensagens depois, o modelo ainda consegue considerar essas duas restrições ao recomendar um restaurante.

Em uma conversa suficientemente longa, entretanto, um desses detalhes pode ser resumido, deslocado ou deixar de estar disponível no contexto ativo.

O modelo pareceu se lembrar, mas a informação estava apenas temporariamente presente em sua memória de trabalho.

Recuperação Externa: Consultar uma Informação

A geração aumentada por recuperação, ou RAG, permite que o sistema pesquise arquivos, bancos de dados ou páginas da internet antes de responder.

Suponha que um usuário envie o manual de uma empresa e pergunte quantos dias de trabalho remoto os funcionários têm direito a utilizar. O sistema localiza a seção relevante e emprega essa informação para formular a resposta.

Essa abordagem é útil porque a fonte pode ser inspecionada, atualizada ou excluída. O modelo, contudo, não necessariamente incorporou aquela política ao seu conhecimento interno. Sem acesso ao documento, talvez não consiga responder à mesma pergunta posteriormente.

A recuperação externa, portanto, está mais próxima de consultar um caderno do que de recordar algo aprendido por experiência.

Perfis Persistentes: Memória Fora do Modelo

Alguns sistemas preservam preferências do usuário entre diferentes sessões. Eles podem registrar que uma pessoa prefere respostas concisas, utiliza o inglês britânico ou tem um cachorro chamado Buster.

Essas informações costumam ser armazenadas fora da rede neural principal. Quando uma nova conversa começa, o sistema reintroduz os dados salvos como parte das instruções fornecidas ao modelo.

O resultado se parece com memória pessoal, mas o modelo em si não foi treinado novamente. Seus parâmetros internos permanecem inalterados.

Ajuste Fino: Modificar o Próprio Modelo

O ajuste fino, ou fine-tuning, é diferente porque modifica os pesos internos da rede neural.

Um hospital, por exemplo, poderia ajustar um modelo de uso geral com relatórios radiológicos e terminologia médica. Depois desse treinamento, o sistema talvez compreendesse linguagem clínica especializada sem precisar consultar repetidamente os mesmos documentos de referência.

A tabela abaixo resume como esses quatro mecanismos diferem quanto ao local de armazenamento da informação, à forma de acesso e à existência ou não de aprendizado interno.

MecanismoComo funcionaA que se assemelhaPrincipal limitação
Janela de contextoMantém disponíveis a conversa atual e as instruções recentesMemória de trabalho de curto prazoDetalhes antigos podem desaparecer quando a conversa se torna muito longa ou termina
Recuperação externa ou RAGPesquisa documentos, bancos de dados ou páginas da internet e insere trechos relevantes no contextoConsulta a um caderno pesquisávelO modelo acessa a informação, mas não necessariamente a aprende
Perfil persistente do usuárioArmazena preferências ou dados selecionados fora da rede neural e os reapresenta em conversas futurasAnotações externas permanentesOs parâmetros centrais do modelo permanecem inalterados
Ajuste finoAtualiza os pesos internos do modelo utilizando novos dados de treinamentoReescrita do conhecimento de longo prazoÉ caro, difícil de reverter e vulnerável ao esquecimento catastrófico

O ajuste fino é o ponto em que uma memória apenas aparente se aproxima de um aprendizado interno genuíno. Entretanto, modificar os pesos do modelo para aprender algo novo pode apagar involuntariamente capacidades adquiridas anteriormente.

Esse fenômeno é conhecido como esquecimento catastrófico.


O que É o Esquecimento Catastrófico — e por que Ele Acontece

Uma rede neural geralmente não armazena cada habilidade em uma região completamente separada. Tarefas diferentes costumam depender de grupos sobrepostos de parâmetros.

Imagine que um modelo seja inicialmente treinado para reconhecer gatos. Durante o treinamento, seus pesos são ajustados para detectar características como orelhas, pelos, formato do rosto e estrutura corporal.

Em seguida, o mesmo modelo é treinado exclusivamente com imagens de cães. O novo treinamento modifica muitos dos mesmos pesos, pois o reconhecimento de gatos e cães depende de características visuais relacionadas.

Essas atualizações podem melhorar o reconhecimento de cães enquanto destroem parcialmente as representações internas utilizadas anteriormente para identificar gatos.

O modelo não acrescenta simplesmente a nova habilidade ao lado da antiga. Ele pode reescrever estruturas internas compartilhadas.

O desempenho poderia seguir este padrão:

Etapa do treinamentoReconhecimento de gatosReconhecimento de cães
Depois de aprender gatosAltoBaixo
Depois de aprender cãesMais baixoAlto

O modelo se torna melhor na nova tarefa, mas pior naquela que já havia aprendido.

O esquecimento catastrófico está relacionado ao sobreajuste, ou overfitting, mas os dois problemas não são iguais. O sobreajuste ocorre quando um modelo se adapta excessivamente aos dados atuais de treinamento e perde a capacidade de generalizar para novos exemplos. O esquecimento catastrófico acontece quando o aprendizado de uma nova tarefa prejudica conhecimentos adquiridos anteriormente.

Os dois fenômenos podem ocorrer ao mesmo tempo. Um treinamento intensivo com um conjunto pequeno e pouco diversificado de imagens de cães pode fazer o modelo memorizar particularidades daquele conjunto e, simultaneamente, sobrescrever representações utilizadas para reconhecer gatos.

O esquecimento catastrófico, contudo, não exige sobreajuste. Um modelo pode reconhecer corretamente cães nunca vistos durante o treinamento e, ainda assim, perder grande parte de sua capacidade anterior de identificar gatos.

Em termos simples, sobreajuste significa aprender a nova tarefa de maneira estreita demais; esquecimento catastrófico significa aprendê-la às custas das tarefas anteriores.

A palavra catastrófico não significa que todas as capacidades anteriores desapareçam completamente. Ela indica que a perda pode ser repentina e desproporcionalmente grande em relação à quantidade de novo aprendizado.

Isso acontece porque o processo de otimização se concentra em reduzir o erro da tarefa atual. A menos que o sistema possua mecanismos específicos para preservar o conhecimento anterior, não existe uma razão automática para que ele proteja as representações internas responsáveis pelas antigas capacidades.

O novo aprendizado pode, portanto, melhorar o desempenho presente enquanto silenciosamente danifica o passado.

Uma IA capaz de aprender continuamente precisa fazer duas coisas ao mesmo tempo:

  • mudar o suficiente para adquirir novos conhecimentos;
  • preservar as estruturas internas necessárias às capacidades anteriores.

Esse conflito constitui o dilema estabilidade–plasticidade, um dos principais problemas que a arquitetura Dendritron tenta enfrentar.


O Dilema Estabilidade–Plasticidade

O aprendizado contínuo depende do equilíbrio entre duas exigências opostas.

Plasticidade é a capacidade de mudar. Ela permite que o modelo absorva novas informações, corrija erros e se adapte a situações desconhecidas.

Estabilidade é a capacidade de preservar conhecimentos úteis. Ela impede que cada novo episódio de aprendizado reescreva tudo o que veio antes.

Plasticidade excessiva produz um sistema que aprende rapidamente, mas esquece constantemente.

Estabilidade excessiva cria um sistema que conserva o conhecimento antigo, mas se torna rígido, incapaz de corrigir erros ou se adaptar às mudanças.

A cognição humana parece manter um equilíbrio dinâmico entre esses dois extremos. Adquirimos novas habilidades sem esquecer a linguagem, a identidade ou os conhecimentos fundamentais sobre o mundo.

Ao mesmo tempo, nossas memórias não são perfeitamente fixas. Elas são revisadas, enfraquecidas, reorganizadas e, em alguns casos, deliberadamente esquecidas.

A inteligência artificial ainda não conseguiu reproduzir esse equilíbrio de maneira confiável.

A abordagem Dendritron tenta separar essas duas funções. O grande Transformer previamente treinado permanece congelado e preserva suas capacidades gerais. Um módulo adaptativo menor fica responsável pelos novos aprendizados.

Em vez de reescrever todo o sistema, a arquitetura modifica apenas sua memória adicional.


Por que os Dendritos Importam

O neurônio artificial utilizado nas redes neurais convencionais é uma simplificação extrema do neurônio biológico.

Ele recebe várias entradas, atribui um peso numérico a cada uma, combina esses valores e aplica uma função de ativação não linear. Seu poder emerge quando milhões ou bilhões dessas unidades simples são conectadas em múltiplas camadas.

Essa abstração foi extraordinariamente bem-sucedida. Ela sustenta grande parte dos sistemas capazes de reconhecer imagens, gerar linguagem, prever estruturas moleculares e controlar máquinas complexas.

Os neurônios biológicos, porém, são muito mais sofisticados.

Os dendritos são estruturas ramificadas pelas quais os neurônios recebem sinais. Durante muito tempo, foram tratados principalmente como cabos passivos que transportavam informação em direção ao corpo celular.

A neurociência experimental mostrou, entretanto, que ramos dendríticos individuais podem realizar processamento local.

Um ramo pode responder de maneira diferente a combinações distintas de entradas. Ele pode apresentar limiares de ativação, saturação, disparos elétricos locais, soma não linear e plasticidade específica de cada ramificação.

Os sinais, portanto, podem ser transformados em ramos separados antes de serem integrados pelo neurônio como um todo.

Isso possui consequências matemáticas importantes.

Um neurônio artificial convencional de camada única não consegue resolver problemas como a operação lógica XOR, na qual a resposta correta depende de uma relação não linear entre as entradas. Normalmente, são necessários neurônios ou camadas adicionais.

Um neurônio com vários ramos dendríticos pode aplicar transformações não lineares separadas a diferentes grupos de entradas antes de combiná-las.

Em princípio, isso permite que uma única unidade estruturada represente interações que um perceptron convencional não consegue expressar sozinho.

O neurônio biológico pode, portanto, comportar-se menos como um único neurônio artificial e mais como uma pequena rede interna.

Uma arquitetura dendrítica artificial tenta capturar esse princípio sem reproduzir todos os detalhes da fisiologia celular. Ramos diferentes poderiam se especializar em contextos, domínios, usuários ou tipos de memória distintos.

Um ramo poderia responder a informações médicas. Outro poderia se especializar em física. Outros poderiam codificar preferências do usuário, conhecimentos adquiridos recentemente ou observações incertas ainda aguardando validação.

Como o aprendizado seria localizado, uma nova experiência poderia modificar apenas os ramos relevantes, em vez de alterar todo o módulo de memória. Isso talvez reduzisse a interferência com conhecimentos não relacionados.

A inspiração biológica, porém, é apenas uma motivação. Um modelo não é superior simplesmente por se parecer com o cérebro.

Arquiteturas dendríticas ainda precisam superar alternativas mais simples quando comparadas sob condições equivalentes.


Como Funciona a Arquitetura Dendritron

Em termos conceituais, a arquitetura possui três componentes principais.

1. O núcleo Transformer congelado

O Transformer previamente treinado fornece competência linguística, conhecimento geral e amplas capacidades de raciocínio.

Seus parâmetros centrais permanecem inalterados durante a adaptação contínua. Congelar o núcleo ajuda a protegê-lo do esquecimento catastrófico direto.

2. A memória Dendritron treinável

O módulo adaptativo, menor, recebe representações internas produzidas pelo Transformer.

Seus ramos dendríticos aprendem correções, associações, preferências ou conhecimentos especializados sem reescrever o modelo fundamental.

3. Ativação seletiva

Um mecanismo de roteamento pode ativar apenas os ramos relevantes para a entrada atual.

Uma pergunta médica poderia mobilizar determinado grupo de ramos, enquanto uma tarefa de programação ativaria outro.

Isso cria uma forma de memória condicional: nem todos os ramos participam de todos os cálculos.

A interação entre essa memória e o Transformer pode ocorrer em três estágios principais.

Antes da atenção: modificar as representações internas

O Dendritron poderia ajustar as representações ocultas que entram em uma camada Transformer.

Nessa configuração, a memória modifica a maneira como o modelo representa a informação atual antes que a atenção seja calculada.

A ideia se aproxima de um adaptador, mas a computação adicional é organizada em ramos dendríticos, e não em uma pequena rede neural convencional.

Dentro da atenção: influenciar o foco do modelo

O módulo de memória poderia modificar as consultas, chaves ou valores utilizados pelo mecanismo de atenção.

Isso permitiria que aprendizados anteriores influenciassem quais partes do contexto atual recebem maior importância. A memória não alteraria apenas a resposta final; ela também participaria da interpretação da entrada.

Essa abordagem oferece maior poder de intervenção, mas também interfere mais profundamente na computação interna do Transformer.

Depois da atenção: corrigir a saída final

O Dendritron também poderia modificar as pontuações finais antes que o modelo selecionasse o próximo token.

Essa é a forma mais simples de integração. O Transformer realiza seu processamento normal, e a memória adaptativa acrescenta uma correção final.

A vantagem está na eficiência e no relativo isolamento entre os sistemas. A limitação é que a memória pode alterar a resposta, mas não transformar profundamente o raciocínio interno do modelo.

Um mecanismo de controle, ou gating, também poderia regular o equilíbrio entre os dois sistemas.

Em perguntas familiares, o modelo dependeria principalmente do Transformer congelado. Em informações personalizadas ou recentemente aprendidas, a memória adaptativa poderia exercer maior influência.


Comparação com Métodos Existentes de Adaptação

A ideia geral de congelar um grande modelo e treinar somente um componente menor já está bem estabelecida.

O Dendritron pertence ao campo mais amplo do ajuste fino eficiente em parâmetros, conhecido pela sigla PEFT.

MétodoO que mudaIdeia principal
AdaptadoresPequenos módulos neurais inseridos nas camadas congeladasAcrescentar transformações específicas sem retreinar o modelo inteiro
LoRA — Low-Rank AdaptationPequenas matrizes de baixa dimensão associadas aos pesos existentesAproximar mudanças úteis nos pesos utilizando muito menos parâmetros treináveis
Prompt tuningVetores treináveis acrescentados à entradaOrientar o comportamento do modelo sem alterar seus pesos originais
Prefix tuningRepresentações treináveis inseridas no mecanismo de atençãoInfluenciar a atenção por meio de prefixos aprendidos
Mistura de especialistasDiferentes módulos ativados para diferentes entradasEncaminhar cada tarefa para componentes especializados
DendritronMemória adaptativa organizada em ramosUtilizar computação não linear local e plasticidade seletiva

O Dendritron, portanto, não é inovador apenas por conectar um componente treinável a um Transformer congelado.

Seu valor científico precisa vir das propriedades específicas da organização dendrítica.

A computação baseada em ramos aprende utilizando menos parâmetros? Ela reduz a interferência entre tarefas? Consegue localizar memórias com maior precisão? A ativação seletiva melhora a escalabilidade? Ramos individuais podem ser auditados, removidos ou reiniciados?

Essas são as afirmações que exigem evidências.


O que Seria Necessário para Comprovar a Ideia?

Um sistema que aprende um único fato durante uma demonstração não resolveu o problema do aprendizado contínuo.

Uma avaliação convincente exigiria uma longa sequência de tarefas. Depois de cada nova tarefa, o modelo precisaria ser novamente testado em tudo o que havia aprendido anteriormente.

Os pesquisadores teriam de verificar se a arquitetura consegue:

  • adquirir novos conhecimentos sem retreinamento extensivo;
  • preservar o desempenho nas tarefas anteriores;
  • transferir conhecimentos úteis entre domínios relacionados;
  • evitar crescimento ilimitado da memória e do custo computacional;
  • permanecer estável quando as tarefas são apresentadas em ordens diferentes;
  • distinguir informações confiáveis de ruído;
  • resistir a entradas maliciosas ou contraditórias.

As comparações também precisam ser justas.

Um módulo Dendritron deve ser comparado com adaptadores convencionais, LoRA, perceptrons multicamadas, sistemas de recuperação externa, aprendizado com repetição de experiências e outros métodos de aprendizado contínuo.

Todos devem utilizar quantidades comparáveis de parâmetros e orçamentos computacionais semelhantes.

Essas comparações podem mostrar se a arquitetura supera as alternativas existentes, mas não revelam quais de seus componentes internos são responsáveis pelos ganhos.

Para isso, são necessários estudos de ablação.

Em aprendizado de máquina, ablação significa remover, desativar ou substituir deliberadamente uma parte do modelo para verificar se ela realmente contribui para o desempenho.

Os pesquisadores podem substituir os ramos dendríticos por camadas neurais convencionais, desativar o roteamento seletivo ou eliminar o processamento não linear local.

Em seguida, o desempenho é medido novamente. Se a retirada de um componente reduzir os ganhos, há indícios de que ele é importante. Se nada mudar, a complexidade adicional talvez seja desnecessária.

Sem esses testes, qualquer vantagem poderia ser apenas consequência da inclusão de mais capacidade treinável, e não do projeto dendrítico propriamente dito.


O Custo Oculto do Aprendizado Contínuo

Uma IA que continua aprendendo depois de ser implantada pode se tornar mais útil, mas também menos previsível.

Um modelo congelado possui limitações, porém é relativamente estável. Uma versão específica pode ser testada, arquivada, comparada e reproduzida.

Um modelo continuamente adaptativo muda com a experiência.

Duas cópias inicialmente idênticas podem se tornar muito diferentes depois de interagir com usuários, organizações ou ambientes informacionais distintos.

Seu comportamento passaria a depender não apenas dos parâmetros originais, mas também de tudo o que cada uma aprendeu posteriormente.

Isso cria uma deriva comportamental.

Cada atualização individual pode parecer inofensiva. Entretanto, milhares de pequenas mudanças podem se acumular, alterando gradualmente as prioridades, o tom, os julgamentos e as respostas do modelo de maneiras que nunca foram explicitamente projetadas.

O perigo não precisa assumir a forma de uma falha única e dramática. Pode ser o afastamento lento do sistema em relação ao comportamento originalmente testado.

Um modelo validado no momento do lançamento talvez já não seja o mesmo sistema em operação seis meses depois. Suas capacidades, seus vieses e seus modos de falha podem ter se transformado por meio da adaptação contínua.

O aprendizado contínuo converte o modelo de um produto tecnológico fixo em um processo evolutivo — um processo que precisa ser monitorado, auditado e governado durante toda a sua vida operacional.


Envenenamento da Memória e Manipulação

Uma memória treinável também cria uma nova superfície de ataque.

Um usuário mal-intencionado poderia apresentar repetidamente informações falsas, associações tendenciosas ou instruções ocultas concebidas para influenciar comportamentos futuros.

Em uma injeção de prompt convencional, a instrução maliciosa pode desaparecer quando a conversa termina. Em um sistema de aprendizado contínuo, a mesma manipulação poderia ser armazenada e tornar-se persistente.

Esse fenômeno pode ser chamado de envenenamento da memória.

Um atacante poderia tentar ensinar o modelo a confiar em uma fonte pouco confiável, ignorar determinadas restrições de segurança, favorecer uma agenda específica ou responder de maneira diferente quando um gatilho oculto estivesse presente.

Ramos seletivos poderiam limitar a propagação do dano, mas somente se o sistema conseguisse identificar que houve envenenamento.

Uma arquitetura segura de memória precisaria controlar o que pode se tornar permanente. Seriam necessários registros de procedência, estimativas de confiança, atualizações reversíveis, validação independente, pontos de restauração protegidos e mecanismos para detectar alterações anormais.

Aprendizado contínuo não pode significar aprendizado indiscriminado.


Privacidade e o Direito ao Esquecimento

A memória externa é imperfeita, mas geralmente pode ser inspecionada.

Um documento armazenado ou registro de banco de dados pode ser localizado, editado ou excluído. Informações incorporadas aos parâmetros de uma rede neural são muito mais difíceis de encontrar.

Suponha que o sistema aprenda uma informação privada sobre um usuário. Onde esse dado foi armazenado? Qual ramo o contém? Ele se espalhou por vários ramos? Pode ser removido sem prejudicar conhecimentos não relacionados? Como verificar que a exclusão realmente ocorreu?

Uma arquitetura dendrítica modular poderia tornar a memória mais localizada e, portanto, mais fácil de administrar. Usuários diferentes poderiam possuir módulos separados, e um ramo comprometido talvez pudesse ser reiniciado.

Isso, contudo, ainda é uma hipótese. Representações neurais frequentemente se tornam entrelaçadas mesmo em sistemas modulares.

Os usuários precisariam de respostas claras para várias perguntas:

  • O sistema está aprendendo com esta interação?
  • Quais informações podem ser retidas?
  • Elas influenciarão respostas dadas a outros usuários?
  • A memória pode ser inspecionada?
  • Pode ser corrigida ou excluída?
  • O sistema consegue comprovar que a exclusão ocorreu?

Uma arquitetura que se lembra permanentemente sem oferecer controle significativo transformaria a personalização em um problema de privacidade.


A Inteligência Também Exige Esquecimento

A expressão “uma IA que nunca esquece” parece desejável porque os seres humanos frequentemente experimentam o esquecimento como uma fraqueza.

A memória perfeita, porém, talvez não seja natural nem inteligente.

A memória humana é seletiva. Esquecemos detalhes, enfraquecemos associações pouco utilizadas, revisamos crenças e comprimimos muitas experiências em conceitos mais gerais.

O esquecimento reduz o ruído. Ele remove informações obsoletas, evita a sobrecarga, preserva a plasticidade e permite que novas interpretações substituam as antigas.

Uma máquina que armazenasse todas as interações com a mesma importância acumularia desinformação, contradições, detalhes irrelevantes, correlações acidentais e entradas maliciosas.

Com o tempo, ela poderia se tornar menos coerente, e não mais capaz.

O objetivo, portanto, não deveria ser a retenção ilimitada, mas a governança da memória.

Um sistema maduro de memória artificial precisaria distinguir entre:

  • informações necessárias apenas para a conversa atual;
  • experiências temporárias que merecem acompanhamento;
  • memórias candidatas ainda aguardando validação;
  • conhecimentos confiáveis adequados à consolidação;
  • informações desatualizadas que deveriam enfraquecer;
  • conteúdos perigosos ou privados que deveriam ser apagados.

O aprendizado se tornaria uma sequência controlada de seleção, verificação, consolidação, revisão e esquecimento.

A capacidade de esquecer corretamente talvez seja tão importante quanto a capacidade de recordar.


Uma Abordagem Paralela: Dragon Hatchling

O Dendritron não é a única tentativa de superar a memória estática dos Transformers convencionais.

Outra arquitetura experimental, conhecida como Dragon Hatchling, ou BDH, também explora a ideia de que a memória deve existir em conexões mutáveis, e não apenas em tokens armazenados.

A sigla BDH originalmente significava Baby Dragon Hatchling, embora o artigo científico normalmente se refira à arquitetura apenas como Dragon Hatchling.

O nome reflete o caráter experimental do projeto: um sistema que acaba de “sair do ovo”, mas já apresenta indícios do que uma família mais madura de arquiteturas adaptativas poderia se tornar.

O BDH representa parte de sua memória de trabalho como correlações temporárias entre neurônios artificiais. Essas conexões se comportam como pesos sinápticos rápidos, fortalecendo-se ou enfraquecendo-se à medida que o modelo processa novas informações.

Isso oferece à arquitetura uma forma de memória dinâmica durante a inferência.

Em vez de preservar todo o passado como uma sequência crescente de tokens, o BDH comprime informações anteriores em um estado associativo que evolui continuamente.

A semelhança com o Dendritron é evidente. As duas abordagens separam uma estrutura de conhecimento relativamente estável de um mecanismo mais plástico, capaz de mudar durante o uso.

Ambas também se inspiram na ideia de que a inteligência biológica depende não apenas da atividade neural, mas de conexões adaptáveis e processamento local.

A diferença crucial está naquilo que já foi demonstrado.

A pesquisa pública sobre o BDH mostra principalmente adaptação temporária e memória recorrente durante a inferência. Ela ainda não prova que o sistema possa consolidar novos conhecimentos permanentemente de maneira segura, preservá-los entre sessões ou evitar o esquecimento catastrófico durante longos períodos.

O BDH, portanto, reforça o argumento mais amplo por trás do Dendritron: o futuro da inteligência artificial talvez exija arquiteturas nas quais a memória seja um processo ativo e adaptativo, e não um arquivo passivo de tokens anteriores.

Ao mesmo tempo, ele sustenta a mesma conclusão cautelosa. A memória dinâmica é promissora, mas o aprendizado confiável ao longo de toda a vida operacional continua sem solução.


Uma Direção Promissora, mas Ainda Não uma Solução

O Dendritron Transformer enfrenta uma limitação real da inteligência artificial contemporânea.

Modelos de linguagem baseados em Transformers conseguem processar novas informações sem necessariamente aprendê-las de forma permanente. Atualizar o modelo inteiro é caro e envolve o risco de esquecimento catastrófico.

A recuperação externa oferece uma memória útil, mas consultar informações armazenadas não equivale a incorporá-las ao conhecimento interno do modelo.

Uma memória dendrítica separada oferece uma alternativa interessante.

O Transformer congelado preserva o conhecimento geral e as capacidades fundamentais. O módulo adaptativo aprende com novas experiências. O processamento baseado em ramos pode favorecer especialização, ativação seletiva e atualizações mais localizadas.

O Dragon Hatchling, ou BDH, explora uma direção relacionada. Em vez de depender exclusivamente de uma janela de contexto crescente, ele mantém um estado interno dinâmico que pode ser interpretado como conexões sinápticas temporárias modificadas durante a inferência.

Isso sugere que uma memória adaptativa pode ser implementada dentro da arquitetura sem retreinar continuamente todo o modelo.

Entretanto, o BDH demonstra principalmente uma memória de trabalho dinâmica, e não um aprendizado permanente comprovado ou uma consolidação segura entre sessões.

Juntos, Dendritron e BDH apontam para uma mudança mais ampla: a memória pode se tornar um componente ativo e evolutivo do modelo, em vez de permanecer apenas como um arquivo passivo do passado.

Essas arquiteturas, porém, ainda são hipóteses experimentais.

Elas precisam demonstrar que a memória inspirada na biologia supera alternativas mais simples. Precisam permanecer estáveis durante longas sequências de aprendizado, resistir à manipulação, evitar crescimento descontrolado, proteger a privacidade e permitir a correção ou exclusão de memórias indesejadas.

Também precisam resolver um problema ainda mais profundo: decidir quando uma adaptação temporária deve se transformar em conhecimento permanente.

O desafio central não é simplesmente criar uma IA capaz de se lembrar de mais coisas.

É criar uma IA capaz de decidir o que merece tornar-se permanente, o que deve permanecer temporário, o que precisa ser questionado e o que deve desaparecer.

O futuro da inteligência artificial talvez não pertença à máquina que nunca esquece.

Talvez pertença à máquina que aprende o que vale a pena lembrar.


Referências

Ramón y Cajal, S. (1909–1911). Histologie du système nerveux de l’homme et des vertébrés. Paris: A. Maloine.

McCulloch, W. S., & Pitts, W. (1943). A logical calculus of the ideas immanent in nervous activity. The Bulletin of Mathematical Biophysics, 5, 115–133.

Rosenblatt, F. (1958). The perceptron: A probabilistic model for information storage and organization in the brain. Psychological Review, 65(6), 386–408.

Vaswani, A., et al. (2017). Attention is all you need. Advances in Neural Information Processing Systems, 30.

Chavlis, S., & Poirazi, P. (2025). Dendrites endow artificial neural networks with accurate, robust and parameter-efficient learning. Nature Communications, 16, 943.

Pathway. (2026, March 17). Pathway’s BDH solves Sudoku Extreme with 97.4% accuracy, while leading LLMs are close to 0. https://pathway.com/research/beyond-transformers-sudoku-bench.



Copyright 2026 AI-Talks.org

Similar Posts

  • | | | | |

    Amara’s Law and Artificial Intelligence

    AI is not failing. Our sense of time is.

    Amara’s Law explains the central illusion of artificial intelligence: we expect AI to transform everything at science-fiction speed, then dismiss it when reality moves more slowly. But while the hype collapses, the infrastructure keeps growing. Expert systems disappointed. Neural networks were declared dead. AI winters came and went. Then came deep learning, Transformers, ChatGPT, and autonomous agents.

    The mistake is not believing that AI will change the world. The mistake is expecting the revolution next year while ignoring what it may do over the next twenty.

    AI does not need consciousness to eliminate tasks, weaken professions, reshape education, automate bureaucracy, manipulate information, and redistribute power. It does not need to replace everyone. It only needs to become cheap, invisible, and embedded everywhere.

    We are probably overestimating AI in the short term.

    We are almost certainly underestimating what will happen when society becomes dependent on it.

  • | | |

    With Skill and Art

    My colleague Eduardo Valadares, from the Department of Physics at the Universidade Federal de Minas Gerais, has written a delightful article for those who still believe a diploma is a magic wand that opens doors and solves everything. With elegant irony, he shows how we’re building a society of glittering islands surrounded by an ocean of resentment — where shiny degrees float while real skills sink. After all, what’s the point of stacking up certificates if, in the end, no one knows how to build the bridge between knowledge and reality?

  • | |

    The Uncanny Valley

    The concept of the “Uncanny Valley” (Japanese: 不気味の谷, Hepburn: bukimi no tani) is a fascinating subject that has captured the attention and challenges of researchers, engineers, and robotics enthusiasts since pioneering robotics professor Masahiro Mori introduced it in 1970. This complex psychological phenomenon plays a crucial role at the intersection of robotics, artificial intelligence (AI), and our own interaction with machines. In this AI-Talks Wiki article, we will expand our understanding of the Uncanny Valley, bringing new examples and information to deepen our analysis.

  • | |

    Transformando ChatGPT em qualquer coisa que você quiser: Um guia para usar prompts para respostas criativas

    Saia do caminho, gênios criativos! Quem precisa de originalidade quando você pode simplesmente usar o ChatGPT ou outro LLM para gerar qualquer personalidade ou personagem que desejar? Neste artigo, vamos mostrar como manipular as respostas do ChatGPT com alguns prompts para que ele possa se transformar em qualquer coisa que você queira. Forneceremos instruções passo a passo de como fazer isso e daremos alguns exemplos de que tipo de conversas você pode ter com um bot que está fingindo ser outra coisa.

  • | | |

    Treinando uma Rede Perceptron Linear com uma tabela – Um exemplo de Aprendizado Supervisionado

    No campo das redes neurais artificiais, o perceptron é um modelo fundamental para compreender o aprendizado supervisionado. Embora tradicionalmente os perceptrons sejam treinados usando equações e algoritmos matemáticos, este artigo explora uma abordagem alternativa para treinar um perceptron usando tabelas do Excel. Especificamente, focamos em um neurônio de duas entradas com um neurônio de saída, excluindo viés e funções de ativação, e utilizamos a simplicidade e versatilidade do Excel para demonstrar o processo de aprendizado supervisionado. Através deste exemplo, nosso objetivo é fornecer uma compreensão prática de como um perceptron pode ser treinado para somar dois números usando dados tabulares, demonstrando sua capacidade de aprender fronteiras de decisão lineares.

  • | | | |

    Himenópteros: Lições da Natureza para o Futuro da Sociedade e da Tecnologia

    Neste artigo, exploramos o fascinante mundo do comportamento social em insetos Hymenoptera, como as formigas, e examinamos as impressionantes semelhanças entre seu comportamento de “mente coletiva” e as sociedades humanas. Baseando-se nas observações de Charles Darwin e na pesquisa inovadora de Edward Wilson, nos aprofundamos na intrincada divisão do trabalho, comunicação, escravidão e cooperação dentro das colônias de formigas, e nas profundas implicações do altruísmo recíproco na evolução da seleção natural. Mas isso não é tudo — também investigamos como um ramo da inteligência artificial é inspirado no comportamento social desses insetos eusociais. A “mente coletiva” das formigas nos guia para novos caminhos na criação de sistemas mais eficientes e adaptáveis. No entanto, ao explorar essas fascinantes analogias, também reconhecemos as limitações e os perigos potenciais da inteligência artificial. A pergunta que surge é: estaremos caminhando para um futuro onde os humanos sejam escravizados por uma “mente coletiva”, à semelhança de como algumas espécies de formigas escravizam membros de outras colônias? Este artigo é uma leitura obrigatória para qualquer pessoa interessada em biologia evolutiva, sociobiologia e no futuro da inteligência artificial. E lembre-se: a resistência é inútil…

Leave a Reply

Your email address will not be published. Required fields are marked *

This site uses Akismet to reduce spam. Learn how your comment data is processed.