Dos Números ao Significado: Como Sensores Semânticos Baseados em LLMs Podem Transformar a Inteligência Financeira
Resumo
Os mercados financeiros são moldados por dois tipos muito diferentes de informação. O primeiro é numérico e estruturado: preços, retornos, volume de negociação, volatilidade, taxas de juros, demonstrações financeiras e indicadores macroeconômicos. O segundo é, em grande parte, não estruturado: relatórios corporativos, teleconferências de resultados, regulamentações, políticas governamentais, notícias, mídias sociais, condições climáticas e acontecimentos geopolíticos. Modelos quantitativos são excepcionalmente eficientes no processamento da primeira categoria, enquanto os Grandes Modelos de Linguagem (Large Language Models, LLMs) oferecem uma nova capacidade de interpretar a segunda. Este artigo apresenta uma arquitetura híbrida na qual modelos numéricos convencionais continuam fazendo aquilo que fazem melhor, enquanto agentes especializados baseados em LLMs atuam como sensores semânticos, identificando em textos eventos e relações economicamente relevantes. Uma camada de coordenação reúne então essas duas formas de evidência, enquanto mecanismos independentes de verificação e controle de risco permanecem fora do processo de raciocínio dos LLMs. O objetivo não é criar um oráculo de mercado baseado em IA, mas uma forma mais rica, disciplinada e abrangente de inteligência financeira.
Ideia Central
Os Grandes Modelos de Linguagem devem complementar, e não substituir, as finanças quantitativas. Utilizados como sensores semânticos, eles podem extrair informações relevantes de relatórios, políticas públicas, notícias, mídias sociais, condições climáticas e acontecimentos geopolíticos. A verdadeira oportunidade está em conectar essa informação semântica aos dados numéricos de mercado, preservando a qualidade das fontes, o momento em que a informação se torna disponível, a incerteza, a independência das evidências e controles rigorosos de risco.
Jim Simons e a Atração de um Problema Difícil
Há também uma motivação pessoal por trás desta ideia. Sempre admirei Jim Simons, não principalmente pelo extraordinário sucesso financeiro da Renaissance Technologies, mas pela atitude intelectual que ele levou aos mercados. Em The Man Who Solved the Market, Gregory Zuckerman retrata um matemático de classe mundial e ex-decifrador de códigos que ajudou a inaugurar uma abordagem de investimento orientada por dados e algoritmos, numa época em que grande parte de Wall Street ainda dependia fortemente de narrativas financeiras convencionais e do julgamento humano.
O que me fascina nessa história não é a possibilidade de descobrir uma máquina que imprima dinheiro, mas a atração exercida por um problema científico difícil. Os mercados financeiros são sistemas adaptativos complexos, nos quais matemática, expectativas, instituições, tecnologia, psicologia, política, fenômenos naturais e acaso interagem continuamente. O desafio é intelectualmente fascinante porque o sistema não é completamente aleatório nem claramente determinístico. Existem padrões, mas eles mudam; as relações importam, mas são condicionais; a informação é relevante, mas nem sempre da mesma maneira ou na mesma escala de tempo.
Essa perspectiva também orienta um trabalho que venho desenvolvendo com meus alunos na universidade. Estamos testando modelos preditivos em ambientes controlados de pesquisa, incluindo backtesting e condições simuladas de mercado, em mercados bastante diferentes: ações brasileiras e derivativos de ações, commodities e criptomoedas.
As ações brasileiras e seus derivativos são negociados em um ambiente altamente estruturado, no qual um pequeno grupo de grandes participantes institucionais bem conhecidos — os “tubarões brancos” — interage com uma população muito maior de pequenos investidores de varejo, as proverbiais “sardinhas”, muitas das quais são suscetíveis ao comportamento de manada, à perseguição de movimentos de preço e à especulação de curto prazo.
A vantagem dos tubarões pode vir da capacidade de reconhecer padrões comportamentais recorrentes, processar informações mais rapidamente e executar grandes posições por meio de estratégias cuidadosamente planejadas, muitas vezes algorítmicas. Essas operações podem, por sua vez, tornar-se sinais para investidores menores, que reagem aos movimentos de preço e volume sem compreender plenamente sua origem.
Nesse sentido, os “tubarões brancos” não apenas nadam entre as “sardinhas”: por meio de uma execução sofisticada, eles podem frequentemente ajudar a conduzir investidores menores em direções que, ao final, favorecem suas próprias posições.
As commodities, por outro lado, estão muito mais diretamente ligadas ao mundo físico. O clima pode alterar safras, estoques podem apertar ou aliviar mercados, gargalos de transporte podem atrasar o fornecimento e problemas de produção podem mudar rapidamente as expectativas. A geopolítica pode amplificar todos esses efeitos ao interromper rotas comerciais, restringir exportações, impor sanções ou limitar o acesso a energia, metais, produtos agrícolas e outros recursos estratégicos. Nesses mercados, compreender o ativo muitas vezes significa compreender a cadeia de suprimentos por trás dele.
As criptomoedas são diferentes novamente. Elas são negociadas continuamente em um mercado global fragmentado e podem reagir de forma brusca a narrativas sociais, eventos específicos de corretoras, desenvolvimentos tecnológicos, anúncios regulatórios e mudanças no sentimento dos investidores. Seus preços também podem responder a acontecimentos geopolíticos, especialmente quando esses eventos afetam regulação, controles de capital, sanções, estabilidade financeira ou a demanda por reservas alternativas de valor. Em comparação com muitos ativos tradicionais, a informação pode se espalhar de forma extraordinariamente rápida nos mercados de criptomoedas, muitas vezes com pouca separação entre notícia, especulação e reação coletiva.
O objetivo aqui não é simplesmente perguntar se a IA consegue prever preços. É compreender quais tipos de informação importam em cada mercado, quando importam e como podem ser combinados sem confundir ruído com conhecimento.
Este artigo desenvolve essa questão conceitualmente. Não se trata de uma receita de negociação, nem se pressupõe que uma arquitetura de IA multiagente necessariamente produzirá investimentos lucrativos. O objetivo mais profundo é explorar como máquinas podem combinar a informação numérica que as finanças quantitativas já processam muito bem com a enorme quantidade de informação economicamente relevante que ainda chega principalmente por meio da linguagem humana.
Dois Mundos da Informação Financeira
Imagine que estejamos analisando uma empresa de capital aberto. A qualquer momento podemos observar o preço de suas ações, retornos recentes, volume negociado, volatilidade, liquidez, múltiplos de avaliação, nível de endividamento e talvez aquilo que o mercado de opções sugere sobre o risco futuro. Também podemos observar taxas de juros, taxas de câmbio, índices setoriais, preços de commodities e variáveis macroeconômicas relevantes para a empresa.
Os computadores são extremamente eficientes no processamento dessas informações. Modelos estatísticos podem detectar volatilidade incomum, comparar o volume atual com padrões históricos, medir correlações, estimar exposição a taxas de juros, identificar momentum e agressão compradora ou vendedora, ou avaliar como uma carteira se comporta sob diferentes hipóteses.
A infraestrutura financeira moderna já torna grande parte dessas informações diretamente legível por máquinas.
No Brasil, isso é particularmente útil para nossa pesquisa, porque as plataformas disponíveis aqui oferecem uma visão excepcionalmente transparente da atividade de mercado, incluindo preços, volumes negociados, fluxo de ordens, agressão compradora e vendedora e os rastros recorrentes deixados por grandes participantes institucionais. Isso não revela as estratégias internas dos tubarões, mas pode tornar seus padrões de negociação surpreendentemente visíveis. Quando entram de forma agressiva, acumulam posições, distribuem ativos, absorvem liquidez ou movimentam grandes ordens pelo mercado, frequentemente deixam rastros mensuráveis que modelos quantitativos podem detectar e analisar.
Mas os mercados não são movidos apenas por atividade de negociação e sinais numéricos. Algumas das forças mais importantes vêm de fora das telas de preços e aparecem primeiro como acontecimentos, documentos, decisões ou narrativas que os modelos numéricos não conseguem interpretar diretamente.
Considere uma situação diferente. Um governo anuncia uma nova restrição às exportações, uma tarifa ou uma mudança na tributação internacional. O relatório anual da empresa revela uma dependência significativa do mercado afetado, enquanto a administração já havia reconhecido que substituir um fornecedor crítico poderia levar vários trimestres. Ao mesmo tempo, uma tempestade severa ameaça uma importante região industrial, enquanto a discussão sobre a empresa começa a se intensificar na imprensa financeira e nas redes sociais.
Todos esses acontecimentos podem, eventualmente, refletir-se no preço. Mas eles não chegam inicialmente como variáveis numéricas. Eles chegam como frases, documentos, eventos, relações, narrativas e comportamento.
Essa é a distinção central deste artigo. O mundo estruturado contém quantidades que modelos numéricos conseguem processar diretamente. O mundo semântico contém significado que primeiro precisa ser interpretado. O objetivo não deve ser forçar ambos para dentro da mesma ferramenta, mas permitir que diferentes sistemas computacionais trabalhem com as representações que compreendem melhor e, depois, construir uma interface disciplinada entre eles.
Deixe os Modelos Numéricos Continuarem Numéricos
A ascensão dos LLMs não torna obsoletos a econometria, a estatística, a otimização, os modelos de séries temporais ou as redes neurais. Em muitas tarefas financeiras, eles continuam sendo as ferramentas naturais.
Se o problema é estimar volatilidade, calcular exposição de carteira, medir correlações, otimizar risco, detectar momentum de preços ou processar milhões de observações de mercado, converter esses números em texto para que um LLM possa lê-los geralmente tornaria o problema pior, e não melhor.
O motor numérico deve, portanto, permanecer numérico.
Dependendo do problema, esse motor pode ser um modelo econométrico convencional, um modelo de Markov ou de mudança de regime, um sistema de aprendizado de máquina, uma LSTM ou uma arquitetura mais recente, como o Temporal Fusion Transformer. Modelos baseados em Markov são úteis quando o comportamento do mercado pode ser representado como transições entre diferentes regimes, como estados de baixa e alta volatilidade. As LSTMs foram desenvolvidas para capturar dependências de longo prazo em dados sequenciais, enquanto os Temporal Fusion Transformers podem combinar diferentes tipos de informação em múltiplos horizontes de previsão e oferecem mecanismos de seleção de variáveis e interpretabilidade.
O ponto importante não é decidir qual modelo de previsão vence. É permitir que modelos numéricos operem diretamente sobre dados numéricos. O papel novo dos LLMs começa justamente onde esses modelos são mais fracos: na informação cujo significado econômico é expresso principalmente por meio da linguagem.
LLMs como Sensores Semânticos
Uso o termo sensor semântico para designar um LLM cuja função principal não é prever diretamente o mercado, mas ler informações expressas em linguagem e identificar aquilo que pode ter relevância econômica.
Considere um longo documento governamental anunciando mudanças na política de exportações. Em vez de perguntar ao LLM “esta ação vai subir ou cair?”, o sistema pode formular perguntas mais disciplinadas. O que mudou? Quais setores são afetados? Quais empresas parecem expostas? Quando a regra entra em vigor? Existem exceções? O evento é temporário ou estrutural? O documento é uma fonte oficial primária ou apenas um comentário sobre ela?
A saída pode ser transformada em um registro compacto de evento:
| Campo | Exemplo |
|---|---|
| Evento | Nova restrição à exportação de semicondutores |
| Entidade afetada | Empresa A |
| Exposição | Significativa |
| Possível direção econômica | Negativa |
| Horizonte relevante | Meses a anos |
| Fonte primária | Publicação oficial do governo |
| Confiança da extração | Alta, sujeita a verificação |
Esse é um papel muito mais útil para um LLM do que tentar transformá-lo em um oráculo de investimentos. O sensor semântico converte um trecho de linguagem em evidência estruturada que pode ser examinada por outras partes do sistema.
Até algo aparentemente simples como sentimento exige contexto financeiro. Loughran e McDonald demonstraram que dicionários genéricos de sentimento classificavam incorretamente muitas palavras encontradas em relatórios anuais 10-K apresentados à SEC, porque palavras que parecem negativas no inglês cotidiano não carregam necessariamente o mesmo significado em documentos financeiros. A lição mais ampla é importante: extrair significado economicamente relevante não é o mesmo que contar palavras positivas e negativas.
A palavra sensor também não deve ser entendida de forma excessivamente literal. Um termômetro mede temperatura em relação a uma escala física; um LLM produz uma interpretação dependente do modelo. Sua saída, portanto, precisa ser validada. O fato de um modelo afirmar estar “90% confiante” não torna esse número estatisticamente significativo. Idealmente, a confiança deve refletir desempenho medido em exemplos rotulados, verificação independente ou outros procedimentos de calibração, e não apenas a impressão subjetiva de certeza do próprio modelo.
Uma Equipe Híbrida de Agentes Especializados
Quando deixamos de imaginar um único modelo gigantesco lendo tudo, surge uma divisão de trabalho muito mais natural. Um sistema híbrido pode atribuir diferentes ambientes de informação a agentes especializados, mantendo os modelos quantitativos convencionais fora da camada de linguagem.
Um Agente Quantitativo acompanha preços, volume, volatilidade, liquidez, derivativos, indicadores financeiros, variáveis macroeconômicas e outros dados estruturados. Em muitas implementações, esse agente nem precisaria ser um LLM. Ele poderia simplesmente coordenar modelos convencionais e bancos de dados.
Um Agente de Inteligência Corporativa concentra-se em informações originadas pelas próprias empresas: relatórios anuais e trimestrais, teleconferências de resultados, apresentações a investidores, documentos regulatórios, projeções da administração e divulgações jurídicas. Sua função é identificar mudanças relevantes, e não apenas resumir documentos. Um novo fator de risco, uma alteração no investimento de capital, mudança nas projeções da administração (guidance), maior dependência de um fornecedor ou mudança na linguagem da administração podem merecer atenção.
Um Agente de Sentimento e Narrativas acompanha o ambiente informacional ao redor do ativo. Ele examina jornalismo, análises de mercado, publicações especializadas e redes sociais, mas precisa ir além de um simples sentimento positivo ou negativo. Atenção, novidade, divergência, diversidade de fontes e persistência narrativa podem ser mais informativas. Dez mil publicações repetindo a mesma notícia não representam dez mil observações independentes.
Um Agente do Mundo Externo monitora o ambiente fora da empresa: regulação, política monetária, sanções, geopolítica, energia, clima, logística, eleições ou acontecimentos específicos de um setor. As entradas relevantes devem depender do domínio. O clima pode ser central para o café ou outras commodities agrícolas e quase irrelevante para determinadas empresas de software; interrupções no transporte marítimo podem ser decisivas para fabricantes e muito menos importantes para empresas de serviços domésticos.
Isso torna a arquitetura adaptativa, e não universal. Não existe razão para que todos os ativos tenham os mesmos sensores semânticos. Mercados diferentes geram tipos diferentes de informação relevante, o que também explica por que testar essa abordagem em derivativos brasileiros, commodities e criptomoedas é intelectualmente interessante.
FinGPT, FinMem e TradingAgents já ilustram partes dessa direção mais ampla. FinGPT enfatiza modelos de linguagem financeiros e pipelines de dados, FinMem explora memória em camadas em um agente financeiro baseado em LLM, e TradingAgents utiliza papéis especializados, como agentes de análise fundamentalista, de sentimento, técnicos, de negociação e de risco. Esses sistemas demonstram que a especialização é possível; não demonstram que arquiteturas multiagente sejam sempre superiores a alternativas mais simples.
Como os Dois Mundos Realmente se Conectam
A questão técnica central não é como criar vários agentes. É como a informação passa do lado semântico para o lado numérico.
A transferência não deve consistir em despejar documentos inteiros dentro de um modelo de previsão. Um sensor semântico pode transformar texto em um conjunto relativamente pequeno de características com marcação temporal: tipo do evento, empresa ou ativo afetado, materialidade estimada, direção provável, horizonte relevante, confiabilidade da fonte e confiança na extração. Algumas informações podem ser representadas como indicadores simples — por exemplo, se ocorreu ou não um novo evento regulatório — enquanto outras podem ser transformadas em escores numéricos ou embeddings semânticos compactos.
Uma vez alinhadas temporalmente, essas variáveis podem entrar em um sistema de previsão como informação exógena. Uma LSTM, por exemplo, poderia receber históricos de preços e volatilidade juntamente com indicadores de eventos ou medidas de sentimento. Um Temporal Fusion Transformer pode acomodar naturalmente diferentes covariáveis e escalas temporais, tornando-se uma opção para combinar sinais numéricos históricos com características externas estruturadas.
Não existe razão para insistir em uma única interface. Em algumas aplicações, a informação semântica pode entrar diretamente no preditor numérico. Em outras, a previsão numérica deve permanecer independente, enquanto a camada semântica é usada por um Coordenador para interpretar essa previsão em contexto. Manter esses caminhos parcialmente separados pode até ser mais seguro, pois permite ao analista distinguir se uma conclusão veio do modelo numérico ou da interpretação de informações externas.
O princípio importante, portanto, não é “colocar texto dentro do modelo”. É converter significado relevante em evidência explícita, temporalmente identificada e cuja origem continue rastreável.
A Memória É, na Verdade, um Mapa de Relações
Um sistema semântico útil também precisa de memória. Se uma empresa anunciou seis meses atrás que pretendia abandonar determinado fornecedor, um choque geopolítico atual que afete esse fornecedor não deve ser interpretado como se nada tivesse mudado.
Uma forma natural de organizar essa memória é por meio de um Gráfico Temporal de Conhecimento. Um gráfico de conhecimento pode ser entendido simplesmente como um mapa de relações: a Empresa A depende do Fornecedor B; o Fornecedor B opera no País X; o País X regulamenta a Tecnologia Y; o Produto Z depende da Tecnologia Y. O caráter temporal acrescenta o fato crucial de que essas relações podem começar, mudar e terminar ao longo do tempo. A pesquisa em gráficos temporais de conhecimento trata especificamente desse problema de fatos cuja validade evolui em vez de permanecer permanentemente verdadeira.
Essa dimensão temporal é essencial em finanças. Uma relação com um fornecedor não deve permanecer ativa para sempre apenas porque apareceu em um relatório antigo. O sistema precisa de marcas de tempo, períodos de validade e regras para atualizar ou retirar relações. Alguns eventos perdem relevância gradualmente; outros terminam abruptamente. Um rumor pode deixar de importar em poucas horas, enquanto uma regulamentação pode permanecer relevante até ser revogada.
A memória também cria riscos. Se o sensor semântico interpretar incorretamente dois nomes como empresas diferentes, inventar uma relação ou armazenar uma dependência desatualizada, o raciocínio posterior pode amplificar o erro original. Um sistema prático precisa, portanto, de resolução de entidades, eliminação de duplicatas, rastreamento de fontes e validação periódica. O gráfico de conhecimento só é valioso se for curado, em vez de funcionar como um depósito permanente para tudo aquilo que um LLM já inferiu.

O Tempo Faz Parte da Informação
O tempo merece atenção especial porque é muito fácil construir um modelo financeiro que pareça excelente simplesmente porque ele “sabe” algo que, naquele momento, não poderia ter sabido.
Considere três momentos diferentes. Um evento acontece; um documento descrevendo esse evento torna-se público; e o sistema de IA finalmente termina de recuperar, analisar e interpretar esse documento. Esses momentos podem ser distintos. Se um anúncio governamental é publicado às 10h e o pipeline semântico só termina de processá-lo às 10h02, um backtest não pode fingir que o sistema já possuía a interpretação às 10h.
O mesmo problema existe com dados macroeconômicos, porque números históricos são frequentemente revisados. O ALFRED — Archival Federal Reserve Economic Data — preserva os valores das séries do FRED como foram originalmente divulgados e posteriormente revisados. Isso permite ao pesquisador reconstruir quais informações estavam realmente disponíveis em determinada data histórica, em vez de utilizar inadvertidamente a versão atual, revisada, do passado.
Isso leva a uma regra que deve governar toda a arquitetura:
Um backtest histórico deve reconstruir o conjunto de informações disponível naquele momento, e não apenas o conjunto histórico de dados.
Esse princípio é mais importante do que praticamente qualquer escolha específica de modelo.
O Coordenador Deve Integrar Evidências, Não Governar o Sistema
No centro da arquitetura está um Coordenador. No desenho que considero mais interessante, ele pode de fato ser um LLM, porque modelos de linguagem são particularmente úteis para comparar diferentes tipos de evidência e explicar como elas podem se relacionar. Mas o Coordenador não deve ter autoridade irrestrita.
Suponha que o sistema quantitativo detecte forte momentum de curto prazo, enquanto o Agente do Mundo Externo identifica uma mudança regulatória que pode prejudicar os negócios da empresa no próximo ano. Ao mesmo tempo, o sentimento nas redes sociais torna-se fortemente negativo. Esses sinais não são necessariamente contraditórios. Eles podem operar em horizontes diferentes, e o sentimento negativo pode simplesmente refletir a mesma notícia regulatória que já foi identificada por outro agente.
O papel do Coordenador é organizar essas evidências. Vários agentes estão reagindo à mesma fonte original? Suas conclusões se referem ao mesmo horizonte temporal? Uma observação é um fato primário ou uma interpretação? Existe um mecanismo plausível de transmissão entre o evento e a situação econômica da empresa? O mercado talvez já tenha incorporado aquela informação?
É aqui que aparece outra distinção essencial: concordância não é independência. Cinco agentes usando o mesmo modelo de base e lendo a mesma notícia não são cinco testemunhas independentes. Uma arquitetura robusta deve acompanhar tanto a sobreposição das fontes quanto a sobreposição dos próprios modelos. A concordância entre fontes genuinamente independentes merece mais peso do que concordâncias repetidas que descendem de uma única origem informacional.
O Coordenador também deve manter uma separação clara entre quatro níveis de raciocínio:
Observação → Interpretação → Hipótese → Previsão
Um anúncio regulatório é uma observação. A conclusão de que ele reduz o acesso da empresa a determinado mercado é uma interpretação. A afirmação de que a receita futura cairá é uma hipótese. Um retorno previsto para a ação é uma previsão. A fluência dos LLMs torna esses níveis fáceis de confundir, portanto a arquitetura deve torná-los explícitos.
O Problema do Eco: Quando Uma História Parece Mil
As redes modernas de informação criam um problema particularmente difícil para a análise de sentimento. Uma reportagem original pode ser reproduzida por agregadores, resumida por sistemas automatizados, republicada em redes sociais e reescrita por IA generativa. Um sistema ingênuo pode interpretar milhares de cópias como milhares de confirmações independentes.
Um sistema mais sofisticado deve rastrear a linhagem da informação. Modelos modernos de linguagem podem converter frases ou documentos em representações numéricas chamadas embeddings, nas quais textos com significados semelhantes tendem a ocupar regiões próximas de um espaço de alta dimensão. A similaridade pode então ser medida matematicamente. Um método comum é a similaridade do cosseno, que compara a direção de dois vetores de embedding em vez de seus tamanhos absolutos: quanto mais esses vetores apontam na mesma direção, mais semelhantes são considerados os significados dos textos.
Isso torna o método particularmente útil para detectar ecos informacionais. Dois artigos podem utilizar palavras completamente diferentes e, ainda assim, descrever exatamente o mesmo acontecimento. Sentence-BERT, por exemplo, foi desenvolvido para produzir embeddings que podem ser comparados eficientemente por similaridade do cosseno. Um sistema pode, portanto, agrupar centenas de notícias aparentemente distintas que sejam semanticamente muito próximas e depois examinar horários de publicação, citações, links e fontes primárias para determinar se representam informações genuinamente independentes ou apenas versões repetidas da mesma história original.
Na prática, um sistema financeiro poderia agrupar notícias muito semelhantes, examinar seus horários de publicação, seguir links e citações, comparar trechos, identificar documentos primários compartilhados e construir um gráfico de prováveis relações entre fontes.
Técnicas de aprendizado contrastivo podem aprimorar ainda mais essas representações, aproximando, no espaço de representação, textos ou informações semanticamente semelhantes e afastando aqueles que possuem significados diferentes.
Isso não revela magicamente a verdadeira origem de todas as notícias. A independência é parcialmente uma variável oculta que precisa ser estimada. Ainda assim, estimar o número de fontes realmente independentes é muito mais significativo do que simplesmente contar documentos.
Essa distinção também impede que republicação legítima seja confundida com manipulação deliberada. Cem jornais podem repetir uma notícia de agência por razões perfeitamente normais. Já contas coordenadas em redes sociais podem amplificar intencionalmente uma informação falsa. Ambas produzem repetição, mas são fenômenos diferentes e devem ser tratados como tal.
Informação Externa Também É uma Superfície de Ataque
A partir do momento em que um LLM lê o mundo externo, o mundo externo também pode tentar atacar o LLM.
Pesquisadores já demonstraram a chamada injeção indireta de prompt, na qual instruções maliciosas são inseridas em conteúdos que uma aplicação baseada em LLM recupera e interpreta como dados. Um agente financeiro que navega por documentos ou páginas da internet enfrenta, portanto, um problema de segurança fundamentalmente diferente daquele enfrentado por um modelo numérico convencional.
A regra arquitetural deve ser simples: texto externo é informação não confiável, não autoridade. Uma notícia pode informar ao sensor semântico algo sobre uma empresa, mas jamais deve poder alterar regras do sistema, desativar controles de risco, autorizar uma operação ou modificar permissões de acesso apenas porque contém instruções dirigidas ao modelo.
Essa é mais uma razão para manter verificação e execução fora da camada de raciocínio do LLM. Software determinístico deve impor controle de acesso, permissões de ferramentas, fontes autorizadas, limites de concentração, limites de alavancagem e outras restrições rígidas. O perfil de IA generativa do NIST enfatiza de forma semelhante a necessidade de identificação explícita de riscos, avaliação e governança, em vez de presumir que um modelo generativo competente seja inerentemente confiável.
Também existe uma fronteira jurídica e de governança. Se um sistema pode acessar memorandos internos, comunicações privadas ou outras informações corporativas restritas, isso não significa que tais dados possam entrar legitimamente em um processo de investimento. Informações materiais não públicas exigem controles especialmente rigorosos; negociar com base nelas em violação de deveres ou relações de confiança pode constituir insider trading ilegal. Uma implementação séria precisa, portanto, de regras de acesso aos dados, além de inteligência analítica.
O Risco Deve Poder se Sobrepor ao Raciocínio
O Coordenador pode raciocinar probabilisticamente; a camada de risco precisa ser capaz de dizer não de maneira determinística.
Essa separação é importante. Um LLM pode concluir que vários sinais justificam aumentar determinada exposição. Um sistema independente de risco pode, ainda assim, determinar que a posição proposta viola limites de concentração, restrições de liquidez, alavancagem máxima, limites de perda da carteira ou regras que exigem aprovação humana em situações de incerteza excepcionalmente alta.
Em um sistema apenas analítico, essa camada pode simplesmente sinalizar a incerteza e exigir revisão antes que uma recomendação seja distribuída. Em um sistema capaz de executar operações, os controles precisam ser muito mais rígidos: limites de posição, instrumentos autorizados, tamanho máximo das ordens, restrições de carteira e mecanismos emergenciais de interrupção devem permanecer fora do modelo de linguagem.
O objetivo não é eliminar a incerteza. Os mercados não permitem isso. O objetivo é impedir que uma linguagem convincente seja confundida com autorização para agir.
Como Saber se Tudo Isso Realmente Ajuda?
Uma arquitetura complicada não é automaticamente uma arquitetura inteligente. Cada componente adicional precisa justificar experimentalmente sua existência.
A abordagem mais limpa é construir o sistema progressivamente. Primeiro, avalia-se um modelo quantitativo de referência. Depois, acrescenta-se análise convencional de sentimento. Em seguida, eventos estruturados extraídos por um único LLM. Depois, agentes semânticos especializados. Em seguida, memória persistente e rastreamento de relações. Finalmente, adiciona-se o Coordenador. Em cada etapa, os resultados devem ser comparados fora da amostra, perguntando se a nova camada realmente acrescenta informação que os sistemas mais simples ainda não continham.
Isso é, essencialmente, um estudo de ablação: componentes são adicionados ou removidos individualmente para determinar o que realmente contribuem. O sistema completo não deve ser considerado melhor simplesmente porque é mais sofisticado.
O sucesso também precisa ser definido de forma mais ampla do que “maior retorno”. Informação semântica pode melhorar a detecção de riscos emergentes, explicar mudanças de exposição, identificar eventos importantes mais cedo, reduzir erros catastróficos, aprimorar análises de cenários ou produzir estimativas de incerteza melhor calibradas, mesmo quando a precisão média das previsões pouco se altera.
Em aplicações de investimento, o backtesting também precisa incluir custos de transação, slippage, liquidez, mudanças de regime e o risco de selecionar um modelo simplesmente porque ele, por acaso, apresentou bom desempenho após muitos testes históricos. O Deflated Sharpe Ratio, de Bailey e López de Prado, trata precisamente dos problemas de viés de seleção, backtest overfitting e retornos não normais.
A pergunta empírica realmente importante, portanto, não é “Um LLM consegue prever o mercado?”. Ela é mais estreita — e mais útil:
A informação semântica acrescenta informação confiável, fora da amostra, além daquilo que já está contido nos dados financeiros estruturados?
Por Que Esse Ainda É um Problema em Aberto
Os agentes financeiros baseados em IA estão avançando rapidamente, mas o problema está longe de resolvido. FinGPT demonstra uma abordagem orientada a dados para modelos financeiros de linguagem de código aberto, FinMem explora memória em camadas, e TradingAgents oferece um exemplo de agentes LLM especializados cooperando em análise financeira. São experimentos importantes, mas nenhum deles elimina a necessidade de verificação independente.
O Finance Agent Benchmark, de 2025, torna esse ponto particularmente claro. Ele contém 537 questões elaboradas por especialistas e baseadas em tarefas realistas de pesquisa financeira envolvendo documentos recentes da SEC. Na avaliação original do estudo, o sistema de melhor desempenho obteve 46,8% de acerto, com custo médio reportado de US$ 3,79 por consulta. Esses números representam um retrato de um benchmark e de uma geração específica de modelos, e não um limite permanente para a IA financeira. Ainda assim, demonstram que raciocínio financeiro fluente e raciocínio financeiro confiável não são a mesma coisa.
Sistemas multiagente também criam seus próprios riscos. Agentes podem compartilhar os mesmos pontos cegos porque utilizam o mesmo modelo de base, as mesmas fontes de recuperação ou os mesmos prompts. A memória pode preservar erros. Um Coordenador pode construir uma narrativa extremamente convincente a partir de evidências fracas. Um gráfico de conhecimento pode institucionalizar uma relação incorreta. A complexidade pode produzir aparência de robustez sem verdadeira independência.
É por isso que o sistema deve ser avaliado não apenas como um todo, mas camada por camada.
Além do Trading
Embora as finanças constituam um caso particularmente claro, a arquitetura subjacente é muito mais geral. Um hospital combina medições fisiológicas estruturadas com notas clínicas não estruturadas. Uma fábrica combina telemetria com relatórios de manutenção e comunicações de fornecedores. A agricultura combina sensores e observações de satélite com previsões meteorológicas, documentos de política pública e relatórios de mercado. A logística combina GPS e dados de estoque com avisos portuários, regras alfandegárias, greves e acontecimentos geopolíticos.
Em todos esses casos, sensores numéricos e informações semânticas descrevem aspectos diferentes da mesma realidade. O desafio não é fazer um substituir o outro, mas construir sistemas capazes de integrá-los, preservando seus diferentes níveis de confiabilidade, temporalidade e interpretação.
Essa perspectiva mais ampla é justamente o motivo pelo qual considero útil a expressão sensor semântico. Ela descreve uma nova função computacional para os modelos de linguagem sem fingir que compreender linguagem seja equivalente a realizar uma medição física.
Conclusão: O Mundo Não É uma Planilha
As finanças quantitativas conquistaram enorme poder ao transformar a realidade em números. Preços tornaram-se séries temporais, empresas tornaram-se índices financeiros, riscos tornaram-se distribuições estatísticas e economias tornaram-se conjuntos de indicadores. Essa transformação tornou possível uma análise rigorosa em uma escala que nenhum analista humano conseguiria alcançar sozinho.
Mas o mundo que produz esses números não é, ele próprio, uma planilha. Empresas tomam decisões estratégicas, governos mudam regras, tecnologias surgem, cadeias de suprimentos se rompem, guerras começam, o clima muda e narrativas alteram expectativas. Grande parte dessa informação aparece primeiro como linguagem.
Os Grandes Modelos de Linguagem oferecem uma nova forma de conectar esse ambiente semântico à análise computacional. Seu papel mais interessante talvez não seja substituir modelos quantitativos ou investidores humanos, mas atuar como sensores semânticos capazes de identificar eventos, relações e contexto que sistemas numéricos convencionais não conseguem ler diretamente. Essas saídas podem então ser estruturadas, marcadas temporalmente, comparadas aos dados de mercado e testadas, em vez de simplesmente aceitas.
Um sistema confiável precisa, entretanto, permanecer cético em relação a si próprio. Precisa de memória, mas também de mecanismos para esquecer e corrigir. Precisa de múltiplas fontes, mas também da capacidade de detectar quando essas fontes são apenas ecos umas das outras. Pode utilizar um LLM para coordenar evidências, mas sistemas determinísticos devem manter o controle sobre segurança, acesso aos dados e risco. Acima de tudo, cada camada adicional deve demonstrar que acrescenta informação, e não apenas complexidade.
Isso nos leva de volta a Jim Simons. A principal lição que retiro de sua história não é que os mercados possam ser reduzidos a uma única fórmula, mas que sistemas difíceis recompensam a curiosidade disciplinada: reunir dados, procurar estrutura, testar hipóteses, descartar aquilo que não funciona e permanecer desconfiado de explicações elegantes que as evidências não conseguem sustentar. Os LLMs nos dão um novo instrumento para essa investigação. O desafio é utilizar o instrumento sem confundi-lo com a resposta.
References
- G. Zuckerman, The Man Who Solved the Market: How Jim Simons Launched the Quant Revolution. New York, NY, USA: Portfolio, 2019.
- B3 S.A., “Ibovespa Futures,” B3, São Paulo, Brazil. Accessed Sep. 30, 2026.
- U.S. Securities and Exchange Commission, “EDGAR Application Programming Interfaces (APIs),” updated Apr. 8, 2025.
- T. Loughran and B. McDonald, “When Is a Liability Not a Liability? Textual Analysis, Dictionaries, and 10-Ks,” The Journal of Finance, vol. 66, no. 1, pp. 35–65, 2011, doi: 10.1111/j.1540-6261.2010.01625.x.
- H. Yang, X.-Y. Liu, and C. D. Wang, “FinGPT: Open-Source Financial Large Language Models,” arXiv preprint arXiv:2306.06031, 2023.
- Y. Yu, H. Li, Z. Chen, Y. Jiang, Y. Li, D. Zhang, R. Liu, J. W. Suchow, and K. Khashanah, “FinMem: A Performance-Enhanced LLM Trading Agent with Layered Memory and Character Design,” Proceedings of the AAAI Symposium Series, vol. 3, no. 1, pp. 595–597, 2024, doi: 10.1609/aaaiss.v3i1.31290.
- Y. Xiao, E. Sun, D. Luo, and W. Wang, “TradingAgents: Multi-Agents LLM Financial Trading Framework,” arXiv preprint arXiv:2412.20138, 2024.
- S. Hochreiter and J. Schmidhuber, “Long Short-Term Memory,” Neural Computation, vol. 9, no. 8, pp. 1735–1780, 1997, doi: 10.1162/neco.1997.9.8.1735.
- B. Lim, S. Ö. Arık, N. Loeff, and T. Pfister, “Temporal Fusion Transformers for Interpretable Multi-Horizon Time Series Forecasting,” International Journal of Forecasting, vol. 37, no. 4, pp. 1748–1764, 2021, doi: 10.1016/j.ijforecast.2021.03.012.
- B. Cai, Y. Xiang, L. Gao, H. Zhang, Y. Li, and J. Li, “Temporal Knowledge Graph Completion: A Survey,” in Proceedings of the Thirty-Second International Joint Conference on Artificial Intelligence, pp. 6545–6553, 2023, doi: 10.24963/ijcai.2023/734.
- N. Reimers and I. Gurevych, “Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks,” in Proceedings of EMNLP-IJCNLP 2019, pp. 3982–3992, 2019, doi: 10.18653/v1/D19-1410.
- K. Greshake, S. Abdelnabi, S. Mishra, C. Endres, T. Holz, and M. Fritz, “Not What You’ve Signed Up For: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection,” in Proceedings of the 16th ACM Workshop on Artificial Intelligence and Security, 2023.
- C. Autio, R. Schwartz, J. Dunietz, S. Jain, M. Stanley, E. Tabassi, P. Hall, and K. Roberts, Artificial Intelligence Risk Management Framework: Generative Artificial Intelligence Profile, NIST AI 600-1. Gaithersburg, MD, USA: National Institute of Standards and Technology, 2024, doi: 10.6028/NIST.AI.600-1.
- U.S. Securities and Exchange Commission, “Insider Trading,” Investor.gov. Accessed Sep. 30, 2026.
- Federal Reserve Bank of St. Louis, “ALFRED—Archival Federal Reserve Economic Data,” Federal Reserve Economic Data. Accessed Sep. 30, 2026.
- A. Bigeard, L. Nashold, R. Krishnan, and S. Wu, “Finance Agent Benchmark: Benchmarking LLMs on Real-world Financial Research Tasks,” arXiv preprint arXiv:2508.00828, 2025.
- D. H. Bailey and M. López de Prado, “The Deflated Sharpe Ratio: Correcting for Selection Bias, Backtest Overfitting, and Non-Normality,” The Journal of Portfolio Management, vol. 40, no. 5, pp. 94–107, 2014, doi: 10.3905/jpm.2014.40.5.094.
Maurício Veloso Brant Pinheiro, PhD
Professor of Physics, Federal University of Minas Gerais (UFMG)
Founder, Author and Editor, AI-Talks.org
About Us
Editorial transparency note: This article, as with all articles published on this site, was conceived, directed, written, and reviewed by Prof. Maurício Veloso Brant Pinheiro. Artificial intelligence was used as an assistant for editorial refinement, formatting, image generation, SEO metadata, and publication workflow.

Copyright 2026 AI-Talks.org