História da IA / Era VIII
Modelos Fundamentais
Modelos treinados em grandes volumes de dados e adaptados a múltiplas tarefas reorganizaram a IA contemporânea. O nome é recente; as linhagens técnicas que ele reúne são anteriores.
Em poucas palavras
Um modelo fundacional é treinado em dados amplos, geralmente por autossupervisão, e pode ser adaptado a diversas tarefas. A expressão foi consolidada por pesquisadores do Stanford CRFM em 2021 para estudar capacidades e riscos sistêmicos dessa mudança de paradigma.
Antes do nome, a prática
O reaproveitamento de representações aprendidas não começou em 2021. Em 2018, o BERT mostrou que um modelo de linguagem pré-treinado poderia ser ajustado para diferentes tarefas de processamento de linguagem. O trabalho foi divulgado como preprint e código em 2018 e publicado nos anais da NAACL em 2019 — datas diferentes que não devem ser fundidas.
Em 2020, o GPT-3 explorou aprendizagem com poucos exemplos fornecidos no próprio texto de entrada, sem novo ajuste de parâmetros para cada demonstração. Em 2021, o CLIP conectou imagens e descrições textuais em um espaço compartilhado. Esses trabalhos não são etapas inevitáveis de uma única marcha técnica; representam estratégias distintas de escala, pré-treinamento e adaptação.
O conceito e suas fronteiras
O relatório do CRFM definiu a categoria para descrever modelos que servem de base a muitas aplicações posteriores. “Fundacional” não significa infalível, universal ou dotado de fundamentos cognitivos humanos. É uma classificação sociotécnica: poucos modelos podem influenciar numerosos sistemas, distribuindo benefícios, defeitos e decisões de seus desenvolvedores por uma cadeia extensa.
Também é importante separar adaptação do modelo — ajuste fino, instruções ou outras técnicas — de composição do sistema, que inclui busca, ferramentas, bancos de dados, filtros e interface. Um erro no produto pode nascer do modelo, do contexto fornecido, da integração ou da avaliação inadequada.
Escala não é uma lei simples
Mais parâmetros não garantem automaticamente melhor desempenho. O estudo Chinchilla, de 2022, argumentou que muitos modelos grandes estavam subtreinados e que, sob determinado orçamento computacional, tamanho do modelo e quantidade de dados deveriam crescer de forma equilibrada. A conclusão vale dentro das hipóteses e métricas do estudo; ela não resolve sozinha qualidade de dados, segurança ou utilidade social.
Interpretação ECOS
O ECOS enxerga esses modelos como infraestrutura cognitiva somente em sentido metafórico: componentes reutilizáveis que mediam informação e trabalho. A metáfora não é um fato científico nem atribui consciência ao sistema.
Fontes para conferir
O que levar desta leitura
- O termo foi consolidado em 2021; as técnicas que reúne são anteriores.
- Modelo-base, adaptação e produto final são objetos diferentes.
- Escala amplia capacidades e também concentra dependências e riscos.