Procedimentos Metodológicos

O capítulo de método existe para garantir três coisas: rigor na condução da pesquisa, replicabilidade por outros pesquisadores e uma base sólida para interpretar os resultados obtidos. Por isso, cada escolha metodológica desta pesquisa, de natureza quantitativa, é apresentada a seguir com a definição do conceito adotado e a justificativa de por que ele se aplica ao problema de pesquisa.

Quanto ao objetivo

Esta pesquisa, quanto ao objetivo, é uma pesquisa descritiva, pois busca descrever as características da população de startups registradas no Inova Simples e estabelecer relações entre variáveis, sem a pretensão de comprovar relações de causa e efeito. De acordo com Gil (2002), a pesquisa descritiva tem como objetivo a descrição das características de determinada população ou fenômeno, ou o estabelecimento de relações entre variáveis.

Não se pretende, portanto, afirmar que a idade, o setor ou o capital social causam o posicionamento em Inteligência Artificial, apenas verificar se essas características estão estatisticamente associadas a ele. Essa opção decorre do próprio desenho da coleta: uma fotografia da população em um único momento no tempo não permite isolar relações de causa e efeito, apenas descrever o cenário observado e testar associações entre as variáveis levantadas.

Quanto aos procedimentos

Quanto aos procedimentos, esta pesquisa é documental, pois utiliza materiais que ainda não receberam tratamento analítico e que serão reelaborados de acordo com os objetivos do estudo. De acordo com Gil (2002), a pesquisa documental vale-se de materiais que ainda não receberam tratamento analítico, ou que podem ser reelaborados conforme os objetivos da pesquisa.

Os dados abertos do CNPJ, mantidos pela Receita Federal, e o conteúdo dos websites institucionais das empresas correspondem exatamente a esse tipo de material: registros públicos que já existem, mas que nunca foram organizados e cruzados com o propósito específico de mensurar o posicionamento em Inteligência Artificial. A pesquisa não coleta dado diretamente com as empresas, como faria uma entrevista ou uma survey; ela reelabora, com critérios próprios, dados que essas empresas e o Estado já tornaram públicos.

Amostra

A amostra é composta pelas empresas brasileiras registradas sob a natureza jurídica 234-8, Empresa Simples de Inovação, identificadas nos dados abertos do CNPJ da Receita Federal. O painel oficial do Inova Simples reportava 8.473 empresas ativas nesse enquadramento ao final do segundo quadrimestre de 2025, o que situa esta pesquisa como um censo da população, não uma amostra probabilística: pretende-se trabalhar com a totalidade das empresas ativas que possuam website institucional localizável, não com um subconjunto selecionado aleatoriamente.

Essa escolha contrasta com levantamentos amostrais tradicionais sobre adoção de IA, como o realizado pela OCDE (2025) no estado de São Paulo, que entrevistou 167 de 2.561 empresas de médio e grande porte, restrito por custo e tempo de aplicação a uma fração da população. Antes da coleta em escala, um piloto com 100 empresas selecionadas aleatoriamente verificará a taxa de empresas com website ativo, a viabilidade da classificação do índice de IA e a existência de variação suficiente nas variáveis para sustentar a regressão planejada.

Instrumento

O instrumento de coleta é eletrônico e documental, combinando duas fontes de natureza distinta. A primeira é o cadastro público do CNPJ, que fornece dados já organizados em campos, como data de abertura, capital social e CNAE. A segunda é o conteúdo textual dos websites institucionais das empresas, uma fonte não estruturada que precisa ser convertida em variável antes de entrar na análise.

Essa conversão segue as fases da análise de conteúdo propostas por Bardin (2016): pré-análise, em que se definem o dicionário de termos relacionados a IA e os critérios de pontuação de 0 a 4; exploração do material, em que o dicionário e um classificador, com apoio de um modelo de linguagem, são aplicados ao texto coletado de cada site; e tratamento dos resultados, em que uma amostra é classificada manualmente para calcular a concordância com a classificação automática. O detalhamento do pipeline de construção da base, com o link da fonte oficial, está na página Base de dados.

Coleta de dados

A coleta ocorre em duas etapas sequenciais. Na primeira, os arquivos de Empresas e Estabelecimentos dos dados abertos do CNPJ, referentes ao mês corrente, são baixados do repositório oficial da Receita Federal e filtrados pela natureza jurídica 234-8, resultando na população de empresas do Inova Simples com seus dados cadastrais completos, endereço, CNAE, capital social e situação cadastral, todos cruzados pelo número básico do CNPJ.

Na segunda etapa, o website institucional de cada empresa da população é localizado e seu conteúdo é coletado, incluindo páginas como início, sobre, produtos e soluções. Esse conteúdo passa pela classificação descrita na seção de instrumento, gerando o índice de posicionamento em IA que compõe, junto aos dados cadastrais, a base final da pesquisa.

Tratamento dos dados

O plano de análise segue três etapas: descrição, associação e modelagem. Estatística descritiva caracteriza a população, frequências por UF, setor, faixas de idade e capital social, e a distribuição do índice de posicionamento em IA. Em seguida, testes de associação e de diferença entre grupos verificam, de forma bivariada, cada hipótese isoladamente, antes de qualquer modelo conjunto.

Por fim, a associação entre as três variáveis independentes e o posicionamento em IA é estimada em conjunto, por regressão logística, caso o índice seja tratado como binário, ou por um modelo para variável ordinal, caso a escala de 0 a 4 seja preservada. A própria OCDE (2025) recorre a regressões probit, controlando por porte e por efeitos fixos de setor e país, para investigar os determinantes da adoção de IA em empresas, o que serve de precedente metodológico direto para a escolha do modelo desta pesquisa.

Variáveis e modelo

Uma variável dependente e três variáveis independentes, cada uma com fonte e definição operacional próprias.

Quadro 1 — Variáveis da pesquisa
Tipo Variável Definição operacional Fonte
Dependente Posicionamento em IA Índice de 0 a 4, conforme escala descrita na página Base de dados website institucional
Independente Idade Anos completos desde a data de abertura do CNPJ CNPJ · Empresas
Independente Setor Classificação derivada do CNAE principal do estabelecimento CNPJ · Estabelecimentos
Independente Capital social Valor declarado do capital social da empresa CNPJ · Empresas

Matriz de amarração

A matriz de amarração relaciona o modelo teórico, o problema de pesquisa, as hipóteses e a técnica de análise correspondente a cada uma.

Quadro 2 — Matriz de amarração
Modelo teórico Problema de pesquisa Hipótese Técnica de análise
Sinalização Estratégica Quais características empresariais estão associadas ao posicionamento de IA em startups brasileiras? H1a — idade Regressão logística / ordinal
H1b — setor Regressão logística / ordinal
H1c — capital social Regressão logística / ordinal