Pesquisadores desenvolveram um modelo de linguística computacional capaz de prever o sucesso de startups, definido como a ocorrência de um evento de saída (Exit), analisando apenas descrições textuais. O método dispensa o uso de variáveis financeiras, contextuais ou de capital humano, operando exclusivamente sobre as narrativas fornecidas pelos fundadores.
Análise baseada em narrativas
O estudo utilizou uma base de dados curada por investidores de risco, abrangendo 7.419 startups ao longo de 20 anos. Os autores criaram 850 variáveis, conhecidas como features, a partir do mapeamento das narrativas dessas empresas. Os experimentos testaram seis modelos de aprendizado de máquina, sendo que o LightGBM obteve o melhor desempenho, atingindo um índice F1 de 0,48. O uso isolado de descritores textuais alcançou um F1 de 0,30, validando o valor preditivo do conteúdo escrito.
Identificação de padrões de linguagem
A pesquisa aponta que a probabilidade de saída está ligada a densidades específicas de marcadores de entusiasmo no texto, como o uso de adjetivos, jargões e termos da moda. Em contrapartida, nomes de empresas ou declarações com excesso de extensão reduzem a chance de sucesso. Com base nesses achados, os autores introduziram um Hyping Score, uma métrica quantificável para auxiliar investidores em cenários de alta assimetria de informação. A notícia foi identificada em 2 fontes de 1 país.
O que ainda não foi divulgado
- Detalhes sobre a precisão do modelo em diferentes setores de mercado.
- A eficácia da ferramenta em ecossistemas fora dos Estados Unidos.
- Quais modelos de linguagem específicos foram comparados aos seis utilizados no estudo.