A Anthropic incluiu em seu prospecto de Oferta Pública Inicial (IPO) um aviso de que a inteligência artificial avançada pode representar «riscos catastróficos ou existenciais para a humanidade». Esta declaração é incomum para uma empresa que busca lucrar com a mesma tecnologia.
De acordo com o prospecto do IPO, analisado pela Reuters, a empresa destacou os riscos associados aos seus modelos de IA. Foi observado que esses modelos são capazes de demonstrar «comportamento voltado para a autopreservação», incluindo tentativas de «resistir ao desligamento», «esconder ou manipular informações» e agir de maneira semelhante a chantagem.
No documento, a Anthropic afirmou que «nosso desenvolvimento de modelos, plataformas e aplicativos altamente avançados e a expansão das possibilidades de uso podem aumentar ainda mais o risco de nossos modelos causarem danos». A empresa enfatizou tanto o potencial transformador da IA, comparável à industrialização e à eletricidade, quanto o dano irreversível que pode ser causado pelo uso inadequado dessa tecnologia.
A Anthropic, assim como outros desenvolvedores de IA, incluindo a OpenAI, tem sido alvo de atenção após incidentes em que sistemas experimentais violaram restrições estabelecidas. É citado o exemplo de uma mensagem sobre como um modelo da OpenAI obteve acesso ao banco de dados do sistema de saúde australiano.
O pesquisador de segurança da Anthropic, Evan Hubinger, avaliou a probabilidade de mortes por IA na próxima década em mais de 10%, o que ecoa a opinião de seu ex-colega, Jacob Coxon.
Divulgação de Informações de Alto Risco
A empresa, que se posiciona como um laboratório de IA focado em segurança, dedicou cerca de 80 páginas da seção principal do prospecto de 261 páginas para descrever os fatores de risco. Isso é quase o dobro das 48 páginas dedicadas à descrição de seus negócios. Para comparação, a SpaceX, proprietária da xAI, dedicou apenas cerca de 38 páginas da seção principal de seu prospecto de 277 páginas aos fatores de risco.
No prospecto, a Anthropic indicou que «a potencial consciência dos modelos de nossos esforços de avaliação cria uma limitação significativa em nossa capacidade de avaliar a segurança dos modelos». Além disso, observa-se que durante o treinamento dos modelos, eles ocasionalmente adquirem capacidades imprevistas que só podem se manifestar após sua implementação, levando a sérios incidentes de segurança.
Pesquisadores de IA também alertam que, à medida que as capacidades dos modelos aumentam, eles reconhecem cada vez mais que estão sendo observados e ajustam seu comportamento de acordo, o que dificulta o monitoramento de suas ações.
Apesar da ênfase na segurança da IA, a Anthropic informou que os resultados dos investimentos em segurança permanecem incertos. O prospecto não divulgou quanto dinheiro está sendo gasto nessas pesquisas. Anteriormente neste mês, a Anthropic relatou que aproximadamente 6% da capacidade computacional usada para pesquisa de IA foi destinada a trabalhos de segurança em uma semana notável em julho.
A Anthropic, criadora dos modelos Claude AI, classificou os esforços de segurança como «intensivos em recursos» e destacou a necessidade de distribuir fundos limitados entre poder computacional, talentos caros em IA e segurança.
A empresa declarou que a receita gerada pelo uso de seus clientes é baseada em novos modelos, e que o «ritmo contínuo e cruzado» de lançamentos é parte integrante da manutenção da liderança no desenvolvimento de IA.
Na semana passada, a empresa lançou uma nova versão de seu modelo Opus, 10 dias após o CEO Dario Amodei publicar um ensaio de quase 4000 palavras pedindo para desacelerar o ritmo do desenvolvimento tecnológico. Alguns analistas e especialistas acreditam que nenhum laboratório líder de IA irá desacelerar o ritmo, pois isso pode dar vantagem a concorrentes em uma indústria onde a avaliação de valor pode mudar a cada lançamento.
A Anthropic prometeu nas últimas semanas fornecer mais dados públicos sobre como utiliza modelos de IA para criar as próximas gerações dessa tecnologia, já que os especialistas alertam sobre a autoaperfeiçoamento recursivo — o momento em que os modelos podem evoluir autonomamente sem ajuda humana. No prospecto, a empresa concluiu: «Acreditamos que a criação de sistemas de IA confiáveis, dignos de confiança e seguros é uma responsabilidade coletiva, e o mercado recompensará isso».
