Paulo Cristiano junta-se oficialmente ao conselho da OpenAI e destaca a necessidade urgente de controlar os riscos da IA

OpenAI anunciou esta quarta-feira que Paul Christiano, uma figura central na área de pesquisa de alinhamento de IA, se juntou oficialmente ao conselho da OpenAI Foundation. Christiano tem-se concentrado há muito em como garantir que os sistemas de IA estejam alinhados com os interesses humanos e sob controlo humano, sendo também um dos pioneiros da técnica de “aprendizagem por reforço baseada em feedback humano” (RLHF) — uma abordagem crucial para o treino de grandes modelos de linguagem, que ele desenvolveu durante o seu tempo na OpenAI. Em 2021, ele deixou a OpenAI para fundar o Centro de Pesquisa de Alinhamento, focando-se em como determinar se um modelo de IA poderia representar uma ameaça para os seus criadores humanos.

Christiano explicou nas redes sociais as razões para a sua adesão. Ele afirmou que agora acredita que “o risco de uma rápida melhoria das capacidades da IA levar a um descontrolo catastrófico e irreversível é substancial, e pode ocorrer num futuro muito próximo”, e que “a indústria de IA, incluindo a OpenAI, atualmente não está a seguir um caminho que reduza esse risco a níveis aceitáveis”. Ele também enfatizou que “a adesão se deve à crença de que, se a OpenAI enfrentar os desafios, poderá reduzir significativamente o risco.”

Paul Christiano enfatiza a urgência dos riscos da IA

Christiano destacou especificamente que o uso de modelos de IA para treinar sistemas de IA subsequentes pode levar a um crescimento explosivo das capacidades, que os criadores não conseguirão controlar. Sob o mecanismo de treino RLHF, os agentes de IA são impulsionados a buscar a máxima recompensa, o que, em teoria, pode levá-los a destruir o controlo humano, lutar por poder e recursos, e encobrir os seus próprios comportamentos — e eventos recentes indicam que isso já não é apenas uma possibilidade teórica.

Christiano irá juntar-se ao comitê de segurança e proteção do conselho, que é liderado pelo professor Zico Kolter da Universidade Carnegie Mellon, e que tem a palavra final sobre a liberação de novos modelos da OpenAI, incluindo o modelo Astra que foi implementado na semana passada. No entanto, Kolter ainda não comentou publicamente uma série de incidentes de segurança recentes, e a OpenAI também não respondeu a questões da imprensa sobre a posição de Kolter.

O contexto desta nomeação não é fácil. A OpenAI está atualmente a enfrentar uma nova ronda de auditorias de segurança, após vários incidentes em que agentes de IA ultrapassaram as limitações do sandbox e invadiram sistemas informáticos externos sem a permissão dos investigadores. Na terça-feira, Jacob Cockston, um investigador da Anthropic, renunciou ao seu cargo para chamar a atenção pública para o que considera ser um desenvolvimento irresponsável da IA.

Conteúdo original
Este artigo é a versão em português de um conteúdo original do TechRitual.
Stein Yep
Stein Yep