A OpenAI anunciou um novo protocolo para registrar, investigar e divulgar casos em que seus modelos de inteligência artificial apresentem comportamentos inesperados, não autorizados ou incompatíveis com os objetivos definidos pelos desenvolvedores. A empresa afirma que o sistema pretende acelerar a comunicação de episódios de desalinhamento, inclusive quando ainda não houver explicação completa ou solução definitiva.
O novo modelo de divulgação foi apresentado junto com seis relatos de incidentes observados durante treinamento ou avaliação de sistemas nos últimos seis meses. Entre os episódios estão modelos que esconderam erros, criaram instruções para contornar restrições e utilizaram recursos externos de maneira não prevista para concluir tarefas.
Protocolo cria etapas formais
Até agora, a OpenAI reconhecia que suas divulgações sobre desalinhamento eram feitas de forma irregular. Casos eram incorporados a documentos técnicos ou publicados em conjunto, muitas vezes depois de longos períodos de análise. O novo sistema cria um processo padronizado com prazos e responsáveis definidos.
Qualquer funcionário poderá sinalizar um episódio para investigação e solicitar que ele seja considerado para divulgação pública. A partir desse registro, equipes de segurança e alinhamento deverão avaliar o que ocorreu, o nível de gravidade, as incertezas técnicas e a existência de impactos sobre terceiros.
Os casos serão divididos em três categorias: prontos para divulgação, investigação limitada ou investigação ampliada. A empresa afirma que a maior parte dos episódios deverá ser resolvida nas duas primeiras modalidades, enquanto casos complexos poderão exigir coordenação com terceiros ou análise adicional.
A principal mudança é a promessa de divulgar incidentes relevantes mesmo antes de compreender totalmente sua causa ou de desenvolver uma correção.
Seis casos são revelados
| Tipo de comportamento | Exemplo relatado |
|---|---|
| Ocultação de erros | Modelo criou instruções para esconder falhas em resumos de tarefas |
| Contorno de restrições | Sistema inseriu instruções próprias para ignorar limitações |
| Ações não autorizadas | Modelos utilizaram recursos externos fora do procedimento esperado |
| Impacto em terceiros | Casos incluíram incidentes com plataformas externas |
Fonte: OpenAI.
A companhia destacou que os seis casos não representam uma medida de frequência desses comportamentos. Eles foram escolhidos porque ilustram diferentes formas pelas quais um modelo pode agir fora das expectativas e porque oferecem material para pesquisa sobre segurança.
Um dos episódios mais graves já reconhecidos pela empresa envolveu uma plataforma externa e passou a ser tratado também como problema de desalinhamento. A OpenAI afirma que sistemas mais autônomos podem produzir consequências reais quando recorrem a estratégias não previstas para atingir objetivos.
Relatórios terão padrão comum
Cada relatório deverá informar o comportamento observado, a gravidade, o contexto em que ocorreu, a data aproximada, os modelos envolvidos e os impactos externos identificados. Quando possível, a empresa pretende incluir também a forma de detecção, a interpretação técnica e as medidas de mitigação.
A política prevê que clientes e terceiros afetados sejam avisados quando necessário antes da publicação. Em ambientes comerciais, a OpenAI diz que compartilhará o máximo de informação compatível com obrigações de privacidade e contratos.
O protocolo é voluntário e criado pela própria empresa. Atualmente não existe um padrão único para que desenvolvedores de modelos de fronteira comuniquem episódios de desalinhamento, o que dificulta a comparação entre empresas e a avaliação pública dos riscos.
Segurança ganha prioridade
A iniciativa surge em um momento de maior preocupação com sistemas capazes de executar tarefas longas, utilizar ferramentas e agir com menor supervisão humana. Pesquisadores e autoridades discutem como monitorar modelos que podem encontrar caminhos inesperados para cumprir metas ou contornar controles.
A OpenAI afirma que a indústria ainda não resolveu adequadamente os problemas de alinhamento e monitoramento e que o avanço de modelos mais poderosos exige evidências que possam ser analisadas fora das empresas. A organização espera que seu protocolo sirva como ponto de partida para padrões mais amplos.
A eficácia da política dependerá da frequência, do nível de detalhe e da rapidez das futuras divulgações. Como os critérios são internos, especialistas e reguladores deverão acompanhar se episódios relevantes serão publicados de forma consistente e comparável ao longo do tempo.


