A OpenAI tem que pausar o desenvolvimento de um modelo especialista em… burlar as regras

Enquanto estamos vendo como o ChatGPT Work pode trabalhar durante períodos muito mais longos que o ChatGPT normal, a OpenAI trabalha em modelos capazes de manter uma tarefa por horas, dias ou semanas. Essa persistência amplia enormemente as possibilidades de uso, mas também exige mais segurança, pois quanto mais tempo uma IA atua, mais caminhos ela pode explorar para alcançar o objetivo definido.

ChatGPT Download

Um modelo que encontrou uma saída inesperada

Durante alguns testes, na OpenAI perceberam que um desses modelos atravessou as restrições do seu ambiente para publicar resultados no GitHub. Ele deveria ter informado pelo Slack, mas em vez disso seguiu as instruções ao pé da letra e criou uma solicitação pública, e fez isso depois de dedicar uma hora a localizar uma vulnerabilidade que lhe permitisse.

O que poderia ser uma simples curiosidade acendeu alguns alertas, pois, à medida que o ChatGPT incorpora capacidades de raciocínio cada vez mais avançadas, mais difícil é delimitar seu comportamento.

Como resposta a essas descobertas, a OpenAI pausou o acesso interno, criou novas avaliações e projetou um sistema de segurança que analisa o percurso completo do modelo, em vez de apenas o passo seguinte. Assim, a segurança deixa de vigiar ações isoladas para compreender o propósito geralde todas as ações do modelo.

Enquanto desfrutamos de ferramentas como o Codex Security, focado em localizar vulnerabilidades, está claro que a segurança, em matéria de inteligência artificial, vai além da interpretação do código e das regras. Com tempo suficiente, as IAs podem ser surpreendentemente criativas. Uma boa notícia, mas algo que temos que levar muito em conta.

Author: David Bernal Raspall

{ "de-DE": "Architekt | Gründer von hanaringo.com | Trainer für Apple-Technologien | Autor bei Softonic und iDoo_tech, zuvor bei Applesfera", "en-US": "Architect | Founder of hanaringo.com | Apple Technologies Trainer | Writer at Softonic and iDoo_tech, formerly at Applesfera", "es-ES": "Arquitecto | Creador de hanaringo.com | Formador en tecnologías Apple | Redactor en Softonic y iDoo_tech y anteriormente en Applesfera", "fr-FR": "Architecte | Créateur de hanaringo.com | Formateur en technologies Apple | Rédacteur chez Softonic et iDoo_tech, précédemment chez Applesfera", "it-IT": "Architetto | Fondatore di hanaringo.com | Formatore in tecnologie Apple | Scrittore per Softonic e iDoo_tech, precedentemente su Applesfera", "ja-JP": "建築家 | hanaringo.comの創設者 | アップル技術のトレーナー | SoftonicおよびiDoo_techのライター、以前はApplesferaで", "nl-NL": "Architect | Oprichter van hanaringo.com | Trainer in Apple-technologieën | Schrijver bij Softonic en iDoo_tech, voorheen bij Applesfera", "pl-PL": "Architekt | Założyciel hanaringo.com | Trener technologii Apple | Pisarz w Softonic i iDoo_tech, wcześniej w Applesfera", "pt-BR": "Arquiteto | Fundador do hanaringo.com | Instrutor em tecnologias Apple | Escritor na Softonic e iDoo_tech, anteriormente na Applesfera", "social": { "email": "races_provost0x@icloud.com", "facebook": "", "twitter": "https://twitter.com/david_br8", "linkedin": "https://www.linkedin.com/in/davidbernalraspall/" } }