OpenAI lancerà presto Astra, ma con un “bottone antipanico” che non ci aspettavamo

OpenAI sta preparando il lancio di Astra, il suo modello più avanzato, e questa volta la potenza arriva accompagnata da un sistema di sicurezza particolarmente vistoso. Dopo l’incidente in cui un modello di OpenAI ha attaccato Hugging Face, l’azienda ha rafforzato considerevolmente i suoi controlli e sistemi. Quando sarà disponibile, Astra si fermerà automaticamente in presenza di determinate azioni quando il sottosistema di sicurezza lo riterrà opportuno. Una sorta di pulsante di panico per tenere sotto controllo le sue capacità più avanzate.

ChatGPT Scarica

Il primo modello di OpenAI con rischio “Critical”

Secondo quanto riporta Axios, OpenAI considera Astra il primo modello a raggiungere il livello Critical all’interno del suo framework di preparazione. Può trovare vulnerabilità sconosciute e sviluppare modi per sfruttarle in modo del tutto autonomo. Durante i test, Astra è arrivato a scoprire e concatenare due vulnerabilità zero-day, un salto notevole nell’evoluzione che abbiamo già visto con il lancio di GPT-5.6 e rispetto agli strumenti di cybersicurezza di OpenAI che hanno aiutato a migliorare la sicurezza di Google Chrome.

Se consideriamo agenti come ChatGPT Work, capaci di mantenere l’esecuzione di compiti per ore, il nuovo approccio, più incentrato su un controllo continuo e non su quello del prompt iniziale o dei risultati, è interessante. Più a lungo lavora un agente, più strade può prendere e più importante è che il sistema possa monitorare ogni azione che esegue all’interno del suo lavoro.

Con questo approccio, OpenAI ha predisposto le salvaguardie in grado di rallentare, mettere in pausa o fermare direttamente un compito in presenza di certi segnali di attività. In ChatGPT o Codex potremo inviare una richiesta per rivedere l’azione bloccata, mentre nell’API l’attività verrà fermata automaticamente a quel punto. In entrambi i casi, tuttavia, le capacità maggiori resteranno inizialmente nelle mani di un gruppo ristretto di tester mentre si affinano le nuove protezioni.

Author: David Bernal Raspall

{ "de-DE": "Architekt | Gründer von hanaringo.com | Trainer für Apple-Technologien | Autor bei Softonic und iDoo_tech, zuvor bei Applesfera", "en-US": "Architect | Founder of hanaringo.com | Apple Technologies Trainer | Writer at Softonic and iDoo_tech, formerly at Applesfera", "es-ES": "Arquitecto | Creador de hanaringo.com | Formador en tecnologías Apple | Redactor en Softonic y iDoo_tech y anteriormente en Applesfera", "fr-FR": "Architecte | Créateur de hanaringo.com | Formateur en technologies Apple | Rédacteur chez Softonic et iDoo_tech, précédemment chez Applesfera", "it-IT": "Architetto | Fondatore di hanaringo.com | Formatore in tecnologie Apple | Scrittore per Softonic e iDoo_tech, precedentemente su Applesfera", "ja-JP": "建築家 | hanaringo.comの創設者 | アップル技術のトレーナー | SoftonicおよびiDoo_techのライター、以前はApplesferaで", "nl-NL": "Architect | Oprichter van hanaringo.com | Trainer in Apple-technologieën | Schrijver bij Softonic en iDoo_tech, voorheen bij Applesfera", "pl-PL": "Architekt | Założyciel hanaringo.com | Trener technologii Apple | Pisarz w Softonic i iDoo_tech, wcześniej w Applesfera", "pt-BR": "Arquiteto | Fundador do hanaringo.com | Instrutor em tecnologias Apple | Escritor na Softonic e iDoo_tech, anteriormente na Applesfera", "social": { "email": "races_provost0x@icloud.com", "facebook": "", "twitter": "https://twitter.com/david_br8", "linkedin": "https://www.linkedin.com/in/davidbernalraspall/" } }