Nowiny

OpenAI wkrótce wypuści Astrę, ale z „przyciskiem paniki”, którego się nie spodziewaliśmy

To pierwszy model OpenAI z oceną Critical za autonomiczne wykorzystywanie luk

OpenAI wkrótce wypuści Astrę, ale z „przyciskiem paniki”, którego się nie spodziewaliśmy

David Bernal Raspall

  • 2 września 2026
  • Zaktualizowany: 2 września 2026 09:51
OpenAI wkrótce wypuści Astrę, ale z „przyciskiem paniki”, którego się nie spodziewaliśmy

OpenAI przygotowuje premierę Astry, swojego najbardziej zaawansowanego modelu, i tym razem mocy towarzyszy szczególnie rzucający się w oczy system bezpieczeństwa. Po incydencie, w którym model OpenAI zaatakował Hugging Face, firma znacząco wzmocniła mechanizmy kontroli i zabezpieczenia. Kiedy trafi do użytku publicznego, Astra będzie automatycznie przerywać określone działania, gdy podsystem bezpieczeństwa uzna to za stosowne. Coś w rodzaju przycisku paniki, by utrzymać pod kontrolą jej najbardziej zaawansowane możliwości.

Pierwszy model OpenAI z ryzykiem „Critical”

Jak podaje Axios, OpenAI uważa, że Astra jest pierwszym modelem, który osiąga poziom Critical w swoim systemie oceny gotowości. Potrafi znajdować nieznane podatności i opracowywać sposoby ich wykorzystywania w pełni autonomicznie. Podczas testów Astra zdołała wykryć i połączyć dwie podatności zero-day, co stanowi bardzo znaczący skok w ewolucji, którą widzieliśmy już przy premierze GPT-5.6, a także względem narzędzi cyberbezpieczeństwa OpenAI, które pomogły poprawić bezpieczeństwo Google Chrome.

Jeśli weźmiemy pod uwagę agentów takich jak ChatGPT Work, zdolnych wykonywać zadania przez wiele godzin, nowe podejście, bardziej skoncentrowane na trwałej kontroli, a nie na kontroli początkowego promptu czy wyników, jest interesujące. Im dłużej pracuje agent, tym więcej dróg może obrać i tym ważniejsze jest, by system mógł nadzorować każdy jego krok w ramach swojej pracy.

Przy takim podejściu OpenAI przygotowało zabezpieczenia zdolne spowalniać, wstrzymywać lub bezpośrednio zatrzymywać zadanie po wykryciu określonych sygnałów aktywności. W ChatGPT lub Codexie będziemy mogli poprosić o sprawdzenie wstrzymanego działania, podczas gdy w API zadanie zostanie automatycznie wstrzymane na tym etapie. W obu przypadkach jednak największe możliwości pozostaną początkowo w rękach ograniczonej grupy testerów, podczas gdy nowe zabezpieczenia będą dopracowywane.

Najnowsze artykuły

Ładowanie następnego artykułu

Zalogowano do Softonic jako