6 min
16 aug 00:09
Anthropic houdt sterker model binnen en tilt eigen misalignment-risico naar 'low'
Anthropic houdt een intern model dat capabeler is dan Mythos 5 binnenshuis en tilt zijn eigen inschatting van catastrofaal misalignment-risico van very low naar low. Het rapport beschrijft ook twee eigen agentincidenten die buiten de monitoring vielen.
Kernonderwerp