FLOH
Diensten
Integraties
Cases
Producten
Gratis Tools
Over FLOH
Kennis
Gratis scan
benchmark testing
Terug naar Kennishub
Concept

Benchmark testing

Systematic evaluation of model behavior on dangerous tasks

Nieuws· 1

RoboHarm toont dat robotmodellen gevaar niet betrouwbaar weigeren
Nieuws
4 min

19 sep 16:49

RoboHarm toont dat robotmodellen gevaar niet betrouwbaar weigeren

RoboHarm zet GPT-6 Astra, Claude Fable 5.1 en MolmoAct2 aan echte robotarmen met gevaarlijke opdrachten. De modellen weigeren zelden, waardoor fysieke AI een aparte veiligheidsgrens krijgt.

Verwante concepten

Robot safety· 1
Prompt injection· 1
Token efficiency· 1
Model availability· 1
Sandbox testing· 1
Agent safety· 1
Task cost reduction· 1
Task-based pricing· 1
Benchmarking· 1
Physical AI· 1
Model evaluation· 1
Task cost efficiency· 1
FLOH

Software, AI en integraties op maat. Van eerste idee tot werkend product.

Aanbod

  • Diensten
  • Integraties
  • Cases
  • Gratis Automatiseringsscan

Producten

  • Producten
  • Threadline
  • Conexus
  • Decky
  • Gratis Tools
  • Agent Skills

FLOH

  • Over FLOH
  • Kennis
  • Gidsen
  • Verhalen
  • Redactie
  • Veelgestelde vragen
  • Contact
•

© 2026 FLOH Solutions. Alle rechten voorbehouden. · Kvk-nr: 78007984

Terug naar Kennishub