anzeigen
OPMI sagt gerade ganz offiziell, unsere neuen Modelle schlagen das teuerste Modell von Antropic zu einem 16el der Kosten. Genau solche Sätze schauen wir uns [musik] heute mal in Ruhe an. Mein Name ist Luca. Ich bin Mitgründer von Rewired. Wir bauen AI Systeme für E-Commerce und Mittelstand, also eigene Software und Automatisierung, die im Tagesgeschäft [musik] mitlaufen, unter anderem auch für die Snocks Group und Johannes hat mir heute seinen Kanal überlassen. Einmal vorweg, damit wir uns richtig verstehen, ich arbeite selber am liebsten mit Cloud. Das wissen wahrscheinlich auch viele, die jetzt die letzten Videos verfolgt haben, aber OP May hat diese Woche bzw. Letzte auch ordentlich abgeliefert und die Ansagen sind so groß, dass man da einfach mal drauf schauen muss, egal mit welchem Tool du arbeitest. Wir machen heute drei Sachen. Erst schauen wir uns kurz an, was GPT 5,6 ist und was sich in der App selbst geändert hat. Dann gehen wir durch die verschiedenen Benchmarks durch, mit denen Open AI gerade wirbt und dann zeige ich dir, wie du solche Charts liest, ohne auf Marketing reinzufallen. Das ist nämlich eine Fähigkeit, die du wirklich bei jedem Modell Lounge immer wieder brauchst. Also am 9. Juli hat Opi die neue Generation gedroppt. GPT 5,6 und das ist nicht ein Modell, sondern drei Stufen. Soll ist das Flagschiff, da gibt's oben drauf noch SOL Pro, das ist die Ausbaustufe für richtig lange und schwere Aufgaben. Terra ist die, ich sage jetzt mal Mittelklasse und Luna ist das kleine, schnelle und günstige Modell für die Masse z.B. Genau, wir sehen hier, so sieht das Ganze quasi dann in der App. Heißt, alle drei Stufen stehen direkt im Modellmenü zusammen mit den älteren Modellen. Und daneben gibt es einen zweiten Regler, den vielleicht viele mal übersehen. Wir sehen hier den Aufwand und da stellst du einfach ein, wie gründlich das Modell nachdenkt von kurz bis sehr hoch. Mein Standardtipp dazu, der bleibt auch bei 5,6 gleich. Standard als Ausgangspunkt und wirklich nur hochdrehen, wenn das Ergebnis nicht reicht. Die meisten Alltagsaufgaben laufen nämlich auch wunderbar ohne auf der höchsten Stufe zu sein, weil das kostet nämlich nur unnötiges Kontingent und die Modelle sind nicht das einzige was neu ist. Opi hat gleichzeitig die App selbst neu umgebaut. Heißt, wir haben Chat, Work und Codex, die laufen jetzt zusammen in einer App gebündelt. Also dein normaler Chat, dazu dann der Workbereich, dem die Agenten bzw. die Aufgaben laufen und fertige Dokumente, Tabelle oder sogar teilbare Seiten ähm erstellen, auch gerne nach Zeitplan und die Entwicklerumgebung Codex oben drauf. Heißt eine App für alles, das ist die Richtung. Genau. Ganz ehrlich, im Moment kann es vielleicht noch ein bisschen viel auf einmal sein. Dann muss ich da glaube ich ein bisschen neu orientieren. Und wer da vielleicht die alte aufgeräumte App vermisst, die gibt's weiter. Die heißt jetzt nämlich ChatGBT Classic. Aber interessant wird es jetzt bei dem, was Open May über diese Modelle selbst behauptet. Wir schauen jetzt einmal ganz kurz rein. Wenn du dir selbst die Loungeite von Openm anschaust, fällt dir sofort vielleicht etwas auf. Zeigen kaum die klassischen Schulbenchmarks, die zeigen fast nur Agentenbenchmarks, also Tests, bei denen das Modell lange, echte Arbeitsabläufe alleine durchzieht. Genau. Ich zeig dir jetzt hier die drei wichtigsten Ansagen und dabei ist ganz wichtig, das sind alles Zahlen, die Open AI selbst veröffentlicht. Genau. Kommen wir hier gleich zuerstens und hier haben wir den Agenden Benchmark namens Agents Last Exam. Das sind einfach langlaufende Aufgaben aus 55 verschiedenen Berufsweltern und hier holt Sol 53,6 Punkte. Das sind laut Open AI gut 13 Punkte mehr als Cloud Fable 5. Genau. Dann haben wir einmal zweitens und zwar der Intelligenzindex extern gerechnet. Genau. Und hier kommt Sol bis auf einen Punkt an Fable 5, aber und das ist die eigentliche Botschaft bei ungefähr der Hälfte der geschätzten Kosten und 61% weniger Zeit. Kommen wir zu drittens und da geht's um die Computernutzung bzw. Bedienung. Also, wenn das Modell selbstständig auf einen Rechner zugreift und da liegt soll laut Open AI über Opus 4.8 mit 85% weniger Output Tokens. Genau, ich habe die hier mal den richtigen Chart von Opi zum Agents Last Exam den mal genau anschaust, siehst du das eigentliche Muster OPMI Ei plottet fast alles gegen die Kosten. Genau. Und die Story ist, wir sind gleich gut oder besser und wir sind deutlich günstiger. Heißt nicht schlauer, sondern eben günstiger. Genau. Genau. Und hier einmal der größte Satz bzw. was eben Open Eye selbst über Fable 5 entgegenschreibt. Ter und Luna schlagen Cloud Fable 5 bei ungefähr ein 16 der Kosten. Da steht sogar das kleine Luna schlägt Opus 4.8. Der Hersteller selbst behauptet, sein kleinstes Modell schlägt das Flexschiff der Konkurrenz für ein Bruchteil des Preises. Vielleicht hier ein wichtiger Disclaimer. Ähm, die Zahlen, die über Opm berichtet werden, sind selbst von Opi. Heißt, jeder Anbieter misst unter seinen eigenen Bedingungen. Heißt, solche Werte sind immer ein bisschen mit Vorsicht zu genießen. Genau. Und dann gibt's noch einen Claim, der vielleicht ein bisschen untergeht, aber eigentlich der bemerkenswerteste ist. Einmal kurz zum Kontext. Entropic hat neben Fable noch Mythos 5. Das ist deren stärkstes Modell, das nicht jeder einfach bekommt, unter anderem wegen der Sicherheitsfähigkeit. Fable 5 basiert auf dem gleichen Modell, hat aber quasi Leibplanken drumherum. Jedes Mal, wenn wir mit Fable eine Anfrage starten, in der es vielleicht so um Sicherheit geht, dann blockiert Fable bzw. Claud und switcht automatisch auf Opus 4.8. Genau. Und jetzt zeigt Open Mai einen Sicherheitsbenchmark, bei dem es quasi ums finden von Schwachstellen geht und zwar Exploit Bench und da liegt soll mit 53,5% fast gleich auf mit der Preview Version von Mythos und das bei ungefähr einem Drittel der Output Tokens. Das ist ehrlicherweise mal eine Ansage, weil Mythos genau das Modell ist, we das in Tropic sagt, das ist unsere Sperspitze. Genau. Aber der Ehrlichkeit halber, wir sehen auch hier Mythos 5 Gesamt liegt hier mit, ich sag jetzt mal ungefähr 78% noch ein Stück drüber. Und jetzt kommt ein Detail, dass ich super spannend finde. Wenn man genau hinschaut, direkt daneben steht bzw. Also, wir haben hier direkt eine Tabelle mit den anderen Sicherheitstests und bei denen sind die Mythosspalten einfach leer. Die Mythoswerte stehen genau bei dem einen Benchmark drin, bei dem der Vergleich gut aussieht. Ich unterstelle da niemanden was. Es kann schlicht sein, dass sie keinen Zugriff auf das Modell vielleicht hatten für alle Tests, aber ich finde genau das zeigt, worüber wir gleich reden. Und damit sind wir eigentlich beim wichtigsten Teil des Videos. Wie liest man eigentlich solche Benchmarksiten richtig, ohne irgendwie aufs Marketing reinzufallen? Genau. Und dafür gibt's eigentlich vier Dinge und die gelten für jeden Anbieter, nicht nur für Open AI. En Tropic macht es bei so einem Launches nämlich genauso. Genau. Wir haben hier erstens bei den Kostenvergleichen steht eigentlich überall immer das gleiche Wort dabei, estimated. Äh was nichts anderes heißt wie geschätzt. Das sind keine gemessenen Rechnungen, es sind einfach nur Schätzungen. Genau. Launchzahlen sind grundsätzlich immer Bestwerte gefahren unter den Optimalbedingungen. Kommen wir zu zweitens. Ähm, die Auswahl macht da so ein bisschen die Story. Wir haben es gerade bei den leeren Mythospalten gesehen. Äh, und es geht hier weiter. Verglichen wird hier vor allem mit Cloud. Gemini taucht in den Charts genau einmal auf und die klassischen Benchmarks, die du vielleicht kennst, stehen nur gebündelt in einem externen Index, also nicht als eigene Schlagzeile. Was gezeigt wird und was nicht, ist also eigentlich immer eine bewusste Entscheidung. Genau. Dann haben wir einmal drittens und zwar die Konfiguration zählt. Bei manchen Werten steht ähm max reasoning mal steht medium und das Konkurrenzmodell läuft in seiner eigenen Einstellung. Da vergleichen sich schnell mal Äpfel mit Biern, ohne dass irgendjemand lügt. Und als letztes Modelle ändern sich nach dem Launche. Ich glaube, das ist eigentlich so das super spannendste. Das steht sinngemäß sogar in Open AI eigener Card ähm bzw. System Card, dass die Vergleichswerte von den neuesten Version der anderen Modells stammen und von deren Launchwerten immer mal abweichen können. Heißt, das Modell, dass du vielleicht in 3 Monaten dann benutzt, es zwingt bzw. es nicht zwingt das Modell aus dem Launch. Genau. Und das ist alles kein Skandal. Das ist einfach, wie diese Branche ihre Produkte vorstellt. Heißt, du musst einfach nur das im Hintergrund behalten, wenn du immer irgendwelche Anbieter Charts liest. Vielleicht einfach noch mal der Vollständigkeit halber. Ähm, erste unabhängige Tester kommen nach eigenen Tests zu einem ziemlich ähnlichen Schluss. Sinnemäß Fable ist weiter mit an der Spitze. Auf jeden Fall, aber so deutlich, wie man natürlich denken würde, ist der Abstand nicht mehr. Die Richtung der Opi Zahlen scheint also irgendwie auch zu stimmen, auch wenn man die Details nicht wörtlich nehmen sollte. Genau. Ich habe hier noch einmal grob die Preise zusammengefasst hier in der Folie. Heißt, wir haben ja die drei Modelle soll quasi das Flagshift Modell mit Input ähm Kosten bei einer Million, Tokens bei $ Output bei 30$. Terra, die Mittelklasse haben wir hier bei 250, also die Hälfte ähm im Input und im Output genauso 15$, also auch wieder die Hälfte. Und Luna ähm sehen wir auch hier eigentlich bei einer Million Tokens super günstig bei $ Input und 6$ Output. Genau. Und hier habe ich dir wichtigerweise noch mal zwei Fußnoten notiert, die im Alltag wahrscheinlich super viel Geld wert sind. Ab 272 000 Input Tokens ähm wird es teurer. Heißt lange Kontexte kosten, also extra und gecashte Eingaben ähm sind 90% günstiger, was bei wiederkehrenden Aufgaben super reinhaut. Wenn ich das gesamte Video auf einen Gedanken runterbreche, dann ist es folgender: Benchmark Charts sind Werbung mit Zahlen. Die Richtung stimmt eigentlich oft. Die Details musst du aber nicht unbedingt glauben. Was für dich zählt, findest nur du raus, wenn du das Modell an deinen eigenen Aufgaben test. Nimm also einfach mal eine echte Aufgabe aus deinem Alltag. Lass verschiedenste Modelle, ob es Cloud ist, ob es Open AI ist, ähm einfach mal durchlaufen und dann weißt du eigentlich wirklich mehr als jeder Chart. Schreib uns gerne in die Kommentare, ob du solchen Benchmark Angaben überhaupt noch traust oder ob du längst selber test. Uns würde es wirklich interessieren. Das war's von unserer Seite. Bis dann. Ciao. Ciao.