Stiller Kostentreiber

Ein Ritter in prunkvoller goldener Rüstung liegt besiegt am Boden, während ein zweiter Ritter in schlichter Stahlrüstung tapfer weiterkämpft, im Hintergrund ein bedrohlicher Drache mit ausgebreiteten Schwingen vor stürmischem Abendhimmel.
Zwei Ritter im Kampf gegen einen Drachen. KI-generiert (GPT Image 2).

Alle starren auf Modell-Benchmarks und Tokenpreise. GPT, Claude, Gemini, Kimi, Qwen, GLM, Minimax – welches Modell bietet das beste Preis-Leistungsverhältnis? Doch eine neue Studie zeigt: Die eigentliche Kostenschraube sitzt woanders. Wer dasselbe Modell in einem anderen Harness laufen lässt, zahlt bis zu neunmal mehr – bei identischer Leistung. Ein Blick auf Zahlen, die das Silicon Valley gerade nervös machen.

„Stiller Kostentreiber“ weiterlesen

Bennett’s Razor: Überlegene Schwäche

Antikes Rasiermesser im warmen Licht auf Holztisch, im Hintergrund Hunde mit unterschiedlichen Fellfarben (braun, schwarz, weiß, golden, grau) als Symbol für Bennetts Rasiermesser.
Antikes Rasiermesser mit Hunden. KI-generiert (GPT Image 2).

Es gibt mittlerweile einige Fachleute, die sagen, dass die LLM-Technologie weitgehend ausgereizt sei. Mit anderen Worten, technisch würden sich die Modelle im Top-Segment kaum noch unterscheiden – dass es trotzdem immer noch erhebliche Qualitätsunterschiede zwischen den Anbietern gibt, läge nur daran, dass die führenden Anbieter OpenAI und Anthropic über sehr viel mehr Wissen und Daten verfügen, und deshalb eine deutlich überlegene Harness verwenden können. Ich kann das nicht beurteilen. Aber dass eine gute Harness, also die Regeln, wie eine Antwort gefunden werden soll, tatsächlich sehr wichtig ist, das weiß ich aus eigener Erfahrung ganz sicher. Doch was ist eine gute Harness? Dazu habe ich heute ein sehr spannendes Forschungspapier für Sie.

„Bennett’s Razor: Überlegene Schwäche“ weiterlesen

Die Grenzen des digitalen Bienenstocks

Forscher der University of Washington (Allen School) und der University of Stanford haben die bislang größte Studie zur kreativen Vielfalt von KI-Systemen durchgeführt – und die Ergebnisse sind ernüchternd. Über 70 verschiedene große Sprachmodelle (LLMs) aller führenden Anbieter wurden mit denselben offenen Fragen konfrontiert: „Schreibe ein Gedicht über die Zeit“, „Schlage Startup-Ideen vor“, „Gib mir Lebensratschläge.“ Also solche Fragen, auf die zehn verschiedene Menschen zehn völlig unterschiedliche Antworten geben würden. Doch trotz unterschiedlicher Architekturen, Trainingsdaten und Hersteller lieferten die Modelle nahezu identische Antworten – dieselben Ideen, dieselben Strukturen, dieselben Metaphern. Die Forscher nennen dieses Phänomen den „Artificial Hivemind“ (Künstlicher Schwarmgeist).

Die Arbeit wurde mit dem Best Paper Award der NeurIPS 2025 ausgezeichnet, der höchsten Anerkennung in der KI-Forschung. Sie können die Studie hier bei uns oder bei der Cornell University herunterladen.

„Die Grenzen des digitalen Bienenstocks“ weiterlesen