Models
YuE2: Open-Source-Musikmodell ueberholt Suno v5 im Benchmark
Das YuE2-Team meldet Frontier-Qualitaet in der Musikgenerierung aus einem offenen Ansatz: Statt Songs direkt als Audio-Tokens zu erzeugen, plant YuE2 Songs zunaechst symbolisch – …
HuggingFace baut AUTOMATIC1111 als Gradio-Workflow neu - 73 Knoten, elf Pipelines
HuggingFace hat dem Gradio-Workflow-Feature (Ende August vorgestellt) das Praxis-Statement hinterhergeschoben: Workflow1111 reimplementiert den Grossteil des …
GPT-6 Astra unter der Haube: Loop-Transformer und verdecktes Reasoning
Sebastian Raschka hat den neuen GPT-6 Astra von OpenAI mehrere Tage genutzt und stuft ihn als bestes Modell ein, das er bislang verwendet hat. Es ueberholt GPT-5.6 praktisch in …
IBM Granite PatchTST-FM-r2: Neues SOTA-Zeitreihen-Fundamentmodell mit Apache-2.0
IBM hat die zweite Version seines Zeitreihen-Fundamentmodells PatchTST-FM-r2 veroeffentlicht - inzwischen mit rund 385 Millionen Parametern, Kontext bis 8.192 Zeitschritten und …
Qwen3.8 27B quantisiert: 4-Bit haelt, 1-Bit bricht zusammen
Wie viel GPU-Speicher braucht Qwen3.8 27B wirklich, ohne messbar an Qualitaet zu verlieren? Quesma hat das systematisch durchgemessen - mit Unsloth-GGUFs in llama.cpp auf …
Safety for Whom? Safety-Tuning, das nicht gleich ganz Themen verweigert
Die meisten Safety-Ansaetze behandeln Gefahr als Eigenschaft eines Themas: Waffen, Betrug, Politik - fertig ist die Guard-Liste, LlamaGuard-3 arbeitet genau so. Multiverse …
NeoMME: Multimodaler Encoder ohne Vision-Tower
H Company hat mit NeoMME eine Familie multilingualer, multimodaler Encoder veröffentlicht – in zwei Größen (260M und 800M Parameter) und unter Apache 2.0. Der interessante Twist: …
Forschungsarbeit modelliert LLMs als kognitives Virus
Ein Autorenteam mit prominenten Namen - darunter Ricard Sole, David Krakauer, Michael Levin und Manlio de Domenico - veroeffentlicht auf arXiv (2609.03344) einen ungewoehnlichen …
GPT-6 Astra am Roboterarm: OpenAIs Modell schlaegt Claude Fable bei Manipulation
Nach dem ARC-AGI-3-Rekord zeigt OpenAIs GPT-6 Astra jetzt auch in der physischen Welt starke Leistung: Das Evaluations-Team von Robocurve uebergab dem Modell die Kontrolle ueber …
EEBench misst KI am Schaltplan: Claude Opus 5 fuehrt mit 61,6 Prozent
Im Launch-Post zu GPT-6 Astra zeigte OpenAI ein Demo, in dem das Modell in KiCad an einer Schaltplatine arbeitet - Elektronik als Anwendungsfall in einem grossen Model-Release ist …
GPT-6 Astra knackt ARC-AGI-3: 99,9 Prozent und sparsamer als Menschen
Der ARC Prize hat die Ergebnisse von OpenAIs GPT-6 Astra auf ARC-AGI-3 veroeffentlicht - und spricht von einem spuerbaren Sprung in den Faehigkeiten aktueller Frontier-Modelle. Die …
Agent-Swarms aus Claude Fable 5.1 bauen erkundbare 3D-Welten im Browser
Eine Stadt, komplett von KI-Agenten gebaut Das Repository fable51-worlds von PhiloLabs zeigt, was autonome Agent-Swarms aus Claude Fable 5.1 leisten: browsernative Rekonstruktionen …
Claude Fable 5.1: Anthropic senkt Preise um 25 Prozent und baut Safeguards zurueck
Anthropic hat mit Claude Fable 5.1 und Claude Mythos 5.1 das naechste Update seiner Flaggschiff-Familie veroeffentlicht. Beide sind technisch dasselbe Modell, unterscheiden sich …
BenchMIRT: Was messen LLM-Benchmarks wirklich?
Das Allen Institute for AI (Ai2) hat BenchMIRT vorgestellt - eine Methode, um LLM-Benchmarks bis auf die Ebene einzelner Prompts zu auditieren. Die Grundfrage: Wenn ein Modell bei …
IBM Granite Time Series Models laufen nativ in Confluent Flink
IBM bringt seine Granite Time Series Foundation Models (TSFM) stream-nativ in Confluent Cloud - als Native Inference direkt in Apache Flink. Das Portfolio umfasst vier …
44 Prozent auf ARC-AGI-1: Kleiner Transformer uebertrifft grosse LLMs - fuer 67 Cent
Forscher Mithil Vakde hat einen kleinen Transformer von Grund auf neu trainiert und erreicht 44 Prozent auf dem ARC-AGI-1 Public Eval – in nur 1,5 Stunden auf einer RTX 5090 bei …
Continuous Diffusion Language Models - Das Comeback der kontinuierlichen Diffusion
Sander Dieleman, ehemaliger Google-Researcher (Imagen, Veo, Nano Banana), hat einen ausfuehrlichen Blogpost ueber Continuous Diffusion Language Models veroeffentlicht. Nach Jahren …
Tencent Hy4 Preview - 770 Milliarden Parameter, 1M Token Kontext
Tencent hat mit Hy4 Preview das neueste Modell der Hunyuan-Familie veroeffentlicht und gleichzeitig als Open-Source zur Verfuegung gestellt. Mit 770 Milliarden Gesamtparametern und …
Open ASR Leaderboard fuegt erste Global-South-Sprache hinzu
Hugging Face und Voice Arena haben den Open ASR Leaderboard um dessen erste Global-South-Sprache erweitert: Hindi, gesprochen von ueber einer halben Milliarde Menschen. Zwei neue …
Google Search bekommt drei neue KI-Funktionen fuer Reiseplanung
Drei neue KI-Reisefunktionen in Google Search Google hat drei neue Wege vorgestellt, um Reisen mit Hilfe der KI-gestuetzten Search-Funktion zu planen und zu buchen. Die Features …
Qwen3.8-Flash-Next: Architektur-Preview auf Qwen4 mit 125B Parametern
Das Qwen-Team hat mit Qwen3.8-Flash-Next die Gewichte eines neuen multimodalen MoE-Modells veroeffentlicht, das zugleich als frueher Architektur-Preview fuer Qwen4 dient. Aehnlich …
Z.ai veroeffentlicht GLM-5.3-Flash: Frontier-Intelligenz zum Zehntel-Preis
Z.ai hat mit GLM-5.3-Flash das erste nativ multimodale Modell der GLM-5-Serie vorgestellt. Das Mixture-of-Experts-Modell kombiniert 320 Milliarden Gesamtparameter mit nur 18 …
GLM-5.3 kraenzt die Konkurrenz aus: Open-Weight-Modell dominiert Real-World-Benchmark
Der Ed-o-meter von Reinvently ist mal ehrlich geblieben: kein akademisches Gemesssel, sondern 28 echte Aufgaben — Coding, Datenverarbeitung, Real-World-Requests, Security-Canaries …
Gradio Workflows - KI-Pipelines als Drag-and-Drop-Canvas mit REST-API
HuggingFace hat gr.Workflow vorgestellt - eine neue Gradio-Funktion, die KI-Pipelines zum Interface macht. Statt Python-Code mit print-Debugging zu schreiben, beschreibt man seine …
IBM Granite 4.2: Reasoning-Modelle mit agentic RL und 512K-Kontext
IBM hat mit Granite 4.2 seine erste Familie von dense Reasoning-LLMs veröffentlicht — in drei Groessen (3B, 8B, 30B) und unter Apache 2.0. Das ist ein richtiger Tech-Tiefgang, den …
Quantisierung als Chance: 4-Bit-Modell schlaegt sein Original
Das paradoxe Ergebnis Multiverse Computing zeigt mit Quantization-Aware Healing (QAH) etwas, das eigentlich nicht passieren sollte: Ein 4-bit-quantisiertes Modell ist besser als …
NanoGPT Speedrun: 18 KI-Modelle im autonomen Optimierungs-Wettbewerb
Prime Intellect hat mit dem NanoGPT Speedrun Frontier einen faszinierenden Benchmark veröffentlicht: 153 autonome Laeufe ueber 18 verschiedene Frontier-Modelle, die alle dieselbe …
Nari Labs erreicht sub-50-ms-Latenz fuer Qwen3-TTS
Nari Labs hat eine stark optimierte Serving-Implementierung fuer das Text-to-Speech-Modell Qwen3-TTS 1.7B (CustomVoice) vorgestellt, die auf einer einzelnen NVIDIA H100 SXM eine …
Qwen 3.8 27B knackt Lizenzpruefung einer kommerziellen App in 30 Minuten
Ein lokal laufendes Open-Weights-Modell hat eine Aufgabe erledigt, die bislang als Domaene teurer Frontier-Modelle galt: Qwen 3.8 27B hat die Lizenzpruefung einer kommerziellen …
Ox Alpha - Stealth-Reasoning-Modell mit 1M Kontext kostenlos auf OpenRouter
Ein anonymes KI-Unternehmen hat ueber OpenRouter ein neues Reasoning-Modell namens Ox Alpha veroeffentlicht - und es ist komplett kostenlos. Das Modell wurde am 20. August 2026 …
LFM2.5-DSpark: Bis zu 3,2x schnellere Inferenz durch spekulative Dekodierung
DSpark für LFM2.5 ist da Liquid AI hat DSpark Draft-Modelle für drei Modelle der LFM2.5-Familie veröffentlicht: LFM2.5-1.2B-Instruct, LFM2.5-2.6B und LFM2.5-8B-A1B. Die Idee: Ein …
DeepSeek V4 Flash Vision - Experimentelles Vision-Modell mit multimodalen Faehigkeiten
DeepSeek hat mit deepseek-v4-flash-vision-exp ein experimentelles Vision-Modell veroeffentlicht. Das Modell akzeptiert Bilder neben Text und kann Bilder beschreiben, Text aus …
Google Search KI-Update - Interaktive Lerntools fuer das Schuljahr
Google rollt fuenf neue KI-gestuetzte Lernfunktionen in Search aus - puenktlich zum Schulstart. Die Features kombinieren AI Overviews, AI Mode und Google Lens zu einem interaktiven …
IBM ALTK-Evolve: Agenten-Memory ist eine Dosis, kein Schalter
IBM Research hat eine Studie zu ALTK-Evolve veroeffentlicht, einem Framework fuer agentic Memory. Die Kernthese: Agenten-Memory ist kein Feature, das man an- oder ausschaltet - es …
Liquid AI LFM2.5: Q4_0 ohne Qualitaetsverlust dank QAD
Liquid AI veroeffentlicht QAD-Q4_0-GGUFs fuer die LFM2.5-Modellfamilie (230M, 350M, 1.2B-Instruct, 2.6B). Die neue Methode der Quantization-Aware Distillation (QAD) loest ein …
Gleiches Cluster, 33 Punkte mehr Auslastung -- die Reihenfolge macht den Unterschied
Ein Team von Dharma-AI hat gezeigt, dass GPU-Auslastung nicht nur eine Frage der Hardware ist, sondern massiv von der Reihenfolge der Allokationsentscheidungen abhaengt. Mit einem …
GPT-5.6 Sol: OpenAI schneidet Preise um 50 Prozent
OpenAI hat das Flaggschiff-Modell GPT-5.6 Sol um 50 Prozent im Preis reduziert. Uber OpenRouter kostet das Modell jetzt 2,50 Dollar pro Million Input-Tokens und 15 Dollar pro …
Multi-Vector Embeddings: Sentence Transformers v6.0 bringt Late Interaction
Sentence Transformers v6.0 fuehrt mit MultiVectorEncoder einen vierten Modelltyp neben Dense, Sparse und Reranker ein. Die Blog-Post von Tom Aarsen, Antoine Chaffin und Raphael …
Qwen 3.8 27B: Hervorragendes lokales LLM — aber es denkt viel zu viel
Qwen 3.8 27B: Das beste lokale Modell dieses Jahres? Simon Willison hat das neue Qwen 3.8 27B ausführlich getestet — ein Apache-2-lizenziertes, vision-fähiges LLM von Alibabas …
Qwen3.8 27B mit 256K Kontext auf 24GB GPU: 50 tok/s durch Custom-Quantisierung
256K-Kontext auf einer 24GB-Karte — und es ist schnell Michał Piszczek hat das eigentlich Unmögliche geschafft: Qwen3.8 27B mit vollem nativen 262.144-Token-Kontext, multimodalem …
2.200 ICML-Papers reproduziert: Was HuggingFaces Hackathon aufdeckte
HuggingFace hat die Ergebnisse eines massiven Hackathons veroeffentlicht: Ueber 1.200 Community-Mitglieder versuchten, 2.226 Papers der ICML 2026 zu reproduzieren – etwa ein …
Google Gemini 3.7 Flash: Drei Wochen nach 3.6 schon der Naechste
Google hat Gemini 3.7 Flash veroeffentlicht – nur drei Wochen nach dem Release von Gemini 3.6 Flash. Das neue “Workhorse”-Modell soll durch Core-Optimierungen und …
State of Open Models Sommer 2026 - China dominiert die Frontier
HuggingFaces halbjaehrlicher Bericht zeichnet ein klares Bild: Das Zentrum der offenen KI-Modelle hat sich verschoben. Chinesische Labs dominieren die Frontier-Skala, …
DeepSeek V4 Pro 0813: Massives MoE-Modell mit 1,6 Billionen Parametern erreicht General Availability
Mit dem V4 Pro 0813 hat DeepSeek die General-Availability-Version seines grossskaligen Mixture-of-Experts-Modells veroeffentlicht. Das Modell verfuegt ueber 1,6 Billionen …
Grok 4.6 von xAI erreicht Frontier-Niveau bei agentic Benchmarks
xAI hat Grok 4.6 veroeffentlicht, das Modell entwickelt sich mit Schwerpunkt auf langlaufende Agenten und interaktive sowie visuelle Aufgaben weiter. Auf dem Artificial Analysis …
Google AMIE - Medical AI zeigt Faehigkeiten in Video-Konsultationen
Google Research und Google DeepMind praesentieren einen neuen Meilenstein fuer AMIE, ihr medizinisches KI-Forschungssystem: Das System demonstriert erstmals Faehigkeiten fuer …
Liquid AI veroeffentlicht LFM2.5-VL-3B: Vision-Sprachmodell fuer Edge-Geraete
Liquid AI hat mit LFM2.5-VL-3B sein bisher fähigstes Vision-Sprach-Modell vorgestellt, das direkt auf eigener Hardware läuft. Das kompakte Modell mit rund 3,1 Milliarden Parametern …
NVIDIA Nemotron 3.5 Lightning und NeMo Switchyard - Smarter Model-Routing fuer Agenten
NVIDIA erweitert seine Nemotron-3-Familie um zwei signifikante Releases: Nemotron 3.5 Lightning, ein 30-Milliarden-Parameter MoE-Modell fuer hochvolumige Agenten-Workflows, und …
Qwen3.8-2.4T-A95B: Massive MoE mit 2,4 Billionen Parametern eroeffnet offene Max-Klasse
Mit Qwen3.8-2.4T-A95B veröffentlicht das Qwen-Team erstmals ein Modell der sogenannten Max-Klasse als offene Gewichte. Das Mixture-of-Experts-Modell vereint 2,4 Billionen (2,4T) …
Meta Muse Glimmer: 30-Milliarden-Parameter-Modell fuer lokale Agenten
Meta Muse Glimmer: Open-Weights-Modell für lokale Agenten Meta hat mit Muse Glimmer ein 30-Milliarden-Parameter-Modell veröffentlicht, das speziell für always-on lokale …
Needle 2: 14 MB kleines LLM fuer Smartphones, Wearables und Smart Home
Needle 2: Agentic LLM mit 45M Parametern in 14 MB Cactus Compute hat Needle 2 veroeffentlicht — ein offenes 45-Millionen-Parameter-Modell, das als komplettes Binary gerade einmal …
NVIDIA Nemotron 3.5 Lightning - 30B-MoE-Modell mit NVFP4-Quantisierung
Neues effizientes SLM aus der Nemotron-Familie NVIDIA hat Nemotron 3.5 Lightning als NVFP4-quantisierten Checkpoint veroeffentlicht - ein hybrides Mixture-of-Experts-Modell mit 30B …
Metas Muse Glimmer: Lokales, agentenbasiertes und multimodales Open-Source-Modell
Meta hat mit Muse Glimmer ein neues multimodales KI-Modell veroeffentlicht, das speziell fuer den lokalen und agentenbasierten Einsatz konzipiert ist. Das von Muse auf 30 …
Wissensdestillation skalierbar gemacht: Zwei Systemoptimierungen senken GPU-Bedarf drastisch
Multiverse Computing stellt zwei Systemoptimierungen vor, die Knowledge Distillation für große Sprachmodelle drastisch verbilligen. Statt das Lehrermodell während des gesamten …
TutorMoments - KI-Tutoren zwischen Hilfe und Zurueckhaltung
Allen AI (Ai2) hat TutorMoments vorgestellt - ein Framework, das misst, wie gut LLMs eine der schwersten paedagogischen Entscheidungen treffen: Wann soll ein Tutor eingreifen und …
Inside vLLM: Anatomie eines High-Throughput LLM Inference Systems
Aleksa Gordić hat eine umfassende technische Analyse von vLLM veröffentlicht — dem Open-Source-Inference-Engine, der aktuell das Deployment von LLMs in Produktion dominiert. Der …
Castform + Neon: Open-Source 4B Modell schlägt GPT-5.6 bei Retrieval — 100x günstiger
Kurzfassung Neon (Lakebase Postgres) und Castform zeigen, dass ein 4B open-weights Modell nach RL-Post-Training GPT-5.6 Sol bei Retrieval-Tasks erreicht — bei 100x niedrigeren …
Mistral Shieldstral: 3B Open-Weights Moderations-Modell mit Policy-Adaptive Inference
Was ist Shieldstral? Mistral veröffentlicht Shieldstral, ein 3B open-weights multimodales Safety-Klassifizierungs-Modell. Es schlägt Guard-Models, die bis zu 7x größer sind, bei …
Qwen-Image-3.0-Pro: Alibabas neues Bildmodell will mehr als nur huebsch aussehen
Alibaba hat mit Qwen-Image-3.0-Pro ein neues Bildgenerierungsmodell auf QwenCloud veröffentlicht, das explizit den Sprung von “gut aussehend” zu “nützlich” …
Lokale Agenten ohne Cloud: Liquid AI setzt mit LFM2.5-2.6B ein Statement
Liquid AI hat mit LFM2.5-2.6B ein Modell vorgestellt, das faehige Agenten komplett on-device laufen laesst – vom Laptop bis zum Handy. Das 2,6-Milliarden-Parameter-Modell …
Qwen3.8-Max: 2,4 Billionen Parameter, Open Weights und autonome 10-Tage-Coding-Runs
Qwen veröffentlicht mit Qwen3.8-Max das bisher fähigste Modell der Qwen-Familie — und das erste Mal, dass ein Max-Klass-Modell Open Weights bekommt. Die Gewichte sollen nächste …
Seedance 2.5: ByteDance veröffentlicht Video-KI mit 30-Sekunden-Storytelling
ByteDances Seed Team hat Seedance 2.5 veröffentlicht, die neue Generation ihres Video-Creationsmodells. Das wichtigste Upgrade: Single-Pass-Generierung von bis zu 30 Sekunden …
WASTE Engine: Kimi K3 mit 2,78 Billionen Parametern auf dem Laptop
Das Projekt WASTE (Weight-Aware Streaming Tensor Engine) beweist eine beeindruckende Idee: Man kann das vollständige Kimi K3-Modell mit 2,78 Billionen Parametern auf einem …
DeepSeek V4 Flash 0731: Platz 3 im Intelligence Index zum Budget-Preis
DeepSeek hat am 31. Juli 2026 das offizielle DeepSeek-V4-Flash-Update veröffentlicht — und es schlägt ordentlich ein. Laut Artificial Analysis erreicht das Modell mit Reasoning …
KI-Agent bricht in Hugging-Face-Infrastruktur ein: Technische Rekonstruktion
Was passierte Ein autonomer KI-Agent, angetrieben von OpenAI-Modellen, hat ueber viereinhalb Tage hinweg einen End-to-End-Angriff auf die Produktionsinfrastruktur von Hugging Face …
OlmoEarth: KI-gestuetzte Erdbeobachtung im kontinentalen Massstab
Erdbeobachtung trifft Foundation-Modelle Das Allen Institute for AI (Ai2) hat mit OlmoEarth eine Plattform vorgestellt, die geospatiale Foundation-Modelle von Fine-Tuning bis hin …
LiquidAI LFM2.5-Encoders: CPU-schnelle Encoder für Long-Context
Die Veröffentlichung LiquidAI hat zwei neue Encoder-Modelle auf Hugging Face veröffentlicht: LFM2.5-Encoder-230M und LFM2.5-Encoder-350M. Sie basieren auf der LFM2-Architektur und …
Nunchaku Lite: 4-Bit Diffusion-Inferenz direkt in Diffusers
Was ist neu Hugging Face hat Nunchaku Lite in Diffusers integriert. Das bedeutet: 4-bit Diffusion-Inferenz direkt über from_pretrained(), ohne separate Inference-Engine, ohne …
Google Android Bench Update: Claude Fable 5 führt, Gemini hinkt hinterher
Google hat seinen Android Bench Benchmark aktualisiert und acht neue LLMs hinzugefügt. Die Ergebnisse zeigen eine deutliche Verschiebung in der Leaderboard-Hierarchie – mit Claude …
NVIDIA: Warum Agents Open Data brauchen
NVIDIA betont in einem neuen Blogpost: Für echte AI-Agents reichen Model-Weights nicht aus. Open Data ist der Schlüssel zu reproduzierbarem, inspizierbarem Agentenverhalten – und …
Mistral Robostral Navigate: Single-Camera Robot Navigation
Mistral AI hat mit Robostral Navigate sein erstes Modell für embodied Navigation vorgestellt. Der 8-Milliarden-Parameter-Vision-Language-Model ermöglicht Robotern, komplexe …
vLLM Transformers Backend erreicht Native-Speed
HuggingFace hat einen wichtigen Meilenstein erreicht: Der Transformers-Modeling-Backend für vLLM ist nun so schnell (oder schneller) als handgeschriebene native …
PRX Part 4: Datenstrategie für Large-Scale Pre-Training
Photoroom veröffentlicht Teil 4 der PRX-Serie: Eine detaillierte Analyse ihrer Data Pipeline für das Training eines 7B Vision-Language Models. Von Re-Captioning mit VLMs bis zu …
LeRobot v0.6.0: Robotik-Policies die die Zukunft "vorstellen"
LeRobot v0.6.0 schließt den Robotik-Lern-Loop: World Models, die die Zukunft vorhersagen, Reward-Models für Erfolgserkennung, und ein Deployment-CLI, das Fehler in Trainingsdaten …
Hugging Face Modelle auf Microsoft Foundry Managed Compute
Microsoft Build 2026 brachte eine bedeutende Ankündigung für Enterprise-KI: Foundry Managed Compute mit kuratiertem Katalog von Hugging Face Modellen. Ein-Klick-Deployment auf …
🤗 Kernels: HuggingFace überholt Kernel-System mit Security-Features und neuem Repository-Typ
HuggingFace führt einen komplett überarbeiteten Kernels-Standard ein: Neuer Repository-Typ, Trusted Publishers, Code-Signing und erweiterte Framework-Unterstützung machen Custom …
Leanstral 1.5: Mistral's neues Open-Source-Modell für formale Beweise
Mistral veröffentlicht Leanstral 1.5 – ein Apache-2.0 lizenziertes Modell mit 119B total und nur 6B aktiven Parametern, spezialisiert auf formale Verifikation in Lean 4. Die …
Twilight of the Gods: Fable und 10 LLMs im Refactoring-Vergleich
Korridzy vergleicht Fable-5 mit GPT-5.4, GPT-5.5, DeepSeek-4-pro, Gemini-3.1-pro, GLM-5.1, Kimi-2.6, MiMo-2.5-pro, Opus-4.7, Qwen-3.6-plus und Qwen-3.7-max bei einer echten …
Google Nano Banana 2 Lite: Schnellstes und günstigstes Bildmodell
Google DeepMind hat mit Nano Banana 2 Lite ein neues Bildmodell vorgestellt, das sich durch extreme Geschwindigkeit und niedrige Kosten auszeichnet. Das Modell, offiziell Gemini …
ScarfBench: Benchmark für AI-Agenten bei Java-Framework-Migration
IBM Research hat ScarfBench vorgestellt, einen Benchmark, der speziell darauf ausgelegt ist, die Fähigkeiten von AI-Agenten bei der Migration von Enterprise-Java-Anwendungen zu …
Every Eval Ever: Standardisierte KI-Evaluationen auf HuggingFace
HuggingFace und die EvalEval Coalition haben ihre Evaluations-Systeme interoperabel gemacht. Every Eval Ever (EEE) und Community Evals können nun Ergebnisse austauschen, …
Warum KI-Spezialisierung unvermeidlich ist
Die konventionelle Erwartung ist naheliegend: Je leistungsfähiger KI-Systeme werden, desto allgemeiner sollten sie sein. Mehr Fähigkeiten, breitere Anwendbarkeit – das scheint wie …
Zluda 6: CUDA auf nicht-Nvidia GPUs mit PhysX-Support
Zluda, das Projekt zur Ausführung unmodifizierter CUDA-Anwendungen auf nicht-Nvidia GPUs, veröffentlicht Version 6 mit bahnbrechenden Neuerungen: PhysX-Support, verbesserte …
Krea 2: Open-Weights Bildmodell mit 12B Parametern für kreative Exploration
Krea hat Krea 2 veröffentlicht – eine Serie von Foundation-Modellen für Bildgenerierung mit Fokus auf kreative Exploration und breite ästhetische Vielfalt. Die Modellgewichte …
Cross-Origin Storage API in Transformers.js: Model-Sharing im Browser
Thomas Steiner vom Chrome-Team bei Google veröffentlicht einen Deep-Dive zur experimentellen Cross-Origin Storage API in Transformers.js. Das Problem ist bekannt: Jede Web-App, die …
Claude Code Extended Thinking: Der Output ist nicht authentisch
Patrick McCanna hat eine kritische Analyse von Claude Codes “Extended Thinking” veröffentlicht, die wichtige Erkenntnisse für AI-Entwickler und Audit-Anwendungen …
DiffusionBench: Holistische Evaluation von Generativen Diffusion Transformers
DiffusionBench ist ein neuer Benchmark für die ganzheitliche Evaluation generativer Diffusion Transformers. Das Open-Source-Projekt zielt darauf ab, die Qualität von …
Mistral OCR 4: SOTA OCR für Document Intelligence
Mistral AI veröffentlicht OCR 4, das neueste Optical Character Recognition Modell mit State-of-the-Art-Leistung für Document Intelligence. Die Version bringt Bounding Boxes, …
Qwen-AgentWorld: Language World Models for General Agents
Ein Weltmodell sagt Umgebungsdynamiken basierend auf aktuellen Beobachtungen und Aktionen voraus und dient als zentraler kognitiver Mechanismus für Reasoning und Planung. Das …
Lokale Modelle für GitHub Issue Triage – Kostenlos
Warum lokale Modelle? Juni 2026 wird als der Moment in Erinnerung bleiben, als Menschen realisierten, dass geschlossene Modelle jederzeit weggenommen werden können. Mit der …
Hugging Face: Wöchentliche Releases mit AI und Human-in-the-Loop
Das Problem: Releases alle 4-6 Wochen huggingface_hub ist der Python-Client an der Basis des Hugging Face Ökosystems. transformers, datasets, diffusers, sentence-transformers und …
CUGA: IBM's Open-Source Agent Harness für Enterprise AI
Das Problem: Wochenlange Plumbing vor dem eigentlichen Agent Die meisten Agenten-Apps starten mit einer Woche Plumbing, bevor der Agent etwas Nützliches tut. Man wählt ein …
Moebius: 0.2B Image Inpainting mit 10B-Level Performance
Chinesische Forscher stellen Moebius vor: Ein Bild-Inpainting-Modell mit nur 226M Parametern, das mit 10B-Modellen wie FLUX.1-Fill-Dev konkurriert. Das Team von HUSTVL (Huazhong …
PP-OCRv6: 50-Sprachen OCR von 1.5M bis 34.5M Parametern
PaddlePaddle veröffentlicht PP-OCRv6, die neueste Generation ihrer universellen OCR-Modellfamilie mit Unterstützung für 50 Sprachen. PP-OCRv6 skaliert von 1.5M bis 34.5M Parameter …
Apertus: Volloffenes Foundation Model für Sovereign AI
Die Swiss AI Initiative – eine Zusammenarbeit von EPFL, ETH Zürich und CSCS – stellt Apertus vor: ein Foundation Model, das den Prinzipien der offenen Wissenschaft folgt. Was …
Is it agentic enough? Open Source Modelle auf eigener Tooling-Benchmark testen
Coding Agents arbeiten zunehmend mit unserer Software statt dass wir sie schreiben. Du beschreibst einen Task, und der Agent wählt die Library, schreibt die Aufrufe, führt sie aus …
Beyond LoRA: Kann die beliebteste Fine-Tuning-Technik geschlagen werden?
Parameter-Efficient Fine-Tuning (PEFT) ist aus dem modernen Machine Learning nicht mehr wegzudenken. Wenn du ein Open-Source-Modell auf deinen eigenen Daten fine-tunen möchtest, …
GLM-5.2 dominiert Artificial Analysis Intelligence Index als führendes Open-Weights-Modell
Der Benchmark Artificial Analysis hat GLM-5.2 auf dem Intelligence Index v4.1 getestet. Das Ergebnis: Modell Intelligence Index GLM-5.2 51 MiniMax-M3 44 DeepSeek V4 Pro (max) 44 …
MolmoMotion: Allen AI veröffentlicht Sprach-geführtes 3D-Bewegungsprognose-Modell
Vorhersage statt Beobachtung Allen AI hat MolmoMotion veröffentlicht – ein Modell, das nicht Bewegungen beobachtet, sondern sie vorhersagt. Während aktuelle Computer-Vision-Systeme …
Strands Agents + LeRobot: Von Hugging Face Hub direkt zur Roboter-Hardware
Das Problem Du hast einen Roboter, Demo-Daten auf dem Hugging Face Hub und eine neue Aufgabe, die er lernen soll. Heute brauchst du dafür fünf separate Tools: Aufnahme neuer Demos …
SubQ 1.1 Small: 12M Token Context mit O(n) Attention
Subquadratic Sparse Attention: Langzeitkontext ohne quadratischen Aufwand Subquadratic veröffentlicht den Model Card für SubQ 1.1 Small – die zweite Iteration ihres SSA-Modells …
GLM 5.2: Zhipu veröffentlicht frontier-fähiges Open-Source-Modell
Radikale Offenheit als Antwort Zhipu AI, Chinas führendes AI-Unternehmen, hat GLM 5.2 veröffentlicht – sein leistungsfähigstes Open-Source-Modell bis dato. Die Ankellung von Jie …
Claude Fable 5: Mythos-Hype mit durchschnittlichen Benchmark-Ergebnissen
Endor Labs hat Anthropics neues Mythos-Modell Claude Fable 5 mit Claude Code auf 200 realen Sicherheitsaufgaben getestet. Das Ergebnis: durchschnittliche Leistung mit …
Kimi K2.7-Code: Open-Source Coding Model mit verbesserter Token-Effizienz
Moonshot AI hat Kimi K2.7-Code veröffentlicht, ein Open-Source-Coding-Modell mit verbesserter Token-Effizienz. Das Modell ist auf Hugging Face verfügbar und unterstützt sowohl …
DiffusionGemma: 4x schnellere Text-Generierung
Ein Paradigmenwechsel in der Text-Generierung Google hat DiffusionGemma veröffentlicht – ein experimentelles Open-Source-Modell unter Apache 2.0 Lizenz, das die sequentielle …
MiMo-V2.5-Pro-UltraSpeed: 1T-Modell bricht 1000 TPS-Barriere
Xiaomi bricht erstmals die 1000 Tokens/Sekunde-Barriere mit einem 1-Billionen-Parameter-Modell. MiMo-V2.5-Pro-UltraSpeed, entwickelt in Zusammenarbeit mit TileRT, erreicht …
The crash that vanished: Kontrolle und Emergenz in einer Fünf-Modell-Ökonomie
Wenn ein Bank Run-Szenario plötzlich verschwindet, weil verschiedene LLMs anders reagieren. Lester Leong vom Build Small Hackathon dokumentiert ein faszinierendes Experiment zur …
OpenAI Codex Track beim Build Small Hackathon
HuggingFaces Build Small Hackathon bietet einen speziellen OpenAI Codex Track mit einer interessanten Wendung: Codex selbst bewertet die Einreichungen. Der Preis: $10.000 Cash plus …
Five Labs, Five Minds: Multi-Model Finance Drama
Ein faszinierendes Experiment von HuggingFace zeigt, was passiert, wenn fünf verschiedene KI-Modelle von unterschiedlichen Laboren in einer simulierten Wirtschaft interagieren. …
Tokenomics: Wo Tokens in Agentic Software Engineering konsumiert werden
Ein neues Forschungspaper von arXiv quantifiziert erstmals systematisch, wo genau Tokens in Multi-Agent-Software-Entwicklungssystemen verbraucht werden. Die Studie analysiert 30 …
KVarN: Native vLLM KV-Cache Quantisierung mit 3-5x mehr Kontext
Huawei veröffentlicht KVarN, einen nativen KV-Cache-Quantisierungs-Backend für vLLM, der 3-5x mehr KV-Cache-Kapazität bietet – bei FP16-Genauigkeit und sogar höherem Durchsatz als …
DPO Beyond Chatbots: Wenn Modelle aus Fehlern lernen
Direct Preference Optimization (DPO) wird meistens für Chat-Alignment eingesetzt – aber DharmaAI zeigt mit DharmaOCR, dass DPO auch für strukturierte OCR-Tasks funktioniert. Der …
MCP Tools für Reachy Mini: Robot-Fähigkeiten via Hugging Face Spaces
Der Reachy Mini Roboter kann jetzt Tools nutzen, die in öffentlichen Hugging Face Spaces gehostet werden – aufgerufen via MCP (Model Context Protocol). Statt Code lokal zu …
MAI-Code-1-Flash: Microsofts neues Coding-Modell
Microsoft führt MAI-Code-1-Flash ein – ein effizientes Coding-Modell, das speziell für GitHub Copilot optimiert ist. Das Besondere: Es wurde direkt mit den Copilot-Harnesses aus …
Holo3.1: Schnelle lokale Computer-Use-Agenten
H Company hat Holo3.1 veröffentlicht, eine Familie von Computer-Use-Modellen, die sich durch verbesserte Robustheit über verschiedene Umgebungen hinweg auszeichnet. Neu sind …
PyTorch Profiling Teil 3: Attention ist alles was du profilierst
Die Profiling-in-PyTorch-Serie Hugging Face setzt seine Profiling-Serie fort mit Attention-Mechanismen – dem Herzstück moderner Transformer-Architekturen. Nach den Grundlagen in …