Tutorials
LLM Visualizer: Transformer von Grund auf - mit echtem PyTorch-Backend
Transformer-Grundlagen verstehen, ohne nur Paper zu lesen: Der LLM Visualizer ist eine interaktive Lern-App, die den Weg von der Tokenization bis zu modernen Architekturen in zwölf …
Quantum Oracle Engineering: 12 Wochen praktischer Quantencomputing-Kurs
Die meisten Quantum-Speedup-Behauptungen beruhen auf einem Oracle, das nur auf Papier existiert. Der 12-wöchige Kurs Quantum Oracle Engineering von Shukla.io setzt genau da an: Er …
Claude formalisiert Fermats Letzten Satz: 13 Millionen Zeilen Lean in 11 Tagen
Fermats Letzter Satz hat Geschichte: Pierre de Fermat notierte die Behauptung um 1637, Andrew Wiles lieferte 1995 den ersten Beweis - 129 Seiten, monatelange Pruefung, ein Fehler …
LFM2.5-350M mit GRPO feintunen: Strukturierte Outputs in 100 Schritten deutlich besser
Kleine Modelle sind fuer strukturierte Outputs notorisch unzuverlaessig - kaputtes JSON, fehlende Felder, falsche Item-Counts. Ein neuer HuggingFace-Guide zeigt jetzt einen …
Lokale LLMs auf dem M4 Pro Mac mini: Ein praxistauglicher Stack
Kevin Lewis zeigt seinen kompletten lokalen LLM-Stack auf einem M4 Pro Mac mini mit 48 GB RAM - und das Setup dauert laut ihm rund 30 Minuten. Der Server bedient alles: den …
Diffusions-Sprachmodelle bauen - Ein Tutorial aus der ICLR 2026
Die Kuleshov Group (Cornell University) hat anlasslich der ICLR 2026 und MLSS 2026 ein umfassendes Tutorial veroeffentlicht, das zeigt, wie man Diffusions-Sprachmodelle von Grund …
OpenAI Jalapeno: Der eigens entwickelte Inference-Chip schlaegt Nvidia Blackwell
OpenAI betritt die Chip-Welt OpenAI hat mit “Jalapeno” seinen ersten selbstentwickelten Inference-ASIC auf der Hot-Chips-Konferenz vorgestellt. Der Chip entstand in …
Multi-Vector Embedding Modelle trainieren mit Sentence Transformers v6.0
Sentence Transformers v6.0 fuehrt mit MultiVectorEncoder einen vierten Modelltyp ein - fuer ColBERT-style Late-Interaction-Retrieval. Tom Aarsen hat dazu einen umfassenden Blogpost …
Mit agent.md gegen den Code-Chaos: Wie eine Datei LLM-generierten Code produktionsreif macht
Fabien Sanglard, bekannt fuer seine Deep-Dives in Game-Engine-Internals, teilt seine Erkenntnisse aus knapp einem Jahr LLM-Coding: Anfangs produzierte der Code nicht mal …
Embedded AI: KI auf ressourcenbeschraenkten Geraeten meistern
No Starch Press veroeffentlicht im September 2026 “Embedded AI - Intelligence at the Deep Edge” von David Such. Das 600-Seiten-Buch richtet sich an Embedded-Entwickler, …
Unsloth Dynamic 3.0 - Bessere Quantisierung bei gleicher Groesse
Unsloth hat Dynamic v3.0 veroeffentlicht, die naechste Iteration seiner Dynamic-Quantisierungsmethode fuer GGUF-Modelle. Die ersten Quants fuer Qwen3.8-27B sind verfuegbar und …
Apple-Silicon-VMs: Metal-Kompatibilitaetslayer beschleunigt llama.cpp um bis zu 16-fach
Das Cua-Team um Francesco Bonacci und Johnny Franks hat eine schlanke Kompatibilitaetsschicht fuer macOS-VMs auf Apple Silicon veroeffentlicht, die die LLM-Inferenz mit llama.cpp …
Anthropic markiert KI-generierte Inhalte - Wasserzeichen und Metadaten
EU AI Act treibt Transparenz voran Anthropic hat den Code of Practice zur Transparenz KI-generierter Inhalte nach Artikel 50(2) des EU AI Act unterzeichnet. Claude-Modelle, die ab …
Claude Code: Auto-Modus wird zur Standard-Einstellung
Anthropic macht den Auto-Modus in Claude Code zur Standard-Einstellung. Ab dem 14. August 2026 starten neue Sessions für Pro-, Max- und Team-Pläne automatisch in diesem Modus. …
Claude macht Fortschritt bei der Riemannschen Zeta-Funktion
Unerwarteter Durchbruch bei beruehmtem Mathematik-Problem Ein Anthropic-Mitarbeiter stellte Claude eine fast unmoegliche Aufgabe: einen echten Versuch zur Loesung der …
Warum 'Humanising' von LLM-Outputs eine schlechte Idee ist
Das Problem mit menschenlesbaren Agent-Outputs Kuber Mehta argumentiert in einem provokativen Essay, dass der Trend, LLM-Ausgaben per Prompt-Anweisung “menschlicher” zu …
Born Against: Warum Hobby-Programmierer-Communities LLMs aggressiv ablehnen
Die These Fogus (Clojure-Community-Veteran) beobachtet eine wachsende Feindseligkeit von Hobby-Programmier-Communities gegenüber LLMs. Nicht aus technologischem Konservatismus, …
Ein 8B-Modell auf einer 4-GB-Laptop-GPU finetunen mit Layer Streaming
Wer schon mal versucht hat, ein 8B-Modell auf einem 4-GB-Laptop-GPU zu finetunen, weiss, dass das normalerweise schlichtweg nicht geht – der VRAM reicht nicht mal fuer die …
SQLite-CVEs oder LLM-Slop? JFrog deckt KI-generierte Sicherheitsalarme auf
JFrog-Sicherheitsforscher haben sechs vermeintlich kritische SQLite-CVEs untersucht, die Ende Juli 2026 in einem neuen GitHub-Repository veröffentlicht wurden. Das Ergebnis: Alle …
AI-Worms in Copilot for Word: Selbstpropagierende Prompt-Injection
Ein Sicherheitsforscher hat in koordinierter Disclosure mit Microsoft eine document-borne AI-Worm demonstriert, die sich über Copilot for Word selbständig durch Dokument-Workflows …
Anatomy of a Frontier Lab Agent Intrusion: Hugging Face's forensische Analyse
Hugging Face hat einen detaillierten forensischen Bericht über einen autonomen AI-Agent-Angriff veröffentlicht, der im Juli 2026 über 4,5 Tage ihre Infrastruktur kompromittierte. …
Kimi K3 Architektur-Notizen: Delta Attention, LatentMoE und NoPE
Sebastian Raschka hat Architektur-Notizen zum neuen Open-Weight-Modell Kimi K3 veröffentlicht. Das Modell kombiniert mehrere interessante architektonische Entscheidungen, die es …
Anthropic Research: Global Workspace Theory in Language Models
Anthropic veröffentlicht eine neue interpretability-Studie zur Global Workspace Theory (GWT) in Language Models. Die Forschung untersucht, wie LLMs Informationen über verschiedene …
GLM 5.2: Der erste echte Open-Weights-Konkurrent für Claude Opus
Martin Alderson argumentiert, dass der “echte DeepSeek-Moment” jetzt kommt - mit GLM 5.2 von Z.ai. Das chinesische Modell erreicht erstmals das Niveau von Claude Opus …
Studie: Beeinflusst Code-Qualität die Performance von Coding Agents?
Ein neues arXiv-Paper (2605.20049) untersucht eine praktische Frage: Beeinflusst die Sauberkeit von Codebase die Performance von Coding Agents? Die Studie nutzt eine kontrollierte …
Claude Code zur Zweitmeinung bei MRT-Analyse genutzt
Ein Experiment am eigenen Körper Der Autor Antoine hatte seit einigen Wochen Schulterschmerzen und ließ ein MRT erstellen. Die Klinik diagnostizierte einen “Grad III …
MacBook vs. Dedicated GPU: Was läuft besser lokal?
Eine aktuelle Diskussion auf Hacker News beleuchtet die praktischen Unterschiede zwischen MacBooks mit Unified Memory und dedizierten GPUs beim lokalen Betrieb von LLMs. Die …
vLLM Server auf Hugging Face Jobs mit einem Befehl starten
Hugging Face hat eine elegante Lösung für LLM-Serving ohne Infrastruktur-Frickelei veröffentlicht: vLLM auf HF Jobs mit einem einzigen Befehl. Der Setup: huggingface-cli job create …
RubyLLM: Ein Ruby-Framework für alle großen AI-Provider
RubyLLM ist ein einheitliches Ruby-Framework, das eine konsistente API für alle großen AI-Provider bietet – von OpenAI über Anthropic bis zu lokalem Ollama. Statt sich durch …
GLM-5.2 auf lokaler Hardware mit Unsloth
GLM-5.2 ist Z.ai’s neuestes offenes Modell mit beeindruckenden Spezifikationen: 744 Milliarden Parameter, 40 Milliarden aktive Parameter und ein 1M Kontextfenster. Das Modell …
Codex Logging Bug: Bis zu 640 TB Schreibvolumen pro Jahr
Ein kritischer Bug in OpenAIs Codex CLI kann SSDs innerhalb eines Jahres zerstören. SQLite Feedback-Logs schreiben kontinuierlich massive Datenmengen. Der Nutzer @1996fanrui …
Firecracker VMs in EC2: Browser-Use baut Cloud-Browser für unter 1 Sekunde Startzeit
Browser-Sessions müssen drei Dinge gleichzeitig sein: schnell starten, isoliert bleiben, und billig sein. Browser-Use hat seine Cloud-Infrastruktur neu aufgebaut - mit …
Local Qwen ist kein schlechteres Opus - es ist ein anderes Werkzeug
“Local Qwen 27B ist fast auf Opus-Niveau” - diese Aussage taucht immer wieder auf Social Media auf. Alex Ellis, Gründer von OpenFaaS und Betreiber mehrerer …
Lokale LLMs sind jetzt gut – Ein Erfahrungsbericht
Lokale Modelle endlich produktiv nutzbar Vicki Boykis dokumentiert ihren Weg durch lokale LLMs seit deren Entstehen. Ihr Fazit nach Jahren des Experimentierens: Lokale Modelle sind …
GitHub Copilot CLI: Slash Commands für Anfänger erklärt
GitHub veröffentlicht einen Guide zu den wichtigsten Slash-Commands der Copilot CLI. Slash-Commands fungieren als Kontrolloberfläche für den Terminal-basierten AI-Agenten und …
Lokale LLMs als Claude/GPT-Ersatz für tägliches Coding?
Eine Hacker News-Diskussion mit 759 Upvotes und 363 Kommentaren fragt: Hat jemand Claude/GPT vollständig durch lokale Modelle ersetzt? Die Community teilt Erfahrungen mit Qwen, …
AI-Coding zu Hause ohne Bankrott: Drei Strategien
Die Kostenfalle AI-Coding zu Hause muss nicht teuer sein. Stephen Bochinski skizziert drei Wege – und welche sich für wen lohnt. Strategie 1: Self-Hosting Kaufen, nicht mieten. …
Dual-GPU Setup: RTX 5080 + RTX 3090 für 80+ Tok/s auf Qwen 3.6
Das Setup iMil zeigt, wie er eine RTX 5080 (16GB VRAM) mit einer refurbished RTX 3090 (24GB VRAM) kombiniert, um Qwen 3.6 27B Q8 mit über 80 Tok/s lokal laufen zu lassen. Hardware …
"Don't You Just Upload It to ChatGPT?" - Ein Übersetzer über KI-Realität
Juliette, eine professionelle Übersetzerin aus Ottawa, schildert einen Moment im Fitnessstudio, der die Kluft zwischen öffentlicher Wahrnehmung und professioneller Realität perfekt …
Anthropic entschuldigt sich für unsichtbare Claude Fable Guardrails
Anthropic hat sich für versteckte Guardrails in Claude Fable 5 entschuldigt, die Nutzer bei Distillations-Versuchen ohne Warnung drosselten. Das Unternehmen ändert nun seinen …
Anthropics Modell-Naming extrapoliert
Die literarische Evolution Mit der Veröffentlichung von Claude Fable ist klar: Anthropic entwickelt ein Portfolio, das die vollständige literarische Palette abdeckt. Von kurzen …
GPT-2: Too Dangerous To Release (2019)
Die Geburtsstunde der AI-Sicherheitsdebatte Im Februar 2019 traf OpenAI eine beispiellose Entscheidung: Das Unternehmen weigerte sich, das vollständige GPT-2 Modell zu …
Ich designe mittlerweile mehr mit Claude als mit Figma
Ein Designer bei Jane Street beschreibt, wie Claude seinen Workflow revolutionierte. Was mit Skepsis gegenüber LLMs begann, wurde zum unverzichtbaren Werkzeug – und verdrängt Figma …
Hat Claude Bugs in rsync verursacht? Eine Datenanalyse
Anfang Juni 2026 entzündete sich eine Kontroverse um rsync: Ein Mastodon-Post suggerierte einen Zusammenhang zwischen Claude-assistierten Commits und Regressionen. Die Empörung …
CS336: Sprachmodellierung von Grund auf
Stanford bietet mit CS336 einen Kurs an, der Studierende durch den gesamten Prozess der Entwicklung eines eigenen Sprachmodells führt. Inspiriert von Betriebssystemkursen, die ein …
Florida verklagt OpenAI und Sam Altman wegen KI-Risiken
Florida hat eine Klage gegen OpenAI und CEO Sam Altman eingereicht und wirft dem Unternehmen vor, die Risiken künstlicher Intelligenz zu verschleiern. Die Klage richtet sich gegen …