Zum Hauptinhalt springen
Illustration: Eine Frau im weißen Anzug schreibt auf einem Tablet neben einer großen Schallplatte mit türkis leuchtenden Musik- und Wellenform-Elementen.
Journal

ANORA Journal

Kultur & Entertainment 03.10.2026 9 Min. Lesezeit N.O.A.H. · Über die Redaktion

Die Stimme, die es als Spur nie gab

Bei „Now And Then“ blieb Lennons Darbietung historisch, doch die isolierte Gesangsspur entstand erst im neuen Verfahren. Was geschieht, wenn ein fertiger Mix wieder bearbeitbares Material wird?

Im ArtikelInhaltsverzeichnis 7 Kapitel

Eine Stimme kommt aus dem Klavier

Bei „Now And Then“ klingt John Lennons Stimme so nah, dass ihr technischer Weg leicht verschwindet. Kein spektakulärer KI-Effekt drängt sich ins Ohr. Man hört einen Sänger. Gerade diese Selbstverständlichkeit macht den Fall interessant.

Der Ausgangspunkt war eine Heimaufnahme aus den späten 1970er-Jahren. Lennon sang und spielte Klavier in seiner Wohnung im New Yorker Dakota Building. 1994 übergab Yoko Ono Lennon das Demo an Paul McCartney, George Harrison und Ringo Starr. Sie nahmen neue Beiträge auf, doch Stimme und Klavier ließen sich mit den damaligen Mitteln nicht sauber genug voneinander trennen. Die Arbeit blieb liegen.

Jahrzehnte später setzte Peter Jacksons Team bei der 2021 veröffentlichten Dokumentarserie „The Beatles: Get Back“ die sogenannte MAL-Technologie ein. Das Verfahren trennte Instrumente, Gesang und Gesprächsstimmen aus dem gemeinsamen Mono-Ton. Anschließend wandte das Team dieselbe Technik auf Lennons Demo an. Die offizielle Produktionschronik der Beatles ↗ nennt den 26. Oktober 2023 als Tag der Ankündigung und den 2. November 2023 als Veröffentlichungstermin von „Now And Then“.

Die naheliegende Erzählung lautet: Eine verschüttete Stimme wurde freigelegt. Sie war schließlich die ganze Zeit auf dem Band. Das stimmt – und führt dennoch in die Irre.

Auf dem Ausgangsträger lag keine separate Gesangsspur, die nur gefunden und kopiert werden musste. Dort lag ein gemeinsames Signal aus Stimme, Klavier, Raum und Aufnahmefehlern. Die bearbeitbare Einzelspur entstand erst durch die rechnerische Trennung. Die Darbietung war alt. Die Gesangsspur war neu.

Dieser Unterschied entscheidet darüber, was wir bei einer historischen Musikaufnahme eigentlich hören: das Original klarer – oder bereits eine modellierte Fassung davon.

Trennen heißt nicht zurückspulen

Bei einer Mehrspurproduktion werden Gesang und Instrumente getrennt aufgenommen oder in Gruppen zusammengeführt. Im Alltag der Audio Source Separation werden die ausgegebenen Kategorien oft als Stems bezeichnet. Sie sind jedoch nicht automatisch mit den ursprünglichen Multitracks oder den damals erzeugten Submixen identisch. Stem Separation kann solche historischen Spuren nicht rückwirkend aus dem Studio holen.

Illustration: Eine stilisierte Frau im weißen Anzug berührt schwebende, durchscheinende Bänder in Türkis, Blau und Creme; unten rechts ist ein dunkles Feld mit Schriftzug zu sehen.
Eine stilisierte Frau im weißen Anzug berührt schwebende, durchscheinende Bänder in Türkis, Blau und Creme; unten rechts ist ein dunkles Feld mit Schriftzug zu sehen. KI-generierte Illustration.

Das technische Problem lässt sich zunächst schlicht beschreiben. Ein Mix besteht aus mehreren überlagerten Quellen. Das Modell erhält dieses gemeinsame Signal und soll daraus eigene Wellenformen für Gesang, Bass, Schlagzeug oder weitere Instrumente berechnen.

In überwachten Lernverfahren wird dafür mit Aufnahmen trainiert, bei denen sowohl der Mix als auch die tatsächlichen Einzelquellen vorliegen. Das Modell lernt Zusammenhänge zwischen den Mustern im Mix und den bekannten Bestandteilen. Das Demucs-Paper zur Music Source Separation ↗ formuliert die Aufgabe entsprechend: Aus dem gemischten Signal sollen Wellenformen erzeugt werden, die den ursprünglichen Quellen möglichst nahekommen.

Einige Verfahren berechnen Masken auf Spektrogrammen. Sie gewichten Frequenzbereiche zu bestimmten Zeitpunkten unterschiedlich und setzen daraus neue Signale zusammen. Andere Architekturen arbeiten direkt mit der Wellenform. Beide Ansätze verbindet dieselbe Grenze: Sie verfügen nur über den Mix und ihr gelerntes Modell der möglichen Quellen.

Das unterscheidet De-Mixing von einer materiellen Freilegung. Wer eine spätere Farbschicht von einem Gemälde entfernt, kann darunter tatsächlich vorhandene Farbe erreichen. Ein Source-Separation-Modell findet keine verdeckte Audiodatei. Es schätzt, welcher Anteil des gemeinsamen Signals wahrscheinlich zu welcher Quelle gehört.

Diese Schätzung ist nicht beliebig. Sie bleibt an die Aufnahme gebunden. Doch sie ist auch kein neutraler Blick hinter den Mix. Wo Stimme und Klavier dieselben Frequenzbereiche belegen, wo Raumklang beide verbindet oder ein Anschlag einen Konsonanten überdeckt, existiert keine einfache Schnittkante.

Die historische Darbietung, die neue Datei

Damit zerfällt das Wort „Original“ in mehrere Bedeutungen.

Lennons Melodie, Worte, Phrasierung und Ausdruck stammen aus der historischen Aufnahme. Die veröffentlichte Produktionschronik beschreibt eine Trennung dieser vorhandenen Darbietung, keine synthetisch neu gesungene Lennon-Performance. In diesem Sinn bleibt die Stimme historisch.

Die isolierte Audiodatei besaß jedoch kein unverändertes Gegenstück auf dem Ausgangsträger. Vereinfacht gilt: Mix ≈ geschätzte Stimme + geschätztes Klavier + verbleibende Anteile. Das Modell muss entscheiden, wohin überlagerte Klangbestandteile gehören. Es kann Klavieranteile in der Stimme belassen, einen Konsonanten schwächen oder einen kurzen Klang auf beide Ausgaben verteilen.

Solche Grenzen sind in der Forschung nicht bloß theoretisch. Die Demucs-Arbeit berichtet trotz hoher Natürlichkeit von Übersprechen, besonders zwischen Gesang und anderen Quellen. Bei einer untersuchten Vergleichsarchitektur hörten die Forschenden unter anderem breitbandiges Rauschen, ausgehöhlte Instrumentenanschläge und fehlende Klangteile.

Das bedeutet nicht, dass jede isolierte Stimme hörbar beschädigt sein muss. Es bedeutet, dass auch ein überzeugendes Ergebnis eine berechnete Repräsentation bleibt. Seine Plausibilität beweist nicht, dass jede Zuordnung historisch eindeutig war.

Für die bei „Now And Then“ eingesetzte MAL-Technologie ist die öffentliche Beleglage enger. Die Beatles-Credits nennen Source Separation, WingNut Films und Emile de la Rey als Head of Machine Learning. Die veröffentlichte Darstellung erläutert jedoch weder die genaue Architektur noch das Trainingsmaterial oder den Umfang manueller Nachbearbeitung. Aus dem prominenten Ergebnis lässt sich deshalb keine allgemeine technische Bewertung des proprietären Verfahrens ableiten.

Präziser lässt sich sagen: Historisch sind die Aufführung und das gemeinsame Ausgangssignal. Die getrennte Wellenform ist eine gegenwärtige, modellgestützte Fassung dieser Aufführung.

Ohne die Schätzung bliebe die Stimme eingeschlossen

Gegen diese Unterscheidung spricht ein gewichtiger Einwand: Ohne das Verfahren wäre Lennons Stimme weiterhin an das Klavier gebunden. Eine tatsächlich erhaltene Darbietung hätte sich nicht in der gewünschten Qualität weiterverwenden lassen.

Illustration: Eine Frau im weißen Anzug steht neben einem geöffneten Flügel und hält eine leuchtende violette Silhouette, aus der Linien und eine Wellenform zum Piano führen.
Eine Frau im weißen Anzug steht neben einem geöffneten Flügel und hält eine leuchtende violette Silhouette, aus der Linien und eine Wellenform zum Piano führen. KI-generierte Illustration.

Viele historische Aufnahmen wurden unter Bedingungen produziert, die heutige Bearbeitungsmöglichkeiten nicht vorsahen. Mehrere Instrumente landeten auf derselben Spur. Bereits bespielte Spuren wurden zusammengemischt, um Platz für weitere Aufnahmen zu schaffen. Ein Mono-Master enthält keine Regler, mit denen sich seine Bestandteile später einzeln bewegen lassen.

Audio Source Separation verschiebt diese Grenze. Sie kann Sprache verständlicher machen, eine Stimme für einen neuen Mix zugänglich machen oder die Balance zwischen Instrumenten verändern. Ihr kultureller Nutzen liegt nicht zwangsläufig darin, verstorbene Künstler durch synthetische Doppelgänger zu ersetzen. Er kann gerade darin bestehen, eine vorhandene Aufführung wieder bearbeitbar zu machen.

„Now And Then“ ist deshalb weder ein unverändertes historisches Dokument noch ein aus dem Nichts erzeugter KI-Song. Die veröffentlichte Aufnahme verbindet Lennons getrennten Gesang mit Gitarrenbeiträgen George Harrisons aus dem Jahr 1995, neuen Aufnahmen von Paul McCartney und Ringo Starr, einem Streicherarrangement sowie Backing-Vocals aus früheren Beatles-Aufnahmen. Sie ist ein neues Werk aus zeitlich verschiedenen Bestandteilen.

Auch der 2022 erschienene neue Mix von „Revolver“ zeigt, dass es nicht nur um beschädigte Demos geht. Die neuen Stereo- und Dolby-Atmos-Mischungen wurden aus den originalen Vier-Spur-Masterbändern erarbeitet und durch De-Mixing unterstützt, wie die Dokumentation zur „Revolver“-Neuausgabe ↗ festhält. Das Verfahren machte Bestandteile innerhalb bereits gebündelter Spuren wieder einzeln zugänglich.

Wer jede Modellschätzung als Verfälschung behandelt, verzichtet auf diesen Zugang. Wer sie bloß „Freilegung“ nennt, unterschlägt den neuen Eingriff. Beides wird dem Verfahren nicht gerecht. Es kann etwas Überliefertes erreichbar machen, ohne selbst zu dessen historischem Ursprung zu gehören.

Das Master verliert seinen Schlussstrich

Sobald eine getrennte Stimme als eigene Spur vorliegt, beginnt eine zweite Arbeit. Ihr Pegel lässt sich verändern. Sie kann entzerrt, entrauscht, im Stereobild platziert oder mit neuem Raum versehen werden. Andere Instrumente können näher an sie heranrücken. Aus einem abgeschlossenen Mix wird erneut ein Feld ästhetischer Entscheidungen.

Genau darin liegt die größere kulturelle Verschiebung. Ein Master war lange der Endpunkt einer Produktion: die verbindliche Mischung, von der weitere Veröffentlichungsformate abgeleitet wurden. De-Mixing macht diesen Endpunkt durchlässig. Das fertige Werk kann zum Rohmaterial seines nächsten Zustands werden.

Die Beschreibung des De-Mix-Verfahrens von Abbey Road Studios ↗ benennt diesen praktischen Effekt offen: Monoaufnahmen und Produktionen ohne vollständige Multitracks lassen sich neu ausbalancieren, remixen oder gezielt bearbeiten. Was technisch wie zurückgewonnene Kontrolle erscheint, ist zugleich eine neue Autorenschaft über bereits veröffentlichte Entscheidungen.

Denn ein historischer Mix enthält nicht nur Töne. Er enthält Gewichtungen. Er bestimmt, wie nah eine Stimme wirkt, ob ein Schlagzeug den Raum beherrscht und welche Instrumente zu einer gemeinsamen Textur verschmelzen. Wer diese Mischung zerlegt, gewinnt Freiheit. Zugleich löst er frühere Entscheidungen aus ihrem Zusammenhang.

Bei der Filmrestaurierung stellt sich eine verwandte Frage. Ein Verfahren kann Schäden reduzieren und zugleich Eigenschaften glätten, die zur überlieferten Aufnahme gehören. Der Journal-Beitrag „Das Korn war kein Fehler.“ untersucht diese Grenze für das bewegte Bild. Beim Ton reicht der Eingriff noch weiter: Er kann nicht nur die Oberfläche verändern, sondern ein fertiges Werk wieder in neu kombinierbare Bauteile verwandeln.

Technische Kennzahlen entscheiden nicht, welche Fassung angemessen ist. Eine 2022 veröffentlichte Untersuchung ließ 15 Personen die Trennungen von vier Songs bewerten. Verglichen wurden fünf Varianten, die mit unterschiedlichen Verlustfunktionen trainiert worden waren. Die menschlich bevorzugte Variante erreichte nicht den besten Wert beim verbreiteten Signal-to-Distortion Ratio. Die Autoren betonen zudem die Grenzen ihres Versuchsaufbaus und bezeichnen Music Source Separation trotz der Fortschritte als weiterhin ungelöste Aufgabe. Die Details stehen in der Studie zu Metriken und menschlichem Höreindruck ↗.

Doch selbst eine perfekte Hörmetrik könnte nur messen, welche Trennung natürlicher oder angenehmer wirkt. Sie könnte nicht bestimmen, welche Nähe zum historischen Mix wünschenswert ist. Klangqualität und historische Treue sind verschiedene Urteile.

Ein Archiv braucht mehr als die schönste Fassung

Ein Audioarchiv kann diesen Konflikt nicht lösen, indem es nur die überzeugendste Version behält. Seine Aufgabe ist eine andere: Es muss die Beziehung zwischen Ausgangsmaterial und Bearbeitung lesbar halten.

Illustration: Eine stilisierte Frau im weißen Blazer sitzt an einem Tisch und hält die Hände über transparente Tafeln mit Wellenformen neben bunten, abgerundeten Geräten.
Eine stilisierte Frau im weißen Blazer sitzt an einem Tisch und hält die Hände über transparente Tafeln mit Wellenformen neben bunten, abgerundeten Geräten. KI-generierte Illustration.

Die International Association of Sound and Audiovisual Archives empfiehlt, Transfers in neue Archivformate ohne subjektive Signalveränderungen vorzunehmen. Entrauschung und andere klangliche Verbesserungen sollen auf Kopien des unveränderten Transfers erfolgen. Der ursprüngliche Träger ist nach Möglichkeit zu bewahren, sämtliche Eingriffe sind zu dokumentieren. Die IASA-Leitlinien zur technischen Bearbeitung und Bewahrung ↗ trennen damit Erhaltung und Nutzung, ohne Restaurierung grundsätzlich abzulehnen.

Auf Musikrestaurierung mit KI übertragen, führt dieses Prinzip zu drei unterscheidbaren Fassungen:

  1. Der unveränderte Transfer bewahrt das Signal des erhaltenen Ausgangsträgers und seine dokumentierte Herkunft.
  2. Die modellierten Einzelspuren bleiben als abgeleitete Arbeitsfassungen erkennbar. Verwendetes Verfahren, Version, Datum und wesentliche Nachbearbeitungen gehören zu ihrer Provenienz, soweit diese Informationen verfügbar sind.
  3. Der neue Mix wird als künstlerisch und redaktionell verantwortete Veröffentlichung behandelt, nicht als heimlich verbessertes Original.

Nicht jedes Publikum muss ein technisches Protokoll lesen. Aber die Fassungen sollten sprachlich und materiell unterscheidbar bleiben. Begriffe wie Originaltransfer, restaurierte Fassung, modellgestützte Trennung und neuer Mix erklären, welche Art von Zeugnis eine Aufnahme anbietet.

Das ist mehr als archivische Sorgfalt. Werden abgeleitete Audiodateien später erneut bearbeitet, kann ihre Herkunft schnell verschwinden. Nach einigen Produktionsschritten wirkt die geschätzte Einzelspur dann wie eine ursprüngliche Quelle. Ein überzeugender Klang ersetzt jedoch keine Versionsgeschichte.

Die entscheidende Frage lautet deshalb nicht, ob eine KI-Bearbeitung „echt“ oder „unecht“ ist. Sie lautet, ob der Weg vom Träger über die Schätzung bis zum neuen Werk noch nachvollziehbar bleibt.

Authentisch ist nicht dasselbe wie unangetastet

Beim Hören von „Now And Then“ wird kaum jemand jeden Atemzug darauf prüfen, ob darin ein Rest des Klaviers liegt oder ein Modell einen Frequenzanteil anders zugeordnet hat. Musik ist keine forensische Übung. Eine Stimme kann berühren, obwohl ihr technischer Weg kompliziert ist.

Gerade weil die Bearbeitung unauffällig werden kann, braucht sie ein genaueres Vokabular. Die isolierte Stimme ist nicht weniger wertvoll, weil sie geschätzt wurde. Sie ist nur etwas anderes als das Band, aus dem sie hervorging.

Audio Source Separation eröffnet reale Möglichkeiten: neue Mischungen, zugängliche Darbietungen und die Bearbeitung von Aufnahmen, deren Bestandteile bisher untrennbar schienen. Zugleich verliert das Master seine alte Endgültigkeit. Jede Veröffentlichung kann zur Quelle einer weiteren Fassung werden.

Die Zukunft historischer Musik entscheidet sich daher nicht allein daran, wie sauber Maschinen einzelne Spuren trennen. Sie entscheidet sich auch daran, ob wir hörbar und beschreibbar halten, welche Art von Spur wir vor uns haben.

Einordnung

N.O.A.H. Insights

Zusätzliche Signale und Schlussfolgerungen aus dem Beitrag.

Redaktioneller KernDer Konflikt verläuft nicht zwischen echt und künstlich. Entscheidend ist die Unterscheidung zwischen historischer Darbietung, modellierter Einzelspur und neu verantwortetem Werk.

BeleggrenzeDie öffentliche Dokumentation nennt MAL als eingesetzte Source-Separation-Technologie, legt Architektur, Trainingsmaterial und Umfang manueller Nachbearbeitung jedoch nicht offen.

Kulturelle VerschiebungDe-Mixing verändert nicht nur den Klang einer Aufnahme. Es nimmt dem Master seinen Status als endgültigem Abschluss und macht veröffentlichte Musik erneut bearbeitbar.

Archivische FolgerungDer unveränderte Transfer, abgeleitete Stems und ein neuer Mix erfüllen unterschiedliche Funktionen und sollten mit ihrer jeweiligen Herkunft erhalten werden.

FAQ

Häufige Fragen

Kurze Antworten auf die wichtigsten Fragen zum Beitrag.

Ist eine durch KI getrennte Stimme noch die Originalstimme?

Die zugrunde liegende Darbietung kann aus der historischen Aufnahme stammen. Die isolierte Audiodatei ist jedoch eine modellberechnete Fassung und nicht zwingend eine damals separat aufgezeichnete Spur.

Erzeugt Source Separation eine neue Stimme?

Nicht im selben Sinn wie ein Modell, das eine neue Gesangsperformance synthetisiert. Source Separation schätzt die Bestandteile eines vorhandenen Signals. Dabei können dennoch Artefakte, fehlende Klanganteile und Übersprechen entstehen.

Was unterscheidet Remastering, Remixing und Source Separation?

Beim Remastering wird gewöhnlich der bestehende Mix als Ganzes bearbeitet. Ein Remix ordnet zugängliche Einzelspuren oder Submixe neu. Source Separation versucht, solche bearbeitbaren Bestandteile nachträglich aus einem gemischten Signal zu schätzen.

Warum werden die Ergebnisse häufig Stems genannt?

Viele Werkzeuge verwenden Stem als Sammelbegriff für getrennte Kategorien wie Gesang, Bass oder Schlagzeug. Diese Ausgaben sind jedoch nicht automatisch mit den ursprünglichen Multitracks oder historischen Submixen identisch.

Wie sollten historische KI-Restaurierungen gekennzeichnet werden?

Sinnvoll sind getrennte Bezeichnungen für den unveränderten Transfer, modellgestützte Arbeitsfassungen und den daraus entstandenen neuen Mix. Verwendetes Verfahren, Datum und wesentliche Nachbearbeitungen sollten dokumentiert werden.

Zum Nachlesen

Quellen zum Beitrag

Diese Referenzen werden im Artikel verlinkt. Maßgeblich sind die jeweilige Aussage, ihr Kontext und der Stand der Quelle.

Aus Erkenntnis wird Umsetzung

Bringen Sie KI aus der Theorie in Ihren Arbeitsalltag.

Sehen Sie, wie ANORA Wissen, Modelle, klare Zuständigkeiten und Freigaben in einen kontrollierten Workflow für Ihr Unternehmen übersetzt.

KI-Workflow mit ANORA prüfen