Video- und Audioaufzeichnungen — Hochladen von Aufzeichnungen bis 2 GB, Teams-Besprechungsaufzeichnungen, der Medien-Viewer, Transkripte und Untertitel, zeitbasierte Schwärzungsmarkierungen (Box, Weichzeichnen, Verpixeln, Stummschalten, Piepton, Stimme verzerren, Zurückhalten), automatische Verfolgung, Gesichts- und Bildschirmtext-Erkennung, geschwärzte Vorschau und wie Aufzeichnungen freigegeben werden
Last updated: September 03, 2026 by Steve
Video- und Audioaufzeichnungen
Aufzeichnungen — Exporte von Bodycams und Videoüberwachung, Einsatzleit- und Notrufaudio, Interviewaufzeichnungen, Voicemail, Teams-Besprechungsaufzeichnungen — sind Dokumente wie jedes andere in einem Antrag. Sie befinden sich im selben Dokumentarbeitsbereich mit einer Facette Video oder Audio, einer Spalte Dauer und Verarbeitungs-Chips in der Zeile. Am Original wird niemals etwas verändert: Wiedergabekopien, Thumbnails, Transkripte und freigegebene Kopien sind abgeleitete Dateien, die daneben aufbewahrt werden.

Alles auf dieser Seite gilt überall dort, wo Sie eine Registerkarte Dokumente sehen — Datenschutzbewertungen, Vorfälle und Beschwerden tragen denselben Arbeitsbereich wie Anträge.
Aufzeichnungen erfassen
- Hochladen. Legen Sie die Datei auf der Registerkarte Dokumente ab oder verwenden Sie Erstellen oder hochladen. Aufzeichnungen bis zu 2 GB werden standardmäßig akzeptiert. Dateien über 100 MB werden in fortsetzbaren Blöcken hochgeladen: Das Panel Upload-Warteschlange zeigt den Fortschritt je Datei an und übersteht eine unterbrochene Verbindung (Pausieren, Fortsetzen, Abbrechen). Lassen Sie die Seite geöffnet, bis der Vorgang abgeschlossen ist.
- Teams-Besprechungsaufzeichnungen. Öffnen Sie Aus Microsoft 365 hinzufügen und wählen Sie Teams-Besprechungsaufzeichnungen, um eine Aufzeichnung einer von Ihnen organisierten Besprechung zu erfassen. Die Aufzeichnung wird über Ihren Browser in die Upload-Warteschlange heruntergeladen, und das von Teams erzeugte Transkript kommt mit, sofern eines existiert, sodass die Aufzeichnung nie ein zweites Mal transkribiert wird.


Verarbeitung
Nach dem Hochladen zeigt der Datensatz Wird verarbeitet, während eine im Browser abspielbare Kopie, ein Posterbild, Hover-Thumbnails und (bei Audio) eine Wellenform vorbereitet werden. Wenn die Transkription aktiviert ist, folgt ein Chip Wird transkribiert…. Eine Bereitstellung ohne Medienprozessor parkt den Datensatz als Benötigt Medienprozessor, bis einer verfügbar ist — dies schlägt niemals fehl —, und Wiederholen steht bei einer fehlgeschlagenen Aufbereitung in der Zeile bereit. Wenn Ihre Bereitstellung Uploads mit Microsoft Defender for Storage scannt, kann ein als bösartig markierter Datensatz nicht wiedergegeben, heruntergeladen oder freigegeben werden.
Ansehen und Anhören
Öffnen Sie die Zeile zum Medien-Viewer: native Bedienelemente, Leertaste zum Abspielen und Pausieren, Pfeiltasten sowie J / K / L zum Vor- und Zurückspulen, F für Vollbild, Wiedergabegeschwindigkeit und Hover-Scrub über der Zeitleiste. Audiodatensätze fügen eine Wellenform-Spur hinzu. Wenn Sie den Datensatz zuvor schon geöffnet haben, bietet der Viewer Fortsetzen bei hh:mm:ss an.

Transkripte und Untertitel
Wenn Azure AI Speech bereitgestellt ist, wird jede neue Aufzeichnung nach ihrer Aufbereitung transkribiert (ein Administrator kann dies unter Einstellungen → Funktionen deaktivieren). Die Schublade Transkript neben dem Player zeigt ein zeitcodiertes, sprecherbeschriftetes Transkript: Klicken Sie auf ein Segment, um zu dem Moment zu springen, in dem es gesprochen wird, verwenden Sie Im Transkript suchen, um ein Wort zu finden, und schalten Sie Untertitel im Player ein. Der Transkripttext fließt wie jeder andere Dokumenttext in die Inhaltssuche, die Duplikaterkennung, die KI-Zusammenfassungen und Ask AccessPoint ein und trägt dieselbe Sperre für Antragsteller-PII wie das Dokument — Benutzer, die keine Antragsteller-PII sehen dürfen, sehen nur Anzahlen und Zeitangaben.

Eine Aufzeichnung markieren
Die Schwärzung einer Aufzeichnung ist zeitbasiert: Jede Markierung deckt eine Zeitspanne der Zeitleiste ab, und bei Video kann sie zusätzlich eine Region des Bildes abdecken. Markierungen werden in der Ansicht Redline vorgenommen (die Tasten 1, 2 und 3 wechseln zwischen Original, Redline und Geschwärzte Vorschau).
Öffnen Sie Schwärzen ▾ in der Seitenleiste:
- Markieren… übernimmt die Zeitspanne aus Ihrer Zeitleistenauswahl oder dem Abspielkopf und lässt Sie eine Region auf dem Bild zeichnen. Keine Region bedeutet das gesamte Bild für diese Zeitspanne.
- Zeitspanne stummschalten, Stimme in Zeitspanne verzerren und Aufzeichnung zurückhalten sind die Kurzbefehle für Audio und den gesamten Datensatz.
- Gesichter und Bildschirmtext erkennen (Video) und Suchen und schwärzen (benötigt ein Transkript) sind die unten beschriebenen Erkennungswerkzeuge.

Jede Markierung besitzt einen Effekt: Box, Weichzeichnen oder Verpixeln für das Bild; Audio stummschalten, Audio piepen oder Stimme verzerren für den Ton; Gesamte Aufzeichnung zurückhalten für den gesamten Datensatz. Wie eine Seitenschwärzung trägt jede Markierung eine Ausnahme mit Alternativen, Kommentaren, Kennzeichnungen, Genehmigung und ein Anzeige-Label — die Ausnahmezitierung, benutzerdefinierten Text oder kein Label —, das auf der freigegebenen Kopie in das Bild eingezeichnet wird.


Einem sich bewegenden Subjekt folgen
Eine Regionsmarkierung kann sich mit der Person oder dem Objekt bewegen, das sie abdeckt. Wählen Sie die Markierung aus und öffnen Sie ihr Menü Verfolgung:
- Diese Markierung automatisch verfolgen folgt dem von Ihnen umrahmten Subjekt in beide Richtungen durch den Clip. Sie verlängert die Markierung meist rückwärts, da man ein Gesicht typischerweise erst umrahmt, wenn man es bemerkt, und sie stoppt, statt abzudriften, wenn sie das Subjekt verliert.
- Verfolgungspunkte durch Ziehen hinzufügen — bewegen Sie den Abspielkopf, ziehen Sie das Feld dorthin, wo sich das Subjekt jetzt befindet, und die Schwärzung wandert zwischen den Punkten. Verfolgungspunkte werden als Markierungspunkte auf der Zeitleiste angezeigt.
- Verfolgung dieser Markierung löschen entfernt die Keyframes.
![]()
Eine Stimme verzerren
Stimme verzerren ist eine andere Art der Trennung als Stummschalten und Piepen: Die Zeitspanne wird tonhöhenverschoben, sodass der Sprecher nicht mehr identifiziert werden kann, während jedes Wort hörbar bleibt. Verwenden Sie es dort, wo Stummschalten mehr entfernen würde, als die Ausnahme rechtfertigt — Aufsichtsbehörden haben genau dies angeordnet, statt einer Entfernung (zum Beispiel die Ontario-IPC-Anordnungen MO-3961 und PO-4190), und manche Gebührengesetze nennen „Verzerren" unter den gebührenpflichtigen Verdeckungsmethoden. Wählen Sie Schwärzen ▾ → Stimme in Zeitspanne verzerren, oder wählen Sie Stimme verzerren in der Effektliste eines beliebigen Markierungsdialogs. Die Zeitspanne wird auf der Zeitleiste in ihrer Ausnahmefarbe angezeigt, mit einem Chip Verzerrt in der Seitenleiste. In der Geschwärzten Vorschau kann der Browser die Tonhöhe nicht live verschieben, daher wird die Zeitspanne stummgeschaltet abgespielt, und ein Hinweis erinnert Sie daran, dass die Freigabe die Worte mit veränderter Stimme hörbar hält. Die Verzerrung wird angewendet, wenn die Freigabedatei erzeugt wird, und das Schwärzungsverzeichnis sowie das Protokoll erfassen den Effekt und die Ausnahme je Zeitspanne. Verzerren-, Stummschalten- und Piepen-Zeitspannen können auf einer Aufzeichnung kombiniert werden.
Gesichter und Bildschirmtext erkennen
Über das Menü Schwärzen durchläuft Gesichter und Bildschirmtext erkennen die Bilder des Videos und schlägt vor:
- Eine verfolgte Region je gefundenem Gesicht. Der Gesichtsdetektor läuft vollständig auf Ihrem App Service — nichts verlässt den Mandanten, und es fallen keine Kosten pro Bild an.
- Eine Region überall dort, wo die Erkennungsmuster Ihrer Organisation auf dem Bildschirm erscheinen — ein Nummernschild, ein Namensschild, eine Fallakte auf einem Monitor. Der Textdurchlauf liest Beispielbilder mit Azure AI Document Intelligence und wird pro Bild abgerechnet.
Vorschläge verwenden Ihren Standardeffekt für Regionen (Weichzeichnen, sofern Einstellungen → Darstellung von Schwärzungen nichts anderes vorgibt). Der Scan läuft im Hintergrund mit einem Live-Fortschrittshinweis; Sie können den Viewer schließen und zurückkehren, und ein Hinweis trifft ein, sobald er mit der Anzahl der Vorschläge abgeschlossen ist. Jeder Treffer ist ein gestrichelter, bernsteinfarbener Vorschlag zum Annehmen oder Verwerfen — nichts wird stillschweigend angewendet. Ein erneuter Scan bietet an, die früheren ungeprüften Vorschläge zu ersetzen, sodass sich bei erneuten Durchläufen nie Duplikate ansammeln. Jeder der beiden Detektoren kann von einem Administrator unter Einstellungen → Funktionen deaktiviert werden.


Suchen & schwärzen, Vorschlagsregeln und der KI-Schwärzungsdurchlauf funktionieren auch auf dem Transkript: Sie schlagen Stummschalten-Markierungen über der gesprochenen Zeitspanne vor, die Sie annehmen oder verwerfen können, genau wie sie Textschwärzungen bei einem Dokument vorschlagen.
Geschwärzte Vorschau
Die Ansicht Geschwärzte Vorschau spielt den Datensatz so ab, wie ihn der Antragsteller erhalten wird — weichgezeichnete, umrahmte oder verpixelte Regionen, stummgeschaltete oder gepiepte Zeitspannen und die Label-Beschriftung, eingebrannt in das Bild. Sie zeigt nur angewendete Markierungen; Vorschläge erscheinen darin nie.

Freigabeentscheidung
Die Disposition jeder Aufzeichnung — vollständig offengelegt, teilweise offengelegt oder vollständig zurückgehalten — wird aus ihren Markierungen abgeleitet: keine Markierungen bedeutet vollständig offengelegt, Zeitspannen-Markierungen bedeuten teilweise offengelegt, und eine Markierung Gesamte Aufzeichnung zurückhalten bedeutet vollständig zurückgehalten. Die Entscheidung fließt in die Inhaltsseite des Antwortpakets, das Schwärzungsverzeichnis des Antrags und die Dispositionsstatistik ein.
Eine Aufzeichnung freigeben
Ein Antwortpaket, das Aufzeichnungen enthält, wird im Hintergrund erzeugt: Die Vorabprüfung weist darauf hin, Export-Verlauf zeigt den Fortschritt an, und Sie werden benachrichtigt, sobald es fertig ist. Das Paket ist ein ZIP mit den PDFs, einem Ordner Media/ mit den gerenderten MP4- oder MP3-Dateien — Markierungen eingebrannt, mit einer Datensatzbezeichnung als Beschriftung —, einem Ordner Files/ für nativ unverändert freigegebene Dateien sowie einer MANIFEST.sha256, die den Hash jedes Eintrags auflistet: der Nachweis des Amtes darüber, was genau freigegeben wurde. Siehe Antwort & Gebühren für die Paket-Vorabprüfung und die Schätzung der Medienprüfung.

Gebühren und Stunden
Das Gebühren-Panel auf der Registerkarte „Antwort & Gebühren" zeigt eine Zeile Geschätzte Medienprüfung — die Gesamtdauer der Aufzeichnungen multipliziert mit dem Multiplikator des Mandanten, standardmäßig vier Prüferstunden je aufgezeichneter Stunde — und bietet Zeile für Medienprüfung vorschlagen an, das den Dialog „Zeile hinzufügen" vorausgefüllt mit der Basis und, sofern die Gebührenordnung Prüfzeit abrechnet, dem Betrag öffnet. Das Stundenverzeichnis trägt eine Kategorie Medienprüfung aus dem Paket Universal Baseline.
Für Administratoren
Einstellungen → Funktionen → Medienaufzeichnungen (Video & Audio) zeigt, welcher Medienprozessor aktiv ist (im Prozess auf dem App Service, ein Container Apps-Job oder keiner), den Schalter Aufzeichnungen transkribieren und die beiden Erkennungsschalter. Die Transkription benötigt die Azure AI Speech-Ressource, die Bildschirmtext-Erkennung benötigt Azure AI Document Intelligence, und die produktionsreife Verarbeitung verwendet den optionalen Job zur Medienverarbeitung — alle werden von der Bereitstellungsvorlage in Ihr eigenes Abonnement bereitgestellt. Siehe Funktionen und das Bereitstellungshandbuch.
Verwandte Seiten
- Dokumente — der Arbeitsbereich, den Aufzeichnungen mit jedem anderen Datensatz teilen, einschließlich der Label-Modi und des Download-Menüs.
- Antwort & Gebühren — die Vorabprüfung des Antwortpakets und die Schätzung der Medienprüfung.
- Darstellung von Schwärzungen — der Standardeffekt für Regionen und die Durchsetzung bei vorgeschlagenen Schwärzungen, die für Erkennungen gilt.
- Funktionen — die Schalter für Medienverarbeitung, Transkription und Erkennung.