Grabaciones de video y audio — carga de grabaciones de hasta 2 GB, grabaciones de reuniones de Teams, el visor multimedia, transcripciones y subtítulos, marcas de tachado basadas en el tiempo (recuadro, desenfoque, pixelado, silenciar, pitido, distorsionar voz, retener), seguimiento automático, detección de rostros y de texto en pantalla, vista previa con tachados, y cómo se divulgan las grabaciones
Last updated: September 03, 2026 by Steve
Grabaciones de video y audio
Las grabaciones — exportaciones de cámara corporal y CCTV, audio de despacho y 911, grabaciones de entrevistas, mensajes de voz, grabaciones de reuniones de Teams — son documentos como cualquier otro en una solicitud. Se ubican en el mismo espacio de trabajo de Documentos, con una faceta Video o Audio, una columna de Duración y chips de procesamiento en la fila. El original nunca se modifica: las copias de reproducción, las miniaturas, las transcripciones y las copias divulgadas son archivos derivados que se guardan junto a él.

Todo lo que aparece en esta página se aplica dondequiera que vea una pestaña Documentos: las evaluaciones de privacidad, los incidentes y las quejas comparten el mismo espacio de trabajo que las solicitudes.
Cómo incorporar las grabaciones
- Carga. Suelte el archivo en la pestaña Documentos o use Crear o cargar. De forma predeterminada se aceptan grabaciones de hasta 2 GB. Los archivos de más de 100 MB se cargan en bloques reanudables: el panel Cola de carga muestra el progreso de cada archivo y sobrevive a una conexión interrumpida (pausar, reanudar, cancelar). Mantenga la página abierta hasta que finalice.
- Grabaciones de reuniones de Teams. Abra Agregar desde Microsoft 365 y elija Grabaciones de reuniones de Teams para capturar la grabación de una reunión que usted organizó. La grabación se descarga a través de su navegador hacia la cola de carga, y la transcripción generada por Teams la acompaña cuando existe, de modo que la grabación nunca se transcribe una segunda vez.


Procesamiento
Después de la carga, el registro muestra Procesando mientras se preparan una copia reproducible en el navegador, un fotograma de póster, miniaturas al pasar el cursor y, en el caso del audio, una forma de onda. Cuando la transcripción está habilitada, le sigue un chip Transcribiendo…. Una implementación sin procesador multimedia deja el registro marcado como Requiere procesador multimedia hasta que haya uno disponible — nunca falla —, y Reintentar aparece en la fila cuando la preparación falla. Si su implementación analiza las cargas con Microsoft Defender for Storage, un registro señalado como malicioso no puede reproducirse, descargarse ni divulgarse.
Reproducción y escucha
Abra la fila para acceder al visor multimedia: controles nativos, Espacio para reproducir y pausar, las teclas de flecha y J / K / L para avanzar cuadro a cuadro y desplazarse, F para pantalla completa, velocidad de reproducción, y desplazamiento al pasar el cursor sobre la línea de tiempo. Los registros de audio añaden un carril de forma de onda. Cuando ya ha abierto el registro antes, el visor ofrece Reanudar en hh:mm:ss.

Transcripciones y subtítulos
Con Azure AI Speech implementado, toda grabación nueva se transcribe después de prepararse (un administrador puede desactivar esto en Configuración → Funciones). El panel Transcripción junto al reproductor muestra una transcripción con código de tiempo y etiquetado por interlocutor: haga clic en un segmento para saltar al momento en que se pronuncia, use Buscar en la transcripción para localizar una palabra, y active los subtítulos en el reproductor. El texto de la transcripción se incorpora a la búsqueda de contenido, la detección de duplicados, los resúmenes con IA y Pregúntele a AccessPoint como cualquier otro texto de documento, y lleva el mismo filtro de información personal del solicitante que el documento: los usuarios que no pueden ver información personal del solicitante solo ven recuentos y tiempos.

Marcado de una grabación
El tachado en una grabación está basado en el tiempo: cada marca cubre un tramo de la línea de tiempo y, en el caso del video, también puede cubrir una región de la imagen. Las marcas se realizan en la vista Redline (las teclas 1, 2 y 3 alternan entre Original, Redline y Vista previa con tachados).
Abra Tachar ▾ en el panel lateral:
- Marcar… toma el tramo a partir de su selección en la línea de tiempo o de la posición del cursor de reproducción, y le permite dibujar una región en el fotograma. La ausencia de región significa toda la imagen durante ese tramo.
- Silenciar tramo, Distorsionar voz en el tramo y Retener grabación son los atajos para el audio y para el registro completo.
- Detectar rostros y texto en pantalla (video) y Buscar y tachar (requiere una transcripción) son las herramientas de detección descritas más abajo.

Cada marca tiene un Efecto: Recuadro, Desenfoque o Pixelado para la imagen; Silenciar audio, Pitido o Distorsionar voz para el sonido; Retener toda la grabación para el registro completo. Al igual que un tachado de página, cada marca lleva una exención con alternativas, comentarios, indicadores, aprobación y una etiqueta de visualización —la cita de la exención, texto personalizado o ninguna etiqueta— que se dibuja en el fotograma de la copia divulgada.


Seguimiento de un sujeto en movimiento
Una marca de región puede moverse junto con la persona u objeto que cubre. Seleccione la marca y abra su menú Seguimiento:
- Seguir esta marca automáticamente sigue al sujeto que recuadró a lo largo del clip en ambas direcciones. Por lo general extiende la marca hacia atrás, porque se tiende a recuadrar un rostro en el momento en que se lo advierte, y se detiene en lugar de desviarse cuando pierde al sujeto.
- Agregar puntos de seguimiento arrastrando — mueva el cursor de reproducción, arrastre el recuadro hasta donde se encuentra ahora el sujeto, y el tachado se desplaza entre los puntos. Los puntos de seguimiento se muestran como marcadores en la barra de la línea de tiempo.
- Borrar el seguimiento de esta marca elimina los fotogramas clave.
![]()
Distorsión de una voz
Distorsionar voz es un tipo de supresión distinto de Silenciar y Pitido: el tramo se altera en tono para que el interlocutor ya no pueda identificarse, mientras cada palabra permanece audible. Utilícela cuando silenciar eliminaría más de lo que la exención justifica: los reguladores han ordenado exactamente esto en lugar de la eliminación (por ejemplo, las órdenes MO-3961 y PO-4190 del IPC de Ontario), y algunas leyes de tarifas nombran la «distorsión» entre los métodos de ocultación facturables. Elija Tachar ▾ → Distorsionar voz en el tramo, o seleccione Distorsionar voz en la lista de Efectos de cualquier cuadro de diálogo de marca. El tramo se muestra en la línea de tiempo con el color de su exención y con un chip Distorsión en el panel lateral. En la Vista previa con tachados, el navegador no puede alterar el tono en vivo, de modo que el tramo se reproduce silenciado y una nota le recuerda que la divulgación mantiene las palabras audibles con la voz alterada. La distorsión se aplica al producirse el archivo de divulgación, y el índice de tachados y el registro consignan el efecto y la exención de cada tramo. Los tramos de Distorsión, Silenciado y Pitido pueden combinarse en una misma grabación.
Detección de rostros y texto en pantalla
Desde el menú Tachar, Detectar rostros y texto en pantalla analiza los fotogramas del video y propone:
- Una región rastreada por cada rostro que encuentra. El detector de rostros se ejecuta íntegramente en su App Service: nada sale del inquilino, y no hay ningún cargo por fotograma.
- Una región dondequiera que aparezcan en pantalla los patrones de detección de su organización — una matrícula, una placa de identificación, un expediente en un monitor. La pasada de texto lee fotogramas muestreados con Azure AI Document Intelligence y se factura por fotograma.
Las propuestas usan su efecto de región predeterminado (Desenfoque, salvo que Configuración → Apariencia de los tachados indique otra cosa). El análisis se ejecuta en segundo plano con un aviso de progreso en vivo; puede cerrar el visor y volver más tarde, y recibirá un aviso cuando finalice, con el recuento de propuestas. Cada coincidencia es una propuesta en recuadro ámbar discontinuo para que la acepte o descarte: nada se aplica de forma silenciosa. Volver a analizar ofrece reemplazar las propuestas anteriores sin revisar, de modo que las repeticiones nunca acumulen duplicados. Un administrador puede desactivar cualquiera de los dos detectores en Configuración → Funciones.


Buscar y tachar, las reglas de sugerencia y la pasada de tachado con IA también funcionan sobre la transcripción: proponen marcas de Silenciar sobre el tramo hablado para que las acepte o descarte, exactamente igual que proponen tachados de texto en un documento.
Vista previa con tachados
La vista Vista previa con tachados reproduce el registro tal como lo recibirá el solicitante: regiones difuminadas, recuadradas o pixeladas, tramos silenciados o con pitido, y el rótulo de la etiqueta incrustado en el fotograma. Muestra únicamente las marcas aplicadas; las propuestas nunca aparecen en ella.

Decisión de divulgación
La resolución de cada grabación —divulgada en su totalidad, divulgada en parte o retenida en su totalidad— se deriva de sus marcas: sin marcas significa divulgada en su totalidad, marcas de tramo significan divulgada en parte, y una marca de Retener toda la grabación significa retenida en su totalidad. Esta decisión alimenta la página de contenido del paquete de respuesta, el registro de tachados de la solicitud y las estadísticas de resolución.
Divulgación de una grabación
Un paquete de respuesta que incluye grabaciones se genera en segundo plano: la verificación previa se lo indica, Historial de exportación muestra su progreso, y se le notifica cuando está listo. El paquete es un ZIP que contiene los PDF, una carpeta Media/ con los archivos MP4 o MP3 generados —con las marcas incrustadas y el rótulo del registro—, una carpeta Files/ para los archivos nativos divulgados tal cual, y un MANIFEST.sha256 que enumera el hash de cada elemento: la prueba de la oficina de exactamente lo que se divulgó. Consulte Respuesta y tarifas para conocer la verificación previa del paquete y la estimación de revisión de multimedia.

Tarifas y horas
El panel de Tarifas de la pestaña Respuesta y tarifas muestra una línea de Revisión de multimedia estimada —la duración total de las grabaciones multiplicada por el multiplicador del inquilino, cuatro horas de revisor por cada hora grabada de forma predeterminada— y ofrece Sugerir línea de revisión de multimedia, que abre el cuadro de diálogo Agregar línea prerrellenado con la base de cálculo y, cuando el programa de tarifas factura el tiempo de revisión, el importe. El registro de horas incluye una categoría Revisión de multimedia del paquete Universal Baseline.
Para administradores
Configuración → Funciones → Grabaciones multimedia (video y audio) muestra qué procesador multimedia está activo (en proceso en el App Service, un trabajo de Container Apps, o ninguno), el conmutador Transcribir grabaciones y los dos conmutadores de detección. La transcripción necesita el recurso Azure AI Speech, la detección de texto en pantalla necesita Azure AI Document Intelligence, y el procesamiento a escala de producción usa el trabajo opcional de procesamiento multimedia — todos ellos implementados en su propia suscripción por la plantilla de implementación. Consulte Funciones y la Guía de implementación.
Páginas relacionadas
- Documentos — el espacio de trabajo que comparten las grabaciones con cualquier otro registro, incluidos los modos de etiqueta y el menú Descargar.
- Respuesta y tarifas — la verificación previa del paquete de respuesta y la estimación de revisión de multimedia.
- Apariencia de los tachados — el efecto de región predeterminado y la obligatoriedad de los tachados propuestos que se aplica a las detecciones.
- Funciones — los conmutadores de procesamiento multimedia, transcripción y detección.