Grabaciones de video y audio — carga de grabaciones de hasta 2 GB, grabaciones de reuniones de Teams, el visor multimedia, transcripciones y subtítulos, marcas de tachado basadas en el tiempo (recuadro, desenfoque, pixelado, silenciar, pitido, distorsionar voz, retener), seguimiento automático, detección de rostros y de texto en pantalla, vista previa con tachados, y cómo se divulgan las grabaciones

Last updated: September 03, 2026 by Steve

Grabaciones de video y audio

Las grabaciones — exportaciones de cámara corporal y CCTV, audio de despacho y 911, grabaciones de entrevistas, mensajes de voz, grabaciones de reuniones de Teams — son documentos como cualquier otro en una solicitud. Se ubican en el mismo espacio de trabajo de Documentos, con una faceta Video o Audio, una columna de Duración y chips de procesamiento en la fila. El original nunca se modifica: las copias de reproducción, las miniaturas, las transcripciones y las copias divulgadas son archivos derivados que se guardan junto a él.

Grabaciones en la pestaña Documentos, filtradas por la faceta Video

Todo lo que aparece en esta página se aplica dondequiera que vea una pestaña Documentos: las evaluaciones de privacidad, los incidentes y las quejas comparten el mismo espacio de trabajo que las solicitudes.

Cómo incorporar las grabaciones

  • Carga. Suelte el archivo en la pestaña Documentos o use Crear o cargar. De forma predeterminada se aceptan grabaciones de hasta 2 GB. Los archivos de más de 100 MB se cargan en bloques reanudables: el panel Cola de carga muestra el progreso de cada archivo y sobrevive a una conexión interrumpida (pausar, reanudar, cancelar). Mantenga la página abierta hasta que finalice.
  • Grabaciones de reuniones de Teams. Abra Agregar desde Microsoft 365 y elija Grabaciones de reuniones de Teams para capturar la grabación de una reunión que usted organizó. La grabación se descarga a través de su navegador hacia la cola de carga, y la transcripción generada por Teams la acompaña cuando existe, de modo que la grabación nunca se transcribe una segunda vez.

El panel Cola de carga con un archivo de gran tamaño cargándose en bloques reanudables

Grabaciones de reuniones de Teams en el selector Agregar desde Microsoft 365

Procesamiento

Después de la carga, el registro muestra Procesando mientras se preparan una copia reproducible en el navegador, un fotograma de póster, miniaturas al pasar el cursor y, en el caso del audio, una forma de onda. Cuando la transcripción está habilitada, le sigue un chip Transcribiendo…. Una implementación sin procesador multimedia deja el registro marcado como Requiere procesador multimedia hasta que haya uno disponible — nunca falla —, y Reintentar aparece en la fila cuando la preparación falla. Si su implementación analiza las cargas con Microsoft Defender for Storage, un registro señalado como malicioso no puede reproducirse, descargarse ni divulgarse.

Reproducción y escucha

Abra la fila para acceder al visor multimedia: controles nativos, Espacio para reproducir y pausar, las teclas de flecha y J / K / L para avanzar cuadro a cuadro y desplazarse, F para pantalla completa, velocidad de reproducción, y desplazamiento al pasar el cursor sobre la línea de tiempo. Los registros de audio añaden un carril de forma de onda. Cuando ya ha abierto el registro antes, el visor ofrece Reanudar en hh:mm:ss.

El visor multimedia con una marca de desenfoque rastreada y el rótulo de la exención en el fotograma

Transcripciones y subtítulos

Con Azure AI Speech implementado, toda grabación nueva se transcribe después de prepararse (un administrador puede desactivar esto en Configuración → Funciones). El panel Transcripción junto al reproductor muestra una transcripción con código de tiempo y etiquetado por interlocutor: haga clic en un segmento para saltar al momento en que se pronuncia, use Buscar en la transcripción para localizar una palabra, y active los subtítulos en el reproductor. El texto de la transcripción se incorpora a la búsqueda de contenido, la detección de duplicados, los resúmenes con IA y Pregúntele a AccessPoint como cualquier otro texto de documento, y lleva el mismo filtro de información personal del solicitante que el documento: los usuarios que no pueden ver información personal del solicitante solo ven recuentos y tiempos.

El panel de transcripción con etiquetas de interlocutor y la función Buscar en la transcripción

Marcado de una grabación

El tachado en una grabación está basado en el tiempo: cada marca cubre un tramo de la línea de tiempo y, en el caso del video, también puede cubrir una región de la imagen. Las marcas se realizan en la vista Redline (las teclas 1, 2 y 3 alternan entre Original, Redline y Vista previa con tachados).

Abra Tachar ▾ en el panel lateral:

  • Marcar… toma el tramo a partir de su selección en la línea de tiempo o de la posición del cursor de reproducción, y le permite dibujar una región en el fotograma. La ausencia de región significa toda la imagen durante ese tramo.
  • Silenciar tramo, Distorsionar voz en el tramo y Retener grabación son los atajos para el audio y para el registro completo.
  • Detectar rostros y texto en pantalla (video) y Buscar y tachar (requiere una transcripción) son las herramientas de detección descritas más abajo.

El menú Tachar en una grabación

Cada marca tiene un Efecto: Recuadro, Desenfoque o Pixelado para la imagen; Silenciar audio, Pitido o Distorsionar voz para el sonido; Retener toda la grabación para el registro completo. Al igual que un tachado de página, cada marca lleva una exención con alternativas, comentarios, indicadores, aprobación y una etiqueta de visualización —la cita de la exención, texto personalizado o ninguna etiqueta— que se dibuja en el fotograma de la copia divulgada.

El cuadro de diálogo Nueva marca con la lista de efectos abierta

Una marca de región con su exención, alternativas y etiqueta en el panel lateral

Seguimiento de un sujeto en movimiento

Una marca de región puede moverse junto con la persona u objeto que cubre. Seleccione la marca y abra su menú Seguimiento:

  • Seguir esta marca automáticamente sigue al sujeto que recuadró a lo largo del clip en ambas direcciones. Por lo general extiende la marca hacia atrás, porque se tiende a recuadrar un rostro en el momento en que se lo advierte, y se detiene en lugar de desviarse cuando pierde al sujeto.
  • Agregar puntos de seguimiento arrastrando — mueva el cursor de reproducción, arrastre el recuadro hasta donde se encuentra ahora el sujeto, y el tachado se desplaza entre los puntos. Los puntos de seguimiento se muestran como marcadores en la barra de la línea de tiempo.
  • Borrar el seguimiento de esta marca elimina los fotogramas clave.

Seguir esta marca automáticamente en una marca de región

Distorsión de una voz

Distorsionar voz es un tipo de supresión distinto de Silenciar y Pitido: el tramo se altera en tono para que el interlocutor ya no pueda identificarse, mientras cada palabra permanece audible. Utilícela cuando silenciar eliminaría más de lo que la exención justifica: los reguladores han ordenado exactamente esto en lugar de la eliminación (por ejemplo, las órdenes MO-3961 y PO-4190 del IPC de Ontario), y algunas leyes de tarifas nombran la «distorsión» entre los métodos de ocultación facturables. Elija Tachar ▾ → Distorsionar voz en el tramo, o seleccione Distorsionar voz en la lista de Efectos de cualquier cuadro de diálogo de marca. El tramo se muestra en la línea de tiempo con el color de su exención y con un chip Distorsión en el panel lateral. En la Vista previa con tachados, el navegador no puede alterar el tono en vivo, de modo que el tramo se reproduce silenciado y una nota le recuerda que la divulgación mantiene las palabras audibles con la voz alterada. La distorsión se aplica al producirse el archivo de divulgación, y el índice de tachados y el registro consignan el efecto y la exención de cada tramo. Los tramos de Distorsión, Silenciado y Pitido pueden combinarse en una misma grabación.

Detección de rostros y texto en pantalla

Desde el menú Tachar, Detectar rostros y texto en pantalla analiza los fotogramas del video y propone:

  • Una región rastreada por cada rostro que encuentra. El detector de rostros se ejecuta íntegramente en su App Service: nada sale del inquilino, y no hay ningún cargo por fotograma.
  • Una región dondequiera que aparezcan en pantalla los patrones de detección de su organización — una matrícula, una placa de identificación, un expediente en un monitor. La pasada de texto lee fotogramas muestreados con Azure AI Document Intelligence y se factura por fotograma.

Las propuestas usan su efecto de región predeterminado (Desenfoque, salvo que Configuración → Apariencia de los tachados indique otra cosa). El análisis se ejecuta en segundo plano con un aviso de progreso en vivo; puede cerrar el visor y volver más tarde, y recibirá un aviso cuando finalice, con el recuento de propuestas. Cada coincidencia es una propuesta en recuadro ámbar discontinuo para que la acepte o descarte: nada se aplica de forma silenciosa. Volver a analizar ofrece reemplazar las propuestas anteriores sin revisar, de modo que las repeticiones nunca acumulen duplicados. Un administrador puede desactivar cualquiera de los dos detectores en Configuración → Funciones.

El análisis ejecutándose en segundo plano

Rostros detectados en espera de revisión como propuestas rastreadas

Buscar y tachar, las reglas de sugerencia y la pasada de tachado con IA también funcionan sobre la transcripción: proponen marcas de Silenciar sobre el tramo hablado para que las acepte o descarte, exactamente igual que proponen tachados de texto en un documento.

Vista previa con tachados

La vista Vista previa con tachados reproduce el registro tal como lo recibirá el solicitante: regiones difuminadas, recuadradas o pixeladas, tramos silenciados o con pitido, y el rótulo de la etiqueta incrustado en el fotograma. Muestra únicamente las marcas aplicadas; las propuestas nunca aparecen en ella.

Vista previa con tachados con rostros difuminados y el rótulo incrustado

Decisión de divulgación

La resolución de cada grabación —divulgada en su totalidad, divulgada en parte o retenida en su totalidad— se deriva de sus marcas: sin marcas significa divulgada en su totalidad, marcas de tramo significan divulgada en parte, y una marca de Retener toda la grabación significa retenida en su totalidad. Esta decisión alimenta la página de contenido del paquete de respuesta, el registro de tachados de la solicitud y las estadísticas de resolución.

Divulgación de una grabación

Un paquete de respuesta que incluye grabaciones se genera en segundo plano: la verificación previa se lo indica, Historial de exportación muestra su progreso, y se le notifica cuando está listo. El paquete es un ZIP que contiene los PDF, una carpeta Media/ con los archivos MP4 o MP3 generados —con las marcas incrustadas y el rótulo del registro—, una carpeta Files/ para los archivos nativos divulgados tal cual, y un MANIFEST.sha256 que enumera el hash de cada elemento: la prueba de la oficina de exactamente lo que se divulgó. Consulte Respuesta y tarifas para conocer la verificación previa del paquete y la estimación de revisión de multimedia.

La verificación previa del paquete de respuesta para un paquete que contiene una grabación

Tarifas y horas

El panel de Tarifas de la pestaña Respuesta y tarifas muestra una línea de Revisión de multimedia estimada —la duración total de las grabaciones multiplicada por el multiplicador del inquilino, cuatro horas de revisor por cada hora grabada de forma predeterminada— y ofrece Sugerir línea de revisión de multimedia, que abre el cuadro de diálogo Agregar línea prerrellenado con la base de cálculo y, cuando el programa de tarifas factura el tiempo de revisión, el importe. El registro de horas incluye una categoría Revisión de multimedia del paquete Universal Baseline.

Para administradores

Configuración → Funciones → Grabaciones multimedia (video y audio) muestra qué procesador multimedia está activo (en proceso en el App Service, un trabajo de Container Apps, o ninguno), el conmutador Transcribir grabaciones y los dos conmutadores de detección. La transcripción necesita el recurso Azure AI Speech, la detección de texto en pantalla necesita Azure AI Document Intelligence, y el procesamiento a escala de producción usa el trabajo opcional de procesamiento multimedia — todos ellos implementados en su propia suscripción por la plantilla de implementación. Consulte Funciones y la Guía de implementación.

Páginas relacionadas

  • Documentos — el espacio de trabajo que comparten las grabaciones con cualquier otro registro, incluidos los modos de etiqueta y el menú Descargar.
  • Respuesta y tarifas — la verificación previa del paquete de respuesta y la estimación de revisión de multimedia.
  • Apariencia de los tachados — el efecto de región predeterminado y la obligatoriedad de los tachados propuestos que se aplica a las detecciones.
  • Funciones — los conmutadores de procesamiento multimedia, transcripción y detección.