Articulo de referencia

Migración de contenido

La migración de contenido es el proceso de transferir información de un sistema informático a otro. El sistema de origen o destino puede ser un sistema de gestión de contenido w...

La migración de contenido es el proceso de transferir información de un sistema informático a otro. El sistema de origen o destino puede ser un sistema de gestión de contenido web (CMS), un sistema de gestión de activos digitales (DAM) o un sistema de gestión documental (DMS). El contenido también puede provenir de archivos HTML planos o formatos de servidor de aplicaciones como Active Server Pages (ASP), JavaServer Pages (JSP) o PHP , ya sea en formato estático o dinámico.

Las migraciones se realizan por diversas razones empresariales, como la consolidación de sistemas, los requisitos de cumplimiento normativo y la reestructuración organizativa tras fusiones y adquisiciones. Conllevan riesgos como la pérdida de datos, la rotura de enlaces y la pérdida temporal de posicionamiento en buscadores , y requieren una planificación minuciosa tanto de la estructura del contenido como de la gestión de metadatos .

Factores clave del negocio

Razones para considerar la migración de contenido

Las migraciones de contenido pueden solucionar una serie de problemas, entre los que se incluyen:

  • Consolidación de uno o más sistemas CMS en un número menor de sistemas. Esto permite un control más centralizado, una mejor gobernanza del contenido y una gestión y compartición del conocimiento más eficaz.
  • Reorganización del contenido debido a fusiones y adquisiciones para asimilar la mayor cantidad de contenido posible de los sistemas de origen y lograr una apariencia y experiencia unificadas .
  • Convertir el contenido que ha crecido orgánicamente, ya sea en un CMS o en HTML plano, y estandarizar el formato para que se puedan aplicar estándares que permitan una imagen de marca unificada del contenido.
  • Las complejas rutas de actualización desde versiones no compatibles pueden simplificarse migrando el contenido a una versión más reciente de la plataforma.
  • Los requisitos de cumplimiento normativo podrían exigir una mayor funcionalidad del sistema de almacenamiento subyacente; por ejemplo, la necesidad de auditar el acceso al contenido, mejorar la seguridad o la gestión de registros .

Argumentos en contra de la migración de contenido

Las migraciones de contenido conllevan riesgos. Si bien algunos factores, como el costo, pueden ser evidentes, existen razones menos obvias para evitar una migración. Entre ellas se incluyen la corrupción de datos durante la transmisión y la pérdida de contexto, especialmente en el caso del contenido no estructurado, que suele ser uno de los elementos más importantes de una empresa. También existe el riesgo de que no se tengan en cuenta las referencias externas (enlaces rotos al contenido). El volumen de datos a migrar hace que el proceso requiera muchos recursos (almacenamiento en origen, destino y temporal, ancho de banda de la red, etc.), lo que implica que auditar el proceso de migración puede ser complejo y exigir coherencia y trazabilidad.

Otro problema común en la migración de contenido es la pérdida de SEO y posicionamiento en los motores de búsqueda. Migrar a otra ubicación y adoptar un nuevo software implica que todas las URL del sitio web también cambiarán; por lo tanto, los motores de búsqueda tendrán que realizar ajustes incluso si están informados del proceso. En un informe técnico, Oracle también describió varios problemas relacionados con la perspectiva del factor humano. Citó la posibilidad de que las personas involucradas en la migración de contenido no comprendan completamente el historial, la estructura y el significado de los datos de origen, así como del nuevo sistema, lo que podría generar no solo la pérdida de información, sino también recursos adicionales. [ 1 ]

Uno de los métodos para abordar los riesgos es el uso de metadatos . Estos se emplean para describir, acceder y gestionar registros, sirviendo como el medio definitivo para demostrar la integridad, confiabilidad y autenticidad de un registro. [ 2 ] El proceso, por ejemplo, podría adoptar un marco de dos vías donde una se ocupe del contenido, la estructura, el diseño y la visión generales, mientras que la otra se centre en los metadatos. [ 3 ]

Aproches

Existen diversas formas de acceder al contenido almacenado en un CMS. Dependiendo del proveedor del CMS, este ofrece una interfaz de programación de aplicaciones (API), servicios web , la reconstrucción de un registro mediante consultas SQL , exportaciones XML o a través de la interfaz web.

  1. La API [ 4 ] requiere que el desarrollador lea y comprenda cómo interactuar con la capa API del CMS de origen y luego desarrolle una aplicación que extraiga el contenido y lo almacene en una base de datos, un archivo XML o Excel. Una vez extraído el contenido, el desarrollador debe leer y comprender la API del CMS de destino y desarrollar código para transferir el contenido al nuevo sistema. Lo mismo se aplica a los servicios web.
  2. La mayoría de los CMS utilizan una base de datos para almacenar y asociar contenido, por lo que, si no existe una API, el programador debe realizar ingeniería inversa de la estructura de la tabla. Una vez obtenida la estructura, se escriben consultas SQL muy complejas para extraer todo el contenido de varias tablas a una tabla intermedia o a un archivo de valores separados por comas (CSV) o XML. Una vez que el desarrollador dispone de los archivos o la base de datos, debe leer y comprender la API del CMS de destino y desarrollar el código necesario para integrar el contenido en el nuevo sistema. Lo mismo ocurre con los servicios web.
  3. La exportación XML crea archivos XML con el contenido almacenado en un CMS, pero tras exportarlos, es necesario modificarlos para adaptarlos al nuevo esquema del sistema CMS de destino. Normalmente, un desarrollador se encarga de esta transformación escribiendo código.
  4. Los archivos HTML, JSP, ASP, PHP u otros formatos de archivo de servidor de aplicaciones son los más difíciles. La estructura de los archivos HTML planos se basa en una combinación de la estructura de carpetas, la estructura de archivos HTML y la ubicación de las imágenes. En los inicios de la migración de contenido, el desarrollador tenía que usar lenguajes de programación para analizar los archivos HTML y guardarlos como bases de datos estructuradas, XML o CSV. Normalmente se usaban PERL, JAVA, C++ o C# debido a su capacidad para manejar expresiones regulares . JSP, ASP, PHP, ColdFusion y otras tecnologías de servidor de aplicaciones suelen depender de inclusiones del lado del servidor, lo que simplifica el desarrollo, pero dificulta enormemente la migración de contenido, ya que este no se ensambla hasta que el usuario lo visualiza en su navegador web. Esto hace que sea muy difícil examinar los archivos y extraer el contenido de su estructura.
  5. El web scraping permite a los usuarios acceder a la mayor parte del contenido directamente desde la interfaz de usuario web. Dado que una interfaz web es visual (este es el objetivo de un CMS), algunos web scrapers aprovechan la interfaz de usuario para extraer el contenido y colocarlo en una estructura como una base de datos, XML o formato CSV. Todos los CMS, DAM y DMS utilizan interfaces web, por lo que extraer el contenido de uno o varios sitios de origen es básicamente el mismo proceso. En algunos casos, es posible enviar el contenido al nuevo CMS mediante la interfaz web, pero algunos CMS utilizan applets de Java o controles ActiveX que no son compatibles con la mayoría de los web scrapers. En ese caso, el desarrollador debe leer y comprender la API del CMS de destino y desarrollar código para enviar el contenido al nuevo sistema. Lo mismo se aplica a los servicios web.

El flujo básico de migración de contenido

  1. Obtenga un inventario del contenido.
  2. Obtenga un inventario de contenido binario como imágenes, archivos PDF, archivos CSS, documentos de Office, Flash y cualquier objeto binario.
  3. Encuentra cualquier enlace roto en el contenido o en los recursos del contenido.
  4. Determinar la estructura del menú del contenido.
  5. Encuentre la conexión principal/hermana del contenido para que los enlaces a otros contenidos y recursos no se rompan al moverlos.
  6. Extraiga los recursos de las páginas y guárdelos en una base de datos o en una estructura de archivos. Guarde la referencia en una base de datos o en un archivo.
  7. Extrae el contenido HTML del sitio y guárdalo localmente.
  8. Cargue los recursos al nuevo CMS mediante la API o la interfaz web y almacene la nueva ubicación en una base de datos o en formato XML.
  9. Transforma el HTML para que cumpla con los nuevos estándares del CMS y vuelve a conectar los recursos.
  10. Sube el contenido transformado al nuevo sistema.

De lo antiguo a lo nuevo

  1. Recuerda que la estrategia de contenido de tu nuevo sitio web puede evolucionar a medida que cambian los objetivos de la marca y empiezas a comprender cómo funciona el contenido en este nuevo entorno. Puede que sea necesario recuperar contenido antiguo que no se migró inicialmente; asegúrate de archivar todo lo que no se incluya en la migración inicial por este motivo.

Referencias

  1. Oracle (octubre de 2011). "Migración de datos exitosa" (PDF) . Oracle . Consultado el 4 de septiembre de 2018 .
  2. TAHO (septiembre de 2015). "Consejos sobre gestión de la información 60 Parte 5 Gestionar con éxito los riesgos de la información durante la migración del sistema" (PDF) . Gobierno de Tasmania . Consultado el 4 de septiembre de 2018 .
  3. Sánchez-Alonso, Salvador; Athanasiadis, Ioannis (2010). Metadatos e investigación semántica . Berlín: Springer. pág. 28. ISBN  9783642165511.
  4. Lo que no son las API de migración de contenido
  • Una tarea nada sencilla: Migrar contenido a un nuevo CMS