Extracción

La extracción lee las páginas de cada sitio de un clúster y obtiene las partes que coinciden con una expresión. Un clúster de sitios se convierte en una tabla de números de teléfono, cuentas en redes sociales, direcciones, nombres de plugins: lo que capture el patrón.

Qué lee

Todo lo que PublicWWW ha indexado de esos sitios, incluidas las páginas internas, no solo la página de inicio en la que coincidió la búsqueda. Un dato de contacto que solo aparece en una página de «quiénes somos» también se encuentra.

Patrones predefinidos y propios

Hay patrones predefinidos para lo que más se pide (direcciones de correo electrónico, números de teléfono) y, en su lugar, se puede usar cualquier expresión regular. La expresión funciona igual que snipexp: en una búsqueda: lo que acaba en la columna es el grupo de captura, y una expresión sin grupo de captura da resultados vacíos.

|/wp-content/plugins/([\w\d\-\.\_]+)/|

Prueba primero con un clúster pequeño. La expresión se puede probar, ajustar y volver a probar con un tope de registros a extraer, así que un patrón erróneo no cuesta casi nada; consulta límites para ver por qué es importante.

Obtener el resultado

La tabla extraída se descarga como archivo y se abre en una hoja de cálculo. Cada fila es un sitio y lo que se encontró en él; un sitio en el que no hubo coincidencias también aparece, para que los huecos sean visibles en lugar de desaparecer sin avisar.

Filtrar búsquedas con un clúster

Un clúster también funciona como filtro en la dirección contraria. Sube tu propia lista de dominios, URL o direcciones de correo electrónico y úsala para reducir los resultados de búsqueda a los sitios de esa lista o, restando, a todos excepto ellos.

Extraer teléfonos y correos electrónicos recorre todo el proceso, desde dos búsquedas hasta una hoja de cálculo.

Siguiente Límites