Saltar al contenido
LinkProfit

Tráfico de bots y calidad del clic: qué cuenta en realidad tu recuento de clics

LinkProfit Team12 min de lectura
  • analytics
  • traffic-quality
  • bot-filtering
  • agencies
En esta página

Cualquier servicio de redirección puede decirte cuántas solicitudes sirvió. Casi ninguno puede decirte cuántas de esas solicitudes eran personas, que es la cifra que todo informe da por supuesta sin decirlo. Los enlaces viven en la web abierta: se indexan, se previsualizan, se escanean, se monitorizan y se raspan, y buena parte de eso ocurre a los pocos segundos de publicar, antes de que un solo humano haya visto la publicación.

Este artículo trata de la capa que hay entre el contador en bruto y una cifra que puedas defender en una reunión con un cliente: qué automatización te interesa dejar pasar, por qué identificar a un rastreador por su nombre no es identificarlo, qué demuestra un tipo de red y cómo convertir todo eso en reglas y en un informe honesto.

El contador en bruto es un contador de solicitudes

Un motor de redirección cuenta lo que llega. Esa es su virtud: funciona con destinos que no controlas, sobrevive a los bloqueadores y cuenta el escaneo de un código QR desde un cartel que no tiene sesión ni referente, como vimos en nuestra guía sobre medir los clics de tus enlaces. Y es también la razón por la que esa cifra necesita matices.

El tráfico automatizado que llega a un enlace corto se reparte en grupos reconocibles:

  • Escáneres de enlaces. Los proveedores de correo, las plataformas de mensajería y las pasarelas de seguridad descargan los enlaces al entregarlos para comprobar adónde llevan, y por eso un enlace acumula clics en el minuto siguiente a un envío, antes de que la entrega haya terminado.
  • Rastreadores de vista previa. Las redes sociales y las apps de chat descargan el enlace para montar la tarjeta con el título y la imagen. Un redirector bien educado les responde con metadatos en lugar de enrutarlos y contarlos.
  • Rastreadores de búsqueda y de SEO. Los indexadores de los buscadores, más las herramientas comerciales de SEO que rastrean todo lo que encuentran.
  • Monitores. Comprobaciones de disponibilidad, incluida la tuya. Por eso las solicitudes HEAD se sirven sin contar un clic.
  • Scrapers y sondas. Recolectores de precios, cosechadores de datos y escáneres que buscan enlaces que puedan reapuntar a otro sitio.

Dos de esos grupos son tráfico que pediste, uno es infraestructura neutra y uno no es bienvenido. «Bloquear bots» los trata a todos igual.

Los bots buenos y lo único que los identifica

Un user agent es una afirmación

El user agent es una cabecera que escribe quien envía la solicitud. Cualquier cosa puede poner ahí cualquier texto, así que una solicitud que dice ser Googlebot no demuestra nada, y un scraper que se hace llamar Chrome es más frecuente que uno que admite lo que es. Comparar user agents se gana igualmente su sitio —atrapa a la automatización que se identifica con honestidad y corrobora otras señales—, pero en el clasificador es explícitamente una señal débil: confirma, no decide.

La verificación comprueba algo que no controla quien envía

La dirección desde la que llega una solicitud no la elige quien envía en ningún sentido útil, y eso la convierte en lo que hay que comprobar. Hay dos maneras de hacerlo.

Algunos operadores publican los rangos que usan sus rastreadores. Google, Bing y Apple lo hacen, y esos ficheros se descargan una vez al día a una estructura de consulta rápida, así que una solicitud desde un rango listado queda confirmada sin ningún trabajo de red en el momento de la solicitud.

Para los rastreadores sin lista publicada —Yandex, DuckDuckGo, Baidu, Petal— la verificación es una comprobación de nombre en dos pasos, y hacen falta los dos:

Claim: "Googlebot" in the user agent

Step 1  reverse lookup of the address
        <address>  ->  crawl-<address>.googlebot.com   ends in the crawler's domain
Step 2  forward lookup of that name
        crawl-<address>.googlebot.com  ->  <address>    matches the original address
        verdict: verified crawler

Same claim, different address

Step 1  203.0.113.9  ->  host9.example-hosting.net     not the crawler's domain
        verdict: not verified, the claim is rejected

El paso hacia delante no es opcional. Quien controla un bloque de direcciones puede fijar normalmente su registro inverso a lo que le apetezca, así que un nombre inverso por sí solo se puede fabricar. Resolver ese nombre hacia delante y recuperar la dirección original es lo que cierra el círculo.

El CDN que hay delante del redirector realiza además su propia categorización de bots verificados, un veredicto que quien envía no puede falsificar y que no cuesta nada leer. Por eso la confirmación se toma en orden descendente de autoridad: lista publicada, verificación del CDN, comprobación de nombre inversa y hacia delante, y por último la pertenencia a un rango de araña conocido en la base de datos de direcciones.

Por qué la comprobación de nombre nunca se ejecuta mientras un visitante espera

Una resolución inversa es una solicitud de red con latencia impredecible, y la redirección es el único sitio donde los milisegundos son visibles para una persona, así que nunca se ejecuta de forma síncrona. Si una regla pregunta si un rastreador está verificado y la respuesta no está en caché, la regla lo trata como no verificado, la resolución se ejecuta en segundo plano y la respuesta queda en caché para el siguiente clic desde esa dirección. Equivocarse hacia «no verificado» cuesta una clasificación correcta; equivocarse hacia una resolución síncrona le cuesta a una persona real un retraso en cada solicitud.

El tipo de red es contexto, no un veredicto

Al margen de lo que un visitante diga ser, el rango de direcciones del que viene tiene un carácter conocido. La base de datos comercial de direcciones que hay detrás clasifica los rangos en un conjunto pequeño de tipos:

| Tipo | Qué es el rango | Porcentaje de rangos IPv4 en la base de datos | | --- | --- | --- | | Sin clasificar | Direcciones corrientes, sobre todo domésticas y corporativas | 72,1 % | | Centro de datos, alojamiento, nube | Servidores, instancias en la nube, navegadores alojados | 15,3 % | | Proxy público abierto | Repetidores abiertos por los que cualquiera puede enrutar | 9,2 % | | VPN comercial | Servicios de VPN para consumo y para empresa | 3,2 % | | Araña de buscador | Rangos que se sabe que pertenecen a rastreadores | 0,17 % | | Nodo de salida TOR | Puntos de salida de la red TOR | 0,005 % | | Anonimizador web | Páginas de proxy que funcionan en el navegador | 0,005 % |

Lee esa tabla con cuidado, porque es fácil malinterpretarla. Son porcentajes de rangos de direcciones en una base de datos de referencia, no porcentajes del tráfico de nadie. Un rango de un proveedor doméstico da servicio a cantidades enormes de personas; un rango de alojamiento puede no dar servicio a ninguna. La tabla dice cuáles son las categorías y con qué finura se reparte el espacio de direcciones entre ellas, y nada sobre lo que recibió tu campaña.

La lectura importa más que los números. Una dirección de centro de datos no significa un bot. Las redes corporativas enrutan a sus empleados por infraestructura en la nube, los consumidores celosos de su privacidad usan VPN comerciales para todo, compras incluidas, y los navegadores alojados son una forma normal de leer la web. Borra todos los clics de centros de datos y borrarás clientes reales. El tipo de red desplaza la confianza; por sí solo es un dato sobre enrutamiento.

La puntuación de calidad y para qué sirve

El clasificador produce dos salidas: un tipo de visitante —humano, rastreador de búsqueda, biblioteca, centro de datos, VPN, TOR o desconocido— y una puntuación de calidad del 1 al 100 con los motivos que hay detrás. Las entradas son las anteriores más señales de comportamiento: con qué frecuencia la misma dirección golpea el mismo enlace en un minuto, si la solicitud lleva siquiera una preferencia de idioma y si el conjunto de cabeceras encaja con la plataforma que declara el user agent.

La puntuación no es un interruptor, y eso es deliberado. Nada se bloquea porque la puntuación sea baja: la puntuación explica un veredicto y alimenta los informes, mientras que el bloqueo se configura de forma explícita. El coste de un falso positivo es asimétrico: un bot contado como humano distorsiona un porcentaje, mientras que un cliente bloqueado como bot nunca llega a la página y nunca te lo cuenta.

El tipo, la puntuación y los motivos aparecen en los desgloses de geografía y calidad del tráfico, donde la tabla de redes es a la que acuden los compradores de medios: número de sistema autónomo, nombre del proveedor, tipo de rango, total de clics y clics humanos en columnas separadas. La diferencia entre esas dos últimas, proveedor a proveedor, suele ser la historia entera de una compra de tráfico. El conjunto completo está documentado en analíticas geográficas.

Convertir un veredicto en una decisión

Un veredicto solo sirve si algo puede actuar sobre él. Las reglas de filtrado de tráfico enganchan a un enlace una lista ordenada de condiciones, evaluadas en el edge antes de elegir el destino, y la primera que encaja decide el resultado. Un enlace sin reglas no hace ni un ápice de trabajo extra.

Las condiciones que importan aquí son el tipo de visitante, el estado de rastreador verificado, el tipo de red y un umbral de puntuación de calidad, junto a la geografía, el sistema autónomo, las listas de direcciones, el dispositivo, el idioma, el referente, el patrón de user agent, las etiquetas de campaña, la hora local y si es primera visita o visita repetida. Los resultados: dejar pasar, bloquear con 404, bloquear con 410, redirigir a otro destino, mostrar una página de aviso con tu marca o dejar pasar marcando la visita como sospechosa.

Tres detalles de diseño deciden si esto se puede llevar a producción con seguridad.

Las condiciones son de tres valores. Cumplida, no cumplida o sin respuesta porque faltan los datos, y «sin respuesta» nunca cuenta como coincidencia. Si la base de datos de direcciones no está disponible, una regla condicionada al tipo de red no se dispara y el visitante llega al destino normal. El filtrado falla abriendo, nunca cerrando.

Invertir solo da la vuelta a las respuestas seguras. Una regla escrita como «todos menos Alemania» no se dispara en silencio con visitantes cuyo país no se pudo determinar. Esta es la forma más habitual en que una regla geográfica bienintencionada acaba en una caída.

Dejar pasar existe para que los filtros se puedan auditar. Una regla que deja pasar el tráfico y registra que coincidió es la manera de probar un filtro antes de dejar que bloquee nada: ejecútala en modo de dejar pasar, lee el desglose de tráfico filtrado, confirma que atrapa lo que esperabas y solo entonces cambia la acción.

Pon la política general en el conjunto de reglas de todo el espacio de trabajo, porque una política sobre centros de datos rara vez va de un solo enlace, y luego usa las reglas propias del enlace —que se evalúan primero— para llevar las excepciones por encima de la prohibición general. Así es como tu monitor de disponibilidad sigue funcionando en el único enlace que vigila. Los topes de reglas y de listas de direcciones están en la documentación de reglas de tráfico.

Un detalle antes de que escribas una regla de primera visita: distinguir una primera visita de una repetida exige una cookie pequeña en tu dominio de redirección, que solo se pone cuando alguna regla hace de verdad esa pregunta. Eso tiene consecuencias de privacidad, y por eso se activa por el propio mecanismo y no por defecto.

Qué cambia en el informe al cliente

Aquí es donde el trabajo se paga solo, y va sobre todo de qué números acaban en la página.

| Línea del informe | Sin capa de calidad | Con ella | | --- | --- | --- | | Cifra principal | Clics | Clics humanos, con el total de clics al lado | | Composición | Ausente | Humano, rastreador verificado, centro de datos, VPN, TOR, desconocido | | Tabla de proveedores | Clics por red | Clics y clics humanos por red | | Tráfico filtrado | Invisible | Volumen por regla, con la acción que aplicó cada una | | Explicación de un pico | «Algo pasó el martes» | El tipo y la red de los que vino el pico |

Dos hábitos hacen que ese informe sea honesto y no solo detallado. Enseña siempre las dos cifras: un dato de clics humanos sin el total al lado invita a sospechar que el total resultaba incómodo. Y cuenta qué filtraste y por qué; como en cada evento coincidente se guardan el identificador de la regla y la acción, el desglose de tráfico filtrado se sigue leyendo bien para reglas que después hayas editado o borrado.

Para las agencias, la tabla de proveedores es además un instrumento comercial: una red que manda volumen con casi ningún clic humano es una conversación con un proveedor, y esa conversación es más fácil con un desglose proveedor a proveedor que con un agregado. Nuestras páginas de soluciones para agencias y soluciones para afiliación cuentan cómo encaja esto en los informes al cliente y en los pagos.

Una cosa que conviene decir sin rodeos, porque los proveedores de esta categoría no suelen hacerlo: la clasificación es probabilística. Un scraper decidido que ejecuta un navegador real desde una dirección doméstica se clasificará como humano, y ningún producto del mercado te dirá lo contrario. Esta capa retira la mayoría grande, fácil y sincera consigo misma de la automatización, y te da pruebas para investigar el resto. Un informe que dé a entender certeza acabará equivocándose delante de un cliente.

Una secuencia que funciona

  1. Deja el filtrado de bots activado por defecto en analíticas y trata como automatización, mientras no se demuestre lo contrario, cualquier pico que empiece antes de que un humano haya podido ver el enlace.
  2. Lee el desglose de composición antes que la cifra principal. Una proporción de automatización inusual para el canal ya es en sí el hallazgo.
  3. Revisa la tabla de redes en busca de proveedores donde el total de clics y los clics humanos se separen mucho.
  4. Escribe la primera regla en modo de dejar pasar, vigila el desglose de tráfico filtrado durante una semana y pásala a una acción de bloqueo solo cuando el volumen que atrapa se parezca a lo que pretendías.
  5. Mantén el paso libre a los rastreadores verificados y exime a tus propios monitores con una regla a nivel de enlace por encima de la política del espacio de trabajo.
  6. Informa juntos de los clics humanos y del total de clics, enseñando el volumen filtrado en lugar de restarlo en silencio.

La idea de fondo es sencilla: un clic es una solicitud, una solicitud tiene una procedencia y la procedencia se puede medir. Lo que hace que merezca la pena es el efecto de segundo orden. Las tasas de conversión calculadas sobre clics humanos son estables, los desgloses geográficos sin rangos de alojamiento describen mercados y no infraestructura, y un cliente al que le has enseñado una vez la composición de su tráfico deja de preguntar si los números son reales.

Lo que suele preguntar la gente

¿Por qué mi recuento de clics es mayor que el número de visitantes reales?

Una redirección cuenta cada solicitud que le llega, y buena parte de esas solicitudes son automatizadas: las plataformas descargan los enlaces al entregarlos para comprobarlos, las redes sociales los descargan para montar las tarjetas de vista previa, los rastreadores los indexan, los monitores los sondean, los scrapers los recopilan. Casi todo eso llega antes de que ningún humano haya podido ver el enlace. La diferencia entre el contador en bruto y el contador de humanos no es un error: es exactamente lo que la capa de calidad existe para medir.

¿Qué es un bot bueno y por qué querría dejarlo pasar?

Un rastreador de búsqueda que indexa un destino, un rastreador de vista previa que construye la tarjeta que ven los destinatarios, un escáner de seguridad que comprueba un enlace antes de entregarlo y tu propio monitor de disponibilidad son automatización de la que te beneficias. Bloquearlos cuesta indexación, rompe las vistas previas en los canales donde publicas y hace que el filtrado retenga tus mensajes. La política útil casi nunca es «bloquear bots»: es «deja pasar a los rastreadores verificados, decide aparte sobre los centros de datos y las redes de anonimato, y deja de contar nada de eso como audiencia».

¿Por qué verificar un rastreador por dirección y no por su user agent?

Porque el user agent es una autodeclaración en una cabecera de la solicitud, y cualquiera puede poner ahí el texto que quiera: escribir un scraper que se llame a sí mismo Googlebot es trivial. La verificación tiene que comprobar algo que no controla quien envía. Google, Bing y Apple publican los rangos de direcciones que usan sus rastreadores, actualizados a diario, así que una solicitud desde un rango listado queda confirmada. Para los rastreadores sin lista publicada, la comprobación es una resolución inversa: la dirección debe resolver a un nombre de host dentro del dominio del propio rastreador, y ese nombre debe volver a resolver hacia delante a la misma dirección. Hacen falta las dos mitades, porque el registro inverso por sí solo lo puede fijar quien controle el bloque de direcciones.

¿Una dirección de centro de datos significa que el clic fue un bot?

No, y tratarlo así borrará personas reales de tus informes. Las redes corporativas enrutadas por infraestructura en la nube, los navegadores alojados y los consumidores celosos de su privacidad que usan servicios de VPN comercial producen clics humanos desde rangos clasificados como centro de datos o VPN. El tipo de red es contexto que sube o baja la confianza, no un veredicto. Por eso el clasificador produce una puntuación con sus motivos en lugar de una etiqueta binaria, y por eso el bloqueo queda en manos de una regla que hayas escrito tú.

Si bloqueo tráfico, ¿desaparece de mis informes?

No. Una visita bloqueada se registra igualmente como evento de clic, con el identificador de la regla que coincidió y la acción que aplicó, y aparece en el desglose de tráfico filtrado. Borrar los eventos filtrados haría imposible distinguir un filtro que funciona de uno que se está comiendo tu audiencia en silencio. Tres paneles —tráfico filtrado, calidad del tráfico y redes— incluyen el tráfico automatizado incluso con el interruptor de «excluir bots» activado, porque son precisamente los paneles que abriste para mirar bots.