Documentación Metodológica para la Detección de Bots

Estimación del porcentaje de bots y/ó cuentas falsas en una base de followers — Ground truth del sistema
Idea original: Análisis de followers de un usuario específico · Metodología fundamentada según bibliografía académica

1. Objetivo y alcance

Estimar, de forma fiable y reproducible, qué porcentaje de las cuentas en la base followers de un usuario son bots o cuentas falsas (fantasmas, lotes comprados), articulando señales débiles en un score ponderado y reportando un rango de estimación con su intervalo de confianza.

Datos disponibles por cuenta

username followers_count statuses_count account_created_at (ISO 8601) ID de cuenta

Escala: de 3 a 4.5 millones de filas. El análisis se sustenta en proporciones y muestras representativas, no en la revisión exhaustiva de cada cuenta.

Todo el sistema descrito aquí constituye la fuente de verdad: los scripts SQL de la Fase 3 deben corresponderse 1:1 con esta documentación, y cualquier desvío debe justificarse explícitamente.

2. Contexto y justificación

Las redes sociales son una fuente primaria de noticias e información susceptible de ser manipulada. Los social bots actúan como "ejércitos coordinados" capaces de amplificar desinformación, propaganda y falsas tendencias Metodológico [A9]. La compra y venta de seguidores en volumen es un mercado sombra que infla métricas para hacer parecer influyentes a cuentas e influencers, y puede ser redirigido a fines de desinformación Contexto [B3].

Los bots son a su vez un habilitador técnico de campañas de manipulación de la opinión pública (troll farms y redes de cuentas falsas) Contexto [B1], y la manipulación de la conversación digital importa en términos democráticos porque las plataformas son hoy el entorno clave donde ocurren las prácticas de desinformación Contexto [B2].

Desde lo empírico, según la bibliografía analizada, entre el 9% y el 15% de las cuentas activas de Twitter son bots [A2]. Esta cifra proviene de estimaciones de 2017 (hace más de 9 años), por lo que debe leerse como referencia histórica orientativa, no como valor actual. Es nuestro benchmark de comparación: si la cuenta auditada queda por encima o por debajo de ese rango, contrastamos contra lo que era esperable en la plataforma en aquel periodo.

"Our estimates suggest that between 9% and 15% of active Twitter accounts are bots." — Varol et al., 2017 [A2] (estimación de 2017, referencia histórica)

3. Taxonomía de cuentas

Siguiendo el marco conceptual de Gorwa & Guilbeault [A7], no tratamos el resultado como binario ("bot o no"). Distinguimos tipos de cuenta, porque "bot" no es una categoría única y los tipos tienen señales distintas. La multiclasificación (no binaria) también es defendida por Zago et al. [A9].

CategoríaDefiniciónSeñales dominantes
Bot activoCuenta automatizada con actividad anómala (spam, amplificación)posts/día extremos; actividad "incesante" [A1][A4]
FantasmaCuenta sin vida ni interacción (inactividad crónica)0 posts y/o 0 followers persistentes en cuentas viejas
Lote compradoCuenta perteneciente a una camada coordinada (account farm)cohorte de fecha de creación + coherencia interna [A3][A6]
SospechosoAcumula señales débiles combinadas sin un tipo definidoscore ponderado supera umbral
LimpiaSin señales relevantesscore bajo

Está tipología modera la lectura del resultado: no todo "bot" es malicioso (hay bots legítimos de difusión de noticias) y los cyborgs (cuenta con intervención humana parcial) escapan a cualquier detector basado en features [A1][A7]. Por eso además del % global, reportamos el desglose por categoría.

4. Variables de detección

Las features derivadas de nuestros 5 campos se agrupan en las categorías consolidamente reconocidas por la literatura: user related (username, edad de cuenta), friendship (seguidores), shared content (posts) y time-related [A9]. La literatura converge en que la metadata de usuario es de lo más predictivo [A1][A2].

4.1 Variables de username (user-related)

4.2 Variables de antigüedad (user/time-related)

4.3 Variables de actividad (friendship/content)

4.4 Ratio followers/followees

"bots usually have less followers and more followees" [A4]. Requiere friends_count (no en el esquema base). Se marca como feature ausente que mejoraría el sistema si se añadiera (ver Limitaciones).

4.5 Análisis de IDs (lotes)

Los IDs tipo snowflake codifican el momento de creación. IDs consecutivos o muy cercanos entre cuentas del mismo usuario indican registro en ráfaga, señal de lote comprado más fuerte que la fecha declarada [A3][A6].

Resumen señal → fuente
SeñalPaper(s)
Antigüedad / fecha de creaciónFerrara 2016 [A1]; Varol 2017 [A2]; Bessi 2016 [A4]
Cohorte / lote (agrupación temporal de creación)Cresci 2017 [A3]; USENIX 2013 [A6]; RTbust 2019 [A5]; SLR 2023 [A8]
Volumen de posts / posts por díaBessi 2016 [A4]; SLR 2023 [A8]
Longitud y dígitos del usernameFerrara 2016 [A1]; Bessi 2016 [A4]; USENIX 2013 [A6]; SLR 2023 [A8]
Ratio followers/followeesBessi 2016 [A4]; Varol 2017 [A2]; SLR 2023 [A8]
Segmentación por tipoGorwa & Guilbeault 2018 [A7]; Zago 2019 [A9]
Validación manual (human-in-the-loop)Zago 2019 [A9]

5. Scoring ponderado

Los bots modernos pueden imitar el comportamiento humano de forma que ningún umbral simple es suficiente [A9], y ningún feature aislado identifica un bot [A8]. Por ello usamos un score acumulativo ponderado. Siguiendo a Cresci [A3], las señales de comportamiento colectivo / coordinación (cohortes, lotes) tienen el peso más alto, porque son las más robustas contra bots sofisticados; los rasgos de perfil individual son señales más débiles.

5.1 Pesos v1 (priors iniciales)

SeñalPesoJustificación
Cohorte anómala coherente3.0Comportamiento colectivo [A3][A6]
IDs en rango consecutivo (lote)3.0Registro en ráfaga [A3][A6]
0 posts + cuenta > 1 año2.5Fantasma crónico confirmado por tiempo
posts/día > 502.0Capacidad de posteo "sobrehumana" [A1][A4]
< 90 días + (followers > 1000 o 0 posts)1.5Nuevo sin trayectoria [A1][A4]
0 posts O 0 followers (una sola señal)1.0Débil (usuarios reales lurkean)
≥4 dígitos en username0.75Rasgo de perfil, ruidoso [A4][A6]
username > 15 chars o prefijo compartido0.75Ídem [A1][A4]

5.2 Bandas

BandaRangoInterpretación
Baja / limpia< 1.5Sin señales relevantes
Dudoso1.5 – 2.9Señales débiles
Alto riesgo≥ 3.0Probable bot/fantasma/lote
Muy probable≥ 5.0Múltiples señales fuertes

Importante: estos pesos son priors justificados por la literatura, no valores finales. Se calibran en la Fase 3 mediante validación manual (ver sección 7), iterando de v1 a v2, v3… Se mantiene un registro versionado de pesos para reproducibilidad.

6. Detección de lotes y cohortes

Esta es la señal más robusta y prioritaria del sistema, porque se basa en comportamiento colectivo, no en features individuales fáciles de imitar [A3].

"a large enough group of spambots will still leave traces of automation, since they do have a common goal" — Cresci et al., 2017 [A3]

6.1 Niveles de agrupación

6.2 Regla de anomalía

conteo > mediana_global + 3 × IQR (con sensibilidad alternativa usando P95/P99). Con millones de filas se usan percentiles robustos.

6.3 Coherencia interna (anti-falsos positivos)

La cohorte solo se marca como anómala si además cumple coherencia interna: ≥50% con 0 posts, o ≥3 prefijos de username compartidos dentro del día. Esto distingue un "lote comprado" de un "día viral real" con mucha gente creándose cuentas.

6.4 Análisis de IDs

Densidad de gaps entre IDs en rangos consecutivos / muy cercanos = registro en ráfaga → evidencia de lote más fuerte que la fecha declarada [A3][A6].

7. Validación manual estratificada

El score necesita calibración sobre datos reales y verificación por ojos humanos, en línea con el enfoque de aprendizaje activo con humano-en-el-bucle [A9].

Este procedimiento estima la precisión por banda y permite reportar el resultado final con su intervalo de confianza, requisito de una "estimación fiable".

8. Estimación y reporte final

Principio: se reporta un rango calibrable, no un número falso de precisión, porque los datos disponibles y los métodos no garantizan un número exacto.

9. Limitaciones decladas

10. Bibliografía

A continuación, la bibliografía analizada, organizada por rol. Las marcas [An] corresponden a los documentos presentes en la carpeta Bibliografía.

Núcleo metodológico

  1. [A1] Ferrara, E., Varol, O., Davis, C., Menczer, F., & Flammini, A. (2016). The Rise of Social Bots. Communications of the ACM, 59(7), 96–104. DOI: 10.1145/2818717 · arXiv
  2. [A2] Varol, O., Ferrara, E., Davis, C. A., Menczer, F., & Flammini, A. (2017). Online Human-Bot Interactions: Detection, Estimation, and Characterization. Proc. ICWSM 2017 (AAAI). ICWSM
  3. [A3] Cresci, S., Di Pietro, R., Petrocchi, M., Spognardi, A., & Tesconi, M. (2017). The Paradigm-Shift of Social Spambots: Evidence, Theories, and Tools for the Arms Race. WWW 2017 Companion. DOI: 10.1145/3041021.3055135 · arXiv
  4. [A4] Bessi, A., & Ferrara, E. (2016). Social Bots Distort the 2016 U.S. Presidential Election Online Discussion. First Monday, 21(11). DOI: 10.5210/fm.v21i11.7090 · First Monday
  5. [A5] Mazza, M., Cresci, S., Avvenuti, M., Quattrociocchi, W., & Tesconi, M. (2019). RTbust: Exploiting Temporal Patterns for Botnet Detection on Twitter. ACM WebSci 2019. arXiv
  6. [A6] Thomas, K., McCoy, D., Grier, C., Kolcz, A., & Paxson, V. (2013). Trafficking Fraudulent Accounts: The Role of the Underground Market in Twitter Spam and Abuse. 22nd USENIX Security Symposium. USENIX
  7. [A7] Gorwa, R., & Guilbeault, D. (2018). Unpacking the Social Media Bot: A Typology to Guide Research and Policy. Policy & Internet, 12(2), 225–248. arXiv
  8. [A8] Ellaky, Z., Benabbou, F., & Ouahabi, S. (2023). Systematic Literature Review of Social Media Bots Detection Systems. Journal of King Saud University – Computer and Information Sciences, 35, 101551. DOI: 10.1016/j.jksuci.2023.04.004 · ScienceDirect
  9. [A9] Zago, M., Nespoli, P., Papamartzivanos, D., Gil Pérez, M., Gómez Mármol, F., Kambourakis, G., & Martínez Pérez, G. (2019). Screening Out Social Bots Interference: Are There Any Silver Bullets?. IEEE Communications Magazine, 57(8), 98–104. DOI: 10.1109/MCOM.2019.1800520

Contexto (desinformación y mercado)

  1. [B1] Frederick, K. (2019). The New War of Ideas: Counterterrorism Lessons for the Digital Disinformation Fight. Center for a New American Security (CNAS). JSTOR resrep20399.
  2. [B2] Terzis, G., Kloza, D., Kużelewska, E., & Trottier, D. (eds.) (2020). Disinformation and Digital Media as a Challenge for Democracy. Intersentia. ISBN 978-1-78068-975-3.
  3. [B3] Diaz Ruiz, C. (2025). Market-Oriented Disinformation Research: Digital Advertising, Disinformation and Fake News on Social Media. Routledge Studies in Marketing, vol. 50. DOI: 10.4324/9781003506676 (Open Access).