1. Introducción
En Bolivia, el empleo informal representa un componente estructural de su economía asociado a peores estándares de vida [1], [2]. Identificar sus determinantes, es crucial para diseñar políticas públicas efectivas que promuevan la formalización y mejoren las condiciones laborales Banco Mundial [3].
En la región latinoamericana los principales determinantes del empleo informal se han agrupado en factores individuales y del hogar. La búsqueda de estos determinantes se ha realizado a través de técnicas tradicionales de econometría (TT), como ser modelos logit y probit. Sin embargo, estas técnicas enfrentan limitaciones al capturar interacciones complejas entre variables o patrones no lineales en datos con alta dimensionalidad [4]. En este escenario, se han desarrollado técnicas híbridas apoyadas en el machine learning (ML), rescatando el aporte de esta técnica para predecir comportamientos junto a el enfoque causal que proporcionan las TT.
Si bien las técnicas tradicionales (TT) de econometría y el machine learning (ML) difieren en sus objetivos y enfoques metodológicos, el crecimiento del big data y la necesidad de resolver problemas económicos complejos han motivado la combinación de ambos enfoques metodológicos [5], [6], [7], [8]. No obstante, esta convergencia exige un análisis cuidadoso de sus diferencias, seleccionando su aplicación individual o combinada según el objetivo, para mejorar el análisis empírico mediante sus ventajas comparativas [5], [9], [10]. Estas diferencias metodológicas adquieren especial relevancia en el estudio de fenómenos socioeconómicos multifactoriales, como el empleo informal, un fenómeno ampliamente reconocido como obstáculo clave para el desarrollo en economías emergentes [11].
Este estudio contribuye al análisis de los determinantes del empleo informal en Bolivia mediante TT econométricas, métodos de ML y estrategias híbridas que combinan ambos paradigmas. El objetivo es contrastar los hallazgos según cada enfoque metodológico y generar evidencia robusta para el diseño de políticas públicas más efectivas, así como para mejorar el entendimiento del empleo informal en Bolivia. A través de este enfoque híbrido, se aporta a la literatura de medición de determinantes del empleo informal con una comparación de la efectividad de cada técnica, y aportando a afinar los efectos y causalidad de cada variable sobre la elección de empleo informal.
La utilización de métodos híbridos ha permitido analizar una amplia cantidad de interacciones entre variables y seleccionar aquellas más relevantes, lo cual ha resaltado relaciones de causalidad más complejas, directas e indirectas, que las TT no logran capturar. Entre estas relaciones se encuentra que la edad, años de estudio e ingresos del hogar tienen una relación no lineal con la probabilidad encontrarse en el sector informal, que el efecto del género (ser mujer) afecta a la probabilidad de ser informal no solo en sí misma sino también a través de la educación (años de estudio), y la pertenencia a un grupo originario; y que, a su vez, pertenecer a un grupo originario no tiene un efecto en sí mismo en la probabilidad de informalidad, pero sí a través del nivel de ingresos del hogar.
Por otro lado, los modelos basados en técnicas de ML muestran una relación importante entre los ingresos laborales y la decisión de informalidad, insinuando una relación más compleja respecto a las expectativas entre estas dos variables más allá de la causalidad inversa. Ahondar en esta relación, podría ayudar a comprender mejor el fenómeno de informalidad en el país o incluso en la región.
El documento se organiza de la siguiente manera: la Sección 2 revisa la literatura relevante, la Sección 3 detalla los datos y metodología, la Sección 4 presenta los resultados y la Sección 5 discute las conclusiones y recomendaciones.
2. Revisión de la literatura
La informalidad es un concepto amplio y complejo que abarca una diversidad de actividades económicas no reguladas por los marcos normativos y regulatorios del Estado. Su definición varía según el enfoque adoptado, desde una perspectiva económica, se asocia con comportamientos de incumplimiento normativo, como la evasión tributaria o la elusión de regulaciones laborales, mientras que desde una visión estadística se vincula a la dificultad de observación y registro en las cuentas nacionales [12]. Aunque la heterogeneidad de las investigaciones complique la definición, una definición ampliamente utilizada por su comparabilidad internacional, es la propuesta por la Organización Internacional del Trabajo, donde la informalidad se define como el conjunto de actividades económicas realizadas por personas o unidades productivas que, en la práctica o en la ley, no están cubiertas por arreglos formales como la legislación laboral, tributaria o de seguridad social [13].
Con dicha definición de empleo informal, es relevante conocer las teorías que explican las causas de porque los agentes económicos optan por ser parte del sector informal, ya que en función a estas se pueden obtener los fundamentos teóricos para comprender el empleo informal e identificar sus determinantes. La teoría del mercado laboral dual conceptualiza al trabajo informal como un sector laboral de segunda donde se ubican los trabajadores excluidos de los mercados primarios (trabajos regulados y que pagan impuestos), caracterizado por la ausencia de regulación y protección laboral, los cuales son un reflejo de la estratificación racial, por clases y de género en nuestra sociedad [14].
La teoría neoclásica resalta que el pertenecer al sector informal es el resultado de la evaluación racional de los costos y beneficios relativos de entrar al sistema legal; sin embargo, ante fallas o intervenciones de mercado, la informalidad puede actuar como una escapatoria al desempleo [12]. Por otro lado, [15] explica que los empleos informales pueden actuar como una red de seguridad para las familias de bajos ingresos y marginales, ya que facilitan la posibilidad de generar ingresos a aquellos que no tienen acceso al mercado formal. Asimismo, las teorías macro-económicas explican que la informalidad podría ser el resultado del sistema impositivo, composición del mercado laboral y la debilidad institucional [16].
Igual que la informalidad, el empleo informal es un tema cuya definición presenta desafíos significativos debido a su naturaleza multidimensional y heterogénea, lo que genera diversas definiciones operativas que varían según la dimensión y perspectiva considerada, ya sea contractual, afiliación a la seguridad social, tamaño de la empresa o registro administrativo [17], [18], [19]. Esta diversidad dificulta la comparabilidad entre estudios, regiones y periodos. Por lo tanto, resulta esencial considerar definiciones estándar junto a enfoques sensibles al contexto específico para lograr análisis más robustos y políticas efectivas [17]. En este sentido, la [20] propone una definición teórica ampliamente aceptada:
“El empleo informal puede definirse como cualquier actividad de las personas para producir bienes o prestar servicios a cambio de una remuneración o un beneficio que no esté efectivamente cubierta por disposiciones formales como las leyes comerciales, los procedimientos para declarar las actividades económicas, el impuesto sobre la renta, la legislación laboral y las leyes y reglamentos de seguridad social que proporcionan protección contra los riesgos económicos y personales asociados al ejercicio de las actividades.”
Esta definición servirá como base para definir los criterios operativos aplicados en esta investigación para diferenciar a los trabajadores formales e informales. Por tanto, la definición operativa de empleo informal utilizada en esta investigación es categorizar a los individuos como empleados informales si caen en alguna de las siguientes categorías:
a) Empleados y empleadores con remuneración trabajando en empresas privadas, con 5 o menos personas y que no reciben o no esperan recibir beneficios sociales (subsidios, bonos de natalidad, seguros de salud).
b) Trabajadores por cuenta propia, empleadores sin remuneración y cooperativistas de producción trabajando en instituciones con 5 o menos personas.
c) Trabajadores familiares o aprendices sin remuneración.
d) Empleados del hogar.
Esta definición de empleo informal es similar a medidas tradicionales que se utilizaron para medir la informalidad en Bolivia. De manera general en el caso boliviano la informalidad suele estimarse en base a la perspectiva productiva, donde se categoriza a un empleado informal en base al sector de la economía (público o privado), la clasificación por tipo de trabajo (asalariado, trabajador por cuenta propia, empleador, etc.) y tamaño de la firma (cantidad de trabajadores). Estas mediciones, responden a las recomendaciones de la OIT y suelen presentar estimaciones del tamaño del empleo informal muy similares en el tiempo [21], [22], [23], [24], [25], [26], [27], [28], [29]. No obstante, también se debe mencionar que en algunas ocasiones la informalidad en el país se estima en base a la perspectiva legal, donde se suele considerar el cumplimiento de la normativa laboral como principal criterio y su medición se basa principalmente en información sobre la afiliación al fondo de pensiones , seguros contra accidentes laborales o vacaciones pagadas [1], [21], [30]; sin embargo, a pesar de que no sea la corriente dominante usualmente por la falta de datos y comparabilidad, ambas perspectivas presentan estimaciones similares del empleo informal.
Enfocándonos en el contexto latinoamericano, existen diversas investigaciones que buscaron las determinantes del empleo informal, en los que podemos encontrar patrones muy claros que van acompañados de modelos y justificaciones teóricas que explican la elección de dichas determinantes.
Las principales determinantes del empleo informal con un especial foco en la región suelen identificarse mediante el uso de TT econométricas, específicamente, mediante el uso de modelos de clasificación binaria no lineales (logit y probit). Las determinantes pueden agruparse en factores individuales y del hogar. Entre los factores individuales se encuentran el nivel educativo, el género, la edad, el estado civil, la experiencia laboral, haber migrado recientemente, la pertenencia a determinados grupos sociodemográficos, la existencia de ingresos no laborales y la presencia de alguna discapacidad. En cuanto a los factores del hogar, influyen el nivel de ingresos, los indicadores de riqueza, la presencia de menores y adultos mayores en el hogar, la presencia de trabajadores en el hogar, la residencia en zonas rurales y la situación de pobreza [2], [31], [32], [33], [34], [35], [36], [37], [38], [39], [40], [41].
Para el caso boliviano, las determinantes del empleo informal que suelen encontrarse son factores asociados a la educación, ya que esta reduce de manera significativa la probabilidad de inserción en el sector informal, mientras que a la vez los retornos de la educación son sustancialmente menores en dicho sector, reforzando la segmentación del mercado de trabajo [42], [43], [44]. Asimismo, se observa una mayor incidencia de informalidad entre las mujeres, vinculada a segregación ocupacional y la concentración femenina en actividades de comercio y servicios de baja productividad [42], [45], [46]. Desde el lado institucional, varios trabajos señalan que la rigidez de la normativa laboral incluyendo el salario mínimo y los costos de despido genera incentivos limitados para la formalización en micro y pequeñas unidades productivas [21], [47], [48].
De esta manera, siguiendo un enfoque parsimonioso y considerando tanto las teorías que explican la decisión de participar en el empleo informal como investigaciones previas que identifican sus determinantes, se analizan como factores relevantes para explicar el empleo informal para Bolivia: la edad, el género, los años de estudio, los ingresos per cápita del hogar, los ingresos no laborales, la cantidad de miembros menores de 5 años en el hogar y la pertenencia a una nación originaria. Asimismo, se incorporan como variables de control el área de residencia (rural o urbana) y el departamento.
Enfocándonos en las diferencias metodológicas, como se presentó anteriormente las TT econométricas han sido ampliamente utilizadas para la identificación de las determinantes del empleo informal, de manera que las investigaciones previas que buscaron encontrar las determinantes del empleo informal se han basado principalmente en modelos de probabilidad no lineal (logit/probit). Brindando la posibilidad de estimar efectos marginales promedio y relaciones causales bajo supuestos paramétricos [49]. Sin embargo, estas técnicas enfrentan limitaciones al capturar interacciones complejas entre variables o patrones no lineales en datos con alta dimensionalidad [4].
Por otro lado, el uso de ML, por su naturaleza, no puede ser utilizado directamente para la identificación de las determinantes o ser interpretado con el enfoque causal con el que se suelen analizar las determinantes [6]. Esto se debe a que los algoritmos de ML están optimizados para maximizar la precisión predictiva y no para estimar parámetros estructurales o efectos causales [50]. No obstante, a pesar de tener importantes limitaciones al momento de identificar determinantes, el ML ha mostrado ser útil al momento de formular políticas públicas al proveer una manera de identificar o predecir comportamientos no deseables por la población o actores económicos que pueden transformarse en oportunidades de política para combatir dichos comportamientos y la optimización de recursos [51], [52].
Como resultado de los beneficios de ambos enfoques se fueron abriendo distintas alternativas que intentan reconciliar la capacidad predictiva de los modelos de ML y el enfoque causal de las TT econométricas [6]. Estas técnicas incluyen, pero no se limitan a Causal Forests, Double/Debiased ML y Adaptive Lasso [53], [54], [55]. En consecuencia, este estudio implementa un enfoque triple para el análisis de las Encuestas de Hogares 2022-2023: un modelo Probit tradicional que preserva la interpretabilidad causal, un algoritmo Random Forest que maximiza la capacidad predictiva capturando no linealidades, y un modelo Adaptive Lasso que permite la selección automática de variables a través de la penalización de la suma de los valores absolutos de los parámetros estimados. Esta estrategia metodológica múltiple permite contrastar los resultados desde distintas perspectivas analíticas, manteniendo el rigor en la identificación de determinantes clave del empleo informal y su potencial traslado a políticas públicas efectivas.
3. Datos y metodología
La fuente de datos utilizada para este estudio corresponde a las Encuestas de Hogares 2022 y 2023, realizadas por el Instituto Nacional de Estadística (INE) durante el segundo semestre de cada año [56], [57]. Estas encuestas tienen como objetivo central la recopilación de datos sobre las principales características demográficas y socioeconómicas de la población boliviana, constituyéndose en una herramienta clave para el análisis del mercado laboral y la estructura de ingresos de los hogares [57]. En particular, la encuesta de hogares proporciona información detallada sobre la condición de actividad, ocupación principal y secundaria, así como los ingresos percibidos tanto por trabajadores asalariados como independientes, aspectos fundamentales para el estudio de la informalidad laboral.
Ambas encuestas utilizan un diseño muestral probabilístico, estratificado y multietápico [56], [57]. El tamaño de muestra planificado fue de 12.816 viviendas en 2022 [56] y de 12.948 en 2023 [57], cerciorando representatividad a nivel nacional, urbano, rural y departamental. La riqueza de estas bases de datos permite un análisis profundo de los determinantes de la informalidad en Bolivia, considerando múltiples dimensiones relacionadas con el empleo y las fuentes de ingreso de la población.
Algunos hechos estilizados del empleo informal en el país se pueden observar en la Tabla 1. El empleo formal se asocia con mejores resultados socioeconómicos, evidenciados por mayores ingresos laborales, mayores ingresos del hogar per cápita, mayor nivel educativo y una menor incidencia de pobreza. Además, quienes se desempeñan en este sector tienden a ser en promedio más jóvenes y trabajar una cantidad de horas similar a quienes están en el empleo informal. Este último, en contraste, no solo muestra desventajas en términos de ingresos, educación y pobreza, sino que también concentra a poblaciones con menor acceso a oportunidades laborales, lo que podría estar reforzando dinámicas de exclusión asociadas a características individuales de los empleados informales.
Tabla 1: Hechos Estilizados, Informalidad En Bolivia, 2022 Y 2023
| Indicador | EH 2022 | EH 2023 | ||||
|---|---|---|---|---|---|---|
| Formal | Informal | Diferencia | Formal | Informal | Diferencia | |
| Ingresos (BOB/mes) | ||||||
| Laborales | 4558.52 | 2545.93 | 2012.59*** (41.51) | 3950.95 | 2544.73 | 1406.22*** (64.64) |
| Hogar per cápita | 2532.82 | 1404.52 | 1128.30*** (25.85) | 2322.37 | 1447.89 | 874.48*** (27.12) |
| Horas trabajadas | ||||||
| Semanales (ocup. principal) | 43.37 | 43.24 | 0.13 (0.33) | 44.88 | 43.64 | 1.24*** (0.30) |
| Características sociodemográficas | ||||||
| Edad (años) | 38.96 | 40.27 | -1.31*** (0.27) | 36.86 | 42.98 | -6.12*** (0.23) |
| Años de estudio | 14.04 | 9.27 | 4.77*** (0.08) | 13.31 | 8.9 | 4.41*** (0.07) |
| Mujeres (%) | 39.42 | 44.43 | -5.01*** (0.86) | 38.08 | 46.77 | -8.69*** (0.75) |
| Pertenencia a nación originaria (%) | 20.68 | 33.86 | -13.18*** (0.80) | 22.01 | 37.75 | -15.74*** (0.70) |
| Indicadores sociales | ||||||
| Pobreza (%) | 12.57 | 36.02 | -23.45*** (0.79) | 14.69 | 39.58 | -24.89*** (0.68) |
| Trabajo infantil (%) | 1.46 | 8.38 | -6.92*** (0.44) | 2.69 | 7.35 | -4.66*** (0.35) |
| Trabajo de ancianos (%) | 12.62 | 20.81 | -8.19*** (0.70) | 9.96 | 26.9 | -16.94*** (0.61) |
***p≤0.01; **p≤0.05; *p≤0.10
Fuente: Elaboración propia en base a la EH 2022 y EH 2023
Como se mencionó en la revisión de la literatura, una TT econométrica clásicamente utilizada para encontrar las determinantes del empleo informal es el modelo probit, el cual servirá como punto de partida y comparación. Este es un modelo estadístico para respuestas binarias en el que la probabilidad de respuesta se obtiene evaluando la función de distribución normal acumulada estándar en una función lineal de las variables explicativas [49].
Su descripción en un contexto econométrico tradicional es:
Donde P(y = 1|x) es la probabilidad de que, y sea igual a 1, dado los valores de x, e es un término de error no observable. xβ es una combinación lineal de las regresoras y sus coeficientes. G es la función de distribución normal acumulada estándar y los coeficientes, β se estiman mediante máxima verosimilitud.
En el contexto de esta investigación, se estiman modelos probit para las bases EH 2022 y EH 2023, donde la variable dependiente y representa la condición de pertenencia al empleo informal. Con el objetivo de favorecer la comparabilidad con estimaciones futuras, en particular con el modelo Adaptive Lasso, se opta por normalizar las variables continúas consideradas como posibles determinantes del empleo informal. La variable dependiente toma el valor de y=1 para empleo informal y y=0 para empleo formal. La matriz de regresores x incluye valores normalizados de edad, años de estudio, ingreso per cápita del hogar, ingreso no laboral y número de personas menores de cinco años. Asimismo, se incorporan variables indicadoras (dummies) para género (referencia: hombres), pertenencia a una nación originaria (referencia: no pertenece), área de residencia (referencia: urbana) y departamento (referencia: La Paz).
En la búsqueda de las determinantes del empleo informal, el objetivo principal es estimar los efectos de sobre P(y = 1|x); no obstante, los coeficientes presentan únicamente el signo del efecto parcial, para analizar el efecto de las regresoras sobre la probabilidad de ser un empleado informal se necesita información específica de para cada individuo, de manera que se opta por analizar los efectos marginales promedio para capturar el efecto de las regresoras.
Enfocando la discusión en las técnicas de ML, un modelo reconocido por su adaptabilidad y que no requiere un entrenamiento demasiado complejo es el modelo Random Forest. Este es un clasificador compuesto por un conjunto de clasificadores con estructura de árbol, {h(x, θk), k = 1,...} donde {θk} son vectores aleatorios independientes e idénticamente distribuidos. Cada árbol emite un voto unitario por la clase más popular correspondiente en base a x [58]. Su estimación consiste en construir múltiples árboles de decisión utilizando la técnica de bagging. Además, en cada nodo de cada árbol, se selecciona aleatoriamente un subconjunto de variables predictoras para determinar la mejor partición mediante un top-greedy algorithm, que evalua splits basados en el índice Gini. Los hiperparámetros (número de árboles, predictores por nodo, tamaño mínimo de los nodos finales) son ajustados mediante validación cruzada y la predicción final se obtiene mediante votación mayoritaria entre los árboles del conjunto.
En el contexto de esta investigación, para el modelo Random Forest, la variable dependiente y también representa la condición de pertenencia al empleo informal; sin embargo, las variables independientes utilizadas para entrenar al modelo son diferentes en comparación al modelo probit. Se opta por utilizar un mayor número de variables con el fin de mejorar el entrenamiento y capacidad predictiva del modelo, ya que a diferencia de las TT econométricas no se busca entender las causas o efectos y se pueden obviar aspectos relacionados a la endogeneidad. Las variables son los valores normalizados de la edad, los años de estudio, el ingreso per cápita del hogar, el ingreso laboral, el ingreso no laboral, la brecha de pobreza, la brecha de pobreza extrema, el número total de personas en el hogar, la cantidad de personas menores de 5 años, 18 años y mayores a 54 años, número de personas desempleadas en el hogar y número de personas parte de la población económicamente activa en el hogar. A su vez, se incorporan variables categóricas que capturan dimensiones clave como el género, el estado civil, la pertenencia a una nación originaria, la presencia de alguna discapacidad (solo disponible para la EH 2023), haber migrado en los últimos cinco años (solo disponible para la EH 2023), contar con una ocupación secundaria, la situación de pobreza y pobreza extrema, el área de residencia, el grupo ocupacional principal, y el departamento de residencia.
Los hiperparámetros seleccionados para el modelo Random Forest incluyen 2000 árboles, el número máximo de características a considerar en cada nodo, evaluado en un rango entre 2 y 7, y el tamaño mínimo de las hojas, probado entre valores de 1 y 11. La selección de estos hiperparámetros fue optimizada mediante validación cruzada, además, se utilizó el error out-of-bag para estimar el error de generalización. En lo que respecta a la evaluación del modelo, el conjunto de datos fue dividido en un conjunto de entrenamiento y uno de prueba para evaluar el rendimiento del modelo en datos no vistos.
A diferencia del modelo probit, el objetivo del modelo Random Forest no es estimar los efectos de xj sobre P(y = 1|x), sino encontrar la mejor manera de categorizar la variable dependiente y con la información disponible en x. Sin embargo, Random Forest permite calcular una medida de importancia de las variables, basada en la reducción promedio de impureza en los nodos del bosque generada por cada variable independiente. Si bien estas medidas no permiten inferencias causales ni direccionales, ofrecen evidencia empírica sobre las variables que son más relevantes para la clasificación del empleo informal, y por ello, pueden considerarse como “posibles determinantes” dentro del marco del modelo.
Con el fin de aprovechar las ventajas de las TT econométricas y algunas características de los métodos de ML, se utiliza una técnica que combina componentes de ambas metodologías, el método Adaptive Lasso. Este puede rescatar la estructura econométrica tradicional, manteniendo un enfoque en la interpretabilidad y a su vez, mediante un enfoque basado en la validación cruzada (técnica comúnmente asociada con ML) se puede realizar la selección automática de relaciones no lineales entre las determinantes. Este es un método de regresión que mejora el método Lasso tradicional, introduce pesos adaptativos en la penalización asociada a los parámetros para lograr una selección consistente de variables y reducir el sobreajuste [55]. Esencialmente, este método es una secuencia de estimaciones Lasso con validación cruzada, donde cada aproximación Lasso es al menos tan parsimoniosa como la anterior. Primero se estiman \(\widehat{\beta}^{lasso}\) los coeficientes, luego, se excluyen los coeficientes iguales a cero y se construye la matriz de pesos para las covariables distintas de cero \(\widehat{w}_j=\frac{1}{|\widehat{\beta}^{lasso}|}\) y se estima \(\widehat{\beta}^{*n}\) , adicionalmente para un modelo Adaptive Lasso con tres niveles (el utilizado en esta investigación) se vuelven a estimar los pesos con los coeficientes de la última estimación y se estima \(\widehat{\beta}^{*n}\) nuevamente.
donde λ y λn controlan la fuerza de la penalización y se identifican mediante validación cruzada, a medida que dichos parámetros incrementan el valor óptimo de los coeficientes más pequeños es cero.
En el contexto de esta investigación para la identificación de las relaciones no lineales entre las determinantes se estima un modelo de probabilidad lineal Adaptive Lasso con tres niveles donde λ y λn se eligen mediante validación cruzada con 10 grupos. Como variables independientes se emplean las mismas utilizadas en el modelo probit, incluyendo las potencias hasta el tercer grado de las variables continuas, así como todas las interacciones posibles entre variables continuas y categóricas. Las variables de control no forman parte del proceso de selección penalizado, así que no se consideran las interacciones con estas, pero estas variables sin modificación se mantienen en todas las estimaciones Adaptive Lasso.
Tras identificar las variables relevantes mediante la metodología descrita, se estima un modelo probit que incorpora tanto los términos principales como las potencias e interacciones identificadas por el modelo Adaptive Lasso. Finalmente, se calculan los efectos marginales promedio para capturar los efectos de xj sobre P(y=1|x) considerando nuevas relaciones no lineales entre las determinantes, no comúnmente identificadas en la literatura.
Por último, como parte de la evaluación de los modelos de clasificación, se analizarán las siguientes métricas de desempeño. La sensibilidad, representa la capacidad del modelo para identificar correctamente los casos positivos. La especificidad, representa la capacidad del modelo para identificar correctamente los casos negativos. El porcentaje de observaciones correctamente clasificadas ofrece una medida global de la exactitud predictiva del modelo. El área bajo la curva ROC proporciona una evaluación integral de la capacidad discriminativa del modelo al considerar todos los posibles umbrales de clasificación, un valor de 1 indica que se cuenta con discriminación perfecta de clases y 0.5 sugiere un rendimiento aleatorio. Estas métricas permitirán evaluar de manera comprehensiva el equilibrio entre los diferentes tipos de error de clasificación y el rendimiento general del modelo.
4. Resultados
Los resultados se presentan en el siguiente orden, primero, los efectos marginales promedio del modelo Probit tradicional (con los coeficientes completos en el Apéndice A); luego, las variables más relevantes identificadas mediante la reducción promedio de impureza del Random Forest; a continuación, los efectos marginales del modelo Probit extendido con términos no lineales elegidos mediante el método Adaptive Lasso (con los coeficientes completos en el Apéndice B); y finalmente, la comparación de las métricas de desempeño para todos los modelos estimados.
La Tabla 2 presenta los efectos marginales promedio estimados mediante el modelo Probit para los valores normalizados de las determinantes del empleo informal en Bolivia, utilizando datos de las Encuestas de Hogares (EH) 2022 y 2023. Los resultados muestran patrones consistentes en ambos años: variables como la edad y el género tienen efectos positivos y significativos sobre la probabilidad de informalidad, mientras que los años de estudio y los ingresos del hogar presentan efectos negativos. Destacan las diferencias territoriales, con mayor informalidad en áreas rurales y variaciones significativas por departamento (ej. efectos negativos en Santa Cruz y Beni). La pertenencia a grupos originarios y la cantidad de personas menores a 5 años en el hogar solo fue significativa en 2022.
Tabla 2: Efectos marginales promedio - Modelo Probit, 2022-2023
| Variable | EH 2022 | EH 2023 | ||
|---|---|---|---|---|
| Coef. | Err. Est. | Coef. | Err. Est. | |
| Edad | 0.0463*** | (0.0042) | 0.0520*** | (0.0042) |
| Años de estudio | -0.1147*** | (0.0045) | -0.1438*** | (0.0049) |
| Ingreso del hogar por persona | -0.0725*** | (0.0052) | -0.0503*** | (0.0077) |
| Ingreso no laboral | 0.0315*** | (0.0054) | 0.0269*** | (0.0049) |
| Género (ref. Hombre) | ||||
| Mujer | 0.0738*** | (0.0073) | 0.0691*** | (0.0073) |
| Pertenencia a un grupo originario (ref. No pertenece) | ||||
| Pertenece | 0.0183* | (0.0095) | 0.0003 | (0.0094) |
| Personas menores a 5 años | -0.0147*** | (0.0041) | -0.0038 | (0.0039) |
| Área (ref. urbana) | ||||
| Rural | 0.1299*** | (0.0106) | 0.1364*** | (0.0100) |
| Departamento (ref. La Paz) | ||||
| Chuquisaca | -0.0573*** | (0.0163) | -0.0278* | (0.0151) |
| Cochabamba | 0.0147 | (0.0113) | -0.0119 | (0.0110) |
| Oruro | -0.0023 | (0.0147) | -0.0233 | (0.0144) |
| Potosí | -0.0077 | (0.0149) | -0.0355** | (0.0145) |
| Tarija | -0.0274* | (0.0149) | -0.0055 | (0.0140) |
| Santa Cruz | -0.0554*** | (0.0111) | -0.0483*** | (0.0114) |
| Beni | -0.0543*** | (0.0169) | -0.0428*** | (0.0156) |
| Pando | -0.1005*** | (0.0188) | -0.0049 | (0.0161) |
***p≤0.01; **p≤0.05; *p≤0.10
Fuente: Elaboración propia en base a la EH 2022 y EH 2023
Una perspectiva diferente se puede observar en los resultados del modelo Random Forest, donde las características que mejor ayudan a predecir el empleo informal son los ingresos laborales, los años de estudio, la edad y los ingresos del hogar per cápita, en ese orden, para las EH 2022 y EH 2023.
Tabla 3: Reducción De Impureza Promedio - Random Forest, 2022-2023
| Característica | EH 2022 | EH 2023 |
|---|---|---|
| Ingreso laboral | 0.2408 | 0.2311 |
| Años de estudio | 0.1164 | 0.1243 |
| Edad | 0.0859 | 0.0828 |
| Ingresos del hogar por persona | 0.0590 | 0.0624 |
Fuente: Elaboración propia en base a la EH 2022 y EH 2023
Es relevante reconocer que si bien mediante la perspectiva econométrica tradicional no se suele incluir al ingreso laboral como una determinante, principalmente por los problemas de causalidad reversa y endogeneidad relacionados a utilizarla como variable independiente, esta es la variable asociada con la mayor reducción promedio de las impurezas para ambas encuestas de hogares, reflejando el rol y abriendo la discusión a considerar a los ingresos laborales como una variable especialmente relevante al momento de comprender la decisión de ser un empleado informal. Asimismo, estos resultados refuerzan la importancia en términos de poder predictivo de los años de estudio, la edad y los ingresos del hogar per cápita.
Por otro lado, considerando los resultados del Adaptive Lasso, también se presentan los efectos marginales promedio de los modelos considerando las relaciones no lineales específicas para cada estimación, se observa que hay efectos marginales promedio que se mantiene relativamente iguales, edad, años de estudio, miembros en el hogar menores a cinco años; mientras los efectos de los ingresos del hogar per cápita, ingresos no laborales y pertenecer a una nación originaria varían notablemente.
Las relaciones identificadas mediante el Adaptive Lasso revelan patrones no lineales que ilustran la complejidad de los determinantes de la informalidad. La relación cuadrática en la edad y educación muestra cómo el efecto sobre la informalidad se intensifica progresivamente en grupos de mayor edad y con mayor educación, para los ingresos del hogar, la curva en U invertida revela que el efecto de los ingresos per cápita del hogar reducen a medida que dichos ingresos incrementan. Las interacciones significativas, como el efecto combinado entre género y educación, penaliza particularmente a las mujeres con mayor formación, y la relación entre ingresos per cápita del hogar e ingresos no laborales, destaca cómo estos factores no operan de forma aislada, sino mediante mecanismos interdependientes, con efectos diferenciados para la población originaria, donde la pertenencia a grupos indígenas interactúa con el género y los ingresos per cápita del hogar, configurando un panorama donde la informalidad emerge como resultado de múltiples dinámicas entrelazadas.
Finalmente, comparando las métricas de desempeño de los modelos estimados, se puede observar que el Random Forest supera consistentemente a los demás modelos en capacidad predictiva, mostrando el mejor equilibrio entre sensibilidad y especificidad, junto con un destacado poder discriminatorio (área debajo de la curva ROC cercana al 90%). El Probit, aunque efectivo para identificar casos de informalidad, presenta limitaciones para clasificar correctamente a los trabajadores formales, reflejando las restricciones de los modelos paramétricos ante fenómenos complejos. El Probit con Adaptive Lasso ocupa una posición intermedia, confirmando que los enfoques híbridos mejoran sobre las técnicas tradicionales, aunque aún sin alcanzar el rendimiento de ML. Estos patrones se mantienen estables entre 2022 y 2023, sugiriendo que las diferencias responden a ventajas metodológicas.
Los resultados revelan la naturaleza multifacética de los determinantes de la informalidad en Bolivia. El análisis Probit tradicional identifica patrones consistentes: efectos positivos de edad y género, e impactos negativos de educación e ingresos del hogar. El Random Forest, por su parte, destaca el rol predictivo central de los ingresos laborales, una variable tradicionalmente excluida por problemas de endogeneidad y valida la relevancia de los años de estudio, la edad y los ingresos del hogar per capita. Los modelos híbridos (Probit con Adaptive Lasso) descubren relaciones no lineales clave (efectos cuadráticos en edad y educación, una curva en U invertida para ingresos del hogar, e interacciones significativas como género-educación, genero-ingresos no laborales, genero-originario) que afectan a los efectos marginales promedio de algunas variables. En términos de desempeño predictivo, el Random Forest supera consistentemente a los demás modelos, mientras el Probit muestra limitaciones en especificidad, y los enfoques híbridos ocupan una posición intermedia. Esta evidencia conjunta sugiere que la informalidad surge de dinámicas complejas, normalmente ignoradas en una aproximación basada únicamente en TT econométricas, se muestra que factores económicos, demográficos y territoriales interactúan de manera no lineal, requiriendo aproximaciones analíticas que combinen la capacidad explicativa de los modelos tradicionales con el poder predictivo de técnicas de ML para su mejor comprensión.
Tabla 4: Efectos marginales promedio - Modelo Probit con Adaptive Lasso, 2022-2023
| Variable | EH 2022 | EH 2023 | |||
|---|---|---|---|---|---|
| Coef. | Err. Est. | Coef. | Err. Est. | ||
| Edad | 0.0377*** | (0.0002) | 0.0572*** | (0.0002) | |
| Años de estudio | -0.1048*** | (0.0002) | -0.1410*** | (0.0002) | |
| Ingreso del hogar por persona | -0.1288*** | (0.0004) | -0.0839*** | (0.0003) | |
| Ingreso no laboral | 0.0423*** | (0.0003) | 0.0243*** | (0.0002) | |
| Género (ref. Hombre) | |||||
| Mujer | 0.0772*** | (0.0004) | 0.0757*** | (0.0003) | |
| Pertenencia a un grupo originario (ref. No pertenece) | |||||
| Pertenece | 0.0142*** | (0.0004) | -0.0052*** | (0.0004) | |
| Personas menores a 5 años | -0.0106*** | (0.0002) | -0.0167*** | (0.0002) | |
| Área (ref. urbana) | |||||
| Rural | 0.1111*** | (0.0005) | 0.1240*** | (0.0004) | |
| Departamento (ref. La Paz) | |||||
| Chuquisaca | -0.0346*** | (0.0009) | -0.0023*** | (0.0009) | |
| Cochabamba | 0.0261*** | (0.0005) | 0.0042*** | (0.0005) | |
| Oruro | -0.0034*** | (0.0009) | -0.0093*** | (0.0009) | |
| Potosí | -0.0053*** | (0.0008) | -0.0136*** | (0.0008) | |
| Tarija | -0.0119*** | (0.0008) | 0.0171*** | (0.0008) | |
| Santa Cruz | -0.0427*** | (0.0005) | -0.0346*** | (0.0005) | |
| Beni | -0.0535*** | (0.0010) | -0.0346*** | (0.0009) | |
| Pando | -0.0904*** | (0.0016) | 0.0097*** | (0.0015) | |
***p≤0.01; **p≤0.05; *p≤0.10
Fuente: Elaboración propia en base a la EH 2022 y EH 2023
Tabla 5: Métricas de desempeño - Probit, Random Forest, Probit con Adaptive Lasso, 2022-2023
| Indicador | EH 2022 | EH 2023 | ||||
|---|---|---|---|---|---|---|
| Probit | Random Forest | Probit con Adaptive Lasso | Probit | Random Forest | Probit con Adaptive Lasso | |
| Sensitividad | 0.8510 | 0.8800 | 0.8516 | 0.8279 | 0.8900 | 0.8429 |
| Especificidad | 0.4794 | 0.6700 | 0.5011 | 0.5393 | 0.6500 | 0.5215 |
| Observaciones correctamente clasificadas | 0.7186 | 0.8072 | 0.7267 | 0.7240 | 0.8066 | 0.7272 |
| Área bajo la curva ROC | 0.7689 | 0.8800 | 0.7858 | 0.7803 | 0.8900 | 0.7917 |
Fuente: Elaboración propia en base a la EH 2022 y EH 2023
5. Conclusiones y recomendaciones
Los resultados del modelo Probit identifican como determinantes significativas de la informalidad a la edad, años de estudio, ingresos del hogar per cápita e ingresos no laborales, mientras que pertenecer a un grupo originario o tener menores de cinco años en el hogar no resultan estadísticamente relevantes en este enfoque tradicional. Por su parte, el Random Forest resalta la importancia predictiva de los ingresos laborales (variable tradicionalmente omitida en el Probit) y valida la importancia de los años de estudio, edad e ingresos del hogar per cápita como potenciales determinantes del empleo informal dado su rol central en la clasificación del empleo informal. Finalmente, el Adaptive Lasso revela que las determinantes tradicionales deben analizarse desde un enfoque no lineal, ya que este método al capturar interacciones complejas y potencias de las variables modifica la significancia de variables que pueden ser ignoradas desde una perspectiva tradicional (como el origen étnico y la presencia de niños pequeños). Estos hallazgos subrayan que la comprensión integral del empleo informal exige evaluar no solo variables aisladas, sino también relaciones no lineales y contextos específicos que los modelos lineales tradicionales pasan por alto a su vez que se necesita profundizar en las estructuras teóricas que puedan vincular los ingresos laborales con el empleo informal explícitamente.
Estos hallazgos sugieren diseñar políticas diferenciadas que consideren tanto los determinantes tradicionales como las complejas interacciones identificadas. Para las variables significativas en el modelo Probit (edad, educación e ingresos), se recomiendan programas de capacitación laboral enfocadas en los adultos mayores y programas que favorezcan el logro educativo. Los resultados del Random Forest destacan la necesidad de incorporar los ingresos laborales en el diseño de políticas, proponiendo esquemas de formalización progresiva que ofrezcan beneficios fiscales y de seguridad social adaptados a distintos niveles de ingresos. El análisis no lineal del Adaptive Lasso revela la importancia de políticas con enfoque interseccional, particularmente para grupos originarios y hogares con niños pequeños. La integración de estas aproximaciones metodológicas en el ciclo de políticas públicas puede permitir el diseño de intervenciones más precisas y adaptadas a la compleja realidad del empleo informal en Bolivia.
Para futuras investigaciones, se recomienda, aprovechar la disponibilidad de la Encuesta Continua de Empleo (ECE), ya que incluye variables clave como tipo de contrato y registro tributario que ofrecen la posibilidad de una identificación más precisa del empleo informal, así como utilizar técnicas avanzadas dada su naturaleza de datos rotatorios de panel. Asimismo, futuras investigaciones pueden incorporar modelos como redes neuronales y máquinas de vectores de soporte si se busca mejorar la clasificación de los empleados formales e informales. Asimismo, estos métodos predictivos podrían combinarse con técnicas de inferencia causal (Causal Forests, Double/debiased ML) para evaluar impactos de políticas. La implementación de estos enfoques es viable con los datos existentes y permitiría superar limitaciones de los modelos tradicionales, generando evidencia más robusta sobre los determinantes y dinámicas del empleo informal.
En resumen, el estudio revela que el empleo informal en Bolivia responde a factores complejos, el modelo tradicional Probit confirma el impacto de edad, educación e ingresos; el Random Forest destaca el rol clave de los ingresos laborales; y el modelo Probit con Adaptive Lasso descubre interacciones críticas y no linealidades que se traducen en resaltar la importancia de variables como la pertenencia a grupos originarios y contar con niños pequeños en el hogar. Estos hallazgos demuestran que combinar técnicas econométricas tradicionales con machine learning permite una comprensión más completa del fenómeno, esencial para diseñar políticas efectivas.













