Indicadores de calidad de la información en la anonimización de bases de datos de estadísticas oficiales

2021-05-312021-05-312021-04-261668-5008http://hdl.handle.net/2133/20823Los operativos estadísticos tienen por objetivo recolectar datos de unidades de observación que pueden estar constituidas por personas, hogares, empresas u otros objetos. Estos datos proveen información que, para el caso de las estadísticas oficiales, proporcionan elementos importantes para la evaluación de políticas implementadas y para la toma de decisiones a futuro. Si bien este es el objetivo primario, no puede desconocerse que existe una marcada tendencia en aumento a la difusión de la información a la sociedad para que la misma utilice los datos para analizarlos y poder obtener sus propias conclusiones. De esta forma, en los últimos tiempos, el término datos abiertos tuvo una expansión significativa, al punto tal que existen portales oficiales que contienen datos a los cuales el público en general puede acceder. Por otra parte, la Ley N° 17.622 menciona la obligación de respetar el secreto estadístico en la divulgación de los operativos que se llevan a cabo. De esta forma, existe una contraposición entre ambas posturas, datos abiertos versus secreto estadístico, que es importante a tener en cuenta para buscar soluciones que permitan brindar información sin violar el secreto estadístico. Es por este motivo, que se estudian distintas alternativas que se engloban dentro del término anonimización. Se propone utilizar métodos de anonimización perturbadores, los cuales modifican los datos observados de las unidades para evitar que un intruso pueda detectar, con información secundaria, la identidad de la misma, lo que provocaría que el organismo que difunde la información violase la ley mencionada. Se evalúan las técnicas de perturbación que adicionan un ruido aleatorio a los datos y la de microagregación, que asignan un valor representativo a todas las unidades que forman parte de un grupo de unidades determinado por la cercanía de las mismas. Se comparan los métodos propuestos a través de medidas que dan cuenta de la distorsión que producen en las estimaciones de ciertos parámetros la aplicación de los métodos de perturbación a los datos originales. En el presente trabajo, se evalúan ciertos escenarios de anonimización sobre la base usuario de la ENGHO publicada por el INDEC, utilizando las bases de pesos replicados para la estimación de ciertos parámetros que cuantifican el error muestral. En general, los métodos que adicionan un ruido aleatorio no correlacionado presentan mejores resultados que sus competidores, y más consistentes que los que produce el método de microagregación.Statistical operations have the objective of collecting data from observation units that can be made up of people, houses, companies or other objects. These data, in the case of official statistics, provide important elements for the evaluation of implemented policies and for future decision-making. Although this is the primary objective, it cannot be ignored that there is a growing trend towards the dissemination of information to society so that private users can analyze the data and be able to obtain their own conclusions. In this way, in recent times, the term open data has had a significant expansion, to the point that there are official portals that contain data that the general public can access to. On the other hand, Law No. 17,622 mentions the obligation to respect statistical secrecy in the disclosure of operations carried out. In this way, there is a contrast between both positions, open data versus statistical secrecy, which is important to take into account to find solutions that allow information to be provided without violating statistical secrecy. It is for this reason that different alternatives that are included within the term anonymization are studied. It is proposed to use perturbative anonymization methods, which modify the observed data of the units to prevent an intruder from detecting, with secondary information, the identity of the unit, which would cause the organization that disseminates the information to violate the mentioned law. Perturbative techniques that add random noise to the data and the method of microaggregation are evaluated. Microaggregation assigns a representative value to all the units that are part of a group of units determined by their proximity. The proposed methods are compared through measurements that account for the distortion produced in the estimates of certain parameters by the application of the perturbative methods to the original data. In this work, certain anonimization scenarios are evaluated on the database of the ENGHO published by the INDEC, using the replicated weight bases for the estimation of certain parameters that quantify the sampling error. In general, the methods that add uncorrelated random noise present better results than their competitors, and more consistent than those produced by the microaggregation method.application/pdfspaopenAccessestadísticas oficialesanonimizaciónindicadores de calidadOfficial statisticsanonymisationquality indicatorsIndicadores de calidad de la información en la anonimización de bases de datos de estadísticas oficialesconferenceObjectFacultad de Ciencias Económicas y Estadística. Universidad Nacional de RosarioAtribución – No Comercial – Compartir Igual (by-nc-sa)