Los datos binarios son aquellos cuya unidad solo puede adoptar dos estados posibles. Estos suelen representarse como 0 y 1, de acuerdo con el sistema numérico binario y el álgebra booleana .
Los datos binarios se presentan en muchos campos técnicos y científicos diferentes, donde pueden recibir distintos nombres, como bit (dígito binario) en informática , valor de verdad en lógica matemática y ámbitos relacionados, y variable binaria en estadística.
Fundamentos matemáticos y combinatorios
Una variable discreta que solo puede tomar un estado contiene información cero , y 2 es el siguiente número natural después de 1. Por eso el bit , una variable con solo dos valores posibles, es una unidad primaria estándar de información .
Una colección de n bits puede tener 2ⁿ estados: consulte la numeración binaria para obtener más detalles. El número de estados de una colección de variables discretas depende exponencialmente del número de variables y solo como una ley de potencias del número de estados de cada variable. Diez bits tienen más ( 10²⁴ ) estados que tres dígitos decimales ( 1000 ). 10²³ bits son más que suficientes para representar una información (un número o cualquier otra cosa) que requiere 3²³ dígitos decimales , por lo que la información contenida en variables discretas con 3 , 4, 5, 6, 7, 8, 9, 10 ... estados puede ser reemplazada asignando dos, tres o cuatro veces más bits. Por lo tanto, el uso de cualquier otro número pequeño distinto de 2 no proporciona ninguna ventaja.

Además, el álgebra booleana proporciona una estructura matemática conveniente para la colección de bits, con una semántica de colección de variables proposicionales . Las operaciones del álgebra booleana se conocen como " operaciones bit a bit " en informática. Las funciones booleanas también están bien estudiadas teóricamente y son fácilmente implementables, ya sea con programas informáticos o mediante las denominadas puertas lógicas en electrónica digital . Esto contribuye al uso de bits para representar diferentes datos, incluso aquellos que originalmente no eran binarios.
En estadística
En estadística , los datos binarios son un tipo de datos estadísticos que consisten en datos categóricos , que pueden tomar exactamente dos valores posibles, como "A" y "B", o "cara" y "cruz". También se les llama datos dicotómicos , y un término más antiguo es datos cuantitativos . [ 1 ] Los dos valores a menudo se denominan genéricamente "éxito" y "fracaso". [ 1 ] Como una forma de datos categóricos, los datos binarios son datos nominales , lo que significa que los valores son cualitativamente diferentes y no se pueden comparar numéricamente. Sin embargo, los valores se representan frecuentemente como 1 o 0, lo que corresponde al conteo del número de éxitos en un solo ensayo: 1 (éxito…) o 0 (fracaso); véase § Conteo . De manera más intuitiva, los datos binarios pueden representarse como datos de conteo .
A menudo, los datos binarios se utilizan para representar uno de dos valores conceptualmente opuestos, por ejemplo:
- el resultado de un experimento ("éxito" o "fracaso")
- la respuesta a una pregunta de sí o no ("sí" o "no")
- presencia o ausencia de alguna característica ("está presente" o "no está presente")
- la verdad o falsedad de una proposición ("verdadera" o "falsa", "correcta" o "incorrecta")
Sin embargo, también puede utilizarse para datos que se supone que tienen solo dos valores posibles, incluso si no son conceptualmente opuestos o no representan conceptualmente todos los valores posibles en el espacio. Por ejemplo, los datos binarios se utilizan a menudo para representar las opciones partidistas de los votantes en las elecciones en Estados Unidos, es decir, republicano o demócrata . En este caso, no hay ninguna razón inherente por la que solo deban existir dos partidos políticos , y de hecho, existen otros partidos en Estados Unidos, pero son tan minoritarios que generalmente se ignoran. Modelar datos continuos (o datos categóricos de más de dos categorías) como una variable binaria para fines de análisis se denomina dicotomización (creación de una dicotomía ). Como toda discretización, implica un error de discretización , pero el objetivo es aprender algo valioso a pesar del error: tratarlo como insignificante para el propósito en cuestión, pero recordando que no se puede asumir que sea insignificante en general.
Variables binarias
Una variable binaria es una variable aleatoria de tipo binario, es decir, con dos valores posibles. Las variables binarias independientes e idénticamente distribuidas (i.i.d.) siguen una distribución de Bernoulli , pero, en general, los datos binarios no tienen por qué provenir de variables i.i.d. El recuento total de variables binarias i.i.d. (o, equivalentemente, la suma de variables binarias i.i.d. codificadas como 1 o 0) sigue una distribución binomial , pero cuando las variables binarias no son i.i.d., la distribución no tiene por qué ser binomial.
Cálculo
Al igual que los datos categóricos, los datos binarios se pueden convertir en un vector de datos de conteo escribiendo una coordenada para cada valor posible y contando 1 para el valor que ocurre y 0 para el valor que no ocurre. [ 2 ] Por ejemplo, si los valores son A y B, entonces el conjunto de datos A, A, B se puede representar en conteos como (1, 0), (1, 0), (0, 1). Una vez convertidos a conteos, los datos binarios se pueden agrupar y los conteos se pueden sumar. Por ejemplo, si el conjunto A, A, B se agrupa, los conteos totales son (2, 1): 2 A y 1 B (de 3 ensayos).
Dado que solo hay dos valores posibles, esto se puede simplificar a un único conteo (un valor escalar) considerando un valor como "éxito" y el otro como "fracaso", codificando un valor de éxito como 1 y de fracaso como 0 (usando solo la coordenada para el valor de "éxito", no la coordenada para el valor de "fracaso"). Por ejemplo, si el valor A se considera "éxito" (y por lo tanto B se considera "fracaso"), el conjunto de datos A, A, B se representaría como 1, 1, 0. Cuando esto se agrupa, los valores se suman, mientras que el número de intentos generalmente se registra implícitamente. Por ejemplo, A, A, B se agruparía como 1 + 1 + 0 = 2 éxitos (deensayos). En sentido contrario, contar datos conson datos binarios, con dos clases: 0 (fallo) o 1 (éxito).
Los recuentos de variables binarias i.i.d. siguen una distribución binomial, con el número total de ensayos (puntos en los datos agrupados).
Regresión
El análisis de regresión sobre resultados predichos que son variables binarias se conoce como regresión binaria ; cuando los datos binarios se convierten en datos de conteo y se modelan como variables i.i.d. (de modo que tengan una distribución binomial), se puede utilizar la regresión binomial . Los métodos de regresión más comunes para datos binarios son la regresión logística , la regresión probit o tipos relacionados de modelos de elección binaria .
De manera similar, los recuentos de variables categóricas i.i.d. con más de dos categorías pueden modelarse con una regresión multinomial . Los recuentos de datos binarios no i.i.d. pueden modelarse con distribuciones más complejas, como la distribución beta-binomial (una distribución compuesta ). Alternativamente, la relación puede modelarse sin necesidad de modelar explícitamente la distribución de la variable de salida utilizando técnicas de modelos lineales generalizados , como la cuasi-verosimilitud y un modelo cuasibinomial ; véase Sobredispersión § Binomial .
En informática

Como las computadoras modernas están diseñadas para operaciones y almacenamiento binarios, los datos informáticos son datos binarios. Cada bit se almacena en hardware que guarda uno de dos estados. [ a ] [ 3 ]
Generalmente, un ordenador accede a la memoria como una secuencia de ubicaciones de memoria que constan de un número fijo de bits (a menudo un byte de 8 bits ), pero esto varía según el hardware de memoria. También se suelen definir agrupaciones de nivel superior. Por ejemplo, una palabra normalmente se refiere a un grupo de bytes, y un grupo de palabras podría denominarse palabra larga o palabra cuádruple .
Aunque los datos binarios pueden interpretarse como puramente numéricos, algunos datos son más abstractos y representan otros conceptos basados en un esquema de correspondencia. Por ejemplo, la memoria puede contener instrucciones informáticas que controlan el ordenador (es decir, mediante un programa informático ).
La memoria también puede contener datos que representan texto mediante una codificación de caracteres que codifica información legible para humanos . Si bien todos los datos informáticos son binarios, en la práctica, los datos binarios generalmente excluyen los datos de texto ( texto plano ). Aunque técnicamente los datos de texto son binarios (como todos los datos informáticos), se distingue entre los datos codificados como texto y los que no lo están. El contenido que representa texto puede ser binario, como una imagen de texto, pero solo los datos almacenados como caracteres codificados se consideran datos de texto. Todos los demás datos se clasifican como binarios (no textuales).
Véase también
Notas
- ↑ En un dispositivo biestable como un flip-flop
Referencias
- 1 2 Collett 2002 , pág. 1.
- ↑ Agresti, Alan (2012). "1.2.2 Distribución multinomial". Análisis de datos categóricos (3.ª ed.). Wiley. pág. 6. ISBN 978-0470463635.
- ↑ Gul, Najam (18 de agosto de 2022). "¿Cómo se almacenan los diferentes tipos de datos en forma de 0 y 1?" . Curiosity Tea . Archivado del original el 5 de enero de 2023 . Recuperado el 5 de enero de 2023 .
Collett, David (2002). Modelado de datos binarios (Segunda edición). CRC Press. ISBN 9781420057386.
- Tipos de datos estadísticos