Exige recortar la imagen a mano y falla al validar palabras clave.
Basta una orientación incorrecta para que el sistema no entienda el texto.
Cada falla se traduce en una llamada más a soporte técnico o procesos inconclusos.
Captura
CNN
OCR
Resultado
Una CNN extrae patrones visuales apilando dos operaciones matemáticas: convolución y pooling.
Aplica el filtro bidimensional sobre los 3 canales RGB sumando el sesgo:
Reduce las dimensiones al quedarse con el valor máximo regional:
34,296
Integrado con 1,057 INE Frontales con data aumentada de 7,992, dando un total de 9,049, y enriquecido con 25,247 imágenes como otras identificaciones, para enseñarle al modelo a rechazar documentos que no son una INE.
82.23%
Train (28,197)9.11%
Test (3,125)8.67%
Validate (2,974)384 × 275 px RGB
RMSprop lr=1e-4
Binary Crossentropy
30
| Capa / Orden | Tipo de capa | Filtros / Neuronas | Kernel | Activación | Formato de salida |
|---|---|---|---|---|---|
| Entrada | Input Tensor | Canales RGB | — | — | 275 × 384 × 3 |
| conv2d_8 | Conv2D | 32 filtros | (4,4) | ReLU | 272 × 381 × 32 |
| max_pooling2d_6 | MaxPooling2D | pool (3,3) | — | — | 90 × 127 × 32 |
| conv2d_9 | Conv2D | 64 filtros | (4,4) | SiLU | 87 × 124 × 64 |
| max_pooling2d_7 | MaxPooling2D | pool (3,3) | — | — | 29 × 41 × 64 |
| conv2d_10 | Conv2D | 128 filtros | (4,4) | ReLU | 26 × 38 × 128 |
| max_pooling2d_8 | MaxPooling2D | pool (3,3) | — | — | 8 × 12 × 128 |
| conv2d_11 | Conv2D | 128 filtros | (4,4) | SiLU | 5 × 9 × 128 |
| max_pooling2d_9 | MaxPooling2D | pool (3,3) | — | — | 1 × 3 × 128 |
| flatten | Flatten (Aplanado) | Vector lineal | — | — | 384 elementos |
| dropout | Dropout (Regularización) | rate = 0.05 | — | — | 384 elementos |
| dense | Dense | 512 neuronas | — | ReLU | 512 elementos |
| dropout_1 | Dropout (Regularización) | rate = 0.1 | — | — | 512 elementos |
| Salida | Dense (Clasificador binario) | 1 neurona | — | Sigmoide | 1 (Probabilidad de INE) |
Verificación de Identificaciones mediante Redes Neuronales
Pérdida
Precisión
151
0
37
2,786