Mejores modelos NER en 2026: spaCy, GLiNER, Transformers y LLMs
Traducción automática Este artículo se tradujo automáticamente a partir de la versión original en inglés.
El reconocimiento de entidades con nombre (NER) encuentra y etiqueta fragmentos de texto, como personas, empresas y códigos de producto. Esta página está dirigida a ingenieros que deben elegir un enfoque de extracción para una carga de trabajo de producción. Ofrece un punto de partida que puedes probar con tu schema, tus documentos y tus restricciones operativas.
Usa spaCy para etiquetas estables y pipelines rápidos. Elige GLiNER cuando las etiquetas cambien con frecuencia, un bi-encoder cuando un inventario grande de etiquetas pueda reutilizar embeddings almacenados en caché, o un clasificador de tokens basado en Transformer con fine-tuning cuando dispongas de ejemplos etiquetados. Usa extracción estructurada basada en LLM cuando necesites un registro complejo en lugar de una lista sencilla de fragmentos.
Última revisión: 17-08-2026. Criterios de selección: estabilidad de las etiquetas, inventario de etiquetas, salida en forma de fragmentos frente a registros, idioma, datos supervisados, latencia, normalización y coste de revisión.
Tabla de decisión
| Necesidad | Mejor punto de partida | Motivo |
|---|---|---|
| NER rápido con etiquetas conocidas | spaCy | Pipelines maduros, buena ergonomía, despliegue rápido en CPU e integración con reglas. |
| Etiquetas nuevas sin entrenamiento completo | GLiNER | La extracción condicionada por etiquetas funciona bien cuando cambia el conjunto de etiquetas. Empieza con descripciones claras de los tipos, no con nombres aislados. |
| Inventario grande y reutilizable de etiquetas | GLiNER bi-encoder | Puede precalcular y almacenar en caché los embeddings de las etiquetas en lugar de codificarlas con cada documento. |
| Entidades y relaciones en una sola pasada | Candidato GLiNER-Relex | Extrae conjuntamente los tipos de entidad y de relación. Compáralo con fases separadas usando el schema de relaciones objetivo. |
| Entidades además de campos documentales o clasificación | GLiNER2 | Su interfaz de schema combina reconocimiento de entidades, clasificación y tareas de extracción estructurada. |
| Entidades anidadas o solapadas | Decodificador compatible con anidamiento, incluido GLiNER con flat_ner=False | La decodificación plana suprime los solapamientos. Prueba los fragmentos anidados con anotaciones que contengan los patrones de solapamiento esperados. |
| Extracción multilingüe o en varios scripts | GLiNER-X o baseline XLM-R | Ningún modelo gana en todos los idiomas. Prueba cada idioma objetivo y la redacción de sus descripciones de tipos. |
| Etiquetas de dominio estables con fragmentos etiquetados representativos | Clasificador de tokens con fine-tuning o pipeline de spaCy | Establece un baseline supervisado y compara el exact-span F1, la latencia y el coste en tu conjunto de dominio. |
| Campos implícitos, entre frases o estructurados | Candidato basado en LLM o híbrido | Los structured outputs limitan la forma de la respuesta, no la corrección de la extracción. Valida la precisión por campo en un conjunto de prueba del dominio. |
| PII sensible o flujo regulado | Presidio más candidato GLiNER2-PII | Combina la salida del modelo con comprobaciones deterministas, controles de redacción y revisión. |
Clases de herramientas
| Clase | Ventaja | Desventaja | Adecuado para |
|---|---|---|---|
| NER de spaCy | Rápido, adecuado para producción y consciente de reglas | Necesita entrenamiento o reglas para etiquetas personalizadas | Etiquetas conocidas en sistemas de alto rendimiento. |
| GLiNER | Etiquetas flexibles en inferencia | La calidad depende de la redacción de las etiquetas y del desajuste con el dominio | Iteración rápida de ontologías y etiquetas long-tail. |
| GLiNER bi-encoder | Los embeddings de etiquetas almacenados en caché permiten escalar ontologías grandes | Los beneficios dependen de la reutilización de etiquetas y de la forma de la carga de trabajo | Inventarios reutilizados de decenas a miles de etiquetas. |
| GLiNER2 | Extracción de schema multitarea | Cada tarea y el schema combinado aún requieren evaluación | Entidades, clasificación y campos estructurados. |
| GLiNER-Relex | Extracción conjunta de entidades y relaciones | Modelo más reciente que necesita comparación específica por tarea | Schemas explícitos de entidad-relación. |
| Clasificador de tokens basado en Transformer | Alta precisión supervisada | Requiere fragmentos etiquetados y reentrenamiento | Extracción estable de dominio con suficientes datos. |
| Extracción con LLM | Flexibilidad del schema y capacidad de razonamiento | Mayor latencia, coste y no determinismo | Registros complejos, valores implícitos y flujos de bajo volumen. |
| Reglas y diccionarios | Comportamiento determinista de matching | Recall frágil | Cumplimiento, identificadores, códigos de producto y post-filters. |
Cómo elegir
Empieza por el schema de entidades, no por el modelo.
Si las etiquetas son estables y dispones de ejemplos representativos, aplica fine-tuning a un clasificador de tokens. Compáralo en un conjunto de dominio reservado para evaluación. Predice etiquetas de tokens sin generación autoregresiva. La latencia y el coste siguen dependiendo del modelo, el hardware, el tamaño del batch y el stack de serving.
Si las etiquetas cambian cada semana, usa GLiNER o un extractor basado en LLM mientras se estabiliza la ontología. Escribe una descripción breve del tipo para cada etiqueta ambigua. La investigación reciente sobre NER hard zero-shot muestra que las descripciones mejoran la generalización y evitan confundir la filtración de etiquetas con capacidad zero-shot. El objetivo es aprender cómo debe ser el schema antes de invertir presupuesto en anotación.
Si reutilizas un inventario grande de etiquetas, evalúa primero un bi-encoder antes que un encoder conjunto de etiquetas y texto. El artículo sobre GLiNER bi-encoder informa de un micro-F1 de 61,5 en CrossNER. También informa de hasta 130 veces más throughput con 1.024 etiquetas y embeddings precalculados bajo sus condiciones de prueba con H100. Estos resultados identifican un comportamiento de escalado. No estiman el rendimiento de otra carga de trabajo de producción.
Si los documentos abarcan varios idiomas, haz benchmark de cada idioma y script objetivo. OpenNER 1.0 no encontró un único modelo que fuese el mejor en toda su colección de 52 idiomas. Prueba tanto descripciones de tipos en inglés como localizadas, porque el texto de la etiqueta forma parte de la entrada del modelo.
Si la salida es un registro estructurado en lugar de fragmentos, usa un LLM con structured outputs o un pipeline híbrido. LangExtract resulta útil cuando cada extracción debe poder vincularse con su ubicación de origen. NuExtract es una opción self-hosted para la extracción multimodal de documentos. Ambos necesitan evaluación a nivel de campo en los documentos objetivo.
Muchas tareas de extracción empresarial no son NER puro. «Encuentra las partes, las obligaciones, la fecha de entrada en vigor, la cláusula de rescisión y la ley aplicable» es comprensión documental con campos de entidades.
Para PII, usa un framework de PII como Presidio como capa de integración y redacción. Trata GLiNER2-PII como candidato de modelo, no como una decisión de compliance. Mide el recall en los formatos sensibles, idiomas y documentos que procesará el sistema.
Pipeline de producción
Un pipeline de extracción de producción suele añadir fases alrededor del modelo:
- Extracción de candidatos: spaCy, GLiNER, modelo Transformer, LLM, reglas o una combinación.
- Normalización opcional o entity linking: asigna los fragmentos a IDs canónicos, códigos de producto, usuarios, empresas o entradas de la ontología.
- Validación y revisión: rechaza etiquetas imposibles, aplica las restricciones del schema, elimina fragmentos duplicados y deriva los casos inciertos a revisión.
La normalización convierte el texto extraído en datos de producto útiles. Encontrar el fragmento «Apple» es solo el primer paso. El sistema aún debe decidir si significa la empresa, la fruta, una familia de productos o un ticker bursátil, y después asignarle un ID estable.
Checklist de evaluación
Mide algo más que el F1 a nivel de entidad:
- F1 de fragmentos exactos
- F1 de fragmentos relajados
- matriz de confusión de etiquetas
- gestión de entidades anidadas
- precisión de la normalización de entidades
- sensibilidad a la descripción del tipo y al idioma de la etiqueta
- segmentación por idioma, script y formato documental
- falsos positivos por etiqueta
- calibración de confianza
- latencia y coste por documento
- tasa de correcciones humanas
Mantén el conjunto de prueba separado del diseño del schema y del ajuste de umbrales. Informa del número de documentos y menciones de entidades por etiqueta. Usa intervalos de confianza a nivel de documento cuando las menciones repetidas en un mismo documento puedan inflar la certeza.
Lecturas recomendadas
- Guía de NER 2026 cubre encoders, LLMs y la arquitectura de producción de tres niveles.
- Razonamiento guiado por schema es relevante cuando NER se convierte en extracción estructurada.
Referencias
- Documentación de GLiNER
- Artículo sobre GLiNER bi-encoder: embeddings de etiquetas almacenados en caché para inventarios grandes.
- Documentación de GLiNER2
- Artículo sobre GLiNER-Relex: extracción conjunta de entidades y relaciones.
- Artículo sobre ZeroNER: evaluación hard zero-shot con descripciones de tipos.
- Artículo sobre OpenNER 1.0: evaluación multilingüe y multi-ontología de NER.
- LangExtract: extracción con LLM fundamentada en la fuente.
- NuExtract: extracción multimodal self-hosted.
- Presidio: framework de detección y anonimización de PII.
- Artículo sobre GLiNER2-PII: candidato de modelo multilingüe para PII.
- Documentación de entidades con nombre de spaCy
- Guía de clasificación de tokens de Hugging Face
- Guía de structured outputs de OpenAI