Descargar ark nlp - Descargar el código fuente de ark nlp

ark nlp

Otro código fuente

V0.0.9

Descargar

ark-np

ARK-NLP recolecta y reproduce principalmente modelos de PNL de uso común en académicos y trabajos.

ambiente

Python 3
Torch> = 1.0.0, <1.10.0
tqdm> = 4.56.0
jieba> = 0.42.1
Transformers> = 3.0.0
zhon> = 1.1.5
Scipy> = 1.2.0
Scikit-Learn> = 0.17.0

Instalación de PIP

 pip install --upgrade ark-nlp

Estructura de proyectos

ark_nlp	Biblioteca de procesamiento de lenguaje natural de código abierto
ark_nlp.dataset	Encapsular funciones como la carga, el procesamiento y la conversión de datos
ark_nlp.nn	Encapsular algunos modelos completos de redes neuronales
ark_nlp.processor	Segmentación de palabras encapsuladas, diccionario y composición, etc.
ark_nlp.factory	Encapsulación de funciones de pérdidas, optimizadores, funciones de capacitación y predicción
ark_nlp.model	Encapsular modelos de uso común de acuerdo con las tareas de PNL reales, lo que facilita la llamada

Modelo implementado

Modelo previamente capacitado

Modelo	Referencias
Bert	BERT: pretruamiento de transformadores bidireccionales profundos para la comprensión del lenguaje
Ernie1.0	Ernie: representación mejorada a través de la integración del conocimiento
Nezha	Nezha: representación contextualizada neural para la comprensión del idioma chino
Rormador	ROFORMER: Transformador mejorado con incrustación de posición giratoria
Ernie-CTM	Ernie-CTM (Ernie para minería de texto chino)

Clasificación de texto

Modelo	Introducción
RNN/CNN/Gru/LSTM	Estructuras de clasificación de texto clásicas como RNN, CNN, Gru, LSTM, etc.
Bert/Ernie	Clasificación de modelos previamente capacitada comúnmente utilizada

Coincidencia de texto

Modelo	Introducción
Bert/Ernie	Clasificación de coincidencia de modelo previamente previa al estado de uso común
No supervisado	Algoritmo de juego SIMCSE sin supervisión
Cosente	Cosent: un esquema de vector de oración más eficiente que la oración-Bert

Reconocimiento de entidad nombrado

Modelo	Referencias	Código fuente en papel
CRF Bert
Biaffine Bert
El tramo Bert
Puntero global bert	GlobalPointer: manejar NER anidado y no cuello de una manera unificada
Puntero global eficiente bert	GlobalPointer eficiente: menos parámetros, más efectos
W2ner bert	Reconocimiento de entidad con nombre unificado como clasificación de relación de palabras	github

Extracción de relación

Modelo	Referencias	Código fuente en papel
Casco	Un nuevo marco de etiquetado binario en cascada para la extracción de triple relacional	github
PRGC	PRGC: relación potencial y extracción de triple relacional conjunta basada en correspondencia global	github

Extracción de información

Modelo	Referencias	Código fuente en papel
Apurado	Extracción de información universal Uie (Extracción de información universal)	github

Aprendizaje de pocos disparos

Modelo	Referencias	Código fuente en papel
Apurado	Pre-entrenado, aviso y predicto: una encuesta sistemática de métodos de solicitación en el procesamiento del lenguaje natural)

Aplicación práctica

Chip2021-Task3 Estandarización de terminología clínica Tarea de tercer lugar
Chip2021-Task1 Diálogo-Médico Discovery Clinical Discovery First Place
Lista de desafíos de procesamiento de información médica china CBLUE

Usar ejemplo

Para el código completo, consulte la carpeta test .

Clasificación de texto

 import torch
import pandas as pd

from ark_nlp . model . tc . bert import Bert
from ark_nlp . model . tc . bert import BertConfig
from ark_nlp . model . tc . bert import Dataset
from ark_nlp . model . tc . bert import Task
from ark_nlp . model . tc . bert import get_default_model_optimizer
from ark_nlp . model . tc . bert import Tokenizer

# 加载数据集
# train_data_df的columns必选包含"text"和"label"
# text列为文本，label列为分类标签
tc_train_dataset = Dataset ( train_data_df )
tc_dev_dataset = Dataset ( dev_data_df )

# 加载分词器
tokenizer = Tokenizer ( vocab = 'nghuyong/ernie-1.0' , max_seq_len = 30 )

# 文本切分、ID化
tc_train_dataset . convert_to_ids ( tokenizer )
tc_dev_dataset . convert_to_ids ( tokenizer )

# 加载预训练模型
config = BertConfig . from_pretrained ( 'nghuyong/ernie-1.0' ,
                                   num_labels = len ( tc_train_dataset . cat2id ))
dl_module = Bert . from_pretrained ( 'nghuyong/ernie-1.0' , 
                                 config = config )

# 任务构建
num_epoches = 10
batch_size = 32
optimizer = get_default_model_optimizer ( dl_module )
model = Task ( dl_module , optimizer , 'ce' , cuda_device = 0 )

# 训练
model . fit ( tc_train_dataset , 
          tc_dev_dataset ,
          lr = 2e-5 ,
          epochs = 5 , 
          batch_size = batch_size
         )

# 推断
from ark_nlp . model . tc . bert import Predictor

tc_predictor_instance = Predictor ( model . module , tokenizer , tc_train_dataset . cat2id )

tc_predictor_instance . predict_one_sample (待预测文本)

Coincidencia de texto

 import torch
import pandas as pd

from ark_nlp . model . tm . bert import Bert
from ark_nlp . model . tm . bert import BertConfig
from ark_nlp . model . tm . bert import Dataset
from ark_nlp . model . tm . bert import Task
from ark_nlp . model . tm . bert import get_default_model_optimizer
from ark_nlp . model . tm . bert import Tokenizer

# 加载数据集
# train_data_df的columns必选包含"text_a"、"text_b"和"label"
# text_a和text_b列为文本，label列为匹配标签
tm_train_dataset = Dataset ( train_data_df )
tm_dev_dataset = Dataset ( dev_data_df )

# 加载分词器
tokenizer = Tokenizer ( vocab = 'nghuyong/ernie-1.0' , max_seq_len = 30 )

# 文本切分、ID化
tm_train_dataset . convert_to_ids ( tokenizer )
tm_dev_dataset . convert_to_ids ( tokenizer )

# 加载预训练模型
config = BertConfig . from_pretrained ( 'nghuyong/ernie-1.0' , 
                                   num_labels = len ( tm_train_dataset . cat2id ))
dl_module = Bert . from_pretrained ( 'nghuyong/ernie-1.0' , 
                                 config = config )

# 任务构建
num_epoches = 10
batch_size = 32
optimizer = get_default_model_optimizer ( dl_module )
model = Task ( dl_module , optimizer , 'ce' , cuda_device = 0 )

# 训练
model . fit ( tm_train_dataset , 
          tm_dev_dataset ,
          lr = 2e-5 ,
          epochs = 5 , 
          batch_size = batch_size
         )

# 推断
from ark_nlp . model . tm . bert import Predictor

tm_predictor_instance = Predictor ( model . module , tokenizer , tm_train_dataset . cat2id )

tm_predictor_instance . predict_one_sample ([待预测文本A , 待预测文本B ])

Entidad nombrada

 import torch
import pandas as pd

from ark_nlp . model . ner . crf_bert import CRFBert
from ark_nlp . model . ner . crf_bert import CRFBertConfig
from ark_nlp . model . ner . crf_bert import Dataset
from ark_nlp . model . ner . crf_bert import Task
from ark_nlp . model . ner . crf_bert import get_default_model_optimizer
from ark_nlp . model . ner . crf_bert import Tokenizer

# 加载数据集
# train_data_df的columns必选包含"text"和"label"
# text列为文本
# label列为列表形式，列表中每个元素是如下组织的字典
# {'start_idx': 实体首字符在文本的位置, 'end_idx': 实体尾字符在文本的位置, 'type': 实体类型标签, 'entity': 实体}
ner_train_dataset = Dataset ( train_data_df )
ner_dev_dataset = Dataset ( dev_data_df )

# 加载分词器
tokenizer = Tokenizer ( vocab = 'nghuyong/ernie-1.0' , max_seq_len = 30 )

# 文本切分、ID化
ner_train_dataset . convert_to_ids ( tokenizer )
ner_dev_dataset . convert_to_ids ( tokenizer )

# 加载预训练模型
config = CRFBertConfig . from_pretrained ( 'nghuyong/ernie-1.0' , 
                                  num_labels = len ( ner_train_dataset . cat2id ))
dl_module = CRFBert . from_pretrained ( 'nghuyong/ernie-1.0' , 
                                    config = config )

# 任务构建
num_epoches = 10
batch_size = 32
optimizer = get_default_model_optimizer ( dl_module )
model = Task ( dl_module , optimizer , 'ce' , cuda_device = 0 )

# 训练
model . fit ( ner_train_dataset , 
          ner_dev_dataset ,
          lr = 2e-5 ,
          epochs = 5 , 
          batch_size = batch_size
         )

# 推断
from ark_nlp . model . ner . crf_bert import Predictor

ner_predictor_instance = Predictor ( model . module , tokenizer , ner_train_dataset . cat2id )

ner_predictor_instance . predict_one_sample (待抽取文本)

Extracción de relación de casrel

 import torch
import pandas as pd

from ark_nlp . model . re . casrel_bert import CasRelBert
from ark_nlp . model . re . casrel_bert import CasRelBertConfig
from ark_nlp . model . re . casrel_bert import Dataset
from ark_nlp . model . re . casrel_bert import Task
from ark_nlp . model . re . casrel_bert import get_default_model_optimizer
from ark_nlp . model . re . casrel_bert import Tokenizer
from ark_nlp . factory . loss_function import CasrelLoss

# 加载数据集
# train_data_df的columns必选包含"text"和"label"
# text列为文本
# label列为列表形式，列表中每个元素是如下组织的字典
# [头实体, 头实体首字符在文本的位置, 头实体尾字符在文本的位置, 关系类型, 尾实体, 尾实体首字符在文本的位置, 尾实体尾字符在文本的位置]
re_train_dataset = Dataset ( train_data_df )
re_dev_dataset = Dataset ( dev_data_df ,
                         categories = re_train_dataset . categories ,
                         is_train = False )

# 加载分词器
tokenizer = Tokenizer ( vocab = 'nghuyong/ernie-1.0' , max_seq_len = 100 )

# 文本切分、ID化
# 注意：casrel的代码这部分其实并没有进行切分、ID化，仅是将分词器赋予dataset对象
re_train_dataset . convert_to_ids ( tokenizer )
re_dev_dataset . convert_to_ids ( tokenizer )

# 加载预训练模型
config = CasRelBertConfig . from_pretrained ( 'nghuyong/ernie-1.0' ,
                                          num_labels = len ( re_train_dataset . cat2id ))
dl_module = CasRelBert . from_pretrained ( 'nghuyong/ernie-1.0' , 
                                       config = config )

# 任务构建
num_epoches = 40
batch_size = 16
optimizer = get_default_model_optimizer ( dl_module )
model = Task ( dl_module , optimizer , CasrelLoss (), cuda_device = 0 )

# 训练
model . fit ( re_train_dataset , 
          re_dev_dataset ,
          lr = 2e-5 ,
          epochs = 5 , 
          batch_size = batch_size
         )

# 推断
from ark_nlp . model . re . casrel_bert import Predictor

casrel_re_predictor_instance = Predictor ( model . module , tokenizer , re_train_dataset . cat2id )

casrel_re_predictor_instance . predict_one_sample (待抽取文本)

Extracción de relaciones PRGC

 import torch
import pandas as pd

from ark_nlp . model . re . prgc_bert import PRGCBert
from ark_nlp . model . re . prgc_bert import PRGCBertConfig
from ark_nlp . model . re . prgc_bert import Dataset
from ark_nlp . model . re . prgc_bert import Task
from ark_nlp . model . re . prgc_bert import get_default_model_optimizer
from ark_nlp . model . re . prgc_bert import Tokenizer

# 加载数据集
# train_data_df的columns必选包含"text"和"label"
# text列为文本
# label列为列表形式，列表中每个元素是如下组织的字典
# [头实体, 头实体首字符在文本的位置, 头实体尾字符在文本的位置, 关系类型, 尾实体, 尾实体首字符在文本的位置, 尾实体尾字符在文本的位置]
re_train_dataset = Dataset ( train_df , is_retain_dataset = True )
re_dev_dataset = Dataset ( dev_df ,
                         categories = re_train_dataset . categories ,
                         is_train = False )

# 加载分词器
tokenizer = Tokenizer ( vocab = 'nghuyong/ernie-1.0' , max_seq_len = 100 )

# 文本切分、ID化
re_train_dataset . convert_to_ids ( tokenizer )
re_dev_dataset . convert_to_ids ( tokenizer )

# 加载预训练模型
config = PRGCBertConfig . from_pretrained ( 'nghuyong/ernie-1.0' ,
                                          num_labels = len ( re_train_dataset . cat2id ))
dl_module = PRGCBert . from_pretrained ( 'nghuyong/ernie-1.0' , 
                                       config = config )

# 任务构建
num_epoches = 40
batch_size = 16
optimizer = get_default_model_optimizer ( dl_module )
model = Task ( dl_module , optimizer , None , cuda_device = 0 )

# 训练
model . fit ( re_train_dataset , 
          re_dev_dataset ,
          lr = 2e-5 ,
          epochs = 5 , 
          batch_size = batch_size
         )

# 推断
from ark_nlp . model . re . prgc_bert import Predictor

prgc_re_predictor_instance = Predictor ( model . module , tokenizer , re_train_dataset . cat2id )

prgc_re_predictor_instance . predict_one_sample (待抽取文本)

Grupo de discusión

Cuenta oficial: datak

Veloz

ID de WeChat: FK95624

Principales contribuyentes

_xiangking

_Jimmear

_Zrealshadow

Reconocer

Este proyecto se utiliza para recopilar y reproducir los modelos PNL de uso común en académicos y trabajos, e integrarlos en una forma conveniente de llamadas, por lo que muchas implementaciones de código abierto en Internet lo hacen referencia en Internet. Si hay aspectos inapropiados, contáctenos para obtener críticas y consejos. Aquí, gracias a ustedes por su implementación de código abierto.

Expandir

Información adicional

Versión V0.0.9
Tipo Otro código fuente
Fecha de actualización 2025-04-17
tamaño 298.72KB
Proviene de Github

Aplicaciones relacionadas

ARK 4

2024-11-02
Ark Battle Girls juego móvil genuino

2024-02-16
El juego La última arca

2023-09-05
Choque de Arca

2023-03-15
ARCA: encendido

2022-08-30
Arca de Xenias

2022-07-30

Recomendado para ti

chat.petals.dev

Otro código fuente

1.0.0
GPT Prompt Templates

Otro código fuente

1.0.0
GPTyped

Otro código fuente

GPTyped 1.0.5
Google Dorks

Otro código fuente

1.0
shepherd

Otro código fuente

v6.1.6-react-shepherd: Prepare Release (#3063)
mongo express

Otro código fuente

v1.1.0-rc-3
Google Dorks

Otro código fuente

1.0
shepherd

Otro código fuente

v6.1.6-react-shepherd: Prepare Release (#3063)
mongo express

Otro código fuente

v1.1.0-rc-3

Información relacionada Todo