Classification of kerosene using physicochemical data and multivariate techniques.
In this paper we have compared the abilities of two multivariate classification methods: soft independent modeling of class analogy (SIMCA) and support vector machines (SVM) for kerosene classification using physicochemical data. Two types of kerosene fractions (class A and class B) with different c...
| Publicado en: | Revista CENIC Ciencias Quimicas Vol. 44; no. 1; pp. 13 - 23 |
|---|---|
| Autores principales: | , , , |
| Formato: | Artículo |
| Publicado: |
Centro Nacional de Investigaciones Cientificas
2013
|
| Materias: | |
| Acceso en línea: | Ver este registro en EBSCOhost |
| Sumario: | In this paper we have compared the abilities of two multivariate classification methods: soft independent modeling of class analogy (SIMCA) and support vector machines (SVM) for kerosene classification using physicochemical data. Two types of kerosene fractions (class A and class B) with different chemical compositions were collected from a refinery production. The physicochemical data used as variables for calculation of the models were: initial boiling point, 10 % of recovery, final boiling point, flash point, density, viscosity and sulfur percentage. A training set of 40 samples was used to calculate the supervised classification models. Besides, an independent validation set of 25 samples was used to evaluate their performance. The SIMCA model did not have enough discrimination power, just to distinguish the two types of kerosene fractions. The SVM model, which was calculated using a linear kernel with a capacity parameter of C=10 and 7 support vectors had an adequate sensitivity and selectivity in the training and validation steps. The model complexity (number of support vectors) was 17% of the total training data, therefore a reasonable separation was achieved and sufficient training data existed. SVM model must be considered acceptable on ability to classify and discriminate the two types of kerosene fractions (A and B), using physicochemical data as variables. The generalization ability of SVMs makes this technique attractive for systems having limited number of variables. En este trabajo, se comparó la capacidad de discriminación de dos métodos de clasificación multivariada: modelo blando independiente de analogías de clases (SIMCA, de sus siglas en inglés) y máquinas de vectores soporte (SVM, de sus siglas en inglés) para la clasificación de querosinas a partir de los datos de sus propiedades físico químicas. Se colectaron del proceso de producción de una refinería dos fracciones de querosinas con diferente composición química (clase A y clase B). Las variables físico químicas usadas para el cálculo de los modelos fueron: punto inicial de ebullición, 10 % de recobrado, punto final de ebullición, punto de inflamación, densidad, viscosidad y contenido de azufre (%). Para el cálculo de los modelos supervisados se utilizaron 40 muestras (conjunto de entrenamiento). Para su validación se emplearon 25 muestras (conjunto de validación). El modelo SIMCA no tuvo suficiente poder de discriminación para distinguir las dos fracciones de querosinas. El modelo SVM calculado empleando un kernel lineal, una función de costo C = 10 y siete vectores soporte tuvo una adecuadasensibilidad y selectividad en las etapas de calibración y validación. La complejidad del modelo (número de vectores soporte) fue del 17 %, y se obtuvo una separación adecuada entre las muestras. El modelo SVM descrito es acceptable para clasificar y discriminar fracciones de querosinas sobre la base del empleo de sus propiedades físicoquímicas como variables. La habilidad de generalización que poseen las SVM hace atractiva esta técnica cuando se trabaja con sistemas con un número limitado de variables. |
|---|