lunes, 18 de octubre de 2010

RapidMiner: Tutorial online + Operadores

Buenas.

Les dejo a continuación un muy buen material acerca de RapidMiner, que ha sido confeccionado por Leonardo M. Tito y Felipe Mullicundo:

"RapidMiner: Tutorial online + Operadores" contiene los siguiente temas:

  • Instalación:
    • Detalla como descargar, instalar y ejecutar RapidMiner.
  • Tutorial de RapidMiner 5.0:
    • Describe paso a paso los 26 ejemplos presentes en el tutorial online de RapidMiner.
  • Anexo: Descripción de los Operadores utilizados en el Tutorial de RM5:
    • Traducción basada en la wiki de RadipMiner, en donde se tratan 75 operadores.











Por último cabe destacar que este documento posee licencia GNU FDL, para permitir y proteger su libre difusión, distribución, modificación y utilización, en pos de su futura evolución y actualización.

Felipe y Leonardo, muchas gracias por seguir compartiendo!!!

Salud.

PD: para descargar el documento seguir este enlace a dataprix...

lunes, 6 de septiembre de 2010

HEFESTO v2.0: On Line & ePub

Buenas.

Después de varias horas de dedicación he terminado de actualizar en su totalidad la versión On Line de HEFESTO que se encuentra en Dataprix: ver hefesto online...

Por otra parte, Nicolas Gutierrez, se ha tomado la molestia de convertir HEFESTO en formato ePub (formato estándar para archivos e-book): descargar hefesto.epub...


Espero les sea útil.
Salud.

PD: gracias Nicolas Gutierrez por compartir.

lunes, 19 de julio de 2010

HEFESTO v2.0

Buenas, me complace mucho anunciarles que ya está listo HEFESTO versión 2.0: "DATA WAREHOUSING: Investigación y Sistematización de Conceptos - HEFESTO: Metodología para la construcción de un Data Warehouse".



Se han hecho muchas actualizaciones tanto en la parte teórica, como en la metodológica.

A continuación un pequeño listado de las secciones nuevas que se han incluido:
  • Query Manager -> Drill-through.
  • Área de Datos.
  • Performance.
  • Claves Subrogadas.
  • Dimensiones Lentamente Cambiantes.
  • Dimensiones Degeneradas.
  • Dimensiones Clustering.
Con respecto a la metodología, en la siguiente imagen se pueden observar cuáles son sus pasos:


También se ha hecho énfasis en la parte estética, así que HEFESTO v 2.0 cuenta con imagenes totalmente renovadas. Por ejemplo:


Por último, quiero destacar que muchas de las actualizaciones se fueron dando gracias a los diferentes feedbacks que he recibido de quienes leyeron la parte teórica y de quienes utilizan la metodología.



Actualización:


Espero les sea útil.
Y ya saben, si les a gustado envien un mail o un comentario.

Salud.

PD: para descargar la versión ePub, seguir este enlace...

viernes, 25 de junio de 2010

Pentaho 3.2 Data Integration: Reseñas

Buenas.
Hace unos días terminé de leer (y hacer los ejercicios!) el libro Pentaho 3.2 Data Integration - Beginner's Guide, escrito por María Carina Roldan.

Tal como lo vengo haciendo, realizaré una serie de reseñas desde diferentes perspectivas:

1) Reseña general: es un libro muy ameno y fácil de leer. Cada tema es abordado con muchísima dedicación apuntando a que la comprensión de lo que se quiere transmitir sea lo más alta posible.
Cabe destacar la cantidad y la calidad de los ejemplos presentes en el libro, como así también el énfasis en detallar qué se hizo y para qué.

Algo principal a remarcar para que quede bien claro, es que María Carina en su libro habla de la Integración de Datos y no solo de "procesos ETL para cargar un DW", lo cual hace que su lectura nos pueda ayudar en muchísimos ámbitos.


2) Reseña detallada: Pentaho 3.2 Data Integration es un paseo por la integración de datos a través de los ejemplos, prácticas, consejos y recomendaciones que nos plantea María Carina, utilizando por supuesto PDI.

A lo largo del libro se tratan temas complejos tales como: expresiones regulares, pasaje de parámetros, ejecución de transformación y trabajos por línea de comandos, xml, manejo de variables, etc, etc.

Se utilizan pasos no convencionales: Fórmula, Búsqueda en flujo de datos, Append streams, Des-Normalización de Fila, If field value is null, Normalización de Fila, Number range, Regex Evaluation, Búsqueda en Base de Datos, Mapeo, etc, etc.

Hay todo un capítulo dedicado a la utilización de código javascript y del paso "Valor Java Script Modificado".
Oto dedicado al manejo de errores y a los pasos "Write to log", "Abort" y "Data Validator".
Y uno más dedicado al armado de un Data Mart: dimensiones degeneradas, dimensiones junk, claves subrogadas, dimensiones lentamente cambiantes, dimensión tiempo.

Finalmente, se introduce y ejemplifica cómo instalar diferentes plugins en PDI, se habla de cómo aumentar la performance en trabajos y transformaciones y de cómo integrar PDI con Pentaho BI Server.

Pentaho 3.2 Data Integration es un material totalmente recomendable tanto para quienes nos dedicamos al BI, como para quienes tengan que implementar técnicas de Integración de Datos.


3) Reseña final: existen muchas tareas en el mundo del IT y del BI que se hacen manualmente casi sin darle la menor importancia y otras tantas que no son siquiera tenidas en cuenta. A través de este libro María Carina nos muestra una serie de ejemplos que nos hace pensar en todos estos casos y cómo sería la transformación o trabajo que deberíamos utilizar.

Sin lugar a duda, este es otro libro de indispensable lectura.



Salud!

lunes, 21 de junio de 2010

Test de Drivers JDBC

Buenas, adjunto a continuación un pequeño programa que utilizamos en eGluBI y sirve para testear un Driver JDBC y su correspondiente URL.

Este programita es bastante simple y se ejecuta por líneas de comandos. Los pasos a seguir son:
  1. Se debe tener instalado JRE 1.4 o posterior y el accesible al SGBD al que pertenece el Driver en cuestión.
  2. Descomprimir el archivo en, digamos [HOME].
  3. Copiar el Driver JDBC a testear en [HOME]\drivers.
  4. Modificar el archivo c.properties colocando la url, driver, usuario y contraseña a testear.
  5. Ejecutar el programa:
    • Si se trata de Window$: entrar en la consola "CMD" o "COMMAND", cambiar al directorio [HOME] y ejecutar el comando: ejecutar.bat
    • Si se trata de GNU/Linux o Unix: entrar en la consola, cambiarse a la carpeta [HOME], asegurarse que los archivos .sh tengan permisos de ejecución con "chmod +x *.sh" y luego ejecutar el comando: sh ejecutar.sh
Si la ejecución de este programita devuelve un error, por ejemplo "java.lang.ClassNotFoundException" verificar si copiamos el Driver correcto en [HOME]\drivers o bien si colocamos mal el nombre del Driver. Pueden ocurrir otros errores pero son bastante autoexplicativos.


Para DESCARGAR el archivo hacer clic aquí...

Salud!

martes, 8 de junio de 2010

Mini videos tutoriales: Eclipse, JBoss Tools / Struts, IReports / Struts

Buenas, a continuación les presento una serie de videos-tutoriales que ha realizado mi colega Mariano Mattío (miembro de eGlu BI) y que ha decidido compartir con la comunidad.

Gracias Mariano.


Esperamos que les sean útiles, y ya saben, cualquier comentario, feedback, agradecimiento, etc, son bienvenidos.


Eclipse:

  1. Introducción y Descarga: link...
  2. Instalación: link...
  3. Layout y nuevo proyecto: link...
  4. Paquetes y primera clase: link..
  5. Clase hija, clase de prueba, ejecución y reescritura de toSting(): link...
  6. Perfiles de ejecución, paso de argumentos, exportación a JAR y ejecución desde consola: link...
  7. Creación y descripción de la BD que se utilizará en adelante mediante un "poblador" automático: link...
  8. Descarga del conector (driver) JDBC de MySQL: link...
  9. Introducción teórica a JDBC: link...
  10. Carga de un driver y conexión a una BD desde Eclipse: link...
  11. Uso de la Metadata de la conexión: link...
  12. Ejecución de sentencias Insert/Update y Delete de forma dinámica: link...
  13. Ejecución de sentencias Select de forma dinámica y recorrido del resultado: link...
Quedan pendientes aún una serie de videos tutoriales, en cuanto esten disponibles actualizaré esta entrada.


JBoss Tools / Struts:

IReports / Struts:

sábado, 8 de mayo de 2010

Dimensiones Degeneradas

El término Dimensión Degenerada, hace referencia a un campo que será utilizado como criterio de análisis y que es almacenado en la tabla de hechos.

Esto sucede cuando un campo que se utilizará como criterio de análisis posee el mismo nivel de granularidad que los datos de la tabla de hechos, y que por lo tanto no se pueden realizar agrupaciones o sumarizaciones a través de este campo. Los "números de orden", "números de ticket", "números de transacción", etc, son algunos ejemplos de dimensiones degeneradas.

La inclusión de estos campos en las tablas de hechos, se lleva a cabo para reducir la duplicación y simplificar las consultas.

Se podría plantear la opción de simplemente incluir estos campos en una tabla de dimensión, pero en este caso estaríamos manteniendo una fila de esta dimensión por cada fila en la tabla de hechos, por consiguiente obtendríamos la duplicación de información y complejidad, que precisamente se pretende evitar.