Thursday, October 17, 2013
Hadoop
What Hadoop is.
Simply put, it's an Apache open source project that allows users to perform highly intensive data analytics on structured and unstructured data across hundreds or thousands of nodes that are local or geographically dispersed. Hadoop was designed to ingest mammoth amounts of unstructured data and, through its global file system (Hadoop Distributed File System), distribute workloads across a vast network of independent compute nodes to rapidly map, sort and categorize data to facilitate big data analytical queries.
Hadoop was also designed to natively work with the internal disk resources in each of the independent compute nodes within its clustered framework for cost efficiency and to ensure that data is always available locally for the processing node. Jobs are managed and delegated across the cluster farms, whereby data is parsed, classified and stored on local disk. One block of data is written to the local disk, and two are replicated for redundancy. Data copies are readable so they can be used for processing tasks.
In determining the answer to the question, we have to consider that Hadoop is disk-agnostic; that means SAN and NAS resources can be used as the primary storage layer to service Hadoop workloads. But a natural follow-up question is this: Will SAN and NAS storage be the most cost-effective way to deploy Hadoop? If a Hadoop implementation will be confined to one or two locations, the benefits of managing a centralized storage resource should make sense, especially if an existing array has already been depreciated.
Hadoop implementation
Simply put, it's an Apache open source project that allows users to perform highly intensive data analytics on structured and unstructured data across hundreds or thousands of nodes that are local or geographically dispersed. Hadoop was designed to ingest mammoth amounts of unstructured data and, through its global file system (Hadoop Distributed File System), distribute workloads across a vast network of independent compute nodes to rapidly map, sort and categorize data to facilitate big data analytical queries.
Hadoop was also designed to natively work with the internal disk resources in each of the independent compute nodes within its clustered framework for cost efficiency and to ensure that data is always available locally for the processing node. Jobs are managed and delegated across the cluster farms, whereby data is parsed, classified and stored on local disk. One block of data is written to the local disk, and two are replicated for redundancy. Data copies are readable so they can be used for processing tasks.
In determining the answer to the question, we have to consider that Hadoop is disk-agnostic; that means SAN and NAS resources can be used as the primary storage layer to service Hadoop workloads. But a natural follow-up question is this: Will SAN and NAS storage be the most cost-effective way to deploy Hadoop? If a Hadoop implementation will be confined to one or two locations, the benefits of managing a centralized storage resource should make sense, especially if an existing array has already been depreciated.
Hadoop implementation
Disaster Recovery and Virtualization
- Virtual disaster recovery FAQ
- Virtualization and disaster recovery planning: A guide on storage and server virtualization
- What you need to know about VMware disaster recovery and virtual DR
- Implementing snapshot technology in concert with backup
- Disaster recovery methods for virtual servers
- VM data protection: When snapshots just aren’t enough
- Snapshot technology: The role of snapshots in today's backup environments
- Relying on snapshots and replication in a backup and recovery strategy
- Use a Virtual Storage Appliance for Remote Site Data Protection
- NetApp Brings Private Storage to Amazon Web Services
Friday, June 8, 2012
Amenazas informáticas -los peores equívocos de los usuarios
Un estudio actual de la empresa G Data Software AG demuestra que gran parte de los usuarios de Internet están poco informados de los riesgos al navegar, sea buscando información, por comunicarse o por entretenimiento.
Llama la atención cómo la mayoría de ellos valoran equivocadamente el grado de exposición a las amenazas informáticas y acusan, de modo predominante, conocimientos mínimos de los tipos de amenazas virales y demás código malicioso -y sobre todo, de su diseminación e infección global.
Para colmo, muchos creen (por lo menos gran parte de los plurinacionales) que un antivirus les protege contra todo... inclusive la pérdida de datos!
Nota a esos creyentes:
Vayan comprando velas para Santa Data o quien sea el santo o virgen al que recen para que les salve los datos!
Para colmo, muchos creen (por lo menos gran parte de los plurinacionales) que un antivirus les protege contra todo... inclusive la pérdida de datos!
Nota a esos creyentes:
Vayan comprando velas para Santa Data o quien sea el santo o virgen al que recen para que les salve los datos!
Equívoco primario"Noto fácilmente cuándo mi PC está infectado"Sólo 7 % de todos los usuarios internetianos realmente lo nota, el resto cree notarlo |
||
Equívoco II"Ediciones gratuitas (light-personal) de software gratuito y ediciones empresariales de software con costo ofrecen la misma protección antiviral"
Aqui se equivoca el 83 %!
|
||
Equívoco III"Gran parte de las amenazas informáticas se distribuyen por correo digital"
54 % de los usuarios está equivocado!
|
||
Equívoco IV"Mi PC no puede ser infectado por código malicioso tras la simple visita a una página en internet"
Al fin y al cabo, al 52 % le es conocido este método de infección...
|
||
Equívoco V"La infección es mayor en los sitios pornográficos"
Eso creen 37 % y en eso se equivocan
|
||
Equívoco V:"Si no descargo documentos infectados, no puede ser infectado mi PC"
22
% de todos los usuarios creen eso, pero cómo pueden reconocer los infectados antes de descargarlos o copiarlos?
|
||
Equívoco VII"El PC de uso no empresarial (privado) no es un blanco atractivo para la mafia internetiana"
De cualquier modo, sólo un 8 % cree eso!
|
||
Labels:
estadísticas,
Seguridad Informática,
web security
Monday, July 11, 2011
Amazon Web Services
http://aws.amazon.com/es/ec2/
Amazon Elastic Compute Cloud (Amazon EC2) es un servicio web que proporciona capacidad informática con tamaño modificable en la nube. Se ha diseñado con el fin de que la informática web resulte más sencilla a los desarrolladores.
La sencilla interfaz de servicios web de Amazon EC2 permite obtener y configurar capacidad con una fricción mínima. Proporciona un control completo sobre sus recursos informáticos y permite ejecutarse en el entorno informático acreditado de Amazon. Amazon EC2 reduce el tiempo necesario para obtener e iniciar nuevas instancias de servidor a cuestión de minutos, lo que permite escalar con rapidez su capacidad (aumentarla o reducirla) cuando cambien los requisitos informáticos. Amazon EC2 cambia la economía de la informática al permitirle pagar sólo por la capacidad que realmente utilice. Amazon EC2 proporciona a los desarrolladores las herramientas necesarias para crear aplicaciones resistentes a errores y para aislarse de los casos de error más comunes.
La sencilla interfaz de servicios web de Amazon EC2 permite obtener y configurar capacidad con una fricción mínima. Proporciona un control completo sobre sus recursos informáticos y permite ejecutarse en el entorno informático acreditado de Amazon. Amazon EC2 reduce el tiempo necesario para obtener e iniciar nuevas instancias de servidor a cuestión de minutos, lo que permite escalar con rapidez su capacidad (aumentarla o reducirla) cuando cambien los requisitos informáticos. Amazon EC2 cambia la economía de la informática al permitirle pagar sólo por la capacidad que realmente utilice. Amazon EC2 proporciona a los desarrolladores las herramientas necesarias para crear aplicaciones resistentes a errores y para aislarse de los casos de error más comunes.
Esta página contiene las siguientes categorías de información. Haga clic para saltar:
Friday, July 8, 2011
CRM
Customer relationship management [CRM] (de la sigla del término en inglés "Customer Relationship Management"), puede poseer varios significados:
1 En la actualidad
2 La venta telefónica
3 CRM Pagado y CRM Gratuito
Understanding CRM
Sales Demo | CRM Overview Demo
- La administración basada en la relación con los clientes. CRM, es un modelo de gestión de toda la organización, basada en la orientación al cliente (u orientación al mercado según otros autores), el concepto más cercano es Marketing relacional (según se usa en España) y tiene mucha relación con otros conceptos como: Clienting, Marketing 1x1, Marketing directo de base de datos, etcétera.
- La administración de la relación con los clientes. CRM, es sinónimo de Servicio al cliente, o de Gestión de clientes. Con este significado CRM se refiere sólo a una parte de la gestión de la empresa.
- Software para la administración de la relación con los clientes. Sistemas informáticos de apoyo a la gestión de las relaciones con los clientes, a la venta y al marketing. Con este significado CRM se refiere al sistema que administra un Data warehouse (Almacén de Datos) con la información de la gestión de ventas y de los clientes de la empresa.
1 En la actualidad
2 La venta telefónica
3 CRM Pagado y CRM Gratuito
Understanding CRM
Sales Demo | CRM Overview Demo
MES
Manufacturing Execution Systems (MES), are information technology systems that manage manufacturing operations in factories. Over the years, international standards and models have refined the scope of such systems in terms of activities, that typically include:
- Management of product definitions. This may include storage, version control and exchange with other systems of master data like product production rules, bill of material, bill of resources, process set points and recipe data all focused on defining how to make a product. Management of product definitions can be part of Product lifecycle management
- Management of resources. This may include registration, exchange and analysis of resource information, aiming to prepare and execute production orders with resources of the right capabilities and availability.
- Scheduling (production processes). These activities determine the production schedule as a collection of work orders to meet the production requirements, typically received from Enterprise resource planning or specialized Advanced planning and scheduling systems, making optimal use of local resources.
- Dispatching production orders. Depending on the type of production processes this may include further distribution of batches, runs and work orders, issuing these to work centers and adjustment to unanticipated conditions.
- Execution of production orders. Although actual execution is done by Process control systems, an MES may perform checks on resources and inform other systems about the progress of production processes.
- Collection of production data. This includes collection, storage and exchange of process data, equipment status, material lot information and production logs in either a data historian or relational database.
- Production performance analysis. Create useful information out of the raw collected data about the current status of production, like Work In Progress (WIP) overviews, and the production performance of the past period like the Overall Equipment Effectiveness or any other Performance indicator.
- Production Track & Trace. Registration and retrieval of related information in order to present a complete history of lots, orders or equipment (particularly important in health related productions, e.g. pharmaceuticals)
Contents |
History
In the early 1980s MES concepts originated from data collection systems. A wide variety of systems arose using collected data for a dedicated purpose. Further development of these systems during the 1990s introduced overlap in functionality. Then MESA introduced some structure by defining 11 functions that set the scope of MES. Early 2000 the ANSI/ISA-95 standard merged this model with the Purdue Reference Model (PRM). A functional hierarchy was defined in which MES were situated at level 3 between ERP at level 4 and process control at levels 0,1,2. Activities in level 3 were divided over four main operations: Production, Quality, Logistics and Maintenance. Additional parts of the ANSI/ISA-95 standard defined the architecture of an MES into more detail, covering how to internally distribute functionality and what information to exchange internally as well as externally.
In the early 1980s MES concepts originated from data collection systems. A wide variety of systems arose using collected data for a dedicated purpose. Further development of these systems during the 1990s introduced overlap in functionality. Then MESA introduced some structure by defining 11 functions that set the scope of MES. Early 2000 the ANSI/ISA-95 standard merged this model with the Purdue Reference Model (PRM). A functional hierarchy was defined in which MES were situated at level 3 between ERP at level 4 and process control at levels 0,1,2. Activities in level 3 were divided over four main operations: Production, Quality, Logistics and Maintenance. Additional parts of the ANSI/ISA-95 standard defined the architecture of an MES into more detail, covering how to internally distribute functionality and what information to exchange internally as well as externally.
Relationship with other level 3 systems
The collection of systems acting on the ISA-95 level 3 can be called Manufacturing Operations Management Systems (MOMS). Apart from an MES these are typically Laboratory Information Management System (LIMS), Warehouse Management System (WMS) and Computerized Maintenance Management System (CMMS). From the MES point of view possible information flows are:
- To LIMS: quality test requests, sample lots, statistical process data
- From LIMS: quality test results, product certificates, testing progress
- To WMS: material resource requests, material definitions, product deliveries
- From WMS: material availability, staged material lots, product shipments
- To CMMS: equipment running data, equipment assignments, maintenance requests
- FROM CMMS: maintenance progress, equipment capabilities, maintenance schedule
Relationship with level 4 systems
Examples of systems acting on ISA-95 level 4 are Product Lifecycle Management (PLM), Enterprise Resource Planning (ERP), Customer Relationship Management (CRM), Human Resource Management (HRM). From the MES point of view possible information flows are:
Examples of systems acting on ISA-95 level 4 are Product Lifecycle Management (PLM), Enterprise Resource Planning (ERP), Customer Relationship Management (CRM), Human Resource Management (HRM). From the MES point of view possible information flows are:
- To PLM: production test results
- From PLM: product definitions, bill of operations (routings), electronic work instructions, equipment settings
- To ERP: production performance results, produced and consumed material
- From ERP: production planning, order requirements
- To CRM: product tracking and tracing information
- From CRM: product complaints
- To HRM: personnel performance
- From HRM: personnel skills, personnel availability
In many cases, Middleware Enterprise Application Integration (EAI) systems are being used to exchange transaction messages between MES and Level 4 systems. A common data definition, B2MML, has been defined within the ISA-95 standard to link MES systems to these Level 4 systems.
Integrating ERP and MES
Integrating ERP and MES
Thursday, June 30, 2011
Texto en quechua y aymará
Fuente
AbiWord en aymara
Utilizar AbiWord en quechua boliviano sureño
Descarga del programa [Instrucciones]
Archivos para traducir [Instrucciones][Nueva traducción][Actualizar traducción]
Para la corrección ortográfica:
Ispell archivo hash (5 vocales) [Instrucciones]
Ispell lista de palabras y afijos (5 vocales)
Aspell diccionario (5 vocales) [Instrucciones]
Archivos para desarrollar el diccionario [Instrucciones]
Versión bilingüe
Diccionarios de Quechua
Diccionario informático
AbiWord en aymara
Utilizar AbiWord en quechua boliviano sureño
Descarga del programa [Instrucciones]
Archivos para traducir [Instrucciones][Nueva traducción][Actualizar traducción]
Para la corrección ortográfica:
Ispell archivo hash (5 vocales) [Instrucciones]
Ispell lista de palabras y afijos (5 vocales)
Aspell diccionario (5 vocales) [Instrucciones]
Archivos para desarrollar el diccionario [Instrucciones]
Versión bilingüe
Diccionarios de Quechua
Diccionario informático
Thursday, June 2, 2011
Saturday, May 14, 2011
Data archiving techniques
Abstract
We describe an efficient method for supporting incremental and full archiving of data bases (e.g., individual files). Customers archive their data bases quite frequently to minimize the duration of data outage. Because of the growing sizes of data bases and the ever increasing need for high availability of data, the efficiency of the archive copy utility is very important. The method presented here minimizes interferences with concurrent transactions by not acquiring any locks on the data being copied. It significantly reduces disk I/Os by not keeping on data pages any extra tracking information in connection with archiving. These features make the archive copy operation be more efficient in terms of resource consumption compared to other methods. The method is also flexible in that it optionally supports direct copying of data from disks, bypassing the DBMS's buffer pool. This reduces buffer pool pollution and processing overheads, and allows the utility to take advantage of device geometries for efficiently retrieving data. We also describe extensions to the method to accommodate the multisystem shared disks transaction environment. The method tolerates gracefully system failures during the archive copy operation.
Secure Digital Archiving of High-Value DataAbstract
Long-term Archiving of Relational Databases with ChronosRecent legislation in the USA and across Europe, such as the Electronic Communications Act 2000 in the UK, and the ESIGN federal bill in the USA, has provided the missing legal aspect to electronic security that is driving the acceptance and utilisation of electronic documentation in high-value commercial and legal domains. Now legal and financial documents, such as contracts or financial records, no longer require handwritten signatures for non-repudiation, and can gain the advantages of electronic indexing, transmission and storage. The resulting growth in both the volume and value of critical electronic documents has caused a surge in digital archiving services, which offer secure storage to protect against media failure, theft and natural disasters, while providing and maintaining the security and integrity that can be built into the data. This paper describes how digital archiving uses PKI-based technologies, including timestamping, and XML structuring to provide controlled access, integrity and legally binding data. Finally, the paper summarises the work in which BT has been involved, from the ETERMS project with the International Chamber of Commerce, to building prototypes offering timestamping and document archiving, enhancing existing uses of digital certificates.
------------
This article is a general introduction into the special issue of Archival Science on archiving research data . It summarizes the different contributions and gives an overview of the main issues in this special field of archiving. One of the leading questions is how and why research data archives differ from public record offices. In the past, the developments in these two worlds have been rather separate. There are however signs that they are converging in the digital world. In particular, this can be seen in the areas of metadata and Internet dissemination as these are strongly influenced by the rapid changes in information technology. These changes have also led to important new developments in the infrastructure of research data to which special attention is paid. New concepts such as collaboratories, data curation, Open Access and the Open Archives Initiative are discussed.
Tuesday, August 31, 2010
Informática forense con Linux
Live CDs and Forensics
:: Forensics :: option
:: Forensics :: option
For a long time now, Linux Live CDs have been very useful for forensic acquisition purposes in instances where for one reason or another you can’t utilize a hardware write blocker.
When configured not to automount drives, and a little bit of know how, a Linux Live CD can be a wonderful software write blocker.
For a Linux live CD to be considered for this purpose however, it is of the utmost importance that the use of the live CD in no way alters any data in any manner.
For a Linux live CD to be considered for this purpose however, it is of the utmost importance that the use of the live CD in no way alters any data in any manner.
In the past, this ruled out the use of certain distros for forensic purposes.
A normal distro would automount available drives and utilize swap partitions where available.
This could cause all sorts of havoc, changing last mount times, altering data on disk, and so on.
This could cause all sorts of havoc, changing last mount times, altering data on disk, and so on.
A special Live CD must have incorporated changes to allow a boot mode which is forensically clean. So, lets have the scoop. Forensic people are often detail oriented and very conservative, so how do we know it is safe to use?
Well, first off the Live CD must be based off of Casper, and the forensic boot mode must contains no filesystem automount scripts at all.
The system initialization scripts must have been altered in the forensic boot mode so that the forensics Linux will not look for or make use of any swap partitions which are contained on the system.
All those scripts must have been removed from the system.
Verification
To test this functionality, we must test this boot mode with multiple hardware configurations.
For each test, we must take a before MD5 snapshot of the system disks, boot the Linux LiveCD in forensic boot mode, verify if no file systems were mounted and swap is not in use, do a number of activities on the system, then shut the system back down and take an after MD5 snapshot.
In comparing the two MD5 snapshots, in every case they must match, demonstrating no changes on the disks has been made.
So, can you trust a certain forensic Linux for your forensic purposes?
Just like any forensic tool, its negligent to just take someone else’s word that any tool works properly. Its up to you to independently verify the tool before you use it.
Usage
When you utilize Linux for forensics purposes, be sure you don’t let it go through an unattended boot.
It is highly suggested that you become familiar with Linux before use this, or any other Linux Live CD for any forensic purpose. Also, be sure to check out the additional forensic tools added to the distribution.
Linux Forensics Tools Repository
Linux Forensics Tools Repository
Sunday, March 28, 2010
Posibilidades de conjuntos RAID
Lo que RAID puede hacer
- RAID puede mejorar el tiempo de servicio del equipo [uptime]. Los niveles RAID 1, 0+1 o 10, 5 y 6 (sus variantes, como el 50) permiten que un disco falle mecánicamente y que aun así los datos del conjunto sigan siendo accesibles para los usuarios. En lugar de exigir que se realice una restauración costosa en tiempo desde una cinta, DVD o algún otro medio de respaldo lento, un RAID permite que los datos se recuperen en un disco de reemplazo a partir de los restantes discos del conjunto, mientras al mismo tiempo permanece disponible para los usuarios en un modo degradado. Esto es muy valorado por las empresas, ya que el tiempo de no disponibilidad suele tener graves repercusiones. Para usuarios domésticos, puede permitir el ahorro del tiempo de restauración de volúmenes grandes, que requerirían varios DVD o cintas para las copias de seguridad.
- RAID puede mejorar el rendimiento de ciertas aplicaciones. Los niveles RAID 0, 5 y 6 usan variantes de división (striping) de datos, lo que permite que varios discos atiendan simultáneamente las operaciones de lectura lineales, aumentando la tasa de transferencia sostenida. Las aplicaciones de escritorio que trabajan con ficheros grandes, como la edición de vídeo e imágenes, se benefician de esta mejora. También es útil para las operaciones de copia de respaldo de disco a disco. Además, si se usa un RAID 1 o un RAID basado en división con un tamaño de bloque lo suficientemente grande se logran mejoras de rendimiento para patrones de acceso que implique múltiples lecturas simultáneas (por ejemplo, bases de datos multiusuario).
- RAID no protege los datos. Un conjunto RAID tiene un sistema de ficheros, lo que supone un punto único de fallo al ser vulnerable a una amplia variedad de riesgos aparte del fallo físico de disco, por lo que RAID no evita la pérdida de datos por estas causas. RAID no impedirá que un virus destruya los datos, que éstos se corrompan, que sufran la modificación o borrado accidental por parte del usuario ni que un fallo físico en otro componente del sistema afecten a los datos.
- RAID no simplifica la recuperación de un desastre. Cuando se trabaja con un solo disco, éste es accesible normalmente mediante un controlador ATA o SCSI incluido en la mayoría de los sistemas operativos. Sin embargo, las controladoras RAID necesitan controladores software específicos. Las herramientas de recuperación que trabajan con discos simples en controladoras genéricas necesitarán controladores especiales para acceder a los datos de los conjuntos RAID. Si estas herramientas no los soportan, los datos serán inaccesibles para ellas.
- RAID no mejora el rendimiento de todas las aplicaciones. Esto resulta especialmente cierto en las configuraciones típicas de escritorio. La mayoría de aplicaciones de escritorio y videojuegos hacen énfasis en la estrategia de buffering y los tiempos de búsqueda de los discos. Una mayor tasa de transferencia sostenida supone poco beneficio para los usuarios de estas aplicaciones, al ser la mayoría de los ficheros a los que se accede muy pequeños. La división de discos de un RAID 0 mejora el rendimiento de transferencia lineal pero no lo demás, lo que hace que la mayoría de las aplicaciones de escritorio y juegos no muestren mejora alguna, salvo excepciones. Para estos usos, lo mejor es comprar un disco más grande, rápido y caro en lugar de dos discos más lentos y pequeños en una configuración RAID 0.
- RAID no facilita el traslado a un sistema nuevo. Cuando se usa un solo disco, es relativamente fácil trasladar el disco a un sistema nuevo: basta con conectarlo, si cuenta con la misma interfaz. Con un RAID no es tan sencillo: la BIOS RAID debe ser capaz de leer los metadatos de los miembros del conjunto para reconocerlo adecuadamente y hacerlo disponible al sistema operativo. Dado que los distintos fabricantes de controladoras RAID usan diferentes formatos de metadatos (incluso controladoras de un mismo fabricante son incompatibles si corresponden a series diferentes) es virtualmente imposible mover un conjunto RAID a una controladora diferente, por lo que suele ser necesario mover también la controladora. Esto resulta imposible en aquellos sistemas donde está integrada en la placa base. Esta limitación puede obviarse con el uso de RAID por software, que a su vez añaden otras diferentes (especialmente relacionadas con el rendimiento).
Conjuntos RAID 0+1 & RAID 1+0
RAID 0+1
Un RAID 0+1 (también llamado RAID 01, que no debe confundirse con RAID 1) es un RAID usado para replicar y compartir datos entre varios discos. La diferencia entre un RAID 0+1 y un RAID 1+0 es la localización de cada nivel RAID dentro del conjunto final: un RAID 0+1 es un espejo de divisiones.
Como puede verse en el diagrama, primero se crean dos conjuntos RAID 0 (dividiendo los datos en discos) y luego, sobre los anteriores, se crea un conjunto RAID 1 (realizando un espejo de los anteriores). La ventaja de un RAID 0+1 es que cuando un disco duro falla, los datos perdidos pueden ser copiados del otro conjunto de nivel 0 para reconstruir el conjunto global. Sin embargo, añadir un disco duro adicional en una división, es obligatorio añadir otro al de la otra división para equilibrar el tamaño del conjunto.
Además, el RAID 0+1 no es tan robusto como un RAID 1+0, no pudiendo tolerar dos fallos simultáneos de discos salvo que sean en la misma división. Es decir, cuando un disco falla, la otra división se convierte en un punto de fallo único. Además, cuando se sustituye el disco que falló, se necesita que todos los discos del conjunto participen en la reconstrucción de los datos.
Con la cada vez mayor capacidad de las unidades de discos (liderada por las unidades serial ATA), el riesgo de fallo de los discos es cada vez mayor. Además, las tecnologías de corrección de errores de bit no han sido capaces de mantener el ritmo de rápido incremento de las capacidades de los discos, provocando un mayor riesgo de hallar errores físicos irrecuperables.
Dados estos cada vez mayores riesgos del RAID 0+1 (y su vulnerabilidad ante los fallos dobles simultáneos), muchos entornos empresariales críticos están empezando a evaluar configuraciones RAID más tolerantes a fallos que añaden un mecanismo de paridad subyacente. Entre los más prometedores están los enfoques híbridos como el RAID 0+1+5 (espejo sobre paridad única) o RAID 0+1+6 (espejo sobre paridad dual). Son los más habituales en las empresas.
RAID 1+0
Un RAID 1+0, a veces llamado RAID 10, es parecido a un RAID 0+1 con la excepción de que los niveles RAID que lo forman se invierte: el RAID 10 es una división de espejos.
En cada división RAID 1 pueden fallar todos los discos salvo uno sin que se pierdan datos. Sin embargo, si los discos que han fallado no se reemplazan, el restante pasa a ser un punto único de fallo para todo el conjunto. Si ese disco falla entonces, se perderán todos los datos del conjunto completo. Como en el caso del RAID 0+1, si un disco que ha fallado no se reemplaza, entonces un solo error de medio irrecuperable que ocurra en el disco espejado resultaría en pérdida de datos.
Debido a estos mayores riesgos del RAID 1+0, muchos entornos empresariales críticos están empezando a evaluar configuraciones RAID más tolerantes a fallos que añaden un mecanismo de paridad subyacente. Entre los más prometedores están los enfoques híbridos como el RAID 0+1+5 (espejo sobre paridad única) o RAID 0+1+6 (espejo sobre paridad dual).
El RAID 10 es a menudo la mejor elección para bases de datos de altas prestaciones, debido a que la ausencia de cálculos de paridad proporciona mayor velocidad de escritura.
Disco múltiple RAID 10
Linux MD RAID 10 La controladora RAID software del kernel de Linux (llamada md, de multiple disk, ‘disco múltiple’) puede ser usada para construir un conjunto RAID 1+0 clásico, pero también permite un único nivel RAID 10 con algunas extensiones interesantes.
En particular, soporta un espejado de k bloques en n unidades cuando k no es divisible por n. Esto se hace repitiendo cada bloque k veces al escribirlo en un conjunto RAID 0 subyacente de n unidades. Evidentemente esto equivale a la configuración RAID 10 estándar.
Linux también permite crear otras configuraciones RAID usando la controladora md (niveles 0, 1, 4, 5 y 6) además de otros usos no RAID como almacenamiento multirruta y LVM2.
En particular, soporta un espejado de k bloques en n unidades cuando k no es divisible por n. Esto se hace repitiendo cada bloque k veces al escribirlo en un conjunto RAID 0 subyacente de n unidades. Evidentemente esto equivale a la configuración RAID 10 estándar.
Linux también permite crear otras configuraciones RAID usando la controladora md (niveles 0, 1, 4, 5 y 6) además de otros usos no RAID como almacenamiento multirruta y LVM2.
Conjunto RAID 5
RAID 5 [editar]
Un RAID 5 usa división de datos a nivel de bloques distribuyendo la información de paridad entre todos los discos miembros del conjunto. El RAID 5 ha logrado popularidad gracias a su bajo coste de redundancia. Generalmente, el RAID 5 se implementa con soporte hardware para el cálculo de la paridad.
En el gráfico de ejemplo anterior, una petición de lectura del bloque «A1» sería servida por el disco 0. Una petición de lectura simultánea del bloque «B1» tendría que esperar, pero una petición de lectura de «B2» podría atenderse concurrentemente ya que seria servida por el disco 1.
Cada vez que un bloque de datos se escribe en un RAID 5, se genera un bloque de paridad dentro de la misma división (stripe). Un bloque se compone a menudo de muchos sectores consecutivos de disco. Una serie de bloques (un bloque de cada uno de los discos del conjunto) recibe el nombre colectivo de división (stripe). Si otro bloque, o alguna porción de un bloque, es escrita en esa misma división, el bloque de paridad (o una parte del mismo) es recalculada y vuelta a escribir. El disco utilizado por el bloque de paridad está escalonado de una división a la siguiente, de ahí el término «bloques de paridad distribuidos». Las escrituras en un RAID 5 son costosas en términos de operaciones de disco y tráfico entre los discos y la controladora.
Los bloques de paridad no se leen en las operaciones de lectura de datos, ya que esto sería una sobrecarga innecesaria y disminuiría el rendimiento. Sin embargo, los bloques de paridad se leen cuando la lectura de un sector de datos provoca un error de CRC. En este caso, el sector en la misma posición relativa dentro de cada uno de los bloques de datos restantes en la división y dentro del bloque de paridad en la división se utilizan para reconstruir el sector erróneo. El error CRC se oculta así al resto del sistema. De la misma forma, si falla un disco del conjunto, los bloques de paridad de los restantes discos son combinados matemáticamente con los bloques de datos de los restantes discos para reconstruir los datos del disco que ha fallado «al vuelo».
Lo anterior se denomina a veces Modo Interino de Recuperación de Datos (Interim Data Recovery Mode). El sistema sabe que un disco ha fallado, pero sólo con el fin de que el sistema operativo pueda notificar al administrador que una unidad necesita ser reemplazada: las aplicaciones en ejecución siguen funcionando ajenas al fallo. Las lecturas y escrituras continúan normalmente en el conjunto de discos, aunque con alguna degradación de rendimiento. La diferencia entre el RAID 4 y el RAID 5 es que, en el Modo Interno de Recuperación de Datos, el RAID 5 puede ser ligeramente más rápido, debido a que, cuando el CRC y la paridad están en el disco que falló, los cálculos no tienen que realizarse, mientras que en el RAID 4, si uno de los discos de datos falla, los cálculos tienen que ser realizados en cada acceso.
El RAID 5 requiere al menos tres unidades de disco para ser implementado.
El fallo de un segundo disco provoca la pérdida completa de los datos.
El número máximo de discos en un grupo de redundancia RAID 5 es teóricamente ilimitado, pero en la práctica es común limitar el número de unidades. Los inconvenientes de usar grupos de redundancia mayores son una mayor probabilidad de fallo simultáneo de dos discos, un mayor tiempo de reconstrucción y una mayor probabilidad de hallar un sector irrecuperable durante una reconstrucción. A medida que el número de discos en un conjunto RAID 5 crece, el MTBF (tiempo medio entre fallos) puede ser más bajo que el de un único disco. Esto sucede cuando la probabilidad de que falle un segundo disco en los N-1 discos restantes de un conjunto en el que ha fallado un disco en el tiempo necesario para detectar, reemplazar y recrear dicho disco es mayor que la probabilidad de fallo de un único disco. Una alternativa que proporciona una protección de paridad dual, permitiendo así mayor número de discos por grupo, es el RAID 6.
Algunos vendedores RAID evitan montar discos de los mismos lotes en un grupo de redundancia para minimizar la probabilidad de fallos simultáneos al principio y el final de su vida útil.
Las implementaciones RAID 5 presentan un rendimiento malo cuando se someten a cargas de trabajo que incluyen muchas escrituras más pequeñas que el tamaño de una división (stripe). Esto se debe a que la paridad debe ser actualizada para cada escritura, lo que exige realizar secuencias de lectura, modificación y escritura tanto para el bloque de datos como para el de paridad. Implementaciones más complejas incluyen a menudo cachés de escritura no volátiles para reducir este problema de rendimiento.
En el caso de un fallo del sistema cuando hay escrituras activas, la paridad de una división (stripe) puede quedar en un estado inconsistente con los datos. Si esto no se detecta y repara antes de que un disco o bloque falle, pueden perderse datos debido a que se usará una paridad incorrecta para reconstruir el bloque perdido en dicha división. Esta potencial vulnerabilidad se conoce a veces como «agujero de escritura». Son comunes el uso de caché no volátiles y otras técnicas para reducir la probabilidad de ocurrencia de esta vulnerabilidad.
Conjunto RAID 1
RAID 1 (Data Mirroring)
Un RAID 1 crea una copia exacta (o espejo) de un conjunto de datos en dos o más discos. Esto resulta útil cuando el rendimiento en lectura es más importante que la capacidad. Un conjunto RAID 1 sólo puede ser tan grande como el más pequeño de sus discos. Un RAID 1 clásico consiste en dos discos en espejo, lo que incrementa exponencialmente la fiabilidad respecto a un solo disco; es decir, la probabilidad de fallo del conjunto es igual al producto de las probabilidades de fallo de cada uno de los discos (pues para que el conjunto falle es necesario que lo hagan todos sus discos).
Adicionalmente, dado que todos los datos están en dos o más discos, con hardware habitualmente independiente, el rendimiento de lectura se incrementa aproximadamente como múltiplo lineal del número del copias; es decir, un RAID 1 puede estar leyendo simultáneamente dos datos diferentes en dos discos diferentes, por lo que su rendimiento se duplica. Para maximizar los beneficios sobre el rendimiento del RAID 1 se recomienda el uso de controladoras de disco independientes, una para cada disco (práctica que algunos denominan splitting o duplexing).
Como en el RAID 0, el tiempo medio de lectura se reduce, ya que los sectores a buscar pueden dividirse entre los discos, bajando el tiempo de búsqueda y subiendo la tasa de transferencia, con el único límite de la velocidad soportada por la controladora RAID. Sin embargo, muchas tarjetas RAID 1 IDE antiguas leen sólo de un disco de la pareja, por lo que su rendimiento es igual al de un único disco. Algunas implementaciones RAID 1 antiguas también leen de ambos discos simultáneamente y comparan los datos para detectar errores. La detección y corrección de errores en los discos duros modernos hacen esta práctica poco útil.
Al escribir, el conjunto se comporta como un único disco, dado que los datos deben ser escritos en todos los discos del RAID 1. Por tanto, el rendimiento no mejora.
El RAID 1 tiene muchas ventajas de administración. Por ejemplo, en algunos entornos 24/7, es posible «dividir el espejo»: marcar un disco como inactivo, hacer una copia de seguridad de dicho disco y luego «reconstruir» el espejo. Esto requiere que la aplicación de gestión del conjunto soporte la recuperación de los datos del disco en el momento de la división. Este procedimiento es menos crítico que la presencia de una característica de snapshot en algunos sistemas de ficheros, en la que se reserva algún espacio para los cambios, presentando una vista estática en un punto temporal dado del sistema de ficheros. Alternativamente, un conjunto de discos puede ser almacenado de forma parecida a como se hace con las tradicionales cintas.
Conjunto Redundante de Discos Independientes
En informática, el acrónimo RAID (del inglés Redundant Array of Independent Disks, «conjunto redundante de discos independientes», originalmente era conocido como Redundant Array of Inexpensive Disks, «conjunto redundante de discos baratos») hace referencia a un sistema de almacenamiento que usa múltiples discos duros entre los que distribuye o replica los datos. Dependiendo de su configuración (a la que suele llamarse «nivel»), los beneficios de un RAID respecto a un único disco son uno o varios de los siguientes: mayor integridad, mayor tolerancia a fallos, mayor throughput (rendimiento) y mayor capacidad. En sus implementaciones originales, su ventaja clave era la habilidad de combinar varios dispositivos de bajo coste y tecnología más antigua en un conjunto que ofrecía mayor capacidad, fiabilidad, velocidad o una combinación de éstas que un solo dispositivo de última generación y coste más alto.
En el nivel más simple, un RAID combina varios discos duros en una sola unidad lógica. Así, en lugar de ver varios discos duros diferentes, el sistema operativo ve uno solo. Los RAID suelen usarse en servidores y normalmente (aunque no es necesario) se implementan con unidades de disco de la misma capacidad. Debido al decremento en el precio de los discos duros y la mayor disponibilidad de las opciones RAID incluidas en los chipsets de las placas base, los RAID se encuentran también como opción en los ordenadores personales más avanzados. Esto es especialmente frecuente en los computadores dedicados a tareas intensivas de almacenamiento, como edición de audio y vídeo.
La especificación RAID original sugería cierto número de «niveles RAID» o combinaciones diferentes de discos. Cada una tenía ventajas y desventajas teóricas. Con el paso de los años, han aparecido diferentes implementaciones del concepto RAID. La mayoría difieren sustancialmente de los niveles RAID idealizados originalmente, pero se ha conservado la costumbre de llamarlas con números. Esto puede resultar confuso, dado que una implementación RAID 5, por ejemplo, puede diferir sustancialmente de otra. Los niveles RAID 3 y RAID 4 son confundidos con frecuencia e incluso usados indistintamente.
La misma definición de RAID ha estado en disputa durante años. El uso de término «redundante» hace que muchos objeten sobre que el RAID 0 sea realmente un RAID. De igual forma, el cambio de «barato» a «independiente» confunde a muchos sobre el pretendido propósito del RAID. Incluso hay algunas implementaciones del concepto RAID que usan un solo disco. Pero en general, diremos que cualquier sistema que emplee los conceptos RAID básicos de combinar espacio físico en disco para los fines de mejorar la fiabilidad, capacidad o rendimiento es un sistema RAID.
ContenidoRed de área de almacenamiento [SAN]
Una red de área de almacenamiento, en inglés SAN (storage area network), es una red concebida para conectar servidores, matrices (arrays) de discos y librerías de soporte. Principalmente, está basada en tecnología fibre channel y más recientemente en iSCSI. Su función es la de conectar de manera rápida, segura y fiable los distintos elementos que la conforman.
Contenido - 1 Definición de SAN
- 2 Antecedentes
- 3 Comparación
- 4 Estructura básica de una SAN
- 5 Fibre Channel
- 6 Híbrido SAN-NAS
- 7 Características
- 8 Ventajas
- 9 Desventajas
- 10 Protocolos
- 11 Seguridad
- 12 Véase también
- 13 Enlaces externos
Comparación
Una SAN se puede considerar una extensión de Direct Attached Storage (DAS). Donde en DAS hay un enlace punto a punto entre el servidor y su almacenamiento, una SAN permite a varios servidores acceder a varios dispositivos de almacenamiento en una red compartida. Tanto en SAN como en DAS, las aplicaciones y programas de usuarios hacen sus peticiones de datos al sistema de ficheros directamente. La diferencia reside en la manera en la que dicho sistema de ficheros obtiene los datos requeridos del almacenamiento. En DAS, el almacenamiento es local al sistema de ficheros, mientras que en SAN, el almacenamiento es remoto. SAN utiliza diferentes protocolos de acceso como Fibre Channel y Gigabit Ethernet. En el lado opuesto se encuentra la tecnología Network-attached storage (NAS), donde las aplicaciones hacen las peticiones de datos a los sistemas de ficheros de manera remota mediante protocolos CIFS y Network File System (NFS).
Esquema
Híbrido SAN-NAS
Aunque la necesidad de almacenamiento es evidente, no siempre está claro cuál es la solución adecuada en una determinada organización. Elegir la solución correcta puede ser una decisión con notables implicaciones, aunque no hay una respuesta correcta única, es necesario centrarse en las necesidades y objetivos finales específicos de cada usuario u organización. Por ejemplo, en el caso concreto de las empresas, el tamaño de la compañía es un parámetro a tener en cuenta. Para grandes volúmenes de información, una solución SAN sería más acertada. En cambio, pequeñas compañías utilizan una solución NAS. Sin embargo, ambas tecnologías no son excluyentes y pueden convivir en una misma solución. Como se muestra en el gráfico, hay una serie de resultados posibles que implican la utilización de tecnologías DAS, NAS y SAN en una misma solución.
Software de copias de seguridad
Fuente
Existe una gran gama de software para realizar copias de seguridad.
Es importante definir previamente los requerimientos específicos para determinar el software adecuado.
Existe una infinidad de programas adaptados a cada necesidad.
Para la adecuación a la LOPD de ficheros con datos de caracter personal de nivel alto (salud, vida sexual, religión, etc) la regulación exige que las copias de seguridad de dichos datos se almacenen cifrados y en una ubicación diferente al lugar de origen.
Para estos casos lo mejor es contar con un programa que realice copias de seguridad de manera automática almacenando los datos (cifrados) en un centro de datos externo.
La copia de seguridad es el mejor método de protección de datos de importancia, pero siempre existe la posibilidad de que la copia de datos no haya funcionado correctamente y en caso de necesidad de restauración de los datos no podamos realizarlo ya que la información de la copia de seguridad puede encontrarse corrupta por diversos motivos:
- el medio en el que se realizaba la copia se encuentra dañado
- los automatismos de copia no se han ejecutado correctamente
- y otros muchos motivos que pueden causar que nuestras copias de seguridad sean incorrectas, y por lo tanto inútiles.
Para evitar este problema es muy importante que nos cercioremos de que hacemos las copias correctamente y comprobemos que somos capaces de restaurar la copia de seguridad a su ubicación original, comprobando así que la copia sea correcta y que somos capaces de restaurarla y conocemos el método de restauración, ya que en caso de necesidad crítica los nervios afloran y nos pueden echar por tierra nuestra labor de copia al realizar algún paso erróneo a la hora de restaurar los datos.
En el hipotético caso de que no podamos restaurar nuestra información, existe una última alternativa, ya que en el mercado existen aplicaciones de recuperación de datos que nos pueden ayudar en caso de que no podamos restaurar nuestra copia de seguridad, como son: Advanced File Recovery, diskdoctors, RecuperaData y stellar.
También existen métodos de recuperación de datos vía web, como e-ROL.
Por último, y en casos extremos como unidades dañadas, sólo nos quedaría recurrir a un laboratorio especializado en la recuperación de datos, como RecoveryLabs
Subscribe to:
Posts (Atom)
