„Willkommen bei der großen BigData-Insider-Leserwahl!

Dipl.-Ing. (FH) Stefan Luber

IT-Service Luber

Stefan Luber ist Diplom-Ingenieur (FH) der Nachrichtentechnik und arbeitet mit über 30 Jahren Berufserfahrung als freiberuflicher Autor sowie technischer Redakteur. Er ist spezialisiert auf IT- und Telekommunikationsthemen und verfasst hochwertige, suchmaschinenoptimierte Inhalte, Whitepaper, Produkttests, Blog-Artikel und technische Dokumentationen.

Seine Expertise umfasst ein breites Spektrum an IT-Themen, darunter Netzwerke (DSL, Mobilfunk, TCP/IP, Routing, Switching, VoIP), Webhosting, E-Commerce, Content-Management-Systeme wie WordPress, Suchmaschinenoptimierung (SEO), Smart Home, Cloud Computing, Business Intelligence, Big Data, Künstliche Intelligenz, IoT und IT-Sicherheit.

Luber hat für verschiedene Unternehmenswebseiten, Blogs und Fachportale wie Security-Insider, BigData-Insider, Storage-Insider, CloudComputing-Insider und IP-Insider Artikel verfasst, in denen er komplexe technische Sachverhalte verständlich aufbereitet.

Neben seiner Tätigkeit als Autor bietet er IT-Services an und betreibt mit dem IT-Service Luber eine eigene Webseite, auf der er seine Dienstleistungen und Veröffentlichungen präsentiert.

Seine berufliche Laufbahn umfasst Positionen wie Systemingenieur Netzwerkplanung/Internetworking bei verschiedenen Systemhäusern und Netzbetreibern und Manager im Bereich IP-TV-Netze bei der Deutschen Telekom AG. Seit August 2011 ist er als freier Autor und technischer Redakteur tätig.

Artikel des Autors

(© aga7ta - stock.adobe.com)

Dask ist eine Open-Source-basierte Library, mit der sich Rechenaufgaben auf mehrere Rechner verteilen und parallel ausführen lassen. Die Bibliothek ist in Python geschrieben und beispielsweise für das High Performance Computing einsetzbar. Dask wird in der Wissenschaft und im kommerziellen Bereich unter anderem für das Maschinelle Lernen genutzt.

(© aga7ta - stock.adobe.com)

Unter High Performance Computing, HPC, sind Technologien und Verfahren zusammengefasst, mit denen sich komplexe Rechenaufgaben mit hoher Leistung ausführen lassen. Für das Hochleistungsrechnen werden Aufgaben parallelisiert und die Rechenleistung mehrerer Systeme aggregiert. Typische Einsatzbereiche sind Wissenschaft und Forschung, Simulationstechnik, Grafikberechnungen oder Business Intelligence.

(© aga7ta - stock.adobe.com)

Ein Quantum Neural Network ist ein Künstliches Neuronales Netzwerk, das auf den Funktionsprinzipien der Quantenmechanik basiert. Es nutzt sogenannte Qubits, die mehrere Zustände gleichzeitig annehmen können und miteinander verschränkt sind. Quantum Neural Networks sollen schneller arbeiten und komplexere Problemstellungen lösen, als dies mit herkömmlichen Neuronalen Netzen möglich ist.

(© aga7ta - stock.adobe.com)

Augmented Analytics erweitert und automatisiert die Analysemöglichkeiten von Business-Intelligence-Lösungen durch die Nutzung von Methoden und Algorithmen der Künstlichen Intelligenz (KI) und des Machine Learnings (ML). Per Natural Language Processing (NLP) ist die Interaktion des Nutzers mit der Analysesoftware in natürlicher Sprache möglich.

(© aga7ta - stock.adobe.com)

Ein KPI-Dashboard stellt wichtige Leistungskennzahlen eines Unternehmens in visualisierter, leicht verständlicher Form dar. Das Dashboard bietet interaktive Funktionen, lässt sich mit anderen teilen und aktualisiert die Daten bei Bedarf in Echtzeit. Mithilfe eines KPI-Dashboards lässt sich die Zielerreichung verschiedener Unternehmensbereiche messen.

(© aga7ta - stock.adobe.com)

Ein Decision Tree ist ein baumartiges, gerichtetes Diagramm zur Entscheidungsfindung. Es besteht aus Wurzel, Knoten, Ästen und Blättern. Die Knoten bilden die entscheidungsabhängigen Verzweigungspunkte. Typischer Einsatzbereich der Decision Trees sind Klassifizierungsaufgaben. Aus vielen einzelnen Decision Trees lassen sich Entscheidungswälder wie der Random Forest bilden.

(© aga7ta - stock.adobe.com)

Logstash ist eine Open-Source-basierte Software zur Erfassung, Verarbeitung, Transformation und Weiterleitung von Daten. Sie stellt Datenverarbeitungspipelines zur Verfügung und arbeitet mit Plug-ins und Filtern. Zusammen mit Elasticsearch und Kibana bildet Logstash den sogenannten Elastic Stack. Er lässt sich zur Analyse und Visualisierung großer Datenmengen verwenden.

(© aga7ta - stock.adobe.com)

Elasticsearch ist eine Open-Source-Suchmaschine auf Basis von Apache Lucene. Sie arbeitet mit Indices, die aus JSON-Dokumenten im NoSQL-Format bestehen. Die Suchmaschine arbeitet sehr schnell, ist für die Suche in großen Datenmengen einsetzbar (Big Data) und unterstützt für eine hohe Verfügbarkeit verteilte Architekturen. Zusammen mit Kibana und Logstash bildet Elasticsearch den Elastic Stack.

(© aga7ta - stock.adobe.com)

Couchbase ist eine dokumentenorientierte nicht-relationale Datenbank (NoSQL-Datenbank). Sie speichert Informationen in Form von JSON-Dokumenten. Die Couchbase-Lösung umfasst Couchbase Server und Couchbase Mobile. Für das Abfragen und Verändern von Daten steht die Abfragesprache N1QL zur Verfügung, die ähnlich wie SQL für relationale Datenbanken arbeitet.

(© aga7ta - stock.adobe.com)

Ein Data Catalog ist ein Service oder ein Tool, das verschiedene Daten-Assets in einem zentralen Metadatenverzeichnis verwaltet. Der Datenkatalog vereinfacht den Zugang zu den Daten. Häufiger Anwendungsbereich sind das Big-Data-Umfeld und Data Warehouses. Der Data Catalog kann auch als Cloud-Service bei verschiedenen Cloud-Providern genutzt werden.

(© aga7ta - stock.adobe.com)

Apache Tez ist ein Open-Source-basiertes Framework, das zusammen mit Hadoop für Big-Data-Anwendungen geeignet ist. Es sorgt für eine performante Verarbeitung der Daten und wird häufig als Alternative zu Hadoop MapReduce eingesetzt. Ursprünglich wurde es von Hortonworks entwickelt. Seit 2013 ist es ein Apache-Projekt.

(© aga7ta - stock.adobe.com)

Ein Quantile Random Forest ist eine spezielle Form des Random Forests. Er kommt für Klassifizierungs- und Regressionsaufgaben zum Einsatz und wird häufig im Umfeld des Machine Learnings verwendet. Das Besondere am Quantile Random Forest ist, dass Vorhersagen bezüglich verschiedener Quantile möglich werden. Es ist abschätzbar, ob vorhergesagte Werte bestimmte Schwellwerte erreichen.

(© aga7ta - stock.adobe.com)

Apache Samza ist ein Open-Source-basiertes Framework für das Stream Processing. Es wird von der Apache Software Foundation weiterentwickelt und ermöglicht die Verarbeitung von Prozessdaten aus verschiedenen Quellen in nahezu Echtzeit. Unter anderem lassen sich mit Apache Samza statusbehaftete Anwendungen realisieren.

(© aga7ta - stock.adobe.com)

Rohdaten sind ungeprüfte und unbearbeitete Daten, wie sie von einer Datenquelle geliefert werden. Sie liegen in dem Format vor, wie es von der jeweiligen Datenquelle bereitgestellt wird. Für gewöhnlich werden die Rohdaten zur Nutzung in weiteren Anwendungen oder Prozessen mithilfe verschiedener Techniken und Methoden aufbereitet.

(© aga7ta - stock.adobe.com)

Eine User Defined Function (UDF) ist eine vom Anwender selbst erstellte Funktion. Verschiedene Programmierumgebungen und Datenbankmanagementsysteme erlauben die Definition und Nutzung von User Defined Functions. Die Funktionen müssen der Syntax der zugrundeliegenden Programmierumgebung entsprechen. Häufig werden UDFs beispielsweise in SQL-Datenbankumgebungen genutzt.

(© aga7ta - stock.adobe.com)

Das ARIMA-Modell ermöglicht die Beschreibung und Analyse von Zeitreihen. Es handelt sich um eine leistungsstarke Modellklasse, die den autoregressiven Teil und den gleitenden Mittelwertbeitrag des ARMA-Modells um die Differenzierung und Integration zur Trendbeseitigung und Herstellung der Stationarität erweitert.

(© aga7ta - stock.adobe.com)

CIFAR-10 ist ein Datensatz, der aus 60.000 kleinen Einzelbildern besteht. Die farbigen Bilder haben jeweils eine Größe von 32 x 32 Pixel und sind in zehn verschiedene Klassen eingeteilt. Der Datensatz kommt zum Trainieren und Testen von Algorithmen des maschinellen Lernens und der Bildverarbeitung zum Einsatz. Neben CIFAR-10 existiert mit CIFAR-100 ein Datensatz mit 100 verschiedenen Klassen.

(© aga7ta - stock.adobe.com)

Random Forest ist ein Algorithmus, der sich für Klassifizierungs- und Regressionsaufgaben nutzen lässt. Er kombiniert die Ergebnisse vieler verschiedener Entscheidungsbäume, um bestmögliche Entscheidungen zu treffen. Der Lernalgorithmus gehört zu den Verfahren des überwachten Lernens und ist im Machine Learning einsetzbar. Das Verfahren ist relativ einfach und bietet kurze Trainingszeiten.

(© aga7ta - stock.adobe.com)

Cypher ist eine Abfragesprache mit deklarativem Charakter für Property-Graphdatenbanken. Sie ermöglicht, komplexe Abfragen einfach zu formulieren und besitzt eine übersichtliche Syntax. Cypher stellt eine wichtige Quelle zur Entwicklung des neuen Standards einer Graph Query Language (GQL) dar. GQL soll, wie es SQL bereits für relationale Datenbanken ist, eine universelle Abfragesprache für Property-Graphdatenbanken werden.

(© aga7ta - stock.adobe.com)

Kibana ist eine Open-Source-Analyse- und -Visualisierungsplattform. Sie bildet zusammen mit Elasticsearch und Logstash den Elastic-Stack und ermöglicht die Visualisierung der per Elasticsearch erhobenen Daten. Kibana beherrscht die klassischen Visualisierungsformen wie Histogramme, Liniendiagramme oder Kreisdiagramme und erlaubt die Darstellung von Zeitreihen oder geografischen Daten.

(© aga7ta - stock.adobe.com)

TPOT ist ein Open Source Tool für automatisiertes maschinelles Lernen (AutoML). Aufgabe des Tools ist es, optimale Machine Learning Pipelines für die jeweilige Aufgabenstellung des maschinellen Lernens zu finden. Hierfür verwendet TPOT die sogenannte genetische Programmierung. Das Tool basiert auf der scikit-learn-Bibliothek.

(© aga7ta - stock.adobe.com)

Apache TinkerPop ist ein Open Source Framework für das Graph Computing. Es ermöglicht die Online-Transaktionsverarbeitung der Daten in Graphdatenbanken und graphbasierten Analysesystemen. Zur Datenabfrage der Graphen kommt die Sprache Gremlin zum Einsatz. TinkerPop stellt ein komplettes Ecosystem für das Graph Computing zur Verfügung.

(© aga7ta - stock.adobe.com)

Die Pseudonymisierung ersetzt Identifikationsmerkmale wie etwa Namen mit anderen Kennzeichen wie Schlüsseln oder Pseudonymen. Dadurch wird die eindeutige Feststellung der Identität einer Person im pseudonymisierten Datensatz zwar verhindert, doch ist der Vorgang grundsätzlich umkehrbar, da die ursprüngliche Zuordnungsvorschrift in einer externen Datensammlung erhalten bleibt.

(© aga7ta - stock.adobe.com)

Die Anonymisierung verhindert, dass sich Daten bestimmten Personen zuordnen lassen. Hierfür entfernt, ersetzt, aggregiert oder verfälscht der Vorgang des Anonymisierens personenbezogene Daten oder personenbeziehbare Daten. Für vollständig anonymisierte Daten gelten bestimmte Vorgaben der DSGVO nicht. Zwischen Anonymisierung und Pseudonymisierung bestehen deutliche Unterschiede.

(© aga7ta - stock.adobe.com)

Complex Event Processing verarbeitet verschiedene Ereignisströme in nahezu Echtzeit. Um neues Wissen aus den voneinander abhängigen Events zu generieren und mit diesem Wissen beispielsweise Geschäftsprozesse zu steuern, werden die Events erfasst, gruppiert, analysiert und Abhängigkeiten extrahiert.

(© aga7ta - stock.adobe.com)

Behavioral Analytics ist ein Teilbereich der Business Analytics und wertet das Verhalten der User digitaler Plattformen wie Onlineshops oder Social Media Sites systematisch aus. Ziel ist es, das Userverhalten besser zu verstehen und vorherzusagen, um die Plattformen hinsichtlich besserer Produkte und mehr Erfolg zu optimieren. Grundlage der Auswertungen bilden große gesammelte Datenmengen.

(© aga7ta - stock.adobe.com)

Die Customer Experience ist die Summe aller Erfahrungen, die ein Kunde mit einem Unternehmen oder einer Marke macht. Sie umfasst die subjektive Bewertung der Erlebnisse des Kunden an den verschiedenen Kontaktpunkten (Touchpoints) während einer Customer Journey. Das Customer Experience Management versucht, die Kundenerlebnisse im Sinne positiver Erfahrungen zu beeinflussen.

(© aga7ta - stock.adobe.com)

Automatisiertes Machine Learning, AutoML, vereinfacht das maschinelle Lernen durch Automatisierung verschiedener Machine-Learning-Prozesse. Je nach Komplexität und Umfang der Aufgabe lassen sich einzelne Schritte oder der komplette Prozess automatisieren. Ziel ist es, auch Anwendern ohne spezifische Programmierkenntnisse und Machine Learning Know-how die Problemlösungsmöglichkeiten des maschinellen Lernens zu eröffnen.

(© aga7ta - stock.adobe.com)

Ein gepulstes neuronales Netz, engl. Spiking Neural Network, ist eine besondere Form eines künstlichen neuronalen Netzes, das hinsichtlich Abläufe und Aufbau der Funktionsweise eines echten biologischen Gehirns sehr nahekommt. Es wird auch als neuronales Netz der dritten Generation bezeichnet. Gepulste neuronale Netze berücksichtigen die zeitlichen Komponenten der Neuronen-Impulse.

(© aga7ta - stock.adobe.com)

Amazon SageMaker ist ein voll verwalteter Cloud-Service von Amazon, der im Rahmen der Amazon Web Services (AWS) verfügbar ist. Mithilfe des Dienstes lassen sich Machine-Learning-Modelle schneller und einfacher erstellen, trainieren und für produktive Zwecke bereitstellen. Genutzt wird Amazon SageMaker beispielsweise von Datenwissenschaftlern oder Entwicklern.

(© aga7ta - stock.adobe.com)

Digitalisierung bezeichnet im ursprünglichen Sinn das Umwandeln von analogen Werten in digitale Formate. Diese Daten lassen sich informationstechnisch verarbeiten. Oft steht der Begriff Digitalisierung aber auch für die digitale Revolution oder die digitale Transformation.

(© aga7ta - stock.adobe.com)

Im Internet der Dinge (Englisch: Internet of Things, IoT) bekommen Gegenstände eine eindeutige Identität und können miteinander kommunizieren oder Befehle entgegennehmen. Mit dem Internet of Things lassen sich Anwendungen automatisieren und Aufgaben ohne Eingriff von außen erledigen.

(© aga7ta - stock.adobe.com)

Machine Learning, im Deutschen maschinelles Lernen, ist ein Teilgebiet der künstlichen Intelligenz. Durch das Erkennen von Mustern in vorliegenden Datenbeständen sind IT-Systeme in der Lage, eigenständig Lösungen für Probleme zu finden.

(© aga7ta - stock.adobe.com)

SAP BW ist ein Business-Intelligence-Paket von SAP und ermöglicht umfangreiche Auswertungen und Reports auf Basis von unterschiedlichsten Unternehmensdaten. Es besteht aus einer Kombination von Datenbanken, Datenbankmanagement-Tools sowie Analyse und Reporting-Anwendungen.

(© aga7ta - stock.adobe.com)

Die Abkürzung NLP steht für Natural Language Processing und beschreibt Techniken und Methoden zur maschinellen Verarbeitung natürlicher Sprache. Ziel ist eine direkte Kommunikation zwischen Mensch und Computer auf Basis der natürlichen Sprache.

(© aga7ta - stock.adobe.com)

Das Business Intelligence Dashboard, kurz BI Dashboard, beschreibt ein Tool, das wichtige Indikatoren eines Unternehmens übersichtlich und stark verdichtet visualisiert. Das Dashboard führt eine Vielzahl an Zahlen in einer grafischen Anzeige zusammen.

(© aga7ta - stock.adobe.com)

In einem Cyber-physischen System (cyber-physical system, CPS) sind mechanische Komponenten über Netzwerke und moderne Informationstechnik miteinander verbunden. Sie ermöglichen die Steuerung und die Kontrolle von komplexen Systemen und Infrastrukturen. Für die Industrie 4.0 spielen Cyber-physische Systeme eine zentrale Rolle.

(© aga7ta - stock.adobe.com)

Das Data Warehouse stellt ein zentrales Datenbanksystem dar, das zu Analysezwecken im Unternehmen einsetzbar ist. Das System extrahiert, sammelt und sichert relevante Daten aus verschiedenen heterogenen Datenquellen und versorgt nachgelagerte Systeme.

(© aga7ta - stock.adobe.com)

Künstliche Neuronale Netze (KNN) sind inspiriert durch das menschliche Gehirn und lassen sich für maschinelles Lernen und die Künstliche Intelligenz einsetzen. Es lassen sich mit diesen Netzen verschiedene Problemstellungen computerbasiert lösen.

(© aga7ta - stock.adobe.com)

Eine Entität in der Informatik ist ein einzelnes, eindeutig identifizierbares Informationsobjekt. Es kann sich sowohl um existierende als auch um abstrakte Objekte handeln. Entitäten sind zusammen mit den Entitätstypen und Attributen sowie den Beziehungen zwischen den Entitäten wesentliche Elemente der Datenmodellierung.

(© aga7ta - stock.adobe.com)

Deep Learning ist ein Teilbereich des Machine Learnings und nutzt neuronale Netze sowie große Datenmengen. Die Lernmethoden richten sich nach der Funktionsweise des menschlichen Gehirns und resultieren in der Fähigkeit eigener Prognosen oder Entscheidungen.

(© aga7ta - stock.adobe.com)

Der Begriff ACID (Atomicity, Consistency, Isolation, Durability) beschreibt Regeln und Eigenschaften zur Durchführung von Transaktionen in Datenbankmanagementsystemen (DBMS). Hält die Transaktion das ACID-Prinzip ein, gelten die Informationen in den Datenbanksystemen als verlässlich und konsistent.

(© aga7ta - stock.adobe.com)

CRISP-DM (Cross Industry Standard Process for Data Mining) ist ein von der EU gefördertes, branchenübergreifendes Standardmodell für das Data Mining. Es wurde 1996 unter Mitarbeit zahlreicher namhafter Konzerne entwickelt und definiert insgesamt sechs verschiedene Prozessphasen. CRISP-DM ist anwendungsneutral und in beliebigen Bereichen einsetzbar.

(© aga7ta - stock.adobe.com)

Bei einem Chatbot handelt es sich um ein technisches Dialogsystem, mit dem per Texteingabe oder Sprache kommuniziert werden kann. Chatbots werden häufig eingesetzt, um Anfragen automatisiert und ohne direkten menschlichen Eingriff zu beantworten oder zu bearbeiten.

(© aga7ta - stock.adobe.com)

Das Datenbankmanagementsystem, abgekürzt DBMS, ist neben den eigentlichen Daten der wichtigste Bestandteil einer jeden Datenbank. Es übernimmt die Aufgabe der Organisation und Strukturierung der Daten. Gleichzeitig kontrolliert es lesende und schreibende Zugriffe.

(© aga7ta - stock.adobe.com)

Data Mining ist die systematische Anwendung computergestützter Methoden, um in vorhandenen Datenbeständen Muster, Trends oder Zusammenhänge zu finden. Zur Wissensentdeckung eingesetzte Algorithmen basieren unter anderem auf statistischen Methoden.

(© aga7ta - stock.adobe.com)

Relationale Datenbanken ist das am weitesten verbreitete Datenbankmodell. Es setzt auf das relationale Datenbankmodell, das auf der Speicherung von Informationen in verschiedenen Tabellen basiert, die untereinander über Beziehungen (Relationen) verknüpft sind.

(© aga7ta - stock.adobe.com)

Die Normalisierung findet bei relationalen Datenbankschemata statt und hat zum Ziel, Redundanzen, Inkonsistenzen und Anomalien zu vermeiden und zu beseitigen. Zur Durchführung kommen bis zu fünf verschiedene aufeinander aufbauende Normalformen zum Einsatz. Normalisierte Datenbanken folgen einem klar strukturierten Modell.

(© aga7ta - stock.adobe.com)

NoSQL steht für „Not only SQL“ und bezeichnet Datenbanksysteme, die einen nicht-relationalen Ansatz verfolgen. Diese Datenbanken, denen verschiedene Datenbankmodelle zugrunde liegen können, sind horizontal skalierbar und lassen sich für Big-Data-Anwendungen einsetzen.

(© aga7ta - stock.adobe.com)

Beim Data Lake handelt es sich um einen sehr großen Datenspeicher, der die Daten aus den unterschiedlichsten Quellen in ihrem Rohformat aufnimmt. Er kann sowohl unstrukturierte als auch strukturierte Daten enthalten und lässt sich für Big-Data-Analysen einsetzen.

(© aga7ta - stock.adobe.com)

Beim ETL-Prozess handelt es sich um mehrere Einzelschritte, durch die sich Daten aus verschiedenen Datenquellen per Extrahieren und Aufbereiten in ein Data Warehouse integrieren lassen. Der Prozess kommt häufig zur Verarbeitung großer Datenmengen im Big-Data- und Business-Intelligence-Umfeld zum Einsatz.

(© aga7ta - stock.adobe.com)

Random Forest ist ein Algorithmus, der sich für Klassifizierungs- und Regressionsaufgaben nutzen lässt. Er kombiniert die Ergebnisse vieler verschiedener Entscheidungsbäume, um bestmögliche Entscheidungen zu treffen. Der Lernalgorithmus gehört zu den Verfahren des überwachten Lernens und ist im Machine Learning einsetzbar. Das Verfahren ist relativ einfach und bietet kurze Trainingszeiten.

(© aga7ta - stock.adobe.com)

Bei Hadoop handelt es sich um ein auf Java basierendes Software Framework. Mit ihm lassen sich große Datenmengen auf verteilten Systemen in hoher Geschwindigkeit verarbeiten. Es ist zur Bewältigung der Datenverarbeitung im Big-Data-Umfeld geeignet.

(© aga7ta - stock.adobe.com)

Datenvalidierung prüft Daten auf Einhaltung bestimmter Validierungsregeln. Diese wurden zuvor aufgestellt und beinhalten beispielsweise Vorgaben zu Wertebereichen oder Formaten. Die Datenvalidierung verbessert die Ergebnisse der Datenverarbeitung und Datenanalyse. Sie kann bei der Eingabe der Daten, direkt vor dem Start oder während der Datenverarbeitung stattfinden.

(© aga7ta - stock.adobe.com)

Predictive Maintenance verfolgt als eine der Kernkomponenten von Industrie 4.0 einen vorausschauenden Ansatz und wartet Maschinen und Anlagen proaktiv, um Ausfallzeiten niedrig zu halten. Das Verfahren nutzt hierfür von Sensoren erfasste Messwerte und Daten.

(© aga7ta - stock.adobe.com)

Ein BLOB (Binary Large Object ) ist ein großes binäres Datenobjekt, das von Datenbanken meist in besonderer Form verarbeitet und gespeichert wird. Typische BLOBs sind Dateien wie Video-, Audio- oder Bilddateien

(© aga7ta - stock.adobe.com)

Das Convolutional Neural Network ist eine besondere Form des künstlichen neuronalen Netzwerks. Es besitzt mehrere Faltungsschichten und ist für maschinelles Lernen und Anwendungen mit Künstlicher Intelligenz (KI) im Bereich Bild- und Spracherkennung sehr gut geeignet.

(© aga7ta - stock.adobe.com)

Unstrukturierte Daten sind Informationen, die in einer nicht identifizierbaren und nicht normalisierten Datenstruktur vorliegen. Es kann sich beispielsweise um Texte, Bilder oder Audio- und Videodateien handeln. Im Big-Data-Umfeld haben unstrukturierte Daten eine große Bedeutung.

(© aga7ta - stock.adobe.com)

Eine Pivot-Tabelle strukturiert in Tabellenform vorliegende Daten, fasst sie zusammen und ermöglicht ihre Auswertung. Die Tabellenart gehört zu den Grundfunktionen aller gängigen Tabellenkalkulationsanwendungen. Für die Erstellung einer Pivot-Tabelle sind nur wenige Grundbedingungen zu erfüllen. Komplexe Formeln oder das Anwenden von SQL-Datenbankabfragen sind dank Pivot-Tabellen zum Teil überflüssig.

(© aga7ta - stock.adobe.com)

Apache Kafka ist eine Open Source Software, die die Speicherung und Verarbeitung von Datenströmen über eine verteilte Streaming-Plattform ermöglicht. Sie stellt verschiedene Schnittstellen bereit, um Daten in Kafka-Cluster zu schreiben, Daten zu lesen oder in und aus Drittsysteme zu importieren und zu exportieren.

(© aga7ta - stock.adobe.com)

Bei ODBC (Open Database Connectivity) handelt es sich um eine standardisierte, offene Schnittstelle für den Zugriff auf unterschiedliche Datenbankmanagementsysteme. Über ODBC-Treiber können Anwendungen direkt Anweisungen an Datenbanken erteilen oder Abfragen ausführen.

(© aga7ta - stock.adobe.com)

Das ARIMA-Modell ermöglicht die Beschreibung und Analyse von Zeitreihen. Es handelt sich um eine leistungsstarke Modellklasse, die den autoregressiven Teil und den gleitenden Mittelwertbeitrag des ARMA-Modells um die Differenzierung und Integration zur Trendbeseitigung und Herstellung der Stationarität erweitert.

(© aga7ta - stock.adobe.com)

Die Support Vector Machine (SVM) ist eine mathematische Methode, die im Umfeld des maschinellen Lernens zum Einsatz kommt. Sie gestattet das Klassifizieren von Objekten und ist vielfältig nutzbar. Unterstützt werden die lineare und die nicht-lineare Objektklassifizierung. Typische Anwendungsbereiche sind die Bild-, Text- oder Handschrifterkennung.

(© aga7ta - stock.adobe.com)

Big Data Analytics ermöglicht es, große Datenmengen aus unterschiedlichen Quellen zu analysieren. Die gewonnenen Informationen oder erkannten Muster lassen sich einsetzen, um beispielsweise Unternehmensprozesse zu optimieren.

(© aga7ta - stock.adobe.com)

Das Industrial Internet of Things (IIoT) stellt die industrielle Ausprägung des Internet of Things (IoT) dar. Es repräsentiert im Gegensatz zum IoT nicht die verbraucherorientierten Konzepte, sondern konzentriert sich auf die Anwendung des Internets der Dinge im produzierenden und industriellen Umfeld.

(© aga7ta - stock.adobe.com)

In einer Smart City werden moderne Technologien aus den Bereichen Energie, Mobilität, Stadtplanung, Verwaltung und Kommunikation so miteinander vernetzt, dass sich die Lebensqualität für die Bewohner steigert. Gleichzeitig profitiert die Nachhaltigkeit der Stadt.

Generative AI (Artificial Intelligence) ist eine Form von Künstlicher Intelligenz (KI), die auf Basis von Vorgaben und vorhandenen Informationen Inhalte generiert. Es kommen KI-Verfahren und -Technologien wie trainierte neuronale Netzwerke, maschinelles Lernen (Deep Learning) und KI-Algorithmen zum Einsatz, um nach Anweisungen Texte, Bilder, Audio- und Videoinhalte, Programmcode, 3D-Modelle und anderes zu erzeugen.

(© aga7ta - stock.adobe.com)

Die Smart Factory steht im Zentrum der sogenannten Industrie 4.0. Sie stellt eine Produktionsumgebung zur Verfügung, die sich im Idealfall ohne menschlichen Eingriff selbst organisiert. Dazu zählen Fertigungsanlagen und Logistiksysteme. Kernkomponenten sind cyber-physische Systeme und die intelligente Vernetzung.

(© aga7ta - stock.adobe.com)

Bei einem Management-Informationssystem (MIS) handelt es sich um ein computerunterstütztes Informationssystem, das wichtige Unternehmensinformationen für die Führungsebene sammelt und aufbereitet. Auf Basis der Informationen lassen sich Analysen durchführen, Probleme lösen oder strategische Entscheidungen treffen.

(© aga7ta - stock.adobe.com)

Ein Digitaler Zwilling repräsentiert ein reales Objekt in der digitalen Welt. Es kann sich um materielle oder immaterielle Objekte handeln. Die Digitalen Zwillinge sind aus Daten und Algorithmen aufgebaut und können über Sensoren mit der realen Welt gekoppelt sein. Für die Prozesse der Industrie 4.0 stellen Digitale Zwillinge die Basis dar.

(© aga7ta - stock.adobe.com)

Python ist eine Programmiersprache, die dank ihrer klaren Syntax und einfachen Lesbarkeit leicht zu erlernen ist und sich sehr vielseitig einsetzen lässt. Für die gängigen Betriebssysteme ist Python frei verfügbar. Die üblichen Programmierparadigmen wie die objektorientierte oder funktionale Programmierung werden unterstützt.

(© aga7ta - stock.adobe.com)

Der k-Means-Algorithmus ist ein Rechenverfahren, das sich für die Gruppierung von Objekten, die sogenannte Clusteranalyse, einsetzen lässt. Dank der effizienten Berechnung der Clusterzentren und dem geringen Speicherbedarf eignet sich der Algorithmus sehr gut für die Analyse großer Datenmengen, wie sie im Big-Data-Umfeld üblich sind.

(© aga7ta - stock.adobe.com)

Data Literacy oder Datenkompetenz beschreibt die Fähigkeit, mit Daten kompetent umzugehen. Sie umfasst verschiedene Einzelkompetenzen, um Daten zu erfassen, anzupassen, zu verändern, zu interpretieren und zu präsentieren. Die Datenkompetenz ist Grundlage und wichtiger Skill der Digitalisierung.

(© aga7ta - stock.adobe.com)

XGBoost ist eine frei verfügbare Bibliothek mit Open-Source-Lizenz. Sie ermöglicht überwachtes maschinelles Lernen mit dem Boosted-Tree-Algorithmus, einem Baumalgorithmus mit Gradient Boosting. Die Bibliothek ist für Betriebssysteme wie Linux, Windows oder macOS verfügbar und arbeitet mit Programmiersprachen wie C++, Java, Python, R und Julia.

(© aga7ta - stock.adobe.com)

Total Cost of Ownership, abgekürzt TCO, ist eine ganzheitliche Kostenbetrachtung von Produkten, Gütern oder Services, die nicht nur die Anschaffungskosten, sondern auch laufende direkte und indirekt Kosten über den kompletten Lebenszyklus hinweg berücksichtigt. Die Kostenbetrachtung bietet wichtige Hilfestellungen zur Beantwortung betriebswirtschaftlicher Fragestellungen wie Investitionsentscheidungen.

(© aga7ta - stock.adobe.com)

Die IT-Strategie macht Vorgaben über die zukünftige Entwicklung der Informationstechnik (IT) und IT-Infrastruktur eines Unternehmens. Sie folgt immer der Unternehmensstrategie und ist eine zentrale Komponente des IT-Managements. Ziel der Strategie ist es, durch das Management der IT und die Definition der Rahmenbedingungen die langfristigen Unternehmensziele zu erreichen.

(© aga7ta - stock.adobe.com)

OPC UA (Open Platform Communications Unified Architecture) ist eine Sammlung von Standards für die Kommunikation und den Datenaustausch im Umfeld der Industrieautomation. Mithilfe von OPC UA werden sowohl der Transport von Machine-to-Machine-Daten als auch Schnittstellen und die Semantik von Daten beschrieben. Die komplette Architektur ist serviceorientiert aufgebaut.

(© aga7ta - stock.adobe.com)

Neben dem Data Owner hat der Data Steward eine Schlüsselposition in der Umsetzung der Data Governance inne. Er ist verantwortlich für die Einhaltung der Datenqualität und setzt die strategischen Vorgaben der Data Governance fachlich um. Innerhalb des Unternehmens agiert er als Ansprechpartner für die verschiedenen Fachabteilungen bei Fragen oder Problemen zur Datenqualität.

(© aga7ta - stock.adobe.com)

Ein Key Performance Indicator, kurz KPI, ist eine aussagekräftige Kennzahl, mit der sich die Leistung einer Aktivität einer Organisation oder eines Unternehmens messen lässt. Es existieren viele verschiedene KPIs für unterschiedlichen Unternehmensbereiche und Tätigkeiten. Die leicht verständlichen Leistungsindikatoren können zur kontinuierlichen Überprüfung der Zielerreichung eingesetzt werden.

(© aga7ta - stock.adobe.com)

Data Science ist eine angewandte, interdisziplinäre Wissenschaft. Ziel der Datenwissenschaft ist es, Wissen aus Daten zu generieren, um beispielsweise die Unternehmenssteuerung zu optimieren oder die Entscheidungsfindung zu unterstützen. Es kommen Methoden und Wissen aus verschiedenen Bereichen wie Mathematik, Statistik, Stochastik, Informatik und Branchen-Know-how zum Einsatz.

1
...
9
10
11
...
16