Kotlin для науки о данных
От создания конвейеров данных до развертывания моделей машинного обучения в производстве, Kotlin может быть отличным выбором для работы с данными:
Kotlin лаконичен, удобочитаем и прост в изучении.
Статическая типизация и безопасность по отношению к null помогают создавать надежный и поддерживаемый код, который легко отлаживать.
Будучи языком JVM, Kotlin обеспечивает высокую производительность и возможность использования целого экосистемы проверенных Java библиотек.
Интерактивные редакторы
Записные книжки, такие как Jupyter Notebook, Datalore и Apache Zeppelin, предоставляют удобные инструменты для визуализации данных и исследовательской работы. Kotlin интегрируется с этими инструментами, помогая вам исследовать данные, делиться своими результатами с коллегами или развивать свои навыки в области науки о данных и машинного обучения.
Ядро Jupyter на Kotlin
Jupyter Notebook — это открытая веб-приложение, позволяющее создавать и делиться документами (также известными как «записные книжки»), которые могут содержать код, визуализации и текст Markdown. Kotlin-jupyter — это открытый проект, который добавляет поддержку Kotlin в Jupyter Notebook.

Посмотрите репозиторий Kotlin-ядра на GitHub для инструкций по установке, документации и примеров.
Записные книжки на Kotlin в Datalore
С помощью Datalore вы можете использовать Kotlin в браузере, прямо из коробки, без необходимости установки. Вы также можете работать над записными книжками на Kotlin в реальном времени, получать интеллектуальную помощь при написании кода и делиться результатами в виде интерактивных или статических отчётов. Посмотрите образец отчета.

Зарегистрируйтесь и используйте Kotlin с бесплатной учётной записью Datalore Community.
Интерпретатор Zeppelin на Kotlin
Apache Zeppelin — популярное веб-решение для интерактивного анализа данных. Оно обеспечивает сильную поддержку системы кластерного вычисления Apache Spark, что особенно полезно для инженерии данных. Начиная с версии 0.9.0, Apache Zeppelin поставляется с интегрированным интерпретатором Kotlin.

Библиотеки
Экосистема библиотек для задач, связанных с данными, созданная сообществом Kotlin, быстро расширяется. Ниже приведены некоторые библиотеки, которые могут быть полезны:
Библиотеки Kotlin
Multik: многомерные массивы в Kotlin. Библиотека предоставляет интуитивно понятный, безопасный с точки зрения типов и размерностей API для математических операций над многомерными массивами. Multik предлагает взаимозаменяемые вычислительные движки JVM и native, а также их комбинацию для оптимальной производительности.
KotlinDL — высокоуровневый API для глубокого обучения, написанный на Kotlin и вдохновленный Keras. Он предлагает простые API для обучения моделей глубокого обучения с нуля, импорта существующих моделей Keras для инференции и использования трансферного обучения для настройки существующих предобученных моделей под ваши задачи.
Kotlin DataFrame — библиотека для обработки структурированных данных. Она стремится согласовать статическую типизацию Kotlin с динамической природой данных, используя как всю мощь языка Kotlin, так и возможности неявного кода в Jupyter notebooks и REPL.
Kotlin для Apache Spark добавляет недостающий уровень совместимости между Kotlin и Apache Spark. Он позволяет разработчикам Kotlin использовать знакомые языковые особенности, такие как классы данных и лямбда-выражения, как простые выражения в фигурных скобках или ссылки на методы.
kotlin-statistics — библиотека, предоставляющая расширяющие функции для исследовательской и производственной статистики. Она поддерживает базовые числовые функции для списков/последовательностей/массивов (от
sumдоskewness), операторы срезов (например,countBy,simpleRegressionBy), операции по созданию интервалов, дискретную выборку PDF, классификатор наивного Байеса, кластеризацию, линейную регрессию и многое другое.kmath — экспериментальная библиотека, первоначально вдохновленная NumPy, но развившаяся до более гибких абстракций. Она реализует математические операции, объединенные в алгебраические структуры над типами Kotlin, определяет API для линейных структур, выражений, гистограмм, потоковых операций, предоставляет взаимозаменяемые оболочки над существующими библиотеками Java и Kotlin, включая ND4J, Commons Math, Multik и другие.
krangl — библиотека, вдохновленная R's dplyr и Python's pandas. Эта библиотека предоставляет функциональность для обработки данных с помощью функционального API; она также включает функции для фильтрации, преобразования, агрегации и изменения формы табличных данных.
lets-plot — библиотека для визуализации статистических данных, написанная на Kotlin. Lets-Plot многоплатформенна и может использоваться не только с JVM, но и с JS и Python.
kravis — ещё одна библиотека для визуализации табличных данных, вдохновлённая R's ggplot.
londogard-nlp-toolkit — библиотека, предоставляющая утилиты при работе с обработкой естественного языка, такие как векторные представления слов/подслов/предложений, частоты слов, стоп-слова, стемминг и многое другое.
Библиотеки Java
Поскольку Kotlin обеспечивает полную совместимость с Java, вы также можете использовать Java-библиотеки для работы с данными в вашем коде Kotlin. Вот некоторые примеры таких библиотек:
DeepLearning4J — библиотека глубокого обучения для Java
ND4J — эффективная библиотека для работы с матрицами для JVM
Dex — инструмент визуализации данных на базе Java
-
Smile — комплексная система машинного обучения, обработки естественного языка, линейной алгебры, графов, интерполяции и визуализации. Помимо API для Java, Smile также предоставляет функциональный Kotlin API, а также API для Scala и Clojure.
Smile-NLP-kt — переписывание на Kotlin Scala implicits для части обработки естественного языка Smile в формате расширяющих функций и интерфейсов.
Apache Commons Math — общая математическая, статистическая и библиотека машинного обучения для Java
NM Dev — математическая библиотека Java, охватывающая всю классическую математику.
OptaPlanner — утилита-решатель для задач оптимизационного планирования.
Charts — научная JavaFX библиотека построения графиков, находится в разработке.
Apache OpenNLP — набор инструментов на основе машинного обучения для обработки текстов естественного языка.
CoreNLP — набор инструментов для обработки естественного языка.
Apache Mahout — распределенная платформа для регрессии, кластеризации и рекомендаций.
Weka — набор алгоритмов машинного обучения для задач анализа данных.
Tablesaw — Java dataframe. Включает библиотеку визуализации на основе Plot.ly.
Если этот список не удовлетворяет ваши потребности, вы можете найти больше вариантов в репозитории GitHub Kotlin Machine Learning Demos с примерами от Томаса Ниелда.
© 2010–2022 JetBrains s.r.o. and Kotlin Programming Language contributors
Licensed under the Apache License, Version 2.0.
https://kotlinlang.org/docs/data-science-overview.html