Тестирование и диагностика
Операторы диагностики
DESCRIBE
Возвращает схему отношения.
Синтаксис
| DESCRIBE alias; |
Термины
| alias | Имя отношения. |
Использование
Используйте оператор DESCRIBE для просмотра схемы отношения. Можно просматривать внешние отношения, а также отношения, определенные в операторе FOREACH вложенного уровня.
Пример
В этом примере схема задается с помощью оператора AS. Если все данные соответствуют схеме, Pig будет использовать назначенные типы.
A = LOAD 'student' AS (name:chararray, age:int, gpa:float);
B = FILTER A BY name matches 'J.+';
C = GROUP B BY name;
D = FOREACH C GENERATE COUNT(B.age);
DESCRIBE A;
A: {name: chararray,age: int,gpa: float}
DESCRIBE B;
B: {name: chararray,age: int,gpa: float}
DESCRIBE C;
C: {group: chararray,B: {(name: chararray,age: int,gpa: float)}}
DESCRIBE D;
D: {long}
В этом примере схема не задана. Все поля по умолчанию имеют тип bytearray или long (см. Типы данных).
a = LOAD 'student';
b = FILTER a BY $0 matches 'J.+';
c = GROUP b BY $0;
d = FOREACH c GENERATE COUNT(b.$1);
DESCRIBE a;
Schema for a unknown.
DESCRIBE b;
2008-12-05 01:17:15,316 [main] WARN org.apache.pig.PigServer - bytearray is implicitly cast to chararray under LORegexp Operator
Schema for b unknown.
DESCRIBE c;
2008-12-05 01:17:23,343 [main] WARN org.apache.pig.PigServer - bytearray is implicitly caste to chararray under LORegexp Operator
c: {group: bytearray,b: {null}}
DESCRIBE d;
2008-12-05 03:04:30,076 [main] WARN org.apache.pig.PigServer - bytearray is implicitly caste to chararray under LORegexp Operator
d: {long}
Этот пример показывает, как просмотреть схему вложенного отношения с помощью оператора ::.
A = LOAD 'studentab10k' AS (name, age, gpa);
B = GROUP A BY name;
C = FOREACH B {
D = DISTINCT A.age;
GENERATE COUNT(D), group;}
DESCRIBE C::D;
D: {age: bytearray}
DUMP
Выводит результаты на экран.
Синтаксис
| DUMP alias; |
Термины
| alias | Имя отношения. |
Использование
Используйте оператор DUMP для выполнения (выполнения) операторов Pig Latin и отображения результатов на экране. DUMP предназначен для интерактивного режима; операторы выполняются немедленно, а результаты не сохраняются. Вы можете использовать DUMP как средство отладки, чтобы убедиться, что получаемые результаты соответствуют ожидаемым.
Обратите внимание, что в производственных скриптах НЕ следует использовать DUMP, так как это отключит многопоточные оптимизации и, вероятно, замедлит выполнение (см. Сохранение против вывода).
Пример
В этом примере выполняется вывод после каждого оператора.
A = LOAD 'student' AS (name:chararray, age:int, gpa:float); DUMP A; (John,18,4.0F) (Mary,19,3.7F) (Bill,20,3.9F) (Joe,22,3.8F) (Jill,20,4.0F) B = FILTER A BY name matches 'J.+'; DUMP B; (John,18,4.0F) (Joe,22,3.8F) (Jill,20,4.0F)
EXPLAIN
Отображает планы выполнения.
Синтаксис
| EXPLAIN [–script pigscript] [–out path] [–brief] [–dot] [-xml] [–param param_name = param_value] [–param_file file_name] alias; |
Термины
| –script | Используйте для указания скрипта Pig. |
| –out | Используйте для указания пути к результатам (каталог). Сгенерирует файлы logical_plan[.txt|.dot], physical_plan[.text|.dot], exec_plan[.text|.dot] в указанном пути. По умолчанию (без указания пути): Stdout |
| –brief | Не расширяет вложенные планы (представляет более компактную диаграмму для обзора). |
| –dot, -xml | Текстовый режим (по умолчанию): множественный вывод (разделение) будет разделен на разделы. Режим dot: выводит формат, который можно передать утилите dot для графического отображения – сгенерирует направленный ациклический граф (DAG) планов в любом поддерживаемом формате (.gif, .jpg...). Режим xml: выводит xml, представляющий план (в настоящее время отображается только логический план). |
| –param param_name = param_value | См. Замена параметров. |
| –param_file file_name | См. Замена параметров. |
| alias | Имя отношения. |
Использование
Используйте оператор EXPLAIN для просмотра логических, физических и планов выполнения MapReduce, которые используются для вычисления заданного отношения.
Если скрипт не указан:
-
Логический план отображает последовательность операторов, которые будут выполнены для построения отношения. Также применяются проверка типов и независимые от бэкенда оптимизации (например, применение фильтров на ранних этапах).
-
Физический план показывает, как логические операторы преобразуются в физические операторы, специфичные для бэкенда. Также применяются некоторые оптимизации бэкенда.
-
План MapReduce показывает, как физические операторы группируются в задачи MapReduce.
Если указан скрипт без имени отношения, будет выведен весь график выполнения (логический, физический или MapReduce).
Если указан скрипт с именем отношения, будет выведен план для данного имени отношения.
Пример
В этом примере оператор EXPLAIN генерирует все три плана. (Обратите внимание, что в этом примере показана только часть вывода.)
A = LOAD 'student' AS (name:chararray, age:int, gpa:float);
B = GROUP A BY name;
C = FOREACH B GENERATE COUNT(A.age);
EXPLAIN C;
-----------------------------------------------
Logical Plan:
-----------------------------------------------
Store xxx-Fri Dec 05 19:42:29 UTC 2008-23 Schema: {long} Type: Unknown
|
|---ForEach xxx-Fri Dec 05 19:42:29 UTC 2008-15 Schema: {long} Type: bag
etc ...
-----------------------------------------------
Physical Plan:
-----------------------------------------------
Store(fakefile:org.apache.pig.builtin.PigStorage) - xxx-Fri Dec 05 19:42:29 UTC 2008-40
|
|---New For Each(false)[bag] - xxx-Fri Dec 05 19:42:29 UTC 2008-39
| |
| POUserFunc(org.apache.pig.builtin.COUNT)[long] - xxx-Fri Dec 05
etc ...
--------------------------------------------------
| Map Reduce Plan
-------------------------------------------------
MapReduce node xxx-Fri Dec 05 19:42:29 UTC 2008-41
Map Plan
Local Rearrange[tuple]{chararray}(false) - xxx-Fri Dec 05 19:42:29 UTC 2008-34
| |
| Project[chararray][0] - xxx-Fri Dec 05 19:42:29 UTC 2008-35
etc ...
If you are running in Tez mode, Map Reduce Plan will be replaced with Tez Plan:
#--------------------------------------------------
# There are 1 DAGs in the session
#--------------------------------------------------
#--------------------------------------------------
# TEZ DAG plan: PigLatin:185.pig-0_scope-0
#--------------------------------------------------
Tez vertex scope-21 -> Tez vertex scope-22,
Tez vertex scope-22
Tez vertex scope-21
# Plan on vertex
B: Local Rearrange[tuple]{chararray}(false) - scope-35 -> scope-22
etc ...
ILLUSTRATE
Отображает пошаговое выполнение последовательности операторов.
Синтаксис
| ILLUSTRATE {alias | -script scriptfile}; |
Термины
| alias | Имя отношения. |
| -script scriptfile | Ключевое слово script, за которым следует имя скрипта Pig (например, myscript.pig). Файл скрипта не должен содержать оператор ILLUSTRATE. |
Использование
Используйте оператор ILLUSTRATE для изучения того, как данные преобразуются с помощью последовательности операторов Pig Latin. ILLUSTRATE позволяет тестировать программы на небольших наборах данных и сокращает время ожидания.
ILLUSTRATE основан на генераторе примеров (см. Generating Example Data for Dataflow Programs). Алгоритм работает, извлекая небольшую выборку входных данных, а затем распространяя эти данные по конвейеру. Однако некоторые операторы, такие как JOIN и FILTER, могут удалять кортежи из данных — и это может привести к отсутствию данных, следующих по конвейеру. Для решения этой проблемы алгоритм автоматически генерирует примеры данных практически в реальном времени. Таким образом, вы можете увидеть данные, проходящие по конвейеру, которые не были найдены в исходных входных данных, но эти данные ничего не меняют и гарантируют, что вы сможете изучить семантику операторов Pig Latin.
Как показано в примерах ниже, вы можете использовать ILLUSTRATE для проверки отношения или всего скрипта Pig.
Пример - Отношение
Этот пример демонстрирует использование ILLUSTRATE с отношением. Обратите внимание, что оператор LOAD должен включать схему (оператор AS).
grunt> visits = LOAD 'visits.txt' AS (user:chararray, url:chararray, timestamp:chararray);
grunt> DUMP visits;
(Amy,yahoo.com,19990421)
(Fred,harvard.edu,19991104)
(Amy,cnn.com,20070218)
(Frank,nba.com,20070305)
(Fred,berkeley.edu,20071204)
(Fred,stanford.edu,20071206)
grunt> recent_visits = FILTER visits BY timestamp >= '20071201';
grunt> user_visits = GROUP recent_visits BY user;
grunt> num_user_visits = FOREACH user_visits GENERATE group, COUNT(recent_visits);
grunt> DUMP num_user_visits;
(Fred,2)
grunt> ILLUSTRATE num_user_visits;
------------------------------------------------------------------------
| visits | user: chararray | url: chararray | timestamp: chararray |
------------------------------------------------------------------------
| | Fred | berkeley.edu | 20071204 |
| | Fred | stanford.edu | 20071206 |
| | Frank | nba.com | 20070305 |
------------------------------------------------------------------------
-------------------------------------------------------------------------------
| recent_visits | user: chararray | url: chararray | timestamp: chararray |
-------------------------------------------------------------------------------
| | Fred | berkeley.edu | 20071204 |
| | Fred | stanford.edu | 20071206 |
-------------------------------------------------------------------------------
------------------------------------------------------------------------------------------------------------------
| user_visits | group: chararray | recent_visits: bag({user: chararray,url: chararray,timestamp: chararray}) |
------------------------------------------------------------------------------------------------------------------
| | Fred | {(Fred, berkeley.edu, 20071204), (Fred, stanford.edu, 20071206)} |
------------------------------------------------------------------------------------------------------------------
--------------------------------------------------
| num_user_visits | group: chararray | long |
--------------------------------------------------
| | Fred | 2 |
--------------------------------------------------
Пример - Скрипт
Этот пример демонстрирует использование ILLUSTRATE со скриптом Pig. Обратите внимание, что сам скрипт не должен содержать оператор ILLUSTRATE.
grunt> cat visits.txt Amy yahoo.com 19990421 Fred harvard.edu 19991104 Amy cnn.com 20070218 Frank nba.com 20070305 Fred berkeley.edu 20071204 Fred stanford.edu 20071206 grunt> cat visits.pig visits = LOAD 'visits.txt' AS (user, url, timestamp); recent_visits = FILTER visits BY timestamp >= '20071201'; historical_visits = FILTER visits BY timestamp <= '20000101'; DUMP recent_visits; DUMP historical_visits; STORE recent_visits INTO 'recent'; STORE historical_visits INTO 'historical'; grunt> exec visits.pig (Fred,berkeley.edu,20071204) (Fred,stanford.edu,20071206) (Amy,yahoo.com,19990421) (Fred,harvard.edu,19991104) grunt> illustrate -script visits.pig ------------------------------------------------------------------------ | visits | user: bytearray | url: bytearray | timestamp: bytearray | ------------------------------------------------------------------------ | | Amy | yahoo.com | 19990421 | | | Fred | stanford.edu | 20071206 | ------------------------------------------------------------------------ ------------------------------------------------------------------------------- | recent_visits | user: bytearray | url: bytearray | timestamp: bytearray | ------------------------------------------------------------------------------- | | Fred | stanford.edu | 20071206 | ------------------------------------------------------------------------------- --------------------------------------------------------------------------------------- | Store : recent_visits | user: bytearray | url: bytearray | timestamp: bytearray | --------------------------------------------------------------------------------------- | | Fred | stanford.edu | 20071206 | --------------------------------------------------------------------------------------- ----------------------------------------------------------------------------------- | historical_visits | user: bytearray | url: bytearray | timestamp: bytearray | ----------------------------------------------------------------------------------- | | Amy | yahoo.com | 19990421 | ----------------------------------------------------------------------------------- ------------------------------------------------------------------------------------------- | Store : historical_visits | user: bytearray | url: bytearray | timestamp: bytearray | ------------------------------------------------------------------------------------------- | | Amy | yahoo.com | 19990421 | -------------------------------------------------------------------------------------------
Сценарии Pig и идентификаторы задач MapReduce (только режим MapReduce)
Сложные скрипты Pig часто генерируют множество задач MapReduce. Для помощи в отладке скрипта Pig выводит сводку выполнения, показывающую, какие отношения (алиасы) сопоставляются с каждой задачей MapReduce.
JobId Maps Reduces MaxMapTime MinMapTIme AvgMapTime MaxReduceTime
MinReduceTime AvgReduceTime Alias Feature Outputs
job_201004271216_12712 1 1 3 3 3 12 12 12 B,C GROUP_BY,COMBINER
job_201004271216_12713 1 1 3 3 3 12 12 12 D SAMPLER
job_201004271216_12714 1 1 3 3 3 12 12 12 D ORDER_BY,COMBINER
hdfs://mymachine.com:9020/tmp/temp743703298/tmp-2019944040,
Статистика Pig
Pig Statistics — это фреймворк для сбора и хранения статистических данных на уровне скриптов для Pig Latin. Характеристики скриптов Pig Latin и полученных задач MapReduce собираются во время выполнения скрипта. Эти статистические данные затем доступны для пользователей Pig и инструментов, использующих Pig (например, Oozie), для получения после завершения задачи.
Новые статистические данные Pig, а также существующие статистические данные Hadoop, также доступны через файл истории Hadoop (и файл job xml). Piggybank имеет HadoopJobHistoryLoader, который служит примером использования самого Pig для запроса этих статистических данных (загрузчик может быть использован в качестве эталонной реализации, но НЕ поддерживается для использования в производстве).
API Java
Несколько новых публичных классов упрощают интеграцию внешних инструментов, таких как Oozie, со статистикой Pig.
Статистические данные Pig доступны здесь: http://pig.apache.org/docs/r0.14.0/api/
Классы статистики находятся в пакете: org.apache.pig.tools.pigstats
- PigStats
- SimplePigStats
- EmbeddedPigStats
- JobStats
- TezPigScriptStats
- TezDAGStats
- TezVertexStats
- OutputStats
- InputStats
Класс PigRunner имитирует поведение класса Main, но возвращает пользователю объект статистики. По желанию, вы можете вызвать API с реализацией слушателя прогресса, который будет вызываться во время выполнения Pig runtime.
package org.apache.pig;
public abstract class PigRunner {
public static PigStats run(String[] args, PigProgressNotificationListener listener)
}
public interface PigProgressNotificationListener extends java.util.EventListener {
// just before the launch of MR jobs for the script
public void LaunchStartedNotification(int numJobsToLaunch);
// number of jobs submitted in a batch
public void jobsSubmittedNotification(int numJobsSubmitted);
// a job is started
public void jobStartedNotification(String assignedJobId);
// a job is completed successfully
public void jobFinishedNotification(JobStats jobStats);
// a job is failed
public void jobFailedNotification(JobStats jobStats);
// a user output is completed successfully
public void outputCompletedNotification(OutputStats outputStats);
// updates the progress as percentage
public void progressUpdatedNotification(int progress);
// the script execution is done
public void launchCompletedNotification(int numJobsSucceeded);
}
В зависимости от типа скрипта Pig, PigRunner.run() возвращает определённый подкласс PigStats: SimplePigStats (режим MapReduce/локальный), TezPigScriptStats (режим Tez/локальный Tez) или EmbeddedPigStats (встроенный скрипт). SimplePigStats содержит карту JobStats, которая сохраняет статистику для каждой задачи MapReduce скрипта Pig. TezPigScriptStats содержит карту TezDAGStats, которая сохраняет статистику для каждого Tez DAG скрипта Pig, а TezDAGStats содержит карту TezVertexStats, которая сохраняет статистику для каждого узла внутри Tez DAG. В зависимости от типа выполнения, EmbeddedPigStats содержит карту SimplePigStats или TezPigScriptStats, которая сохраняет статистику задачи Pig, запущенной во встроенном скрипте.
Если вы запускаете Pig в режиме Tez (или в режиме Tez/MapReduce), необходимо передать PigTezProgressNotificationListener, который расширяет PigProgressNotificationListener, в PigRunner.run(), чтобы получить уведомления как в режиме Tez, так и в режиме MapReduce.
Файл job XML
В конфигурацию job включены следующие записи:
| Статистика Pig | Описание |
| pig.script.id | UUID скрипта. Все задачи, запущенные скриптом, имеют один и тот же идентификатор скрипта. |
| pig.script | Текст скрипта в кодировке base64. |
| pig.command.line | Командная строка, используемая для запуска скрипта. |
| pig.hadoop.version | Установленная версия Hadoop. |
| pig.version | Используемая версия Pig. |
| pig.input.dirs | Список каталогов входных данных для задачи, разделённых запятыми. |
| pig.map.output.dirs | Список каталогов выходных данных в фазе map задачи, разделённых запятыми. |
| pig.reduce.output.dirs | Список каталогов выходных данных в фазе reduce задачи, разделённых запятыми. |
| pig.parent.jobid | Список идентификаторов родительских задач, разделённых запятыми. |
| pig.script.features | Список функций Pig, используемых в скрипте. |
| pig.job.feature | Список функций Pig, используемых в задаче. |
| pig.alias | Псевдоним, связанный с задачей. |
Загрузчик истории Hadoop
HadoopJobHistoryLoader в Piggybank загружает файлы истории Hadoop и файлы job xml из файловой системы. Для каждой задачи MapReduce загрузчик создаёт кортеж со схемой (j:map[], m:map[], r:map[]). Первая карта в схеме содержит записи, относящиеся к задаче. Вот некоторые важные имена ключей в карте:
| PIG_SCRIPT_ID CLUSTER QUEUE_NAME JOBID JOBNAME STATUS | USER HADOOP_VERSION PIG_VERSION PIG_JOB_FEATURE PIG_JOB_ALIAS PIG_JOB_PARENTS | SUBMIT_TIME LAUNCH_TIME FINISH_TIME TOTAL_MAPS TOTAL_REDUCES |
Примеры использования загрузчика для запроса статистических данных Pig показаны ниже.
Примеры
Найти скрипты, которые генерируют более трёх задач MapReduce:
a = load '/mapred/history/done' using HadoopJobHistoryLoader() as (j:map[], m:map[], r:map[]); b = group a by (j#'PIG_SCRIPT_ID', j#'USER', j#'JOBNAME'); c = foreach b generate group.$1, group.$2, COUNT(a); d = filter c by $2 > 3; dump d;
Найти время выполнения каждого скрипта (в секундах):
a = load '/mapred/history/done' using HadoopJobHistoryLoader() as (j:map[], m:map[], r:map[]);
b = foreach a generate j#'PIG_SCRIPT_ID' as id, j#'USER' as user, j#'JOBNAME' as script_name,
(Long) j#'SUBMIT_TIME' as start, (Long) j#'FINISH_TIME' as end;
c = group b by (id, user, script_name)
d = foreach c generate group.user, group.script_name, (MAX(b.end) - MIN(b.start)/1000;
dump d;
Найти количество скриптов, запущенных пользователем и очередью на кластере:
a = load '/mapred/history/done' using HadoopJobHistoryLoader() as (j:map[], m:map[], r:map[]); b = foreach a generate j#'PIG_SCRIPT_ID' as id, j#'USER' as user, j#'QUEUE_NAME' as queue; c = group b by (id, user, queue) parallel 10; d = foreach c generate group.user, group.queue, COUNT(b); dump d;
Найти скрипты, у которых есть задачи с ошибками:
a = load '/mapred/history/done' using HadoopJobHistoryLoader() as (j:map[], m:map[], r:map[]); b = foreach a generate (Chararray) j#'STATUS' as status, j#'PIG_SCRIPT_ID' as id, j#'USER' as user, j#'JOBNAME' as script_name, j#'JOBID' as job; c = filter b by status != 'SUCCESS'; dump c;
Найти скрипты, использующие только стандартное распараллеливание:
a = load '/mapred/history/done' using HadoopJobHistoryLoader() as (j:map[], m:map[], r:map[]); b = foreach a generate j#'PIG_SCRIPT_ID' as id, j#'USER' as user, j#'JOBNAME' as script_name, (Long) r#'NUMBER_REDUCES' as reduces; c = group b by (id, user, script_name) parallel 10; d = foreach c generate group.user, group.script_name, MAX(b.reduces) as max_reduces; e = filter d by max_reduces == 1; dump e;
Слушатель уведомлений о прогрессе Pig
Pig предоставляет возможность зарегистрировать слушателя для получения уведомлений во время выполнения скрипта. События включают создание плана MapReduce, запуск скрипта, прогресс скрипта, завершение скрипта, отправку задачи, запуск задачи, завершение задачи и ошибку задачи.
Для регистрации слушателя установите параметр pig.notification.listener в полное имя класса реализации org.apache.pig.tools.pigstats.PigProgressNotificationListener. Класс должен существовать в пути поиска классов процесса, отправляющего задачу Pig. Если параметр pig.notification.listener.arg установлен, значение будет передано в конструктор реализующего класса, который принимает единственный строковый аргумент.
PigUnit
PigUnit — это простой xUnit фреймворк, который позволяет легко тестировать ваши скрипты Pig. С PigUnit вы можете проводить модульное тестирование, регрессионное тестирование и быстрое прототипирование. Если вы запускаете Pig в локальном режиме, настройка кластера не требуется.
Сборка PigUnit
Для компиляции PigUnit выполните следующую команду из Pig trunk. Компиляция создаст файл pigunit.jar.
$pig_trunk ant pigunit-jar
Запуск PigUnit
PigUnit можно запускать в локальном режиме Pig или в режиме MapReduce.
Локальный режим
PigUnit по умолчанию работает в локальном режиме Pig. Локальный режим быстрый и позволяет использовать локальную файловую систему в качестве кластера HDFS. Локальный режим не требует реального кластера, но каждый раз создаётся новый локальный.
Другие режимы
PigUnit также работает в режимах MapReduce/Tez/локальный Tez Pig. Режимы MapReduce/Tez требуют использования Hadoop кластера и установки HDFS. Они активируются при установке системной переменной Java pigunit.exectype в определённые значения (mr/tez/tez_local): например, -Dpigunit.exectype=mr или System.getProperties().setProperty("pigunit.exectype", "mr"), что означает, что PigUnit будет работать в режиме mr. Кластер, который вы выбрали для запуска тестов mr/tez, должен быть указан в переменной CLASSPATH (аналогично переменной HADOOP_CONF_DIR).
Пример PigUnit
Многие примеры PigUnit доступны в тестах PigUnit.
Приведённый здесь пример вычисляет топ N самых часто встречающихся запросов. Скрипт Pig, top_queries.pig, похож на Популярность фраз запроса в руководстве по Pig. Он ожидает входной файл запросов и параметр n (n равно 2 в нашем случае для вычисления топ 2).
Настройка теста для этого скрипта проста, так как аргумент и входные данные задаются двумя текстовыми массивами. То же самое относится к ожидаемому выводу скрипта, который будет сравниваться с фактическим результатом выполнения скрипта Pig.
Тест Java
@Test
public void testTop2Queries() {
String[] args = {
"n=2",
};
PigTest test = new PigTest("top_queries.pig", args);
String[] input = {
"yahoo",
"yahoo",
"yahoo",
"twitter",
"facebook",
"facebook",
"linkedin",
};
String[] output = {
"(yahoo,3)",
"(facebook,2)",
};
test.assertOutput("data", input, "queries_limit", output);
}
top_queries.pig
data =
LOAD 'input'
AS (query:CHARARRAY);
queries_group =
GROUP data
BY query;
queries_count =
FOREACH queries_group
GENERATE
group AS query,
COUNT(data) AS total;
queries_ordered =
ORDER queries_count
BY total DESC, query;
queries_limit =
LIMIT queries_ordered $n;
STORE queries_limit INTO 'output';
Запуск
Тест можно выполнить с помощью JUnit (или любого другого фреймворка Java). Для этого требуются:
- pig.jar
- pigunit.jar
Тест занимает около 25 секунд для выполнения и должен пройти успешно. В случае ошибки (например, изменение параметра n на n=3) отображается разница в выводе:
junit.framework.ComparisonFailure: null expected:<...ahoo,3)
(facebook,2)[]> but was:<...ahoo,3)
(facebook,2)[
(linkedin,1)]>
at junit.framework.Assert.assertEquals(Assert.java:81)
at junit.framework.Assert.assertEquals(Assert.java:87)
at org.apache.pig.pigunit.PigTest.assertEquals(PigTest.java:272)
Мокинг
Иногда вам нужно смоделировать данные в определённых псевдонимах. Используя мокинг PigTest, вы можете переопределить псевдоним везде, где он присваивается. Если вы не знаете схему (или хотите сохранить свой тест динамичным), вы можете использовать PigTest.getAliasToSchemaMap() для определения схемы. Если вы решили пойти по этому пути, вы должны кэшировать карту для конкретного скрипта, чтобы обеспечить эффективное выполнение.
@Test
public void testTop2Queries() {
String[] args = {
"n=2",
};
PigTest test = new PigTest("top_queries.pig", args);
String[] mockData = {
"yahoo",
"yahoo",
"yahoo",
"twitter",
"facebook",
"facebook",
"linkedin",
};
//You should cache the map if you can
String schema = test.getAliasToSchemaMap().get("data");
test.mockAlias("data", mockData, schema);
String[] output = {
"(yahoo,3)",
"(facebook,2)",
};
test.assertOutputAnyOrder("queries_limit", output);
}
Советы по устранению неполадок
Ниже обсуждаются распространённые проблемы, которые могут возникнуть.
Путь поиска классов в режиме MapReduce
При использовании PigUnit в режиме MapReduce убедитесь, что $HADOOP_CONF_DIR кластера включён в ваш путь поиска классов.
MiniCluster генерирует его в build/classes.
org.apache.pig.backend.executionengine.ExecException: ERROR 4010: Cannot find hadoop configurations in classpath (neither hadoop-site.xml nor core-site.xml was found in the classpath). If you plan to use local mode, please put -x local option in command line
UDF jar не найдены
Эта ошибка означает, что в вашей тестовой среде отсутствуют некоторые jar-файлы.
WARN util.JarManager: Couldn't find the jar for org.apache.pig.piggybank.evaluation.string.LOWER, skip it
Хранение данных
В настоящее время Pig отбрасывает все команды STORE и DUMP. Вы можете указать PigUnit сохранить команды и выполнить скрипт:
test = new PigTest(PIG_SCRIPT, args);
test.unoverride("STORE");
test.runScript();
Архив кэша
Для работы с архивом кэша ваша тестовая среда должна иметь опции архива кэша, заданные свойствами Java или в дополнительной XML-конфигурации в пути поиска классов.
Если вы используете локальный кластер, вам необходимо установить необходимые переменные среды перед его запуском:
export LD_LIBRARY_PATH=/home/path/to/lib
Планы на будущее
Улучшения и другие компоненты, основанные на PigUnit, которые могут быть разработаны в будущем.
Например, мы могли бы создать PigTestCase и PigTestSuite поверх PigTest, чтобы:
- Добавить понятие рабочих пространств для каждого теста.
- Убрать повторяющийся код, появляющийся при наличии более одного метода тестирования.
- Добавить автономную утилиту, которая считывает конфигурации тестов и генерирует отчёт о тестировании.
© 2007–2016 Apache Software Foundation
Licensed under the Apache Software License version 2.0.
https://pig.apache.org/docs/r0.15.0/test.html