Продолжая использовать наш сайт, вы даете согласие на обработку файлов cookie, которые обеспечивают правильную работу сайта. Благодаря им мы улучшаем сайт!
Принять и закрыть

Читать, слущать книги онлайн бесплатно!

Электронная Литература.

Бесплатная онлайн библиотека.



Главная
Все книги
Назад
Читать: Все географические карты лгут - Марк Монмонье на бесплатной онлайн библиотеке Э-Лит


Помоги проекту - поделись книгой:

Внимательные пользователи карт должны тщательно исследовать статистические карты на предмет использования их в своих интересах рекламирующими себя учеными, нечестными политиками, рекламщиками-обманщиками и другими пропагандистами. В то же время именно в области информационных карт широко распространенное ныне картографическое программное обеспечение делает самообман неизбежным. Сколько пользователей картографических приложений знает о том, что использование разных оттенков цветов в качестве символов, отображающих количественные показатели, может способствовать созданию ошибочных карт? Или что различия в размерах между такими административными единицами, как округ и переписной район, могут радикально исказить картографические сравнения?

В данной главе рассматривается несколько гипотетических примеров, в которых объектом выступает некое электронное устройство, называемое «прибор», и на основе которых мы изучим вопросы территориальной агрегации и классификации данных на картах. Все, кто интересуется вопросами публичной политики и политического анализа, маркетинга, социологии или предотвращения распространения болезней, должны знать, как карты, основанные на числах, могут предоставить нам полезную информацию, равно как и привести к грубым искажениям.

Агрегация, однородность и административные единицы

Большинство статистических карт отображают данные, собранные по таким территориальным и административным единицам, как округа, штаты и страны. Нанесенные на карту, составленную на основе статистических замеров, коррелирующих коэффициентов и других подобных средств, картографические данные отображают соответствующую картину только для какого-то одного типа административных единиц. Поскольку объединение на одной карте нескольких разных единиц может выявить различные закономерности или взаимоотношения между ними, постольку аналитики должны описывать и трактовать отображаемые исследования, четко фиксируя использованную единицу измерений. Например, примечание о том, что какие-то значения на статистической карте обычно возрастают по направлению «север – юг» на уровне округа, предупреждает пользователя (и составителя карты!) о том, что на уровне штата тенденция может быть другой.

Тип агрегации (объединения) географических единиц может оказывать огромное влияние на характер отображения различных статистических данных и показателей на карте. Например, такой показатель, как количество приборов на домохозяйство, кардинально меняет карту в тех случаях, когда он показывает данные отдельно по округам и по городам, в них входящим. Последовательно изображенные на рис. 11.1 три таблицы с данными по городам (без графических символов) показывают нам, как показатели могут меняться в зависимости от изменения единицы измерения. Таблица слева вверху показывает число приборов в каждом из 28 городов, таблица справа вверху показывает количество домохозяйств в них, а таблица внизу посередине демонстрирует среднее соотношение прибор/домохозяйство. Обратите внимание на возрастание показателя этого соотношения: он низок в верхней строке таблицы, средний по значению во второй и третьей строках и высокий – в нижней четвертой строке. Обратите внимание и на то, что три города в правой верхней и нижней левой частях таблицы, а также в третьей строке имеют относительно большое число домохозяйств. Эти отличия в плотности домохозяйств создают совершенно другое соотношение прибор/домохозяйство при его подсчете по округам, которое отражено на левой таблице рис. 11.2.


Рис. 11.1. Таблицы, в которых за единицу измерения принят город, показывают количество приборов (слева вверху), количество домохозяйств (справа вверху) и среднее количество приборов на домохозяйство в 28 гипотетических городах


Рис. 11.2. Таблицы, в которых за единицу измерения принят округ, показывают количество приборов (слева), количество домохозяйств (посередине) и среднее количество приборов на домохозяйство для 3 округов, в которые объединены 28 гипотетических городов

То, каким образом такие единицы измерений, как города, включаются в агрегации, зависит от порой произвольно устанавливаемых административных границ округов. На рис. 11.3 используется два дополнительных критерия агрегации 28 городов, для того чтобы продемонстрировать возможный эффект от исторической ошибки. Верхний ряд карт представляет собой объединение городов в три горизонтальные строки по округам. В нем присутствует ранее отмеченная по городам тенденция увеличения соотношения прибор/домохозяйство от верхней строки к нижней. И наоборот, нижний ряд карт представляет собой такую же правдоподобную агрегацию городов в четыре округа, из которых данные по трем будут представлять собой плотность домохозяйств, а одно – остаток по региону. Соотношение прибор/домохозяйство для нижнего ряда карт отличает три более «городских» округа от одного гораздо большего по размерам «сельскохозяйственного», в котором это соотношение чуть превышает единицу (1). Графические символы в виде разных оттенков серого цвета создадут сильно разнящиеся друг от друга хороплетные карты, отображающие показатели в правых таблицах на рис. 11.2 и 11.3.


Рис. 11.3. Статистические таблицы, в которых за единицу измерения принят округ и использованы другие основания для объединения 28 городов в округа

Другой пример демонстрирует, как агрегация может повлиять на характер карты. Если рис. 11.3 показывает, что различные варианты объединения городов в округа могут существенно изменить статистическую картину на уровне округов, то рис. 11.4 свидетельствует о том, что агрегация может дать одну и ту же картину на уровне округа, притом что на уровне городов показатели существенно различались.

Обратите внимание на то, что таблицы на рис. 11.4, в которых за единицу измерения принят город, показывают совершенно другое соотношение прибор/домохозяйство, чем на рис. 11.1. Особое внимание обратите на увеличение этого соотношения от тех городов, которые расположены в нижней части карты, к городам, которые находятся в верхней правой ее части. Однако если эти города объединить по границам округов так же, как это сделано на рис. 11.2, тогда эта статистика даст одинаковые показатели с уже представленными для уровня округов. Сравнение трех таблиц с теми, которые изображены на рис. 11.1, ясно указывает на важность четкого обозначения используемых единиц измерения и непринятия тенденций, характерных для одного уровня агрегации, на других уровнях.


Рис. 11.4. Показатели количества приборов, количества домохозяйств и соотношения прибор/домохозяйство, радикально отличающиеся от изображенных на рис. 11.1, могут дать такие же соотношения на уровне округов, что и на рис. 11.2

В приведенных выше примерах округа явно не являются однородными по своему составу. Но можно ли предположить, что такая однородность существует хотя бы в городах? Какие вариации в распределении и плотности этих 11 200 домохозяйств скрыты в пределах городских границ? На рис. 11.5 представлен один из правдоподобных вариантов точечных символов, которыми может быть изображена агрегированная картина соответствующих значений и соотношений в городах, приведенная на рис. 11.1. Три вида точечных символов используются для обозначения групп из десяти, ста и пятисот домохозяйств. Имеются также символы, указывающие на среднее наличие приборов в одном домохозяйстве – 0, 1 или 2. Небольшие символы, обозначающие десять домохозяйств, представляют в основном сельскую местность, где в домах может вообще не быть электронных приборов из-за плохой связи, недостатка свободного времени у жителей или их отрицательного отношения к электронным устройствам вообще. Значительная часть данного региона вообще не заселена из-за сложного рельефа местности, наличия болот, парков и лесов, а также общей неразвитости федерального земельного фонда. Из шести больших населенных пунктов, имеющих 400 и более домохозяйств, в двух на каждое домохозяйство приходится в среднем два и больше электронных прибора, а в двух других есть дома, в которых таких устройств вообще нет. Хотя рис. 11.5 содержит элементы, соотносящиеся с картиной рис. 11.1 с ее тенденцией, направленной на городском уровне сверху вниз в сторону повышения, а также с трендом, направленным слева направо на карте на уровне округов (рис. 11.2), ее показатель соотношения прибор/домохозяйство более походит на то, что изображено в правой нижней части рис. 11.3, где границы округов выделяют три больших жилых кластера из остальной части региона. Но даже здесь различия очень велики, еще раз показывая нам, как конфигурация административных единиц может скрыть интересные детали и внести искажения в географические переменные.

Эффект от агрегации может стать еще более серьезным, если невнимательный аналитик или наивный пользователь карт «перепрыгивает» от модели, основанной на административных единицах, к модели, базирующейся на отдельных домохозяйствах. Представьте себе, например, большой населенный пункт, отображенный в нижней правой части рис. 11.5. Средний показатель в два устройства на домохозяйство не обязательно означает, что в каждом из 1700 домов действительно имеется два прибора. В отдельных домохозяйствах их вообще может не быть, тогда как другие могут располагать и тремя, и четырьмя, и пятью устройствами. Один или два жителя могут даже быть «вынужденными» коллекционерами – барахольщиками, имеющими своеобразное хобби, так что больше чем в половине домов может иметься только один прибор или вообще ни одного.

Если мысль о том, что в каких-то домохозяйствах собирают устаревшие электронные приборы, кажется вам слишком надуманной, то займитесь определением среднего дохода на домохозяйство, того самого показателя, который часто используют социологи и аналитики-маркетологи. Если в каком-то даже маленьком поселке имеется парочка творческих, авантюристичных или, по-другому, успешных жителей, то этот поселок может иметь огромный показатель среднего дохода на домохозяйство. Будучи скорее статистическим вывертом, чем реалистичным отражением действительного процветания местных жителей, этот высокий показатель среднего дохода может маскировать занятость большинства населения городка в качестве прислуги, садовников или охранников. Поскольку закон запрещает публикацию точных данных о доходах индивидуума, наиболее правдивую картину здесь могут открыть агрегированные данные, собираемые во время переписей населения. Правда, они тоже дают больше усредненных данных по населенным пунктам, но сообщают мало индивидуальных сведений об их жителях.


Рис. 11.5. Детальная карта, отражающая показатель электронный прибор/домохозяйство, демонстрирует один из возможных пространственных вариантов распределения показателя прибор/домохозяйство, которое может соответствовать и уровню города, и уровню округа, отображенным на рис. 11.1 и 11.2

Плохи ли по-настоящему агрегированные данные? Конечно нет. Во многих случаях, например в вопросах анализа публичной политики, города и округа являются наиболее подходящими единицами, которым штаты и федеральное правительство выделяют бюджеты и определяют результативность их деятельности. Даже данные, агрегированные на более высоком уровне, могут быть весьма полезными, скажем, когда губернаторы и сенаторы хотят сравнить какие-то показатели своего штата с остальными сорока девятью. Местные власти и социологи, озабоченные проблемой различий между соседними местностями, с готовностью признают ценность картографической агрегации. Более того, правила недопущения утечки данных, которые нужны для взаимодействия с учреждениями, занимающимися переписью населения и различными социальными обследованиями, требуют агрегации, и регионально агрегированные данные – это лучше, чем отсутствие всяких данных. Поэтому лица, зависящие от локальных данных, обычно побуждают Бюро переписи населения США к тому, чтобы оно видоизменяло границы административных единиц так, чтобы сохранялась однородность переписных районов[29] и других учетных единиц. А когда данные по этим районам их не устраивают, они в отдельных случаях оплачивают объединение новых данных в более адекватные территориальные единицы.

Что еще может сделать добросовестный аналитик? Немногое сверх того, что и так очевидно: знать территориальную единицу, экспериментировать с данными на различных уровнях агрегации и тщательно выверять все заключения.

А что должен делать скептически настроенный пользователь карт? Искать и сравнивать карты с различной степенью детализации и быть осторожным с картографическими злоумышленниками, которые выбирают такие уровни агрегации, которые выгодны только им самим.

Агрегирование, классификация и исключения

На хороплетных картах картографические данные еще больше подвергаются агрегированию за счет объединения всех ареалов с одинаковыми показателями в одну категорию, обозначенную единым символом. Такой вид агрегирования решает проблему использования в картах более чем шести или семи визуально четко различимых цветов спектра или оттенков серого в логической последовательности от более светлого к более темному. Чаще всего составители карт предпочитают применять четыре или пять таких категорий, особенно тогда, когда имеющиеся пространственные символы не могут обеспечить однозначные значения на карте. Из эстетических соображений или для того, чтобы избежать неправильного понимания отображения внутренних озер и ареалов без каких-либо данных, в хороплетных картах обычно не применяется матово-белый и темно-черный цвета.

Такая классификация создает угрозу искажения пространственных тенденций на статистических картах. Произвольное установление разрывов между категориями может затушевать ясный и связный тренд на картах с ненужной фрагментацией участков или там, где вместо по необходимости сложной картины представляется ее излишне упрощенный вариант. Рис. 11.6 иллюстрирует влияние разрывов между категориями на хороплетной карте, представляющей соотношение электронный прибор/домохозяйство, отображенное на рис. 11.4. Обратите внимание на то, что левая карта дает ясное, однозначное и легко запоминающееся изображение тренда, который постепенно нарастает по направлению к правому верхнему углу региона. Напротив, правая карта представляет более фрагментированную картину одних и тех же данных.

Классификация порождает много вопросов. Какая из этих карт правильная (если вообще правильна хотя бы одна из них)? Или, если определение «правильная» звучит слишком догматично, какая из них дает лучшее отображение имеющихся данных? Не скрывают ли обе карты множество возможных вариаций в некоей третьей категории, представленной квадратами черного цвета? Не должны ли семь городов с показателем 0,2 быть вынесены в отдельную категорию? Является ли разница в 0,1 в нижнем сегменте значений более значимой, чем в верхнем сегменте? Может ли карта, отображающая три категории значений, быть хотя бы отдаленно подходящим решением?


Рис. 11.6. Разные значения в категориях соотношения прибор/домохозяйство производят две разные карты (в каждой по три группы символов), отображающие одни и те же данные, представленные на рис. 11.4


Рис. 11.7. Две ошибочные схемы классификации, которые используются в компьютерных программах, дают радикально отличающиеся картины для данных, отображенных на рис. 11.4

Эти вопросы жизненно важны не только для пользователей карт, но и для их составителей, особенно тех, которые используют графические программы, но не имеют достаточной подготовки в картографии. Компьютерные приложения обычно предлагают на выбор несколько вариантов «автоматической» классификации, а наивные авторы карт часто принимают один из самых простых вариантов. Иногда программа выдает карту моментально, даже не предлагая решений по классификации. Имеющий название ошибочного варианта, этот автоматический выбор границ между категориями является маркетинговым ходом, который рисует перед колеблющимся потенциальным покупателем картину немедленного успеха.

Но поможет ли ошибочный вариант создать хорошую карту? На рис. 11.7 представлены карты с четырьмя категориями символов, созданные на основе двух обычных ошибочных вариантов и отображающие одни и те же данные по соотношению прибор/домохозяйство, использованные и в рис. 11.6. Схема равных интервалов, представленная справа, делит разрыв между высшим и низшим показателями (8,9–0,2=8,7) на четыре равные части (по 2175 приборов в каждой). Обратите при этом внимание на то, что по этой схеме бо́льшая часть ареала попадает в одну категорию (первую), а третья категория (4,6–6,7) вообще отсутствует. В случаях, когда данные ровно распределены по всей имеющейся шкале, польза от этого состоит только в том, что здесь легче делать вычисления.

Напротив, четвертичная схема (справа) распределяет данные по категориям так, что под каждую из них подпадает равное число учетных единиц на местности. Конечно, эти категории будут только приблизительно равны, если, например, количество учетных единиц не будет являться произведением четырех или когда их равномерному распределению по категориям будет мешать «спайка» (как происходит здесь слева вверху, где в верхнюю категорию включены два города с показателем 1,9). Хотя такая схема визуально более сбалансирована, верхняя категория в ней очень широкая и неоднородная, а граница между второй и третьей категориями очень тонкая (соответственно 1,3 и 1,4). И все же четвертичная карта весьма полезна для такого пользователя, который интересуется расположением на местности городов, находящихся в высшей и низшей категориях по значениям. Схемы, в которых имеется пять категорий значений, называются пятеричными, а с еще бо́льшим количеством категорий – квантилями. В принципе такие схемы могут вмещать в себя любое количество категорий.

Некоторые картографические приложения предлагают вариант хороплетных карт «без категорий», в которых каждое отдельное значение (иногда их может быть до пятидесяти) отображается отдельным оттенком серого цвета. В принципе это может оказаться довольно ловким способом избежать необходимости установления границ между категориями. Но, как показывает рис. 11.8, оттенки серого могут и не создать упорядоченную последовательность, поэтому приходится сокращать легенду, чтобы она не стала слишком запутанной. Более того, присваивая каждому отдельному значению собственную категорию, можно легко разрушить четкую и легко запоминающуюся картину пространственных трендов. Так что это идеальное решение в конечном счете может и не быть таким уж идеальным.


Рис. 11.8. Не имеющая категорий хороплетная карта с символами, обозначаемыми последовательными оттенками серого цвета, и отображающая данные, приведенные на рис. 11.4

Остерегаясь как обидных просчетов, так и всяческих панацей, проницательный автор карт начинает с постановки перед собой двух вопросов: как распределены данные по всей шкале и какие границы между категориями могут иметь для пользователя особое значение (если таковые вообще есть)? Ответ на второй вопрос зависит от имеющихся данных и от того, считает ли автор карты полезным их сравнение со средними значениями на национальном или региональном уровне. Например, на уровне штатов граница категории, установленная по среднему значению для США, позволит губернатору и сенаторам сравнить ситуацию в штате или избирательном округе и результаты собственной деятельности в них со средними по стране. Разумеется, в легенде карты эта значимая граница должна быть отражена.


Рис. 11.9. Числовая ось, отображающая показатель наличия приборов в одном домохозяйстве на уровне города и основанная на данных, приведенных на рис. 11.4

После рассмотрения вопроса о значимых границах между категориями добросовестный картограф может обратиться к числовой оси, подобной показанной на рис. 11.9. Горизонтальная линия с вертикальными отсечками и символами представляет собой область данных. Каждый кружок показывает значение определенного показателя, причем одинаковые значения размещаются на оси в одном и том же месте друг над другом. Получившаяся диаграмма точно указывает на границы категорий и четкие группы однородных значений, которые в процессе классификации могут не разделяться дополнительно. Числовые оси позволяют автору схемы легко визуализировать распределение значений и выбирать подходящее количество категорий и адекватные границы между ними. Компьютерные алгоритмы тоже могут находить распределение данных по оптимальному набору границ между категориями, но во многих случаях этот определенный компьютером оптимум ненамного лучше визуально осуществленной классификации; округленные границы категорий и более равномерное распределение по ним населенных пунктов могут явиться важными дополнительными позитивными элементами в хороплетных картах.

Очень высокие или очень низкие значения, не подпадающие ни под одну категорию, могут озадачить как картографа, так и передовые картографические программы. Следует ли присоединять эти отклонения к очевидно более однородным группам в более высокой или более низкой части числовой оси? Или, может быть, такие показатели следует помещать в созданные для них отдельные категории? Можно ли объединить два или три сильно расходящихся показателя на любом полюсе числовой оси в одну очень разнородную группу? Или каждое отклонение нужно рассматривать в отдельной категории, с собственными символами, рискуя ухудшить графическую дифференциацию между пространственными символами? Или автору схемы скорее следует относиться к этим статистическим выбросам как изгоям – ошибкам или отклонениям, которые «не вписываются» в схему, – и просто опускать их или присваивать им специальные символы?


Рис. 11.10. Хороплетная карта, составленная на основе данных, представленных на числовой оси на рис. 11.9, и их характере

В отношении резких отклонений показателей не может быть простых стандартных решений. Автор карты или схемы должен хорошо знать все данные, служащие ее основой; знать, являются ли такие отклонения действительными или неправдоподобными, и осознавать, имеют ли значительные разрывы между ними какое-то значение. Важным вопросом является взаимосвязь таких отклонений с темой схемы и интересами ее пользователей. Для соотношений прибор/домохозяйство, изображенных на рис. 11.9, средний показатель 8,9, безусловно, не только исключителен, но еще и значительно выше, чем ближайшее к нему значение 4,2. Если это не ошибка, то такой показатель заслуживает отнесения его к отдельной категории. Следующие более низкие значения: 4,2 (дважды), 3,5 и 2,6 – могут составить другую категорию. Все они выше более внушающего доверие значения 2,0. Но показатель 4,2 вовсе не невероятен, особенно в состоятельных районах.

Другие границы находятся между значениями 0,9 и 1,3. В этом разрыве расположился естественный значимый показатель – 1 (один) прибор на домохозяйство. Следующая категория – между 0,2 и 0,7, в которую попадают семь не любящих технику городов из нижней части списка распределения электронных устройств. Получившаяся в результате хороплетная карта (схема), состоящая из пяти категорий (рис. 11.10), не только точно и правдиво представляет показатели и их статистическое распределение, но и четко отображает их пространственное расположение. Произвольная классификация, характерная, например, для ошибочных категорий, устанавливаемых компьютерными программами, вряд ли даст такой же положительный результат, даже если будет использовать шесть и больше категорий.

Классификация, корреляция и визуальное восприятие

Хороплетные карты часто искажают взаимоотношения между географическим распределением двух связанных тем. Наскоро подобранные или специально сфальсифицированные категории могут снизить визуальное сходство между двумя подобными в своей основе тенденциями или, наоборот, создать видимость подобия между двумя очень отличающимися друг от друга моделями.

Рассмотрим пример, изображенный на рис. 11.11, – пространственно-статистическую таблицу и числовую ось, отображающие среднее число детей на домохозяйство. Этот показатель на уровне городов тесно связан с количеством электронных приборов, приходящихся на одну семью. Хотя разброс данных в показателе числа детей в семье не так велик, как в случае с электронными приборами, наивысшие значения этого индекса расположились справа вверху, а наиболее низкие – в нижней части таблицы. Города, расположенные справа и вверху региона, в целом характеризуются наличием большего числа детей в семьях, чем города, расположившиеся в нижней и левой части карты. Неудивительно поэтому, что две карты на рис. 11.12 показывают одинаковые пространственные картины наличия детей и электронных приборов в домохозяйствах.

Статистики обычно изображают корреляцию при помощи рассеивания значений по двум осям, когда числовые величины одной переменной отмечаются на вертикальной оси, а другой – на горизонтальной. Точка (или кружок) изображает географический пункт, а плотность и ориентация «облака» точек указывает на силу и направление корреляции.

На рис. 11.13 изображены две таблицы рассеивания значений, каждая из которых указывает на плотную положительную зависимость между числом детей в семьях и количеством электронных приборов в домохозяйстве. Вертикальные пунктирные линии, отходящие от осей таблицы и пронизывающие скопления кружков, отображают границы категорий из рис. 11.12. Четыре линии, отходящие от каждой оси, делят всю таблицу на сетку неравных прямоугольников «5×5». Поскольку все кружки на левой таблице лежат в одной из пяти клеток, расположенных по диагонали, можно сказать, что две схемы с пятью категориями, показанные на рис. 11.12, представляют одинаковую картину, усиливая впечатление о сильной корреляции между ними.


Рис. 11.11. Статистическо-пространственная таблица и числовая ось с показателями среднего числа детей в одном домохозяйстве


Рис. 11.12. Хороплетные карты, отображающие идентичные картины с показателями количества электронных приборов на одно домохозяйство и числа детей на одну семью

А вот правая таблица из рис. 11.13 несколько искажает картину. Как и на левой таблице, пунктирные вертикальные линии, отходящие от осей таблицы, делят ее на сетку прямоугольников 5×5. Однако в данной таблице конфигурация категорий располагает все кружки, за исключением четырех, за пределами диагональных клеток. Таким образом, на обеих схемах несколько городов окажутся сразу в нескольких категориях. На рис. 11.14 показаны расхождения, возникающие в результате этого на схемах, что позволяет говорить в лучшем случае о слабой корреляции между ними. Такие приемы могут заставить слабое подобие карт выглядеть сильным, особенно когда схемы похожи в том, что касается высшей категории, которая обозначается самым темным цветом. И действительно, пространственное влияние самого темного и сразу бросающегося в глаза цветового символа сильно воздействует на мнение наивного пользователя об идентичности схем. Некоторые из них могут даже вынести суждение о схожести схем на основании всего лишь приблизительно равного количества символов самого темного оттенка – даже если обозначенные ими районы находятся в разных частях региона! Различные пространственные символы для двух карт и различное количество категорий – это еще одна разновидность хитростей, с помощью которых картографы обманывают пользователей карт или вводят в заблуждение себя.


Рис. 11.13. Таблицы рассеивания показателей количества приборов на домохозяйство и числа детей в семье. Пунктирные линии на левой таблице отображают границы категорий в паре карт из рис. 11.12. Такие же линии на правой таблице показывают границы категорий из рис. 11.14


Рис. 11.14. Слабая коррелляция между показателями количества приборов на домохозяйство и числа детей в семье

Другие визуальные искажения могут быть связаны с основной картой, на которой размещены соответствующие данные. Не все пространственные символы так единообразны и визуально равны, как прямоугольники, обозначавшие города в предыдущих примерах. Рис. 11.15 иллюстрирует этот момент, изображая две обманчиво выглядящие похожими карты, которые составлены на основе количественных данных и категорий визуально непохожих карт с рис. 11.14. Эти 28 городов значительно отличаются в размерах, а схожесть карт очень высока потому, что самые большие города относятся к одной категории. Города, не попадающие в нее, выглядят на обеих картах меньше и визуально оказывают на наблюдателя меньшее воздействие.


Рис. 11.15. Похожесть больших районов может искажать визуальные оценки корреляции, затушевывая значительное несовпадение между малыми районами. Количественные данные и картографические категории идентичны тем, которые выглядят гораздо более непохожими на двух картах рис. 11.14

Хотя этот пример с соотношением количество приборов / домохозяйство и является выдуманным, он совсем не атипичен. Административные районы городов, переписные районы, избирательные округа по выборам в Конгресс и другие пространственные единицы, установленные с целью включения в них примерно равного числа жителей, часто сильно отличаются друг от друга по размерам из-за различий в плотности населения. Такая неравномерность еще более заметна на картах, где густонаселенные округа с преимущественно городской застройкой, как правило, по территории значительно меньше, чем сельские округа с немногочисленными жителями. Осторожный пользователь карт никогда не выносит суждения о цифровой корреляции в зависимости от похожести изображений на карте и проявляет особую осторожность в отношении тех районов, которые значительно больше других.

Для того чтобы избежать искажений в корреляции, происходящих из-за разных размеров административных единиц, внимательный аналитик обратится к более «демократичному» методу, когда на диаграммах рассеивания идентичные точки или кружки представляют каждый район. Как показывают диаграммы на рис. 11.16, плотность и ориентация «облака» точек отражают силу и направление корреляции.


Рис. 11.16. Диаграммы рассеивания и линии тренда для различных видов корреляции

Если прямая линия обеспечивает нормальное формирование множества точек, когда они расположены недалеко друг от друга, то такая корреляция называется линейной, а степень незначительного разброса точек вокруг этой линии указывает на силу линейной корреляции. Линия положительной корреляции направлена направо вверх, а отрицательной – направо вниз; множество точек без ощутимых внутренних связей не имеет видимого направления. Для слабых корреляций характерен широкий разброс точек вокруг линии тренда, тогда как в сильных линейных корреляциях большинство точек расположено прямо на линии тренда или в непосредственной близости от нее. Не все корреляции бывают прямыми, сильная криволинейная корреляция характеризуется изогнутым трендом, которому соответствует изогнутая линия тренда.

Статистики используют определенное число, называемое коэффициентом корреляции, для измерения силы и направления линейной корреляции. Его обозначают символом r, и он показывает специальным значком направление взаимоотношений между переменными, а также силу этих взаимоотношений в ее абсолютной величине. Коэффициент r колеблется в диапазоне от +1,00 до –1,00. Для сильной положительной корреляции r составляет от 0,9 и выше; для сильной отрицательной корреляции – от –0,9 и ниже; около 0 – это показатель неопределенной или очень слабой корреляции. Существует эмпирическое правило, по которому квадрат коэффициента корреляции дает пропорцию изменений в одной переменной в зависимости от других переменных. Например, если r = –0,6, то корреляция является негативной и одна переменная может «объяснять» 36 % другой переменной. Коэффициент корреляции измеряет только зависимость величин, а не их причинно-следственную связь, которая обосновывается логикой и сопутствующими доказательствами.

Карты, диаграммы рассеивания и коэффициенты корреляции дополняют друг друга, и аналитик, интересующийся корреляцией, обычно полагается на все эти три элемента. Коэффициент корреляции, который обеспечивает возможность точного сравнения пары переменных величин, измеряет только линейную зависимость. А вот диаграмма рассеивания моментально показывает и криволинейные взаимосвязи со средним значением r. Эти диаграммы также показывают отклонения, которые могут сильно искажать вычисление r. Однако необходимость основываться на визуальных оценках снижает ценность диаграмм для сравнения силы взаимосвязей величин. Более того, диаграммы рассеивания и коэффициенты корреляции ничего не говорят о расположении той или иной местности, а карты, которые представляют нам пространственные тренды, могут обеспечить только ненадежные оценки корреляции.

Карты могут показывать другой вид корреляции, географическую корреляцию, которая отличается от статистической корреляции диаграмм рассеивания и классического коэффициента корреляции. Статистическая корреляция существует вне пространства и ничего не сообщает о пространственных трендах. Рис. 11.17 показывает это различие с помощью двух пар карт, отличающихся по пространственной картине, но идентичных по диаграмме рассеивания и коэффициенту корреляции. Переменные А и B, для которых общей является несколько хаотичная, фрагментарная картина, явственно отличаются по географической корреляции от переменных Х и Y, для которых характерен отчетливый общий тренд с более высокими значениями в верхней части таблицы и более низкими – в ее нижней части. Хотя они и не являются идентичными, карты X и Y предполагают влияние третьего лежащего в основе географического фактора, такого как долгота, этнический состав населения, плодородность почв или приближенность к сильному источнику загрязнения окружающей среды. Несмотря на проблемы, возникающие в связи с агрегацией районов местности, аналитик географических данных, исследующий вопросы корреляции без одновременного изучения пространственной картины, некомпетентен, либо невнимателен, либо просто глуп. И не настроенный скептически пользователь карт может легко запутаться.



Поделиться книгой:



Регистрация