Большинство компьютерных технологий длинных «родословных» не имеют. Стандарты на них и связанные с ними проблемы рождались буквально на наших глазах. Только компьютерное видео относится к числу немногих исключений. Оно явилось наследником видео цифрового, а то, в свою очередь, преемником аналогового телевидения и видео. Многие, казалось бы, непонятно каким образом возникшие проблемы на самом деле являются следствием компромисса между необходимостью соответствовать утвердившимся еще в эпоху становления цветного телевидения стандартам и современным требованиям к качеству компьютерных изображений. Чтобы понять причины появления некоторых параметров компьютерного видео, необходимо кратко познакомиться с тем, что происходило когда-то с телевизионным изображением, давшим начало всей эволюционной линии электронных изображений.
Основы телевидения
Этот раздел, увы, будет несколько скучным. Здесь нет ни практических рекомендаций, ни занимательных случаев из жизни. Однако, как надеется автор, его прочтение будет небесполезным. Как уже сказано, современное компьютерное видео по-прежнему основано на телевизионных стандартах.
Краткое знакомство со структурой телевизионного сигнала поможет вам избежать ошибок при сравнении возможностей разных устройств для оцифровки и захвата изображения. Во всяком случае, встретив в описании ТВ тюнера (который вы уже собрались купить) надпись PAL/NTSC, вы сможете уверенно спросить продавца: «А как же SECAM?», что в его глазах сразу переведет вас из разряда «чайников» в разряд специалистов. И соответственно, доля истины в сообщаемой вам информации резко увеличится.
Палитры телевизионные и не только
Если провести среди компьютерщиков один из популярных психологических тестов и предложить быстро назвать первую ассоциацию, приходящую на ум при произнесении определенного слова, вероятно, почти все на слово «палитра» ответят «RGB». Эта система представления цвета используется не только в компьютерных мониторах, но и в любых других электронных системах отображения информации. В какой-то мере она соответствует восприятию цвета человеческим глазом. Подобный принцип получения любого цвета из трех основных называется
Итак, видеокамеры и другие подобные устройства передают цвет любого объекта при помощи трех сигналов, соответствующих основным цветам. Монитор имеет три типа элементов, излучающих соответственно красный, зеленый и синий цвета. Однако, говоря о соответствии этой модели восприятию человеческого глаза, я не зря оговорилась – «в определенной степени». Дело в том, что человеческий глаз, кроме светочувствительных элементов, активных при высокой освещенности и воспринимающих базисные (опорные) цвета, имеет элементы, активные даже почти в полной темноте и фиксирующие только освещенность объекта. В итоге яркость объекта оказывается гораздо важнее для восприятия, чем его цветовые характеристики.
Восприятие человеческого глаза моделирует популярная ныне цветовая модель Lab, с которой мы познакомимся подробнее в главе о ретушировании изображений. Хотя она не имеет ни малейшего отношения к телевидению, на ее основе удобно проследить некоторые общие принципы описания цвета. В этой модели цвет описывается координатой в трехмерном пространстве, вертикальная ось которого L (Light – яркость) определяет яркость (от 0 до 100), а угловые координаты на цветовом круге задают две цветовые характеристики:
Цветовой круг
Говоря о яркости и цветовом круге, нельзя не упомянуть еще две величины, которые в телевизионных сигналах не используются, но в каждом цветном телевизоре есть ручки (кнопки или меню) для их регулировки. Эти параметры изображения очень существенны, и их названия не раз встретятся в книге. Они называются
Иллюстрирация влияния яркости, насыщенности и цветового тона на внешний вид изображения:
С яркостью, насыщенностью и цветовым фоном мы еще не раз встретимся, когда займемся вопросами обработки полученных изображений. Кроме того, рассматривая различные стандарты телевизионных сигналов, мы также будем обращать внимание и на возможные искажения этих величин при телевизионном приеме.
В телевидении выделение яркостной составляющей необходимо для обеспечения совместимости цветных и черно-белых телеприемников. Другими словами, сигнал яркости в цветном телевидении должен полностью совпадать с сигналом, воспринимаемым черно-белыми ТВ приемниками.
Кроме того, имеет значение объем передаваемой информации: чем меньше объем, тем дешевле и проще передающие системы. Сократить объем информации можно, если уменьшить количество данных о цвете. Вот почему, выражаясь языком компьютерной графики, передается и принимается не RGB-сигнал, а яркость и два цветоразностных сигнала, или YUV, где Y –
Для человеческого глаза разные цвета имеют неодинаковую яркость. Если расположить опорные цвета в порядке убывания яркости, выстроится следующий ряд: «Зеленый-Красный-Синий», то есть при одинаковой насыщенности свечения наиболее ярким будет восприниматься зеленый объект, а наиболее темным покажется синий. В соответствии с этим наибольшую долю сигнала яркости составляет зеленый, наименьшую – синий. Один из стандартов, соответствующий так называемому «белому С» или цвету облачного неба (цветовая температура 6500 °C), определяется следующими соотношениями:
Y=0,299R+0,587G+0,114B
В таком случае нет необходимости кодировать все три цвета. Достаточно задать два из них, а третий легко вычисляется путем несложных арифметических операций. Как указано выше, U и V могут иметь в два раза более низкое разрешение, чем Y.
Следует отметить, что в приведенной выше формуле, описывающей работу устройства матрицирования, составляющие R, G и B не являются оригинальными сигналами, а представляют собой продукты специальных преобразований, называемых гамма-коррекцией, призванной компенсировать нелинейную зависимость яркости свечения экрана кинескопа от амплитуды модулирующего сигнала.
Изображение на телеэкране создается при движении электронного луча по экрану, покрытому люминофором – материалом, излучающим свет определенной длины волны, то есть определенного цвета. Этот процесс называется
В вещательном же телевидении частота видеосигналов не превышает 6,5 МГц для российской системы (SECAM D/K), 5,5 МГц для европейской (PAL B/G) и 4,5 МГц для американской и японской (NTSC). Соответственно, максимальная (теоретически) разрешающая способность составит около 600 линий. Но это верно только для черно-белых телевизоров. В самых лучших цветных телевизорах разрешающая способность составляет не более 400 линий по горизонтали.
Как это ни удивительно, но при такой малой, с точки зрения компьютерной графики, разрешающей способности качество изображения в обычном цветном телевизоре, по крайней мере, не хуже, а естественней и «живее», чем в компьютерном мониторе. Это объясняется разными принципами обработки и передачи изображений, и анализ этих проблем выходит далеко за рамки данной книги.
В телевидении есть такое понятие, как
В литературе встречается также термин
Теперь к полученному видеосигналу необходимо добавить звук. Этот процесс мы рассматривать не будем, поскольку он не имеет отношения к нашей теме. Принципы организации звукового сопровождения в обычном телевидении одни и те же, но параметры для разных ТВ стандартов различны (см. следующий раздел).
Обычный видеосигнал можно передавать только по кабелям. Для передачи же на большие расстояния через эфир используются радиоволны. В этом случае присутствует так называемая несущая частота, которая модулируется сигналами ПЦТС и звукового сопровождения.
В вещательном телевидении используются следующие
• первый диапазон, 48–66 МГц (каналы 1, 2);
• второй, 76-100 МГЦ (каналы 3–5);
• третий, 174–230 МГц (каналы 6-12);
• четвертый, 470–790 МГц (каналы 21–60).
В процессе приема композитный сигнал подвергается обратному преобразованию. Восстановление RGB-сигнала из YUV называется
Телевизионные стандарты
В настоящее время используются три основных стандарта цветного телевидения: американский NTSC (National Television Standard Committee – Комитет национальных телевизионных стандартов), немецкий PAL (Phase Alternation Line – строки с переменной фазой) и французский SECAM. На территории России принят стандарт SECAM, но большинство моделей бытовых видеокамер и видеомагнитофонов работают в стандарте PAL. Стандарт NTSC действует в Америке и Японии, и российский пользователь сталкивается с ним довольно редко. Тем не менее на нем придется остановиться отдельно, поскольку NTSC – первый из внедренных в широкое вещание стандартов цветного телевидения.
Для кодирования сигналов цветности используется сочетание амплитудной и фазовой модуляций, называемое квадратурной балансной модуляцией с подавленной несущей, частота и фаза которой восстанавливается на стороне приема из сигналов цветовой синхронизации (впышек). Используется одна поднесущая частота, равная 3,5579545 МГц (есть поднесущая 4,433619 МГц, которая используется американскими войсками в Германии – так называемый NTSC 4,43). Оба цветоразностных сигнала сдвинуты по фазе один относительно другого на 90° (то есть находятся в квадратуре). При этом фаза определяет цветовой тон, а амплитуда – насыщенность. К сожалению, этот стандарт наименее защищен от помех, в частности, от искажений цветового тона, называемых дифференциальными фазовыми искажениями. Именно поэтому в телевизорах NTSC необходима независимая регулировка цветового тона (Hue control – контроль оттенка), которая выводится на переднюю панель вместе с яркостью и контрастом. Дешевые телевизоры NTSC имеют достаточно слабое подавление сигналов яркости в канале цветности, поэтому на очень светлых участках изображения возможен сдвиг цветового тона в сторону зеленого, а в темных областях появляются красноватые оттенки.
Стандарт PAL, предложенный фирмой Telefunken, явился усовершенствованием NTSC. Принцип формирования сигнала цветности тот же, но через строку производится изменение фазы цветоразностного сигнала R – Y. При декодировании цветоразностные сигналы выделяются путем сложения/вычитания сигналов цветности соседних строк. Сложение поступившего сигнала с задержанным дает удвоенное значение цветоразностного сигнала B – Y, вычитание – сигнала R – Y. В результате цветоразностные сигналы меньше подвержены фазовым искажениям канала передачи, легче отделяются от шумов и помех, а также от остатков сигнала яркости. Фаза сигнала по-прежнему задает цветовой тон, а амплитуда – насыщенность, но к дифференциальным фазовым искажениям система нечувствительна, поэтому основную проблему составляют как раз остатки сигнала яркости, приводящие к некоторым искажениям насыщенности цвета. К сожалению, при таком способе в два раза снижается цветовая четкость по вертикали (по сравнению с NTSC). Но при этом число строк в кадре не 525, а 625, из которых видимых 576 (против 480 для NTSC).
Стандарт SECAM, наиболее актуальный для нас, также имеет 576 видимых строк в кадре, частота кадровой развертки (то есть обновления изображения) равна 25 Гц. Для передачи цветоразностных сигналов используются частотная модуляция и две разных поднесущих частоты – для сигналов R – Y используется частота 4,416 МГц, и увеличение до 4,68 МГц, для сигналов R – Y – частота 4,25 МГц, и уменьшение до 3,95 МГц. При этом если сигнал яркости в канале цветности подавлен согласно стандарту, насыщенность и цветовой тон изображения не искажаются при любых величинах яркости, хотя при резких перепадах возможно появление артефактов: синяя окантовка очень светлых областей изображения; желтая – вокруг очень темных. Цветоразностные сигналы передаются поочередно (Sequentiel – последовательный, поочередный) через строку (то есть, например, в первой строке – красный, во второй – синий и т. д.) и восстанавливаются для каждой строки с помощью блока памяти (Memoire), в которой запоминается предыдущая строка. Естественно, такой способ в два раза снижает цветовую четкость изображения по вертикали.
Конкретные реализации стандартов в разных странах могут значительно отличаться способом модуляции звукового сигнала, шириной спектра видеосигнала и некоторыми другими характеристиками. Всего существует 13 вариантов, от A до N (табл. 2.1). Однако стандарты А (Англия), С (Бельгия и Люксембург), F и Е (Франция) устарели и в настоящее время не используются.
В России принят SECAM D/K (первая буква – стандарт для передачи в метровых волнах, вторая – в дециметровых).
Таблица 2.1. Телевизионные стандарты
В связи со все более широким выходом на рынок телевизоров с большими и сверхбольшими экранами появилась потребность в разработке новых телевизионных стандартов с большим размером кадра и более высоким разрешением. Если в традиционном телевидении принято соотношение сторон кадра 4:3, то для
В ряде стран существуют проекты перехода на широкоэкранное цифровое телевещание (наибольшую активность в этом отношении проявляют США). Консорциум компаний (U.S. Grand Alliance) разрабатывает новый стандарт HDTV (High Definition TV – телевидение высокого разрешения). В нем используется сжатие сигнала MPEG 2 с разрешением 1440x960 для 50 Гц и 1280x720 для 60 Гц.
Аналоговые видеоформаты
Кроме теоретического интереса, вопрос о видеоформатах имеет для занимающихся компьютерным видео очень важное практическое значение, поскольку видеоустройства разных форматов требуют подключения к различным разъемам, далеко не все из которых могут присутствовать на вашей плате видеоввода.
Как ни странно, видеомагнитофоны – практически ровесники цветного телевидения: формат NTSC был принят в 1953 г., а первый видеомагнитофон появился в 1956 г. Первые видеомагнитофоны весили около тонны и работали на ленте шириной в 2 дюйма. Хотя специалисты и считают, что кое-где такие аппараты еще продолжают использоваться, в рассмотрение включены только современные форматы.
Основные видеоформаты связаны с наиболее известными фирмами-производителями видеотехники. Таких фирм на сегодняшний день три. Это JVC, где разработаны форматы VHS (Video Home System – домашняя видеосистема) и Super VHS (или S-VHS); Sony – профессиональные форматы Betacam, форматы Video-8 и Hi-8, цифровые форматы D1, D2, DVCAM; и Panasonic – формат MII, цифровые форматы D3, D5, DVCPRO.
В среднем качество изображения бытовых видеозаписей уступает качеству телевещания. Например, разрешение по горизонтали в форматах, использующихся в недорогой технике, составляет всего 240 линий, а в полупрофессиональной – 400 линий.
Качество изображения в зависимости от используемых форматов может отличаться весьма значительно, поэтому, если вы собираетесь использовать в качестве источника сигнала бытовой видеомагнитофон или видеокамеру, необходимо заранее решить, устраивает ли вас среднее качество изображения. Устройства видеозаписи могут работать с сигналами трех типов: обычный композитный видеосигнал (ПЦТС), S-video (Separate video – раздельные видеосигналы, другое обозначение Y/C) и компонентный (подробности ниже, при рассмотрении соответствующих форматов). Для работы с каждым из этих сигналов необходим свой разъем. Поэтому, приобретая устройство компьютерного видеоввода, вы должны точно знать, с какого типа видеомагнитофона или камеры будете использовать сигнал.
Самый простой формат: VHS
Видеозаписывающая аппаратура, как и телевидение, использует палитру YUV. В предыдущем разделе описано формирование низкочастотного видеосигнала, включающего яркостную составляющую Y, два цветоразностных сигнала (U и V) и импульсы синхронизации. Он используется в наиболее дешевой и доступной потребителю аппаратуре. Кроме того, принцип магнитной записи изображения сам по себе создает и более серьезную проблему – ухудшение качества изображения при многократной перезаписи. Наверное, каждому из нас не раз и не два приходилось испытывать сомнительное удовольствие от просмотра так называемых вторых и третьих копий (размножаемых любителями) с недоступных по тем или иным причинам видеокассет. Тем не менее низкая цена оказывается решающим фактором, и устройства, работающие с композитным видеосигналом, до сих пор наиболее распространены на российском рынке.
Этот тип используется в наиболее распространенной бытовой видеоаппаратуре класса VHS. Само название – домашняя видеосистема – дает понять, что устройства этого класса не предназначены для профессиональной работы. На такой аппаратуре невозможно достичь разрешения более 240 линий. Для сравнения вспомним, что телевизионные стандарты SECAM и PAL обеспечивают разрешение не менее 350 линий. То есть качество изображения, достигаемое на аппаратуре класса VHS, существенно уступает вещательному телевидению. Однако компактность и низкая цена привлекают покупателей к технике формата VHS. Как ни странно, большинство непрофессиональных пользователей удовлетворены качеством изображения видеомагнитофонов и видеокамер формата VHS. Поэтому эту технику можно использовать в качестве источника изображения при подготовке видеороликов, если в дальнейшем вы не предполагаете демонстрировать их на большом экране и вообще как-либо увеличивать изображение. Но, если вы планируете работать с отдельными захваченными кадрами, в особенности, если они будут использоваться для полиграфии, стоит поискать оборудование более высокого качества или ограничиться съемкой только крупных планов. Ведь то, что не заметно при быстрой смене мелких деталей на экране, наверняка бросится в глаза на отдельной картинке.
Полупрофессиональный формат S-VHS
Этот формат явился дальнейшим развитием VHS. Здесь используется сигнал, называемый S-Video. Палитра остается прежней (YUV), но сигналы яркости (Y) и цветности (C) подаются раздельно. Это позволяет более четко выделить информацию о цвете и, следовательно, уменьшить искажения цветового тона и насыщенности под влиянием яркостной составляющей. Разрешающая способность почти в два раза выше, чем у VHS (за счет увеличения полосы частот канала яркости), и равна 400 линиям. Существенно выше контрастность и отношение сигнал/шум в канале изображения. Эта аппаратура позиционируется как полупрофессиональная, хотя нередко используется и в быту, особенно в сочетании со стереозвуком и системами домашнего театра. S-VHS – нижний предел качества для репортажной, медицинской и научной видеосъемок. Почти все современные устройства компьютерного видеоввода имеют разъем для приема сигнала S-Video.
Форматы Video-8 и Hi-8
Video-8 – формат сверхминиатюрной техники бытового класса. Хотя здесь используется принцип S-Video, из-за узкой полосы частот разрешение составляет всего 250 линий. Качество изображения выше, чем в формате VHS (из-за применения металлопорошковой магнитной ленты с повышенной отдачей), но из-за низкого разрешения не дотягивает до полупрофессионального уровня. Аппаратура сверхлегкая (за счет миниатюрных кассет и пленки шириной 8 мм) и недорогая.
Hi-8 – формат полупрофессионального класса, являющийся усовершенствованным вариантом формата Video-8. Используется тот же принцип записи, кассета тех же размеров, но металлопорошковая лента более высокого качества. Разрешение – до 400 линий. Плотность записи очень высокая, поэтому вероятны выпадения строк в записи.
В нашей стране оба формата не получили широкого распространения.
Профессиональные форматы Betacam
Betacam – первый из профессиональных форматов записи на полдюймовую оксидную ленту, использующий компонентный сигнал, то есть принимающий каждую из трех составляющих RGB или YUV по отдельному каналу. Запись яркостного и цветоразностных сигналов ведется раздельно и без переноса спектра (гетеродинирования) сигналов цветности, что исключает искажение цвета за счет перекрестных помех. Несмотря на высокое качество цветопередачи, стандарт уже устарел и не обеспечивает необходимую для современной видеозаписи профессионального класса полосу частот из-за применения феррооксидной ленты и дискретно-аналоговых устройств для временной компрессии сигналов. Разрешение – меньше 500 линий.
Этот и ряд других недостатков исправлен в формате Betacam SP. Тип сигнала не изменился. Полоса частот яркостного сигнала расширена до 6,7 МГц, улучшены соотношение сигнал/шум и качество звукозаписи за счет использования высококачественной металлопорошковой ленты, аналоговых и цифровых микросхем высокой степени интеграции.
Betacam SP является неформальным стандартом техники студийного класса и до сих пор не уступает по качеству записи известным цифровым форматам. Этот формат имеет самое высокое разрешение – до 650 линий, 4 звуковых канала (два продольных и два высококачественных ЧМ канала), выдающуюся точность монтажа (возможна покадровая запись). Техника Betacam SP весьма дорога и довольно громоздка. Существуют упрощенные и более дешевые версии Betacam SP: 2000 PRO (могут воспроизводить кассеты Betacam) и Betacam SP1000 PRO, где отсутствует высококачественная звукозапись и применены компромиссные технические решения. Эти версии можно с успехом использовать при создании компьютерного видео.
Существуют также цифровые версии формата Betacam (студийный Digital Betacam и репортажный Betacam SX), также использующие полдюймовую металлопорошковую ленту, но разные принципы компрессии видеосигнала.
На компонентном сигнале основан и предложенный фирмой Panasonic стандарт MII, отличающийся повышенной плотностью записи. В России аппаратура этого стандарта практически не встречается.
Если вы планируете работать с аппаратурой, использующей компонентные сигналы, ваше устройство видеоввода должно иметь специальный разъем для подключения этой аппаратуры. На дешевых платах захвата кадра и ТВ тюнерах этого разъема наверняка не будет и, скорее всего, на недорогих платах нелинейного монтажа тоже. Основные параметры распространенных видеоформатов приведены в табл. 2.2.
Таблица 2.2. Форматы аналоговой записи
Глава III Цифровое видео
• Принципы цифрового описания
• Цифровые видеоформаты
• Наконец о компьютерном видео
• Компьютерный видеомонтаж
Цифровое видео – это не обязательно и далеко не всегда компьютер. Первый цифровой видеомагнитофон появился в 1986 г., когда до начала эры компьютерного мультимедиа было еще далеко. К настоящему времени число цифровых форматов перевалило за десяток.
Стало общим местом утверждение, что цифровая запись всегда превосходит по качеству аналоговую. Цифровое описание считают одним из величайших достижений цивилизации. Как ни забавно, но принципы цифрового кодирования не чужды и природе. Везде, где речь идет о стабильных структурах, начиная от атомов и кончая клетками живых существ, обнаруживается дискретность. Это и понятно: дискретные системы гораздо более помехоустойчивы. Искажения непрерывного сигнала уловить сложно. Малые отклонения вообще незаметны. Однако через несколько актов передачи эти исходно незначительные ошибки могут заметно исказить первоначальную информацию. В своей деятельности человек, как это часто бывает, лишь по-своему реализовал присущие природе принципы.
При этом, однако, следует учитывать, что данные, которые мы оцифровываем, носят аналоговый характер. Поэтому возникает задача не потерять, не исказить информацию при преобразовании непрерывного сигнала в цифровые форматы. Не вдаваясь в технические детали, постараемся выяснить, как это делается.Принципы цифрового описания
Этот раздел посвящен описанию процессов, происходящих при преобразовании непрерывного сигнала в цифровую форму. Автор постаралась избежать сложных формул и подробностей, касающихся аппаратной реализации преобразований. Заинтересованный читатель без труда найдет эти сведения в специальной литературе, где рассматриваются вопросы теории дискретизации и аналого-цифровые/ цифроаналоговые преобразователи (АЦП/ЦАП).
Принципы и проблемы цифрового описания мало зависят от носителя информации, поэтому изложенные здесь сведения с небольшими оговорками применимы и для компьютерных цифровых изображений.
Дискретизация и квантование
В работе аналоговых устройств мы обычно имеем дело с непрерывным сигналом, изменяющимся по тому или иному закону. В процессе
Рис. 3.1. Частота дискретизации и глубина квантования сигнала
Необходимая для качественной оцифровки частота дискретизации непосредственно зависит от полосы частот самого сигнала. При слишком низкой для данного сигнала частоте дискретизации информация о высокочастотных компонентах сигнала будет искажена или утеряна (рис. 3.2).
Поскольку в цифровом описании мы имеем дело с двоичным представлением, полученные значения необходимо воспроизвести в виде двоичного кода. При этом происходит усечение значений параметра до ближайшего допустимого значения (рис. 3.1). Степень числа «два», при которой мы получим нужное число допустимых значений параметра, называется
Параметры одного и того же видеоматериала могут оцифровываться с различной частотой и глубиной. Чем выше частота и глубина оцифровки, тем более качественным будет описание, но тем больше и объем данных.
Рис. 3.3 иллюстрирует двоичное представление сигнала, показанного на рис 3.1. Уровень квантования, как уже было сказано, равен трем. Сигнал принимает значения 3, 4, 5, 6, затем снижается до 5. Первое значение в двоичной форме примет вид 011. Значение 4 – 100 и т. д.
Возможны два способа передачи оцифрованных данных: параллельный, когда каждый из разрядов передается по отдельной линии, и последовательный, когда данные передаются по одной линии с помощью определенной комбинации импульсов. Параллельная передача обычно быстрее, она используется, например, на шине SCSI.
Естественно, при последовательном кодировании и передаче возникают дополнительные проблемы: как обозначить переход к следующему слову, как своевременно обнаружить ошибку при передаче (ведь ошибка в старшем разряде может полностью исказить данные). Поэтому реально комбинация импульсов может быть достаточно сложной.
Процесс оцифровки – лишь одна из возможностей цифро-аналоговых преобразований. В цифровом виде хорошо хранить, модифицировать и копировать информацию. Но воспринимаем-то мы непрерывные, аналоговые процессы, следовательно, для вывода изображения на экран его необходимо перевести в прежний – аналоговый – формат. При этом в идеальном случае исходный сигнал должен был бы восстановиться в полном объеме. Понятно, что такого не бывает. Во-первых, глубина квантования не бесконечна, поэтому всегда происходит округление значений параметра, и при обратном преобразовании исходные значения уже не восстанавливаются в прежнем виде. Такие искажения называют
Однако при хороших параметрах оцифровки данных их искажения становятся практически незаметными и на первый план выступают достоинства цифрового описания. Это, прежде всего, возможность многократного копирования без искажений информации. Даже для формата Betacam SP число последовательных копий без ухудшения качества не превышает четырех. Для цифрового видео (если не применять многократную компрессию/декомпрессию) оно не ограничено. Цифровому видео присуща гораздо большая помехоустойчивость. В большинстве форматов существуют механизмы автоматического обнаружения и коррекции ошибок. Кроме того, появляются колоссальные возможности для преобразований изображения (например, для создания эффектов).
Итак, у цифрового описания масса преимуществ, поэтому оно стало популярным задолго до начала эры компьютерного мультимедиа.Стандарты дискретизации видеосигналов
В большинстве форматов цифрового видео используется компонентная палитра. Весьма популярен стандарт 4:2:2 (YUV2). Речь идет о раздельной оцифровке значений Y, U и V-каналов. Для цифрового кодирования в качестве базовой принята частота 3,375 МГц. Это значение кратно частотам основных стандартов телевизионных изображений: 625/60 и 525/50. Частота дискретизации для конкретного канала вычисляется как произведение базовой частоты на соответствующий коэффициент: 4 для канала Y и 2 для цветоразностных каналов. Таким образом, частота оцифровки яркостного сигнала равна 13,5 МГц. Эта частота соответствует рекомендациям международного стандарта ITU (бывшего CCIR) 601. Схема дискретизации при данной частоте приведена на рис. 3.4.
Рис. 3.4. Дискретизация по стандарту 4:2:2 (YUV2)
Отсюда следует, что каждый пиксел строки имеет собственное значение яркости, но значения каждого из цветоразностных компонентов одинаковы для пары соседних пикселов. При 576 активных строках на кадр с сохранением стандартного для телевидения соотношения ширины изображения к высоте 4:3 получаем 720 активных элементов в строке для сигнала яркости и 360 – для цветоразностных сигналов. (Нарушение соотношения 4:3 приводит к искажению изображения, так что квадратные элементы становятся прямоугольными.) Это исходный, наиболее универсальный формат, такие кадры как раз и поступают на вход систем компрессии. Яркостный сигнал кодируется восемью битами, оба цветоразностных – по 8 бит на пару точек. В результате для описания каждой точки используется 16 бит, однако определяемое таким способом кодирования цветовое пространство соответствует 24-битной палитре – 16 миллионов цветов, где каждая отдельная точка может занимать любое положение в пределах цветового охвата данной палитры. Поэтому при перекодировании из YUV 4:2:2 в 16-битный RGB происходят необратимые потери информации.
Для цифрового представления существенна величина потока информации (скорости передачи данных, необходимой для записи информации без потерь). Она является произведением глубины квантования на частоту дискретизации. То есть для стандарта 4:2:2 при уровне квантования 10 бит (распространенном для современной техники) имеем:
Чy х Гу + Чu х Гu + Чv х Гv = 10 бит х (13,5 МГц + 6,75 МГц + 6,75 МГц) = 270 Мбит/с или 33,75 Мбайт/с (где Ч – частота, Г – глубина оцифровки).
Поток достаточно большой, но только при таких характеристиках сохраняется студийное качество изображения.
Встречаются и другие значения частоты дискретизации: для передачи данных непосредственно в RGB-палитре (в измерительной технике или особо точной записывающей аппаратуре) 4:4:4. Этот способ кодирования совсем не искажает изображение, но применяется довольно редко в связи с резким увеличением потока информации. При кодировании дополнительных данных (например, альфа-канала, задающего прозрачные области) встречается представление 4:4:4:4. Это дает поток 540 Мбит/с.
Гораздо чаще встречаются стандарты дискретизации с уменьшенным пространственным разрешением для цветоразностных сигналов: 4:1:1 (BTYUV) и 4:2:0 (YUV12). Оба способа кодирования ухудшают качества кадра и обычно применяются вместе с достаточно высоким уровнем компрессии в форматах, когда компактность оказывается важнее качества.
В первом случае имеем дискретизацию яркостного сигнала с частотой 13,5 МГц, а цветоразностных сигналов – 3,375 Мгц, то есть цветоразностные компоненты общие уже не для двух, а для четырех пикселов.
Стандарт 4:2:0 (рис. 3.5) имеет тот же суммарный поток информации, но для цветоразностных сигналов в два раза снижено разрешение как по горизонтали (360 отсчетов в строке), так и по горизонтали (288 строк). В этом случае имеем не пары, а квадраты точек, для которых приравниваются значения цветоразностных сигналов: две точки в данной строке и две точки в соседней. Ноль в записи, естественно, некоторая условность, вторая цветоразностная компонента никуда не исчезает. Стандарт 4:2:0 используется в бытовых форматах DV.
Еще сильнее уменьшает поток информации (и качество изображения) формат CIF, при котором для яркостной компоненты оцифровывается половина строк (288), горизонтальное разрешение составляет 352 элемента, а разрешение цветоразностных компонент по обоим направлениям в два раз ниже. Такое кодирование используется там, где необходимо очень сильно уменьшить поток данных, например при передаче изображения по телефонным сетям.
Если изображение необходимо копировать без потери качества, надо применять дискретизацию не ниже 4:2:2. Даже если запись производилась с худшими характеристиками, копирование по мере возможности стоит производить на технике именно такого класса.
Для форматов, использующих композитный сигнал, применяется частота дискретизации, совпадающая с частотой четвертой гармоники цветовой несущей: 17,73 МГц для PAL и 14,32 МГц для NTSC.
Сжатие
Существует два принципиально различных варианта сжатия данных: с потерей и без потери информации. Первый вариант используется, например, при архивации данных и основан на том, что информацию можно записывать более или менее «экономным» способом, подобно тому как один и тот же текст можно просто записать, а можно застенографировать. Во втором случае запись, конечно, будет гораздо компактнее. При этом информация не теряется: при расшифровке стенограммы мы получим исходный текст.
Способов сжатия без потерь немного. Один из них основан на частотном анализе компрессируемых данных. В файле различные значения байтов встречаются, естественно, с неодинаковой частотой. Можно перекодировать «текст», поставив в соответствие часто встречающимся значениям байтов более короткие битовые последовательности, а редким значениям – более длинные коды. Для файлов, где существует значительная разница в частоте значений байтов, такой механизм сжатия довольно эффективен. В усовершенствованном варианте, называемом «арифметическим кодированием», анализируется не только частота отдельных значений, но и вероятность их появления в определенном «контексте» (в зависимости от соседних значений).
В другом случае принцип кодирования близок к уже упоминавшейся стенографии: определенные последовательности значений заменяются кодами, из который составляется «словарь». При этом, если в процессе кодирования встречается комбинация значений, являющаяся расширенным вариантом уже зарегистрированной последовательности, она добавляется в словарь. Объем словаря, разумеется, ограничен. Подобным образом создаются, например, специальные компрессированные TIFF-файлы.
Степень сжатия сильно зависит от типа и длины файла. В любом случае к данным добавляется информация, необходимая для
Даже в удачном случае уровень компрессии без потери информации обычно не очень высок. Сжатие в два раза – уже победа. Поэтому обычно для видео используют сжатие с потерей качества, отбрасывая информацию, якобы неразличимую глазом. Естественно, чем выше уровень такого сжатия, тем больше искажения. Из «неподвижных» графических компьютерных форматов такое сжатие применяется, например, в формате JPEG. В компьютерном видеоформате AVI (Audio Video Interleave – чередование аудио и видео) используется Motion JPEG.
Методы сжатия кадров основаны на дискретно-косинусном преобразовании. Картинка подразделяется на квадратные блоки, обычно 8х8 пикселов. В пределах каждого блока значения яркости и цветности точек переводятся в некоторые частотные коэффициенты. На этом этапе потерь информации не происходит. Затем производится квантование с переменным интервалом, то есть наибольшее число уровней квантования (значений, до которых производится округление) приходится на низкочастотную область, описывающую крупные объекты. В высокочастотной области, ответственной за детали изображения, происходит грубое округление значений до небольшого числа разрешенных уровней. Внешне результат выглядит как уменьшение разрешения, иногда сопровождающееся появлением артефактов. В несколько утрированном виде последствия такого сжатия можно проиллюстрировать при помощи обычного JPEG с высоким уровнем сжатия. Обратите внимание на рис. 3.6. Исходная надпись создана в CorelDraw с использованием градиентной заливки из черного в белый. Вверху – изображение импортировано в формат TIFF с разрешение 300 dpi и стандартным сглаживанием, снизу – то же изображение преобразовано в формат JPEG с максимальным уровнем сжатия. Разрешение то же. Разумеется, в реальной жизни никому не придет в голову использовать такую обработку для векторных картинок. При меньшем уровне сжатия и для картинки с пестрым фоном повреждения будут гораздо меньше. Чувствительность зрения к высокочастотным компонентам изображения (мелким деталям) меньше, чем к низкочастотным составляющим (крупным фрагментам). Поэтому, если в результате обработки «слипнутся», например, травинки или брызги воды, зритель может этого и не заметить. Особенно когда мы имеем дело с видеорядом изображений. Крупные же объекты с плавным краем обработка почти не искажает.
Для видео, кроме компрессии одного кадра – пространственного или внутрикадрового сжатия, – возможно межкадровое сжатие, основанное на том, что два соседних кадра обычно очень похожи.
На межкадровом сжатии основан, например, наиболее часто использующийся формат компрессии MPEG, на котором следует остановиться подробнее. Вообще MPEG – это не формат и даже не группа форматов. По словам одного из разработчиков, Джона Уоткинсона, «MPEG – это набор стандартных средств или точно определенных алгоритмов, которые могут комбинироваться многими способами при реализации аппаратуры цифрового сжатия». Собственно, аббревиатура MPEG расшифровывается как Moving Picture Expert Group (группа экспертов по движущимся изображениям). Он предусматривает компрессию видео– и аудиоматериала, а также способы их объединения и синхронизации. Литературы по MPEG очень много. Мы кратко коснемся только обработки видеоданных. Метод сжатия MPEG 1 основан на том, что полностью записывается лишь один кадр из группы примерно в 10 кадров. Это опорный, или I-кадр. Он сворачивается методами внутрикадрового сжатия. Следующие кадры сравниваются при кодировании, и вычисляются векторы движения. Для этого кадр подразделяется на макроблоки размером 16x16 пикселов, и измеряется движение фрагмента при переходе к следующему кадру. Для некоторого предсказанного кадра (P-кадра) производится сравнение с реальным, и определяется ошибка предсказания. При помощи векторов движения и разностных данных кодируются и остальные кадры. Их называют двунаправленными (В-кадрами), поскольку для их декодирования необходим I– или P-кадр до и после данного B-кадра. Последовательности I-, P-, B-кадров объединяются в фиксированные по длине и структуре группы, называемые GOP (Group of Pictures). Каждая такая группа обязательно начинается с I-кадра и с определенной периодичностью содержит P-кадры. Ее структуру описывают как M/N, где M – общее число кадров в группе, а N – интервал между P-кадрами. Для кадров разных типов применяется различный уровень компрессии. Наименее сильно сжимаются I-кадры. Р-кадр составляет по размеру примерно третью часть от I, а B – восьмую. Поэтому суммарный поток данных в значительной степени зависит от состава GOP. В зависимости от назначения и требуемого качества записи – видеофильм, мультимедиа-продукция, фильм для демонстрации в Internet и т. д. – используется различный состав GOP. Так, типичная для Video-CD IPB группа 15/3 имеет следующий вид: IBBPBBPBBPBBPBB. Программы для записи MPEG обычно позволяют пользователю регулировать состав группы.
Теоретически MPEG позволяет описывать кадры большого размера, но в связи с ограничением числа макроблоков на картинку реальный размер кадра составляет 352x240, 30 кадров/с (SIF) или 352x288, 25 кадров/с, формат 4:2:0, 8 бит на точку.
MPEG позволяет значительно уменьшить суммарный поток данных. Естественно, потери качества при очень высоком уровне сжатия будут происходить вне зависимости от алгоритма обработки. Обычно программы сжатия позволяют заранее выбрать требуемое качество и показывают поток данных, которые вы получите в этом случае. Уменьшение потока в ущерб качеству обычно выбирают при создании видео для Intenet и мультимедиа-приложений.
Поскольку B-кадр нельзя декодировать, не приняв последующего P-кадра, кадры декодируются не в линейной последовательности (рис. 3.7).
Алгоритм MPEG 2 является усовершенствованным вариантом MPEG 1, использует поиск и удаление избыточности (повторяющейся информации) в видеосигнале. Поскольку, по некоторым данным, дублируется более 90 % информации, уровень компрессии может быть весьма высоким. Этот стандарт позволяет работать с кадром полного размера, с видео в стандарте не только 4:2:2, но и 4:4:4, чересстрочной разверткой, широкоформатным изображением (соотношение сторон кадра 16:9).
MPEG подразделяется на уровни и профили. Профиль определяет набор методов обработки, а уровень – перечень ограничений, таких, как размер кадра или скорость потока данных.
В профиле Simple (простой) отсутствуют B-кадры, профиль Main (основной) – это обычный MPEG 1. В более высоких профилях – Main+ (основной+), Next (следующий) – используется разделение на три слоя, что позволяет организовать приоритет при передаче данных. При пространственном масштабировании основной, менее приоритетный слой кодируется с меньшим разрешением и затем используется как предсказание для более приоритетных. SNR-каналы (Signal to Noise Ratio Scalability – масштабирование соотношения сигнал/шум) кодируются с одинаковой скоростью, но с разным качеством: менее приоритетный слой содержит плохую картинку – более дискретные шаги, а высокоприоритетный слой содержит довесок, позволяющий построить качественную картинку.
При временном масштабировании слои различаются по скорости передачи информации. Обычно больший приоритет имеют низкочастотные компоненты, а меньший – более высокочастотные (мелкие детали).
Уровни определяют размер кадра и величину потока – см. табл. 3.1.
Существуют запретные сочетания уровней и профилей, например для профиля Main невозможны уровни High. Наиболее часто встречается сочетание главного уровня с главным профилем. Встретив обозначение ML@MP, не пугайтесь, это всего лишь Main Level, Main Profile. Возможны и более развернутые обозначения, например IBP 15/3 MP@ML. Вы, наверное, уже поняли, что такая запись означает главный уровень, главный профиль, кодирование с использованием и I-, B– и P-кадров, группы из 15 кадров, по 3 B-кадра между P-кадрами.
MPEG 2 является наиболее распространенным способом сжатия видеоданных и применяется во многих цифровых форматах. Однако в наиболее дорогой технике профессионального класса предпочитают обходиться без компрессии, следуя по пути увеличения скорости протяжки ленты и ее расхода, а для компьютерного видео – распараллеливания записей.
Для записей бытового класса и многих случаев видеорегистрации MPEG представляет собой вполне приемлемый вариант. Этот алгоритм с успехом используется в цифровом формате DVD-video, считающемся «последним словом» бытовой видеотехники. При непрерывном просмотре кадры MPEG кажутся полностью реалистичными. Однако это впечатление обманчиво. На рис. 3.8 и 3.9 показаны кадры из одного и того же видеоклипа: один взят из некомпрессированного AVI-файла, другой – из созданного на его основе MPEG-файла.
До недавнего времени считалось, что монтаж MPEG-последовательностей затруднен, если не невозможен. Для монтажа и создания эффектов их приходилось декомпрессировать. Наиболее современные системы видеоввода обеспечивают возможность не только монтажа, но и применения эффектов к видеопоследовательностям в формате MPEG. К сожалению, автор вынуждена честно признаться, что пока не видела видео, созданного подобным способом и ничего не может сказать о его качестве.
Существует (в зачаточном состоянии) еще два MPEG-формата: MPEG 4 и MPEG 7, не являющиеся собственно форматами сжатия. MPEG 4 – новый мультимедиа-формат, рассчитанный на низкоскоростную передачу данных. Суть его заключается в том, чтобы подразделить материал на несколько типов элементов (медиа-объектов): неподвижные, видеообъекты, аудиообъекты и т. д., формализовать их структуру и взаимосвязи и скомпоновать в единую, изменяемую пользователем сцену. Есть его вариант MPEG-J, использующий язык Java. MPEG 7 представляет собой интерфейс для описания и поиска различных типов мультимедиа-информации.
Несмотря на преимущества межкадрового сжатия, для ряда профессиональных форматов, например, Digital S фирмы JVC, применяется только внутрикадровая компрессия.
Цифровые видеоформаты
Как уже отмечалось, количество цифровых форматов значительно превышает количество форматов аналоговых. Даже при наличии общепринятых стандартов практически каждая известная фирма-производитель видеотехники предлагает свою реализацию формата. К сожалению, совместимость даже между разными реализациями одного формата чаще всего (точнее, почти всегда) оставляет желать лучшего. Причина не в сложности разработки совместимых форматов, а в соображениях исключительно маркетингового характера. Как только в среде производителей появляется даже не стандарт, а идея стандарта, сразу начинается борьба за лидерство: каждая фирма стремится первой создать его рыночную реализацию. Кроме того, каждая компания мечтает закрепить за собой своих клиентов «навеки». Поэтому делается все возможное для вертикальной совместимости между собой продукции данной фирмы. Приведет ли это к несовместимости с продукцией конкурентов – пока не важно. Зато потом, когда все, кто успел, уже предложили свои варианты и рынок оказался поделенным, начинается переманивание клиентов у «соседа». Вот тогда производители вдруг начинают заботиться о совместимости, выпускать адаптеры и заключать соглашения. В результате покупатели, растерявшиеся перед разнообразием торговых марок и стандартов, тратят массу времени на попытки разобраться, какой модели отдать предпочтение.
На самом деле, во многих случаях разница между вариантами весьма невелика. В этом разделе автор постаралась привести краткие характеристики наиболее известных форматов. Конечно, здесь нет их полной спецификации и подробных технических описаний. За небольшим исключением также опущены данные, касающиеся особенностей пленки, расположения и числа дорожек, работы головок. Основное внимание уделено стандартам кодирования видеоинформации.
Форматы, с которых все начиналось
Формат D1 – это «дедушка» всех современных цифровых форматов. В нем используется компонентный сигнал, дискретизация 4:2:2, уровень квантования составляет 8 бит. Существование кода, содержащего контрольную информацию, позволяло исправлять ошибки, эквивалентные продольной царапине длиной в 0,5 мм или выпадению трех строк изображения. Аппараты этого формата способны принимать данные в двух основных ТВ стандартах: PAL и NTSC. При этом число строк в поле (полукадре) варъируется: 300 при 625 строках на кадр и 250 при 525 строках на кадр.
Форматы D2 и D3 использовали композитный сигнал (в стандартах PAL или SECAM) и частоту дискретизации, соответствующую четвертой гармонике цветовой несущей. Формат D2 обладал на тот момент беспрецедентной плотностью записи.
D1 и D2 работали на широкой ленте – 3/4 дюйма, D3 – на более узкой, 1/2 дюйма, что дало возможность использовать этот формат для создания первой цифровой видеокамеры.
В наши дни форматы представляют лишь исторический интерес и в современной технике не используются. В дальнейшем композитный видеосигнал не применялся в цифровой технике. Все современные цифровые видеомагнитофоны используют компонентный сигнал.
Современные цифровые форматы
Число форматов цифрового видео очень велико, однако с точки зрения их использования в качестве источника сигнала для компьютерного видеоввода эти различия не очень значительны.
Все современные цифровые форматы работают с компонентным сигналом. Частота дискретизации и глубина квантования могут заметно различаться. Появился еще один существенный параметр: это наличие/отсутствие компрессии (сжатия), ее тип и уровень. В начале этой главы мы разбирали проблемы, связанные со сжатием данных. Проблема записи больших потоков связана с существенным расходом пленки, и решить вопрос возможно только с помощью громоздкой и очень дорогой студийной техники. Поэтому большинство современных цифровых форматов используют сжатие.
Последний формат без сжатия – D5 (1992 г.) – использовал дискретизацию 4:2:2 и уровень квантования 10 бит. Как было показано выше, при таких характеристиках поток данных достигает 270 Мбит/с. Скорость протягивания ленты и, соответственно, ее расход увеличен в два раза.
У Digital Betacam при компрессии 2:1 те же параметры записи видеосигнала. Аппараты этого формата могут воспроизводить записи в аналоговых Betacam-форматах.