Редактор потоков sed – это неинтерактивный текстовый редактор, выполняющий операции на данных, поступающих из стандартного ввода или из файла. Sed редактирует информацию построчно.
В были описаны основы работы с редактором sed. Данное руководство охватывает более продвинутые приёмы.
Объединение команд
Иногда возникает необходимость передать редактору sed несколько команд одновременно. Это делается несколькими способами.
Если у вас ещё нет тестового файла для работы с sed, создайте следующее окружение:
cd
cp /usr/share/common-licenses/BSD .
cp /usr/share/common-licenses/GPL-3 .
echo "this is the song that never ends
not knowing what it was
just because..." > annoying.txt
Поскольку sed работает со стандартным вводом и выводом, можно, конечно, просто вызвать различные команды sed вместе в одной строке:
sed "s/and/\&/" annoying.txt | sed "s/people/horses/"
yes, it goes on & on, my friend
some horses started singing it
not knowing what it was
& they"ll continue singing it forever
just because...
Такой метод сработает, но несколько вызовов sed создают излишнюю нагрузку, занимают больше места и не используют встроенных возможностей sed.
Передать sed несколько команд одновременно можно при помощи опции –e, которую нужно вставить перед каждой командой:
sed -e "s/and/\&/" -e "s/people/horses/" annoying.txt
Также можно объединить команды в строку при помощи символа точки с запятой. Этот метод работает точно так же как и предыдущий.
sed "s/and/\&/;s/people/horses/" annoying.txt
Обратите внимание: при использовании флага –e возникает необходимость разрывать одиночные кавычки, а при использовании точки с запятой все команды можно перечислить в одних кавычках.
Эти два способа одновременного вызова нескольких команд достаточно удобны, однако бывают случаи, когда требуется использовать простую строку команд.
Также следует ознакомиться с оператором =. Этот оператор вставляет номер строки между каждой существующей строкой. Результат выглядит следующим образом:
sed "=" annoying.txt
1
this is the song that never ends
2
yes, it goes on and on, my friend
3
some people started singing it
4
not knowing what it was
5
and they"ll continue singing it forever
6
just because...
Теперь попробуйте отредактировать текст, чтобы понять, как меняется формат нумерации.
Команда G по умолчанию добавляет пустую строку между уже существующими строками.
sed "G" annoying.txt
_
this is the song that never ends
_
yes, it goes on and on, my friend
_
some people started singing it
_
not knowing what it was
_
and they"ll continue singing it forever
_
just because...
Попробуйте скомбинировать эти две команды. Сначала может показаться, что вывод этих команд будет содержать пустую строку между строкой текста и строкой с номером. Однако вывод выглядит так:
sed "=;G" annoying.txt
1
this is the song that never ends
_
2
yes, it goes on and on, my friend
_
3
some people started singing it
_
4
not knowing what it was
. . .
. . .
Это происходит потому, что оператор = изменяет поток вывода (это значит, что использовать полученный вывод для дальнейшего редактирования нельзя).
Это можно обойти при помощи двух вызовов sed, где первый вызов будет восприниматься как простой поток текста для второго.
sed "=" annoying.txt | sed "G"
1
_
this is the song that never ends
_
2
_
yes, it goes on and on, my friend
_
3
_
some people started singing it
. . .
. . .
Имейте в виду, некоторые из команд работают аналогичным образом, особенно если вы объединяете несколько команд и вывод отличается от ожидаемого.
Продвинутая адресация
Одним из преимуществ команд sed, поддерживающих адресацию, является то, что они могут использовать регулярные выражения в качестве критериев. Это означает, что можно работать с файлами, содержимое которых точно не известно.
sed "1,3s/.*/Hello/" annoying.txt
Hello
Hello
Hello
not knowing what it was
and they"ll continue singing it forever
just because...
Вместо этого можно использовать регулярное выражение, находящее только строки, содержащие определенный шаблон. Для этого нужно поместить шаблон поиска между двумя слешами (/) перед командой.
sed "/singing/s/it/& loudly/" annoying.txt
this is the song that never ends
yes, it goes on and on, my friend
some people started singing it loudly
not knowing what it was
and they"ll continue singing it loudly forever
just because...
В этом примере слово loudly помещается перед первым it в каждой строке, содержащей слово singing. Обратите внимание: вторая и четвёртая строки остались без изменений, поскольку они не отвечают шаблону.
Выражения для адресации можно усложнить. Это делает команды более гибкими.
Следующий пример демонстрирует, как использовать регулярные выражения для генерации адресов для других команд. Эта команда находит все пустые строки и удаляет их:
sed "/^$/d" GPL-3
GNU GENERAL PUBLIC LICENSE
Version 3, 29 June 2007
Copyright (C) 2007 Free Software Foundation, Inc.
Everyone is permitted to copy and distribute verbatim copies
of this license document, but changing it is not allowed.
Preamble
The GNU General Public License is a free, copyleft license for
. . .
. . .
Имейте в виду, что регулярные выражения могут быть использованы в любой части диапазона.
К примеру, можно удалить строки между строками START и END:
sed "/^START$/,/^END$/d" inputfile
Имейте в виду: эта команда удалит все строки от первого найденного слова START до первого найденного слова END, и если затем она снова встретит слово START, она продолжит удалять данные.
Чтобы инвертировать адресацию (то есть выбрать строки, которые не соответствуют шаблону), используйте восклицательный знак (!).
К примеру, чтобы удалить любую заполненную строку, нужно ввести:
sed "/^$/!d" GPL-3
Адрес не обязательно должен быть сложным выражением, чтобы быть инвертированным. Инверсия точно так же работает с обычной нумерацией.
Использование дополнительного буфера
Дополнительный буфер (hold buffer) увеличивает способность sed выполнять многострочное редактирование.
Дополнительный буфер представляет собой область временного хранения, которая может быть изменена путем определенных команд.
Наличие этого дополнительного буфера позволяет хранить строки во время работы над другими строками.
Команды для работы с буфером:
- h: копирует текущий буфер обработки (последней совпавшей строки, с которой вы работаете) в дополнительный буфер.
- H: Добавляет текущий буфер обработки в конец текущей дополнительной обработки, разделяя их символом \n.
- g: Копирует текущий дополнительный буфер в текущий буфер обработки. Предыдущий буфер обработки будет утерян.
- G: Добавляет текущий шаблон в текущий буфер обработки, разделяя их символом \n.
- x: Подкачивает текущий шаблон и дополнительный буфер.
С контентом дополнительного буфера нельзя работать до тех пор, пока он не перемещён в буфер обработки.
Рассмотрим сложный пример.
Попробуйте соединить смежные строки при помощи следующей команды:
sed -n "1~2h;2~2{H;g;s/\n/ /;p}" annoying.txt
Примечание : На самом деле, для этого sed предлагает отдельную встроенную команду N; но для практики рассмотреть этот пример полезно.
Опция –n подавляет автоматический вывод.
1~2h – определение адреса, выполняющее последовательную замену каждой второй строки текста, начина с первой (то есть каждой нечётной строки). Команда h копирует совпавшие строки в дополнительный буфер.
Остальная часть команды взята в фигурные скобки. Это означает, что эта часть команды будут наследовать адрес, который был только что указан. Без этих скобок, наследовать адрес будет только команда H, а остальные команды будут выполняться для каждой строки.
Конечно, ранее упомянутая встроенная команда N значительно короче и проще, и возвращает такой же результат:
sed -n "N;s/\n/ /p" annoying.txt
this is the song that never ends yes, it goes on and on, my friend
some people started singing it not knowing what it was
and they"ll continue singing it forever just because...
Скрипты sed
Команды можно компоновать в скрипты. Это позволяет выполнять целый набор команд на один целевой шаблон.
К примеру, можно написать скрипт, чтобы создавать простые текстовые сообщения, которые нужно предварительно отформатировать.
Тогда вам не придётся постоянно повторять одни и те же команды для каждого сообщения. По сути, скрипт sed – это список команд, которые нужно применить на заданный объект.
Например:
s/this/that/g
s/snow/rain/g
1,5s/pinecone/apricot/g
Затем можно вызвать файл:
sed -f sedScriptName fileToEdit
Заключение
Теперь вы знаете более продвинутые методы работы с sed.
Сначала команды sed сложны для понимания, в них легко запутаться. Потому рекомендуется поэкспериментировать с ними, прежде чем использовать их на важных данных.
Tags: ,Автор: Rares Aioanei
Дата публикации: 19 ноября 2011 года
Перевод: А. Кривошей
Дата перевода: июль 2012 г.
1. Введение
Добро пожаловать во вторую часть нашей серии, которая посвящена sed, версии GNU. Существует несколько версий sed, которые доступны на разных платформах, но мы сфокусируемся на GNU sed версии 4.x. Многие из вас слышали о sed, или уже использовали его, скорее всего в качестве инструмента замены. Но это только одно из предназначений sed, и мы постараемся показать вам все аспекты использования этой утилиты. Его название расшифровывается как "Stream EDitor" и слово "stream" (поток) в данном случае может означать файл, канал, или просто stdin. Мы надеемся, что у вас уже есть базовые знания о Linux, а если вы уже работали с регулярными выражениями, или по крайней мере знаете, что это такое, то все для вас будет намного проще. Объем статьи не позволяет включить в нее полное руководство по регулярным выражениям, вместо этого мы озвучим базовые концепции и дадим большое количество примеров использования sed.
2. Установка
Здесь не нужно много рассказывать. Скорее все sed у вас уже установлен, так как он используется различными системными скриптами, а также пользователями Linux, которые хотят повысить эффективность своей работы. Вы можете узнать, какая версия sed у вас установлена, с помощью команды:
$ sed --version
В моей системе эта команда показывает, что у меня установлен GNU sed 4.2.1 плюс дает ссылку на домашнюю страницу программы и другие полезные сведения. Пакет называется "sed" независимо от дистрибутива, кроме Gentoo, где он присутствует неявно.
3. Концепции
Перед тем, как идти дальше, мы считаем важным акцентировать внимание на том, что делает "sed", так как словосочетание "потоковый редактор" мало что говорит о его назначении. sed принимает на входе текст, выполняет заданные операции над каждой строкой (если не задано другое) и выводит модифицированный текст. Указанными операциями могут быть добавление, вставка, удаление или замена. Это не так просто, как выглядит: предупреждаю, что имеется большое количество опций и их комбинаций, которые могут сделать команду sed очень трудной для понимания. Поэтому мы рекомендуем вам изучить основы регулярных выражений, чтобы понимать, как это работает. Перед тем, как приступить к руководству, мы хотели бы поблагодарить Eric Pement и других за вдохновление и за то, что он сделал для всех, кто хочет изучать и использовать sed.
4. Регулярные выражения
Так как команды (скрипты) sed для многих остаются загадкой, мы чувствуем, что наши читатели должны понимать базовые концепции, а не слепо копировать и вставлять команды, значения которых они не понимают. Когда человек хочет понять, что представляют собой регулярные выражения, ключевым словом является "соответствие", или, точнее, "шаблон соответствия". Например, в отчете для своего департамента вы написали имя Nick, обращаясь к сетевому архитектору. Но Nick ушел, а на его место пришел John, поэтому теперь вы должны заменить слово Nick на John. Если файл с отчетом называется report.txt, вы должны выполнить следующую команду:
$ cat report.txt / sed "s/Nick/John/g" > report_new.txt
По умолчанию sed использует stdout, вы можете использовать оператор перенаправления вывода, как показано в примере выше. Это очень простой пример, но мы проиллюстрировали несколько моментов: мы ищем все соответствия шаблону "Nick" и заменяем во всех случаях на "John". Отметим, что sed призводит поиск с учетом регистра, поэтому будьте внимательны и проверьте выходной файл, чтобы убедиться, что все замены были выполнены. Приведенный выше пример можно было записать и так:
$ sed "s/Nick/John/g" report.txt > report_new.txt
Хорошо, скажете вы, но где же здесь регулярные выражения? Да, мы хотели сначала показать пример, а теперь начинается самая интересная часть.
Если вы не уверены, написали ли вы "nick" или "Nick", и хотите предусмотреть оба случая, необходимо использовать команду sed "s/Nick/nick/John/g". Вертикальная черта имеет значение, которое вы должны знать, если изучали C, то есть ваше выражение будет соответствовать "nick" или "Nick". Как вы увидите ниже, канал может использоваться и другими способами, но смысл остается тот же самый. Другие операторы, широко использующиеся в регулярных выражениях - это "?", который соответствует повторению предшествующего символа ноль или один раз (то есть flavou?r будет соответствовать flavor и flavour), "*" - ноль или более раз, "+" - один или более раз. "^" соответствует началу строки, а "$" - наоборот. Если вы - пользователь vi или vim, многие вещи покажутся вам знакомыми. В конце концов, эти утилиты, вместе с awk и С уходят корнями в ранние дни UNIX. Мы не будем больше говорить на эту тему, так как проще понять значение этих символов на примерах, но вы должны знать, что существуют различные реализации регулярных выражений: POSIX, POSIX Extended, Perl, а также различные реализации нечетких регулярных выражений, гарантирующие вам головную боль.
5. Примеры использования sed
Синтаксис команды | Описание |
sed "s/Nick/John/g" report.txt | Заменяет каждое вхождение Nick на John в файле report.txt |
sed "s/Nick/nick/John/g" report.txt | Заменяет каждое вхождение Nick или nick на John. |
sed "s/^/ /" file.txt >file_new.txt | Добавляет 8 пробелов слева от текста для улучшения качества печати. |
sed -n "/Of course/,/attention you \ pay/p" myfile |
Выводит один абзац, начинающийся с "Of course" и заканчивающийся на "attention you pay" |
sed -n 12,18p file.txt | Выводит только строки 12-18 файла file.txt |
sed 12,18d file.txt | Выводит весь файл file.txt за исключением строк с 12 по 18 |
sed G file.txt | Удваивает пробелы в file.txt |
sed -f script.sed file.txt | Записывает все команды в script.sed и выполняет их. |
sed "5!s/ham/cheese/" file.txt | Заменяет ham на cheese в file.txt за исключением 5-й строки |
sed "$d" file.txt | Удаляет последнюю строку |
sed "/\{3\}/p" file.txt | Печатает только строки с тремя последовательными цифрами |
sed "/boom/!s/aaa/bb/" file.txt | Если найден "boom", заменить aaa на bb |
sed "17,/disk/d" file.txt | Удаляет все строки, начиная с 17-й, до "disk" |
echo ONE TWO / sed "s/one/unos/I" | Заменяет one на unos независимо от регистра, поэтому будет напечатано "unos TWO" |
sed "G;G" file.txt | Утраивает пробелы в файле |
sed "s/.$//" file.txt | Способ замены dos2unix:) |
sed "s/^[ ^t]*//" file.txt | Удаляет все пробелы перед каждой строкой в file.txt |
sed "s/[ ^t]*$//" file.txt | Удаляет все пробелы в конце каждой строки в file.txt |
sed "s/^[ ^t]*//;s/[ ^]*$//" file.txt | Удаляет все пробелы в начале и в конце каждой строки в file.txt |
sed "s/foo/bar/" file.txt | Заменяет foo на bar только в первом вхождении в строке. |
sed "s/foo/bar/4" file.txt | Заменяет foo на bar только в четвертом вхождении в строке. |
sed "s/foo/bar/g" file.txt | Заменяет foo на bar для всех вхождений в строке. |
sed "/baz/s/foo/bar/g" file.txt | Заменить foo на bar только если строка содержит baz. |
sed "/./,/^$/!d" file.txt | Удалить все последовательные пустые строки за исключением EOF |
sed "/^$/N;/\n$/D" file.txt | Удалить все последовательные пустые строки, но оставить верхнюю пустую строку. |
sed "/./,$!d" file.txt | Удалить все начальные пустые строки |
sed -e:a -e "/^\n*$/{$d;N;};/\n$/ba" \ file.txt |
Удалить все замыкающие пустые строки |
sed -e:a -e "/\\$/N; s/\\\n//; ta" \ file.txt |
Если файл заканчивается обратным сплешем, соединить его со следующим (полезно для скриптов оболочки) |
sed "/regex/,+5/expr/" | Соответствует regex плюс 5 следующих строк |
sed "1~3d" file.txt | Удалить каждую третью строку, начиная с первой. |
sed -n "2~5p" file.txt | Печатать каждую пятую строку, начиная со второй. |
sed "s/ick/John/g" report.txt | Другой способ записи некоторых приведенных выше примеров. Вы можете предложить свой? |
sed -n "/RE/{p;q;}" file.txt | Печатает только первое соответствие RE (регулярного выражения) |
sed "0,/RE/{//d;}" file.txt | Удаляет только первое соответствие |
sed "0,/RE/s//to_that/" file.txt | Изменяет только первое соответствие |
sed "s/^[^,]*,/9999,/" file.csv | Заменяет первое поле на 9999 в CSV-файле |
s/^ *\(.*[^ ]\) *$//\1//; s/" *, */"//g; : loop s// *\([^",/][^,/]*\) *, *//\1//g; s// *, *//\1//g; t loop s/ *////g; s// *///g; s/^/\(.*\)/$/\1/; | Скрипт sed для конвертирования CSV-файла в файл с вертикальной чертой в качестве разделителя (работает только с некоторыми типами CSV, со встроенными кавычками и запятыми). |
sed ":a;s/\(^\/[^0-9.]\)\(\+\)\(\{3\}\)/\1\2,\3/g;ta" file.txt | Меняет формат чисел в file.txt с 1234.56 на 1.234.56 |
sed -r "s/\<(reg/exp)+/\U&/g" | Переводит любое слово, начинающееся с reg или exp в верхний регистр. |
sed "1,20 s/Johnson/White/g" file.txt | Производит замену Johnson на White только в строках 1 - 20. |
sed "1,20 !s/Johnson/White/g" file.txt | Предыдущий пример наоборот (заменяет везде, кроме строк 1-20) |
sed "/from/,/until/ { s/\ /magenta/g; \ s/\ /cyan/g; }" file.txt | Заменяет только между "from" и "until" |
sed "/ENDNOTES:/,$ { s/Schaff/Herzog/g; \ s/Kraft/Ebbing/g; }" file.txt | Заменяет только со слова "ENDNOTES:" и до EOF |
sed "/./{H;$!d;};x;/regex/!d" file.txt | Печатает абзац только если он содержит regex |
sed -e "/./{H;$!d;}" -e "x;/RE1/!d;/RE2/!d;/RE3/!d" file.txt | Печатает абзацы только если они содержат RE1, RE2 и RE3 |
sed "s/14"/fourteen inches/g" file.txt | Так вы сможете использовать двойные кавычки |
sed "s/\/some\/UNIX\/path/\/a\/new\/path/g" file.txt | Работа с путями Unix |
sed "s///g" file.txt | Удаляет все символы, начиная с a и заканчивая g из файла file.txt |
sed "s/\(.*\)foo/\1bar/" file.txt | Заменяет только последнее соответствие foo на bar |
sed "1!G;h;$!d" | Замена команды tac |
sed "/\n/!G;s/\(.\)\(.*\n\)/&\2\1/;//D;s/.//" | Замена команды rev |
sed 10q file.txt | Замена команды head |
sed -e:a -e "$q;N;11,$D;ba" \ file.txt | Замена команды tail |
sed "$!N; /^\(.*\)\n\1$/!P; D" \ file.txt | Замена команды uniq |
sed "$!N; s/^\(.*\)\n\1$/\1/;\ t; D" file.txt | Обратная команда (что эквивалентно uniq -d) |
sed "$!N;$!D" file.txt | Эквивалент tail -n 2 |
sed -n "$p" file.txt | ... tail -n 1 (или tail -1) |
sed "/regexp/!d" file.txt | Эквивалент grep |
sed -n "/regexp/{g;1!p;};h" file.txt | Печатает строку, находящуюся перед первым соответствием регулярному выражению, но не включающую само соответствие |
sed -n "/regexp/{n;p;}" file.txt | Печатает строку, находящуюся после первого соответствия регулярному выражению, но не включающую само соответствие |
sed "/pattern/d" file.txt | Удаляет строки, соответствующие шаблону pattern |
sed "/./!d" file.txt | Удаляет все пустые строки из файла |
sed "/^$/N;/\n$/N;//D" file.txt | Удаляет все следующие друг за другом пустые строки, за исключением первых двух |
sed -n "/^$/{p;h;};/./{x;/./p;}"\ file.txt | Удаляет последнюю строку каждого абзаца |
sed "/^$/q" | Получает заголовок письма |
sed "1,/^$/d" | Получает тело письма |
sed "/^Subject: */!d; s///;q" | Получает тему письма |
sed "s/^/> /" | Цитирует сообщение, вставляя "> " перед каждой строкой |
sed "s/^> //" | Обратная команда (убирает цитирование из сообщения) |
sed -e:a -e "s/<[^>]*>//g;/ | Удаляет HTML-теги |
sed "/./{H;d;};x;s/\n/={NL}=/g" file.txt / sort \ / sed "1s/={NL}=//;s/={NL}=/\n/g" | Сортирует абзацы в file.txt в алфавитном порядке |
sed "s@/usr/bin@&/local@g" path.txt | Заменяет /usr/bin на /usr/bin/local в path.txt |
sed "s@^.*$@<<<&>>>@g" path.txt | Попробуйте и увидите:) |
sed "s/\(\/[^:]*\).*/\1/g" path.txt | При условии, что path.txt содержит $PATH, выводит только первый путь в каждой строке |
sed "s/\([^:]*\).*/\1/" /etc/passwd | Замена awk - показывает только пользователей из файла passwd |
echo "Welcome To The Geek Stuff" / sed \ "s/\(\b\)/\(\1\)/g" (W)elcome (T)o (T)he (G)eek (S)tuff | Понятно без объяснений |
sed -e "/^$/,/^END/s/hills/\ mountains/g" file.txt | Заменяет "hills" на "mountains", но только в блоках текста, начинающихся с пустой строки и заканчивающихся строкой с тремя символами "END", включительно. |
sed -e "/^#/d" /etc/services / more | Показывает файл services без закомментированных строк |
sed "$s@\([^:]*\):\([^:]*\):\([^:]*\)@\3:\2:\1@g" path.txt | Меняет порядок элементов в последней строке файла path.txt на обратный |
sed "/regex/{x;p;x;}" file.txt | Вставляет новую строку выше каждой строки, соответствующей регулярному выражению |
sed "/AAA/!d; /BBB/!d; /CCC/!d" file.txt | Ищет соответствие AAA, BBB и CCC в любом порядке |
sed "/AAA.*BBB.*CCC/!d" file.txt | Ищет соответствие AAA, BBB и CCC в заданном порядке |
sed -n "/^.\{65\}/p" file.txt | Печатает строки длиной 65 символов и более |
sed -n "/^.\{65\}/!p" file.txt | Печатает строки длиной 65 символов и менее |
sed "/regex/G" file.txt | Вставляет пустую строку под каждой строкой |
sed "/regex/{x;p;x;G;}" file.txt | Вставляет пустую строку над и под каждой строкой |
sed = file.txt / sed "N;s/\n/\t/" | Нумерует строки в file.txt |
sed -e:a -e "s/^.\{1,78\}$/ &/;ta" file.txt | Выровнять текст по правому краю |
sed -e:a -e "s/^.\{1,77\}$/ &/;ta" -e "s/\(*\)\1/\1/" file.txt | Выровнять текст по центру |
6. Заключение
Это только часть того, что можно бы было рассказать о sed, но данная серия статей представляет собой скорее практическое руководство, которое, как мы надеемся, поможет вам оценить всю мощь утилит Unix и сделает вашу работу более эффективной.
Автор: Rares Aioanei
Дата публикации: 19 ноября 2011 года
Перевод: А. Кривошей
Дата перевода: июль 2012 г.
Николай Игнатушко проверил на GNU sed version 4.2.1 в дистрибутиве Gentoo все команды, упомянутые в этой статье. Не все скрипты хорошо отрабатывали на версии GNU sed. Но дело касалось мелочей, которые исправлены. Только скрипт по замене hill на mountains пришлось существенно переделать.
1. Введение
Добро пожаловать во вторую часть нашей серии, которая посвящена sed, версии GNU. Существует несколько версий sed, которые доступны на разных платформах, но мы сфокусируемся на GNU sed версии 4.x. Многие из вас слышали о sed, или уже использовали его, скорее всего в качестве инструмента замены. Но это только одно из предназначений sed, и мы постараемся показать вам все аспекты использования этой утилиты. Его название расшифровывается как "Stream EDitor" и слово "stream" (поток) в данном случае может означать файл, канал, или просто stdin. Мы надеемся, что у вас уже есть базовые знания о Linux, а если вы уже работали с регулярными выражениями, или по крайней мере знаете, что это такое, то все для вас будет намного проще. Объем статьи не позволяет включить в нее полное руководство по регулярным выражениям, вместо этого мы озвучим базовые концепции и дадим большое количество примеров использования sed.
2. Установка
Здесь не нужно много рассказывать. Скорее все sed у вас уже установлен, так как он используется различными системными скриптами, а также пользователями Linux, которые хотят повысить эффективность своей работы. Вы можете узнать, какая версия sed у вас установлена, с помощью команды:
$ sed --version
В моей системе эта команда показывает, что у меня установлен GNU sed 4.2.1 плюс дает ссылку на домашнюю страницу программы и другие полезные сведения. Пакет называется "sed" независимо от дистрибутива, кроме Gentoo, где он присутствует неявно.
3. Концепции
Перед тем, как идти дальше, мы считаем важным акцентировать внимание на том, что делает "sed", так как словосочетание "потоковый редактор" мало что говорит о его назначении. sed принимает на входе текст, выполняет заданные операции над каждой строкой (если не задано другое) и выводит модифицированный текст. Указанными операциями могут быть добавление, вставка, удаление или замена. Это не так просто, как выглядит: предупреждаю, что имеется большое количество опций и их комбинаций, которые могут сделать команду sed очень трудной для понимания. Поэтому мы рекомендуем вам изучить основы регулярных выражений, чтобы понимать, как это работает. Перед тем, как приступить к руководству, мы хотели бы поблагодарить Eric Pement и других за вдохновление и за то, что он сделал для всех, кто хочет изучать и использовать sed.
4. Регулярные выражения
Так как команды (скрипты) sed для многих остаются загадкой, мы чувствуем, что наши читатели должны понимать базовые концепции, а не слепо копировать и вставлять команды, значения которых они не понимают. Когда человек хочет понять, что представляют собой регулярные выражения, ключевым словом является "соответствие", или, точнее, "шаблон соответствия". Например, в отчете для своего департамента вы написали имя Nick, обращаясь к сетевому архитектору. Но Nick ушел, а на его место пришел John, поэтому теперь вы должны заменить слово Nick на John. Если файл с отчетом называется report.txt, вы должны выполнить следующую команду:
$ cat report.txt | sed "s/Nick/John/g" > report_new.txt
По умолчанию sed использует stdout, вы можете использовать оператор перенаправления вывода, как показано в примере выше. Это очень простой пример, но мы проиллюстрировали несколько моментов: мы ищем все соответствия шаблону "Nick" и заменяем во всех случаях на "John". Отметим, что sed призводит поиск с учетом регистра, поэтому будьте внимательны и проверьте выходной файл, чтобы убедиться, что все замены были выполнены. Приведенный выше пример можно было записать и так:
$ sed "s/Nick/John/g" report.txt > report_new.txt
Хорошо, скажете вы, но где же здесь регулярные выражения? Да, мы хотели сначала показать пример, а теперь начинается самая интересная часть.
Если вы не уверены, написали ли вы "nick" или "Nick", и хотите предусмотреть оба случая, необходимо
использовать команду sed "s/Nick|nick/John/g". Вертикальная черта имеет значение, которое вы должны
знать, если изучали C, то есть ваше выражение будет соответствовать "nick" или "Nick". Как вы увидите
ниже, канал может использоваться и другими способами, но смысл остается тот же самый. Другие операторы,
широко использующиеся в регулярных выражениях - это "?", который соответствует повторению
предшествующего символа ноль или один раз (то есть flavou?r будет соответствовать flavor и flavour),
"*" - ноль или более раз, "+" - один или более раз. "^" соответствует началу строки, а "$" - наоборот. Если вы - пользователь vi или vim, многие вещи покажутся вам знакомыми. В конце концов, эти утилиты, вместе с awk и С уходят корнями в ранние дни UNIX. Мы не будем больше говорить на эту тему, так как проще понять значение этих символов на примерах, но вы должны знать, что существуют различные реализации регулярных выражений: POSIX, POSIX Extended, Perl, а также различные реализации нечетких регулярных выражений, гарантирующие вам головную боль.
5. Примеры использования sed
Синтаксис команды | Описание |
Sed "s/Nick/John/g" report.txt |
Заменяет каждое вхождение Nick на John в файле report.txt |
Sed "s/Nick\|nick/John/g" report.txt |
Заменяет каждое вхождение Nick или nick на John. |
Sed "s/^/ /" file.txt > file_new.txt |
Добавляет 8 пробелов слева от текста для улучшения качества печати. |
Sed -n "/Of course/,/attention you pay/p" myfile |
Выводит все абзацы, начинающиеся с "Of course" и заканчивающиеся на "attention you pay". |
Sed -n 12,18p file.txt |
Выводит только строки 12-18 файла file.txt |
Sed 12,18d file.txt |
Выводит весь файл file.txt за исключением строк с 12 по 18 |
Вставляет пустую строку после каждой строки в file.txt | |
Sed -f script.sed file.txt |
Записывает все команды в script.sed и выполняет их. |
Sed "5!s/ham/cheese/" file.txt |
Заменяет ham на cheese в file.txt за исключением 5-й строки |
Sed "$d" file.txt |
Удаляет последнюю строку |
Sed -n "/\{3\}/p" file.txt |
Печатает только строки с тремя последовательными цифрами |
Sed "/boom/s/aaa/bb/" file.txt |
Если найден "boom", заменить aaa на bb |
Sed "17,/disk/d" file.txt |
Удаляет все строки, начиная с 17-й, до "disk". Если строк с "disk" несколько, удаляет до первой из них. |
Echo ONE TWO | sed "s/one/unos/I" |
Заменяет one на unos независимо от регистра, поэтому будет напечатано "unos TWO" |
Sed "G;G" file.txt |
Вставляет две пустые строки после каждой строки в file.txt |
Sed "s/.$//" file.txt |
Способ замены dos2unix:). В общем случае удаляет последний символ в каждой строке. |
Sed "s/^[ \t]*//" file.txt |
Удаляет все пробелы/табы перед каждой строкой в file.txt |
Sed "s/[ \t]*$//" file.txt |
Удаляет все пробелы/табы в конце каждой строки в file.txt |
Sed "s/^[ \t]*//;s/[ \t]*$//" file.txt |
Удаляет все пробелы/табы в начале и в конце каждой строки в file.txt |
Sed "s/foo/bar/" file.txt |
Заменяет foo на bar только в первом вхождении в строке. |
Sed "s/foo/bar/4" file.txt |
Заменяет foo на bar только в четвертом вхождении в строке. |
Sed "s/foo/bar/g" file.txt |
Заменяет foo на bar для всех вхождений в строке. |
Sed "/baz/s/foo/bar/g" file.txt |
Заменить foo на bar только если строка содержит baz. |
Sed "/./,/^$/!d" file.txt |
Сжать все последовательные пустые строки до одной. Пустой строки сверху не остается. |
Sed "/^$/N;/\n$/D" file.txt |
Сжать все последовательные пустые строки до одной, но оставить верхнюю пустую строку. |
Sed "/./,$!d" file.txt |
Удалить все начальные пустые строки |
Sed -e:a -e "/^\n*$/{$d;N;};/\n$/ba" file.txt |
Удалить все замыкающие пустые строки |
Sed -e:a -e "/\\$/N; s/\\\n/ /; ta" file.txt |
Если строка заканчивается обратным сплешем, соединить ее со следующей (полезно для скриптов оболочки) |
Sed -n "/regex/,+5p" file.txt |
Выводит 5 строк после строки содержащей regex |
Sed "1~3d" file.txt |
Удалить каждую третью строку, начиная с первой. |
Sed -n "2~5p" file.txt |
Печатать каждую пятую строку, начиная со второй. |
Sed "s/ick/John/g" report.txt |
Другой способ записи некоторых приведенных выше примеров. Вы можете предложить свой? |
Sed -n "/RE/{p;q;}" file.txt |
Печатает строку с первым соответствием RE (регулярного выражения) |
Sed "0,/RE/{//d;}" file.txt |
Удаляет строку с первым соответствием |
Sed "0,/RE/s//to_that/" file.txt |
Изменяет только первое соответствие |
Sed "s/^[^,]*,/9999,/" file.csv |
Заменяет на 9999 все значения в первой колонке CSV-файла |
S/^ *\(.*[^ ]\) *$/|\1|/; s/" *, */"|/g; : loop s/| *\([^",|][^,|]*\) *, */|\1|/g; s/| *, */||/g; t loop s/ *|/|/g; s/| */|/g; s/^|\(.*\)|$/\1/; |
Скрипт sed для конвертирования CSV-файла в файл с вертикальной чертой в качестве разделителя (работает только с некоторыми типами CSV, со встроенными кавычками и запятыми). |
Sed ":a;s/\(^\|[^0-9.]\)\(\+\)\(\{3\}\)/\1\2,\3/g;ta" file.txt |
Меняет формат чисел в file.txt с 1234.56 на 1.234.56 |
Sed -r "s/\<(reg|exp)+/\U&/g" |
Переводит любое слово, начинающееся с reg или exp в верхний регистр. |
Sed "1,20 s/Johnson/White/g" file.txt |
Производит замену Johnson на White только в строках 1 - 20. |
Sed "1,20 !s/Johnson/White/g" file.txt |
Предыдущий пример наоборот (заменяет везде, кроме строк 1-20) |
Sed "/from/,/until/ { s/\<red\>/magenta/g; s/<blue\>/cyan/g; }" file.txt |
Заменяет только между "from" и "until". Если областей "from"-"until" несколько, заменяет в каждой из них. |
Sed "/ENDNOTES:/,$ { s/Schaff/Herzog/g; s/Kraft/Ebbing/g; }" file.txt |
Заменяет только со слова "ENDNOTES:" и до EOF |
Sed "/./{H;$!d;};x;/regex/!d" file.txt |
Печатает абзац только если он содержит regex |
Sed -e "/./{H;$!d;}" -e "x;/RE1/!d;/RE2/!d;/RE3/!d" file.txt |
Печатает абзацы только если они содержат RE1, RE2 и RE3. Порядок RE1, RE2 и RE3 не имеет значения. |
Sed "s/14"/fourteen inches/g" file.txt |
Так вы сможете использовать двойные кавычки |
Sed "s/\/some\/UNIX\/path/\/a\/new\/path/g" file.txt |
Работа с путями Unix |
Sed "s///g" file.txt |
Удаляет все символы, начиная с a и заканчивая g из файла file.txt |
Sed "s/\(.*\)foo/\1bar/" file.txt |
Заменяет только последнее в строке соответствие foo на bar |
Sed "1!G;h;$!d" |
Замена команды tac |
Sed "/\n/!G;s/\(.\)\(.*\n\)/&\2\1/;//D;s/.//" |
Замена команды rev |
Sed 10q file.txt |
Замена команды head |
Sed -e:a -e "$q;N;11,$D;ba" file.txt |
Замена команды tail |
Sed "$!N; /^\(.*\)\n\1$/!P; D" file.txt |
Замена команды uniq |
Sed "$!N; s/^\(.*\)\n\1$/\1/;t; D" file.txt |
Обратная команда (что эквивалентно uniq -d) |
Sed "$!N;$!D" file.txt |
Эквивалент tail -n 2 |
Sed -n "$p" file.txt |
... tail -n 1 (или tail -1) |
Sed "/regexp/!d" file.txt |
Эквивалент grep |
Sed -n "/regexp/{g;1!p;};h" file.txt |
Печатает строку, находящуюся перед первым соответствием регулярному выражению, но не включающую само соответствие |
Sed -n "/regexp/{n;p;}" file.txt |
Печатает строку, находящуюся после первого соответствия регулярному выражению, но не включающую само соответствие |
Sed "/pattern/d" file.txt |
Удаляет строки, соответствующие шаблону pattern |
Sed "/./!d" file.txt |
Удаляет все пустые строки из файла |
Sed "/^$/N;/\n$/N;//D" file.txt |
Сжимает все последовательные пустые строки до двух пустых. Одинарные пустые строки не изменяются. |
Sed -n "/^$/{p;h;};/./{x;/./p;}" file.txt |
Удаляет последнюю строку каждого абзаца |
Получает заголовок письма. Другими словами - удаляет все после первой пустой строки. | |
И я не могу найти хорошо написанные учебники.
Позвольте мне сказать, что я работал с регулярным выражением на других языках (Python, JavaScript, Java), поэтому это не должно быть проблемой.
Итак, вот мои вопросы («теоретические» и более практичные):
регулярные выражения, используемые в sed точно такие же, как те, которые используются Python / JS / Java? Я читал о BRE и EREs, но насколько они различны? Не должно ли ERE быть расширением BRE?
если я хочу, скажем, просто извлечь что-то из выходного канала, что такое синтаксис sed ?
Подробности по второму вопросу: скажем, у меня есть выход uptime с sed:
Uptime | sed ...
Учитывая пример выхода от uptime: 18:13 up 5:12, 2 users, load averages: 0,45 0,37 0,40 , я хочу разобрать единовременное время работы в виде двух разделенных номеров (часы и минуты) , а затем я хочу отобразить их в виде xxhyym (xx – часы, yy минуты).
И чтобы закончить, вот что я сделал бы на Python:
Hh, mm = re.match(r"\s+ up \s+(\d{1,2}):(\d{1,2})").groups() print "%sh%sm" % (hh, mm)
2 Solutions collect form web for “Регулярные команды и команды с командой sed”
Традиционные инструменты unix поддерживают BRE или ERE (базовые или расширенные регулярные выражения). POSIX кодирует оба. Википедия объясняет их. Большинство современных инструментов расширяют ERE, часто с дополнительными функциями, впервые представленными в Perl (который известен как PCRE).
ERE расширяет функциональность BRE, но не расширяет синтаксис. В BRE только символы \[.*^$ Имеют особое значение, а некоторые операторы, такие как группировка \(…\) используют обратную косую черту. В ERE +?|() Также являются специальными, а обратная косая черта, сопровождаемая не-буквенно-цифровым символом, никогда не бывает особенной.
BRE не имеет Python / PCRE \d и \s . Вы можете выразить эти наборы символов с помощью традиционных наборов конструкций и классов символов: \d is [[:digit:]] и \s is [[:space:]] . Обратите внимание на двойные скобки: один для указания набора символов и один для обозначения класса символов; например, «буквы, тире или символы подчеркивания» можно записать [-_[:alpha:]] .
У BRE нет оператора + (некоторые реализации sed поддерживают \+ как расширение синтаксиса BRE); X+ совпадает с XX* . Для групп и совпадений требуется дополнительная обратная косая черта.
Таким образом, BRE эквивалент Python \s+ up \s+(\d{1,2}):(\d{1,2}) является [[:space:]][[:space:]]* up [[:space:]][[:space:]]*\([[:digit:]]\{1,2\}\):\([[:digit:]]\{1,2\}\) . Обратите внимание, что вы слишком много пробегаете: \s+ и пробел означает как минимум два пробельных символа.
Вам нужно будет сопоставить всю строку, так как команда sed переписывает строку. Не существует отдельной команды для записи строки, собранной из сохраненных групп. Исправляя лишние пробелы, аналог вашего фрагмента Python:
Uptime | sed "s/^.*[[:space:]][[:space:]]*up[[:space:]][[:space:]]*\([[:digit:]]\{1,2\}\):\([[:digit:]]\{1,2\}\).*$/\1h\2m/"
В отличие от фрагмента Python, это извлекает первый матч, а не последний матч, но здесь это не имеет значения.
Вывод uptime содержит символы пробела и цифры ASCII, поэтому вы можете упростить регулярное выражение:
Uptime | sed "s/^.* up *\(\{1,2\}\):\(\{1,2\}\).*$/\1h\2m/"
Это будет соответствовать только выходному uptime если машина была меньше 1 дня. Я оставлю соответствующее количество дней в качестве упражнения. (Подсказка: напишите два выражения: sed -es/AS ABOVE/\1h\2m/ -e "s/EXERCISE/\1d\2h\3m/")
Каждый инструмент использует (в основном) собственную библиотеку RE. Даже среди разных версий sed вы найдете здесь различия. Два популярных стандарта – стандартные регулярные выражения POSIX, многие из которых принимают их (по крайней мере, с некоторыми опциями), другой популярный набор – это библиотека регулярного выражения Perl Compatible Regular Expression (PCRE). Но последние немного отличаются от «ванильных» RE …
В твоем случае:
Uptime | sed -e "s/^ \(\):\(\).*$/\1h\2m/"
(Пробовали на Fedora 18, sed-4.2.1-10.fc18.x86_64, GNU sed).
Обновление: что не так с большой документацией на главной странице GNU sed ? Или этот учебник? Информационная документация для GNU sed немного длинная, но полная.
Sed - лёгкий (бинарник весит всего 128 килобайт) и удобный инструмент обработки текста.
В этой статье я приведу несколько простых примеров использования sed и расскажу о его основных возможностях.
Sed получает входной поток данных или файл построчно, редактирует каждую строку согласно правилам, определённым в sed-скрипте, и затем выводит результат. Sed это тьюринг-полный язык программирования.
Формат команды sed
Команда sed имеет формат:
sed [ -n ] [ -e скрипт ] [ -f скрипт-файл ] [ файлы ]Флаг -n
подавляет вывод
-e
- указывает на список инструкций, заданный в командной строке.
-f
- указывает местонахождение файла-скрипта.
Формат команд редактирования
Скриптовый файл состоит из набора команд:
[ адрес [ , адрес ] ] команда [ аргументы ]по одной в каждой строке.
Адреса это либо номера строк, либо специальные символы, либо регулярное выражение:
$
- последняя строка
начало~N
- Каждая N
-я строка, начиная с номера начало
/регулярное_выражение/
- строки, попадающие под регулярное_выражение
Примеры:
- Если адрес не указан, обрабатываются все строки.
- Если указан один адрес - обрабатывается соответствующая строка
- Если указаны два адреса, то выбираются строки в заданном интервале.
- !команда - выполняется команда , для строк, которые небыли выбраны по адресам.
Основные команды
Рассмотрим основные команды:
[адрес] a текст - добавить новую строку с текстом после указанной строки
$ cat sed_test sed_test_1 11111 sed_test_2 22222 sed_test_3 33333 $ sed -e "2 a new_line" sed_test sed_test_1 11111 sed_test_2 22222 new_line sed_test_3 33333
[адрес [, адрес]] c текст - Удаляет выбранные строки и заменяет их на текст
$ sed -e "2 с new_line" sed_test sed_test_1 11111 new_line sed_test_3 33333 $ sed -e "/3/ с new_line" sed_test sed_test_1 11111 sed_test_2 22222 new_line
[адрес [, адрес]] d - Удаляет указанные строки.
$ sed -e "2 d" sed_test sed_test_1 11111 sed_test_3 33333 $ sed -e "2!d" sed_test sed_test_2 22222
[адрес] i текст - Вставить текст на место указанной строки.
$ sed -e "2 i new_line" sed_test sed_test_1 11111 new_text sed_test_2 22222 sed_test_3 33333
[адрес [, адрес]] p (с флагом -n ) выводит найденные строки.
$ sed -ne "2p" sed_test sed_test_2 22222
[адрес] q - выход из sed.
[адрес [, адрес]] r файл - Читает файл и выдает его содержание на выход.
[адрес [, адрес]] s/регулярное_выражение/замена/флаги - Заменяет регулярное_выражение на замена -у с учётом флагов:
- g - во всей строке
- i - без учёта регистра
- p - выводить результат замены
[адрес [, адрес]] y/строка1/строка2/ - Заменяет все вхождения символов в строке1 соответсвующими символами из строки2 . Длины строк должны быть одинаковыми.
$ sed -ne "y/est/EST/g" sed_test SEd_TEST_1 11111 SEd_TEST_2 22222 SEd_TEST_3 33333
[адрес [, адрес]] { команды }
- скобки группируют команды
[адрес] =
- Выдаёт номера строк
Метки
: метка
- сопоставить группе команд метку
b метка
метка
, если метка
отсутствует, то переход в конец командного файла.
t метка - переход к команде, обозначенной меткой метка только после удачной замены с помощью команды s///
Цикл выполнения
sed работает с двумя буферами данных: основным и вспомогательным. Изначально оба буфера пусты.
Работа с этими буферами осуществляется при помощи команд:\\`h’, `H’, `x’, `g’, `G’ `D’ h
- Заменить содержимое вспомогательного буфера содержимым основного
H
- Добавить новую строку к вспомогательному буферу и затем добавить содержимое основного буфера к содержимому вспомогательного
x
- Поменять содержимое обоих буферов местами
g
- Заменить содержимое основного буфера содержимым вспомогательного
G
- Добавить новую строку к основному буферу и затем добавить содержимое вспомогательного буфера к содержимому основного
D
- Удалить текст основного буфера до следующего символа перевода строки
N
- Добавить новую строку к основному буферу, затем добавить туда следующую обрабатываемую строку
P
- Вывести содержимое основного буфера до следующего символа перевода строки.
Более сложные примеры
Следующий скрипт меняет местами строки файла (первые строки становятся последними и наоборот)
$ cat tac.sed #!/usr/bin/sed -nf # начиная со второй строки, содержимое буфера (который уже содержит # все предыдущие строки) добавляется к текущей строке. 1! G # при достижении последней строки - печатаем $ p # Заносим данные в буфер опять h sed -nf tac.sed sed_test sed_test_3 33333 sed_test_2 22222 sed_test_1 11111
Считаем строки файла (выводим номер последней строки)
$ cat count.sed #!/usr/bin/sed -nf $=
результат
$ sed -nf count.sed sed_test 3
Обращение строк
$ cat revers.sed #!/usr/bin/sed -f # пропускаем строки из одной буквы /../! b # Переворачиваем строку. Добавляем по пустой строке перед и после текущей. s/%$@~*!G4;:%#`.*$/\ &\ / # Переносим первый символ в конец # цикл работает пока в средней строке есть символы. tx:x s/\(\\n.\)\(.*\)\(.\\n\)/\\3\\2\\1/ tx #удаляем лишние переносы строк s/\\n//g
Этот скрипт перемещает две буквы за раз.
$ sed -f revers.sed sed_test 11111 1_tset_des 22222 2_tset_des 33333 3_tset_des
Дополнительная информация
Подробнее о формате sed-скриптов можно узнать, прочитав мануал man sed или техническую документацию info sed .