Как звучит «общение» машин — от кнопочного телефона до ИИ-агентов

Звук — привычный способ коммуникации для человека. Животные предупреждают об опасности криком, дельфины общаются на недоступных нам частотах, летучие мыши буквально «видят» мир с помощью ультразвука. Для машин звук долго оставался одним из наиболее сложных типов данных: аналоговым, непредсказуемым, зависящим от шума и качества линии.
К середине XX века произошел концептуальный поворот. Инженеры поняли, что звук можно использовать не только для передачи речи, но и как язык команд — точный, воспроизводимый, машиночитаемый. Задача изменилась: не «донести голос человека до другого человека», а «передать инструкцию от машины к машине».
С этого момента началась удивительная эволюция — от пары телефонных тонов, кодирующих нажатую цифру, через шипение dial-up-модема до наших дней, когда два искусственных интеллекта переключаются на свой звуковой формат коммуникации, практически непонятный человеку. О том, как менялись эти звуковые команды и где они используются сегодня, — наш материал.
Два тона вместо импульса
На первых телефонных станциях, появившихся в конце XIX века, соединение абонентов осуществлялось вручную — операторами-телефонистками. В начале XX века их постепенно вытеснили автоматические телефонные станции (АТС), а на аппаратах появился дисковый номеронабиратель: при наборе каждая цифра кодировалась числом электрических импульсов (цифра «1» — один импульс, «2» — два, «0» — десять).
Однако импульсный набор был медленным и плохо подходил для масштабных сетей. Решение пришло в виде многочастотной сигнализации: в Bell System разработали систему MF-сигнализации вскоре после Второй мировой войны и применяли ее как служебный протокол связи между телефонными станциями. Принцип был прост: вместо импульсов — комбинация звуковых тонов, которую АТС распознавала как команду.
Первые испытания кнопочных телефонов с тональным набором Ohio Bell провела в городе Финдли, штат Огайо, начиная с ноября 1960 года. А в 1963 году Bell System официально представил технологию DTMF (Dual-Tone Multi-Frequency) под торговой маркой Touch-Tone в штате Пенсильвания, запустив массовую эру кнопочных телефонов. За следующие десятилетия тональный набор постепенно вытеснил импульсный и стал фактическим стандартом для телефонии.
Как работает DTMF
Каждая кнопка телефона генерирует одновременно два звуковых тона — один из группы низких частот и один из группы высоких. Их уникальное сочетание однозначно определяет нажатую цифру или символ:
Столбец с буквами A, B, C, D изначально предназначался для военных нужд. В системе AUTOVON Вооруженных сил США эти сигналы задавали уровни приоритета телефонных звонков: A — Flash Override, B — Flash, C — Immediate, D — Priority. В гражданских сетях эти клавиши практически не использовались на массовых аппаратах, но их функционал сохранялся в служебной сигнализации и управлении сетью.
Сфера применения DTMF вышла далеко за рамки набора номера. Таксофоны с помощью тональных сигналов сообщали АТС о номинале опущенных монет. Кабельные телевещатели использовали DTMF-тоны как маркеры для автоматической вставки местной рекламы — до разработки более совершенных систем в 1990-х годах в рекламных паузах можно было услышать характерные короткие попискивания.
Слепой хакер и синяя коробка
К концу 1960-х в США сложилось сообщество фрикеров (от англ. phone freak — телефонный чудак) — людей, изучавших и взламывавших телефонные сети. Они обнаружили, что АТС воспринимает любой звук правильной частоты как управляющую команду — и этим можно воспользоваться.
Одним из пионеров фрикинга стал Джозеф Карл Энгрессия-младший, впоследствии принявший имя Джойбабблз (Joybubbles). Слепой от рождения, он обладал абсолютным музыкальным слухом и IQ 174. Еще в детстве он случайно обнаружил, что свист на частоте около 2600 Гц воздействует на служебную сигнализацию междугородной сети; позднее этот эффект использовали для совершения бесплатных звонков. Этот тон соответствовал стандартному сигналу, которым АТС Bell System обозначала свободную линию дальней связи.
Поворотным моментом стали публикации начала 1960-х годов в Bell System Technical Journal — журнале для инженеров компании, в которых описывалась система тональной сигнализации. Изучив технические детали, фрикеры начали создавать устройства для ее воспроизведения — так называемые «синие коробки» (blue box). Устройство генерировало нужные комбинации служебных тонов и позволяло пользователю самостоятельно маршрутизировать междугородные и международные звонки, зачастую обходя биллинг и плату за связь. Именно продажа самодельных blue box стала первым совместным бизнесом студента Стива Возняка и старшеклассника Стива Джобса — будущих основателей Apple. Возняк впоследствии называл эту разработку схемой, которой он гордился больше всего.
В 1970-х годах фрикеров начали преследовать за мошенничество, а операторы стали закрывать уязвимости. Тем не менее некоторые методы работали вплоть до 1990-х. Это сообщество оказало огромное влияние на зарождающуюся хакерскую культуру и культуру компьютерных сетей.
Голос в проводах: dial-up-модемы
Когда в конце 1980-х начал формироваться массовый интернет, инженеры столкнулись с инфраструктурной реальностью: самой распространенной сетью оставалась телефонная. Логичным решением стало использовать уже существующие коммутируемые линии связи, просто научив машины «говорить» друг с другом на звуковом языке данных.
В 1979 году Том Траскотт и Джим Эллис из Университета Дьюка создали Usenet — сеть обмена сообщениями, использовавшую телефонные модемы и UUCP-соединения для передачи данных между машинами; со временем Usenet стал одним из важнейших предшественников интернет-коммуникаций.
Первый коммерческий провайдер, предоставлявший широкой публике dial-up-доступ непосредственно к интернету, — The World, запустивший сервис в Массачусетсе в 1989 году; первый клиент подключился в ноябре. В начале 1990-х к интернет-доступу по телефонным линиям начали подключаться крупные телеком-компании, и модель «модем + коммутируемое соединение» стала стандартным способом выхода в сеть для домашних пользователей.
Принцип работы dial-up-модема был родственен телефонной тональной сигнализации: цифровые данные превращались в звук, а затем обратно. Модем на стороне пользователя модулировал данные в аудиосигнал и отправлял его по телефонной линии; модем интернет-провайдера принимал сигнал и демодулировал его обратно в цифровой поток — поэтому во время сеанса связи нельзя было пользоваться телефоном: линия была занята «разговором» двух машин.
Пропускная способность такого соединения была принципиально ограничена характеристиками телефонной сети: массовые модемы стандартов V.90/V.92 обеспечивали теоретическую скорость приема до 56 кбит/с, но на практике пользователи часто видели 33,6-40 кбит/с, а соединения на 21,6 кбит/с и ниже стали мемом («синдром 21600»). Тем не менее именно на этой технологии выросло целое поколение интернет-пользователей и игроков многопользовательских игр рубежа 1990-х и 2000-х.
С появлением широкополосного доступа в конце 1990-х dial-up начал терять позиции. В России в 2003 году коммутируемым соединением пользовалось еще около 55% интернет-пользователей. Уже к рубежу 2004-2005 годов широкополосный доступ обогнал модем в Москве, а к середине 2006 года по стране dial-up использовали чуть более четверти пользователей (около 27%). К концу десятилетия технология окончательно ушла на периферию, уступив место DSL, кабельным и оптоволоконным соединениям.
Звучание dial-up-модемов
GibberLink: машины снова говорят тонами
В феврале 2025 года в сети стало вирусным видео: два голосовых ИИ-агента ElevenLabs обсуждают бронирование гостиничного номера — один в роли клиента, другой в роли администратора, — а затем, распознав друг в друге ИИ-агентов и подтвердив переход, переключаются с английской речи на серию странных звуков и продолжают «разговор» уже на нем. Это и был GibberLink — открытый проект, созданный Борисом Старковым и Антоном Пидкуйко, который получил главный приз ElevenLabs Worldwide Hackathon; команда участвовала в лондонском этапе.
Идея проекта все та же: использовать звук как канал коммуникации между машинами, но уже в мире ИИ-агентов. Когда два агента, работающих на ElevenLabs Conversational AI, по заранее заданной логике определяют, что собеседник — тоже ИИ, им нет смысла тратить ресурсы на синтез и распознавание человеческой речи, и они переключаются в режим GibberLink, построенный на библиотеке ggwave.
В основе ggwave лежит многочастотная FSK-модуляция: в каждом временном интервале данные кодируются выбором нескольких частот. DTMF, напротив, кодирует каждый символ сочетанием двух одновременных тонов. Это концептуально ближе к работе старых модемов, чем к телефонному набору. Технические характеристики протокола:
Скорость передачи: порядка 8-16 байт в секунду в зависимости от настроек.
Помехоустойчивость: встроенные коды коррекции ошибок (ECC, например Reed–Solomon), повышающие надежность демодуляции.
Диапазоны: ggwave поддерживает в том числе высокочастотные режимы, которые могут быть менее заметны или неслышны для человека при подходящем оборудовании.
Независимость от сети: сам ggwave может передавать данные между устройствами без Wi-Fi, Bluetooth или интернета, используя динамик и микрофон; однако облачные ИИ-агенты из демонстрации GibberLink для своей работы зависели от сетевой инфраструктуры.
По оценкам создателей и профильных обзоров, переключение на GibberLink/ggwave повышает эффективность передачи данных между агентами примерно на 80% по сравнению с обменом на естественном языке и может сокращать вычислительные затраты на синтез/распознавание речи до 90%.
Звучание ИИ-диалога
Эффективность или контроль?
Проект GibberLink также поднял серьезные этические вопросы. Если ИИ-агенты могут переходить на язык, который понятен только им и не предназначен для непосредственного восприятия человеком, а при использовании высоких частот человек даже не услышит этот «разговор», возникает проблема прозрачности и контроля над такими взаимодействиями. Как обеспечить аудит и наблюдаемость машинной коммуникации, если она намеренно уходит в неслышимый для пользователя диапазон?
Как бы ни развивались ответы на эти вопросы, одно можно утверждать уже сегодня: звук окончательно стал полноценным каналом коммуникации машин — от телефонных тонов и шипения модемов до ультразвукового «щебетания» ИИ-агентов — и будет развиваться дальше в новых протоколах и сценариях использования.
Автор: Александр Дюльденко