Новостной медиаробот: теоретические аспекты интеллектуальной системы генерации контента
Замков Андрей Владимирович
Научный сотрудник
Проблемная научно-исследовательская лаборатория комплексного изучения актуальных проблем журналистики, факультет журналистики, Московский государственный университет им. М.В. Ломоносова, Российская Федерация, г Москва,
Аннотация
В статье обсуждается новый феномен цифровой медиасферы -- новостные медиароботы, способные создавать текстовый контент на технологической платформе интеллектуальных систем. Рассматриваются междисциплинарные подходы к пониманию этого феномена с привлечением теоретических положений и примеров из области искусственного интеллекта, инженерии знаний и технологий естественного языка. В качестве рабочей гипотезы о природе интеллектуальных систем медиароботов формулируется утверждение, что они являются вычислительными моделями, которые имитируют специфические функции естественного интеллекта человека. Феномен имитации как присущая социальным и техническим системам общая способность к самообучению по образцу, расценивается в качестве ключевого механизма адаптации медиароботов к социальной среде. Для иллюстрации функционирования интеллектуальной системы медиаробота приводится кейс генерации новостного контента в контексте теории фреймов -- междисциплинарного формализма для представления образцов знаний и стереотипов социального поведения. Как возможный эталон для сравнения интеллектуальной системы робота с естественным интеллектом человека рассматривается структура общего интеллекта по Кэттелу -- Хорну. Отмечается её частичное сходство со структурой «интеллекта» медиаробота. В качестве наиболее перспективного средства расширения вербального интеллекта медиаробота выделяется технология моделирования естественного языка. В заключении делается вывод о существовании конвергентных тенденций между методами инженерии знаний и аналитической журналистики. Утверждается, что для дальнейшего прогресса в создании медиароботов нового поколения, главными чертами которых должны стать способность к самообучению и «чувство»социальной ответственности, необходимы совместные усилия в области междисциплинарных исследований цифровых медиа, искусственного интеллекта и когнитологии.
Ключевые слова. Медиаробот, интеллектуальная система, искусственный интеллект, база знаний, инженерия знаний, теория фреймов, технология естественного языка.
Andrey V. Zamkov
Research fellow
Laboratory for Complex Media and Journalism Studies,
Faculty of Journalism, Lomonosov Moscow State University,Moscow, Russian Federation медиаробот интеллектуальный естественный язык
NEWS MEDIA ROBOT: THEORETICAL ASPECTS OF INTELLECTUAL SYSTEM FOR CONTENT GENERATION
Abstract. The article discusses a new phenomenon of digital media sphere, i.e. news media robots, which are capable of creating content on a technological platform of intellectual systems. Interdisciplinary approaches to understanding this phenomenon, which attract theoretical concepts and cases from artificial intelligence, knowledge engineering and natural language technologies are considered. It is stated, that in the core of intellectual systems lie computational models of natural human intelligence and knowledge. The phenomenon of imitation as a characteristic of social and technical systems general ability to self-study relying on a sample is viewed as a key mechanism media robots adaptation to social environment. The case study of generating news content within the context of frames theory is provided as an illustration of universal formalism for representation of knowledge and social actions. The structure of general human intelligence, provided by Cattell -- Horn theory, is considered as a possible reference model for comparison of a robotic intellectual system with natural human intelligence. The similarity between a general intelligence structure and an “intellectual” structure of a media robot is noted. The article defines the technology of modelling a natural language as the most prospective means of broadening the verbal intellect of a media robot. It is stated in conclusion, that one can observe trends for convergence in the methodology of knowledge engineering and analytical journalism. In a long-term perspective serious progress in creating new generation of media robots requires reproduction of such human abilities, as learning and “sense” of social responsibility. For this reason joint efforts in interdisciplinary studies in digital media, artificial intelligence and cognitive sciences are required.
Keywords. Media robot, intellectual system, artificial intelligence, knowledge base, knowledge engineering, frames theory, natural language technology.
Проблема и актуальность вопроса
Цифровые трансформации СМИ в настоящее время преодолевают очередной технологический рубеж, который в числе других особенностей характеризуется переходом от «ручного» способа производства контента к его частичной замене медиароботами роботизированными системами, управляемыми с помощью технологий искусственного интеллекта. Уточним, что под словом «интеллект» в данном контексте понимается всего лишь способность к имитации разумных форм речевой деятельности машиной, а отнюдь не её, машины, антропоморфное качество.
Так как машинное создание текстов новостей с помощью технологий искусственного интеллекта становится одним из успешных опытов, сначала экспериментальной,а затем и коммерческой роботизации медиа, понимание внутренних механизмов этого явления требует серьезного теоретического осмысления.
В этой статье интеллектуальная система (ИС) медиаробота рассматривается с точки зрения его участия в ключевой фазе медиапроизводства, а именно генерации текстового контента. Автор использует междисциплинарный подход с привлечением теоретических положений и примеров из области искусственного интеллекта и инженерии знаний. В сопряжении с концепцией представления знаний как фреймов и технологий естественного языка такое видение применяемых в медиа роботизированных систем дает исследователям объемное теоретическое представление об этом мало исследованном феномене.
Краткий обзор подходов и терминологии
Рассматриваемые в данной статье медиароботы относятся к категории интеллектуальных систем (ИС) узкого назначения, которые основаны на знаниях вербального опыта повседневной жизни. Их функция состоит в языковом анализе и генерации контента, отражающего динамику стереотипных ситуаций.
Типичными примерами такого контента являются сводки финансовых, спортивных новостей, хроники криминальных событий и т.п.
Интеллектуальная система -- это, как правило, конечный продукт междисциплинарных исследований и разработок в области искусственногоинтеллекта (ИИ). Наряду с интеллектуальными системами широко используется эквивалентный термин «система искусственного интеллекта», например, система общения с машиной на естественном языке в интерактивном режиме [1; 2]. Исследования фундаментальных предпосылок современных систем искусственного интеллекта берут начало в трудах классиков теории автоматического регулирования [3]. Именно они заложили физико-математические основы общей теории саморегуляции. Главным событием, которое инициировало прикладные проекты в этой новой междисциплинарной области, стало Предложение Дартмутской конференции 1956 года по исследованию искусственного интеллекта. Его подготовила инициативная группа учёных и инженеров во главе с профессором Стэнфордского университета Джоном Маккарти (США) [4]. Конструирование коммерческих интеллектуальных систем обязано своими достижениями, в первую очередь, прогрессу в математической части теории и методологии программирования. Эта динамичная область исследований и разработок во многом опирается на данные смежных дисциплин -- психологии, лингвистики, эпистемологии и др., поэтому дать законченное определение её объекту даже с позиций системного подхода затруднительно. Среди наиболее известных попыток найти такое определение можно выделить теоретический и прагматический_подходы.
Хрестоматийным примером теоретического подхода служит определение искусственного интеллекта как синтетической дисциплины, которая исследует закономерности, лежащие в основе разумного поведения. Роль инструмента исследований здесь играют вычислительные модели принятия решений естественным интеллектом человека [5]. Благодаря прогрессу в области технологии цифрового моделирования этот класс моделей расширяется особенно быстро [6].
Прагматический подход к определению искусственного интеллекта появился в связи с освоением рынком новых технологических решений. Так, например, глоссарий исследовательской компании Gartner(США), предлагающей консалтинговые услуги в области анализа и прогнозирования трендов информационных технологий, определяет искусственный интеллект на основе цели его создания. «Искусственный интеллект -- это технология, которая призвана эмулировать базовые человеческие способности к обучению, умозаключениям, пониманию сложного контента, который возникает в естественных диалогах между людьми, усиливать когнитивные способности (т.е. производить так называемые когнитивные вычисления) или замещать людей при выполнении некреативных задач» IT Glossary, Gartner Inc., 2018. URL: https://www.gartner.com/it-glossary.
Следует отметить, что в русскоязычной литературе по проблемам искусственного интеллекта существует возникшее из-за неточности перевода английского словосочетания «artificialintelligence» более претенциозный термин «искусственный интеллект» English Oxford Living Dictionary, 2018. URL: https://en.oxforddictionaries.com/definiti- on/intelligence. Исходный термин подразумевает «искусственную интеллигентность», а не «интеллект», т.е. не ментальную способность, а свойство машины работать со знаниями, имитируя объективное понимание и рассуждения. С этой ошибкой связано, в частности, возникновение завышенных ожиданий в отношении уровня зрелости технологий искусственного интеллекта.
Теоретическая база и рабочая гипотеза
Новостной медиаробот -- это интеллектуальная система, которая предназначена для автоматизации ключевой фазы цикла медиапроизводства -- производства и презентации контента.
В терминах ИС контент -- это, прежде всего, разновидность социальных знаний, а сама система воспроизводит с различной степенью точности те или иные когнитивные функции человека.
Хотя некоторые системы успешно имитируют и устную речь, в этой статье обсуждается принцип действия роботов, производящих письменные сообщения (тексты).
По характеру решаемых ИС задач их можно разделить на два широких класса -- это системы, решающие задачи анализа, и системы, решающие задачи синтеза. Относящиеся к первому классу системы настроены, соответственно, на понимание текста, а системы второго класса -- это генераторы текста. Реальные медиароботы, разумеется, сочетают в себе функции обоих типов, как первого -- анализа, так и второго типа -- синтеза.
С целью придания большей выразительности презентации медийные роботы нередко наделяются чертами антропоморфных персонажей. ИС робота может быть реализована как чисто программно, так и аппаратно. В первом случае ИС называют ботом или агентом, во втором -- роботом. Антропоморфных роботов-андроидов используют в роли виртуальных блогеров и даже телеведущих, имитирующих речь и мимику человека. Типичным примером андроида может служить новостной робот китайского агентства Синьхуа World's first AI news anchor makes “his” China debut // XINHUANET. URL: http://www.xinhuanet.com/english/2018- 11/08/c_137591813.htm.. В качестве примера бота можно указать голосового помощника Алиса от компании Яндекс Яндекс. URL: https://alice.yandex.ru.
Цикл функционирования медиаробота как интеллектуальной системы объединяет два последовательных этапа -- накопление знаний (обучение системы) и генерацию потока новостей. Этап накопления (обучения) состоит из серии процедур человеко-машинного общения, например, формирования словарей, тезаурусов и других источников знаний, которые послужат для генерации контента. Хотя не прекращаются попытки придать этим процедурам форму свободного диалога с машиной, едва ли удастся автоматизировать обучение полностью в обозримом будущем. Напротив, процесс генерации новостей протекает почти полностью алгоритмически, т.е. в автономном режиме.
В настоящее время достичь автономного воспроизведения специфичных для работы журналиста интеллектуальных функций (чтения, анализа, создания текста и др.) удалось ценой отказа от создания универсальной интеллектуальной системы, работающей в широкой предметной области. Сегодня архитектуру интеллектуальной системы медиаробота определяют два элемента. Это так называемый лингвистический процессор (оболочка) языковой обработки знаний и база знаний (БЗ). Именно процессор обеспечивает алгоритмическую переработку информации в системе, а БЗ служит её онтологическим ядром. БЗ новостных роботов обычно строятся на узкоспециализированных темах (например, финансы, спорт, погода и др).
База знаний в некотором смысле оказалась переходным средством представления знаний, выраженных формально в виде набора понятных машине символов. База знаний занимает промежуточное место между таким архаическим средством репрезентации как картотека и компьютерная лингвистическая онтология [7]. База знаний медиаробота -- это электронный каталог лингвистических и экстралингвисти- ческих знаний. Первые несут сведения о правилах языка, а вторые -- о смысловых связях сущностей, в том числе в контексте конкретной темы (финансы, спорт и т.д.).
Прототипами баз знаний являются проекты создания идеографических словарей (тезаурусов) общего языка науки, его основы были заложены ещё в работах Лейбница.
Одна из первых версий такого словаря -- «Тезаурус Роже» -- была опубликована только в середине XIX века. Она включает описание тысячи смысловых категорий логической модели мира и позволяет проследить системообразующие связи между общим и частным, целым и частью и т.п. Электронная версия этого англоязычного тезауруса по- прежнему актуальна и доступна онлайн [8]. Сравнительно недавно был опубликован русскоязычный аналог «Тезауруса Роже» -- первый выпуск идеографического словаря русского языка [9].
База знаний новостного робота, разумеется, не обладает такой полнотой описания сущностей, как упомянутые тезаурусы. Она ориентирована не столько на научную лексику, сколько на словари и языковые правила стереотипов общения -- синтаксис, семантику и прагматику ситуационного контекста по избранной узкоспециализированной теме. Такая база знаний хранится в памяти интеллектуальной системы на внутреннем языке машины. Следует отметить, что система может включать несколько версий баз знаний, настроенных на разные национальные языки и темы новостей.
В обыденном сознании человека новостной дискурс представлен неупорядоченным набором эпизодических знаний. Они выражают множество размытых взаимосвязей между событиями, фактами и закономерностями проблемных ситуаций (политических, экономических, спортивных, этнических и т.д.), которые складываются спонтанно. Содержанием же «знаний системы» является экспертный опыт, полученный в результате профессиональной деятельности специалистов (журналистов, аналитиков, редакторов и др.).