Depository of News

От парсинга постов к сбору данных: что на самом деле можно достать из Telegram

newsdepo.com · world

<img src="https://habrastorage.org/getpro/habr/upload_files/325/c9b/1cd/325c9b1cdced44949f4913fb71db4a1e.png" /><p>Я бы сделал начало более естественным и менее похожим на презентацию продукта. Например:</p><p>В прошлой статье я разбирал, как с помощью Python и Telethon автоматизировать сбор публикаций из Telegram-каналов. Тогда мы фактически решали задачу первого уровня: получили сообщения, забрали текст и сохранили результат.</p><p>На практике довольно быстро выясняется, что у Telegram-публикации есть гораздо больше интересных данных, чем просто текст.</p><p>У сообщения есть источник, время публикации, просмотры, реакции, комментарии, медиафайлы и другие связанные данные. Если собирать информацию сразу из нескольких каналов, всё это уже хочется не просто выгрузить в таблицу, а нормально связать между собой.</p><p>Например, один и тот же пользователь может встречаться сразу в нескольких чатах, а один пост может иметь десятки комментариев и несколько типов реакций. При обычном экспорте такие связи быстро теряются.</p><p>Поэтому после первой версии парсера я решил пойти немного дальше и посмотреть, что получится, если относиться к Telegram не как к источнику отдельных сообщений, а как к набору связанных данных.</p><p>В этой статье покажу, как я организовал такой сбор, какие данные можно получить из публикаций и что с ними можно делать после парсинга.</p> <a href="https://habr.com/ru/articles/1076966/?utm_source=habrahabr&amp;utm_medium=rss&amp;utm_campaign=1076966#habracut">Читать далее</a>

Read full article →