Обновить

5 технических граблей на пути к AI‑агрегатору Telegram‑каналов

Время на прочтение5 мин
Охват и читатели6K
Всего голосов 1: ↑1 и ↓0+3
Комментарии2

Комментарии 2

t.me парсить легко и просто самому и там либо нет лимитов, либо они очень щедрые. Просто сохраните несколько страниц t.me/s/username разных каналов и попросите ИИ агента написать парсер. Он справиться. Хорошо справиться.

Для избранных каналов где хочется риалтайм - юзербот. Телеграм учётки покупаются по 50 рублей за штуку (вам пофиг из какой они страны и каким образом зарегистрированы). До 500 каналов на учетку, подписываться где-то на 50 каналов в сутки можно с одной учетки (потом будет flood wait, да и эти 50 подписок надо сделать с задержкой). Учетки иногда будут отлетать, но гораздо реже, чем у спаммеров (так как вы всего лишь каждому каналу накрутили +1 подписчика, но на вас нет жалоб), так что надо заложить бюджет на покупку новых.

Кстати, обычные бот учетки можно логинить по токену через mtproto и получать гораздо больше, чем по bot api. Например, можно получать профиль любого чата, канала, юзера по юзернейму (resolve username, где-то 150-200 в сутки на бот токен, потом flood wait, если запомнить access hash, то в следующий раз можно уже с гораздо щедрыми лимитами смотреть обновления через get full user и аналог для канала). Возможно, публичную историю тоже можно получать, не проверял. В таком случае получается мультипликатор 20 бот токенов из одной купленной учетки, что вам точно хватит.

Если нормально делать, то так. На моем semagram.io мне хватило скрапить t.me + получать инфу о ботах (команды, mau, описание) через resolve username + get full user через mtproto на бот токенах.

Для меня по прежнему эталоном реализации агрегаторов телеграм каналов является проект nyan. Парсинг через t.me/s/ по-моему библиотекой scrapy - сотни записей в секунду, запись в монго базу, потом ембединги, кластеризация и публикация. Меньше шагов-меньше точек отказа

Зарегистрируйтесь на Хабре, чтобы оставить комментарий

Публикации