Привет-привет!
Оказалось, пока я вайб-кодю интернет-магазины, пропускаю много критически важной информации по нейросетям. Появляются новые инструменты, которыми я не пользуюсь. Запускаются новые модели, о которых я не знаю. Кто-то из ключевых участников индустрии высказывает своё мнение о ближайшем будущем, после которого возникает мысль «Блин, он же прав! Я планирую и реализую то, что заведомо не будет востребованным или опять изобретаю уже существующий велосипед». В общем, нужно как-то наловчиться получать самую свежую информацию из первоисточников, чтоб не быть догоняющим, а раньше других осознавать, куда мы все идём со стремительно развивающимся искусственным интеллектом. Кроме того, уже созданным мной сайтам нужен качественный контент, чтоб получить свою дольку поискового трафика, пока он ещё есть.
Так, за последние пару недель я создал сайт interpreter.ru, который просматривает несколько десятков источников, в основном, на английском и китайском языках. Поскольку многие из сайтов, которые я называю «первоисточниками» на самом деле являются новостными лентами, то часто в своих материалах они рассказывают об одном и том же. Соответственно, первая задача — не брать копии, появившиеся на разных ресурсах. Я, конечно, и раньше знал, что можно сравнивать статьи и оценивать долю общего между ними, но не знал, как именно это делается. Сейчас знаю. Существуют специальные модели эмбеддинга, которые строят смысловые векторы. И сравниваются именно эти векторы. То есть, если в разных источниках, допустим, на французском и китайском языках речь идет о чем-то одном, к себе я добавлю этот материал только один раз. Возможно, вообще не добавлю. После того, как я нашел и скачал новую статью и определил, что она оригинальная, стоит её оценить. Для этого я прошу другую модель по определенным мной критериям поставить рейтинг статье от 1 до 10. Если это что-то глобально значимое и прорывное, рейтинг должен быть высоким, а если где-то Вася Пупкин почесался, рейтинг должен быть ниже плинтуса. Информация о материалах с рейтингом ниже 6 запоминается в базе знаний с векторами, но сами посты не сохраняются. С сохраненными статьями работаем дальше…
Хоть на английском я довольно свободно читаю, на родном я читаю быстрее и охотнее, а китайского вообще не знаю. Потому следующий этап — перевод статьи на русский язык. При этом переводить дословно и близко к тексту явно не стоит. Часто в источниках одни и те же факты пересказываются по три раза, чтоб статья получилась объёмней. Мне такое не нужно. Также часто в текстах присутствуют какие-то человеческие восторги, очень частные мнения и другая «вода». Моя же цель — получить наиболее краткую выжимку самого главного. Потому задействуем ещё одну модель, которая безжалостно выбрасывает всё «лишнее», оставляя только суть и структурирует факты. Само написание статьи — процесс ресурсозатратный и чтоб не снижать качество рерайта, все остальные процессы (то есть, выделение тегов, определение категории, написание заголовков для сайтов и уведомительных постов для мессенджеров) делаются отдельным этапом и отдельной моделью.
По итогу у меня остаётся оригинальная хорошо структурированная статья на русском языке с полной мета-информацией (это теги, категория, заголовки, рейтинг, источник, дата публикации и сайт назначения, куда я её в итоге перенаправлю). Частично статьи автоматически уходят на другие мои сайты, частично остаются на interpreter.ru. Кроме того, сделал админку, где можно покопаться в самом процессе. Что отсеивается и по каким причинам, что остаётся и правильно ли расставляются акценты и рейтинги. Какие источники особенно полезны. Какие нестабильны или просто редко публикуют что-то действительно дельное… В админке же можно заказать отдельную генерацию картинки. Потенциально можно сделать заказ видео, глубокое исследование темы и рерайт статьи более мощной моделью, а также подготовку материала к публикации в соцсетях. Автоматически в соцсети вываливать всё найденное, конечно, не буду, но самыми интересными из находок охотно поделюсь.
Сайт написан нейросетями, статьи находятся, оцениваются и переводятся нейросетями. Источники найдены нейросетями. Пока их несколько десятков, но это буквально первые попавшиеся. После доводки сайта их наверняка будут сотни. Возможно, сделаю автоматический поиск новых источников и их отсев, а также сбор новых статей в формат аудиокниги, чтоб начитывались мне в ухо, пока на велосипеде катаюсь. Все же у меня сейчас лето.
Спасибо, что были сегодня со мной. Если у вас есть идеи по развитию нового сайта или вам нужно что-то подобное, пожалуйста, пишите.
Пока-пока!
Комментарии (0)