Обновить
4K+
10
Дима Косаревский@dKosarevsky

SDE

0,5
Рейтинг
10
Подписчики
Отправить сообщение

В дополнение к посту по albu-mcp

В доке Albumentations появился отдельный раздел про мой AlbumentationsX MCP - https://albumentations.ai/docs/integrations/mcp/

Теперь есть официальный integration guide, где показано, как ты можешь подключить MCP-сервер к AI-assistant’у и использовать его для нормального HITL workflow вокруг CV-аугментаций: подобрать pipeline, провалидировать его, отрендерить локальные previews, сравнить baseline и candidate, дать feedback вроде too_noisy:high и экспортировать финальный pipeline.

Приятно видеть, что проект стал частью экосистемной документации Albumentations. 🙂

AlbumentationsX MCP это конечно же не замена Python API, а assistant-facing review layer для тех случаев, когда ты хочешь быстрее и безопаснее работать с augmentation pipelines.

Теги:
+3
Комментарии0

Я сделал AlbumentationsX MCP — MCP-сервер для работы с аугментациями в computer vision.

Идея простая: когда ты собираешь augmentation pipeline, не хочется бесконечно вручную перебирать transforms, гадать с параметрами и проверять глазами десятки вариантов. Хотелось, чтобы MCP-host мог помочь: найти подходящие transforms, собрать консервативный baseline, провалидировать pipeline, отрендерить локальные previews, сравнить результаты, собрать feedback вроде too_noisy:high и экспортировать принятый вариант.

Проект работает поверх AlbumentationsX и не пытается делать магию вместо тебя. Он помогает быстрее пройти цикл: recommend → validate → preview → compare → adjust → export.

Особенно полезно, если ты делаешь classification, detection, segmentation, OCR или просто хочешь быстрее проверять качество аугментаций на локальных примерах.

Запуск:

uvx --from albumentationsx-mcp albumentationsx-mcp

Репозиторий: albu-mcp

Теги:
Всего голосов 1: ↑1 и ↓0+3
Комментарии0

Наконец-то поднял публичную демку Aximo на Hugging Face Spaces 🎙️

Это локальный speech-to-text API, который работает на CPU, использует Parakeet v3 и позволяет тестировать транскрибацию прямо из браузера через Swagger UI с записью с микрофона, о котором писал в одном из своих предыдущих постов.

Теги:
Всего голосов 1: ↑0 и ↓1-1
Комментарии0

Aximo — локальный STT API на Rust для CPU-only inference

Недавно сделал Aximo — self-hosted микросервис для speech-to-text, который можно запускать локально без облака и без зависимости от внешних SaaS.

Идея была довольно простая: хотелось собрать вменяемый STT API, который работает на CPU, поднимается как обычный сервис и при этом остается достаточно прозрачным с инженерной точки зрения.

В основе — Rust, локальный inference через Parakeet v3, HTTP API для обычной транскрибации и WebSocket-слой для realtime-сценариев. Из коробки также добавил Docker, OpenAPI и разбиение на несколько crates, чтобы проект не выглядел одноразовой демкой и оставался удобным для дальнейшего развития.

На текущем этапе это скорее крепкий MVP, чем законченный production-ready продукт, но уже сейчас сервис можно запускать локально, тестировать на своих аудиоданных и использовать как основу для дальнейших экспериментов.

Из интересного: доработал Swagger, добавив возможность отправки записи с микрофона:

Репозиторий проекта: https://github.com/agent-axiom/aximo

Звёзды приветствую

Теги:
Всего голосов 2: ↑2 и ↓0+3
Комментарии0

Всем привет. Начал писать открытую книгу про архитектуру безопасных AI-агентов.

Делаю не обзор фреймворков и не коллекцию «магических демо», а практический инженерный reference: control plane, policy boundaries, tool gateway, memory, observability, evals, approval flows, governance и production-подход к агентным системам.

Уже выложил первые главы и каркас книги - https://agent-axiom.github.io/agent-arch

Репозиторий - https://github.com/agent-axiom/agent-arch

Буду очень рад критике по существу:

  • где архитектура спорная,

  • где не хватает важных разделов,

  • где формулировки слишком сырые,

  • что стоит добавить из практики эксплуатации и безопасности.

Если тема близка - вливайся: issues, comments, corrections, PRs, ссылки на сильные источники и контрпримеры из реальных production-систем.

Хочется сделать не просто набор заметок, а полезный community-driven reference для тех, кто строит надежных и безопасных AI-агентов.

Теги:
Всего голосов 6: ↑6 и ↓0+9
Комментарии0

Открываем новые возможности с ChatGPT и инженерией запросов

Всем привет! В этом посте хочется поделиться уникальным курсом от Исы Фулфорд (OpenAI) и Эндрю Ына (DeepLearning.AI) под названием "ChatGPT Prompt Engineering for Developers".

На этом курсе можно окунутся в удивительный мир больших языковых моделей (LLM) и узнать, как быстро создавать новые полезные приложения с их помощью. Благодаря API OpenAI можно научиться:

  • Кратко излагать (например, суммаризировать отзывы пользователей)

  • Извлекать информацию (например, классификация по настроению, извлечение тем)

  • Трансформировать текст (перевод, исправление орфографии и грамматики)

  • Расширять (например, автоматическое написание электронных писем)

Курс также затрагивает два ключевых принципа создания эффективных запросов, способы систематической разработки хороших запросов и создания собственного чат-бота. Про создание собственного чат-бота писал ранее в этом туториале.

Чтобы закрепить полученные знания, на курсе предоставляются наглядные примеры, с которыми можно поработать прямо в среде Jupyter notebook.

Курс подходит для начинающих. Для участия требуется лишь базовое знание Python. Однако этот курс также подойдет для опытных инженеров машинного обучения, стремящихся изучить передовые методы использования моделей LLM.

Не упустите свой шанс обучиться этому захватывающему направлению и выполнять разнообразные задачи с помощью умений инженерии запросов. Успехов! ?

Всего голосов 3: ↑3 и ↓0+3
Комментарии1

Всем привет!

В этом туториале писал о том, как собрать свою обëртку для ChatGPT, используя Streamlit и API OpenAI.

Рассказываю, что случилось нового ?
Добавлен функционал для подсчёта токенов, стоимости сообщения и беседы. Реализовано с помощью функции:

import streamlit as st


def calc_cost(usage: dict) -> None:
    total_tokens = usage.get("total_tokens")
    prompt_tokens = usage.get("prompt_tokens")
    completion_tokens = usage.get("completion_tokens")
    st.session_state.total_tokens.append(total_tokens)
    # pricing logic: https://openai.com/pricing#language-models
    if st.session_state.model == "gpt-3.5-turbo":
        cost = total_tokens * 0.002 / 1000
    else:
        cost = (prompt_tokens * 0.03 + completion_tokens * 0.06) / 1000
    st.session_state.costs.append(cost)

Проверить работу нового функционала можно на сайте AI Talks. Репозиторий с кодом ожидающий ваших issue, pr и звёзд ⭐
Успехов! ?

Всего голосов 14: ↑14 и ↓0+14
Комментарии0

Информация

В рейтинге
2 426-й
Откуда
Россия
Зарегистрирован
Активность

Специализация

Бэкенд разработчик, DE
Средний
Git
SQL
Python
Linux
PostgreSQL
Docker
Kubernetes
Базы данных
ООП
Django