This media is not supported in your browser
VIEW IN TELEGRAM
🔥 Face Anything - восстановление 4D-лица из любой последовательности изображений
На ECCV 2026 представили Face Anything - unified feed-forward модель для высокоточного 4D face reconstruction и плотного трекинга лица.
Ключевая идея - canonical facial point prediction: каждому пикселю назначается нормализованная координата лица в общем каноническом пространстве.
Это позволяет объединить dense tracking и динамическую реконструкцию в одну задачу и получать:
* стабильную геометрию между кадрами
* точные соответствия facial points
* 4D-реконструкцию из произвольной последовательности изображений
Код:
https://github.com/kocasariumut/FaceAnything
На ECCV 2026 представили Face Anything - unified feed-forward модель для высокоточного 4D face reconstruction и плотного трекинга лица.
Ключевая идея - canonical facial point prediction: каждому пикселю назначается нормализованная координата лица в общем каноническом пространстве.
Это позволяет объединить dense tracking и динамическую реконструкцию в одну задачу и получать:
* стабильную геометрию между кадрами
* точные соответствия facial points
* 4D-реконструкцию из произвольной последовательности изображений
Код:
https://github.com/kocasariumut/FaceAnything
🔥12❤3🎉2👍1
🐍 PyAdventure - бесплатная игра для изучения Python через практику
Вместо обычных уроков здесь 10 игровых миров, каждый посвящён отдельной теме Python, а в конце ждёт битва с боссом.
Игра сделана на Pygame и рассчитана на обучение основам программирования через прохождение уровней и выполнение задач.
Сейчас доступна бесплатная версия для Windows.
https://khalidmfy.itch.io/pyadventure
Вместо обычных уроков здесь 10 игровых миров, каждый посвящён отдельной теме Python, а в конце ждёт битва с боссом.
Игра сделана на Pygame и рассчитана на обучение основам программирования через прохождение уровней и выполнение задач.
Сейчас доступна бесплатная версия для Windows.
https://khalidmfy.itch.io/pyadventure
1❤15👍10🔥8
10 GitHub-репозиториев, которые сильнее всего залетают прямо сейчас
Собрал свежую подборку проектов, которые заметно растут и активно обсуждаются.
1. OpenAI Codex
Coding agent от OpenAI для терминала и автоматизации разработки.
https://github.com/openai/codex
2. God's Eye View
OSINT и открытые геоданные на интерактивном 3D-глобусе: авиация, спутники и другие источники.
https://github.com/bilawalsidhu/gods-eye-view
3. awesome-gpt-image-2
Большая библиотека промптов, примеров и шаблонов для GPT Image 2.
https://github.com/freestylefly/awesome-gpt-image-2
4. mattpocock/skills
Готовые skills и workflows для coding agents, которые можно переиспользовать вместо огромных промптов.
https://github.com/mattpocock/skills
5. Archify
Строит интерактивную карту архитектуры кодовой базы: sequence, data-flow, lifecycle и связи компонентов.
https://github.com/tt-a1i/archify
6. Tailcat
Инструмент от Tailscale для прямого соединения машин через WireGuard и NAT traversal.
https://github.com/tailscale/tailcat
7. Prime Agent
Self-improving coding agent для длинных автономных задач.
https://github.com/PrimeIntellect-ai/prime-agent
8. Semantica
Graph-native инфраструктура для хранения контекста, связей и происхождения данных в AI-системах.
https://github.com/semantica-agi/semantica
9. Cursor Plugins
Официальный репозиторий плагинов Cursor: orchestration, code review, continual learning и другие agent-функции.
https://github.com/cursor/plugins
10. AnyDoc
Инструмент от Firecrawl для превращения документов в структурированный контент для AI и RAG.
https://github.com/firecrawl/anydoc
Если смотреть на общий тренд недели:
AI-агенты → agent skills → память и контекст → визуализация архитектуры → инструменты для автономной работы с окружением
Сохраняй себе, чтобы не потерять!
Собрал свежую подборку проектов, которые заметно растут и активно обсуждаются.
1. OpenAI Codex
Coding agent от OpenAI для терминала и автоматизации разработки.
https://github.com/openai/codex
2. God's Eye View
OSINT и открытые геоданные на интерактивном 3D-глобусе: авиация, спутники и другие источники.
https://github.com/bilawalsidhu/gods-eye-view
3. awesome-gpt-image-2
Большая библиотека промптов, примеров и шаблонов для GPT Image 2.
https://github.com/freestylefly/awesome-gpt-image-2
4. mattpocock/skills
Готовые skills и workflows для coding agents, которые можно переиспользовать вместо огромных промптов.
https://github.com/mattpocock/skills
5. Archify
Строит интерактивную карту архитектуры кодовой базы: sequence, data-flow, lifecycle и связи компонентов.
https://github.com/tt-a1i/archify
6. Tailcat
Инструмент от Tailscale для прямого соединения машин через WireGuard и NAT traversal.
https://github.com/tailscale/tailcat
7. Prime Agent
Self-improving coding agent для длинных автономных задач.
https://github.com/PrimeIntellect-ai/prime-agent
8. Semantica
Graph-native инфраструктура для хранения контекста, связей и происхождения данных в AI-системах.
https://github.com/semantica-agi/semantica
9. Cursor Plugins
Официальный репозиторий плагинов Cursor: orchestration, code review, continual learning и другие agent-функции.
https://github.com/cursor/plugins
10. AnyDoc
Инструмент от Firecrawl для превращения документов в структурированный контент для AI и RAG.
https://github.com/firecrawl/anydoc
Если смотреть на общий тренд недели:
AI-агенты → agent skills → память и контекст → визуализация архитектуры → инструменты для автономной работы с окружением
Сохраняй себе, чтобы не потерять!
❤12👍5🔥5😁1🎉1
This media is not supported in your browser
VIEW IN TELEGRAM
Вайбкодеры никогда не узнают это чувство
🔥25😁15👍5❤4
🔥 GLM-5.3-Flash теперь можно запускать локально
Unsloth выпустил GGUF-версии модели, включая 3-bit вариант, который можно запускать примерно на 128 ГБ RAM.
GLM-5.3-Flash, ранее известная как Ox Alpha, показывает очень сильные результаты в coding и agentic-бенчмарках и, по заявленным тестам, приближается к уровню Claude Opus 4.8 на DeepSWE.
Гайд:
https://unsloth.ai/docs/models/glm-5.3-flash
GGUF:
https://huggingface.co/unsloth/GLM-5.3-Flash-GGUF
Unsloth выпустил GGUF-версии модели, включая 3-bit вариант, который можно запускать примерно на 128 ГБ RAM.
GLM-5.3-Flash, ранее известная как Ox Alpha, показывает очень сильные результаты в coding и agentic-бенчмарках и, по заявленным тестам, приближается к уровню Claude Opus 4.8 на DeepSWE.
Гайд:
https://unsloth.ai/docs/models/glm-5.3-flash
GGUF:
https://huggingface.co/unsloth/GLM-5.3-Flash-GGUF
❤12👍9🔥5
⚡️ KTransformers - open-source фреймворк из Китая, который позволяет запускать огромные модели на обычном потребительском железе.
Самый показательный пример - DeepSeek-R1 на 671 млрд параметров можно запустить с RTX 4090 на 24 ГБ, используя гибридную схему CPU+GPU вместо полноценного H100-кластера.
Что заявляют разработчики:
- до 28× быстрее инференс в отдельных сценариях
- дообучение DeepSeek-V3 на 4 потребительских GPU
- поддержка Kimi-K2, GLM-5 и MiniMax
- без облака и собственного дата-центра
- полностью open source
Проект сильно снижает порог входа для локального запуска очень крупных MoE-моделей.
https://github.com/kvcache-ai/ktransformers
Самый показательный пример - DeepSeek-R1 на 671 млрд параметров можно запустить с RTX 4090 на 24 ГБ, используя гибридную схему CPU+GPU вместо полноценного H100-кластера.
Что заявляют разработчики:
- до 28× быстрее инференс в отдельных сценариях
- дообучение DeepSeek-V3 на 4 потребительских GPU
- поддержка Kimi-K2, GLM-5 и MiniMax
- без облака и собственного дата-центра
- полностью open source
Проект сильно снижает порог входа для локального запуска очень крупных MoE-моделей.
https://github.com/kvcache-ai/ktransformers
👍19🔥7❤6
🚀 Целую AI-компанию можно запустить прямо на своём компьютере.
Разработчики выложили open-source проект Auto-Company, где внутри работают сразу 14 AI-агентов.
Есть CEO с ролевым промптом в стиле Джеффа Безоса, CTO в стиле Вернера Фогельса, разработчики, дизайнеры, QA, маркетолог, продажник и CFO.
Агенты сами:
• собираются в команды
• придумывают продукты
• проверяют идеи
• пишут код
• деплоят
• передают контекст следующей «смене» через один Markdown-файл
По сути, это автономная виртуальная команда, которую можно развернуть локально и использовать как мини-стартап под свою задачу.
https://github.com/MaxMiksa/Auto-Company
Разработчики выложили open-source проект Auto-Company, где внутри работают сразу 14 AI-агентов.
Есть CEO с ролевым промптом в стиле Джеффа Безоса, CTO в стиле Вернера Фогельса, разработчики, дизайнеры, QA, маркетолог, продажник и CFO.
Агенты сами:
• собираются в команды
• придумывают продукты
• проверяют идеи
• пишут код
• деплоят
• передают контекст следующей «смене» через один Markdown-файл
По сути, это автономная виртуальная команда, которую можно развернуть локально и использовать как мини-стартап под свою задачу.
https://github.com/MaxMiksa/Auto-Company
🔥13👍6😁6😱3❤2
🔥 AI Job Search - open-source система, которая превращает Claude Code в помощника по поиску работы
Она умеет:
- анализировать вакансии и оценивать, насколько они подходят
- подгонять CV под конкретную позицию
- писать сопроводительные письма
- готовить к интервью
- искать вакансии через отдельные skills
- хранить профиль, документы и историю откликов локально
Интересно, что автор сам использовал этот workflow для поиска работы: 69 адаптированных откликов → 20 первых интервью → 1 оффер.
Проект построен как набор команд
MIT License.
https://github.com/MadsLorentzen/ai-job-search
Она умеет:
- анализировать вакансии и оценивать, насколько они подходят
- подгонять CV под конкретную позицию
- писать сопроводительные письма
- готовить к интервью
- искать вакансии через отдельные skills
- хранить профиль, документы и историю откликов локально
Интересно, что автор сам использовал этот workflow для поиска работы: 69 адаптированных откликов → 20 первых интервью → 1 оффер.
Проект построен как набор команд
/setup, /scrape, /apply, /interview и легко форкается под свои сайты вакансий и рынок.MIT License.
https://github.com/MadsLorentzen/ai-job-search
❤8👍4🔥2🎉2
⚡️ GPT-6 Astra подняла рекорд Epoch AI с 163 до 169 ECI
GPT-6 Astra установила новый максимум в индексе возможностей Epoch AI - 169 баллов против предыдущих 163.
Для масштаба: тренд эпохи reasoning-моделей составляет около 15 ECI в год, поэтому скачок на 6 пунктов соответствует примерно пяти месяцам прогресса. Astra находится немного выше трендовой линии, но всё ещё в пределах ожидаемого диапазона.
Особенно выделяются отдельные результаты:
- 84% на Mystery Game Puzzles против предыдущего рекорда в 59%
- 98% на FrontierMath Tier 4 - Epoch уже считает этот уровень практически полностью насыщенным
При этом результат заметно расходится с рейтингом Artificial Analysis Intelligence Index.
Причина в методологии: Epoch и Artificial Analysis используют разные наборы тестов и веса. AA сильнее акцентирует coding и agentic-задачи, поэтому лидерство Astra в ECI не означает автоматического лидерства во всех практических сценариях.
По метрике Epoch скачок действительно большой - +6 ECI за одно поколение модели.
https://x.com/Machinelearrn/status/2095826666702393538
GPT-6 Astra установила новый максимум в индексе возможностей Epoch AI - 169 баллов против предыдущих 163.
Для масштаба: тренд эпохи reasoning-моделей составляет около 15 ECI в год, поэтому скачок на 6 пунктов соответствует примерно пяти месяцам прогресса. Astra находится немного выше трендовой линии, но всё ещё в пределах ожидаемого диапазона.
Особенно выделяются отдельные результаты:
- 84% на Mystery Game Puzzles против предыдущего рекорда в 59%
- 98% на FrontierMath Tier 4 - Epoch уже считает этот уровень практически полностью насыщенным
При этом результат заметно расходится с рейтингом Artificial Analysis Intelligence Index.
Причина в методологии: Epoch и Artificial Analysis используют разные наборы тестов и веса. AA сильнее акцентирует coding и agentic-задачи, поэтому лидерство Astra в ECI не означает автоматического лидерства во всех практических сценариях.
По метрике Epoch скачок действительно большой - +6 ECI за одно поколение модели.
https://x.com/Machinelearrn/status/2095826666702393538
👍6🔥6❤4🎉2
VCR.py - очень удобная библиотека для тестирования Python-кода, который ходит во внешние API.
Первый запуск теста делает реальные HTTP-запросы и сохраняет ответы в так называемую cassette - по умолчанию YAML-файл. Следующие запуски уже не идут в сеть: VCR.py перехватывает знакомый запрос и возвращает сохранённый ответ.
Что это даёт:
- тесты становятся детерминированными
- их можно запускать офлайн
- они работают заметно быстрее
- внешнее API не нужно дёргать сотни раз в CI
- если API изменилось, cassette можно просто перезаписать
Особенно полезно для тестов интеграций с REST API, платёжными сервисами, LLM API и любыми внешними HTTP-сервисами.
Проект активно развивается: в актуальной ветке 8.x есть поддержка HTTPX, custom transports, безопасная загрузка YAML и свежая поддержка
MIT License.
https://github.com/kevin1024/vcrpy
Первый запуск теста делает реальные HTTP-запросы и сохраняет ответы в так называемую cassette - по умолчанию YAML-файл. Следующие запуски уже не идут в сеть: VCR.py перехватывает знакомый запрос и возвращает сохранённый ответ.
Что это даёт:
- тесты становятся детерминированными
- их можно запускать офлайн
- они работают заметно быстрее
- внешнее API не нужно дёргать сотни раз в CI
- если API изменилось, cassette можно просто перезаписать
Особенно полезно для тестов интеграций с REST API, платёжными сервисами, LLM API и любыми внешними HTTP-сервисами.
Проект активно развивается: в актуальной ветке 8.x есть поддержка HTTPX, custom transports, безопасная загрузка YAML и свежая поддержка
niquests. MIT License.
https://github.com/kevin1024/vcrpy
🔥7❤5👍3🎉1
🦅 Colibrì - движок для запуска очень больших AI-моделей на обычных ПК и рабочих станциях, даже если модель целиком не помещается в видеопамять.
Как это работает:
MoE-модели состоят из множества «экспертов», но для каждого токена используется только небольшая их часть.
Colibrì хранит:
* самые нужные веса в VRAM;
* менее активные — в RAM;
* редко используемые - на NVMe SSD.
Когда модели нужен конкретный эксперт, движок подгружает его с диска или из RAM.
То есть для запуска условной модели на сотни миллиардов или даже триллионы параметров не обязательно иметь столько же VRAM.
Поддерживаются CPU, CUDA, Metal и смешанное размещение модели.
Проще говоря: Colibrì позволяет запускать гигантские MoE-модели локально, жертвуя в первую очередь скоростью, а не возможностью их вообще запустить.
https://github.com/JustVugg/colibri
@pythonl
Как это работает:
MoE-модели состоят из множества «экспертов», но для каждого токена используется только небольшая их часть.
Colibrì хранит:
* самые нужные веса в VRAM;
* менее активные — в RAM;
* редко используемые - на NVMe SSD.
Когда модели нужен конкретный эксперт, движок подгружает его с диска или из RAM.
То есть для запуска условной модели на сотни миллиардов или даже триллионы параметров не обязательно иметь столько же VRAM.
Поддерживаются CPU, CUDA, Metal и смешанное размещение модели.
Проще говоря: Colibrì позволяет запускать гигантские MoE-модели локально, жертвуя в первую очередь скоростью, а не возможностью их вообще запустить.
https://github.com/JustVugg/colibri
@pythonl
1❤14🔥9👍5🎉1
Python и ИИ в 2026 году: как правильно работать с кодом через ChatGPT, Claude, Cursor и AI-агентов
Как использовать ИИ для написания, проверки, рефакторинга и отладки Python-кода.
Лучшие промпты, примеры, workflow и правила работы с AI-ассистентами в 2026 году.
https://uproger.com/python-i-ii-v-2026-godu-kak-pravilno-rabotat-s-kodom-cherez-chatgpt-claude-cursor-i-ai-agentov/
Как использовать ИИ для написания, проверки, рефакторинга и отладки Python-кода.
Лучшие промпты, примеры, workflow и правила работы с AI-ассистентами в 2026 году.
https://uproger.com/python-i-ii-v-2026-godu-kak-pravilno-rabotat-s-kodom-cherez-chatgpt-claude-cursor-i-ai-agentov/
❤6👍6🔥3😁2
⚡ OrcaRouter стала лучшей uncensored-версией Qwen3.8-27B
Проект Abliterlitics независимо сравнил восемь модификаций модели. Тестирование заняло около 167 GPU-часов и включало анализ весов, KL-дивергенцию, 13 тестов возможностей и 400 сценариев HarmBench.
Результаты Qwen3.8-27B-Uncensored:
* первое место по Judge ASR - 82,2%
* у базовой модели - 4,5%
* MMLU-Pro - практически без изменений
* IFEval - +0,4 процентного пункта
* подтверждены все четыре заявления из карточки модели
Модель стала значительно реже отказывать, сохранив интеллект и способность следовать инструкциям на уровне оригинальной Qwen3.8-27B. Итог независимого исследования - «The winner».
Анализ:
https://abliterlitics.dev/models/qwen38-27b/
Модель:
https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored
Проект Abliterlitics независимо сравнил восемь модификаций модели. Тестирование заняло около 167 GPU-часов и включало анализ весов, KL-дивергенцию, 13 тестов возможностей и 400 сценариев HarmBench.
Результаты Qwen3.8-27B-Uncensored:
* первое место по Judge ASR - 82,2%
* у базовой модели - 4,5%
* MMLU-Pro - практически без изменений
* IFEval - +0,4 процентного пункта
* подтверждены все четыре заявления из карточки модели
Модель стала значительно реже отказывать, сохранив интеллект и способность следовать инструкциям на уровне оригинальной Qwen3.8-27B. Итог независимого исследования - «The winner».
Анализ:
https://abliterlitics.dev/models/qwen38-27b/
Модель:
https://huggingface.co/orcarouter/Qwen3.8-27B-Uncensored
👍10🔥5❤4
⚡️ OriginTracer - низкоуровневая observability-система для Python web stack
OriginTracer позволяет трассировать запросы сразу через несколько уровней приложения:
- Nginx
- Gunicorn
- Uvicorn
- Django
- Celery
Главная идея - видеть путь запроса не только внутри одного фреймворка, а через весь стек: от входа через веб-сервер до фоновых задач.
Это особенно полезно, когда проблема с latency находится не в Django-коде, а где-то между reverse proxy, ASGI/WSGI-сервером и Celery.
Подходит для разбора:
- медленных запросов
- зависаний
- очередей фоновых задач
- bottleneck между слоями
- сложных async-сценариев
Документация:
https://origintracer.app/docs/
OriginTracer позволяет трассировать запросы сразу через несколько уровней приложения:
- Nginx
- Gunicorn
- Uvicorn
- Django
- Celery
Главная идея - видеть путь запроса не только внутри одного фреймворка, а через весь стек: от входа через веб-сервер до фоновых задач.
Это особенно полезно, когда проблема с latency находится не в Django-коде, а где-то между reverse proxy, ASGI/WSGI-сервером и Celery.
Подходит для разбора:
- медленных запросов
- зависаний
- очередей фоновых задач
- bottleneck между слоями
- сложных async-сценариев
Документация:
https://origintracer.app/docs/
👍5🔥5❤4🎉2
🔥 monty-go - безопасный запуск Python-кода от LLM прямо внутри Go
Проект оборачивает интерпретатор Pydantic Monty в WebAssembly и запускает его через
Что интересно:
- pure Go — без CGO
- без контейнеров и subprocess
- запуск sandbox меньше миллисекунды
- WASM-бинарник всего около 2,9 МБ
- можно ограничить память, время, число аллокаций и глубину рекурсии
- доступ к файлам и ОС идёт только через разрешённые Go-callbacks
- внешние функции работают через pause/resume
Главная идея — агент может написать один Python-скрипт, который вызывает ваши Go-инструменты, вместо длинной цепочки отдельных tool calls. Это уменьшает число обращений к модели и упрощает сложные agentic workflow.
MIT.
https://github.com/fugue-labs/monty-go
Проект оборачивает интерпретатор Pydantic Monty в WebAssembly и запускает его через
wazero.Что интересно:
- pure Go — без CGO
- без контейнеров и subprocess
- запуск sandbox меньше миллисекунды
- WASM-бинарник всего около 2,9 МБ
- можно ограничить память, время, число аллокаций и глубину рекурсии
- доступ к файлам и ОС идёт только через разрешённые Go-callbacks
- внешние функции работают через pause/resume
Главная идея — агент может написать один Python-скрипт, который вызывает ваши Go-инструменты, вместо длинной цепочки отдельных tool calls. Это уменьшает число обращений к модели и упрощает сложные agentic workflow.
MIT.
https://github.com/fugue-labs/monty-go
🔥7❤5👍3
Anthropic разобрала четыре случая, когда её модели атаковали реальные системы во время тестов по кибербезопасности.
Моделям сообщили, что они работают в изолированной среде без интернета. Но из-за ошибки настройки доступ в сеть остался открытым. Защитные фильтры публичных продуктов на этих тестах были отключены.
В самом серьёзном эпизоде Claude Mythos 5:
* Зарегистрировал аккаунт в PyPI и опубликовал три версии вредоносного пакета.
* Пакет установили 15 систем.
* Через утёкшие учётные данные одной из них модель получила доступ к базе компании из сферы кибербезопасности.
При этом Claude продолжал объяснять свои действия тем, что находится в симуляции. Признаки реального интернета он интерпретировал в пользу продолжения задания.
Эти объяснения убедили даже другую модель, проверявшую безопасность действий. Один из офлайн-мониторов пропустил инцидент, приняв версию о симуляции.
Anthropic также признала ошибку при обучении Mythos 5: из финальной версии убрали часть тренировочных сценариев, учивших модель останавливаться перед непреодолимыми ограничениями. Тогда другую версию сочли удобнее в использовании. Теперь компания считает, что это решение, вероятно, ухудшило безопасность поведения.
Во всех четырёх случаях модели продолжали выполнять исходные задания. Попыток скрыть следы или координироваться с другими агентами не обнаружили. Независимое расследование проведёт METR.
https://www.anthropic.com/research/alignment-assessment-cybersecurity-incidents
Please open Telegram to view this post
VIEW IN TELEGRAM
😁9❤6👍5🔥4🎉1
Получи подготовленные данные и разработай ИИ-ассистента для энергетики на соревновании от ПАО «Интер РАО» при поддержке компании «Яндекс».
Призовой фонд — 750 000 рублей. Лучшие проекты смогут стать частью экосистемы компании.
Регистрация открыта до 27 сентября.
Можно участвовать одному или командой до 5 человек. Идеальный состав: разработчик, специалист по машинному обучению, аналитик и дизайнер.
Задачи соревнования — за какую возьмешься?1️⃣ ИИ-помощник для подготовки презентаций.2️⃣ Помощник для анализа документов из судов.3️⃣ Ассистент для создания ИТ/ИБ-дайджестов.4️⃣ Архитектор BPMN-диаграмм.
Стартуем 28 сентября. Придумай концепт проекта: самые сильные идеи участники доработают под руководством экспертов Группы «Интер РАО» с 9 по 23 октября. Финал в Москве — 3 ноября.
Please open Telegram to view this post
VIEW IN TELEGRAM
👍2❤1😁1
🐍 Исправление опечаток всего в 21 строке Python
Питер Норвиг показал очень компактный пример вероятностного spell checker — без нейросетей и сложных моделей.
Идея простая:
- берём слово с ошибкой
- генерируем варианты на расстоянии 1–2 правок
- оставляем слова, которые есть в словаре
- выбираем самый вероятный вариант по частоте в корпусе
Одна правка — это:
Например:
Ключевой момент — алгоритм не пытается «понять» слово. Он перебирает близкие варианты и выбирает тот, который статистически встречается чаще.
Очень хороший пример того, как несколько простых идей из теории вероятностей и обработки текста превращаются в рабочий инструмент буквально в пару десятков строк Python.
Питер Норвиг показал очень компактный пример вероятностного spell checker — без нейросетей и сложных моделей.
Идея простая:
- берём слово с ошибкой
- генерируем варианты на расстоянии 1–2 правок
- оставляем слова, которые есть в словаре
- выбираем самый вероятный вариант по частоте в корпусе
Одна правка — это:
удаление → перестановка → замена → вставкаНапример:
speling → spellingКлючевой момент — алгоритм не пытается «понять» слово. Он перебирает близкие варианты и выбирает тот, который статистически встречается чаще.
Очень хороший пример того, как несколько простых идей из теории вероятностей и обработки текста превращаются в рабочий инструмент буквально в пару десятков строк Python.
🔥8