Big Data AI – Telegram

Big Data AI

16.8K subscribers

840 photos

100 videos

19 files

839 links

@haarrp - админ

Вопросы с собеседований по Machine Learning, Data Science, Deep Learning и Нейроннным сетям

@data_analysis_ml - анализ данных

@ai_machinelearning_big_data

@itchannels_telegram - важное для программиста

РКН: clck.ru/3Fmqxe

Download Telegram

About

Blog

Apps

Platform

16.8K subscribers

This media is not supported in your browser

VIEW IN TELEGRAM

🔥

Magic 1-For-1 — это модель генерации видео, разработанная для оптимизации использования памяти и снижения задержек при выводе!

🌟 Она разделяет задачу генерации видео из текста на два этапа: генерацию изображения из текста и преобразование изображения в видео, что способствует более эффективному обучению и дистилляции.

🖥

Github

@bigdatai

Please open Telegram to view this post

VIEW IN TELEGRAM

👍4❤3🔥2

1.87K views16:15

⚡️ NVIDIA’s New AI: Text To Video Supercharged!

https://www.youtube.com/watch?v=FpZ_6bxx5v8

@bigdatai

NVIDIA’s New AI: The Age of Real Time Game Making Is Here!

❤️ Check out Lambda here and sign up for their GPU Cloud: https://lambdalabs.com/papers

📝 Magic 1-For-1:
https://magic-141.github.io/Magic-141/
https://github.com/Open-Magic-Video/Magic-1-For-1
https://arxiv.org/abs/2502.07701v1

📝 Phantom: https://phantom…

❤3👍1

1.96K views17:38

This media is not supported in your browser

VIEW IN TELEGRAM

🔥

Open Computer Use — платформа для безопасного использования компьютеров с помощью ИИ, управляемого через E2B Desktop Sandbox!

🌟 Это решение позволяет удалённо управлять компьютером с помощью команд, моделируя действия клавиатуры, мыши и терминала. Интерфейс поддерживает интеграцию с различными моделями LLM (Large Language Models), включая Llama, Hugging Face и другие.

💡 Ключевые функции: живая трансляция дисплея из песочницы, возможность приостановить выполнение агентом задач для внесения обратной связи, поддержка любых операционных систем и платформ, а также гибкость настройки моделей.

🔐 Лицензия: Apache-2.0

🖥

Github

@bigdatai

Please open Telegram to view this post

VIEW IN TELEGRAM

👍2

2.22K views11:02

📝

E2M (Everything to Markdown) — библиотека на Python для преобразования различных типов файлов в формат Markdown!

🌟 Он поддерживает широкий спектр форматов, включая doc, docx, epub, html, url, pdf, ppt, mp3, и m4a. Библиотека использует архитектуру «парсер-конвертер»: сначала данные извлекаются из файлов с помощью парсеров, а затем преобразуются в Markdown через конвертеры.

🌟 E2M разработан для упрощения работы с данными, особенно для задач Retrieval-Augmented Generation (RAG), обучения моделей и их дообучения. Поддерживаются инструменты обработки текста, изображений и звука, такие как OpenAI Whisper API для преобразования аудио в текст.

🔐 Лицензия: Apache-2.0

🖥

Github

@bigdatai

Please open Telegram to view this post

VIEW IN TELEGRAM

🔥3❤1👍1

2.4K views10:01

🔥

openpilot — это открытое программное обеспечение, которое служит операционной системой для робототехники для улучшения системы помощи водителю в автомобилях!

🌟 openpilot расширяет возможности существующих систем помощи водителю (ADAS) и может быть установлен на более чем 275 поддерживаемых моделях автомобилей. Он добавляет функции, такие как удержание полосы, адаптивный круиз-контроль и автоматическое экстренное торможение.

🔐 Лицензия: MIT

🖥

Github

@bigdatai

Please open Telegram to view this post

VIEW IN TELEGRAM

🔥5👍2😱2

2.18K views08:02

Forwarded from Machinelearning

This media is not supported in your browser

VIEW IN TELEGRAM

⚡️ Magma-8B – это экспериментальная модель от Microsoft, которая объединяет обработку текста и изображений в одном агентском решении.

Чем полезен инструмент:

- Мультимодальность: Возможность работать с изображениями, видео и текстом позволяет строить комплексные системы – от навигации по пользовательским интерфейсам до управления робототехникой.
Агентские возможности: Модель не просто описывает содержимое картинки, а умеет генерировать план действий, что особенно ценно для интерактивных приложений.
- ИспользованиеSet-of-Mark и Trace-of-Mark, помогает связать визуальные элементы с текстовыми командами, обеспечивая более точное понимание и планирование.

Magma-8B специально разработан для сценариев работы с агентами – акцент не только на генерации текста, но и на взаимодействии с реальными объектами (например, интерфейсами).

Модель обучалась на разнообразных источниках, включая неразмеченные видео, в результате этого удалось добиться понимания динамики и пространственных отношений в видео.

Современные технические решения и масштабируемость, что позволяет адаптировать модель под разные задачи.

Минусы:

- На данном этапе модель ориентирована на исследовательские проекты, поэтому может требовать доработки перед использованием в боевых условиях.
- Ограничения по языкам: основной фокус сделан на английском, что может усложнить работу с другими языками.

Возможны нестабильные результаты - в некоторых сценариях, особенно если задача выходит за рамки обучающих данных, что требует осторожности при внедрении в реальные приложения.

В целом, Magma-8B – это интересный экспериментальный инструмент, который может стать отправной точкой для создания новых, более «умных» агентных систем, объединяющих восприятие и действие в одном флаконе.

pip install torchvision Pillow open_clip_torch

https://huggingface.co/microsoft/Magma-8B

#microsoft #magma #multimodal

2.51K views16:36

🔥 OpenObserve — это облачное решение для мониторинга и анализа данных с открытым исходным кодом!

🌟 Оно позволяет собирать, индексировать и визуализировать различные метрики и логи в реальном времени.

🔐 Лицензия: Apache-2.0

🖥

Github

@bigdatai

Please open Telegram to view this post

VIEW IN TELEGRAM

❤3👍2🔥1

2.47K views10:01

🔥

Cofounder — это генеративная платформа для создания полноценных веб-приложений с бэкендом и UI!

🌟 Он использует ИИ для генерации приложений, включая проектирование интерфейсов и создание структур на основе описаний. На данный момент это ранняя альфа-версия, нестабильная, которая требует больших вычислительных ресурсов. В будущем проект планирует улучшения и добавление новых функций, таких как интеграция с мобильными фреймворками и расширенная настройка приложений.

🔐 Лицензия: MIT

🖥

Github

@bigdatai

Please open Telegram to view this post

VIEW IN TELEGRAM

❤1👍1

2.35K views11:05

🔥

MiniCPM-o 2.6 — это мощная языковая модель с 8 млрд параметров, разработанная OpenBMB! Она поддерживает текст, изображения, видео и аудио, а также обеспечивает высококачественные ответы на естественном языке. Производительность модели сравнима с GPT-4o-202405, особенно в обработке мультимодального контента.

💡 Особенности MiniCPM-o включают расширенные возможности оптического распознавания символов (OCR), улучшенное понимание видео и поддержку голосовых диалогов в реальном времени на английском и китайском языках. Модель может адаптировать тембр, скорость и эмоции речи, что делает её полезной для голосовых ассистентов и интерактивных приложений.

🔐 Лицензия: Apache-2.0

🖥

Github

@bigdatai

Please open Telegram to view this post

VIEW IN TELEGRAM

👍5🔥1

2.57K views11:47

📖

NExT-Mol: объединение 3D-диффузионных моделей и 1D-языкового моделирования для генерации молекул!

🌟 В этой статье представлена новая модель NExT-Mol, сочетающая преимущества 1D-языковых моделей (LM) и 3D-диффузионных моделей для генерации трехмерных структур молекул. Авторы отмечают, что, хотя 3D-диффузионные модели эффективно моделируют непрерывные 3D-конформеры, они могут генерировать некорректные молекулы. В то же время 1D-LM, основанные на SELFIES, обеспечивают 100% валидность создаваемых молекул, используя большие одномерные наборы данных.

🔗 Ссылка: *клик*

@bigdatai

Please open Telegram to view this post

VIEW IN TELEGRAM

👍1

2.67K views18:56

🔥

Jina Serve — это облачно-ориентированный фреймворк для создания и развертывания мультимодальных AI-сервисов!

🌟 Он поддерживает взаимодействие через gRPC, HTTP и WebSocket, предлагая высокопроизводительную архитектуру для масштабирования, потоковой передачи данных и динамической обработки запросов. Основные возможности включают нативную интеграцию с ML-фреймворками, контейнеризацию, встроенный оркестратор микросервисов и поддержку Kubernetes.

🔐 Лицензия: Apache-2.0

🖥

Github

@machinelearning_ru

Please open Telegram to view this post

VIEW IN TELEGRAM

❤1👏1

2.49K views11:04

🔥

Code2Prompt — это инструмент командной строки, который помогает разработчикам передавать структуру и содержимое кода большим языковым моделям!

🌟 Он автоматически генерирует Markdown-файлы с подробным представлением проекта, что упрощает анализ, документирование и рефакторинг кода. Это особенно полезно для работы с крупными кодовыми базами, где важно дать модели контекст перед генерацией ответов.

🔐 Лицензия: MIT

🖥

Github

@bigdatai

Please open Telegram to view this post

VIEW IN TELEGRAM

2.32K views12:00

Forwarded from Rust

👣

Training a Rust 1.5B Coder LM with Reinforcement Learning (GRPO)
Источник: Oxen.ai Blog
Ссылка: Oxen.ai

Статья подробно рассказывает о процессе обучения специализированной языковой модели для генерации кода на Rust, обладающей 1.5 млрд параметров.

Авторы применяют метод обучения с подкреплением (GRPO) с использованием обратной связи от инструментов Rust (компилятор и система сборки cargo). Это позволяет модели учиться генерировать код, который успешно компилируется, проходит линтер (cargo clippy) и unit-тесты.

Подход к данным и метрикам: Описаны этапы подготовки датасета, в том числе адаптация существующих Python-подобных задач под синтаксис Rust, а также разработка специальных reward-функций, проверяющих качество сгенерированного кода.

Материал показывает, как можно использовать инструменты Rust для автоматизированной проверки качества кода, что может служить основой для создания интеллектуальных помощников и средств автоматизации.

🔗 Читать

@rust_code

Please open Telegram to view this post

VIEW IN TELEGRAM

👍4🔥2

2.57K views14:17

Media is too big

VIEW IN TELEGRAM

📹 NVIDIA’s New AI Grows Stuff Out Of Nothing!

Смотреть

🤡3👎2❤1👍1

2.28K views14:28

🔥

MedSSS — это небольшой медицинский языковой модельный проект, разработанный с использованием метода «медленного мышления» и самосовершенствующейся методики!

💡 Цель проекта — улучшить способность модели к медицинским рассуждениям. MedSSS использует модель PRM для выбора наиболее корректного ответа из нескольких возможных вариантов, что позволяет эффективно решать как традиционные задачи медицинского вопросно-ответного характера, так и более сложные клинические сценарии.

🔐 Лицензия: MIT

🖥

Github

@bigdatai

Please open Telegram to view this post

VIEW IN TELEGRAM

👍4❤1👎1🔥1

2.25K views12:05

🔥

UI-TARS Desktop — это приложение с графическим интерфейсом, основанное на модели компьютерного зрения, которое позволяет управлять компьютером с помощью естественного языка!

🌟 Оно поддерживает управление мышью и клавиатурой, а также выполняет захват экрана и распознавание объектов. Это кросс-платформенный инструмент для Windows и MacOS, который обрабатывает запросы локально, обеспечивая безопасность и конфиденциальность.

🔐 Лицензия: Apache-2.0

🖥

Github

@bigdatai

Please open Telegram to view this post

VIEW IN TELEGRAM

👌2❤1🆒1

2.13K views11:28

🔥

5ire — кроссплатформенный AI-ассистент и клиент MCP (Model Context Protocol)!

🌟 Он поддерживает интеграцию с популярными поставщиками AI-сервисов (например, OpenAI, Anthropic, Google и другими), а также предоставляет локальную базу знаний для обработки и векторизации документов. Проект использует MCP-протокол для подключения к различным инструментам, что позволяет работать с файловыми системами, базами данных и удаленными источниками данных.

🔐 Лицензия: GPL-3.0

🖥

Github

@bigdatai

Please open Telegram to view this post

VIEW IN TELEGRAM

❤5🔥3👍1

2.25K views16:01

Forwarded from Machinelearning

✔️

TSMC предлагает ИТ-гигантам объединиться вокруг производственных мощностей Intel.

TSMC обратилась к Nvidia, AMD и Broadcom с предложением войти в совместное предприятие, целью которого станет управление производственными мощностями Intel. Как сообщают источники, TSMC планирует сохранить за собой менее 50% акций в данном предприятии. Аналогичное предложение, по некоторым данным, было направлено и компании Qualcomm. Эти переговоры разворачиваются на фоне обращения администрации президента США к TSMC с просьбой оказать содействие испытывающей трудности Intel. Известно, что переговоры по Intel находятся на ранней стадии, и TSMC заинтересована в привлечении нескольких компаний к участию в этом проекте.
zaobao.com.sg

✔️

ИИ от Sakana AI успешно прошел научное рецензирование.

Проект Scientist-v2, разработка Sakana AI, смогла создать научную работу, которая успешно прошла процесс рецензирования на одном из воркшопов Международной конференции ICLR. Это стало первым случаем, когда полностью сгенерированное исследование прошло стандартную процедуру оценки. Представленная работа была посвящена методам регуляризации нейронных сетей и, как ни странно, сообщала об отрицательных результатах.

Несмотря на то, что средняя оценка работы составила 6.33, что превысило порог принятия воркшопа, согласно предварительной договоренности, работа была отозвана, поскольку в научном сообществе пока отсутствуют устоявшиеся нормы для сгенерированных работ.
sakana.ai

✔️

Google DeepMind выводит ИИ в физический мир с Gemini Robotics.

Google DeepMind представила новейшую разработку – Gemini Robotics, модель на базе Gemini 2.0, способную наделить роботов способностью к "телесному" мышлению. Эта VLA (Vision-Language-Action) модель способна самостоятельно управлять роботами, открывая новые возможности в их применении.

Наряду с ней представлена Gemini Robotics-ER, модель с углубленным пространственным пониманием, позволяющая робототехникам использовать возможности Gemini в своих проектах. Обе модели демонстрируют интерактивность и ловкость, позволяя роботам адаптироваться к различным ситуациям, взаимодействовать с людьми и выполнять сложные задачи. Google DeepMind тестирует Gemini Robotics-ER с несколькими доверенными партнерами.
deepmind.google

✔️

Doubao (ByteDance) опубликовала технические детали модели генерации изображений Seedream 2.0.

Команда Doubao официально представила технический отчет о своей модели генерации изображений Seedream 2.0, впервые раскрыв детали процесса разработки, начиная со сбора данных и заканчивая постобработкой с использованием RLHF.

В отчете отмечаются улучшения в понимании китайского и английского языков, отрисовке текста, достижении высокого уровня эстетики и разрешения генераций. Seedream 2.0 была запущена еще в начале декабря 2024 года в приложениях Doubao и Jimeng, ей воспользовались сотни миллионов пользователей и она стала любимым инструментом для многих профессиональных дизайнеров в Китае. По сравнению с Ideogram 2.0, Midjourney V6.1 и Flux 1.1 Pro, Seedream 2.0 лучше справляется с текстом и лучше понимает китайскую культуру. Модель поддерживает запросы на китайском и английском языках.
team.doubao.com

✔️

Испания вводит крупные штрафы за отсутствие маркировки контента, созданного ИИ.

Испанское правительство одобрило законопроект, предусматривающий введение внушительных штрафов для компаний, которые используют сгенерированный контент без соответствующей маркировки. Мера направлена на борьбу с распространением "дипфейков".

Несоблюдение требований по маркировке будет классифицироваться как "серьезное правонарушение", что может повлечь за собой штрафы до 35 млн. евро или 7% от годового оборота компании-гарушителя. Новый регулирующий орган AESIA будет отвечать за обеспечение соблюдения новых правил.
reuters.com

@ai_machinelearning_big_data

#news #ai #ml

Please open Telegram to view this post

VIEW IN TELEGRAM

❤4👍1🔥1👏1

2.25K views05:27

🔥

DeepScaler — это проект, предназначенный для увеличения разрешения изображений с использованием методов глубокого обучения!

🌟 Он реализует алгоритмы суперразрешения (Super-Resolution), позволяя восстанавливать детали и улучшать качество изображений при их масштабировании.

🔐 Лицензия: MIT

🖥

Github

@bigdatai

Please open Telegram to view this post

VIEW IN TELEGRAM

👍4🔥2❤1🤡1

2.47K views11:02