| Date | Title | Description |
| 18.12.2025 | Использование библиотеки spaCy для поиска сущностей в тексте | Снова приветствую всех читателей Хабр.
В предыдущей статье был приведен пример создания кода проекта для задачи автоматизации обработки данных, в результате чего получилось подготовить нужную информацию по модели данных ЛОЦМАН: PLM. Эти дан... |
| 12.12.2025 | New StepUp Startups report: Scaling Europe’s open-source AI landscape | A new report, The European Open-Source AI Landscape, has just been released by the StepUp Startups project. The report offers a snapshot of where Europe currently stands in the global AI race, and explores how faster adoption of open-source... |
| 13.02.2025 | Обучить модель RoBERTa расстановке запятых на балконе для продакшена | RoBERTa — улучшенная версия модели BERT, разработанная Facebook AI. Она показывает отличные результаты в задачах обработки естественного языка, таких как классификация текстов и генерация ответов.
Построим конкурентоспособный сайт расстанов... |
| 04.02.2025 | PicTrace-X1: Как умные очки и нейросети меняют поиск изображений — от браузера до навигации | Современный цифровой мир генерирует терабайты визуальных данных ежедневно. Рутинные задачи — маркетинговый анализ, модерация контента, обеспечение безопасности или разработка умных очков и протезов для людей с ограниченными возможностями — ... |
| 30.01.2025 | The Rise of Open-Source AI: Alibaba's Qwen Models and the Future of Data Privacy | In the world of artificial intelligence, innovation is the lifeblood. Recently, Alibaba unveiled its Qwen models, a significant leap in open-source AI technology. These models, Qwen2.5-7B-Instruct-1M and Qwen2.5-14B-Instruct-1M, can process... |
| 30.01.2025 | Векторизация текста в NLP: от слов к числам | Перед началом работы с NLP-моделями текст нужно преобразовать в понятный модели вид. Этот процесс называется векторизацией, и без него невозможно представить современный NLP. По сути, мы превращаем слова, предложения или целые документы в в... |
| 28.01.2025 | Русский Маскарад — применение NER для защиты персональных данных | Всем привет!
На связи команда хакатонщиков “Старые Бауманцы” и я - Саша Зазнобин.
Сегодня хочу поговорить с вами о такой малоприятной теме как защита персональных данных. Если вы точно знаете, чего хотите от этой статьи - листайте в конец, ... |
| 19.12.2024 | Unlocking the Power of Pre-trained Neural Networks in Java Projects | In the fast-paced world of technology, time is money. Developers are always on the lookout for ways to speed up their projects without sacrificing quality. Enter pre-trained neural networks. These models are like seasoned chefs who have per... |
| 17.12.2024 | Интеграция предобученных нейросетей в Java-проектах: практический пример | При работе с нейросетями, не обязательно каждый раз писать свою модель заново, можно использовать предобученные модели, что позволяет значительно сократить время разработки, а развитие модели и поддержка сообществом позволяет повысить точно... |
| 17.12.2024 | Сортировка книг по тематикам скриптами Python | На момент написания этой заметки около половины из 16 тысяч книг в моей библиотеке — ИТшные, другая половина — медицинские. Две трети этих книг на английском, одна треть — на русском.
Примерно раз в месяц я с телеграм-каналов докачиваю еще ... |
| 08.12.2024 | The Dark Side of Open Source: A Supply Chain Attack on Ultralytics | In the world of software development, open source is a double-edged sword. It offers collaboration and innovation but also invites vulnerabilities. Recently, a serious incident shook the open-source community. Ultralytics, a prominent playe... |
| 08.12.2024 | NLP: когда машины начинают понимать нас (Часть 2) | 1. Введение
В прошлой статье мы с вами изучили теоретические основы обработки естественного языка (NLP) и теперь готовы перейти к практике. В мире NLP выбор подходящего языка программирования и инструментов играет ключевую роль в успешной р... |
| 02.12.2024 | Создаём генератор аудиокниг с персональным переводом | Привет, Хабр!
Изучая четвёртый язык, я в очередной раз решил попробовать обучить свою биологическую нейросеть на книгах с параллельным переводом, но после пары вечеров в такой же очередной раз их оставил. Подобный подход, когда переводом со... |
| 14.11.2024 | Разбей и властвуй: как создать кастомный токенизатор в SpaCy | Привет, Хабр! Сегодня расскажем вам о том, как создавать собственные токенизаторы с SpaCy. Да-да, тот самый SpaCy, который мы все знаем и любим. Зачем нам свой токенизатор?
Согласитесь, стандартные токенизаторы хороши, но иногда требуется ч... |
| 16.10.2024 | Navigating the Digital Cinema Landscape: A DIY Movie Recommendation System | In the age of streaming, choosing a movie can feel like searching for a needle in a haystack. With countless options available, how do you find that perfect film? This article explores a DIY approach to creating a movie recommendation syste... |
| 15.10.2024 | Рекомендатель кино или как я писал свое DIY-решение для поиска новых фильмов | Вечер. Пересматриваю «Пятницу 13». Не люблю пересматривать фильмы, даже хорошие. Но выбрать интересное кино из потока новинок сложно. Поэтому мне захотелось написать свой рекомендатор кино. Этим и займусь в выходные.
В статье покажу, что по... |
| 09.08.2024 | Transfer learning: подробный гайд для начинающих | Трансферное обучение, или Transfer Learning (TL) — это метод в машинном обучении, при котором модель, обученная для одной задачи, переиспользуется для другой, связанной задачи.
Представим, что человек умеет играть на гитаре и хочет освоить ... |
| 05.07.2024 | NER для начинающих: Простое объяснение с примерами на SpaCy | Что же такое, этот ваш NER?
Named Entity Recognition (NER) — это задача в области NLP (Natural Language Processing), направленная на выделение фрагментов в тексте, относящихся к классам, таким как имена людей, названия организаций, даты, ме... |
| 22.05.2024 | Распознавание именованных сущностей: механизм, методики, сценарии использования и реализация | Естественные языки сложны. А когда на горизонте появляется контекст, они становятся ещё сложнее. Возьмём для примера фамилию Линкольн. Некоторые сразу подумают о шестнадцатом президенте США, выдающейся исторической фигуре. Однако для других... |
| 15.05.2024 | Угрозы под контролем: применение ML для автоматического анализа отчётов | Привет, Хабр!
Меня зовут Валерия Чулкова, я продакт‑менеджер R‑Vision TIP. Сегодня вместе с Анастасией Перковой и Сергеем Ивановым мы расскажем про сервис для распознавания отчетов о киберугрозах, созданный командой экспертов в области маши... |
| 19.04.2024 | Гайд texthero pandas | Упрощенная обработка естественного языка (NLP)
Я всегда нахожусь в поиске новых инструментов, которые помогут мне упростить процедуру обработки естественного языка, поэтому, когда я наткнулся на короткий видеоклип, показывающий функциональн... |
| 15.03.2024 | Краткий обзор токенизаторов: что это такое и зачем это надо? | Токенизация — это первый шаг в обработке текстовых данных. Без токенизации компьютеры не смогли бы понимать текст и находить в нем полезную информацию. Токенизаторы помогают преобразовать текст в данные, которые можно анализировать и исполь... |
| 18.01.2024 | Делаем обучающие датасеты для больших языковых моделей | Дообучение больших языковых моделей на кастомных датасетах делает модели гораздо сообразительнее. Есть история успеха датасета Alpaca. Он творит чудеса с моделями, которые сначала если и умели что-то делать, то делали это очень плохо. Мы ре... |
| 07.11.2023 | Классификация авторства текстов. Обзор Kaggle соревнования «H2O Predict the LLM» | В день, когда Сэм Альтман в темной одежде на темном фоне рассказывал миру о запуске GPT-4-Turbo, в те же самые минуты на Kaggle завершалось небольшое, но любопытное соревнование “Predict the LLM”. Цель – узнать автора по тексту. Авторами те... |
| 20.10.2023 | Классификация текстов в spaCy: пошаговая инструкция | Классификация текстов – одна из основных задач в области обработки естественного языка (NLP – от англ. Natural Language Processing). Она имеет широкий спектр применений: определение тональности отзывов, категоризация новостей, фильтрация сп... |
| 10.07.2023 | Опенсорс-библиотеки для Python: 40+ вариантов, как упростить жизнь начинающего дата-сайентиста | «Удовольствие от программирования на Python должно заключаться в том, чтобы видеть короткие, лаконичные, удобочитаемые классы, которые выражают множество действий в небольшом количестве ясного кода, а не в грудах пустых символов, утомляющих... |
| 28.04.2022 | Open-source NLP company Deepset nabs $14M to power ‘plain-English’ enterprise search | We are excited to bring Transform 2022 back in-person July 19 and virtually July 20 - 28. Join AI and data leaders for insightful talks and exciting networking opportunities. Register today!
Let the OSS Enterprise newsletter guide your open... |
| 27.04.2022 | Если вы устраняете систематическую ошибку модели, то уже слишком поздно | Введение
Машинное обучение — это технологический прорыв, случающийся раз в поколение. Однако с ростом его популярности основной проблемой становятся систематические ошибки алгоритма. Если модели ML не обучаются на репрезентативных данных, у... |
| 25.03.2022 | Apache NLPCraft, подготовка к выходу мультиязычной версии 1.0 | Apache NlpCraft — библиотека с открытым исходным кодом, предназначенная для интеграции языкового интерфейса в пользовательские приложения.
Подробнее с проектом можно ознакомиться на его сайте или, например, по ссылкам на хабре. Состояние пр... |
| 23.12.2021 | Выбираем инструмент для разметки текста (и не только!) | Рано или поздно перед любой компанией, которая хочет внедрить системы машинного обучения в свою инфрастуктуру, встает вопрос разметки данных. Чистые данные в достаточно большом количестве - залог хорошей модели, все мы прекрасно знаем прави... |
| 12.10.2021 | Questions and Answers: The Information Content of the Post-FOMC Meeting Press Conference | October 12, 2021 Questions and Answers: The Information Content of the Post-FOMC Meeting Press Conference
Michiel De Pooter1 Introduction and Summary
Since 2011, the Chair of the Federal Reserve has held post-FOMC meeting press conferences.... |
| 02.09.2021 | Explosion snags $6M on $120M valuation to expand machine learning platform | Explosion, a company that has combined an open source machine learning library with a set of commercial developer tools, announced a $6 million Series A today on a $120 million valuation. The round was led by SignalFire, and the company rep... |
| 28.08.2021 | Расставляем ударения с помощью Natasha и Spacy | Представьте себя на месте изучающего русский язык иностранца. Ударение станет одним из ваших самых страшных ночных кошмаров. Во-первых, оно не описывается каким-то простым набором правил, и чаще всего правильное произношение приходится прос... |
| 10.08.2021 | Кейс: как разработать и вывести в продакшн рекомендательную систему для крупнейшего сервиса по созданию резюме... | Привет, меня зовут Боря, я технический директор в Poteha Labs.
2 2 комментария
529 просмотров
Существует определённая структура и ряд правил для составления резюме, именно на это обращают внимание HR-менеджеры при выборе кандидатов. Resume.... |
| 10.08.2021 | Кейс: как разработать и вывести в продакшн рекомендательную систему для крупнейшего сервиса по созданию резюме... | Привет, меня зовут Боря, я технический директор в Poteha Labs.
2 комментарии
898 просмотров
Существует определённая структура и ряд правил для составления резюме, именно на это обращают внимание HR-менеджеры при выборе кандидатов. Resume.io... |
| 07.08.2021 | Смотрим на Санкт-Петербург сквозь призму публикаций в соцсетях — базовый анализ популярных локаций | Магистры, аспиранты и сотрудники Института дизайна и урбанистики ИТМО рассказывают, как можно изучить публичный образ той или иной локации. Для Санкт-Петербурга они проанализировали более пяти млн публикаций из популярной в России соцсети с... |
| 02.06.2021 | GraphDB 9.8 Brings Text Mining and Kafka Connectivity | |
| 05.05.2021 | NEW RELIC, INC.
New Relic : Nonprofit Quill Relies on the Open Source Community and New Relic to Help Students Improve… | The New Relic Observability for Good program gives nonprofits free and discounted access to our world-class observability platform, along with discounts for AI functionality and access to pro bono services. We talked with Peter Gault, found... |
| 09.04.2021 | NLPCloud.io helps devs add language processing smarts to their apps | While visual ‘no code‘ tools are helping businesses get more out of computing without the need for armies of in-house techies to configure software on behalf of other staff, access to the most powerful tech tools — at the ‘deep tech’ AI coa... |
| 09.02.2020 | Tim Carmody: CTO at IPC, a Leading Financial Trading and Communications Tech Firm, Explains Role of Natural Language Processing in Finance | We recently caught up with Tim Carmody, Chief Technology Officer of IPC, a global leader in financial trading and communications technology solutions. Carmody, who has several decades of experience in designing and leading complex technolog... |
| 04.08.2018 | Обработка естественного языка — это весело: как научить компьютер понимать тексты
Может ли компьютер понять человека
Извлечение смысла из текста — сложный процесс
Пошаговое построение NLP-конвейера... | Отдел новостей 4 августа 2018, 08:55 Обработка естественного языка — это весело: как научить компьютер понимать тексты
Оставить комментарий... |
| 20.12.2017 | Choosing the best language to build your AI chatbot | Joe Lobo Contributor
Joe Lobo is a botmaster at Inbenta.
Jordi Fontseca Contributor
Jordi Fontseca is a web developer at Inbenta.
Which language is the best for your chatbot?
No, this is not about whether you want your virtual agent to unde... |
| 27.01.2017 | 4 AI startups that analyze customer reviews | Already, as of 2010, a quarter of Americans (24 percent) had posted product reviews or comments online, and 78 percent of internet users had gone online for product research. But those are ancient stats. Numbers are higher now. More recentl... |
| 27.01.2017 | 4 AI startups that analyze customer reviews | We are excited to bring Transform 2022 back in-person July 19 and virtually July 20 - 28. Join AI and data leaders for insightful talks and exciting networking opportunities. Register today!
Already, as of 2010, a quarter of Americans (24 p... |
| - | Лучшие Проекты Для Начинающих Python-Разработчиков | Чтобы научиться ходить – надо ходить, чтобы научиться подтягиваться – надо подтягиваться, чтобы научиться решать задачи по физике – надо решать задачи по физике. Так говорил преподаватель физики в моём университете, и эта аналогия применима... |
| - | Модели глубоких нейронных сетей sequence-to-sequence на PyTorch (Часть 1) | Введение
Этот туториал содержит материалы полезные для понимания работы глубоких нейронных сетей sequence-to-sequence (seq2seq) и реализации этих моделей с помощью PyTorch 1.8, torchtext 0.9 и spaCy 3.0, под Python 3.8. Материалы расположен... |