#llm — посты и обсуждения
22 доступных поста
В статье рассматривается, как современное управление данными и архитектура, готовая к внедрению ИИ, помогают предприятиям управлять качеством данных, рисками, соответствием нормативным требованиям и ИИ в масштабах всей организации. Особое внимание уделяется переходу от традиционного управления данными, ориентированного на отчётность и соблюдение требований, к единой модели управления данными и ИИ, в которой данным доверяют не только люди, но и машины — включая автономных агентов, генеративные модели и интеллектуальные системы принятия решений.
Ключевые слова: управление данными, Data Governance, AI Governance, агентный ИИ, мультиагентная оркестрация, AI TRiSM, MCP, A2A, Data Fabric, Data Mesh, Data Contracts, качество данных, происхождение данных, наблюдаемость, контекстная инженерия, Agent Identity, MLOps, DataOps, векторные базы данных, RAG, нулевое доверие, конфиденциальность, регуляторное соответствие.
1. Введение: почему управление данными становится ядром агентной эры
Современное предприятие генерирует и потребляет беспрецедентные объёмы данных в операционных системах, при взаимодействии с клиентами, в партнёрских экосистемах, облачных приложениях, устройствах IoT и на платформах искусственного интеллекта.
Одновременно системы ИИ становятся не просто инструментами аналитики, а активными потребителями корпоративных данных: они принимают решения, генерируют контент, рекомендуют действия, автоматизируют рабочие процессы и всё чаще действуют автономно.
Низкое качество данных — это уже не только проблема отчётности. Это фундаментальная проблема искусственного интеллекта. Неточные, неполные, устаревшие или плохо управляемые данные приводят к предвзятым результатам, нарушениям нормативных требований, галлюцинациям LLM, ошибочным бизнес-решениям и подрыву доверия клиентов. По оценкам Gartner, плохое качество данных обходится организациям в среднем в 12,9 млн долларов в год, а для финансовых организаций медианный показатель достигает 49 млн долларов.
Традиционные программы управления данными создавались прежде всего для поддержки бизнес-аналитики и соблюдения нормативных требований. Однако эра ИИ предъявляет новые требования: управление моделями, объяснимость, происхождение данных, этичное использование ИИ, наблюдаемость данных, управление подсказками и контекстом, а также автономное принятие решений. Поэтому организациям необходим переход к единой модели управления данными и ИИ, которая гарантирует, что данным будут доверять и люди, и машины.
Неэффективное управление данными ведёт к некорректной работе ИИ-систем, искажению результатов моделирования, нарушению регуляторных требований, инцидентам безопасности, росту операционных затрат, подрыву доверия клиентов и неверным бизнес-решениям.
Таким образом, управление данными трансформировалось из функции обеспечения соответствия в стратегическую бизнес-возможность. Предприятия, создающие надёжную, управляемую и доступную базу данных, лучше подготовлены к масштабированию ИИ-инициатив, ускорению инноваций и формированию устойчивых конкурентных преимуществ.
Основные цели управления данными:
- повышение гибкости принятия бизнес-решений на основе данных;
- обеспечение беспрепятственного обмена знаниями внутри предприятия;
- устранение двусмысленности и укрепление доверия к данным;
- повышение доверия к данным, улучшение процесса принятия решений и ускорение циклов инноваций;
- улучшение соответствия нормативным требованиям, сокращение дублирования данных и повышение гибкости бизнеса.
Для полного понимания этих целей важно осознать ключевую роль управления данными в рамках более широкой стратегии управления данными предприятия. В этом документе рассматриваются проблемы, возможности обработки данных следующего поколения, современная архитектура данных и стратегические соображения, необходимые для создания готовой к использованию ИИ базы данных.
2. Терминологическая база
Для профессионального обсуждения важно различать несколько понятий.
Управление данными (Data Management) — совокупность процессов, ролей, политик, стандартов и технологий, обеспечивающих эффективное использование данных на протяжении всего жизненного цикла.
Управление данными как governance (Data Governance) — система принятия решений и подотчётности: кто владеет данными, кто отвечает за качество, кто определяет политики, как обеспечивается соответствие и как измеряется ценность.
AI-ready data — данные, которые обладают не только качеством и полнотой, но и семантической согласованностью, прослеживаемостью, управляемыми правами доступа, документированным происхождением и пригодностью для машинного потребления.
Агентный ИИ (Agentic AI) — системы, способные планировать, вызывать инструменты, использовать память, взаимодействовать с API и автономно выполнять задачи от имени пользователя или организации.
Мультиагентная оркестрация — архитектурный паттерн, при котором несколько специализированных агентов делегируют задачи друг другу, образуя цепочки и графы вызовов для решения сложных задач. Gartner прогнозирует, что к 2028 году 70% AI-приложений будут использовать мультиагентные системы.
Data Product — управляемый набор данных или сервис данных с владельцем, SLA, контрактом, документацией, метриками качества и измеримой бизнес-ценностью.
Data Contract — формальное соглашение между производителем и потребителем данных, описывающее схему, семантику, качество, SLA, права доступа, происхождение, версионирование и правила изменения...
#DST #DSTGlobal #ДСТ #ДСТГлобал #AITRiSM #MCP #A2A #DataFabric #DataMesh #оркестрация #Data Governance #AIGovernance #агентныйИИ #LLM #искусственныйинтеллект #GDPR #HIPAA #потоковыеданные #IoT #Iceberg #DeltaLake #Parquet #Airflow #HabeasWeights #auniversum #ауниверсум #Lambdauniversum #LOGOSk #SemanticDB #Efos #BlindSpots
Источник: https://dstglobal.ru/club/1261-upravlenie-dannymi-v-epohu-agentnyh-tehnologii
Развивая данную тему поинтересовался, а может ли ИИ (#LLM) в том виде, котором мы их используем через чаты и API решать задачу поиска оптимального решения.
Были взяты самые популярные сервисы: #YandexGPT 5.1 (через #API с векторной базой #YDB и без), #DeepSeek 4 Flash (через API Yandex Cloud), #GigaChat 3.5 Ultra (чат), #ChatGPT-5.6 Luna, #Claude Sonnet 5.
Проверка результата через #RStudio.
Для примера была взята классическая задача (поиск весов ИИ), это поиск минимальных остатков. В математике, это метод наименьших квадратов (МНК).
Где применяется? Например, расчет премий по лестнице достижений (% продаж). Или решение задачи подбора параметров в матрицу через функцию минимизации затрат или максимизации выручки. В Excel для этого часто используют функции ВПР или ПОИСКПОЗ+ИНДЕКС.
Немного ранее писал, что решил свою давнюю задачу по запуску обучения разных видов (ИИ) моделей (DNN, LSTM и др) на исторических данных “с учителем”.
Первая
Вторая
https://finbazar.ru/post/818752-kak-menyaetsya-equity-esli-uchitel-ii-dnn-lstm-budet-menee-dergannym
Так вот.
Постановка задачи
Использовать свернутые данные в один числовой вектор (‘x’) по котировками и второй вектор (‘y’) с метками от 1 до 2 (продать или купить) в качестве учителя (‘dt_train / train’).
Второй вектор (‘test’), тестовый, использовать в качестве задачи поиска наиболее подходящего значения из набора train. Найти значение с наименьшим разностным остатком, вывести найденное значение, вывести соответствующее значение из вектора ‘y’, подсчитать процент совпадения ‘p’. Вывести результат в JSON формате и таблице.
Предварительно был загружен тренировочный набор ‘dt_train / train’.
Промпт выглядит так:
x
1,053252588
-0,293614992
-0,194761592
-0,34980501
-0,310607875
-0,051729657
-0,367246745
0,287114539
-0,427839421-0,370099426
Сопоставь со значениями из поискового индекса dt_train / train, найди наиболее подходящие значения из колонки 'y'. Напротив каждой строки, дополнительно выведи колонку 'p' с вероятностью совпадения. Выведи только результат в формате JSON.
На все результаты будет отдельная ссылка (текстовый файл), так как много “воды” в ответах чатов ГПТ, экономлю ваше время. Кто захочет, посмотрит и возможно перепроверит результаты.
Результаты тестирования
№ 1
https://disk.yandex.ru/i/yUXdVozT6mwMlQ
Не удовлетворительно.
№ 2
https://disk.yandex.ru/i/AIiaKTZPHY8LiA
Не удовлетворительно.
№ 3
https://disk.yandex.ru/i/rwg7xTKr5V6Bug
Не удовлетворительно.
№ 4
https://disk.yandex.ru/i/CXm8vnrPAJHtVA
Тест пройден, точность 100%.
№ 5
https://disk.yandex.ru/i/YaAxdFUVs-4y5g
Не удовлетворительно.
№ 6
https://disk.yandex.ru/i/zT1eNJ4yoBg2_g
Тест пройден, точность 100%.
№ 7
https://disk.yandex.ru/i/MUmFz3z0b0uXDw
Тест пройден, точность 100%.
№ 8
https://disk.yandex.ru/i/SFr-NTmgdpl80Q
Не удовлетворительно.
№ 9
https://disk.yandex.ru/i/BfeLsyutneYScg
Не удовлетворительно.
Расшифровка
№ 1 - DeepSeek 4 Flash (~2-5 минут) - не удовлетворительно
№ 2 - DeepSeek 4 Flash (~2-5 минут) - не удовлетворительно
№ 3 - DeepSeek 4 Flash (~2-5 минут) - не удовлетворительно
№ 4 - Claude Sonnet 5 (40 секунд) - тест пройден, точность 100%.
№ 5 - GigaChat 3 Ultra (10 секунд) - не удовлетворительно
№ 6 - RStudio, язык R (0,01 секунда), скрипт - https://disk.yandex.ru/i/RSHBKPumr1jMUw - тест пройден, точность 100%.
№ 7 - ChatGPT-5.6 Luna (10 секунд) - тест пройден, точность 100%.
№ 8 - Excel ВПР, ПОИСКПОЗ+ИНДЕКС (1 секунда + сортировка)
№ 9 - ChatGPT-5.6 Luna (10 секунд) - не удовлетворительно
Полный пакет файлов с результатами и исходниками - https://disk.yandex.ru/d/-kBOHYdMpTyG_w
Выводы
Будьте очень осторожны при постановке задач поиска оптимального математического решения (задача оптимизации по минимальной или максимально функции), когда делегируете это в ИИ модели (чаты или API). Из ИИ доступных сервисов и чатов GPT, задачу поиска подходящего значения через минимальные остатки решил только Claude Sonnet 5 за 40 секунд.
ChatGPT сначала выдал не правильно, потом правильно.
DeepSeek не смог решить задачу, всегда выдавал разные результаты и очень долго это делал.
YandexGPT 5.1 не решил, так как выходных токенов ему не хватило, уперся в свои ограничения. Даже с YDB.
Excel с некоторым приближением достаточно хорошо решает подобные задачи, но не здесь.
В RStudio на языке R эта задача выполняется за 0,01 секунду, с помощью одной строки: nearest_idx <- sapply(x, function(v) which.min(abs(target_x - v))).
В данный момент сервисы с LLM моделями либо не могут решить, либо расходуют слишком много времени (энергии) на ее решение.
Был ли у вас какой либо положительных или отрицательных опыт, поделитесь.
Три термина — искусственный интеллект (ИИ), машинное обучение (МО) и глубокое обучение (ГО) — сегодня на слуху, но их часто путают или используют как синонимы. Между тем за этими понятиями стоит не только иерархия технологий, но и драматичная история научных взлётов и разочарований, разные математические парадигмы и инженерные практики. Понимание этих различий критично не только для исследователей, но и для бизнеса, который выбирает между простой регрессией и многомиллиардной языковой моделью.
В этой статье мы разберём эволюцию подходов, объясним ключевые архитектуры, сравним классическое машинное обучение и глубокое обучение с точки зрения данных, вычислений, интерпретируемости и жизненного цикла. Мы также затронем вопросы MLOps и этики, без которых невозможно построить надёжную промышленную систему.
1. Иерархия технологий: луковица интеллекта
Искусственный интеллект — это широкая область информатики, цель которой — создание систем, имитирующих когнитивные функции человека: восприятие, рассуждение, обучение, планирование. Однако способы достижения этой цели исторически менялись.
- Искусственный интеллект включает любые интеллектуальные системы: от экспертных систем, основанных на правилах, до современных нейросетевых моделей.
- Машинное обучение — подход, при котором система не программируется явно, а обучается на данных, выявляя закономерности.
- Глубокое обучение — метод машинного обучения, использующий многослойные нейронные сети для автоматического извлечения иерархических признаков.
Таким образом, ГО ⊂ МО ⊂ ИИ. Но чтобы понять, почему эти слои сформировались именно так, нужно обратиться к истории.
2. Исторический контекст: зимы и возрождения ИИ
Развитие ИИ никогда не было линейным. Оно шло через циклы завышенных ожиданий, провалов и возрождений.
2.1. Символический ИИ и первая зима (1950–1970-е)
Первые системы ИИ (1950–1960-е) строились на символьных вычислениях: логических правилах, деревьях поиска, экспертных базах знаний. Считалось, что интеллект можно описать формальными символами и манипуляциями над ними. Однако к началу 1970-х стало ясно: машинный перевод далёк от совершенства, а универсальные решатели задач упираются в комбинаторный взрыв. Финансирование (особенно от DARPA) резко сократилось — наступила первая «зима ИИ».
2.2. Экспертные системы и вторая зима (1980-е — начало 1990-х)
В 1980-х наступил ренессанс: коммерческий успех экспертных систем (например, XCON для конфигурации компьютеров DEC) привлёк инвестиции. Появились специализированные Lisp-машины, японский проект Fifth Generation обещал создать компьютер нового поколения. Но рынок рухнул: экспертные системы оказались дорогими в сопровождении, хрупкими и плохо масштабировались. К началу 1990-х вторая зима похоронила символический подход.
2.3. Статистическое обучение: тихое возрождение (1990-е — 2000-е)
Пока символисты доминировали, статистические методы — байесовские сети, SVM, ансамбли — постепенно набирали силу. Именно они легли в основу современного машинного обучения. Алгоритмы вроде Random Forest и градиентного бустинга показали, что можно строить точные модели на табличных данных без попыток воспроизвести «мышление». Этот период ознаменовал переход от «инженерии знаний» к «обучению на данных»...
#DST #DSTGlobal #ДСТ #ДСТГлобал #Искусственныйинтеллект #машинноеобучение #глубокоеобучение #LLM #ChatGPT #ГаллюцинацииLLM #EUAIAct #DataDrift #ConceptDrift #StableDiffusion #DALLE #BERT #GPT #AlphaGo #DARPA
Источник: https://dstglobal.ru/club/1254-iskusstvennyi-intellekt-mashinnoe-i-glubokoe-obuchenie
Термином «ИИ-агент» уже второй год закидывают всё подряд, и многие до сих пор путают его с прокачанным ИИ чат-ботом.
По-факту, разница принципиальная:
ИИ чат-бот отвечает на вопрос, а ИИ-агент сам решает, что делать и в каком порядке, действует от вашего имени и доводит задачу до результата — сходит на сайты и достанет оттуда инфу, сгенерит табличку, напишет кусок кода, разберётся в куче файлов и т.д., а не просто выдаст текст, который вам ещё разгребать руками.
Именно эти способности ИИ-агентов бизнес и купил.
В 2026 году компании удваивают свои инвестиции в ИИ, и почти половина этих денег идёт именно в ИИ-агентов.
Потому что большинство руководителей наконец ждут не хайпа, а окупаемости, и ИИ-агенты дают её лучше, иногда.
Логично, что первыми тут оказались те, кто уже вложился в модели по-крупному.
За рубежом — это Claude Cowork от Anthropic и недавний Work от GPT, а у нас в похожую степь недавно двинулся Сбер со своим GigaCowork.
И вот, с ним есть любопытный момент.
На Хабре, из чистого исследовательского азарта, решили глянуть, что у него там под капотом.
Через фингерпринтинг — задавали простые вопросы вроде «назови цвет» или «какие часы» — и получали узнаваемый набор ответов («синий», Rolex, ...), характерный для конкретной модели.
По совокупности примёт пришёл к выводу, что внутри сидит китайский Qwen3-235B.
Значит ли это, что тут нет своей разработки, а Сбер просто гоняет китайский опенсорс?
Ну, не совсем, так сказать и сие было бы большим упрощением.
Тут очень похоже на торговую марку из ритейла.
Условная Пятерочка или Ашан продают под своим лейблом крупу, которую физически делает третий завод, а сами вкладываются в закупки, логистику и полку, и чтобы вам было удобно и хорошо. Значит ли это, что вам нужно закупаться на заводе, а не в магазине? Нет, конечно, ведь ценность в другом.
Вот и с ИИ-агентами разумно поступать так же, потому что главное — это финальный результат, юзабилити, сценарность и т.д.
Обучение своей LLM топ-уровня стоит сотни $ миллионов, так что кое-где (в конкретной области) взять сильный опенсорс и сфокусироваться на его адаптации и агентной обвязке сверху — вполне здравый ход.
Да, это хорошая новость для всех, кто смотрит на рынок ИИ-агентов в России.
В какой-то точке развития решать начинает не то, чья модель под капотом, а как быстро дотянут обвязку — память, разрешения, интеграции и пр.
А ресурсов и данных, чтобы это сделать быстро, у Сбера как раз точно хватит.
#Россия #Сбер #бизнес #ИИ #AI #LLM
https://habr.com/ru/articles/1074136/
Пост №3.2 (из 4)
AI-заводы: не только лиды. Топ-10 направлений. Часть 2
Продолжаю серию из 4 постов про направления AI-заводов. В первой части разобрал контент-завод и завод обработки заявок. Теперь — ещё три мощных сценария.
3. Завод подготовки коммерческих предложений
Что делает: превращает вводные от клиента (запрос, бриф, встречу) в структурированное КП с ценами, сроками, условиями.
Этапы:
экстракция требований и ограничений;
подбор типовых решений из базы кейсов;
расчёт стоимости и сроков по шаблонам;
генерация текста КП в нужном тоне;
проверка менеджером / юристом;
отправка клиенту + логирование версии.
Результат: КП готовятся за минуты, а не часы, с единым стандартом качества.
4. Завод первичного анализа документов
Что делает: принимает договор, оферту или заявку, выделяет ключевые пункты, риски, несоответствия внутренней политике.
Этапы:
извлечение сторон, сроков, сумм, условий;
проверка по чек-листу рисков (штрафы, односторонние изменения, конфиденциальность);
сравнение с типовой формой компании;
генерация саммари: «зелёные / жёлтые / красные зоны»;
human approval юриста;
вывод: отчёт + рекомендации.
Результат: юристы тратят время на сложные случаи, а не на первичный разбор.
5. CRM-завод повторных продаж и удержания
Что делает: анализирует базу клиентов, сегментирует, готовит персонализированные предложения и напоминания.
Этапы:
сегментация: по последнему заказу, сумме, давности, категории;
подгрузка истории взаимодействий;
генерация предложений: доп. услуги, апсейл, реактивация;
планирование касаний (email, мессенджер, звонок);
human approval маркетинга / аккаунт-менеджера;
отправка + фиксация реакции.
Результат: растёт LTV, возвращается «уснувшая» база без ручного перебора.
Продолжение следует! В следующей части — заводы обучения, аналитики и онбординга.
#AIзавод #LLM #оркестрация #автоматизация #бизнес #стартап #AIагенты #vibecoding #технологии #предпринимательство
Пост №3.1 (из 4)
AI-заводы: не только лиды. Топ-10 направлений. Часть 1
Вы уже видели мои посты про AI-завод по лидам. Но если вы думаете, что AI-заводы — это только про лидогенерацию, вы упускаете 90% возможностей.
AI-завод — это не «бот для клиентов». Это архитектура повторяемого бизнес-процесса, в котором модели, агенты, API, базы знаний, скрипты, проверки и люди последовательно создают измеримый результат.
Сегодня начинаю серию из 4 постов с топ-10 направлений, где такие заводы уже приносят пользу. Сохраняйте, чтобы не потерять.
1. Контент-завод
Что делает: превращает одну идею / интервью / вебинар в серию постов, статей, сценариев, рассылок и каруселей.
Этапы:
экстракция ключевых тезисов из исходника;
адаптация под разные форматы (пост, статья, сценарий, email);
проверка на факты и соответствие тону бренда;
human approval редактора;
публикация или отправка в контент-план.
Результат: в 3–5 раз больше контента при том же объёме исходного материала.
2. Завод обработки заявок и квалификации лидов
Что делает: принимает заявки из разных каналов (сайт, Telegram, почта, формы), классифицирует, извлекает данные, готовит черновик ответа.
Этапы:
классификация: sales / support / billing / other;
экстракция: имя, контакт, суть запроса, приоритет;
подгрузка истории клиента из CRM / базы;
генерация персонализированного черновика;
human approval для критичных случаев;
отправка ответа + обновление CRM.
Результат: быстрее реакция, меньше рутины у менеджеров, выше конверсия в диалог.
Продолжение следует! В следующей части — заводы КП, анализа документов и повторных продаж.
#AIзавод #LLM #оркестрация #автоматизация #бизнес #AIагенты #vibecoding #технологии #предпринимательство