Локальный запуск LLM для SOC: сколько инцидентов обработает одна GPU? Часть 2Всем привет! На связи Сергей Иванов, аналитик технологий машинного обучения R‑Vision. В первой части эксперимента мы выяснили, как на производительность локальной LLM влияют длина контекста, количество параллельных запросов и объем генерируемого ответа. Стресс‑тесты позволили определить границы конфигурации Qwen3.5–122B‑A10B‑GPTQ, vLLM и NVIDIA RTX PRO 6000 Blackwell Max‑Q с 96 GB видеопамяти. Однако предельная конкурентность и скорость генерации сами по себе еще не показывают, насколько такая конфигурация подходит для реального SOC. В промышленном сценарии запросы поступают не равномерно и не изолированно. Они создаются карточками инцидентов, шагами ИИ‑оркестратора и действиями аналитиков, а порядок их выполнения определяется логикой расследования. Во второй части эксперимента мы перешли от лабораторных измерений к моделированию реальной работы SOC. Мы оценили, как GPU справляется с инференсом LLM при разной ...
Related
Are Latent Reasoning Models Easily Interpretable? https://lobste.rs/s/obo3ie #aihttps://arxiv.org/abs/2604.04902
Are Latent Reasoning Models Easily Interpretable? https://lobste.rs/s/obo3ie #aihttps://arxiv.org/abs/2604.04902
APEX-VW: A Document-Level English-Spanish Post-Editing Dataset in the Healthcare DomainSource: arXiv cs.CLhttps://arxiv....
APEX-VW: A Document-Level English-Spanish Post-Editing Dataset in the Healthcare DomainSource: arXiv cs.CLhttps://arxiv.org/abs/2608.08059#MachineLearning
Bede Liu, a digital signal processing pioneer, has diedArticle URL: https://spectrum.ieee.org/digital-signal-processing ...
Bede Liu, a digital signal processing pioneer, has diedArticle URL: https://spectrum.ieee.org/digital-signal-processing Comments URL: https://news.ycombinator.com/item?id=49314615 ...