约2400个站点、约8900台设备一本台账 · 自动化只提议,合并由我手工做
大型零售连锁的基础设施都散在表格里,没人核对。我用 NetBox 建了台账:约2400个站点,约8900台设备。12个定时器从各系统取数、比对、回写、查质量。网络设备的轮询结果进独立分支,由我手工合并。自动化不删任何东西。这是规矩,不是配置项。仓库跑 GitLab CI,841个测试全绿。
关于
12+ 年俄罗斯企业 IT 基础设施经验。从 IT 外包的用户支持与系统管理起步,逐步成长为全栈系统架构师,技术覆盖机房、网络、虚拟化、AD / Exchange,直至生产环境的 AI 智能体。同样擅长:从零搭建基础设施、通过 AI 智能体自动化复杂业务流程、把 LLM 落地到真实业务流程中。专注为出海俄罗斯市场的中国科技企业提供本地化部署、数据合规(152-ФЗ)与跨境基础设施集成(1C / Yandex Cloud / VK Cloud)。
我的工作原则很简单:先弄清业务为什么需要;任何变更之前先准备回滚方案;完成之后写好文档,让系统离开我也能稳定运行。我对那些「谁都不敢动」的遗留系统情有独钟,喜欢把它们整治到谁都敢动的状态。
案例
约2400个站点、约8900台设备一本台账 · 自动化只提议,合并由我手工做
大型零售连锁的基础设施都散在表格里,没人核对。我用 NetBox 建了台账:约2400个站点,约8900台设备。12个定时器从各系统取数、比对、回写、查质量。网络设备的轮询结果进独立分支,由我手工合并。自动化不删任何东西。这是规矩,不是配置项。仓库跑 GitLab CI,841个测试全绿。
Keycloak 自研 2FA 提供方,Web 层为 OWA 和 Outlook 客户端做 SSO
Exchange 做不到我们要的第二因子。它的内部也没人肯让动。于是把 ANGIE 放到 OWA 和 Outlook 客户端前面,2FA 挪进 Keycloak,提供方自己写。Exchange 一行没改。已上生产,全公司邮件流量都走这条路。
2国4站点 · 100–200用户 · 50+台服务器 · 邮件、AD、网络、证书,一个人做完
两个国家,四个站点。开局一片空白。搭起 AD、跨站点 Exchange DAG、PMG 加 HAProxy SNI 路由的邮件链路。路由本身跑在 MikroTik RouterOS 7 上的 WireGuard + GRE + OSPF。证书自己签发,自己装到 Exchange。做了能查清事故的邮件追溯,又用 BookStack 把这些都记下来。一个人,从设计到交付。
Windows 与 macOS 原生客户端,策略带签名 · 更新信任绑到签发 CA
Windows 和 macOS 的企业访问客户端,加一个服务端策略面板。策略我用 ECDSA P-256 签,客户端拿内置密钥验。更新的信任绑到签发 CA,不绑指纹。绑指纹的话,证书一换,全部终端立刻更新失败。机器数据和用户配置分开。面板登录走域账号 Kerberos。测试从31条涨到175条。都在生产跑着。
证书60天有效、自动续期 · 服务接入一条命令 · 其余走面板
证书靠手工签,于是时不时干脆没人签。我搭了内部颁发机构。中间 CA 由企业 Windows CA 签,新根证书谁都不用装。ACME 签60天,自动续期。服务接入就一条命令加一个 reload 钩子。没有钩子,续下来的证书到不了守护进程。ACME 够不着的地方,用面板签。生产上目前只有 Linux。
报告能不能看,由目录组说了算,不用再手工开通
报告放在 GitLab Pages,权限一个个手工开。我写了个网关:先走企业 OIDC 登录,再在每份报告前校验目录组。GitLab 本身不对外。最费劲的是 cookie。整份组列表塞不进 4KB,用户等来的不是报告,是无限重定向。现在只放组和访问映射的交集。权限单位改成报告类型。73个测试,边写边测。
24个应用自动更新,多数已上生产 · VDI 卡死修复不丢会话
大约4600台终端。遗留的管理服务器动不得,新的就在旁边并行搭起来,生产没停。目录自己更新:抓厂商版本,校验签名和哈希,替换旧包,继续分发。24个应用,大多已在生产。VDI 那边写了个门户。它靠保存并恢复虚拟机来修卡死的输入:用户不丢会话,我也不用接电话。
在约2.3万账户的林中审计并修复 GPO 与 ACL,分阶段推进,每步可回滚
七个域、约2.3万个活动账户的林,里面的策略几十年里被不同的人改过。写了17个 PowerShell 脚本:找出坏掉的策略,修回被批量降到 Authenticated Users 的 Security Filtering,清掉失效的 NetLogon ACE。每次跑先做预检,再分三个阶段。每步都有备份和回滚路径。几百条 GPO。没有一次是盲改。
约2.3万个活动账户的林:Windows Server 2008 → 2022,七个域并为一套结构
七个域、约2.3万个活动账户的林,生产上跑着 Windows Server 2008,复制看运气。把林升到当前版本,结构统一。角色分到三个站点,多个域的对象合并成一个。复制变得可预期。这本来就是目的。
统一监控加站点地图;故障不再躲在无期限抑制下面
Zabbix 加远端网络里的代理,Grafana 仪表盘用来定位故障。日常活儿用脚本和 Docker 收口。后来补了地理维度。站点地址台账里本来就有,坐标靠自带的同步拿过来,自己的代码一行没写。约2000张门店地图。又清了无期限的人工抑制:数量比该有的多出好几倍,故障就安稳躲在下面。覆盖是全的,有些点只到城市一级。
站点间 IPSec、备份链路,互联网账单降了约三分之二
几个办公室和两个数据中心各过各的。用站点间 IPSec 把它们并成一个受控环境。到数据中心的链路在 MikroTik 和 OpenVPN 上重做,一部分设备换了位置。互联网账单降了大概三分之二。
Hyper-V → ESXi,ESXi 5 → 6.7,vCenter 7,约15节点高可用集群
虚拟化统一到 VMware。Hyper-V 上的虚机全部转过来,部署 vCenter 7。又做了约15台物理节点的高可用集群。同时还带着 vCloud Director 的云。
三站点备份,网络设备配置自动留存,配套 DRP
三个站点都做备份。虚机由 Veeam 全量覆盖,网络设备配置自动备份。恢复计划写好了,放在找得到的地方。验证靠真恢复,不是报告上打个勾。
幻觉根因在工具层 · 上下文里的工具目录压掉一半
可以用大白话问基础设施的智能体。LLM 通过 tool-calling 调台账和监控的 MCP 服务器,答案发到机器人里。跑了15道对照题,每个答案都跟库里核对。如实的有6道。问题不在模型:查询 schema 太窄,没有可靠计数,步数上限卡死。这些都在工具层,修也在那儿修。工具目录每轮都要发给模型,所以压掉了一半。已在生产。暂时没人用。
三个智能体经 MCP Memory Server 协作,对抗式 diff 评审:38留13,32留14
复杂系统我一个人扛,就在身边搭了三个智能体:战略、知识库管理、IDE 里的开发。它们经 MCP Memory Server 通信。第二轮加了对自己 diff 的对抗式评审:先几个独立视角看,再由两个怀疑者逐条推翻。两次跑下来,38条留13条,32条留14条。“确认”在这里的意思是“没能推翻”。没有外部验证。
Python 导出接进 BI,GPT-4 自动分析通话并回写 CRM
企业 PBX 和运营商虚拟 PBX 都归我运维。顺手把通信费也压下来了。统计用 Python 导出,接进 BI。通话交给 GPT-4 分析,报告直接进 CRM,发给主管。
经历
Detsky Mir
莫斯科
企业客户(NDA)
莫斯科
Leto Realty
索契
Digital Systems
索契

Gift66(ekb.gifts) · 个体经营
叶卡捷琳堡
SKB Kontur
叶卡捷琳堡
Fresh Support · IT 外包
叶卡捷琳堡
课程
Skillbox · 在线
技术栈
全部在生产环境中实际使用过的技术。不是简历里的清单,而是真正搭建并维护过的东西。
企业基础设施的核心:从虚拟化平台到统一身份认证。
把多个站点连成统一网络,并守住安全边界。
一切重复性工作皆化为代码:IaC、配置、容器。
把 LLM 接入生产环境创造价值,而不是停留在演示里。
联系