• 外包信息请发到 /go/outsourcing 节点。
• 不要把相同的信息发到不同的节点
saintube
V2EX  ›  酷工作

[校招] 通义大模型-Token Foundry-AI Infra 工程师-容器方向

  •  
  •   saintube · 3 days ago · 1545 views
    # 通义大模型-Token Foundry-AI Infra 工程师-容器方向

    ## 基础信息

    毕业起止时间要求:2026-11-01 - 2027-10-31

    ## 职位描述

    你将成为大模型技术落地的“算力内核设计者”。你将深入 Kubernetes 生态,参与构建支撑超大规模 AI 集群的容器化基础设施,通过对调度、存储、网络等核心组件的深度定制与优化,打破大模型训练与推理的工程瓶颈。你的代码将直接优化 Agent 的冷启动速度,提升 GPU 集群的吞吐量与资源利用率,为 AI 时代的算力底座注入极致性能。

    具体的职责包括以下相关方向的一项或多项:
    1. AI 容器调度与编排优化:
    - 深度优化 Kubernetes 调度器,实现面向 GPU 拓扑感知的算力分配,解决大规模分布式训练任务的资源碎裂问题。
    - 设计并实现面向 AI Agent 的弹性调度策略,通过多级缓存、预加载等手段,实现分钟级到秒级的 Agent 快速拉起与自动伸缩。
    2. AI 高性能存储与网络底座:
    - 针对 AI 大规模 checkpoint 与数据读取场景,优化容器存储挂载性能,通过存储卸载与并行化技术,解决分布式训练中的 I/O 阻塞问题。
    - 优化容器网络性能(如 RDMA/RoCE 深度集成),通过内核态路径优化,降低推理请求的网络传输延迟。
    3. AI 工程平台架构设计与效率提升:
    - 负责大型 AI 项目工程平台的架构设计与规划,通过构建标准化的云原生技术底座,确保复杂计算场景下的系统高可用性与可扩展性。
    - 针对大规模 AI 任务执行过程中的痛点进行架构级优化,通过降低系统开销与资源冗余,显著提升系统运行效率。
    - 定义面向 AI 场景的资源管控标准与作业管理规范,解决大规模并行任务下的资源争抢与隔离难题,确保高负载生产环境的稳定性。
    4. AI 基础设施极致加速:
    - 研发面向 AI 推理与 Agent 运行的轻量化容器运行时,实现计算资源的极致弹性与高密部署。
    - 构建 AI 场景下的监控与调优平台,深度剖析容器化环境下的性能瓶颈,实现从底层硬件到应用层的全链路性能优化。
    - 负责容器镜像基础服务设计与研发,针对 AI 业务特征及需求,深度优化产品架构及技术实现,为 AI 业务大规模使用等场景提供高效极致的产品能力。
    - 设计研发基于 AI 的智能应用弹性及资源弹性产品能力,推动对 AI 应用场景的端到端弹性伸缩优化。
    - 设计研发自主智能运维 Agent ,通过自动故障感知根因定位与自愈决策闭环,提升运维效率。

    ## 职位要求

    1. 基础条件:

    - 计算机、软件工程等相关专业优先。
    - 热衷于数据结构和算法,在 ACM/ICPC 等竞赛中成绩优异者优先;有 K8s 或容器相关开源社区贡献( Kubernetes/KubeFlow/Volcano/OpenKruise 等)或高性能存储/网络开发经验者加分。

    2. 专业能力:

    - 系统工程与编程能力: 具备扎实的 Linux 系统底层基础(熟悉网络栈、文件系统、进程管理等),熟练掌握 Go 语言(核心)、Java 、Python 或 C++,具备复杂的分布式系统调试能力。
    - 容器与编排生态: 对 Kubernetes 架构有深入理解,熟悉容器 Runtime ( Docker/containerd/CRI )原理,有 K8s 自定义 Controller/Scheduler 开发经验者优先。
    - AI 系统领域专业知识:
    - 理解 AI 推理/训练的资源特征(如显存、带宽、通信模式)。
    - 熟悉容器化环境下 AI /Agent 任务的架构及部署链路,了解如何通过容器技术优化模型加载、Checkpoint 保存、Memory 管理等环节。
    - 对大规模分布式工程架构有一定理解,关注系统的高可用性、可观测性及研发效能的提升。

    3. 能力特质:

    - 极致的性能追求:乐于挑战“毫秒级”的延迟瓶颈,具备良好的性能分析工具(如 ebpf, perf, flamegraph 等)使用与系统调优能力。
    - 工程化思维:具备良好的系统抽象与架构设计能力,能够将复杂的 AI 场景痛点转化为高可用、高可靠的系统工程方案。
    - 跨域协同:具备良好的技术视野,能够与模型算法工程师高效沟通,理解算力对业务的支撑逻辑,从底层视角拆解并解决 AI 工程挑战。
    - 极客精神:对 AI 大模型技术充满热情,渴望在分布式系统与大规模算力平台的交汇处实现技术突破。

    ## 联系方式:

    - mailto:rougang.hrg@alibaba-inc.com
    - 内推码:XKI7JC
    saintube
        1
    saintube  
    OP
       3 days ago
    团队多个校招岗位在招,校招刚启动,hc 充足,欢迎投递~
    saintube
        2
    saintube  
    OP
       3 days ago
    ---

    # 大规模模型训练的调度与框架协同优化-阿里星/A Star

    ## 基础信息

    毕业起止时间要求:2026-11-01 - 2027-10-31

    ## 职位描述

    1. 设计和开发面向大规模模型训练的智能调度系统,实现调度器与训练框架( Megatron-LM 、DeepSpeed 、FSDP )的深度协同,使资源分配能够感知并行策略拓扑、通信模式和显存需求,提升集群级训练效率和资源利用率;
    2. 研究和实现万卡级训练的高可用与弹性机制,包括快速故障检测与自动诊断、智能恢复策略(冗余计算、在线重配)、弹性伸缩(节点增减时自动调整并行策略)、高效 checkpoint (增量/异步/分层存储)等,提升训练稳定性和有效训练时间占比;
    3. 探索自动并行策略搜索与动态调整技术,基于性能建模、执行模拟或在线 profiling ,自动选择和优化 DP/TP/PP/SP/CP/EP 的多维并行组合,适应异构集群和动态资源环境,降低人工调参成本;
    4. 参与 PAI-DLC 训练平台核心能力建设,将技术成果沉淀为可产品化的训练调度和稳定性能力,支撑集团内部和云上客户的大模型训练需求;
    5. 有一定的技术前瞻性,可以对平台演进中的技术需求(如多阶段训练流水线编排、训练-推理混合调度、异构集群适配等)进行预研和设计。

    ## 职位要求

    1. 具备扎实的计算机基础知识和分布式系统研发经验,C++/Python 编程能力强,对操作系统原理、计算机网络、分布式一致性等系统领域知识有较好的理解和项目应用经验。
    2. 熟悉深度学习基本原理和主流深度学习框架( PyTorch ),了解分布式训练的基本并行策略( DP/TP/PP/EP )和通信原语( NCCL 、AllReduce 、P2P )。
    3. 熟悉 Megatron-LM 、DeepSpeed 、TransformerEngine 、DualPipe 等训练框架技术,并在研究或实习项目中有相应的实践经历。
    4. 具有很强的学习能力、复杂问题归纳梳理能力、沟通和团队协作能力,具备能够深度钻研技术的耐心。

    加分项:
    1. 有很强的学术研究能力和优秀的学术成果(分布式系统/AI 系统/高性能计算领域顶会/顶刊论文);
    2. 熟悉集群调度系统( Kubernetes 、YARN 、自研调度器)的设计与实现;
    3. 有万卡级大模型训练实战经验,了解训练中的故障模式和稳定性优化;
    4. 作为核心贡献者参与开发或负责维护 AI 领域的流行开源项目。

    ---

    # 通义大模型-Token Foundry-AI Infra 工程师

    ## 基础信息

    - 毕业起止时间要求:2026-11-01 - 2027-10-31

    ## 职位描述

    在这里,你将成为大模型技术落地的“幕后推手”。你将参与构建支撑千卡/万卡规模的 AI 计算基础设施,通过软硬件协同优化,解决大模型在训练、推理、调度全链路中的工程挑战。你的代码将直接决定大模型训练的效率、推理的响应速度以及集群资源的利用率,为 AI 时代的算力底座注入核心动力。

    具体的职责包括以下相关方向的一项或多项:
    1. 算力基建与分布式训练:
    - 深入分布式训练架构,优化通信与底层算子性能,解决大规模集群通信瓶颈,提升模型训练的吞吐量与计算效率。参与研究新的训练框架和模式。
    极致推理加速:
    - 针对大规模推理场景,研发高性能推理引擎,通过 kernel 、框架、与算法结合的有损优化等手段,实现极致的低延迟与高并发。
    2. 智能化资源调度与系统:
    - 构建大规模 GPU 集群的统一调度与编排系统,实现算力资源的弹性分配与自动化调度,设计与优化面向 AI 计算场景的高性能通信、存储系统,保障海量任务的极致的效率。
    3. 工程效率与平台化建设:
    - 打造一体化的平台,覆盖大模型研发和迭代的全流程,降低模型迭代门槛,提升研发效能。

    ## 职位要求

    1. 基础条件:
    - 计算机、软件工程等相关专业优先。
    - 热衷于数据结构和算法、在 ACM 大赛成绩优异者优先;有顶会论文/高影响项目/开源贡献者加分。
    2. 专业能力:
    - 系统工程与编程能力:具备良好的系统工程基础,熟悉 Linux 开发环境,掌握 Python 、Go 、Java 等至少一门编程语言,具备扎实的工程实现能力。
    - 分布式系统:了解分布式系统基本原理(如一致性、容错、扩展性等)。
    - AI 系统领域专业知识:对于以下领域中的一项或者多项具备专业能力
    - 了解 AI 的基本原理与常见算法,理解模型训练任务的基本流程及其资源需求。
    - 了解主流训练推理框架(如 PyTorch 、TensorFlow 、vLLM 、sglang )的基本使用方式及训练流程。
    - 了解异构计算或高性能计算体系,有 GPU 相关优化经验者优先。
    3. 能力特质:
    - 沟通能力:能与跨域岗位,如:算法、产品等,进行良好的沟通。
    - 跨域视野:有较宽的技术视野与知识面,对算法研发流程、数据、GPU 调度、训练、推理等相关领域的技术逻辑都有涉猎。
    - 系统思维: 乐于挑战复杂系统的性能极限,具备良好的性能分析与调优能力,喜欢从底层视角拆解并解决问题。
    - 极客精神:对 AI 大模型技术充满热情,具备快速学习新技术的能力,渴望在高性能计算领域实现技术突破。

    ---

    # 通义大模型-Token Foundry-Agent Infra 工程师

    ## 基础信息

    毕业起止时间要求:2026-11-01 - 2027-10-31

    ## 职位描述

    负责构建支撑 AI Agent 全生命周期的核心基础设施,涵盖设计构建、训练优化、安全部署、高并发调度及服务化交付等,为 Agent 的规模化落地提供稳定、高效、安全的底层能力。

    具体职责包括以下相关方向的一项或多项:
    1.Agent 基础设施:设计高并发、可扩展的 Agent 框架,覆盖沙箱执行、容器编排、任务调度及状态管理,支持训练优化与安全部署。
    2.安全与稳定性:构建沙箱隔离与委托身份认证,确保 API 安全调用,并实现检查点恢复机制保障长任务可靠性。
    3.平台服务能力:开发 LLM 上下文预计算、知识检索等优化能力,封装 SDK/API (如向量检索、观测体系)提升推理效率。
    4.AI 能力产品化:模块化输出开发套件(如 CLI/SKLLS ),降低 Agent 构建与调优门槛,支持算法迭代优化。
    5.技术前瞻与落地:跟踪 Agent 生态技术进展,推动新技术规模化应用,持续优化架构性能与易用性。
    目标:通过高效、安全、先进的基础设施,实现 AI Agent 从开发到生产的全流程支持,加速规模化落地。

    ## 职位要求

    1.基础条件:

    - 计算机、软件工程、人工智能等相关专业优先。
    - 有顶会论文/高影响项目/开源贡献者加分。

    2.专业能力:
    - 技术基础:扎实的计算机基础( OS/网络/数据库),精通至少一门编程语言( Go/Python/Java/Rust/TypeScript ),熟悉后端技术栈(微服务/消息队列/缓存)及云原生( K8s/Serverless )或安全隔离技术( Docker/gVisor )。
    - AI Agent 专精领域:深入理解大模型原理,熟悉至少一种 Agent 框架( LangGraph/ADK/LangChain/AutoGen/MetaGPT 等)或核心组件( RAG/工具调用/SKILLS ),具备 Agent 全生命周期管理(训练/评测/部署)经验,有强化学习或规划算法背景优先。
    - Agent Ops 运维实践:掌握 LLMOps (模型版本/监控/部署)及 AgentOps (编排/自愈/状态管理),熟悉可观测性系统(链路追踪/日志分析)。
    - 工程与交付能力:擅长 AI Coding 快速原型开发,熟悉测试与变更管理( CI/静态分析),有高并发优化或多租户隔离经验。

    3.能力特质:
    - 对 AI 原生应用有热情,能复现前沿技术;追求简洁可扩展的架构,沟通协作能力强。
    加分项:
    - 有 Agent 优化实战经验、参与 Agent 平台开发、熟悉上下文工程或多 Agent 协同系统。
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   896 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 21ms · UTC 22:03 · PVG 06:03 · LAX 15:03 · JFK 18:03
    ♥ Do have faith in what you're doing.