跳到正文

技术方向

分布式训练与系统 最新动态

训练并行、集群调度、通信、容错、存储和大规模系统工程。

2 条精选近 30 天 2 条共收录 2 条

更新

分布式训练与系统的精选

10月5日周一第 1–2 条
  1. AWS Machine Learning Infrastructure Blog66

    AWS 用 Amazon Bedrock AgentCore 实现 Amazon Quick 跨账户资源自动迁移

    AWS 介绍了基于 Amazon Bedrock AgentCore 的 Amazon Quick Resource Migrator MCP server,可在开发、QA 和生产账户之间自动迁移 agents、action connectors、knowledge bases、flows 和 spaces。

    推荐理由:文章给出了跨账户迁移的完整架构与部署路径,涵盖权限复制、幂等更新、备份恢复和预览审批,便于复用到企业治理流程。

  2. PyTorch Blog70

    PyTorch 加速器集成工作组总结 2026 年上半年硬件支持进展

    PyTorch 加速器集成工作组总结了 2026 年上半年的硬件支持进展,涵盖跨仓库 CI Relay(CRCR)、测试重构、OpenReg 参考后端、性能分析、分布式支持和编译器后端集成。工作组还推进了硬件分类测试机制,并为新后端接入 torch.compile、分布式训练和 profiling 提供参考实现与文档。

    推荐理由:文章梳理了测试、CI、中间件和编译器接入的参考实现,呈现 PyTorch 如何为不同硬件后端提供可复用的集成路径。