News in Focus

TOPIC TIMELINE

タイムライン検索

特定トピックに関する記事を時系列で並べて「いつ・何が起きたか」を俯瞰します。

  1. 2025年12月8日

    Kubernetesスケジューラのベンチマークテスト

    本記事は、PFNのインターンシップを経て現在はアルバイトとして勤務されている上田蒼一朗さんによる寄稿です。 はじめに Preferred Networks(以下PFN)ではKubernetesを用いた機械学習基盤の開発・ […] 投稿 Kubernetesスケジューラのベンチマークテスト は Preferred Networks Tech Blog に最初に表示されました。

    Preferred Networks

  2. 2026年1月16日

    Listen Labs、バイラルな看板採用キャンペーンでAI顧客インタビューをスケールさせるために6,900万ドルを調達

    アルフレッド・ワールフォルスは選択肢がなくなってきていた。彼のスタートアップ Listen Labs は100人以上のエンジニアを雇う必要があったが、マーク・ザッカーバーグと競争していた。

    VentureBeat AI

  3. 2026年2月20日

    日本語の自然さを測る評価手法の検証

    Preferred Networksでは大規模言語モデル (LLM) PLaMoの開発を継続して行っています。 LLMを開発するにあたってその能力を評価するベンチマークは非常に重要です。英語においては様々なベンチマークが […] 投稿 日本語の自然さを測る評価手法の検証 は Preferred Networks Tech Blog に最初に表示されました。

    Preferred Networks

  4. 2026年2月25日

    コード生成ベンチマークのためのサンドボックス環境の開発

    はじめに Preferred Networksでは、大規模言語モデル「PLaMo」の開発を行っています。 PLaMoは開発サイクルにて様々なベンチマークによりその能力を評価していますが、今回はコード生成ベンチマークにてモ […] 投稿 コード生成ベンチマークのためのサンドボックス環境の開発 は Preferred Networks Tech Blog に最初に表示されました。

    Preferred Networks

  5. 2026年5月15日

    DatabricksがGPT-5.5をエンタープライズエージェントワークフローに導入

    DatabricksがOfficeQA Proベンチマークで最先端の成績を達成したGPT-5.5をエンタープライズエージェントワークフローに活用しています。

    OpenAI

  6. 2026年5月18日

    pretrained model向けのベンチマークの構築

    Preferred Networks では、大規模言語モデル PLaMo の開発を継続して行っています。 LLM を開発するうえで、モデルの能力を適切に測定するベンチマークは重要です。英語ではさまざまなベンチマークが日々 […] 投稿 pretrained model向けのベンチマークの構築 は Preferred Networks Tech Blog に最初に表示されました。

    Preferred Networks

  7. 2026年5月20日

    移民街から子供を「強制隔離」デンマークの統合政策 独は学習プログラムに年2400億円

    「教師が対面で教えてくれることで『国が私を助けてくれる』という安心感があった。1つの教室に生徒が18人で窮屈だったが、1人で暮らす上で役立った」 2016年か…

    産経新聞

  8. 2026年5月27日

    NVIDIA Vera CPUが競合製品に対して「強力なパンチを繰り出している」

    エージェンシャルAIへのシフトは、AIファクトリーの新しいCPU要件を生み出します:高速コア、膨大なメモリ帯域幅、およびすべてのコアがアクティブな場合でも高いパフォーマンスを維持する能力です。初期ベンチマークでは...

    NVIDIA Blog

  9. 2026年5月29日

    Amazon Bedrock AgentCoreのデータセット管理でエージェントとともに成長するテストスイートを構築

    エージェント評価は、急速に変化するオンラインシグナルと安定したオフラインベースラインを組み合わせることで最も強力になります。エージェントが時間とともに本当に改善されているかどうかを理解するには、固定ベンチマークが必要です。

    AWS Machine Learning Blog

  10. 2026年5月29日

    チェーンが保たれる、答えが折れる:敵対的圧力下での推論モデルの軌跡と答えの乖離

    推論モデルはシングルターンベンチマークで評価されているが、ユーザーが正解に異議を唱えるマルチターン対話環境に配備されている。継続的な敵対的圧力下では、これまで文書化されていない障害モードが見つかった:思考の連鎖は最初のターンから最後まで事実上正確であるが、回答は変わる。

    arXiv cs.AI

  11. 2026年5月29日

    BEAMS: AI モデリング・シミュレーション評価ベンチマーク

    実世界の意思決定を支援するAIツールは、推奨事項を知らせ解釈可能にするシミュレーションモデルを構築できる必要があります。モデリング実務の側面を自動化できるツールは、人間の専門知識を補完する必要があり、置き換えるべきではありません。BEAMS Initiativeは、開発を指導することを目的としています。

    arXiv cs.AI

  12. 2026年5月29日

    検出可能効果の事前登録:4ビット量子化ベンチマーク用ペアリングMDEバジェット、パイロット監査付き

    これはペアリングなしパイロット監査を伴う計画方法に関する注記である。古典的なペアリング二項サンプルサイズ計算(Miettinen, 1968)を量子化ベンチマークに適応させ、ペアリングされた最小検出可能効果(MDE)の保守的な下限を提供している。

    arXiv cs.LG

  13. 2026年5月29日

    FormInv: 数学推論ベンチマークにおけるセマンティック不変性の測定プロトコル

    MathCheck(ICLR 2025)のパラフレーズ品質監査により、129グループ中4つのセマンティック的に不正確なパラフレーズ(3.1%)が検出されました。これらを削除するとGPT-4oはランク2からランク4に低下し、Claude HaikuとDeepSeek V3がそれを上回ります。これらのランク変動は単一モデル評価では見えません。

    arXiv cs.LG

  14. 2026年5月29日

    ReverseMath: 数学問題生成の拡張可能性と検証可能性を実現する逆向き回答手法

    数学推論ベンチマークはLLMの評価に不可欠だが、多くは静的で公開評価やトレーニングパイプラインを通じて繰り返し露出しており、真の推論と暗記を区別することが困難である。一方、新しい数学問題の手動構築は...

    arXiv cs.CL

  15. 2026年5月29日

    BenchTrace:LLMエージェントの反省能力と制御された進化をテストするベンチマーク

    arXiv:2605.29225v1 文書の発表。自己進化型エージェントは過去の失敗を反省することで時間とともに改善されますが、既存の評価には2つの制限があります。タスクスコアのみを測定して反省の質は不明であり、エージェント自身のエピソード実行に依存して特定の失敗パターンに対応するメカニズムがありません。本論文では新しいアプローチを提示しています。

    arXiv cs.AI

  16. 2026年5月29日

    GTA:スケーラブルなWebエージェント用ロングホライズンタスク生成

    arXiv:2605.29218v1 文書の発表。言語モデルをブラウジングおよびツール使用機能と組み合わせたWebエージェントは、オープンなWebアシスタントとしての可能性を示していますが、スケーラブルなプロセスレベルの監督の不足により進展が制限されています。既存のベンチマークは主に手動で構築されており、粗い開始ゴール注釈のみを提供しています。

    arXiv cs.AI

  17. 2026年5月29日

    多言語LLMタスク実行における言語役割の分離

    多言語LLMは、指示、ソースコンテンツ、および必要な応答言語が一致しない場合にますます使用されています。既存のベンチマークは多言語命令追従評価を拡張していますが、完全にクロスされた設計内でこれら3つの役割を分離することはめったにありません。MTM-Benchを導入します。

    arXiv cs.CL

  18. 2026年5月29日

    『ザ・ラスト・バイキング』評論:型破りなデンマーク発クライムコメディがマッズ・ミケルセンを意外な配役で起用

    『婚礼の日』『より良い世界のために』など数多くの人気アートハウス作品を手がけた多作の脚本家による本作は、マッズ・ミケルセンをこれまでのイメージから大きく異なる役柄で配役している。

    Variety

  19. 2026年5月30日

    ダニエル・ブールドのコロナ禍時代の賭け

    コロナ禍の最中にル・パビヨンをオープンしてから5年後、ミシュラン星獲得シェフでディネックス・グループのオーナー、ダニエル・ブールドとSLグリーンのCEO マーク・ホリンスワースが関わる事業について報道されている。

    Bloomberg

  20. 2026年5月30日

    GS Plus 第4弾「GS Plus 日本株式(TOPIXアルファ)」新登場!

    ゴールドマン・サックスが新たな日本株投資商品「GS Plus 日本株式(TOPIXアルファ)」を発表した。この商品は、TOPIXの構成銘柄から割安性や成長性などの指標で優良企業を厳選し、指数を上回るリターンを目指すもの。日本株が長期停滞する中、機関投資家のニーズが従来のベンチマーク運用からアルファ追求型へシフトしており、データ科学や機械学習を活用した新しい運用戦略が業界で広がっている。

    PR TIMES

  21. 2026年5月30日

    新人監督との仕事で事業を構築したプロデューサーたち。『オブセッション』で大成功を収める

    Tea Shopのジェームス・ハリスとマーク・レーンは、カリー・バーカーのヒット映画の主要プロデューサーであり、新進気鋭の才能に賭ける姿勢を誇りにしている。

    The Hollywood Reporter

  22. 2026年5月30日

    Hondaファン必見。歴代ウイングマークをデザインした「Honda Wing History 折りたたみコンテナボックス」楽天市場で予約開始!

    Hondaは、歴代のウイングマークをデザインした折りたたみコンテナボックスを楽天市場で予約販売開始しました。自動車ファンの懐かしさへのニーズに応える商品で、収納ボックスというインテリアアイテムにすることで、日常生活の中でブランドを想起させる工夫が施されています。デジタル化社会において、企業ロゴ自体が商品化される新しいブランド戦略の転換を示す事例となっています。

    PR TIMES

  23. 2026年5月30日

    コンヴァノ、アクセルマーク株式会社を連結子会社化

    コンヴァノがアクセルマーク株式会社を連結子会社化しました。ゲーム・映像製作業界では、AI活用やメタバース開発など複雑な案件が増加する中で、開発プロセスの垂直統合が競争優位性につながると認識されるようになり、この動きは業界全体で加速しています。子会社化により、親会社はグループ内の経営管理強化と意思決定の迅速化が可能になる一方で、被買収企業の独立性喪失というリスクも存在します。今後、人手不足対策としての同様の買収事例が倍増すると予想されています。

    PR TIMES

  24. 2026年5月31日

    元M&S最高経営責任者が政府の若年失業対策を支援

    マーク・ボーランドが、「失われた世代」に関する警告を受けた若年層の就職支援について政府に助言する。

    BBC Business

  25. 2026年5月31日

    ホワイトソックス 西田陸浮 2試合連続打点で4連勝に貢献

    ホワイトソックスの西田陸浮選手はタイガース戦に先発出場し、2試合連続の打点をマークしてチームの4連勝に貢献しました。

    NHK

  26. 2026年5月31日

    レッドソックス 吉田正尚 押し出しの四球選び 4試合ぶりの打点

    大リーグ、レッドソックスの吉田正尚選手はガーディアンズ戦に途中出場し、9回に押し出しのフォアボールを選んで、4試合ぶりの打点をマークしました。

    NHK

  27. 2026年6月1日

    死亡したクジラ、デンマーク沖で陸地に引き上げられ剖検へ

    「ティミー」という名前のクジラが、複数の救助試みにもかかわらず、アンホルト沖で死亡した状態で発見されました。

    BBC News

  28. 2026年6月1日

    グラミー賞受賞の映画監督がナイジェリア人の祖父のビアフラ戦争における役割を探る

    映画監督メジ・アラビがナイジェリア内戦についてのBBC Africa Eyeランドマークドキュメンタリーを監督する。

    BBC News

  29. 2026年6月1日

    EHRBench: LLMを用いた臨床意思決定のための自動化された信頼性の高いEHRベースベンチマーク

    臨床意思決定(CDM)は現実の臨床業務の中心であり、臨床医は不完全な証拠の下で診断を推測し、治療を選択し、将来の健康転帰を予測する。LLMは強い言語能力と広範なバイオメディカル知識により、これらの決定をサポートするために次第に使用されている。

    arXiv cs.AI

  30. 2026年6月1日

    汎用的または特定の埋め込みどちらが優れているか?非英語言語での臨床コーディング検索の実証研究

    文意検索用の文埋め込みモデルは主に英語コーパスで開発・評価されている。他言語、特にICD-10-CM/CIE-10コード検索での臨床検索に適用すると、リコールが劣化する傾向がみられるが、これは集約的ベンチマークでしばしば見過ごされている。

    arXiv cs.CL